论文记录 · 证据边界公开

Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences

arXiv technical report · 2026-07-14 · preference aligned robot policy and offline reinforcement learning

论文元数据

作者
Taehyung Kim、Gwangmo Lee、Minjun Chang、Sunghyun Lim、Jongeun Choi
机构
机构尚未补齐
发布日期精度
研究方向
preference aligned robot policy and offline reinforcement learning
机器人
D4RL MuJoCo Ant、D4RL MuJoCo HalfCheetah、D4RL MuJoCo Hopper、D4RL MuJoCo Walker2d
DOI
未披露
arXiv
2607.12466
引用元数据
0
记录状态
included
质量检查
无自动质量红旗

算力与训练档案 置信 low · 模型 glm-5.3 · 更新 2026-09-02T16:28:58Z

本体标签: D4RL MuJoCo Ant, D4RL MuJoCo HalfCheetah, D4RL MuJoCo Hopper, D4RL MuJoCo Walker2d

技术标签: preference aligned robot policy and offline reinforcement learning, 偏好学习, 离线强化学习, 人机交互, 低算力训练, 个性化机器人

训练算力(显卡)未披露
训练时长未披露
部署推理硬件未披露
显存/内存/CPU 占用未披露
运行效率(Hz)未披露

证据材料里未披露这些数值 —— 宁缺勿假, 不填推测值。