论文元数据
- 作者
- Taehyung Kim、Gwangmo Lee、Minjun Chang、Sunghyun Lim、Jongeun Choi
- 机构
- 机构尚未补齐
- 发布日期精度
- 日
- 研究方向
- preference aligned robot policy and offline reinforcement learning
- 机器人
- D4RL MuJoCo Ant、D4RL MuJoCo HalfCheetah、D4RL MuJoCo Hopper、D4RL MuJoCo Walker2d
- DOI
- 未披露
- arXiv
- 2607.12466
- 引用元数据
- 0
- 记录状态
- included
- 质量检查
- 无自动质量红旗
算力与训练档案 置信 low · 模型 glm-5.3 · 更新 2026-09-02T16:28:58Z
本体标签: D4RL MuJoCo Ant, D4RL MuJoCo HalfCheetah, D4RL MuJoCo Hopper, D4RL MuJoCo Walker2d
技术标签: preference aligned robot policy and offline reinforcement learning, 偏好学习, 离线强化学习, 人机交互, 低算力训练, 个性化机器人
| 训练算力(显卡) | 未披露 |
| 训练时长 | 未披露 |
| 部署推理硬件 | 未披露 |
| 显存/内存/CPU 占用 | 未披露 |
| 运行效率(Hz) | 未披露 |
证据材料里未披露这些数值 —— 宁缺勿假, 不填推测值。