论文记录 · 证据边界公开DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation
arXiv · 2026-07-14 · 操作
论文元数据
- 作者
- Yu Fang、Wanxi Dong、Jiaqi Liu、Yue Yang、Mingxiao Huo、Yao Mu、Huaxiu Yao、Li Erran Li、Daniel Szafir、Mingyu Ding
- 机构
- University of North Carolina at Chapel Hill、Carnegie Mellon University、Shanghai Jiao Tong University、Amazon AWS AI
- 发布日期精度
- 日
- 研究方向
- 操作
- 机器人
- 未关联具体机器人
- DOI
- 10.48550/arXiv.2607.13033
- arXiv
- 2607.13033
- 引用元数据
- 0
- 记录状态
- included
- 质量检查
- 无自动质量红旗
算力与训练档案 置信 low · 模型 glm-5.3 · 更新 2026-09-02T05:37:48Z
技术标签: 操作, 奖励模型, 失败数据, 强化学习, 密集反馈, 混合真机仿真数据
| 训练算力(显卡) | 未披露 |
| 训练时长 | 未披露 |
| 部署推理硬件 | 未披露 |
| 显存/内存/CPU 占用 | 未披露 |
| 运行效率(Hz) | 未披露 |
证据材料里未披露这些数值 —— 宁缺勿假, 不填推测值。