论文记录 · 证据边界公开

DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

arXiv · 2026-07-14 · 操作

论文元数据

作者
Yu Fang、Wanxi Dong、Jiaqi Liu、Yue Yang、Mingxiao Huo、Yao Mu、Huaxiu Yao、Li Erran Li、Daniel Szafir、Mingyu Ding
机构
University of North Carolina at Chapel Hill、Carnegie Mellon University、Shanghai Jiao Tong University、Amazon AWS AI
发布日期精度
研究方向
操作
机器人
未关联具体机器人
DOI
10.48550/arXiv.2607.13033
arXiv
2607.13033
引用元数据
0
记录状态
included
质量检查
无自动质量红旗

算力与训练档案 置信 low · 模型 glm-5.3 · 更新 2026-09-02T05:37:48Z

技术标签: 操作, 奖励模型, 失败数据, 强化学习, 密集反馈, 混合真机仿真数据

训练算力(显卡)未披露
训练时长未披露
部署推理硬件未披露
显存/内存/CPU 占用未披露
运行效率(Hz)未披露

证据材料里未披露这些数值 —— 宁缺勿假, 不填推测值。