论文记录 · 证据边界公开

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

arXiv preprint · 2026-08-09 · multi-paradigm vision-language reward models for robot policy optimization

论文元数据

作者
Yidong Wang、Yan Zhan、Ziteng Feng、Zhenyu Cui、Ziyi Zhou、Renzhao Liang、Jiaxuan Zhu、Zilei Yang、Yiran Zhao、Zhongkuan Mao、Bo Jia、Hanchu Ni、Chenggang Xie、Biao Liu、Yi Zhang、Yong Dai、Xiaozhu Ju、Wei Ye、Shikun Zhang
机构
Beijing Innovation Center of Humanoid Robotics
发布日期精度
研究方向
multi-paradigm vision-language reward models for robot policy optimization
机器人
PAIBench-G video-generation robot tasks
DOI
未披露
arXiv
2608.08491
引用元数据
0
记录状态
included
质量检查
无自动质量红旗