论文元数据
- 作者
- Manith Adikari、Bei Peng、Samuele Vinanzi、Angelo Cangelosi
- 机构
- 机构尚未补齐
- 发布日期精度
- 日
- 研究方向
- 多教师偏好 MORL(LEMUR)vs MORAL/PbMORL 等单目标化或单奖励模型偏好学习基线
- 机器人
- MO-Hopper/MO-Cheetah(MuJoCo 运动)、MO-LunarLander、MO-MetaWorld(Drawer-Close 仿真机械臂操作,双目标:任务进度+能耗)
- DOI
- 未披露
- arXiv
- 2607.29559
- 引用元数据
- 0
- 记录状态
- included
- 质量检查
- 无自动质量红旗