论文记录 · 证据边界公开

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

arXiv(cs.AI;曼彻斯特大学;无官方代码入口) · 2026-07-31 · 多教师偏好 MORL(LEMUR)vs MORAL/PbMORL 等单目标化或单奖励模型偏好学习基线

论文元数据

作者
Manith Adikari、Bei Peng、Samuele Vinanzi、Angelo Cangelosi
机构
机构尚未补齐
发布日期精度
研究方向
多教师偏好 MORL(LEMUR)vs MORAL/PbMORL 等单目标化或单奖励模型偏好学习基线
机器人
MO-Hopper/MO-Cheetah(MuJoCo 运动)、MO-LunarLander、MO-MetaWorld(Drawer-Close 仿真机械臂操作,双目标:任务进度+能耗)
DOI
未披露
arXiv
2607.29559
引用元数据
0
记录状态
included
质量检查
无自动质量红旗