论文元数据 作者Kaustubh Shivshankar Shejole、Tanish Agarwal、Arpit Agarwal、Avishek Ghosh机构机构尚未补齐发布日期精度日研究方向联合学习成对比较奖励与工作者可靠性的 EM 算法(Boltzmann-rational)机器人无机器人本体;成对比较奖励学习实验DOI未披露arXiv2608.10045引用元数据0记录状态included质量检查无自动质量红旗