论文记录 · 证据边界公开

Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons

arXiv (UAI 2026 accepted; v1 2026-08-10) · 2026-08-10 · 联合学习成对比较奖励与工作者可靠性的 EM 算法(Boltzmann-rational)

论文元数据

作者
Kaustubh Shivshankar Shejole、Tanish Agarwal、Arpit Agarwal、Avishek Ghosh
机构
机构尚未补齐
发布日期精度
研究方向
联合学习成对比较奖励与工作者可靠性的 EM 算法(Boltzmann-rational)
机器人
无机器人本体;成对比较奖励学习实验
DOI
未披露
arXiv
2608.10045
引用元数据
0
记录状态
included
质量检查
无自动质量红旗