论文记录 · 证据边界公开

Coachable agents for interactive gameplay

arXiv (v2 2026-08-10; Sony Research) · 2026-07-01 · 可教练/风格可控 RL(UVFA+风格标签)vs 单最优行为 RL

论文元数据

作者
Roberto Capobianco、Harm van Seijen、Nolan D. Bard、Neil Burch、Fatima Davelouis、Josh Davidson、Alisa Devlic、Yunshu Du、Ishan Durugkar、Siddhant Gangapurwala、Daniel Hernandez、G. Zacharias Holland、Sahil Jain、Kenta Kawamoto、Raksha Kumaraswamy、Patrick MacAlpine、Dustin R. Morrill、Declan Oller、Francesco Riccio、Akanksha Saran、Craig Sherstan、Kaushik Subramanian、Thomas J. Walsh、Samuel Barrett、Kizza N. Frisbee、Mady Govil、Johannes Günther、Varun R. Kompella、James A. MacGlashan、Maxwell Svetlik、Michael D. Thomure、Jaden B. Travnik、Kevin Waugh、Elahe Aghapour、Florian Fuchs、Andreanne Lemay、Shruti Mishra、Takuma Seno、Peter Stone、Michael Spranger、Peter R. Wurman
机构
机构尚未补齐
发布日期精度
研究方向
可教练/风格可控 RL(UVFA+风格标签)vs 单最优行为 RL
机器人
DMC humanoid 仿真(开源人形测试域);AAA 游戏为游戏本体
DOI
未披露
arXiv
2607.00642
引用元数据
0
记录状态
included
质量检查
无自动质量红旗