论文元数据
- 作者
- Yunke Ao、Le Chen、Bruce D. Lee、Assefa S. Wahd、Aline Czarnobai、Philipp Fürnstahl、Bernhard Schölkopf、Andreas Krause
- 机构
- 机构尚未补齐
- 发布日期精度
- 日
- 研究方向
- 信任域策略优化(bounded-ratio/解析最优解)vs PPO/GRPO 启发式目标
- 机器人
- 仿真本体:MuJoCo/Atari/IsaacLab(Humanoid locomotion;官方仓附 Unitree G1/H1/Go1、ANYmal-C 配置)
- DOI
- 未披露
- arXiv
- 2604.18578
- 引用元数据
- 0
- 记录状态
- included
- 质量检查
- 无自动质量红旗