论文记录 · 证据边界公开

Bounded Ratio Reinforcement Learning

arXiv (v3 2026-04-30; project page + code) · 2026-04-20 · 信任域策略优化(bounded-ratio/解析最优解)vs PPO/GRPO 启发式目标

论文元数据

作者
Yunke Ao、Le Chen、Bruce D. Lee、Assefa S. Wahd、Aline Czarnobai、Philipp Fürnstahl、Bernhard Schölkopf、Andreas Krause
机构
机构尚未补齐
发布日期精度
研究方向
信任域策略优化(bounded-ratio/解析最优解)vs PPO/GRPO 启发式目标
机器人
仿真本体:MuJoCo/Atari/IsaacLab(Humanoid locomotion;官方仓附 Unitree G1/H1/Go1、ANYmal-C 配置)
DOI
未披露
arXiv
2604.18578
引用元数据
0
记录状态
included
质量检查
无自动质量红旗