论文记录 · 证据边界公开

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

arXiv v2 (2026-08-13; cs.LG/cs.AI;Tsinghua University, 26 pages) · 2026-08-11 · O2O 微调范式(CFP:放弃离线 critic+新鲜 critic 热身)vs FQL/QC/QCFQL/QCFQL-nstep 标准 O2O

论文元数据

作者
Daoyi Li、Yixian Zhang、Wenbo Ding、Yu Wang、Chao Yu
机构
机构尚未补齐
发布日期精度
研究方向
O2O 微调范式(CFP:放弃离线 critic+新鲜 critic 热身)vs FQL/QC/QCFQL/QCFQL-nstep 标准 O2O
机器人
未关联具体机器人
DOI
未披露
arXiv
2608.10473
引用元数据
0
记录状态
included
质量检查
无自动质量红旗