论文记录 · 证据边界公开

Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning

arXiv v1(2026-08-20,cs.AI;IROS 2026) · 2026-08-20 · QDOS vs 技能分层(SPiRL/OPAL 类)+IQL/BC/JSRL 基线(antmaze/humanoidmaze/antsoccer/kitchen/cube/scene)

论文元数据

作者
Tanachai Anakewat、Takayuki Osa、Tatsuya Harada
机构
机构尚未补齐
发布日期精度
研究方向
QDOS vs 技能分层(SPiRL/OPAL 类)+IQL/BC/JSRL 基线(antmaze/humanoidmaze/antsoccer/kitchen/cube/scene)
机器人
7-DOF Franka(D4RL kitchen 顺序操作,仿真)、ant/antsoccer/cube/scene(D4RL/OGBench 仿真基准)、humanoidmaze 高维人形(OGBench,仿真)
DOI
未披露
arXiv
2608.19684
引用元数据
0
记录状态
included
质量检查
无自动质量红旗