论文记录 · 证据边界公开

MLREF: Efficient Module Reuse for Reward Design in Reinforcement Learning via Large Language Models

arXiv(cs.LG 主分类/cs.AI/cs.CL;v1 2026-08-19 11:36:55 UTC 单版本) · Wed, 19 Au · LLM 奖励设计(模块池演化 vs EUREKA/RF-Agent 整体程序生成)

论文元数据

作者
Chenglin Liu、Xun Wang、Ruishuo Chen、Zhuoran Li、Longbo Huang
机构
机构尚未补齐
发布日期精度
研究方向
LLM 奖励设计(模块池演化 vs EUREKA/RF-Agent 整体程序生成)
机器人
Bi-DexHands 灵巧操作仿真(Catch Abreast 等)、Isaac Gym 仿真本体:Ant/ANYmal/Humanoid/Quadcopter/Allegro Hand/Shadow Hand/Franka Cabinet 等(17 任务,全仿真)
DOI
未披露
arXiv
2608.18827
引用元数据
0
记录状态
included
质量检查
无自动质量红旗