独立行业技术评审 · 持续核验

Mem-World Generated Policy-Improvement Rollouts

动作条件世界模型为三项长时操作每任务生成200条视频,再由人工保留20–30条成功样本做策略后训练,使平均真机成功率58%提升到72%。生成视频、失败样本、选择日志、模型权重和代码均未开放。

Mem-World Generated Policy-Improvement Rollouts

动作条件世界模型为三项长时操作每任务生成200条视频,再由人工保留20–30条成功样本做策略后训练,使平均真机成功率58%提升到72%。生成视频、失败样本、选择日志、模型权重和代码均未开放。

开放状态
项目已核验·制品未开放
许可证
未披露
商业使用
阻断
人工评审结论
paper_described_generated_rollouts_and_human_filtered_success_subset_not_released
机器人
Franka Panda downstream
任务
三项长时桌面操作
模态
multi-view RGB video、wrist RGB、action-conditioned future、human success label
格式
未发布
采集/生成方式
action-conditioned video world model
已知问题
人工选择偏置;无失败集;无代码权重数据;8×H100;无独立复现。

论文原文