论文元数据
作者 Kai Tang、Peidong Jia、Zhong Chu、Jixian Wu、Rui Ma、Jiajun Cao、Fangyuan Zhao、Sixiang Chen、Yichen Guo、Xiaowei Chi、Chun-Kai Fan、Kevin Zhang、Jinchang Xu、Fubing Yang、Weishi Mi、Xiaozhu Ju、Jian Tang、Shanghang Zhang 机构 Peking University、Beijing Innovation Center of Humanoid Robotics、Nanyang Technological University、The Hong Kong University of Science and Technology、University of Electronic Science and Technology of China 发布日期精度 日 研究方向 世界模型与动作条件预测 机器人 未关联具体机器人 DOI 10.48550/arXiv.2606.20698 arXiv 2606.20698 引用元数据 0 记录状态 included 质量检查 无自动质量红旗
工程资源状态 代码 已核验未发布 权重 已核验未发布 数据 已核验未发布 许可证 未核验 当前实践优先级 观察 · 68/100 · 2–3 个月
研发注意力: 55/80 · 近期跨域高潜·社区待验证
工程落地: 13/15 · 量化实机证据+工程实用增量
标准分类标签: 颠覆性分支
路线评审说明: 安全VLA世界模型颠覆性分支
社区证据类型: 尚无独立社区验证
以交互世界模型给VLA提供安全强化学习环境,在SafeLIBERO和Franka五任务上同时评估任务与安全成功;32×A800和零工件使其暂非工程默认。
近期窗口 · 32/35发布距评分基准日 2 个月,落入 2–3 个月 窗口。 社区可复查验证 · 3/25仅论文证据,无项目页、工件或独立复现。 跨领域技术创新 · 20/20安全RL、交互世界模型、VLA和双成功指标统一。 量化实机证据 · 9/10Franka五任务、每方法任务10次,平均TSR 76%、SSR 70%。 开放与可复现 · 0/5无代码、权重或数据。 工程实用增量 · 4/5安全成功率口径有价值,但训练门槛极高。 社区可复查证据: 尚未收录;Stars、forks 与作者演示不计社区验证。
证据缺口: 缺少显式可复查社区复现/部署证据;开放与复现条件不足;无代码;无权重;无数据;32×A800;无独立复现
每日候选人工终审 SafeDojo让OpenVLA-OFT在交互视频世界模型中做安全GRPO:成功分类器与安全头按控制步评估想象轨迹,再用拉格朗日约束平衡任务收益和碰撞成本。SafeLIBERO Level-I安全成功率53.25、Level-II 49.62;Franka五任务每个方法-任务10次,SafeDojo平均TSR 76%、SSR 70%。它代表用世界模型替代危险真机探索的高收益路线,但完整优化使用32张A800-80GB,世界模型误差会随长时程积累,且没有项目页、代码、权重或SafeLIBERO数据开放。
实机证据: quantified_five_franka_tasks_ten_trials_each;Bowl-to-plate、Apple selection、Bread-to-toaster、Block stacking、Dual-arm stacking五任务;每个方法-任务10次,SafeDojo平均任务成功76%、同时安全成功70%。
硬件/本体: Franka Emika Panda single arm、dual-arm Franka、box obstacle
红旗与边界: 32×A800-80GB完整优化成本;无代码权重数据;world model长时预测误差累积;成功/安全分类器依赖训练分布;实机总量每方法50次但仅Franka体系;无独立复现
code · 状态 not_released · 许可证 not available未找到官方项目页或代码仓库。 weights · 状态 not_released · 许可证 not availableSafeDojo策略、world model、安全头和reward模型均未开放。 data · 状态 not_released · 许可证 not availableSafeLIBERO演示、rollout、安全标签和真实任务数据未开放。 原始来源
算力与训练档案 置信 low · 模型 glm-5.3 · 更新 2026-09-02T09:25:04Z 技术标签: 世界模型与动作条件预测, VLA, 世界模型, 安全强化学习, 想象rollout, 约束优化, 实机操作
训练算力(显卡) 未披露 训练时长 未披露 部署推理硬件 未披露 显存/内存/CPU 占用 未披露 运行效率(Hz) 未披露
证据材料里未披露这些数值 —— 宁缺勿假, 不填推测值。