工程资源状态 代码 已核验可访问(使用限制见许可证) 权重 已核验可访问(使用限制见许可证) 数据 已核验可访问(使用限制见许可证) 许可证 许可证条款已核验(不等于可商用) 当前实践优先级 当前可实践 · 62/100 · 7–12 个月
研发注意力: 44/80 · 证据分项观察
工程落地: 13/15 · 量化实机证据+工程实用增量
标准分类标签: 主流迭代
路线评审说明: 推理型VLA主流迭代·混合解码与因果对齐·社区待验证
社区证据类型: 尚无独立社区验证
DeepThinkVLA用因果CoT、双向并行动作和SFT后GRPO同时改善推理与控制,代码、三类权重和CoT数据齐全;527 stars仅表示关注度,真机也没有验证RL阶段。
近期窗口 · 24/35发布距评分基准日 9 个月,落入 7–12 个月 窗口。 社区可复查验证 · 0/25没有独立团队提交可核查的真机或同口径基准复现。 跨领域技术创新 · 20/20在同一VLA内分离因果语言推理与双向并行动作,并以GRPO对齐任务结果。 量化实机证据 · 8/10ALOHA三任务各20次、平均45%,但只评估SFT而非RL阶段。 开放与可复现 · 5/5MIT代码、基础/SFT/RL权重和LeRobot CoT数据可取;权重卡没有独立许可证。 工程实用增量 · 5/5披露2.9B、8×A800、显存门槛、数据规模和三套基准。 社区可复查证据: 尚未收录;Stars、forks 与作者演示不计社区验证。
证据缺口: 缺少显式可复查社区复现/部署证据;无独立复现;真机未验证RL;权重许可证缺失;完整训练需8×80GB及多节点;真机仅60次
每日候选人工终审 DeepThinkVLA以因果注意生成CoT、双向注意并行动作,并用SFT后GRPO把推理与任务成功对齐;v3给出LIBERO 97.0%、LIBERO-Plus零样本79.0%、RoboTwin2.0 59.3%。官方仓和三个公开检查点、CoT数据真实存在;ALOHA三任务各20次但仅验证SFT与混合解码,论文明确没有在真机验证RL因果对齐。
实机证据: preliminary_sft_only_aloha_trials;Stack Bowls、Handover Block、Blocks Rank RGB各20次,成功率55%、45%、35%,平均45%;真机只做SFT,未验证RL因果对齐。
硬件/本体: AGILEX ALOHA bimanual platform、external cameras
红旗与边界: 真机未验证RL阶段;三个权重卡未声明许可证;8×80GB及多节点成本;作者零样本评测仓不是独立复现;真机仅三任务60次;社区关注度不能替代复现
查看资源 · code · 状态 verified_official_implementation · 许可证 MIT固定commit含1844路径,覆盖SFT、GRPO、LIBERO评测和混合注意力实现;仓库仍把真机硬件实验列在TODO。 查看资源 · weights · 状态 verified_public_base_checkpoint · 许可证 model card does not declare a license基础检查点约11.72GB。 查看资源 · weights · 状态 verified_public_sft_rl_checkpoint · 许可证 model card does not declare a licenseSFT与SFT+RL检查点各约6.94GB,均公开非gated;不能由代码MIT推导权重许可。 查看资源 · data · 状态 verified_public_cot_dataset · 许可证 Apache-2.0 declared by data card; underlying LIBERO assets retain upstream terms固定revision含1701路径、LeRobot Parquet数据;论文称273465条CoT标注轨迹帧单元和2847856个标注帧。 原始来源