工程资源状态 代码 已核验可访问(使用限制见许可证) 权重 已核验未发布 数据 已核验未发布 许可证 许可证条款已核验(不等于可商用) 当前实践优先级 观察 · 56/100 · 7–12 个月
研发注意力: 42/80 · 证据分项观察
工程落地: 10/15 · 量化实机证据+工程实用增量
标准分类标签: 主流迭代
路线评审说明: 主流VLA迭代·开源RL训练基础设施·仿真到真机边界明确
社区证据类型: 尚无独立社区验证
RLinf-VLA 将模型、算法、模拟器和 GPU 分配统一到一个 VLA 后训练栈,并以 ManiSkill、LIBERO 与 RoboTwin 三类仿真基准给出系统及策略指标。固定 Apache-2.0 代码和持续 release 使其具备工程试验价值;但论文真机只覆盖 Franka 单一抽屉任务,每策略10次且均为8/10,模型权重、真实示范和上游许可证没有形成固定闭包。因此应作为主流训练基础设施迭代进行评估,而非人形真机泛化或真机性能突破。
近期窗口 · 24/35发布距评分基准日 10 个月,落入 7–12 个月 窗口。 社区可复查验证 · 0/25未核验独立团队以固定版本、公开配置、相同任务和量化指标完成端到端训练或实体复现;官方仓维护、Stars 与作者列举的采用方不计入。 跨领域技术创新 · 18/20将 OpenVLA/OpenVLA-OFT/π 系列等策略、PPO/GRPO/SAC、GPU/CPU 并行模拟器、资源自动放置及仿真到真机后训练统一到同一基础设施;论文未证明所有模型或所有机器人受益。 量化实机证据 · 5/10Franka 抽屉闭合作者研究每策略10次、SFT与RL均8/10;协议和对照存在,但仅一个任务、无时延分布、失败轨迹、第二实验室或第二本体。 开放与可复现 · 4/5固定官方 Apache-2.0 仓提供 Docker、训练文档、仿真和部分实体入口;论文对应模型版本、真实20条示范、配置锁定与各上游数据/模型许可证仍未形成单一闭包。 工程实用增量 · 5/5论文明确比较 collocated/disaggregated/hybrid 分配、自动放置及 8/16/32 H100 配置,官方仓持续提供安装和环境入口;这些是系统基准而非低成本或任意工作负载的保证。 社区可复查证据: 尚未收录;Stars、forks 与作者演示不计社区验证。
证据缺口: 缺少显式可复查社区复现/部署证据;无独立端到端训练、仿真指标或实体部署复现;无论文对应固定 checkpoint、20条真实示范、标定包、原始日志或完整许可证闭包;Franka单任务10次/策略且两组8/10,不构成成功率增益或长期鲁棒性证据;无 Unitree、AgiBot、智元、五指手、轮臂轮足、人形全身或跨本体真机结果;H100效率图不能外推为单卡成本、云端成本或任何模型/模拟器的固定吞吐承诺
每日候选人工终审 RLinf-VLA 提供 VLA 强化学习的统一训练接口与 collocated、disaggregated、hybrid 三种 GPU 分配方式;论文在 ManiSkill、LIBERO、RoboTwin 三类仿真基准中报告系统吞吐和策略结果,并报告 130 个 LIBERO 任务 98.11%、25 个 ManiSkill 任务 97.66%、六个 RoboTwin 任务平均 84.63%。原文把 Franka 抽屉闭合的实机验证明确为初步研究:20 条真实专家示范加 1,000 条仿真轨迹训练后,SFT 与仿真 RL 后训练均为 8/10,作者只报告 RL 动作更直接、效率更高,不能改写为成功率增益。官方仓库当前固定提交和 v0.3 release 可核验,根许可证为 Apache-2.0;但论文期对应的权重、20 条真实示范和各上游数据/模型许可证没有形成统一可复现闭包。它是 VLA/WAM 后训练基础设施的重要主流迭代,适合在仿真基准与小规模 Franka 验证中评估,不应据此宣称已证明人形、五指手或跨本体实机泛化。
实机证据: author_preliminary_franka_drawer_ten_trials_per_policy_matched_simulation;原文第 V-D 节:抽屉闭合任务以 20 条真实专家示范和 1,000 条仿真轨迹训练 SFT,RL 从该 checkpoint 在仿真继续训练;真实部署中 SFT 与 RL 均为 8/10。作者仅报告 RL 动作更直接、效率更高,未给出时间分布、独立复现或更多任务,不能称成功率提升。
硬件/本体: Franka arm
红旗与边界: 论文主体证据为仿真基准;Franka 仅单任务、每策略十次,且两组成功率相同;效率数字跨 ManiSkill、LIBERO 与 RoboTwin 的硬件/并行配置不同,不能外推成任何训练任务固定加速倍数;论文基线与训练数据/种子存在上游依赖,绝对成功率不能与不同数据、机器人或版本的项目直接混排;代码 Apache-2.0 不自动覆盖 Hugging Face 模型、真实示范、模拟器资产和基础模型条款;未核验独立团队的端到端复现,亦无任何人形、五指手、轮臂或跨本体真机迁移证据
查看资源 · code · 状态 verified_official_fixed_repository_with_embodied_rl_docs_and_v0_3_release_lineage · 许可证 Apache-2.0 repository license; integrated simulators, models and downstream artifacts retain their own terms固定提交对应官方 RLinf 主仓当前公开树;README 提供 Docker 安装、ManiSkill/LIBERO/RoboTwin/Franka 等入口,并链接 v0.3 发布说明。当前仓库后续功能不能替代论文版本锁定、实验配置或上游依赖审计。 查看资源 · weights · 状态 official_model_organization_linked_but_paper_specific_weight_version_and_terms_not_audited · 许可证 No single RLinf-VLA checkpoint license established; inspect each model card and upstream base-model terms项目页链接官方 Hugging Face 组织,存在多项公开模型仓;未逐一核验与论文表格一一对应的固定版本、下载闭包和许可证,因此不标作本论文可复现权重。 data · 状态 uses_upstream_benchmarks_and_unreleased_real_demonstrations · 许可证 Upstream benchmark-specific terms; no license for the paper's 20 real demonstrations论文使用 ManiSkill、LIBERO、RoboTwin 等上游基准;Franka 初步实验的 20 条真实专家示范没有论文随附下载、标定包或许可证。 原始来源