Hilti-Trimble-Oxford Dataset: 360 Visual-Inertial Benchmark with Floor Plan Priors for SLAM and Localization
candidate · 88/100 · 数据与基准基础设施
把30段跨八个月真实建造现场、360视觉惯性、楼层图先验、统一真值/工具和62队公开挑战组合成可重复的长期SLAM与定位基准。
以可解释多维评分、独立复现和跨框架采用识别人形机器人技术转折。
严格候选/确认里程碑 221 项;另有 898 篇 2025 年至今深审论文进入里程碑复核池。热度不进入核心技术得分;复核池不等于已授予里程碑。
以 86 个金标准锚点串联严格记录;年代仅服务于检索和路线理解,近期默认仍按当前实践注意力排序。
candidate · 88/100 · 数据与基准基础设施
把30段跨八个月真实建造现场、360视觉惯性、楼层图先验、统一真值/工具和62队公开挑战组合成可重复的长期SLAM与定位基准。
candidate · 80/100 · 数据与基准基础设施
该工作不是提出又一个 WAM,而是首次在固定扰动矩阵中把 WAM、VLA、混合策略、单臂与双臂任务放进同一可审计对照:WAM 并不天然优于 VLA,训练数据多样性和评测实现细节会改变结论。它把“泛化声称必须有统一扰动、训练数据披露、同硬件延迟和可修复基准”确立为 WAM/VLA 研发横评的必要基础设施,因此进入候选里程碑;不把仿真排名包装成真实机器人能力。
candidate · 80/100 · 工程落地
TiPToP 将视觉基础模型、Gemini 语义分解、GPU cuTAMP 与开环控制拼成无需机器人训练数据的开放词汇操作链路。它的里程碑候选价值不在单个成功率,而在于把“语言目标—可操作物体—几何可行轨迹—低层执行”拆成可审查模块,并同时得到作者 165 次受控试验与一支独立团队 RoboLab120 的硬件复现/反证。独立端仅 22/120 端到端成功且变更了 VLM 与规划预算,故证明可观察的工程脆弱性,而不是确认跨环境优势;只进入候选里程碑,不升级确认。
arXiv v2、作者受控协议与失败分析 · 官方 MIT 代码、MIT 许可证与固定提交 · 独立硬件复现与反证问题记录 · 独立 RoboLab120 日志/视频数据
candidate · 82/100 · 工程落地
VLASH 以未来状态训练、异步推理和动作量化将高频交互作为 VLA 的显式工程目标,在两个实体平台和三类任务给出试验分母;Apache 代码、可获取的 π0.5 LIBERO checkpoint 以及可复查的环境反证,使其成为“实时 VLA”从离线吞吐指标走向部署时延权衡的候选里程碑。
论文原文 · 官方固定代码 · 官方 checkpoint · 可复查依赖问题
candidate · 81/100 · 开源生态基础设施
首个面向Isaac Sim语义与层级控制特性的系统模糊测试框架,在多轮12小时对照中显著扩大覆盖并发现基线未触发的崩溃;公开复现包、开发者确认和实际修复让它成为具身仿真可靠性基础设施候选。
confirmed · 93/100 · 范式转折
首次把网页语义预训练、跨本体机器人经验和长时程新家庭操作系统性结合为开放世界VLA路线;公开代码/checkpoint、独立正向复现和跨本体失败反例共同界定了真实能力边界。
论文原文 · 官方代码 · 官方checkpoint列表 · 独立复现与反例
candidate · 87/100 · 范式转折
用一个6.2B模型联合具身问答、未来视觉状态、语言—视觉子目标规划与连续动作,并同时开放Apache-2.0推理代码和权重;三项复杂操作各100次提供了超越只做离线生成的实机证据。
candidate · 90/100 · 性能突破
把低成本伺服遥测、可微动力学rollout、无力传感器外力估计、快速本地适配和工况分类统一为1.44M参数模型,并真实开放三平台代码、数据和11个权重。
candidate · 80/100 · 范式转折
Cortex 将高层 VLM 语义分解与低层 VLA 执行分为可交互的双系统,并把约 4,000 小时语义标注、技能切分和长时程实机流程放入同一研究链路。它在 ARX ACONE 两组 14 子任务流程中给出了统一、带分母的作者实机比较,因此是近期长时程 VLA 从单段动作预测走向可审计规划—执行分工的候选范式转折;但它不是完整可复现的端到端基线,也不能凭作者结果升级为确认里程碑。
arXiv 原论文、实机协议与作者结果 · 作者项目页 · 官方代码与未完成范围 · 官方 Apache-2.0 数据集 · 官方 System-2 权重页,许可证未声明
candidate · 85/100 · 工程落地
把非特权视觉探索、主动询问、MCP工具接口、分层训练、241任务基准和物理移动操作串成同一系统,并开放可审计的MIT代码与任务定义;对开放世界具身智能体提供了比单一策略更完整的工程基线。
candidate · 88/100 · 数据与基准基础设施
把42项仿真能力诊断、18项标准化实机任务、三种双臂本体、30个通用策略适配器、远程评测与约2.91TB训练/资产数据放进同一接口,形成从快速筛选到物理验证的完整基准基础设施。
论文原文 · 官方文档 · 官方Benchmark代码 · 官方XPolicyLab · 官方数据
candidate · 79/100 · 范式转折
WALA 用无动作标签人类视频的 DINOv3 语义差分与 Depth Anything V2 几何差分学习可执行 latent action,并联合约束 VLA 动作与未来动力学。它把低成本人类第一视角视频接入机器人示范稀缺问题,并给出四任务多配置的真机分母,因此是人类视频—世界动作模型—VLA 路线的重要候选转折;论文 checkpoint、机器人示范、人类视频和完整资产仍未释放,不能视作可直接复现的训练闭包。
candidate · 84/100 · 范式转折
把单张真实图像转成分层、可交互、可用于策略共训和sim-real评测的场景,并以同一Franka系统在四种真实布局和六类扰动中量化训练与评估价值。
candidate · 78/100 · 数据与基准基础设施
RoboInter1.5 用同一套密集时空中间表征连接 VLM 理解、VLA 执行与动作条件世界预测,并把 RoboInter、DROID、RH20T 数据包装为 235,920 段、约 407.79GB 的可检查语料。它为 WAM/VLA 的“中间表征是否真正帮助闭环”提供了近期数据与评测接口候选;公开部分是数据处理、VLM 训练/权重与标注工具,7 月论文对应的 VLA 和 RoboInter-World 实现/权重仍缺失,且上游数据许可冲突,因此不能宣称为完整 RoboInter1.5 开源。
arXiv 原论文、Franka ID/OOD 协议 · 官方项目页 · 官方数据/标注/VLM 固定源码 · 官方 407.79GB 数据固定修订与许可边界 · 官方 VLM 权重固定修订
candidate · 78/100 · 工程落地
把商用通用人形G1从工作空间与精度、外科医生对照实验推进到两例活体猪胆囊切除,首次形成通用人形进入标准微创手术流程的系统证据链。
candidate · 87/100 · 开源生态基础设施
把文本到3D资产、可动/抓取标注、场景布局、物理质量控制、Agent技能接口和多仿真器导出统一为世界生成基础设施,并真实开放v2.0.0代码与4,168个资产。
论文原文 · 官方v2.0.0代码 · 官方固定数据
candidate · 80/100 · 工程落地
首次在微型植物攀爬平台上把柔顺抓持、几何PIN-SLAM、语义Octree、流形约束A*与闭环动作原语组成自主系统,并公开从固件到实验分析的源码。
candidate · 80/100 · 范式转折
保留原生VLM语义训练,用冻结视频生成器监督轻量潜在未来token,再以统一动作专家输出控制;代码、基础权重和多基准结果形成VLA与世界模型融合的候选范式,但实机结果尚未定稿。
candidate · 81/100 · 数据与基准基础设施
VLA-Arena 将安全、干扰、外推与长时程能力从单一平均成功率拆成 170 任务、L0--L2 逐级退化曲线,并把任务定义、训练/评测环境、仿真/真机数据与多个 VLA 制品组织为可复查基准;它是近期通用 VLA 从“单一榜单”转向安全和泛化诊断基础设施的候选里程碑。
论文原文 · 官方项目 · 官方固定代码 · 官方仿真数据 · 独立 LangForce 适配
candidate · 93/100 · 范式转折
把通用图像生成、多视角机器人场景/迁移和动作条件视频统一进一个世界基础模型,并同时给出可部署的 FlashAR/vLLM 加速与真实机器人数据增强结果;它代表世界模型从预测展示转向可直接扩充 VLA 后训练分布的近期强路线。
论文 · 项目官网 · 官方代码 · 基础权重 · FlashAR 权重
candidate · 82/100 · 性能突破
用连续时间LTC隐状态表达任务阶段,并通过AdaLN直接调制flow动作生成;在遮挡交换和计数任务中把反应式VLA的阶段混淆转成显著实机增量。
candidate · 88/100 · 数据与基准基础设施
把六视角同步、毫米级空间精度与低成本手持采集扩展到真实开放的2,000小时数据集,并以三种VLA骨干和960次实机试验量化预训练收益,是近期最具杠杆的数据基础设施候选。
论文原文 · 官方项目 · 官方2K数据固定修订
candidate · 83/100 · 工程落地
将每步16个距离样本的稀疏定位理论落为Create 3长期动态环境系统,并把核心、ROS2节点、机器人集成和LiDAR采集器四层都以MIT固定仓库开放。
论文原文 · 官方项目 · 核心代码 · ROS2节点 · Create 3集成
candidate · 86/100 · 开源生态基础设施
把低于3,000美元的可维护四指直驱手、283个三轴触觉taxel、低回驱阻抗和完整开源构建/仿真/遥操作栈组合在一个人尺度平台上,并用可靠性、负载、抓型和热边界给出可审计工程证据。
candidate · 80/100 · 工程落地
Acceleration-Level CBF-QP 将学习策略的加速度参考投影进含控制障碍函数的全身动力学 QP,使既有 RL 策略可作为上层输入接入可检查的约束层。它在 Kinova Gen3 与 Unitree H1 双平台量化真实约束违反,并开源控制器、策略、配置和日志,是近期人形学习控制从性能追逐走向可插拔安全执行层的重要候选工程节点;它降低而非消除了物理违反,QP 不可行和模型失配仍存在,不能宣传为形式安全保证。
arXiv 原论文、H1/Kinova 实机表格 · 官方项目页 · 官方 BSD-2-Clause 控制器、策略与日志
candidate · 78/100 · 主流迭代
Robust-WAM 在生成式视频动力学的 VAE 路径上增加 DINOv3 未来语义对齐,使动作预测可针对照明域偏移优化。它用同一 Franka Research 3 的三项任务、标准光和两种有色光的带分母实机协议,显示 WAM 从纯视频重建向语义前瞻鲁棒控制迭代的可量化路线;但只验证照明 OOD,GE-Act 仿真分支的代码/权重开放不等同 FastWAM、LingBot-VA 或实机部署闭包。
arXiv 原论文与 Franka 实机协议 · 作者项目页 · 官方 GE-Act 语义前瞻源码 · 官方公开 GE-Act checkpoint
candidate · 78/100 · 范式转折
N0-VTLA 以 latent tactile tokens 建模未来接触,并用 ALTER 将失败、纠正和人机协作恢复轨迹转换为离线优势学习信号;近期已实际开放固定后训练/推理源码、基础模型和两份触觉仿真策略。它是视觉—触觉 VLA 从单任务接触策略走向跨本体动作容器与离线改进的“颠覆性分支”候选,但 NeoData、完整预训练、训练算力、NeoReal trial 分母与独立真机复现均未公开,不能作为可验证的真机性能里程碑。
arXiv 原论文与 NeoReal 汇总 · 官方项目页 · 官方后训练与推理固定源码 · 官方基础 checkpoint,Gemma 条款 · 官方 UniVTAC 仿真触觉 checkpoint · 官方 NeoSim 双臂触觉 checkpoint
candidate · 81/100 · 性能突破
把可微GPU QP、批量SQP和控制器数据蒸馏合为单栈,作者报告8千至25万次SQP迭代每秒、相对基线3–25倍,并把20M MPC样本训练的近似控制器部署到微型无人机。
candidate · 84/100 · 范式转折
G0.5 将推理与动作 token 置于同一自回归 VLM 解码器,以跨本体 ActionCodec、in-stream CoT 和有限视觉记忆替代“VLM仅作上下文编码器+独立动作专家”的主流配方;其公开代码/权重路径和 R1 Lite/R1 Pro 同口径实体横评使其达到候选里程碑门槛。代码许可证未声明、模型受自动门控自定义许可、训练数据闭包及独立复现不足,故仍为候选而非确认里程碑。
candidate · 83/100 · 工程落地
把3D场景表征、关键帧数据、时空记忆与VLA执行统一起来,并同时发布固定Apache-2.0代码仓和公开数据/权重包;Franka与Dobot量化实机使其达到候选里程碑门槛,但尚无独立复现。
论文原文 · 官方项目页 · 官方Apache-2.0代码 · 官方数据与权重包
candidate · 82/100 · 数据与基准基础设施
Teleopit 将 PICO 全身/手/头遥操作、Unitree G1 全身跟踪、跨手型优化重定向、主动颈部视觉、LeRobot 数据接口与 ACT/GR00T 策略训练串成可检查的全身人形数据闭环。源码、G1 ONNX/PyTorch 权重和动作参考 HDF5 均可下载,且作者报告了明确的 G1 采集与策略试验分母,因此可作为近期“人形真机数据—部署”基础设施候选;论文的 96 条任务示范没有在公共数据中逐条定位,且未有无关团队端到端实机复现,不能升级为确认里程碑或通用人形性能结论。
论文原文、硬件与作者实机分母 · 官方项目页与组件说明 · 官方 Apache-2.0 源码、G1 部署与采集路径 · 官方 G1 跟踪权重固定 revision · 官方动作参考数据固定 revision
candidate · 79/100 · 范式转折
SelfWAM 将未来视频监督与动作预测严格隔离:世界支路只读取干净示范动作,动作支路不读取未来或干净动作,并用机器人自掩码减少身份泄漏;部署时移除视频生成支路而保留快速动作控制。它在固定的 AgileX 双臂四任务、每任务十次作者真机协议中报告 38/40 成功,同时发布了固定 MIT 训练/评测/SelfMask 源码和可下载的 RoboTwin 派生训练数据,构成近期 WAM 从视频预测走向低时延动作分支的候选范式转折。论文权重仍为 Coming Soon、训练规模高且无独立实体复现,故不能升级为确认里程碑或低成本可部署结论。
论文原文、方法与作者真机协议 · 官方项目页 · 官方固定 MIT 代码、训练与评测入口 · 官方 RoboTwin 处理训练数据固定 revision
candidate · 78/100 · 开源生态基础设施
BWM 将 Wan2.2-TI2V-5B 扩展为带动态历史和动作对齐条件的机器人视频世界模拟器,并把它同时用于合成数据引擎、带失败样本的策略评估和风险预演。作者在 ARX X5 六任务、每策略每任务 25 次的硬件协议中报告 Real+BWM 平均 71.00%,高于 Real-only 的 50.67%,世界模型评估与硬件结果的 Pearson r=0.908。固定 commit 的推理源码(Apache-2.0)和非 gated 的约 10.05GB 权重均可检查,因此它是近期 WAM 工程基础设施的候选里程碑;训练代码、训练语料、推理显存和权重许可证尚未公开,不能被表述为完整可复现训练栈或独立证实的真实机器人增益。
arXiv 原始论文、ARX X5 分母与数据引擎/评估结果 · 官方固定 commit:推理代码、配置、demo 与 Apache-2.0 · 官方固定模型 revision:公开权重及许可证缺失边界 · WorldArena 官方评测入口
candidate · 80/100 · 主流迭代
X-NavDP 将 group Q-score reweighted matching 和行为扰动 RL 后训练接到导航扩散策略,并显式做本体调制;它在 40 个未见仿真场景及 TurtleBot、Go2、G1 三类本体的带分母实机协议中提供近期跨本体导航证据。固定子目录的 MIT 源码、checkpoint 与场景入口可检查,但权重没有制品许可证、场景需接受访问条款,且没有独立实机复现,因此仅列为“可能成为新主流”的候选里程碑。
arXiv 原论文、40 场景与 90 次实机协议 · 官方项目页 · 官方 MIT X-NavDP 固定源码子目录 · 官方 checkpoint 与低层策略固定修订 · Scene-N1 评测场景与访问条款
candidate · 86/100 · 开源生态基础设施
以2B、9B和122B三个开放基础模型统一空间理解、时序推理与具身问答,并在G1、S1和Tianji-Wuji三平台给出多任务实机结果;Apache代码与固定权重使其成为跨本体基础设施候选,但VLA动作模型仍未开放。
论文原文 · 官方项目 · 官方Apache代码 · 官方模型集合
candidate · 78/100 · 数据与基准基础设施
GRAIL 将3D资产、视频先验、4D人—物重建、G1重定向与SONIC任务通用跟踪串为“合成视频—物理验证—人形实机”闭环。公开代码、20k+物理验证序列、任务通用tracking checkpoint和G1按对象计数试验使其达到候选里程碑门槛;但它仍是受许可和外部服务约束的工程基础设施,而非已独立复现的通用人形方案。
论文原文 · 论文HTML · 官方项目 · 官方代码 · 官方数据与checkpoint
candidate · 85/100 · 开源生态基础设施
SONIC把大规模自然人体动作、可执行全身动作 latent、G1 低层控制、VR 遥操作与 VLA 数据采集组合为统一接口;其训练、评测、ONNX/TensorRT 部署与默认/低延迟控制器均已核验,是 2025 年人形全身控制从单任务 tracker 走向可复用工程底座的候选里程碑。
confirmed · 90/100 · 性能突破
把OpenVLA微调从低频离散动作推进到连续动作回归、动作分块和高吞吐推理,并形成代码、联合/分套件权重、训练数据和2000-episode独立复现闭环。
confirmed · 93/100 · 开源生态基础设施
将机器人连续动作压缩为可由语言模型高效生成的离散token,使自回归VLA能够在多本体数据上训练;通用分词器、独立LeRobot实现、量化基准和公开的失败修复共同形成动作表示基础设施。
candidate · 83/100 · 性能突破
把全局任务条件未来腕部潜变量作为VLA动作生成的专门接口,在LIBERO、RoboTwin 2.0与双臂实机均给出量化增量,同时维持87.43Hz并开放固定代码和模型权重,达到候选里程碑门槛。
candidate · 88/100 · 工程落地
把人形全身控制常用的“人类动作重定向+仿真 RL+零样本真机”配方推进到接触丰富的多指工具操作,并主动报告一个 0/10 的跨手型失败条件;完整 MIT 训练栈和紧凑 H5 参考数据使路线具备直接工程验证价值。
candidate · 80/100 · 工程落地
HOMIE以等构外骨骼驾驶舱将人形全身遥操作、动作采集与 G1/Dex3 部署连成闭环;它是近期低摩擦人形移动操作采集路线的重要工程节点,但应保留许可、硬件门槛和独立复现不足的边界。
candidate · 84/100 · 范式转折
首次把完整机器人机构生成、跨本体控制与奖励无关动力学预测统一到RoboToken扩散Transformer,并制造优化ALOHA验证机构改变的真实收益;固定代码、检查点入口和论文训练数据已开放,构成机器人共设计范式候选。
candidate · 78/100 · 数据与基准基础设施
GigaWorld-1把世界模型从“生成未来视频”转为以真实机器人执行结论校准的策略评估器:WMBench 对齐遥操作与策略 rollout,分别比较模型、动作表示、rollout 时域和评估指标。它提供了近期 WAM 研究迫切需要的“世界模型预测是否足以代表真机后果”的评测路线,且官方公开代码、部分模型和数据入口;但核心价值首先是评估基础设施,不应写成已被独立实机确认的通用控制策略。
arXiv 论文原文、发布日期与 WMBench 摘要 · 官方项目页、WMBench、模型与评估协议 · 官方 Apache-2.0 代码仓 · 官方模型入口
candidate · 83/100 · 开源生态基础设施
通过SQP、ADMM、隐式微分和JAX-CUDA共设计,把受约束、可微、超长时域MPC变成可复用GPU基础设施;MIT固定仓和真实赛车部署支撑工程候选地位,人形仍仅仿真。
candidate · 84/100 · 性能突破
把人类动作先验、机器人形态重定向、地形几何优化与感知全身控制接成完整链路,并在固定策略仿真中把地形任务完成率由27.3%提升到55.1%;代码、权重和G1动作对已开放。
candidate · 92/100 · 范式转折
把动作前的 2D visual planning、动作条件 3D 世界状态预测和 3D 动作生成联合进同一 3B/6B 模型,在 6,000 小时多源数据下同时取得 RoboTwin2.0、LIBERO 和两种真机本体的强结果,代表 VLA 向显式 3D world-action 联合建模的近期高潜分支。
candidate · 80/100 · 范式转折
PhysMani 将动作条件世界模型从视觉未来预测推进到动态物理状态建模,并在 Astribot S1 双臂实体平台上用四类任务、合计 64 次试验报告相对 3DFA 的平均成功率提升。固定代码含 Docker、训练、评测与下载入口,官方 benchmark 包可取得,故进入候选里程碑;但代码为 CC BY-NC-SA 4.0,数据和 checkpoint 未声明许可证,且尚无独立闭环复现,不能被写成可商用或已确认的世界模型基础设施。
arXiv 原文、64 次实体试验与结果口径 · 官方预发布训练与评测代码(CC BY-NC-SA 4.0) · 官方 PhysMani-Bench 数据与 checkpoint 包(未声明数据许可)
confirmed · 90/100 · 范式转折
把VLM语义、flow matching连续动作生成和跨七种机器人配置的通用策略训练连接为可迁移VLA范式;开放代码、基础/部分任务权重与后续跨框架采用已形成事实标准,但完整10,000小时数据仍关闭。
candidate · 82/100 · 范式转折
用可学习世界批评模型替代固定奖励器,为VLA持续强化学习提供跨任务奖励与失败诊断;149项任务、四套仿真基准和七项WidowX实机任务形成较完整作者证据链,且批评模型代码与小型实机数据已经开放。
candidate · 81/100 · 性能突破
把语言反馈的可靠性校准、质量感知奖励模型与安全策略更新组合成VLA后训练闭环;15项任务、三套基准及PiperX四任务实机对照,加上Apache代码与QAM权重,使其成为近期可落地的VLA-RL候选。
论文原文 · 官方项目 · 官方Apache代码 · 官方QAM权重
candidate · 81/100 · 工程落地
把语言任务图、持续3D/时序记忆、typed skills、执行状态和恢复机制统一到跨G1、R1与轮式双臂的AgentOS;真实导航有量化优势,但核心HoloAgent-0代码尚未完整发布。
candidate · 84/100 · 开源生态基础设施
MuJoCo Playground以 MJX/Warp、JAX PPO/RSL-RL、多个足式/人形/操作环境和 Apache-2.0 工程链路,降低了单 GPU 大规模仿真训练与 G1 原型验证门槛;其影响更接近训练基础设施而不是任一具体论文性能。
candidate · 79/100 · 数据与基准基础设施
ContactWorld 将视觉—触觉世界模型的训练、12 个接触任务、六类同步模态、rollout 和 CEM 闭环规划变成可下载的比较底座,并给出“触觉并非必然增益,表征兼容性决定长时规划收益”的反例。它是视觉触觉 WAM 评测和数据基础设施的候选节点,不可被表述为已量化的人形或真机领先方案。
论文原文 · 官方项目页 · 官方代码与任务配置 · 官方数据与 checkpoint
candidate · 80/100 · 范式转折
OmniRetarget把对象、地形和组合交互约束纳入人形全身重定向,再接入 Holosoma 的多仿真器训练/部署栈与公开交互子集,代表“人类动作到人形场景交互数据”从纯动作模仿向任务约束重定向的候选分支。
candidate · 79/100 · 数据与基准基础设施
TWIST2将便携全身采集、PICO 在线重定向、训练控制器和 G1 部署纳入同一 MIT 工程栈,是人形真机数据供给从专用实验室遥操作走向可移动采集系统的候选基础设施。
candidate · 78/100 · 范式转折
用人-人协作先验预训练异构双机器人策略,再以少量G1+Vega1遥操作微调,直接改变双机器人数据采集成本结构;5.4倍采集效率和四项实机分母使其跨过候选线,但制品仍待开放。
candidate · 91/100 · 数据与基准基础设施
把第一视角人类视频策展、真机遥操作与 DAgger 纠错、世界模型增强 VLA 以及 RealMan/G1 部署连成可审查的完整栈,并以 40 项多任务和两项跨本体长程任务量化,代表人类视频先验向灵巧真机策略迁移的近期强路线。
candidate · 91/100 · 数据与基准基础设施
首次把超 100K 小时 UMI 实景轨迹预训练、约 10K 小时跨本体后训练和 2.6B/5.1B/10.5B 模型缩放系统性连接到未见环境与低数据真机成功率,代表机器人基础模型进入六位数小时数据规模的转折候选。
candidate · 79/100 · 范式转折
用500Hz逐关节学习驱动器把真实执行器塑造成统一仿真接口,试图以接口层学习替代每台本体的精确系统辨识;从单关节延伸到7-DoF机械臂及31-DoF轮足和人形本体。
candidate · 88/100 · 范式转折
把语言动作生成从单次采样升级为 controller-aware 的“生成—动力学过滤—语义重排”测试时扩展,并把代码、权重和 G1 动作数据同时开放;在基础生成器、未见生成器和 OOD 提示上都显示可执行性与语义的联合增益。
candidate · 87/100 · 性能突破
以统一扩散生成器把语言、音频、人类参考与新型控制接口映射到同一 G1 动作空间,并随 50M–500M 参数规模持续改善;121.17M 帧数据、四档权重、固定 benchmark 与实时部署代码把多模态人形动作生成推进到可审查工程系统。
candidate · 80/100 · 范式转折
把慢 VLM 的推理过程从阻塞结果改造成逐 token 可消费的连续控制信号,并用不冻结模拟时钟的动态社会 VLN 评测直接量化 observation staleness;这是大模型导航从“答完再走”向实时双系统迭代的重要架构候选。
candidate · 84/100 · 范式转折
JEPA-WAM 将冻结的 V-JEPA 未来表征与动作预测放入同一联合嵌入目标,并在低参数预测器上连接 VLA、世界模型和双臂真机 ID/OOD 评测。它不是简单把视频生成器接到动作头,而是以未来潜状态作为动作训练目标的近期 WAM 分支;代码、权重和逐 rollout 实机记录均存在,具备候选里程碑的可审查工程闭包。
论文原文 · 官方项目页与真机结果 · 官方 MIT 代码 · 官方公开权重集合
candidate · 80/100 · 范式转折
Vid2WAM 把 14B 视频扩散教师的未来潜变量与 inverse-dynamics 反推伪动作离线蒸馏进 5B 世界动作学生,并用 source-aware residual adapter 隔离真实/伪动作噪声;部署时删除教师与 IDM。它在 RoboTwin/LIBERO 与两台 AgileX Piper 的受控双臂协议中给出作者量化增量,并发布 Apache-2.0 评测代码与四组 benchmark checkpoint,形成“高成本视频先验—较低时延动作学生”的近期 WAM 技术改进版候选。训练、教师/IDM、伪数据和真实数据均未公开,权重许可证缺失且无独立复现,故不能升级为确认里程碑、完整训练方案或人形/足式实机结论。
论文原文与日期 · 论文 HTML、协议、实机分母与时延 · 官方项目页 · 官方 Apache-2.0 评测代码 · 官方 benchmark checkpoint 固定 revision
candidate · 86/100 · 范式转折
把未来从单一RGB预测扩展到appearance、motion、geometry和semantics四种训练期视图,同时保持RGB-only部署;匹配骨干与数据的LIBERO/LIBERO-Plus横评、210次/模型实机和已开放代码/权重共同达到候选门槛。
candidate · 80/100 · 工程落地
TurboVLA 用 DINOv3 视觉和 BERT 语言的直接双向交互移除 LLM 动作路径,目标是把 VLA 推理放回单张消费级 GPU 的实时闭环。它同时给出同平台同数据的 AgileX Piper 四任务实机比较、Apache-2.0 训练评测代码和非门控 checkpoint,是近期轻量 VLA 工程路线的重要候选;但真实证据只有单一桌面臂,训练仍需 4 张 RTX 4090,权重受不同条款约束且未有独立复现。
arXiv 原论文、推理指标与实机协议 · 官方项目页与结果 · 官方 Apache-2.0 代码 · 官方公开 checkpoint 与权重条款边界
candidate · 94/100 · 数据与基准基础设施
把世界模型从离线合成推进到可交互数字遥操作:人类手势流驱动机器人第一视角视频,蒸馏后单 H100 约39–40+ FPS;官方 Apache-2.0 代码、SFT/Causal 权重和样例已真实开放,并有双臂真机策略收益。
candidate · 80/100 · 性能突破
把视觉与动作空间的SE(2)对称性直接嵌入DrQ-v2/SERL,在Franka FR3三项高精度任务中给出多种子、每设置50次的量化增益;固定仓具备真实训练代码和Apache许可证,适合作为小样本RL工程分支。
candidate · 80/100 · 工程落地
ContactMimic 将显式身体部位—物体部位接触命令、人体动作重定向、反相关数据增强和强化学习跟踪连接起来,使接触不再只是姿态模仿的隐变量;作者在 Unitree G1 五个动作、接触开/关共 70 次实体试验中报告 67 次成功。MIT Isaac Lab 实现已公开,但十个策略权重、HUMOTO 接触标注、实体部署栈和日志未发,故它是人形对象接触控制 2.0 的候选工程节点,而非确认里程碑。
arXiv 原论文、G1 70 次实体协议 · 官方项目页与原始试验视频 · 官方 MIT Isaac Lab 固定源码 · HUMOTO 许可与公开预览边界
candidate · 79/100 · 范式转折
TACO 把真实失败 rollout 组织为“识别—想象—优势标注—离线 VLA 后训练”的自纠正闭环:视觉/12D 力的触觉世界模型不只是预测器,而被用来定位失败并生成后训练信号。它在 Franka FR3 六项接触任务的作者实机实验中给出多轮改善,且 Apache-2.0 官方仓实际发布模型训练代码;该组合使其成为触觉 WAM 从论文概念走向 VLA post-training 工具链的近期候选里程碑,而不是已被社区证实的通用方案。
candidate · 80/100 · 工程落地
ω-0 将语言、多视角 RGB/RGB-D、机器人状态、未来视觉 latent 预测、扩散全身动作生成和 SONIC 控制器接为单一 Unitree G1 并行移动操作栈。作者在 11 个家庭任务、每方法每任务 10 次的协议中报告 ω-0 Omni 81.8% 成功率、36.7/41 task score、90.3% progress,并说明全部评测为学习策略自主执行;ω-HOME 描述 40.3 小时、4,827 段、24 任务、30Hz 的真机多模态采集。这是近期“人形世界动作模型技术2.0”的高潜候选里程碑,而不是确认里程碑:代码、权重、数据、许可证、训练配置和独立复现均缺失。
arXiv 原始论文、数据与真机实验协议 · arXiv HTML 实验/附录与部署边界 · 作者官方 ω-0 项目页(制品仍为占位)
candidate · 85/100 · 范式转折
通过认知骨干与扩散动作专家解耦,在Realman和Franka实机上形成相对OpenVLA的显著增量,并开放Small/Base/Large权重和完整微调部署代码。
candidate · 79/100 · 范式转折
N0-TWAM 将未来视觉、触觉与动作放进同一触觉原生世界动作模型,并以六种本体、450 个接触任务的私有预训练和 Flexiv/PiPER 八项真机协议探索跨本体接触预测。2026-08-13 已核验固定官方推理/后训练代码、基础权重与 UniVTAC 后训练权重,因此它从“承诺开放”升级为可检查的触觉 WAM 候选里程碑;但完整 NeoData 与预训练闭包仍私有,基础许可非商业,且没有独立真机复现,不能升级为确认里程碑或默认商业方案。
论文原文与真机协议 · 官方项目页 · 官方代码、推理与后训练固定提交 · 官方基础模型固定权重 · 官方 UniVTAC 后训练权重
candidate · 78/100 · 开源生态基础设施
ScaleBFM 将约 1.02 亿帧动作、跨来源重定向、PPO 规模化和 Humanoid Transformer 行为策略串成 Unitree G1 全身行为基础模型路线;2026-07-23 后官方新增 ScaleTrack 的 IsaacLab 训练、多 GPU、回放、checkpoint 导出和 TensorRT 路径,以及 M/XL 权重与两套测试数据。它是“全身行为基础模型 2.0”开源基础设施的候选节点,但 G1 机器人侧 ScaleBridge 未发布、根许可证缺失、主要量化来自仿真且没有真机 trial 分母或独立复现。
arXiv 原论文与仿真/部署报告 · 官方项目页 · 官方 ScaleRetarget/ScaleTrack 固定源码 · 官方 M/XL checkpoint 与测试数据固定修订
candidate · 84/100 · 范式转折
首次把两类不同 VLA 后门的内部触发机制、反事实定位与局部修复连成无需重训的推理时防御,并在物理 PiperX 上按每条件 30 rollouts 评测;若代码开放并跨攻击复现,可能成为 VLA 供应链安全的基础防护层。
candidate · 78/100 · 工程落地
OpenHLM 通过逐变量实验将全身遥操作接口、低层控制、VLA 设计与 HuMI 异构共训串为一条 Unitree G1 全身移动操作工程配方,并同时发布代码、五组权重和对应数据。它是近期“主流人形全身 VLA 2.0”路线的候选工程节点;但长时横评只抽取 10 个物体对且每对一次 rollout,代码的 LFS 交付受限,且尚无跨本体或独立真机复现。
arXiv 原论文与 G1 实机协议 · 官方项目页 · 官方 Apache-2.0 代码及 LFS 交付边界 · 官方五组 checkpoint · 官方 G1 训练数据
candidate · 85/100 · 范式转折
FTP-1 将 image、array 与 state 三类触觉通过 morphology-aware tactile token space 对齐,以共享触觉专家接入视觉、语言、本体状态和动作生成;它同时公开训练/后训练代码、预训练与 UniVTAC 模型、以及大规模异构触觉数据入口。作者报告跨已见和未见传感器的平台收益,是近期触觉策略由单硬件专用模型向 foundation-policy 过渡的候选转折。当前仅确认作者结果、Apache-2.0 代码和公开制品面;模型/数据许可未声明、数据逐源条款与独立实机复现尚不完整,故不升级为确认里程碑。
arXiv 原论文 · 官方项目页、逐任务结果与制品链接 · 官方 Apache-2.0 代码、训练/评测/推理路径 · 官方 4B 预训练模型卡,许可未声明 · 官方数据集页,7.53TB/18 archives,许可未声明
candidate · 78/100 · 范式转折
把动作对应的未来3D世界轨迹作为训练期教师蒸馏到当前帧VLA,并在部署时完全移除跟踪器;跨LIBERO-Plus、RoboTwin 2.0与双臂实机保持一致增量,达到候选门槛,但开放性几乎为空。
candidate · 80/100 · 范式转折
ViTacWorld 将动作条件视觉—触觉未来生成、真实与仿真数据预训练、真实策略 rollout 适配、合成轨迹扩增和部署前策略评估纳入同一世界模型闭环。它不是单纯给策略增加触觉输入:模型必须同步预测第三视角、腕部和指端触觉,并以生成轨迹改善下游策略。四项 Franka 接触任务有明确 10 次/任务物理分母与同一专家数据对照,因而可作为视觉触觉 WAM 的近期候选节点;项目页的 GitHub 仍标记 Coming Soon,所有开放、可复现和独立验证结论均为零。
arXiv 原论文与发布日期 · arXiv HTML:硬件、数据、10 次/任务协议与结果表 · 官方项目页及 GitHub Coming Soon 状态
candidate · 88/100 · 范式转折
让冻结世界动作模型在测试时从一段无动作标注的人类视频更新轻量记忆,并跨 Unitree G1、Galbot 两指夹爪和 Sharpa 灵巧手控制新任务;若开放并复现,可能成为人类视频到机器人动作的新主流。
candidate · 82/100 · 开源生态基础设施
把梯度自由的采样控制用于实时手部重定向,并用 18 人、三任务、四算法、平衡拉丁方与混合效应统计建立比单纯仿真追踪误差更严格的遥操作横评范式;多手型代码和样例使其具备工程基础设施价值。
candidate · 84/100 · 工程落地
把大规模视觉 VLA 先验保留到接触后训练阶段,再用因果力记忆、零初始化注入和在线纠错增加低时延物理反馈;三项 Flexiv 真机结果表明力觉可以作为廉价时间记忆而不必重训整个基础模型。
candidate · 89/100 · 数据与基准基础设施
用41路同步环视、双手触觉和markerless 3D把真实可变形物体世界模型数据扩展到198物体、1,980交互和约2,330万帧,并开放MIT数据与完整数据处理流水线;具备成为可变形世界模型基准底座的条件。
candidate · 78/100 · 数据与基准基础设施
WorldSimProbe 不把视频“看起来合理”或单个下游成功率等同于物理可信度,而是把动作条件世界模型的可观察仿真契约拆为局部控制敏感性、全局轨迹变化、跨来源动作、交互落地和动力学五套探针。它为 WAM 的标准泛化与失真诊断提供了可运行的候选基础设施,但没有真机测量或独立复现,故不应被解读为对任何模型的真实部署背书。
candidate · 78/100 · 数据与基准基础设施
KineBench 不以视频观感或单个下游成功率代替世界模型物理可信度:它用 2D 分割、单目深度与 CAD 约束的 6D 位姿追踪替代学习式 inverse-dynamics model,再将从生成视频恢复的末端轨迹送入 ManiSkill3 闭环执行,并补充 SPARC 与可操作度指标。20 个任务、四套评测、五类视频模型和固定代码/数据使它成为 WAM 标准泛化评估的候选基础设施;但全部执行都在仿真,README/环境/权重/CAD 闭包不足且没有独立复现,不能把它写成真机可靠性背书或一键可复现基准。
arXiv 原始论文、20 任务与仿真边界 · 作者论文页 · 官方固定代码、测试和 MIT 许可 · 官方固定评测数据 revision 与 CC-BY-2.0 声明
candidate · 80/100 · 范式转折
反转了“先把通用模型微调成 VLA”的默认路径:让现成前沿视觉代理通过人类可读 3D UI 和 MCP 工具零样本控制机器人。仿真结果显示模型通用能力可直接迁移,但代码、实体定量与可控成本尚未建立。
candidate · 78/100 · 工程落地
TouchWorld 将视觉语言子任务规划、触觉世界模型的未来接触子目标、视觉触觉动作生成与高频触觉残差修正分成不同时间尺度,而不是把触觉作为单一低频 VLA 输入。作者在搭载 Wuji 灵巧手和 JQ-Industries 触觉手套的人形平台上,对六个长时、接触丰富任务在清洁与人扰条件分别报告 65.0% 与 53.7% 成功率,相对最强基线提高 15.7 与 18.5 个百分点。这个带明确分母、触觉预测指标和人扰协议的实机节点应进入视觉触觉 WAM 发展谱系;但项目页没有代码、权重、可下载数据、许可证、标定或独立复现,故只能作为“强真机待开放”候选里程碑,不得写成可部署开源方案。
arXiv v2:模型结构、六任务与 clean/人扰结果 · 官方项目页:人形平台、触觉接口、逐任务结果、预测指标与开放边界
candidate · 81/100 · 范式转折
tau0-VLA 将执行记忆、视觉结果预测世界模型、价值评估、反思与测试时子任务搜索接到统一 40 维低层 flow-matching VLA;它在 AGIBOT G1 轮式人形、ARX AC One 和双臂 Franka 三类实体本体上披露固定十次试验、重置、终止与任务时限,并公开 Apache-2.0 低层代码、3B checkpoint 与 LeRobot 后训练示例。该组合使其成为近期“世界模型/VLA 主流技术迭代+轮式人形移动操作+跨本体动作接口”的候选范式节点;完整高层模型、40,115 小时训练语料和独立实机复现未公开,且 G1 为轮式人形,故不能被写成双足步行、越障或已被社区确认的新主流。
官方技术报告、实机协议与数据规模声明 · 官方项目页 · 官方 Apache-2.0 低层实现固定提交 · 官方公开低层 3B checkpoint
candidate · 79/100 · 工程落地
TrajBooster将跨本体数据重定向、约35小时生成交互数据、少量 G1 真机后训练和 VLA 部署连接成明确工程闭环,且代码、衍生数据与后训练模型均可访问,是人形 VLA 数据重定向路线的候选里程碑。
candidate · 80/100 · 工程落地
将 3B 级通用人形 VLA、混合真机/人类/仿真训练和 LeRobot/Isaac 工具链连接起来;官方模型卡披露 2,160 万训练 datapoints、13 个数据集及多个后训练变体。
NVIDIA GR00T-N1.7-3B 基础权重(公开非门控模型仓) · NVIDIA Isaac GR00T N1.7 训练、评测、LeRobot 转换与部署参考栈(GA 固定代码) · 官方开发指南
candidate · 87/100 · 工程落地
把450M级VLA、约100M动作专家、异步动作队列、LeRobot数据格式和SO100/SO101低成本硬件连成可训练、可部署的完整路线,显著降低VLA实践门槛。
candidate · 81/100 · 范式转折
把大量第一视角人类示范与少量机器人数据共同训练,为降低人形 loco-manipulation 真机采集成本提供可检验路线。
candidate · 86/100 · 范式转折
不再把数据增强的高 benchmark SR 直接当鲁棒性,而是证明全 HSV 扰动会使 VLA 退化成忽略颜色的形状偏置策略;用颜色依赖实体任务和灰度诊断建立了更严谨的 VLA 视觉安全评测范式。
candidate · 84/100 · 数据与基准基础设施
首次把足底压力作为贯穿 RGB 动作捕捉与人形控制的共同物理监督,并配套 70 人、400 动作、12.4M 帧的 MotionPRO;每动作序列 20 次 G1 实验说明感知质量与压力控制能共同提高动作完成和接触一致性。
论文 · 项目官网 · MotionPRO 组件代码 · 官方数据门户
confirmed · 83/100 · 范式转折
把慢速视觉语言规划与高速足式运动策略分层耦合,并在Go2与Booster T1的办公、居家和户外环境量化验证,形成足式VLA导航的可复用参考架构。
candidate · 82/100 · 工程落地
MuseVLA 将热成像、声阵列和毫米波雷达作为按任务选择的传感工具:VLM 先生成传感 token 与目标描述,再把异构读数投影为和 RGB 对齐的 grounded sensor image,交由 DiT 动作专家生成操作。它公开 MIT 代码、MIT 权重、CC-BY-NC-4.0 真机多传感器数据、标定与训练入口,并披露固定桌面 XHand 的已见/未见真实试验分母,达到近期多传感器 VLA 工程落地候选门槛。它不是视觉—触觉、力控、人形全身或跨本体实证;无独立复现且数据限研究用途,不能升级为确认里程碑或通用多模态部署结论。
论文原文与开放制品链接 · 论文 HTML、试验分母、数据规模与算力 · 官方 MIT 代码、训练、标定与硬件入口 · 官方 MIT 模型固定 revision · 官方 CC-BY-NC-4.0 数据固定 revision
candidate · 84/100 · 范式转折
FACT 把失败 rollout 从通常被丢弃的轨迹变成动作条件未来视频与任务进度的因果监督:动作模仿仍仅使用成功示范,但世界模型必须学习失败后果。它在固定 RoboTwin 50 任务闭环协议和有明确分母的双臂实机条件下报告增益,并公开 Apache-2.0 的训练、评测、checkpoint 与仿真数据闭环,因此是近期 WAM 主流技术2.0中的“失败数据因果分支”候选。公开闭环不覆盖论文真机栈,且没有独立实机复现,不能升级为确认里程碑或人形部署基线。
arXiv v1、方法与官方链接 · arXiv HTML 协议、50任务和真机分母 · 官方项目页 · 官方 Apache-2.0 固定代码与仿真闭环 · 官方非门控 checkpoint · 官方 RoboTwin-v2 仿真数据
candidate · 78/100 · 范式转折
这是一篇与另一篇同名 JEPA-WAM 完全独立的工作:它将阶段级语义未来与短视界视频—动作未来分开建模,以冻结 V-JEPA2 预测下一任务阶段,再有界注入 Motus 世界动作流。50 项 RoboTwin 2.0 的干净/随机化闭环协议及 ARX R5/LIFT2 双臂的两项量化实机试验使其值得列入 WAM 主流技术2.0候选;但没有公开工程制品或独立复现,不能和开放 JEPA-WAM、DreamWAM 或可部署 VLA 混为同一条项目线。
candidate · 83/100 · 工程落地
以 10 维显式任务空间命令隔离规划器与全身控制器,将运动跟踪、速度行走与跌倒恢复三类教师蒸馏为同一 MoE 学生;在 G1 上展示无需任务专用控制器微调的多类自然语言移动操作。
论文 · 项目官网 · 官方代码与 ONNX
candidate · 82/100 · 性能突破
179M Mamba 用异方差 residual flow 和按动作维度选择性修正,在不依赖 3–7B VLA 的情况下达到 LIBERO 92.5%、LIBERO-PRO 约 49%;代表低算力策略从纯缩模走向显式不确定性稳定控制。
candidate · 81/100 · 数据与基准基础设施
ArmnetBench 以三套低成本 SO-101 单/双臂单元,把同演示预算下的七类策略、十二项真实任务、成功/次优/失败三级标签和可下载 rollout 组织到同一数据与横评闭环。它让失败轨迹和真机评测不再只留在论文表格,适合作为轮臂/人形策略的低成本前置筛选参照;但 v0.1 还不是跨实验室、跨本体或人形实机排行榜。
candidate · 90/100 · 范式转折
把预训练3D几何基础模型直接改造成共享观测、未来预测与动作解码骨干,在相机扰动、LIBERO和四项实机任务上同时展现精度、鲁棒性与低时延;MIT代码、checkpoint和训练资产已真实开放。
candidate · 80/100 · 范式转折
LaWAM 以紧凑潜在视觉子目标替代像素视频生成,在 LIBERO 98.6%、RoboTwin 91.22% 与作者三项真机平均约 90% 的条件下报告 187ms 动作块推理,是近期世界动作模型从像素生成转向可部署 latent foresight 的候选转折。官方仓、四组模型和两组训练数据可访问,但根 LICENSE 缺失、训练预算很高且没有独立端到端实机复现;因此下调为证据边界清晰的候选,而非确认里程碑。
candidate · 78/100 · 数据与基准基础设施
TTP 将人类手部运动与全手触觉预训练迁移到夹爪、六自由度手与十二自由度手,并把跨本体接触表征、VLA 后训练和多类真实末端闭环连接起来。它在九类真机任务和多种物理手/夹爪上提供带分母的 ID/OOD 实验,是视觉—触觉基础模型从单传感器或单手专用模型走向跨本体触觉先验的重要候选数据节点;完整 H-Tac 仍未开放,权重没有制品级许可证,且缺少独立复现。
arXiv 原论文、H-Tac 与多本体实机协议 · 官方项目页与当前制品入口 · 官方训练、评测及真机代码 · 官方 H-Tac 样本数据及 MIT LICENSE · 官方权重,制品许可证未声明
candidate · 78/100 · 工程落地
该工作在 Unitree H1-2 双臂、两只 Inspire RH56DFTP 灵巧手和单视角 RGB-D 上,将 DDPM 关节生成、运动规划与力/触觉在线调整组成大物体双手抓取闭环;105 次未见物体实机试验给出 65/105 成功。它为“人形双臂+视觉触觉”提供了近期开源可审计的实机工程节点,但数据和代码交付均有许可证/完整性缺口,尚不应被描述为可复现实用基座。
candidate · 78/100 · 范式转折
Tactile-WAM 将视频世界模型、接触变化事件、视觉/双侧触觉非对称注意力与 flow-matching 动作生成连成明确机制链;六种接触条件、每条件20次的作者真机试验给出显著增益。它达到候选里程碑的最低证据门槛,但仅代表值得跟踪的视觉触觉 WAM 分支,绝非已可复现或可部署的主流方案。
candidate · 78/100 · 范式转折
MotionWAM 用视频世界模型的中间去噪特征驱动统一全身 motion latent,替代上肢策略与下肢粗略速度命令的分裂接口;它在同一 Stage-3 数据、同一 SONIC 低层控制器下对多种 VLA/WAM 完成 G1 九任务量化比较,是世界动作模型进入人形全身移动操作的重要候选转折。没有开放制品或独立复现,故不能作为可直接部署基线。
candidate · 82/100 · 工程落地
用 stance-foot frame 的 3D foothold 命令替代依赖世界位姿和显式接触估计的落脚控制,并把低层策略与多种高层规划器解耦;仿真跨窄桥、障碍、楼梯和坡道,Booster T1 上给出 20 次视觉闭环结果。
论文 · 项目官网 · 官方代码(专用实验目录)
candidate · 81/100 · 范式转折
通过自然语言动作前缀化解 VLM 语言分布与数值动作 token 的错配,不增加动作专家或新 head,用单 epoch 直接得到 0.8B/2B/4B VLA;这是紧凑 VLM→VLA 的高解释性主流迭代候选。
candidate · 78/100 · 工程落地
APEX 将 LiDAR 感知、高平台全身多接触、速度无关的 ratchet progress reward 与六技能蒸馏整合为一条 G1 零样本 sim-to-real 越障路线。它突破了仅脚部跳跃通常低于腿长 63% 的范围,并把 climbing、walking、crawling 与姿态切换放入同一策略,因此是近期人形全身越障的候选工程里程碑;但当前仍无代码、权重、数据、许可证、实机试验分母或独立复现,不能成为确认里程碑或默认安全方案。
candidate · 83/100 · 范式转折
Any2Track 将多动作通用跟踪、DAgger 蒸馏、在线动力学适配与 ONNX/G1 部署连接起来,直接针对负载、地形和外扰下的全身动作保持,而不是为每套参考动作和环境重训控制器。其 Apache-2.0 训练/适配/部署栈、公开 issue 中的成功与失败边界使其具备候选里程碑价值;但外部 checkpoint 未版本化,论文 MPJPE 是 root-local 指标,且独立 G1 端到端实机结果仍不足,故不得升级为确认里程碑。
candidate · 84/100 · 工程落地
ASAP 用少量真实 G1 轨迹学习踝部 delta-action 模型并回灌仿真,不再只依赖全量系统辨识或宽泛随机化;它把实机采集、动作重定向、Isaac Gym/Isaac Sim/Genesis/MuJoCo 路径、ONNX 策略和 G1 部署串成可检查的敏捷全身 Sim-to-real 闭环。候选状态反映其真实 G1 数据与制品开放度很高,但物理结果仍主要来自作者系统,独立团队尚未以固定提交和同一指标完成完整复现。
arXiv 原文与版本记录 · RSS 2025 官方论文集 · 研究团队官方项目页 · 官方训练、重定向、Sim2Sim 与 G1 部署代码
confirmed · 84/100 · 数据与基准基础设施
将多仿真器、任务生成、跨本体资产、合成轨迹和统一训练评测接口整合成持续维护的平台,推动大规模仿真数据由单一benchmark转向可组合基础设施。
candidate · 80/100 · 范式转折
把 sim-to-real 适配压缩为冻结 planner、只用约 2 分钟目标域普通 rollout 微调 inverse-dynamics module,不需要奖励、Mocap、特权标签、仿真器校准或在线 RL;G1/T1 五个硬件任务均改善,代表低数据动力学对齐的高潜路线。
论文 · 官方项目页与硬件视频
candidate · 80/100 · 范式转折
把跨人形 WBT 迁移分解为运动学语义对齐和动力学敏感模块低秩适配,在两种预训练骨干、四款人形和六个方向上验证,提示大规模全身控制先验可以像基础模型一样跨本体复用,而非每款机器人从零训练。
论文 · 官方项目(HTTP)
candidate · 84/100 · 范式转折
用轻量 latent world model 在不微调基础 VLA 的情况下对多个动作块候选做在线状态匹配,将测试时扩展引入动作 chunk 执行;两种机器人、两种 VLA 和四项硬件任务验证了局部纠错收益,同时明确展示延迟过高时的反例。
论文 · 项目官网 · 官方 Kinetix 代码
candidate · 89/100 · 数据与基准基础设施
首次把机器人失误检测、损害预测、恢复判断和干预策略放入同一大规模可执行基准,并用Franka实机显示仅追求任务成功会显著放大不安全完成;固定代码与54个HDF5示范文件已真实可取。
candidate · 81/100 · 数据与基准基础设施
PHUMA以物理可靠性筛选与重定向把约73小时动作转为可训练人形运动数据,开放 Apache-2.0 代码与可下载子集,并已进入 ProtoMotions 等后续工具链;它是质量优先运动数据基础设施的候选里程碑。
candidate · 85/100 · 范式转折
DreamZero 将14B自回归视频扩散的未来世界预测与动作联合建模,并以KV cache、异步闭环和Flash降噪把部署动作块压至约150ms。它在AgiBot G1、Franka、YAM和人类视频之间给出作者量化跨本体证据,且发布了可运行代码、checkpoint和DROID派生数据,达到候选里程碑门槛;无独立端到端复现,故不能升级为确认里程碑或生产级人形控制结论。
论文原文 · 官方项目页 · 官方Apache-2.0代码 · 官方DROID checkpoint · 官方DROID预处理数据
candidate · 83/100 · 工程落地
HTD 将稳定的下肢/躯干全身控制、VR 人形遥操作、分布式触觉与预测未来触觉潜变量的策略训练放入一条 G1 真机链路。它把“触觉作为后验观测”推进为同时服务动作预测与接触前瞻的训练目标,是视觉—触觉人形操作与 WAM 式预测表示结合的近期工程候选,而不是已经被跨团队确认的通用人形方案。
论文原文与首次公开日期 · 官方项目页、任务与实机视频 · 官方代码、G1 控制器与 MIT 许可 · 官方 Isaac Lab 训练、权重与 G1 部署栈
candidate · 86/100 · 数据与基准基础设施
以 G1/H1 为核心提供 260 个任务、10.3k 轨迹和多模态全身数据,并配套标准化云评测,直接补足人形操作数据基础设施。
candidate · 84/100 · 开源生态基础设施
Isaac Lab 是 Isaac Gym 的当前官方继承框架:将 GPU 并行物理、RTX 多模态传感、数据采集、域随机化、强化/模仿学习和动作规划放进模块化统一栈,并以可固定版本的开源仓承接人形、四足、机械臂和灵巧操作。由于技术报告发布未满十二个月,且尚无统一任务下的独立实机复现与跨引擎公平横评,本条仅列为候选里程碑;它不能被简化成“Isaac Gym 已完全替代”或“所有依赖均开源”。
论文原文与完整作者列表 · 官方代码、固定版本、环境和许可证边界 · 官方性能仪表板 · Isaac Sim 官方许可证
candidate · 84/100 · 范式转折
把off-policy SAC从传统低维连续控制扩展到60多任务、10个仿真器和高维灵巧操作/人形sim-to-real,在统一超参下显著压缩G1训练时间,并真实开放MIT完整训练框架;它可能改变PPO作为机器人并行RL默认选择的格局。
candidate · 91/100 · 范式转折
把动作条件未来预测重写为带缓存的图像编辑问题,在RoboTwin、LIBERO、OOD和Dobot实机同时给出强结果,并把A6000动作块推理降至263ms;MIT代码与三套非gated权重已真实开放。
confirmed · 83/100 · 开源生态基础设施
RSL-RL 将大规模 GPU 仿真训练、PPO、DAgger 式师生蒸馏、对称增强、RND 与机器人部署所需的轻量接口收敛到一个小而可修改的 PyTorch 库,成为 2022 年以来腿足快速训练向人形全身控制、导航、模仿和 Sim-to-real 工程扩展的关键软件节点。确认的是论文、固定官方源码、BSD-3-Clause 许可证、公开安装入口以及至少四个训练环境的可追溯接入;它不是通用 RL 算法冠军、统一数据集、任何机器人 checkpoint 或某个实体平台的直接成功率证明。
arXiv 原论文、方法、适用边界与框架接入 · 官方 RSL-RL 固定代码、安装、PPO、蒸馏与多 GPU · 官方固定 BSD-3-Clause 根许可证 · 官方 PyPI 安装入口
candidate · 78/100 · 范式转折
HOVER 将 root、局部关节和全身运动学位置等不同人形命令空间,通过命令掩码、oracle imitation 与 DAgger 蒸馏到同一多模式低层控制器;官方描述在 19-DoF 人形上覆盖 15+ 控制模式,并可在 H2O、OmniH2O、ExBody 与 HumanPlus 之间切换。它是从专用控制器走向可组合全身接口的候选范式转折;Apache-2.0 代码开放不等于完整训练数据、真机分母或独立物理复现。
arXiv 原论文 · 作者项目页与多模式控制范围 · NVIDIA 官方研究页 · NVlabs 官方 Apache-2.0 代码
confirmed · 92/100 · 开源生态基础设施
Octo 把 Open X-Embodiment 的异构本体、传感器和动作空间组织为可微调的开源 transformer-diffusion 通用策略,并发布代码、权重、Colab 与统一适配接口。它使“跨本体预训练策略”从闭源演示转为可下载、可调试、可派生的工程基线,是 OpenVLA 与后续轻量 VLA 横评不可缺少的历史节点。
confirmed · 94/100 · 数据与基准基础设施
首次把大规模跨机构机器人数据统一为可消费格式并配套 RT-X 模型,显著降低跨本体预训练的数据工程门槛。
confirmed · 88/100 · 数据与基准基础设施
DROID 将分布式真实机器人采集、统一硬件与标定、76k 示范/350 小时、564 场景和 86 个任务组织为可下载 RLDS 数据、平台搭建与策略训练闭环。它是 Open X 之后“真机数据规模与跨场景泛化”可被社区实际复用的关键数据节点,不等同于人形专用数据或零样本部署保证。
论文原文 · 官方项目页、数据与硬件说明 · 官方平台代码 · 官方策略训练与数据下载入口
confirmed · 84/100 · 工程落地
Mobile ALOHA 把 ALOHA 的低成本双臂采集链延伸到移动底盘与全身遥操作,使移动取放、厨务与电梯等任务首次能够在公开硬件、采集和模仿学习路径上被整体审计。它是轮臂移动操作的工程节点,不是人形全身控制、开放世界泛化或可直接与不同机器人成功率混排的证明。
confirmed · 90/100 · 数据与基准基础设施
MimicGen 将少量人类示范的对象/场景/本体适配转成可重复的大规模演示生成管线,首次把“用少量人类采集撬动多任务多场景数据”做成公开环境、生成代码、数据、文档与复跑协议。它是之后 DexMimicGen、人形合成示范与 sim 数据工厂的重要前史,但不是人形专用数据集,也不等价于真机零样本泛化。
论文原文 · 官方项目页 · 官方代码、环境、数据与许可
confirmed · 84/100 · 开源生态基础设施
GELLO 将“与目标机械臂同构的低成本主手”做成可扩展遥操作框架,并公开软件与硬件,降低了高质量真实示范采集的进入门槛。它是数据采集基础设施节点:价值在可审计的人机接口和跨臂型设计,而非某一策略的通用成功率。
论文原文与首次公开日期 · Berkeley 作者官方项目页、用户研究与开源声明 · 官方软件代码(MIT) · 官方硬件设计仓
confirmed · 82/100 · 数据与基准基础设施
BridgeData V2 把跨机构真实操作采集、语言条件、目标图像与离线评测组织为可共享的低成本机械臂数据基础设施:60,096 条轨迹横跨 24 个环境和 13 类技能,既保留遥操作,也保留脚本化 rollout。它为后续跨本体操作、离线学习与 VLA 预训练提供了共同数据/评测语言,因此是确认的“数据与基准基础设施”节点;但其本体是 WidowX 机械臂,不能被误读为人形、足式、触觉或全身控制基准。
confirmed · 84/100 · 开源生态基础设施
LeRobot 将真实机器人采集、遥操作、标准化多模态数据、PyTorch 策略训练、Hub 分发与部署接口放入同一 Apache-2.0 工具链。它不是某个 VLA、数据集或人形控制器的性能证明,而是让低成本机械臂、移动操作、人形与后续 VLA/WAM 数据在可转换、可检查的共同接口上工作的重要开源基础设施节点。
官方 Apache-2.0 仓、硬件与数据接口 · 官方 LeRobotDataset v3 文档 · 官方 v0.5.0 发布说明(G1、数据与模拟器) · 官方 v0.6.0 发布说明(世界模型、评测与纠正闭环) · 官方 ICLR 2026 论文链接
confirmed · 84/100 · 数据与基准基础设施
RoboCasa 将家庭厨房资产、任务生成、遥操作/自动生成示范、MuJoCo/robosuite 环境和统一评测组织为通用机器人策略的可下载仿真基础设施;RoboCasa365 在同一路线中扩展为 365 个任务、2,500+ 场景、2,200+ 小时演示以及固定 target split 的评测。它是从“单任务仿真 demo”转向任务、资产、数据与长程泛化一起版本化的重要节点,但仍主要是移动机械臂仿真,不能替代人形、轮足、五指手或真机接触证据。
RoboCasa 原始论文 · RoboCasa365 ICLR 2026 官方出版记录 · 官方 RoboCasa 代码、版本和许可证边界 · 官方数据概览与下载文档 · 官方 benchmark 协议
candidate · 80/100 · 开源生态基础设施
GR00T N1 把视觉语言推理、扩散式连续动作、跨本体数据和人形双臂实机后训练组织为公开的人形 VLA 起点;后续 N1.5、N1.6、N1.7 必须作为同一项目时间线的版本演进,而不是覆盖 N1 的论文、许可或复现边界。
论文原文 · NVIDIA 官方研究页 · 官方 N1 固定代码分支 · 官方 N1 2B 权重 · 官方公开仿真数据
candidate · 78/100 · 开源生态基础设施
ToddlerBot 将低成本、3D 打印硬件、数字孪生、可校准执行器、遥操作与真机数据采集作为同一 ML 研究平台发布;它不是性能最高的人形,但对“可自建、可采集、可 sim-to-real”的人形研发入口具有长期基础设施价值。
confirmed · 88/100 · 开源生态基础设施
提供可下载权重、训练与微调链路的通用 VLA 基线,使社区可以在公开条件下研究模型压缩、动作头和部署。
candidate · 81/100 · 开源生态基础设施
Humanoid-Gym 将 Isaac Gym 的大规模并行 PPO、人形奖励与 Isaac Gym→MuJoCo sim2sim 检验打包为可训练、可导出 JIT policy 的公开工程入口,并把 RobotEra XBot-S/XBot-L 的零样本 sim-to-real 作为作者真机验证。它是 2024 年人形强化学习从单篇方法走向可执行训练/仿真迁移栈的关键节点,尤其为后续人形全身控制、reward配方和训练工具链提供了可追溯谱系;但根仓没有 LICENSE,真实试验分母/指标、权重和完整硬件部署闭包未公开,不能升级为已确认的跨平台实机里程碑。
arXiv v2与真实 XBot 验证声明 · 官方项目页 · 官方代码固定提交、训练/sim2sim/示例权重与依赖说明
candidate · 80/100 · 工程落地
HumanPlus 把 RGB 人体/手部感知、仿真中从约 40 小时人类动作训练的低层影随、影随采集和第一视角行为克隆串成一条人类数据到人形自主技能的完整路线。它是 2024 年人形数据采集、影随和真机模仿学习的候选工程转折;官方仓能核查安装与硬件脚本,但没有完整数据、模型、许可闭包或独立实机复现,故不能升格为确认里程碑。
candidate · 79/100 · 数据与基准基础设施
OmniH2O 以运动学姿态为通用接口,连接 VR、RGB、语言/agent 与人形全身目标,再用大规模人类动作重定向、特权教师和 RL Sim-to-real 形成从遥操作到自主的路线,并发布 OmniH2O-6 六类日常任务数据。它是人形真机数据和全身控制谱系的重要候选基础设施;公开仓没有明确许可证,完整数据、模型、硬件与独立复现边界尚不足以确认。
confirmed · 95/100 · 工程落地
ALOHA 把低成本双臂主从遥操作、四相机数据采集与 ACT 动作分块训练合成可复建系统,使精细双臂操作不再只依赖昂贵工业平台。它既是低成本真实数据采集的工程里程碑,也是后来 Mobile ALOHA、VLA 真实微调和双臂横评的共同硬件语境。
confirmed · 86/100 · 范式转折
明确展示把视觉语言模型的 token 预测接口扩展为机器人动作,使互联网语义知识进入端到端机器人控制。
confirmed · 87/100 · 范式转折
RoboCat 以动作标注视觉轨迹训练跨任务、跨机械臂的通用 decision transformer,并把“少量新示范—专用 agent 自采样—回灌下一版通用模型”明确为闭环。它是随后跨本体机器人基础模型、真实数据扩展与自生成数据路线的重要历史节点;不是当下可下载部署的 VLA 基线。
confirmed · 84/100 · 范式转折
PaLM-E 将连续视觉与机器人状态编码成可与语言 token 交错处理的输入,使同一大模型能够覆盖机器人规划、视觉问答与描述任务,并以跨互联网语言、视觉和机器人数据的正迁移明确了后续 VLA 的基础命题。它是“具身多模态模型”范式节点,不应被误写为今日可完整复建的开源机器人控制栈。
confirmed · 87/100 · 开源生态基础设施
Orbit 把 Isaac Sim 的高保真物理/渲染、可组合任务、传感器、控制器、GPU 并行数据采集与多个学习库 wrapper 统一为可扩展机器人学习框架,是 Isaac Gym 的并行训练范式通向 Isaac Sim 多模态感知、移动操作与真实接口的一次关键工程转折。它的官方项目页与原仓均明确:Orbit 在 2024 年演进为 Isaac Lab。因此本条确认其历史影响,同时禁止将已迁移的 Orbit 当作当前维护的独立部署栈。
论文原文与出版 DOI · 官方 Orbit 项目页、吞吐口径、真机接口与迁移公告 · 旧官方仓重定向至 Isaac Lab 的可检验证据 · 当前 Isaac Lab 官方仓对 Orbit 奠基贡献的致谢与当前许可证边界
confirmed · 86/100 · 开源生态基础设施
Isaac Gym 将物理仿真与 PyTorch 策略训练放在同一 GPU 内存路径,减少 CPU 往返,使“数千至上万并行环境+PPO/模仿学习”的训练范式成为足式、人形和灵巧操作研究的共同工程底座。它是当前 Legged Gym、RSL-RL 和 Isaac Lab 路线的历史转折点;但 Isaac Gym Preview 是旧版受限分发软件,今天应以 Isaac Lab 等后继栈开展新项目,而不能把它误写成仍在演进的完全开源平台。
论文原文、GPU张量接口、吞吐与环境边界 · NVIDIA 官方 Isaac Gym 预览发布页 · 独立采用与官方迁移边界:Legged Gym · 后继 Isaac Lab 官方文档
confirmed · 88/100 · 数据与基准基础设施
将语言、图像目标与单示范统一编码为交错的多模态 prompt,并以固定四级泛化协议评估操作策略,提前定义了后来 VLA 研究反复面对的“任务指定形式与组合泛化”问题。它是仿真操作基准/可复现模型节点,不应被包装为真机通用性证据。
confirmed · 85/100 · 奠基理论
DreamerV3 把学习到的潜在世界模型、想象轨迹上的 actor-critic 优化和跨环境稳健化组织为一套固定超参数的可扩展范式。它不是人形或真机控制论文,但构成后续机器人 WAM、潜空间规划、世界模型 RL 与 sim-to-real 方法的关键历史接口,应在技术演进图中作为理论/工程基础节点呈现。
candidate · 79/100 · 数据与基准基础设施
DexCap 把便携式胸前视觉、SLAM、电磁手指追踪、三维场景和人类在环修正连接到灵巧手模仿学习,补上“手部高自由度数据如何以可移动方式采集”的工程链路。完整实现公开且论文覆盖六项真实灵巧操作,但跨设备独立复现和人形五指手迁移证据仍不足,保持候选级。
candidate · 82/100 · 工程落地
UMI 把可携带夹爪、GoPro/SLAM、机器人无关人类示范、Zarr 数据和真实机械臂回放串为可复建链路,直接改变了人形/移动操作此前必须“在目标机器人上采示范”的数据采集假设。它有充分代码、数据和硬件证据,但独立团队按同等真实场景/分母复现的公开证据仍不足,保留候选级。
论文原文 · 官方项目页 · 官方代码、数据与 MIT 许可
confirmed · 90/100 · 范式转折
把扩散生成建模用于多峰连续动作序列,形成了可复现、可迁移的视觉运动策略基线,并广泛进入操作与 VLA 系统。
confirmed · 84/100 · 范式转折
DayDreamer 将 Dreamer 的潜在世界模型、想象内 actor-critic 和在线 replay 直接用于四类实体机器人,而非先依赖模拟器或离线大数据。它同时连接四足恢复/行走、两类机械臂视觉抓放和轮式图像导航,是今天 WAM、在线适应、物理模型生成和跨本体世界表征的明确历史分界点。它不是当前 VLA、视觉触觉模型或人形全身控制的性能基线;源码、数据和硬件闭环不完整也是必须并列呈现的历史限制。
CoRL/PMLR 同行评审论文、四类实体机器人与实验范围 · arXiv 原始预印本与首次公开日期 · 作者官方项目页 · 官方 TensorFlow 实现、物理机器人配置和无根许可证边界
candidate · 78/100 · 范式转折
Puppeteer 以高层视觉 world model 输出命令、低层 tracking world model 执行命令的分层结构,将视觉条件、全身运动跟踪与复杂地形控制放入一个可运行的 56-DoF 模拟人形控制栈。MIT 源码、Docker、训练/评测命令和 checkpoint 链接使它成为视觉人形 WAM 发展史的候选节点与标准横评锚点;但没有任何实体机器人或独立复现证据,故不应被称为真机人形里程碑或优先于近期已核验的物理系统。
confirmed · 84/100 · 范式转折
该工作把外感知与本体感觉通过注意力循环编码器联合建模,使腿足控制在深度退化、遮挡、反光、雪和植被等野外条件下不再只靠接触后反应;它把感知融合从启发式模块接入端到端闭环,是当前视觉地形感知、导航—运动耦合和轮足/人形野外控制的关键历史分支。
confirmed · 87/100 · 范式转折
以端到端 Transformer、离散动作 token 与大规模真实机器人任务数据验证了通用机器人策略的扩展性,是 RT-2、RT-X 与后续 VLA 训练范式的直接工程前身。首次公开日期按 arXiv v1 计,不能用 2023 年修订或出版元数据覆盖。
confirmed · 86/100 · 范式转折
把语言模型对候选技能的语义概率与机器人技能价值函数的可执行性联合排序,建立了“语言规划必须受本体与环境 affordance 约束”的可解释闭环;它是后来语言驱动技能库、闭环反馈规划与具身 agent 路线的重要前身,而非端到端动作模型。
confirmed · 88/100 · 开源生态基础设施
Walk These Ways 将“多种同样能完成训练任务、但对分布外条件泛化不同”的控制行为编码进一张可调策略,而不是每遇到新场景就重新设计奖励与重训。它同时公开了 Unitree Go1 的 Isaac Gym/PPO/域随机化训练、预训练 MoB 策略、板载 Docker 部署、日志与安全功率保护说明,使多行为泛化从论文概念成为可复跑的工程工具链。它是四足动作库与泛化控制的重要里程碑,但依赖旧 Isaac Gym、Go1 Edu 与低层 SDK,不能外推为人形/轮足的直接部署结论。
论文原文与首次公开日期 · 官方项目页、CoRL Oral 与行为定义 · 官方训练、预训练、Go1部署与 MIT 许可
confirmed · 86/100 · 开源生态基础设施
该论文及其 Legged Gym 实现将单 GPU 上数千并行环境、课程地形、执行器模型、随机化与 ANYmal 真机转移合为可复用训练模板,把周级策略搜索压缩为可迭代的分钟级训练工作流。它奠定当前足式与部分人形 RL 管线接口,但官方仓已迁移到 Isaac Lab,旧依赖不能当作长期稳定底座。
论文原文、训练时间、实机转移与硬件限制 · 官方 Legged Gym 代码、依赖、迁移与已知问题 · 官方迁移后的 Isaac Lab 路线
confirmed · 87/100 · 开源生态基础设施
robomimic 把离线人类示范、六种学习算法、五个仿真和三个真实多阶段任务、配置化训练与公开数据放入同一个可复跑框架,使后来的数据集、Diffusion Policy、MimicGen 与真实操作论文有共同的训练/评测语言。它是机械臂操作基础设施,不应被误当作人形 VLA 或足式控制的直接性能基准。
candidate · 79/100 · 工程落地
Tactile Gym 2.0 把 TacTip、DIGIT 与 DigiTac 三种不同光学触觉机制、触觉/视觉/视觉触觉观察、PyBullet 环境与强化学习训练放入同一可检查接口,并将三项接触任务落到低成本 4-DoF DOBOT MG400。它是从 TacTip/DIGIT 传感器工程到今天视觉触觉模型、触觉世界模型与接触泛化评测的关键开源工程中间层。候选身份只确认作者报告的桌面臂 sim-to-real 路线与 GPL-3.0 源码;不把它写成现代人形、五指手、轮臂或视觉触觉大模型的性能证据。
arXiv v2 原论文、三传感器与三任务范围 · University of Bristol 官方出版记录 · 官方 GPL-3.0 代码、环境与部署边界
confirmed · 83/100 · 数据与基准基础设施
RoboNet 首次将不同机构、不同机械臂、相机、夹爪和采集策略下的真实交互经验汇为公开的多机器人数据池,使“先跨本体预训练、再以少量目标本体数据微调”成为可量化的工程问题。约 162,000 条轨迹、1,500 万帧、7 本体与持出 Franka/Kuka 实验构成从单机小数据到 BridgeData、Open X 和现代 VLA 数据混训的关键历史分支。它是数据基础设施节点,不应凭年代而排在近期已验证技术之前,也不应写成人形控制成果。
confirmed · 82/100 · 数据与基准基础设施
RoboTurk 把广泛可得的移动设备映射为 6-DoF 远程遥操作接口,并证明多用户/高延迟网络条件下可规模化采集操作示范;其后续真实任务、多人协作和 robomimic 数据路线展示了“人类远程示范—可复用数据—离线学习”的工程谱系。它是低成本数据采集和遥操作基础设施的确认节点,但绝非当代人形 VLA、全身控制或安全部署排名。
confirmed · 85/100 · 数据与基准基础设施
CALVIN 将连续控制、视觉/语言条件、长任务序列、数据下载和统一评测协议连为可复跑基准,成为 VLA 长时程操作中最常被引用的共同语境之一。它是可比较仿真评测基础设施,不可代替真实人形、触觉或开放环境的泛化证明。
confirmed · 92/100 · 奠基理论
建立了可迁移的图文对齐与 zero-shot 视觉接口,成为开放词汇机器人识别、导航、抓取和语义地图的重要感知基础。
confirmed · 82/100 · 奠基理论
BeT 用 k-means 动作离散化和每簇连续 offset correction 让 Transformer 能对多峰示范动作建模,避免单高斯回归以均值动作覆盖多个有效策略。它构成后续离散动作 token、多峰 BC 与部分 VLA action head 的历史技术接口;官方 MIT 代码与数据入口覆盖 Franka kitchen、BlockPush 和 CARLA,但这些均非已验证实体机器人,故其确认地位来自方法与长期可复跑的基准影响,而非实机落地。
confirmed · 82/100 · 数据与基准基础设施
ManiSkill 将物理丰富操作任务、视觉/状态观测、专家演示和评测环境开放为可扩展基准,后续 ManiSkill 系列继续承接 GPU 并行仿真、数据集和通用操作评测。它是仿真与数据接口里程碑,不能替代真实接触、触觉安装和跨硬件泛化证据。
confirmed · 82/100 · 开源生态基础设施
Brax 用 JAX 的向量化、JIT、自动微分与加速器并行,将刚体仿真、rollout 与 PPO/SAC 等优化放在同一设备内存路径,系统化地把“单卡/多加速器大规模并行训练”变成可公开复查的工程范式。它连接了后续 MJX、MuJoCo Playground、足式策略训练与可微控制分支;但官方当前已将物理仿真推荐迁往 MJX/MuJoCo Warp,Brax 主要维护 training,因此它是历史基础设施节点而不是今天所有实体训练的默认物理引擎。
arXiv 原始论文、任务、训练与物理局限 · Google 官方 Brax 代码、当前维护与 MJX 迁移边界 · 官方 Apache-2.0 许可证 · 官方 MuJoCo MJX 文档
confirmed · 82/100 · 开源生态基础设施
robosuite 将 MuJoCo 操作环境、控制器、相机观测、遥操作和多臂任务模块化,长期充当操作学习与数据采集的可组合工程底座。它是工具与任务层里程碑,不应把当前版本新增的人形或渲染特性倒灌为 2020 论文结论。
confirmed · 84/100 · 开源生态基础设施
SAPIEN 将可动部件资产、物理交互、视觉传感与机器人操作环境放入同一开放仿真底座,解决了只含静态场景或弱交互环境难以支持关节物体操作学习的问题。它随后成为 ManiSkill/ManiSkill2/ManiSkill3 的底层引擎与资产谱系,使大规模专家演示、GPU 并行视觉采集和操作横评拥有连续的工程来源。该节点是仿真和交互资产基础设施里程碑,不是人形真机、触觉接触或 sim-to-real 成功本身的证据。
CVPR 2020论文原文与首次公开日期 · 官方 SAPIEN 项目页与 ManiSkill 承接关系 · 官方 SAPIEN 代码、PyPI安装与 Apache-2.0 许可证 · 官方 SAPIEN v3.0.3 发布记录 · 官方 ManiSkill 后继框架
confirmed · 82/100 · 数据与基准基础设施
RLBench 将任务语言、视觉观测、动作接口、场景与专家演示封装为统一操作基准,使行为克隆、离线强化学习和视觉操作工作能在相同任务定义下比较。它是仿真操作横评与数据接口基础设施,而不是现实世界机器人性能榜单。
confirmed · 83/100 · 开源生态基础设施
dm_control 把 MuJoCo Python 绑定、连续控制 suite、MJCF 组合、可复用环境组件、观察器与 locomotion 任务组织为长期可安装的软件接口。它是现代操作、运动模仿、足式训练和视觉控制实验共享的仿真基础设施节点;它不应因历史影响而压过近期已核验的真机或跨域技术,也不能被写成任何具体策略、人形实机或 sim-to-real 的性能证明。
confirmed · 83/100 · 开源生态基础设施
Habitat 把高性能三维仿真、标准化导航任务、数据下载与训练评测接口组织为可复用平台,成为室内导航、具身视觉与后续重排任务的共同实验底座。它是仿真基础设施里程碑,不是人形真机能力或 sim-to-real 成功的证明。
confirmed · 84/100 · 奠基理论
Raibert 将动态行走的高度、机身姿态和前进速度分解为可反馈控制的问题,并以真实单腿、双足和四足原型验证主动平衡与落足调节。这一脉络是今天足式动态控制、接触恢复和全身控制的历史起点;它确认的是控制思想与真机谱系,绝不等同于当代可下载的软件栈、现代传感器配置或人形性能承诺。
MIT Press 原始著作论文出版页 · MIT Leg Laboratory 四足原型档案 · MIT CSAIL 动态足式控制谱系说明
confirmed · 83/100 · 开源生态基础设施
Free Gait 将足端、关节与基座运动定义为可组合的全身命令层,把导航/脚步/动作规划同低层实时反馈控制解耦;它以 ANYmal 的台阶、全身爬楼、构型变化和特殊动作建立了可用的开源全身控制接口谱系。该架构对当前足式、轮足与人形全身栈具有历史工程价值,但官方源码已停止支持,不能替代现代硬件适配和学习式策略评测。
confirmed · 82/100 · 开源生态基础设施
OpenHRP 将人形仿真器、运动控制库、硬件抽象与同步机制作为同一软件平台提出,并以仿真二进制直接用于对应真机的兼容性检验为目标。它是日本 HRP 系列以及后续人形仿真—控制分层路线的重要早期工程节点;确认状态仅指其历史基础设施影响,并不表示该 2004 软件栈可在当代 GPU 仿真器、Unitree/智元/傅立叶本体或视觉—触觉 VLA 上即装即用。
confirmed · 82/100 · 奠基理论
Capturability/捕获点把受扰动足式系统“是否还能通过有限步恢复”转化为可分析、可控制的落脚与动量问题,并在同系列 Part 2 的 M2V2 下肢人形上给出应用。它是今天 DCM、capture-point、push-recovery 和落脚恢复规划的重要理论谱系,不是能直接替换感知、接触估计、全身力控或现代强化学习策略的完整系统。
IJRR Part 1 DOI · IJRR Part 2:M2V2 下肢人形应用 DOI · IHMC Robotics 官方人形论文目录
confirmed · 83/100 · 奠基理论
Kajita 等将 ZMP 轨迹跟踪表述为使用未来参考的预瞄伺服控制问题,并在简化模型与精确多体模型误差之间引入补偿;这一质心—足步规划接口成为后来 HRP-2 等人形走路、DCM/capture-point、MPC 与学习式低层控制所继承的关键谱系节点。确认的是方法历史影响与可追溯后续实体使用,不把 2003 年的楼梯仿真示例、简化模型或任何社区实现误写成当前本体的实机性能保证。
IEEE ICRA 2003 原始出版 DOI · AIST Kajita 官方论文目录 · AIST HRP-2 后续实体系统采用论文
confirmed · 82/100 · 奠基理论
DMP 将离散与节律运动表示为可调目标、可组合的稳定非线性动力系统,为从示教轨迹生成、重定向和在线调节提供了与端到端策略不同的控制接口。它不是当代 VLA、WAM 或全身策略的性能基线,却是人形技能原语、模仿学习和运动生成长期复用的概念节点;确认状态来自跨团队、跨机器人实现和持续方法继承,而不是引用数或历史声望。
Springer 原始出版 DOI · Autonomous Robots:离散与节律运动原语的高自由度机器人验证 · DMP 教程综述的同行评审书目信息
confirmed · 85/100 · 奠基理论
操作空间公式把末端任务运动、接触力和冗余自由度从关节坐标中的局部调参,提升为可统一表达的动力学控制问题。它是后来人形全身控制、接触约束、双臂协同、任务优先级与运动—力混合控制的理论母线;这条历史贡献不等于一套可直接部署的现代 WBC 软件、实时求解器或人形实机性能。
confirmed · 82/100 · 奠基理论
该工作将约束、操作任务和姿态以优先级层级统一在自由浮动人形的动力学与支撑接触中,提出运行时可行性监测而非只在逆解层拼接目标。它是后续多接触 WBC、操作空间控制、接触一致控制和今日人形低层安全控制接口的重要谱系节点;不是现代电驱人形、轮臂轮足或学习策略的即用性能基线。
Stanford Robotics Lab 原论文目录与 PDF · IEEE ICRA 2006 出版记录 · Stanford whole-body operational-space control 项目脉络
confirmed · 82/100 · 开源生态基础设施
MuJoCo 将带约束的多关节刚体接触、解析/数值动力学计算与模型式控制实验收敛为一个可重复的物理引擎接口,奠定了 dm_control、DeepMimic、强化学习、足式训练、操作仿真与 MJX 等多个谱系共同依赖的底层语言。原始 2012 论文发表时并非今天的开放软件发行;当前 Google DeepMind 维护的 Apache-2.0 开源实现只能作为今天可复查的工程延续,不能倒灌为原论文的开放性或任何真机、sim-to-real 性能证明。
IROS 2012 原始论文 PDF · IEEE DOI 与出版记录 · Google DeepMind 官方 MuJoCo 代码、发布与 Apache-2.0 · 官方 MuJoCo 文档 · 官方 dm_control 仓与 MuJoCo 整合
confirmed · 86/100 · 范式转折
CLIPort 以 CLIP 的语义 what 路径和 Transporter 的空间 where 路径把语言条件操作落实为动作中心 pick/place affordance,是视觉语言操作从对象检测加规则走向端到端空间动作学习的重要工程转折。它有明确官方代码、生成/训练/评测/Docker、checkpoint 与作者报告的九项真实桌面任务;但动作主要是平面 SE(2) 抓放,实体结论不延伸到人形、轮臂、轮足、五指手或触觉。
confirmed · 85/100 · 工程落地
该工作以特权信息教师与只使用本体感觉历史的学生策略,将仿真训练推广到雪、泥、水、植被、碎石等复杂自然环境,并将零样本鲁棒性从实验室地形带入长时野外任务。它是“盲本体感觉优先”的感知失败反例与 later visual locomotion 的对照基线,不等价于完整开源部署栈。
confirmed · 85/100 · 范式转折
RMA 将在仿真中由特权外参训练的基策略与仅由短历史观测估计外参的适应模块拆开,使 Unitree A1 能在无需真机微调的条件下快速响应未见摩擦、载荷、地形与执行器变化。它把“随机化后静态策略”推进为“部署中以历史感觉在线辨识再调节策略”的足式控制范式,是 A-RMA、teacher-student、残差适应及后续人形/四足策略泛化的共同历史节点;原始官方仓仅为项目媒体而非训练实现,因此不能误写成完整开源复现实验。
论文原文、方法、真实 A1 部署与首次公开日期 · 作者官方项目页与原始视频/补充材料 · 作者官方项目媒体仓固定提交(非训练代码的边界证据) · 后续开源训练栈与 RMA 关系说明
confirmed · 84/100 · 工程落地
该工作用包含真实执行器行为的仿真训练策略并部署到 ANYmal,使速度跟踪、动态跑动和跌倒恢复从定制控制律转向可学习的 Sim-to-real 控制链。它是后续腿足快速训练、执行器网络和真机强化学习的工程前史,而非当前开源机器人上可无修改复跑的完整制品。
confirmed · 87/100 · 范式转折
PerAct 用语言条件的RGB-D体素 observation/action space 与 Perceiver Transformer 把多任务6DoF操作从二维图像到连续动作的黑箱映射,改写为可检查的三维离散动作选择。它公开多任务训练、RLBench数据/评测、checkpoint、Docker和Franka接口,是后来3D-VLA、RVT、几何动作模型与语言条件操作横评的共同历史节点;实机证据仅为固定Franka,不能把它升级成人形或移动操作里程碑。
CoRL论文原文、方法与仿真/Franka协议 · 官方项目页 · 官方Apache-2.0代码、checkpoint、数据与Franka接口
confirmed · 84/100 · 工程落地
DIGIT 把相机式柔性触觉推进为可安装于多指手的紧凑、低成本、高分辨率接口,并以公开设计、接口和后续 TACTO 仿真连接传感器制造与视觉—触觉学习。它是从 GelSight 到当代视觉触觉表征、仿真、灵巧手和触觉世界模型的工程锚点;确认的是传感器/生态谱系,并非完整开源触觉控制栈、商用自由硬件或人形手实证。
confirmed · 82/100 · 开源生态基础设施
PyTouch 是将多类真实触觉传感器的触碰检测、滑移和物体位姿估计封装到机器学习库的早期开放软件节点。它在 DIGIT/GelSight 等传感器工程与 TACTO、Sparsh、视觉—触觉基础模型之间提供了可追溯接口层。确认的是 MIT 历史代码与软件生态贡献;该仓已于 2024-04-01 归档,不等同当前维护的触觉训练/部署栈、开放权重数据或人形操控实证。
confirmed · 84/100 · 开源生态基础设施
ORB-SLAM3 将单目、双目、RGB-D、视觉惯性与 multi-map Atlas 统一为一个开源定位—建图库,是移动底盘、四足、轮足和人形把相机/IMU 接入状态估计栈的历史软件锚点。确认的是其论文、基准协议与 GPL-3.0 源码的长期工程影响;它不是端到端导航策略、语义避障、动态人群安全系统或可直接替代当前传感器标定与故障恢复的部署方案。
confirmed · 83/100 · 开源生态基础设施
Pinocchio 将高效多体正/逆动力学、解析导数、接触与闭链计算以长期可安装的 C++/Python 软件库开放,并以 URDF/SDF/MJCF 接口连接人形、足式、机械臂和移动平台的模型层。它是 Stack-of-Tasks、全身控制、MPC、轨迹优化与学习控制之间的关键开源基础设施节点;其历史影响不应压过近期已量化的真机、视觉—触觉或世界动作模型结果,也不能被写成任何策略的性能证明。
SII 2019 论文 DOI · 作者公开论文 PDF · 官方 Pinocchio 仓、安装和 BSD-2-Clause · 官方 Stack-of-Tasks 人形全身控制整合
confirmed · 83/100 · 开源生态基础设施
TACTO 把视觉式触觉传感器作为可配置、可与 PyBullet 联动的图像渲染接口公开,使 DIGIT/OmniTact 等高分辨率触觉输入能够以数百帧每秒进入抓取稳定性、在手操作和 sim-to-real 研究。它是视觉—触觉路线的历史工程节点:意义在于降低试验和数据生成门槛,而不是证明触觉接触物理已经被精确模拟。
arXiv v1(方法、任务与 sim-to-real 边界) · 官方代码、安装与 MIT 许可证 · PyPI 分发记录 · 社区触觉资源目录(仅谱系线索)
confirmed · 83/100 · 开源生态基础设施
Drake 将多体动力学、接触/传感器建模、数学规划、轨迹优化、系统图与控制器实现整合为可安装的 C++/Python 工具箱,并强调暴露梯度、稀疏性和约束结构,而非只作为黑箱仿真器。它连接 Atlas 等全身控制/足式优化、机械臂操作、接触规划与后续学习控制的工程谱系,是 Pinocchio、MuJoCo、ROS 与专用控制栈之间不可缺少的模型式基础设施节点;确认的是长期可审查的软件与生态影响,不能将其写成某一人形、四足、轮足、VLA 或 WAM 路线的统一真机性能。
Drake 官方主页、2019 引文、维护主体与能力范围 · Drake 官方 2019 论文式引用记录(非同行评审 PDF) · RobotLocomotion 官方 Drake 代码、版本与 README · 官方 BSD-3-Clause 许可证 · 官方安装与 Python 教程入口
confirmed · 84/100 · 数据与基准基础设施
LIBERO 将 130 个语言条件操作任务、固定初始状态、四类知识迁移分布偏移、演示下载、训练/评测脚本和基线组合成长期可复跑的共同评测语言。它是近年 VLA、扩散策略、持续学习和记忆方法横评的重要基础设施;确认的是其公开基准与工程采用价值,不把仿真分数包装成实体人形、轮臂轮足或视觉触觉泛化。
confirmed · 85/100 · 范式转折
原始 Dreamer 将 PlaNet 式潜在动态从在线规划推进为“在世界模型想象出的多步轨迹上直接训练 actor 与 value”的范式:行动时只执行 actor,训练时对 latent imagination 中的价值估计反传解析梯度。它是 DreamerV2/V3、DayDreamer 以及今天潜在世界模型/WAM 控制分支之间缺失的关键中继节点。其确认地位来自持续的官方实现、现代复现与后续采用;但原始实验是 Atari/DMControl 等仿真控制,不含任何真机、人形、视觉触觉或语言条件,绝不能用于抬高现代实机路线。
arXiv 原始预印本与首次公开日期 · ICLR 2020 论文 PDF · 作者项目页与机制说明 · 作者 TensorFlow 2 实现、训练入口和 MIT 许可 · Google Research 原始实现及历史版本说明
confirmed · 83/100 · 开源生态基础设施
Crocoddyl 把预定义接触序列下的浮动基多接触最优控制、稀疏解析导数、FDDP 与状态/反馈轨迹计算收敛为可安装的 C++/Python 工具库。它位于 Pinocchio/TSID 的动力学与任务空间接口之后、现代足式/人形接触规划和 inverse-dynamics MPC 之前,是模型式全身控制发展链的关键开源节点。确认的是论文、长期维护的 BSD-3-Clause 实现和多接触最优控制软件谱系;不将其毫秒级仿真轨迹或 ANYmal 示例写成通用人形实体性能、VLA/WAM 收益或安全认证。
arXiv 原始论文与 FDDP 机制 · ICRA 2020 DOI 与正式出版记录 · loco-3d 官方 Crocoddyl 代码、安装、测试与 BSD-3-Clause · 官方 BSD-3-Clause 许可证
confirmed · 83/100 · 范式转折
PlaNet 用随机—确定混合潜在状态、latent overshooting 与在线潜在规划,把“从像素学习可用于规划的动力学”推进到可复跑的模型式控制基线,并直接奠定 Dreamer 系列和当前动作条件世界模型的训练/评测语言。它是仿真控制历史节点,不应与真机 WAM 成功率混排。
confirmed · 89/100 · 工程落地
通过大规模域随机化把仿真强化学习迁移到真实灵巧手,证明复杂接触操作可以跨越显著 reality gap。
confirmed · 88/100 · 范式转折
用对抗式运动先验降低逐帧参考轨迹依赖,成为后续自然人形运动和技能先验的重要基础。
confirmed · 82/100 · 范式转折
该工作把模拟器内动力学随机化、策略训练和低成本四足真机部署明确连成 Sim-to-real 路线,是后来腿足机器人“在模拟中覆盖不确定性、在实机零微调验证”的历史分界点。它缺少完整开放实现与现代统一基准,因此仅作为发展史节点,不当作今天可直接部署的工程模板。
confirmed · 82/100 · 工程落地
该工作把混合整数足步规划、凸/稀疏非线性优化、全身控制、激光—惯性状态估计和 Atlas 实机系统集成在同一条复杂地形行走链路中,明确了当代人形全身控制中“感知—规划—估计—力/运动控制”不能只靠单一模块替代的工程接口。它是 DRC 时代模型驱动 Atlas 栈与后来 centroidal/MPC、接触规划和学习式人形控制之间的关键历史节点;并非今天任意人形、轮足或 VLA/WAM 的即用基线。
Springer 论文出版页、DOI与在线发表日期 · MIT Robot Locomotion Group 公开出版页与论文入口 · MIT Underactuated humanoid 课程脉络与原始文献
confirmed · 82/100 · 工程落地
ANYmal 把扭矩可控腿、机载激光/相机、状态估计、足端选择、导航与工业巡检载荷集成为可野外运行的四足平台,是“动态足式机体”从实验室跑跳走向长期自主感知和作业的关键工程转折。它解释了后续 ANYmal/ANYbotics、感知地形控制、Legged Gym 与足式移动操作路线的硬件起点;但该平台并不是开放数据、开放控制或可直接转移到今天任何产品的通用答案。
confirmed · 83/100 · 工程落地
BigDog 将动态四足机构、粗糙地形感知、液压驱动与实时平衡控制集成为野外真机系统,明确暴露了传感、接触、执行器和环境不确定性必须协同处理的工程约束。它是动态四足从实验室步态走向复杂地形平台的重要节点;它不是今天开源四足、人形控制器、商业产品或可复跑 benchmark 的替代品。
confirmed · 84/100 · 数据与基准基础设施
Dex-Net 2.0 将大规模合成点云、解析抓取鲁棒性标签、RGB-D 抓取候选表示、GQ-CNN 与 ABB YuMi 实体评测接成完整链路,使“先以几何与物理生成可扩展训练数据,再在真实新物体上验证”成为后来合成操作数据、抓取质量模型和 sim-to-real 数据工程的重要前史。它是平行夹爪抓取基础设施,而非人形、足式、轮臂轮足、五指手或视觉—触觉基础模型的直接性能节点;在近期排序中只提供历史上下文,不能压过近期、社区验证和跨域创新路线。
RSS 2017 正式论文记录 · UC Berkeley AUTOLAB 官方项目页、数据、物理评测与后续版本 · 官方 HDF5 数据库 API、使用范围与安装边界
confirmed · 83/100 · 工程落地
MIT Cheetah 的本体感觉执行器把高扭矩密度、低反射惯量、关节内力控制与冲击缓解作为一个可量化的执行器设计问题,改变了后来动态四足与人形硬件把“驱动—接触—控制”割裂处理的方式。它是当代高动态足式机器人执行器谱系的工程基础节点,不是可直接复跑的软件栈,也不应被当成今天任意电机或人形关节的性能承诺。
confirmed · 83/100 · 工程落地
TacTip 将柔性皮肤下的针阵位移、内置相机和双材料 3D 打印结合为可改变形态的视觉触觉平台,并以 TacTip、GR2、M2、TacCylinder 等不同接触几何说明同一光学转导原则如何进入夹爪、软手和其他接触部位。它补齐了 GelSight 的高分辨率视觉触觉之后、TACTO/TACTile Gym 仿真之前的关键工程谱系:不仅把触觉当成传感器,也把制造形态、相机可观测性和接触任务一起设计。其历史价值不意味着任何今日人形五指手、腕部相机或视觉—触觉大模型可直接复用该设计或取得同样性能。
Soft Robotics 论文与 DOI · University of Bristol 正式出版记录 · TacTip 官方技术平台与当前形态说明
confirmed · 85/100 · 范式转折
Deep Visual Foresight 把无标注动作条件视频预测、像素目标和在线模型预测控制连成闭环:预测候选动作后的未来图像,再反复重规划真实机械臂推动和绕障。它是 WAM 从“会预测”走向“用预测选动作”的机器人范式转折;今日没有核验到其固定代码、权重或数据制品,因此不能当作可部署框架。
confirmed · 84/100 · 奠基理论
将真实机器人无标注交互、动作条件的多步视频预测和显式像素运动联系起来,使“不同动作会产生不同未来”首次成为可由机器人数据学习的模型接口。DNA/CDNA/STP 与约 5.9 万段真实推动数据构成当前 WAM/视觉预测控制的早期机器人谱系;它确认的是方法和数据范式,不能被包装为今天可下载的模型、通用控制器或人形方案。
confirmed · 83/100 · 范式转折
McGeer 以斜坡上的无主动供能双足试验机证明步行可以首先是稳定的自然动力学模式,再与主动输入结合。这改变了足式研究只以轨迹跟踪和关节驱动为中心的视角,形成被动/欠驱动行走、能效设计与混合动力学控制的重要谱系;它不证明任意现代人形能耗、越障、安全性或商用可靠性。
confirmed · 83/100 · 工程落地
GelSight 将带相机的软弹性体接触面变成高分辨率视觉观测,把表面几何、法向/切向力和滑移等触觉问题接入图像建模与学习管线。它是后续 DIGIT、视觉触觉表征、触觉仿真与视觉—触觉灵巧操作的关键传感工程前史;确认地位来自可追溯的原始论文、长期的独立传感/算法继承和可检验的接触测量范式,而不是把后来的商用 SDK、现代模型或视频宣传倒灌为 2017 年原始工作的开放复现能力。
原始开放论文(方法、实验与 CC BY 4.0) · MIT CSAIL 正式出版记录 · PubMed Central 全文存档
confirmed · 83/100 · 主流迭代
Temporal skip connections 让动作条件视频预测在对象被遮挡时从较早可见帧取回外观信息,并将该预测接到目标导向规划和行动空间设计;它把视觉世界模型从单对象推动推进到未见对象、多对象与绕障的可检验控制问题。
confirmed · 85/100 · 开源生态基础设施
iCub 把儿童尺度人形本体、丰富的视听触觉与运动能力、可复用软件架构和协作支持机制明确作为开放研究平台,而非孤立算法论文。它让具身认知、模仿学习、视觉—触觉、全身操控和人机交互在共享人形本体与软件生态上长期积累;并不把今天的 icub-main 直接追溯为 2010 论文的一键复现实验,也不把其历史平台优势误写成现代 VLA/WAM 性能优势。
原始同行评审论文(Neural Networks) · RobotCub 官方开放平台与项目遗产说明 · iCub 官方主软件代码仓
confirmed · 82/100 · 奠基理论
Escande、Mansard 与 Wieber 将严格任务优先级以层级二次规划而非单一加权代价表达,使高优先级约束在数值求解中保持可行性边界,并把冗余人形的运动、接触和姿态任务统一为可在线求解的层级。它填补了早期 ZMP/质心规划与后来 TSID、接触约束 WBC、Pinocchio/SoT 软件栈之间的关键算法中继。确认的是方法谱系、长期软件继承与可追溯采用;它不是当代 VLA/WAM、视觉触觉、端到端学习或任意人形的性能保证。
IJRR 原始正式出版 DOI · Stack of Tasks 官方 whole-body/hierarchical-control 项目页 · Stack of Tasks 官方组织与持续维护模块 · 官方 sot-core 任务求解器及 BSD-2-Clause 许可边界
confirmed · 82/100 · 开源生态基础设施
TSID 将多任务优先级、运动/力控制、接触约束和关节力矩输出写成任务空间逆动力学问题,并以分离运动学与动力学的求解结构对同一仿真协议中的既有框架比较效率与最优性。随后 Stack-of-Tasks 官方实现将其作为依赖 Pinocchio 的 C++/Python 库持续发布,构成从早期 operational-space/whole-body control 到现代 Kuavo MPC+TSID、接触规划与模型式人形控制的关键中层接口。确认的是论文机制、可安装开源实现及长期工程谱系;不是任何特定人形、四足、轮足、轮臂或灵巧手的真实部署成功率。
arXiv 原始论文、理论、仿真横评与假设 · Stack-of-Tasks 官方 TSID 代码、安装、Python 测试与 BSD-2-Clause · 官方 BSD-2-Clause 许可证 · Pinocchio 官方项目对 TSID 的工程关系说明
confirmed · 84/100 · 开源生态基础设施
ROS 将节点、消息、工具、驱动、传感器、记录、可视化与包分发组织为可组合机器人软件系统,使足式、人形、机械臂、移动底盘、导航、遥操作和实验室部署能在共同的工程接口上积累。它是从论文策略、训练框架到真实机器人控制桥的关键开源基础设施;确认的是系统集成与生态影响,绝不等价于任何控制算法、物理引擎、VLA/WAM、传感器或单一机器人在真机上的性能。
ROS 官方归档中的原作者论文引文与原始链接 · ROS 官方 2009 版本与多计算机导航稳定性记录 · ROS 官方当前文档与发行版支持信息 · ROS 2 官方聚合代码与 Apache-2.0 许可证 · ROS 官方迁移与许可证边界
confirmed · 83/100 · 奠基理论
World Models 将视觉压缩、动作条件潜在动态记忆与小控制器拆为 V-M-C,并明确提出可在模型生成的“梦境”中训练控制器再迁回真实环境。它是今天 WAM、视频世界模型、潜在动态规划与合成回放讨论的历史概念源头,但不是机器人真机或可直接部署的 WAM 方案。
confirmed · 94/100 · 开源生态基础设施
以单目、双目和 RGB-D 的统一开源实现成为机器人视觉定位与建图的长期工程基线,广泛进入移动机器人和人形感知栈。
confirmed · 91/100 · 范式转折
把对抗式动作模仿与深度强化学习结合成可扩展的物理角色技能范式,长期影响人形运动跟踪、重定向和控制奖励设计。
confirmed · 82/100 · 开源生态基础设施
OCS2 将切换系统的连续时间最优控制、SLQ/iLQR/SQP 等求解器、MPC/MRT 实时接口、URDF/Pinocchio 模型和 ROS 通信收敛为可安装的 BSD-3-Clause 工具箱。其源头论文在四足上验证多层优化接触时序与连续控制输入;随后官方实现扩展为腿式、移动操作和轮足等模型式控制的复用基础,处于 TSID/Pinocchio 动力学接口与 Crocoddyl/专用 NMPC-WBC 栈之间。确认的是公开软件与可追溯工程谱系,不将官方示例或下游项目转换成人形、轮臂、轮足或五指手的统一真机成功率。
arXiv 原始四足最优规划与控制论文 · ETH RSL 官方 OCS2 概览、求解器、许可证与相关出版物 · ETH RSL 官方 OCS2 模型、MPC/MRT 与部署接口说明 · leggedrobotics 官方 OCS2 源码、示例、安装与 BSD-3-Clause · 官方 BSD-3-Clause 许可证
candidate · 81/100 · 工程落地
VBC 以特权状态 teacher 到深度/目标掩码 student 的蒸馏结构,把足式底盘速度、机械臂末端与视觉目标耦合为一套两层全身控制,并在 B1+Z1 带臂四足真机上覆盖 14 个物体、地面/箱体/桌面三种高度,声明不使用真实训练数据或真机微调。它是从盲态 locomotion 或单臂视觉抓取走向视觉 legged loco-manipulation 的高价值工程节点;但只达到候选级:平台并非人形/轮足,目标初始化需人工点击,CC BY-NC 源码和未核验外链权重不构成完整开放复现,且没有独立团队同协议实机复现。
arXiv 原始论文 · arXiv 实验 HTML、硬件、控制频率与失败边界 · 作者官方项目页 · 官方代码与 README · 官方仓 CC BY-NC 4.0 许可证
高潜待持续验证 · 2026-01-29 · 尚未授予里程碑
大规模 off-policy 预训练与物理先验世界模型微调同时满足近期、跨领域和社区部分复现三项高权重条件;许可证缺失、微调不稳定和无真机安全证据阻止其成为稳妥默认方案。
观察 · 2026-08-11 · 尚未授予里程碑
TCAM以定制抓手和四腕部视角缩小接触分布,用成功/失败轨迹分析驱动定向补采;官方比赛页确认Track 4第一名,但实现、权重和600条训练episode未开放。
高潜待持续验证 · 2026-08-10 · 尚未授予里程碑
把跨模型经验复用改造成带证书、冻结验证器和拒绝路径的实验控制问题,直接解决自动研究的负迁移;代码可运行,但论文GPU与实机效果尚未被独立复现。
高潜待持续验证 · 2026-07-09 · 尚未授予里程碑
100任务、多手多臂和统一遥操作框架有平台价值;3,180演示与多数本体尚未释放。
高潜待持续验证 · 2026-07-05 · 尚未授予里程碑
三条恶意episode即可让SO-101上的smolVLA在触发条件下完全拒绝服务;真实数据和评测脚本可审计,适合立即加入训练数据来源审查,但只覆盖单任务与单模型。
高潜待持续验证 · 2026-07-10 · 尚未授予里程碑
通过零动作与反事实审计修复latent action捷径,代码和2B制品可查;没有物理闭环且论文训练昂贵。
观察 · 2026-07-13 · 尚未授予里程碑
在造电子皮肤前先用VR交互推导覆盖和taxel密度,5,520条Parquet真实可下载;无LICENSE、只有二值接触且未做实体机器人验证。
高潜待持续验证 · 2026-07-31 · 尚未授予里程碑
单L40S服务10台PiPER,异构任务下Lookahead总吞吐比EDF约高18%;Apache-2.0固定commit含可运行的服务与LIBERO闭包。
高潜待持续验证 · 2026-07-28 · 尚未授予里程碑
2,000小时CC-BY公开数据、3mm轨迹和960次三骨干实机比较,直接挑战遥操作后训练锚点。
高潜待持续验证 · 2026-07-17 · 尚未授予里程碑
AIKIDO把短视界任务空间优化、碰撞代价和第一平滑动作组合成亚毫秒级避碰控制;Apache源码、固定提交与公开容器可查,UR10e有30次实机,但障碍轨迹主要仍来自仿真且缺原始试验日志。
高潜待持续验证 · 2026-07-11 · 尚未授予里程碑
ActiveFly把EQA、观察规划和细粒度控制统一成可运行流水线,真实发布约245GB混合数据、两类权重和ROS客户端;但真实飞行只有案例与390ms时延,论文/发布计数和test切分不完全一致。
观察 · 2026-07-07 · 尚未授予里程碑
将VLA提升到显式3D几何与动力学表征,MetaWorld/RLBench分别提升10.8/11.1个百分点,Franka八任务达到71%;但项目页没有代码、权重或数据快照。
高潜待持续验证 · 2026-07-21 · 尚未授予里程碑
像素空间部分可见轨迹把同一视频模型变成跨本体前向、规划评价和逆向动作接口,并有Franka真实数据配对评价;当前只有Apache薄层代码,权重401、训练数据和渲染工具未开放。
高潜待持续验证 · 2026-07-07 · 尚未授予里程碑
通过时序切分、表征聚类和结构感知选择,在50%数据与50%步数下超过全量训练,代码链完整;但无LICENSE、无冻结选择清单且实机policy未验证。
观察 · 2026-07-18 · 尚未授予里程碑
把世界模型SFT推进到动作探索RL;源码可查但私有预训练与无许可证阻断完整复现。
当前可实践 · 2026-07-17 · 尚未授予里程碑
35任务把理解、物理推理、动作生成和迭代执行放进同一协议;当前公开350 episode与14K宣称不一致,正好暴露开放性审计价值。