论文元数据
- 作者
- Seonghyeon Ye、Yunhao Ge、Kaiyuan Zheng、Shenyuan Gao、Sihyun Yu、George Kurian、Suneel Indupuru、You Liang Tan、Chuning Zhu、Jiannan Xiang、Ayaan Malik、Kyungmin Lee、William Liang、Nadun Ranawaka、Jiasheng Gu、Yinzhen Xu、Guanzhi Wang、Fengyuan Hu、Avnish Narayan、Johan Bjorck、Jing Wang、Gwanghyun Kim、Dantong Niu、Ruijie Zheng、Yuqi Xie、Jimmy Wu、Qi Wang、Ryan Julian、Danfei Xu、Yilun Du、Yevgen Chebotar、Scott Reed、Jan Kautz、Yuke Zhu、Linxi "Jim" Fan、Joel Jang
- 机构
- NVIDIA
- 发布日期精度
- 日
- 研究方向
- 视觉识别
- 机器人
- AgiBot G1 mobile bimanual manipulator、Franka single-arm robot、YAM robot、human egocentric video
- DOI
- 10.48550/arXiv.2602.15922
- arXiv
- 2602.15922
- 引用元数据
- 0
- 记录状态
- included
- 质量检查
- 无自动质量红旗
算力与训练档案 置信 medium · 模型 glm-5.3 · 更新 2026-09-01T07:31:25Z
本体标签: AgiBot G1 mobile bimanual manipulator, Franka single-arm robot, YAM robot, human egocentric video
技术标签: 视觉识别, 世界模型与动作条件预测, 视觉语言动作模型, 人形真机, 跨本体, 主流技术2.0, 可能成为新主流
| 训练算力(显卡) | 未披露 |
| 训练时长 | 未披露 |
| 部署推理硬件 | 未披露 |
| 显存/内存/CPU 占用 | 未披露 |
| 运行效率(Hz) | 7Hz |
证据原文:
- we enable a 14B autoregressive video diffusion model to perform real-time closed-loop control at 7Hz
- 官方测试至少2张GPU,GB200或H100;14B模型,公开说明H100约3秒/动作块、GB200约0.6秒,论文7Hz/150ms依赖2张GB200和Flash优化。