论文记录 · 证据边界公开

ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model

Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing · 2025-11-04 · 通用或轻量 VLA

论文元数据

作者
Zhongyi Zhou、Yichen Zhu、Minjie Zhu、Junjie Wen、Ning Liu、Zhiyuan Xu、Weibin Meng、Ran Cheng、Yaxin Peng、Chaomin Shen、Feifei Feng、Yi Xu
机构
East China Normal University、Midea Group、Shanghai University、Beijing Innovation Center of Humanoid Robotics、Tsinghua University
发布日期精度
研究方向
通用或轻量 VLA
机器人
Franka Emika 7-DoF arm、Robotiq gripper、ZED Mini wrist camera、two ZED 2 cameras
DOI
10.18653/v1/2025.emnlp-main.273
arXiv
2502.14420
引用元数据
6
记录状态
included
质量检查
无自动质量红旗

算力与训练档案 置信 medium · 模型 glm-5.3 · 更新 2026-09-01T05:34:22Z

本体标签: Franka Emika 7-DoF arm, Robotiq gripper, ZED Mini wrist camera, two ZED 2 cameras

技术标签: 通用或轻量 VLA, 视觉语言动作, 多任务/多头, 混合专家, 视觉问答, 长程操作, 真机操作, 标准泛化评测

训练算力(显卡)未披露
训练时长320 GPU-hours
部署推理硬件未披露
显存/内存/CPU 占用未披露
运行效率(Hz)未披露

证据原文: