论文记录 · 证据边界公开

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

ACM Multimedia 2026 / arXiv preprint · 2026-03-26 · 通用或轻量 VLA

论文元数据

作者
Yang Liu、Pengxiang Ding、Tengyue Jiang、Xudong Wang、Wenxuan Song、Minghui Lin、Han Zhao、Hongyin Zhang、Zifeng Zhuang、Wei Zhao、Siteng Huang、Jinkui Shi、Donglin Wang
机构
Westlake University、Zhejiang University、East China University of Science and Technology、Huawei Technologies、The Hong Kong University of Science and Technology (Guangzhou)
发布日期精度
研究方向
通用或轻量 VLA
机器人
AgileX PiPER 6-DoF arm、DX200-2.8mm wrist camera、Intel RealSense D435
DOI
10.1145/3767308.3836069
arXiv
2603.25406
引用元数据
0
记录状态
included
质量检查
无自动质量红旗