论文记录 · 证据边界公开

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

arXiv · 2026-07-14 · 通用或轻量 VLA

论文元数据

作者
Mohan Liu、Zhihao Gu、Xuanyu Chen、Haitian Zhang、Kaimin Mao、Yan Wu、Wei-Yun Yau、Lin Wang
机构
EmPACT Lab, Nanyang Technological University、Institute for Infocomm Research, A*STAR
发布日期精度
研究方向
通用或轻量 VLA
机器人
未关联具体机器人
DOI
未披露
arXiv
2607.12356
引用元数据
0
记录状态
included
质量检查
无自动质量红旗

算力与训练档案 置信 low · 模型 glm-5.3 · 更新 2026-09-01T16:41:33Z

技术标签: 通用或轻量 VLA, 视觉语言动作模型, 3D Gaussian, 语义空间表征, 多视角视觉, 低 token 控制, OOD 泛化

训练算力(显卡)four NVIDIA RTX 5090 GPUs
训练时长未披露
部署推理硬件未披露
显存/内存/CPU 占用未披露
运行效率(Hz)未披露

证据原文: