论文记录 · 证据边界公开

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

arXiv technical report (v2) · 2026-04-14 · 通用或轻量 VLA

论文元数据

作者
Zijian Song、Qichang Li、Jiawei Zhou、Zhenlong Yuan、Tianshui Chen、Liang Lin、Guangrun Wang
机构
Sun Yat-sen University、X-Era AI Lab、LongCat, Meituan、Guangdong University of Technology
发布日期精度
研究方向
通用或轻量 VLA
机器人
Franka Panda 7-DoF with parallel-jaw gripper
DOI
10.48550/arXiv.2604.12908
arXiv
2604.12908
引用元数据
0
记录状态
included
质量检查
无自动质量红旗