论文记录 · 证据边界公开

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

arXiv technical report · 2026-08-07 · 视觉识别

论文元数据

作者
Ying Chen、Weizhen Li、Zhe Hu、Zhenjiang Li、Rui Jiang、Zhifeng Gu、Lihuang Fang、Jiangping Liu、Lei Yi、Jie Chen
机构
XPENG Robotics
发布日期精度
研究方向
视觉识别
机器人
12 actor GPUs for consolidation、AI2-THOR、EmbodiedBench ALFRED、EmbodiedBench Habitat、ProcTHOR
DOI
未披露
arXiv
2608.06756
引用元数据
0
记录状态
included
质量检查
无自动质量红旗