论文记录 · 证据边界公开

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

arXiv v1 (2026-08-10; cs.CV; York University/Huawei Canada) · 2026-08-10 · 视觉识别

论文元数据

作者
Hunter Schofield、Mohammed Elmahgiubi、Mohammad Mahdavian、Richard Shi、Jinjun Shan、Amir Rasouli、Dongfeng Bai
机构
机构尚未补齐
发布日期精度
研究方向
视觉识别
机器人
未关联具体机器人
DOI
未披露
arXiv
2608.10278
引用元数据
0
记录状态
included
质量检查
无自动质量红旗