论文记录 · 证据边界公开

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

arXiv v1(ICRA 2026 录用) · 2026-07-12 · 视觉识别

论文元数据

作者
Hao Zheng、Jinyi Huang、Tiantian Zheng、Xun Xu、Tuka Alhanai
机构
机构尚未补齐
发布日期精度
研究方向
视觉识别
机器人
双手装配动作视频域(HA-ViD-VQA/IKEA-ASM-VQA);无机器人本体实验
DOI
未披露
arXiv
2607.10797
引用元数据
0
记录状态
included
质量检查
无自动质量红旗