论文记录 · 证据边界公开

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

arXiv · 2026-07-08 · 空间感知与导航

论文元数据

作者
Peter Bohm、Saimunur Rahman、Abdelwahed Khamis、Sagun Man Singh Shrestha、Chris McCool、Peyman Moghadam
机构
机构尚未补齐
发布日期精度
研究方向
空间感知与导航
机器人
未关联具体机器人
DOI
未披露
arXiv
2607.06882
引用元数据
0
记录状态
included
质量检查
无自动质量红旗

算力与训练档案 置信 medium · 模型 glm-5.3 · 更新 2026-09-01T06:44:49Z

技术标签: 空间感知与导航, 视觉导航, 离散航点token, 冻结MLLM, LoRA, 低数据训练, Spot, zero-shot导航

训练算力(显卡)A100/A6000
训练时长8.7-hour open corpus
部署推理硬件Jetson Thor/Jetson Orin
显存/内存/CPU 占用未披露
运行效率(Hz)未披露

证据原文: