论文记录 · 证据边界公开

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

arXiv manuscript · 2026-07-03 · 世界模型与动作条件预测

论文元数据

作者
Zelin Zhao、Min Shi、Bo Yuan、Haotian Xue、Jialuo Li、Lama Moukheiber、Humphrey Shi、Yongxin Chen
机构
机构尚未补齐
发布日期精度
研究方向
世界模型与动作条件预测
机器人
Franka Isaac Sim、Language Table recorded robot data
DOI
未披露
arXiv
2607.03461
引用元数据
0
记录状态
included
质量检查
无自动质量红旗

算力与训练档案 置信 low · 模型 glm-5.3 · 更新 2026-09-03T14:12:21Z

本体标签: Franka Isaac Sim, Language Table recorded robot data

技术标签: 世界模型与动作条件预测, VLAW, 统一多模态模型, 动作条件世界模型, Fourier动作表示, 多任务操作

训练算力(显卡)未披露
训练时长未披露
部署推理硬件未披露
显存/内存/CPU 占用未披露
运行效率(Hz)未披露

证据材料里未披露这些数值 —— 宁缺勿假, 不填推测值。