跳到正文
原文
arXiv · 多模态、视频与世界模型· Chuyao Fu·· 3 天前AI 评分67

Token-World 提出面向机器人操作的 VLM Token 空间世界建模方法

Token-World: World Modeling in Vision-Language Model Token Space for Robot Manipulation

AI 导读

Token-World 面向视觉语言动作(VLA)系统,将 VLM 视觉特征压缩为紧凑 token 状态,在该空间建模动作条件下的未来动态,并映射回策略使用的表示。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org