arXiv · 多模态、视频与世界模型· Xindi Yang·· 2 天前精选AI 评分84
Oneira:从开放式生成走向视频世界模型的开放世界交互
Oneira: From Open-Ended Generation to Open-World Interaction in Video World Models
AI 导读
Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。
推荐理由
论文将视频世界模型的交互能力拆分为开放世界交互与持久状态,为评估生成环境能否支持长期可控探索提供了具体框架。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org