跳到正文
原文
arXiv · 多模态、视频与世界模型· Duowen Chen·· 4 天前精选AI 评分78

Audible World Models 提出面向 3D 世界的空间感知声音生成框架

Audible World Models: Spatially Aware Sound Generation for 3D Worlds

AI 导读

论文提出 Audible World Models,一种 training-free 框架,可从文本提示构建全景 3D proxy,将声音源锚定到重建几何,并根据听者视点和运动渲染空间音频。对 80 个生成场景的实验显示,该方法在空间一致性上优于文本、视频和全景图条件基线,同时保持有竞争力的语义对齐;论文已被 NeurIPS 2026 接收。

推荐理由

论文将声音源位置、3D 几何与几何声学传播纳入世界状态,为构建随观察者移动而变化且保持空间一致性的多模态世界模型提供了可复用路线。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org