arXiv · 多模态、视频与世界模型· Zhuo Ning·· 3 天前精选AI 评分81
Soundwich:用分层可控音频生成与视频同步
Soundwich: Video Generation with Layered and Controllable Audio
AI 导读
Soundwich 提出一种无需训练的框架,将冻结的联合音视频 flow-matching 模型转化为可生成多条同步、可独立编辑音频轨道的系统。框架通过共享场景表示传递全局视听上下文,并让每条音频轨道与对应视觉来源进行跨模态交互,以保持声音与视频协调。论文称实验和人工评估显示其在时间控制、来源分离和自然度方面有所改善,生成的音频轨道可独立调整时序、静音、替换或重混。
推荐理由
论文展示了如何在不训练新模型的情况下,把单一混音拆成可独立编辑的同步音频轨道,为音视频生成的后期重混与来源级控制提供参考。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org