跳到正文
原文
arXiv · 多模态、视频与世界模型· Yiwen Zhang·· 2 天前精选AI 评分79

MosaiChunk:用时空记忆拼接提升自回归视频生成的一致性

MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation

AI 导读

MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。

推荐理由

MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org