arXiv · 多模态、视频与世界模型· Yiwen Zhang·· 2 天前精选AI 评分79
MosaiChunk:用时空记忆拼接提升自回归视频生成的一致性
MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
AI 导读
MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。
推荐理由
MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org