跳到正文
原文
arXiv · 多模态、视频与世界模型· Byoungwoo Park·· 4 天前精选AI 评分80

LongTake:学习在长时域视频生成中维持动态

LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation

AI 导读

LongTake提出由 Long-Horizon Teacher Forcing 和 DMD 构成的两阶段训练流程,让自回归视频扩散模型基于长真实视频前缀预测后续帧,以维持长时域生成中的场景动态和视觉质量。在相同的五秒 DMD 训练设置下,该初始化在30秒生成中以相近美学质量获得更高动态程度;Hybrid DMD 在30秒和60秒自回滚评测中取得被评估方法中的最高动态程度。

推荐理由

Long-Horizon Teacher Forcing 将长视频真实前缀引入训练,结合 Hybrid DMD,为提升长时域生成的动态持续性和画质提供了可复用的训练思路。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org