arXiv · 多模态、视频与世界模型· Byoungwoo Park·· 4 天前精选AI 评分80
LongTake:学习在长时域视频生成中维持动态
LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation
AI 导读
LongTake提出由 Long-Horizon Teacher Forcing 和 DMD 构成的两阶段训练流程,让自回归视频扩散模型基于长真实视频前缀预测后续帧,以维持长时域生成中的场景动态和视觉质量。在相同的五秒 DMD 训练设置下,该初始化在30秒生成中以相近美学质量获得更高动态程度;Hybrid DMD 在30秒和60秒自回滚评测中取得被评估方法中的最高动态程度。
推荐理由
Long-Horizon Teacher Forcing 将长视频真实前缀引入训练,结合 Hybrid DMD,为提升长时域生成的动态持续性和画质提供了可复用的训练思路。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org