arXiv · 多模态、视频与世界模型· Shengxiang Ji·· 4 天前精选AI 评分77
LIFT:通过在策略自蒸馏实现大视点变化下的未来布局视频生成
LIFT: Layout-In-Future Video Generation under Large Viewpoint Change via On-Policy Self-Distillation
AI 导读
研究团队提出 LIFT 图像到视频生成框架,用最后一帧布局控制未来视图中应出现的内容及其位置。该方法通过在策略自蒸馏,将密集布局教师的控制能力迁移到最后一帧布局学生,并构建包含大视点变化、相机与时序一致布局标注的 LIFT-Vista 数据集;实验显示其视频质量、未来布局可控性和相机可控性优于其他方法。
推荐理由
论文把最后一帧布局引入大视点变化的视频生成,为未来画面内容与空间位置的联合控制提供了可复用思路。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org