arXiv · 多模态、视频与世界模型· Fangyu Lin·· 3 天前精选AI 评分76
Radian:用表征空间对抗蒸馏增强自回归视频生成
Enhancing Autoregressive Video Generation via Representation Adversarial Distillation
AI 导读
论文提出 Radian,通过冻结视觉基础模型提取多层视觉表征,并对自回归生成结果施加真实视频帧对抗监督,以改善细节退化、结构漂移和运动不稳定。基于 Wan2.1-1.3B 的实验显示,四步生成达到 VBench Total 0.8444 和 VideoAlign Total 0.8033,VBench-Long 从 0.7805 提升至 0.8041,且使用更少去噪步数。
推荐理由
论文将视觉基础模型表征空间的对抗监督引入蒸馏,可为降低自回归视频生成中的时序误差传播提供一种训练思路。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org