跳到正文
原文
arXiv · 多模态、视频与世界模型· Huanran Hu·· 2 天前精选AI 评分80

DiVid 诊断视频生成模型的分维度多样性坍缩

DiVid: Diagnosing Dimension-Specific Diversity Collapse in Video Generation Models

AI 导读

论文提出 DiVid,将视频生成多样性拆分为语义、风格、主体、场景、运动和摄影机六个维度。对代表性视频生成模型的系统评测显示,模型可能拥有较高全局多样性分数,却在运动和摄影机等因素上坍缩;这些差异在过滤不忠实生成后仍然存在。受控提示词实验进一步归纳出默认模式收敛和实现缺口两类瓶颈,框架计划发布以支持后续研究。

推荐理由

DiVid将视频多样性拆成六个维度,并区分默认模式收敛与实现缺口,可为评测和训练目标设计提供更细的定位框架。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org