跳到正文
原文
arXiv · 多模态、视频与世界模型· Yu Huang·· 2 天前精选AI 评分79

VTR-Bench:系统评测视频生成中的视觉文本渲染

VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation

AI 导读

研究提出VTR-Bench,用于系统评测视频生成模型在场景文本渲染上的表现。基准包含覆盖五类场景的300个提示词,并通过结合人工对齐的自动化流程分别评估文本保真度及场景、运动要求。对11个模型的实验显示,最佳模型整体词错误率(WER)为0.250,研究还提出由Director agent协调图像与视频生成、视觉评估和迭代筛选的Keyframe-Guided Agentic Framework。

推荐理由

VTR-Bench将视频生成中的文本渲染拆分为可测指标,并用11个模型的结果呈现当前短板,为广告和科学视频的模型评测提供了具体参照。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org