arXiv · 多模态、视频与世界模型· Yu Huang·· 2 天前精选AI 评分79
VTR-Bench:系统评测视频生成中的视觉文本渲染
VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation
AI 导读
研究提出VTR-Bench,用于系统评测视频生成模型在场景文本渲染上的表现。基准包含覆盖五类场景的300个提示词,并通过结合人工对齐的自动化流程分别评估文本保真度及场景、运动要求。对11个模型的实验显示,最佳模型整体词错误率(WER)为0.250,研究还提出由Director agent协调图像与视频生成、视觉评估和迭代筛选的Keyframe-Guided Agentic Framework。
推荐理由
VTR-Bench将视频生成中的文本渲染拆分为可测指标,并用11个模型的结果呈现当前短板,为广告和科学视频的模型评测提供了具体参照。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org