arXiv · 多模态、视频与世界模型· Rui Liu·· 3 天前精选AI 评分77
Align Then Reason 提出多语言唇形同步评判器,提升配音质检效果
Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing
AI 导读
Rui Liu 等提出 Align Then Reason(ATR),用静音视频和候选文本判断配音台词的内容与时序是否匹配。在七语言基准上,ATR 相比对应的 Qwen3.5 SFT 基线,2B、4B 和 9B 推理器的平均 AUC 分别提升 59.4%、50.2% 和 50.8%。
推荐理由
论文把逐帧唇部表征与候选台词的音素单元先做单调对齐,再交给 LLM 联合判断内容和时序,为无配音音频时的配音审片提供了可复用流程。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org