跳到正文
原文
arXiv · 多模态、视频与世界模型· Zhixi Zhu·· 3 天前AI 评分68

多模态 LLM 视频标注的有效性与成本评估

Paying for Too Many Tokens? Valid and Cost-Efficient Multimodal LLM Annotation with Simple Heuristics

AI 导读

研究者系统评估短视频 VLM 标注中的采样、图像网格和单模态等启发式方法,比较分类准确率、下游推断有效性与每视频 token 成本。结果显示,准确率最高的配置可能导出错误结论,文本单模态也可能取得较强表现;通过简单镜头切换检测构建的单个 2×8 图像网格,其 κ 值与全视频理解相差不超过 .05,token 成本约为后者的 15%。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org