arXiv · 多模态、视频与世界模型· Haocun Ye·· 2 天前精选AI 评分83
多模态 RL 如何学会看:Same Reward, Different Skills 研究视觉学习信号
Same Reward, Different Skills: When Multimodal RL Learns to Look
AI 导读
论文研究发现,即使训练时不使用视觉信息,模型在测试时仍能恢复部分真实图像带来的能力增益,但持续使用真实图像训练可能削弱 grounding。作者提出 visual resolvability 设计规则,并在反事实坐标场景中用 GRPO 训练 7B 模型,使目标发现准确率从 0.425 提升至 0.875。
推荐理由
论文提出视觉可解性这一设计规则,并用对照实验区分图像出现在提示中与视觉证据真正进入学习信号的差异。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org