arXiv · 多模态、视频与世界模型· Juekai Lin·· 2 天前AI 评分72
MMVistaReason提出开放数据后训练配方,提升多模态推理
MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning
AI 导读
MMVistaReason提出一种面向多模态推理的开放数据后训练配方,结合分析型与真实世界推理数据、难度感知教师蒸馏、轨迹筛选和多教师在线蒸馏。该方法构建了MVR-SFT-528K与MVR-RL-63K,在15项多模态基准上,MVR-4B平均得分72.8,使用样本比MMFineReason少约70%;扩展到9B后平均得分达到74.4。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org