跳到正文

#多模态

今日 0 条
10月2日周五
  1. arXiv · 多模态、视频与世界模型72

    《Walking the Embedding Space》研究多模态 RAG 的数据存储提取攻击

    论文提出一种针对返回图像的多模态 RAG 系统的自适应黑盒数据提取攻击,将恶意指令嵌入用户输入图像,并通过检索反馈探索嵌入空间。在单次 2500 次查询中,该方法最多重构 611 张放射学图像、566 份文档扫描件和 416 张通用图像,获得的数据存储项数量最高为非自适应基线的 5.6 倍。

  2. arXiv · 多模态、视频与世界模型59

    TouchTherm 构建支持触觉与热渲染的多模态物体数字孪生

    论文提出 TouchTherm,用真实物体构建可用于视觉、触觉与热渲染的多模态数字孪生资产。系统结合结构光扫描、多视角法线图和同步红外视频,分别重建微观表面高度场与受物理约束的动态热场。在 20 个物体上,30 s 和 45 s 的留出表面温度 MAE 分别为 0.465 °C 和 0.592 °C,生成的资产还支持触觉观测下的合成到真实物体识别与手套式 VR 热反馈。

  3. arXiv · 多模态、视频与世界模型68

    ExpertLens 通过多模态 MoE 领域专家实现高效适配

    论文提出数据无关方法 ExpertLens,从预训练多模态 MoE 的路由权重中识别领域专长专家,并选择性微调目标领域相关专家。在数学、医疗和遥感任务上,该方法仅更新 21.7 - 47.0% 的模型参数,平均训练速度提升 4.0x,效果达到或超过全量微调。ExpertLens 在适配性能和训练效率上均优于 LoRA。

  4. arXiv · 多模态、视频与世界模型54

    ScaffoldM3C:用于生成式稳定建造规划的多模态 Sequential Monte Carlo 框架

    论文提出 ScaffoldM3C,一种用于稳定积木式建造的轻量级多模态自回归模型,结合候选区块生成与 Sequential Monte Carlo,同时规划多条装配序列。该模型规模仅为竞品的 1/4,推理速度提升 5x 至 20x,在建造质量相当的情况下实现更高的整体稳定性,并通过仿真和真实机器人装配进行展示。

  5. arXiv · 多模态、视频与世界模型70

    Gestalt:提出基于多模态交互的大型多模态模型

    Zequn Yang 等作者提出 Gestalt,一种围绕多模态交互构建的大型多模态模型。该模型采用多模态交互金字塔、统一离散扩散框架和通过可学习交互 token 促进跨模态交换的架构,论文称其在图像生成、多模态理解和纯文本评测中提升了跨模态融合,同时保留模态特有信息。

  6. arXiv · 多模态、视频与世界模型81

    Soundwich:用分层可控音频生成与视频同步

    Soundwich 提出一种无需训练的框架,将冻结的联合音视频 flow-matching 模型转化为可生成多条同步、可独立编辑音频轨道的系统。框架通过共享场景表示传递全局视听上下文,并让每条音频轨道与对应视觉来源进行跨模态交互,以保持声音与视频协调。论文称实验和人工评估显示其在时间控制、来源分离和自然度方面有所改善,生成的音频轨道可独立调整时序、静音、替换或重混。

    推荐理由:论文展示了如何在不训练新模型的情况下,把单一混音拆成可独立编辑的同步音频轨道,为音视频生成的后期重混与来源级控制提供参考。

  7. arXiv · 多模态、视频与世界模型72

    论文分析真实场景中的多模态 LLM 图像交互任务

    一项研究分析了40,000多条去标识化的 Microsoft Copilot 图像上传对话,并用涵盖感知、认知和生成的十类能力刻画用户任务。研究发现,多数图像任务涉及多种能力,且多模态使用覆盖的任务空间比纯文本交互更广。对照253个基准后,研究指出现有评测更集中于感知和固定答案推理,而文本、代码与数据生成等常见工作流覆盖较少;研究还在独立的 ChatGPT 数据集上验证了分类框架和发现。

  8. arXiv · 多模态、视频与世界模型68

    多模态 LLM 视频标注的有效性与成本评估

    研究者系统评估短视频 VLM 标注中的采样、图像网格和单模态等启发式方法,比较分类准确率、下游推断有效性与每视频 token 成本。结果显示,准确率最高的配置可能导出错误结论,文本单模态也可能取得较强表现;通过简单镜头切换检测构建的单个 2×8 图像网格,其 κ 值与全视频理解相差不超过 .05,token 成本约为后者的 15%。

  9. arXiv · 多模态、视频与世界模型77

    Align Then Reason 提出多语言唇形同步评判器,提升配音质检效果

    Rui Liu 等提出 Align Then Reason(ATR),用静音视频和候选文本判断配音台词的内容与时序是否匹配。在七语言基准上,ATR 相比对应的 Qwen3.5 SFT 基线,2B、4B 和 9B 推理器的平均 AUC 分别提升 59.4%、50.2% 和 50.8%。

    推荐理由:论文把逐帧唇部表征与候选台词的音素单元先做单调对齐,再交给 LLM 联合判断内容和时序,为无配音音频时的配音审片提供了可复用流程。

  10. arXiv · 多模态、视频与世界模型66

    CANOPY 提出面向多模态 RAG 的自适应粒度证据压缩框架

    CANOPY 提出一种面向多模态 RAG 的自适应粒度证据压缩框架,将文本、表格、图像和视频组织为层级结构,并按查询选择不同范围的证据区域。在包含 33M 个异构项目的语料库和五个问答基准上,CANOPY 的平均答案准确率高于评测中的检索基线;在 unrouted Qwen3-VL-8B-Instruct 设置中,压缩使读者输入证据 token 减少 14.2-27.7%,同时保持相近答案准确率。

  11. arXiv · 多模态、视频与世界模型77

    FutureWorlds 提出从替代未来学习机器人世界模型的方法

    FutureWorlds 提出一种从替代未来学习机器人世界模型的框架,结合多样化束搜索、候选专属记忆和 MemSPO 优化预测。在 RT-1、BridgeV2 和 RoboCasa 上,32 帧预测的 LPIPS 相比各自最强基线分别降低 14.78%、20.84% 和 9.12%。

    推荐理由:论文将候选未来的多样性、历史维护与相对质量学习放进同一训练框架,为机器人视频预测中的时序一致性和动作结果建模提供了可复用思路。

  12. arXiv · 多模态、视频与世界模型65

    ReCast:面向固定接口多模态推理的关系保持保护框架

    论文提出 ReCast,一种面向固定媒体接口的智能体框架,通过替换源内容并保留任务相关关系来保护多模态推理输入。在 4,000 个 ChartQA 和 NMSQA 留出样本上,ReCast 达到 75.10% 准确率,保留未保护远程推理准确率的 92.43%;模型审计在 7.95% 的求解请求中标记出源内容泄露。

  13. arXiv · 多模态、视频与世界模型72

    MMVistaReason提出开放数据后训练配方,提升多模态推理

    MMVistaReason提出一种面向多模态推理的开放数据后训练配方,结合分析型与真实世界推理数据、难度感知教师蒸馏、轨迹筛选和多教师在线蒸馏。该方法构建了MVR-SFT-528K与MVR-RL-63K,在15项多模态基准上,MVR-4B平均得分72.8,使用样本比MMFineReason少约70%;扩展到9B后平均得分达到74.4。

  14. The Decoder76

    Tavus推出 Griffin 人类交互模型,48%受试者将其误认真人

    Tavus推出 Griffin,这是一种面向实时面对面交流的 Human Interaction Model;Tavus称其研究中有48%的参与者在一分钟视频通话后相信 Griffin 是真人。

    推荐理由:材料提供了 Griffin 与真人及上一代 AI 的对照数据,并交代了研究预览的开放范围和安全前提,便于判断其当前成熟度。

10月1日周四
  1. arXiv · 多模态、视频与世界模型73

    ShieldCLIP:面向多模态基础模型的选择性安全对齐框架

    论文提出 ShieldCLIP,根据每个模态的实际安全状态进行选择性安全对齐,在减少有害输出的同时保留原始嵌入空间的实用性。作者构建了包含 195k 个四元组、覆盖 578 个概念和 28 个类别的 ViSUv2 数据集,并在跨模态检索、Stable Diffusion v1.4、SDXL 和 LLaVA 任务上进行评估。

  2. arXiv · 多模态、视频与世界模型55

    球面插值实现向后兼容的多模态表示

    这篇研究提出在正交对齐后的新旧查询表示之间进行球面测地线插值,以在不重建图库嵌入的情况下改善跨模态检索。多组基准和模型族实验显示,该方法在多数评测设置中优于单独的正交对齐,并分析了有利的内部插值点为何会出现。论文已被 NeurIPS 2026 接收,代码已提供。

  3. arXiv · 多模态、视频与世界模型77

    WorldAuditBench:用多模态智能体审计交互式3D世界

    WorldAuditBench提出一个交互式3D世界审计基准,包含基于Unreal Engine 5构建的13个环境和213项异常任务,覆盖五类异常。论文在固定探索预算下评估五个前沿模型,采用VLA探索后由VLM识别异常,以及端到端VLM智能体两种范式,成功率为6.6%至42.3%,低于人类的83.4%。

    推荐理由:WorldAuditBench将3D世界审计拆为探索行动与视觉推理,并用统一预算比较两种范式,可用于评估多模态智能体的证据搜集能力。

  4. arXiv · 多模态、视频与世界模型80

    Multimodal Flow在嵌入空间统一建模语言与视觉

    Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。

    推荐理由:该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。

  5. 可灵 · 模型与创作实践89

    可灵 Kling 4.0 进入早期访问,支持原生 30 秒生成与多参考控制

    可灵 Kling 4.0 进入早期访问,支持单次生成最长 30 秒视频、最多 15 个参考素材和最多 10 个关键帧。Kling 4.0 Flash 将于 9 月 28 日向 Ultra Yearly 订阅者开放,Kling 4.0 计划在 10 月扩大开放。新版本还加入音画同步、21:9 超宽画幅和更精细的视频编辑,10-bit HDR 输出将在后续提供。

    推荐理由:这次更新把长视频生成、多参考控制和时间线工作流放在同一升级中,适合比较连续叙事与商品广告制作的可控性。

  6. arXiv · 多模态、视频与世界模型74

    梯度冲突能预测理解与生成的权衡吗?对统一多模态模型冲突指标有效性的受控审计

    这项研究在受控测试床 GRIDUMM 中审计梯度冲突指标能否预测统一多模态模型的理解与生成权衡。在 63 个配置和 372 个测量检查点中,没有方向性冲突指标达到绝对 Spearman 相关系数 0.3 且置信区间排除零;单调压低冲突也未改变权衡结果。研究发现,功能干扰指标优于方向性冲突指标,训练损失则能较强地追踪该权衡,作者计划在论文接收后公开审计代码。

  7. arXiv · 多模态、视频与世界模型79

    统一多模态模型中的位置级梯度冲突与位置感知调制

    该研究提出位置级干扰图,用于定位统一多模态模型中图像理解与自回归图像生成之间的梯度冲突。在 Show-o 和 Janus-Pro 上,视觉 token 位置可解释较大比例的冲突差异,序列前四分之一的平均梯度余弦为 -0.18,末四分之一为 -0.02。

    推荐理由:该研究为统一多模态模型理解与生成目标的梯度冲突提供了位置级诊断,并给出无需改架构的调制方法。

  8. arXiv · 多模态、视频与世界模型54

    MM-FinEval:面向真实世界金融预测的多任务多模态基准

    MM-FinEval 是一个用于评估多模态大语言模型金融预测能力的基准,涵盖 2019 至 2022 年的 2,045 个 S&P 500 财报电话会,并设置 12 个金融任务标签。每条输入包含逐字稿、电话会演示文稿和完整音频,论文进一步比较了 19 个基线模型。结果显示,处理三种模态的小型 Any-to-Any 模型表现较强,部分情况下优于仅处理两种模态的大型专有模型。

  9. arXiv · 多模态、视频与世界模型79

    SceneJail 利用视频场景上下文攻击多模态大语言模型

    SceneJail 提出一种自适应黑盒越狱框架,通过构造兼容场景并搜索场景相关提示词,攻击视频多模态大语言模型。该方法在包含八个 Video-MLLMs 的评测中,SceneJail-F 的平均攻击成功率最高达 91.5%,较最强基线高 29.1 个百分点。将有害查询分布到连续帧的 SceneJail-S 在严格图像过滤下仍达到 72.3% 的攻击成功率。

    推荐理由:论文将视频场景从有害查询的载体提升为攻击面,为 Video-MLLM 安全评测和防御设计提供了可复用的测试思路。

  10. arXiv · 多模态、视频与世界模型71

    S-OPD:仅增强教师监督足以解锁多模态 On-Policy Distillation 的学生侧学习吗?

    S-OPD 提出一种多模态 On-Policy Distillation 框架,通过 Teacher-calibrated Policy Contrast 和 Policy Agreement 强化学生对视觉证据的依赖及抗噪感知。该方法无需额外数据标注、模型参数或推理操作,覆盖八个基准测试,LogicVista 最高提升 4.25 分,并可与教师侧监督方法结合获得进一步提升。

  11. arXiv · 多模态、视频与世界模型66

    TPAE:通过 Token 级视觉落地优势估计强化多模态推理

    论文提出 Token 级感知落地优势估计(TPAE),利用 token 的视觉依赖与预测熵,为多模态推理生成细粒度强化学习监督信号。分析显示,正确推理链在视觉落地增强时熵下降更明显,关键 token 也是正确推理链联合分布中的统计异常点。TPAE 在七个基准上持续优于强基线,并带来更稳定、高效的优化。

9月30日周三
  1. 可灵 · 模型与创作实践81

    Kling 4.0 与 3.0 有哪些不同

    Kling 4.0将于2026年10月正式发布,原生视频生成时长从3–15秒扩展至3–30秒,并支持最多10个关键帧。新版本还支持最多15个组合参考资产、10-bit HDR、双声道立体声和定向多模态视频编辑。Kling 4.0 Flash已于9月28日向有限用户开放提前体验。

    推荐理由:这篇对比把时长、关键帧、参考资产和视频编辑放在同一框架中,便于按项目复杂度选择 Kling 3.0 或 4.0。

  2. 可灵 · 模型与创作实践83

    Kling 4.0 AI 视频创作完整指南:多模态参考与30秒生成

    Kling 4.0完整模型计划于2026年10月发布,新创作体验自9月28日起向有限用户逐步开放早期访问。模型支持3至30秒原生视频生成、最多10个关键帧,以及最多15个组合参考素材,并提升运动稳定性、角色与商品一致性、音画同步和视频编辑能力。

    推荐理由:文章梳理了从多模态参考、关键帧到时间线审片的完整链路,可用于规划商品广告和短叙事视频的生成与修订流程。

  3. arXiv · 多模态、视频与世界模型88

    HelixWorld:实时交互式音视频世界模型

    论文提出HelixWorld,使视觉场景与基于相机的空间立体声音在用户交互下共同演化。研究通过6-DoF相机轨迹和用户动作进行训练,并将模型蒸馏为低延迟流式模型,在单GPU上以24 FPS生成无漂移的音视频轨迹。论文还提出空间声学一致性与HelixBench,用于评估声音场是否跟随动态视点变化。

    推荐理由:论文将空间立体声纳入实时世界模型,并以24 FPS单GPU交互和HelixBench展示音画协同建模与评测路径。

9月28日周一
9月24日周四
9月23日周三
9月3日周四