跳到正文

#论文/研究

今日 1 条
今天10月3日周六
10月2日周五
  1. arXiv · 多模态、视频与世界模型66

    PRISM:用范畴论测量和优化多模态类比

    论文提出 PRISM(Pullback Refinement via Interpretable Structural Mapping),用基于范畴论的显式关系映射和 pullback score 衡量多模态类比的关系对齐。在 AnaloBench 上,仅依据 pullback score 选择正确类比的准确率为 82.5%;迭代修正也提升了视觉隐喻的一致性与恰当性,但可能偏向视觉更拥挤的构图。

  2. arXiv · 多模态、视频与世界模型79

    VTR-Bench:系统评测视频生成中的视觉文本渲染

    研究提出VTR-Bench,用于系统评测视频生成模型在场景文本渲染上的表现。基准包含覆盖五类场景的300个提示词,并通过结合人工对齐的自动化流程分别评估文本保真度及场景、运动要求。对11个模型的实验显示,最佳模型整体词错误率(WER)为0.250,研究还提出由Director agent协调图像与视频生成、视觉评估和迭代筛选的Keyframe-Guided Agentic Framework。

    推荐理由:VTR-Bench将视频生成中的文本渲染拆分为可测指标,并用11个模型的结果呈现当前短板,为广告和科学视频的模型评测提供了具体参照。

  3. arXiv · 多模态、视频与世界模型84

    Oneira:从开放式生成走向视频世界模型的开放世界交互

    Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。

    推荐理由:论文将视频世界模型的交互能力拆分为开放世界交互与持久状态,为评估生成环境能否支持长期可控探索提供了具体框架。

  4. arXiv · 多模态、视频与世界模型80

    DiVid 诊断视频生成模型的分维度多样性坍缩

    论文提出 DiVid,将视频生成多样性拆分为语义、风格、主体、场景、运动和摄影机六个维度。对代表性视频生成模型的系统评测显示,模型可能拥有较高全局多样性分数,却在运动和摄影机等因素上坍缩;这些差异在过滤不忠实生成后仍然存在。受控提示词实验进一步归纳出默认模式收敛和实现缺口两类瓶颈,框架计划发布以支持后续研究。

    推荐理由:DiVid将视频多样性拆成六个维度,并区分默认模式收敛与实现缺口,可为评测和训练目标设计提供更细的定位框架。

  5. arXiv · 多模态、视频与世界模型61

    时间序列世界模型中预测精度与机制一致性的分歧

    该论文形式化并基准测试时间序列世界模型,发现预测误差与模型对改变后行动的机制一致性可能明显分离。基准涵盖八个公开数据集、七种骨干网络和五个随机种子;冻结潜在预测空间使平均 MAE 降低 9.9%,门控输出融合较输入拼接降低 12.7%。方向监督可在不改变 MAE 的情况下提升受惩罚机制上的一致性。

  6. arXiv · 多模态、视频与世界模型72

    《Walking the Embedding Space》研究多模态 RAG 的数据存储提取攻击

    论文提出一种针对返回图像的多模态 RAG 系统的自适应黑盒数据提取攻击,将恶意指令嵌入用户输入图像,并通过检索反馈探索嵌入空间。在单次 2500 次查询中,该方法最多重构 611 张放射学图像、566 份文档扫描件和 416 张通用图像,获得的数据存储项数量最高为非自适应基线的 5.6 倍。

  7. arXiv · 多模态、视频与世界模型83

    多模态 RL 如何学会看:Same Reward, Different Skills 研究视觉学习信号

    论文研究发现,即使训练时不使用视觉信息,模型在测试时仍能恢复部分真实图像带来的能力增益,但持续使用真实图像训练可能削弱 grounding。作者提出 visual resolvability 设计规则,并在反事实坐标场景中用 GRPO 训练 7B 模型,使目标发现准确率从 0.425 提升至 0.875。

    推荐理由:论文提出视觉可解性这一设计规则,并用对照实验区分图像出现在提示中与视觉证据真正进入学习信号的差异。

  8. arXiv · 多模态、视频与世界模型59

    TouchTherm 构建支持触觉与热渲染的多模态物体数字孪生

    论文提出 TouchTherm,用真实物体构建可用于视觉、触觉与热渲染的多模态数字孪生资产。系统结合结构光扫描、多视角法线图和同步红外视频,分别重建微观表面高度场与受物理约束的动态热场。在 20 个物体上,30 s 和 45 s 的留出表面温度 MAE 分别为 0.465 °C 和 0.592 °C,生成的资产还支持触觉观测下的合成到真实物体识别与手套式 VR 热反馈。

  9. arXiv · 多模态、视频与世界模型68

    ExpertLens 通过多模态 MoE 领域专家实现高效适配

    论文提出数据无关方法 ExpertLens,从预训练多模态 MoE 的路由权重中识别领域专长专家,并选择性微调目标领域相关专家。在数学、医疗和遥感任务上,该方法仅更新 21.7 - 47.0% 的模型参数,平均训练速度提升 4.0x,效果达到或超过全量微调。ExpertLens 在适配性能和训练效率上均优于 LoRA。

  10. arXiv · 多模态、视频与世界模型79

    MosaiChunk:用时空记忆拼接提升自回归视频生成的一致性

    MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。

    推荐理由:MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。

  11. arXiv · 多模态、视频与世界模型85

    4Director:用刚性 3D 几何控制视频世界模型

    论文提出4Director,一种以显式4D场景表示控制相机和物体运动的视频世界模型。它为每个物体重建规范网格,并为每帧指定刚性变换,再通过Motion Adapter生成视角一致的外观、光照和非刚性动态。

    推荐理由:论文将刚性3D几何、视频生成和身份保持评测结合,为可控视频世界模型的设计与比较提供了具体参考。

  12. arXiv · 多模态、视频与世界模型83

    World Observer 通过联合演员与观察者生成实现持久世界建模

    论文提出 World Observer,通过联合生成面向智能体视角的演员和观察选定区域的全景观察者,让离开演员视野的物体继续演化并在重新进入时恢复更新后的状态。该方法基于共享全景源进行几何对应,并引入高分辨率透视参考的 Observer Sink,同时提出用于评估视野外演化的世界空间指标和覆盖真实、合成场景的基准。

    推荐理由:论文将视角外物体的持续演化转化为可观测、可评测的问题,为世界模型的空间覆盖与状态保持提供了具体设计和基准。

  13. arXiv · 多模态、视频与世界模型82

    HiPhy:通过层级对齐实现符合物理规律的多原理视频生成

    HiPhy提出一种基于强化学习的层级物理对齐框架,使视频生成同时遵循多个物理原理并保持场景的物理与语义一致性。研究构建了包含 50K 提示词的数据集和 MultiPhyBench 基准,实验显示 HiPhy 在多个基准上显著优于既有方法,涉及多种并发物理原理的场景提升最大。

    推荐理由:论文将物理规律拆分为局部动态与全局场景一致性目标,并用 MultiPhyBench 支持多物理原理视频生成的比较评估。

  14. arXiv · 多模态、视频与世界模型54

    ScaffoldM3C:用于生成式稳定建造规划的多模态 Sequential Monte Carlo 框架

    论文提出 ScaffoldM3C,一种用于稳定积木式建造的轻量级多模态自回归模型,结合候选区块生成与 Sequential Monte Carlo,同时规划多条装配序列。该模型规模仅为竞品的 1/4,推理速度提升 5x 至 20x,在建造质量相当的情况下实现更高的整体稳定性,并通过仿真和真实机器人装配进行展示。

  15. arXiv · 多模态、视频与世界模型85

    Memorizon:训练超越上下文窗口的世界模型

    论文《Memorizon》提出一种超越上下文窗口训练世界模型的方法,将长跨度重访监督与完整序列注意力解耦。训练样本可覆盖任意长度,但只对最后 k 个 chunks 评分,各 chunk 按相机共视关系检索自身的 top-K latents,共享 bank 上限为 kK;跨度从 100 s 增至 400 s 时,单步耗时增加 12%。

    推荐理由:论文将长跨度重访监督与完整序列注意力解耦,为训练世界模型的时序一致性提供了可复用的检索式方案和成本参考。

  16. arXiv · 多模态、视频与世界模型70

    Gestalt:提出基于多模态交互的大型多模态模型

    Zequn Yang 等作者提出 Gestalt,一种围绕多模态交互构建的大型多模态模型。该模型采用多模态交互金字塔、统一离散扩散框架和通过可学习交互 token 促进跨模态交换的架构,论文称其在图像生成、多模态理解和纯文本评测中提升了跨模态融合,同时保留模态特有信息。

  17. arXiv · 多模态、视频与世界模型76

    SemanTok:面向高效自回归视频生成的可预测语义 token

    论文提出 SemanTok,一种将冻结的 DINO 特征输入编码器并由各保留 token 前缀独立重建的可变长度视频 tokenizer,用于自回归视频生成。201M SemanTok AR 模型的表现可匹配或超过参数规模为其 3.4 倍的 VideoFlexTok AR 模型。SemanTok 的短 token 前缀预测成本更低且生成保真度更高,像素细节则延后到后续 token。

    推荐理由:论文通过让每个保留 token 前缀独立重建冻结的 DINO 特征,提升自回归视频生成的语义对齐,并降低短前缀预测成本。

  18. arXiv · 多模态、视频与世界模型81

    Soundwich:用分层可控音频生成与视频同步

    Soundwich 提出一种无需训练的框架,将冻结的联合音视频 flow-matching 模型转化为可生成多条同步、可独立编辑音频轨道的系统。框架通过共享场景表示传递全局视听上下文,并让每条音频轨道与对应视觉来源进行跨模态交互,以保持声音与视频协调。论文称实验和人工评估显示其在时间控制、来源分离和自然度方面有所改善,生成的音频轨道可独立调整时序、静音、替换或重混。

    推荐理由:论文展示了如何在不训练新模型的情况下,把单一混音拆成可独立编辑的同步音频轨道,为音视频生成的后期重混与来源级控制提供参考。

  19. arXiv · 多模态、视频与世界模型72

    论文分析真实场景中的多模态 LLM 图像交互任务

    一项研究分析了40,000多条去标识化的 Microsoft Copilot 图像上传对话,并用涵盖感知、认知和生成的十类能力刻画用户任务。研究发现,多数图像任务涉及多种能力,且多模态使用覆盖的任务空间比纯文本交互更广。对照253个基准后,研究指出现有评测更集中于感知和固定答案推理,而文本、代码与数据生成等常见工作流覆盖较少;研究还在独立的 ChatGPT 数据集上验证了分类框架和发现。

  20. arXiv · 多模态、视频与世界模型56

    超越单模态基础:面向多模态数据的拉回几何

    Honglei Brinkmann 提出一种面向流形混合数据的拉回几何,以潜在高斯混合分布构造黎曼度量,减少将分离模态映射到单一高斯区域造成的传输变形。该方法通过支持自适应混合学习的 normalizing flow,实现分量级重建和局部有效维度估计。在合成几何数据、多视图图像和 MNIST 实验中,方法展现出较低的传输失真、接近参考轨迹的恢复结果和更真实的插值效果。

  21. arXiv · 多模态、视频与世界模型75

    JEPA-TTT:持续测试时训练让潜在世界模型适应动力学变化

    JEPA-TTT在测试时持续更新预训练、动作条件化JEPA世界模型的潜在动力学预测器,同时固定视觉编码器和奖励头,以适应训练与测试环境之间的动力学变化。该方法通过dense replay积累跨回合的预测窗口,规划不需要目标图像或在线环境奖励。在四个连续控制环境的八种动力学变化中,经过500个测试回合后,潜在自回归预测误差平均降低83%,规划性能较冻结的JEPA世界模型提升153%。

  22. arXiv · 多模态、视频与世界模型66

    CF-JEPA 通过可控性分解提升 JEPA 世界模型鲁棒性

    论文提出 CF-JEPA,将 JEPA 世界模型的潜空间拆分为可控与不可控子空间,以隔离视觉背景干扰。该方法在 2D 和 3D 控制任务的正常条件下表现相当,并在受干扰条件下提升性能,且论文称其是唯一未出现潜表示坍塌的模型;作者还在模拟机器人任务中进行了验证。

  23. arXiv · 多模态、视频与世界模型68

    多模态 LLM 视频标注的有效性与成本评估

    研究者系统评估短视频 VLM 标注中的采样、图像网格和单模态等启发式方法,比较分类准确率、下游推断有效性与每视频 token 成本。结果显示,准确率最高的配置可能导出错误结论,文本单模态也可能取得较强表现;通过简单镜头切换检测构建的单个 2×8 图像网格,其 κ 值与全视频理解相差不超过 .05,token 成本约为后者的 15%。

  24. arXiv · 多模态、视频与世界模型69

    《视频生成模型的后训练与对齐》综述

    Chaoyu Li 等作者发表《视频生成模型的后训练与对齐》综述,系统梳理预训练视频模型的后训练与对齐方法。论文按隐式与显式对齐区分方法,并归纳为监督微调、自训练与蒸馏、偏好与奖励、推理时方法四类,同时总结数据集、基准和评测实践。文章还讨论可扩展奖励设计、长时域时序一致性、稳定性与表现力权衡,以及安全生成等开放问题。

  25. arXiv · 多模态、视频与世界模型77

    Align Then Reason 提出多语言唇形同步评判器,提升配音质检效果

    Rui Liu 等提出 Align Then Reason(ATR),用静音视频和候选文本判断配音台词的内容与时序是否匹配。在七语言基准上,ATR 相比对应的 Qwen3.5 SFT 基线,2B、4B 和 9B 推理器的平均 AUC 分别提升 59.4%、50.2% 和 50.8%。

    推荐理由:论文把逐帧唇部表征与候选台词的音素单元先做单调对齐,再交给 LLM 联合判断内容和时序,为无配音音频时的配音审片提供了可复用流程。

  26. arXiv · 多模态、视频与世界模型79

    Kepler:面向 ARC-AGI-3 的可审计世界模型

    论文提出开源评测框架 Kepler,用可执行世界模型、回溯转移检查和条件预测检查审计 ARC-AGI-3 智能体行为。在固定 Claude Opus 5 配置下,Kepler 在 25 个公开游戏上取得服务器验证的 100.00 RHAE,并记录了 3 类评测失败,包括源代码泄漏、控制条件下重建被移除的 harness,以及自主修复掩盖规划器故障。

    推荐理由:论文把 ARC-AGI-3 的高分拆解为可审计的验证、成本与失败记录,为交互式世界模型评测提供了可复用的报告框架。

  27. arXiv · 多模态、视频与世界模型66

    CANOPY 提出面向多模态 RAG 的自适应粒度证据压缩框架

    CANOPY 提出一种面向多模态 RAG 的自适应粒度证据压缩框架,将文本、表格、图像和视频组织为层级结构,并按查询选择不同范围的证据区域。在包含 33M 个异构项目的语料库和五个问答基准上,CANOPY 的平均答案准确率高于评测中的检索基线;在 unrouted Qwen3-VL-8B-Instruct 设置中,压缩使读者输入证据 token 减少 14.2-27.7%,同时保持相近答案准确率。

  28. arXiv · 多模态、视频与世界模型77

    FutureWorlds 提出从替代未来学习机器人世界模型的方法

    FutureWorlds 提出一种从替代未来学习机器人世界模型的框架,结合多样化束搜索、候选专属记忆和 MemSPO 优化预测。在 RT-1、BridgeV2 和 RoboCasa 上,32 帧预测的 LPIPS 相比各自最强基线分别降低 14.78%、20.84% 和 9.12%。

    推荐理由:论文将候选未来的多样性、历史维护与相对质量学习放进同一训练框架,为机器人视频预测中的时序一致性和动作结果建模提供了可复用思路。

  29. arXiv · 多模态、视频与世界模型81

    论文提出 DynSC-Eval 评估长视频生成中的动态主体一致性

    论文提出 DynSC-Eval,通过动态跟踪视频中主体的可见生命周期,使用六项对象级指标评估局部连续性、全局身份保持和不一致事件。对5s、15s和60s视频生成的评测显示,传统指标会掩盖不同模型的主体一致性差异。

    推荐理由:论文将主体的可见生命周期纳入动态评测,并把一致性指标用于后训练,为长视频主体一致性的测量与优化提供了可复用思路。

  30. arXiv · 多模态、视频与世界模型82

    Ego2Act 提出面向目标驱动操作的第一视角视频生成评测基准

    论文作者提出 Ego2Act,用包含2,640段视频和110项日常任务的基准,评估模型根据初始场景图像和高层目标生成第一视角操作视频的能力。论文同时提出无参考评测流程 Ego2ActJudge,并发现模型常跳过或部分执行中间步骤,在复杂物体操作和持续世界建模中的细粒度物理动态表现不足。

    推荐理由:Ego2Act将多步物理操作和目标完成纳入视频生成评测,并提供无参考评测流程,便于比较模型的目标驱动模拟能力。

  31. arXiv · 多模态、视频与世界模型77

    PhysicsLENS 发布视频生成模型物理属性盲点评测基准

    PhysicsLENS 提出面向机器人物理属性合理性的评测数据集与基准,使用相同条件帧和任务、不同场景物理描述的配对场景,覆盖碰撞、重力、动量、摩擦、形变、流体和因果七个领域。对四个视频生成模型的评测包含 400 多个人工标注,结果显示 47 个外观合理的视频中有 34 个忽略了指定物理属性;明确写出该属性只使合理性略有下降,且未达到显著水平。

    推荐理由:该基准把视觉上难以辨认的物理属性纳入视频模型评测,为判断生成视频能否支持机器人学习与规划提供了更具体的测试维度。

  32. arXiv · 多模态、视频与世界模型65

    ReCast:面向固定接口多模态推理的关系保持保护框架

    论文提出 ReCast,一种面向固定媒体接口的智能体框架,通过替换源内容并保留任务相关关系来保护多模态推理输入。在 4,000 个 ChartQA 和 NMSQA 留出样本上,ReCast 达到 75.10% 准确率,保留未保护远程推理准确率的 92.43%;模型审计在 7.95% 的求解请求中标记出源内容泄露。

  33. arXiv · 多模态、视频与世界模型81

    AutoGUIWorld:用图像生成器构建 GUI 智能体视觉世界模型

    AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。

    推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。