跳到正文

全部动态

今日 1 条
10月2日周五
  1. arXiv · 多模态、视频与世界模型77

    PhysicsLENS 发布视频生成模型物理属性盲点评测基准

    PhysicsLENS 提出面向机器人物理属性合理性的评测数据集与基准,使用相同条件帧和任务、不同场景物理描述的配对场景,覆盖碰撞、重力、动量、摩擦、形变、流体和因果七个领域。对四个视频生成模型的评测包含 400 多个人工标注,结果显示 47 个外观合理的视频中有 34 个忽略了指定物理属性;明确写出该属性只使合理性略有下降,且未达到显著水平。

    推荐理由:该基准把视觉上难以辨认的物理属性纳入视频模型评测,为判断生成视频能否支持机器人学习与规划提供了更具体的测试维度。

  2. arXiv · 多模态、视频与世界模型65

    ReCast:面向固定接口多模态推理的关系保持保护框架

    论文提出 ReCast,一种面向固定媒体接口的智能体框架,通过替换源内容并保留任务相关关系来保护多模态推理输入。在 4,000 个 ChartQA 和 NMSQA 留出样本上,ReCast 达到 75.10% 准确率,保留未保护远程推理准确率的 92.43%;模型审计在 7.95% 的求解请求中标记出源内容泄露。

  3. arXiv · 多模态、视频与世界模型81

    AutoGUIWorld:用图像生成器构建 GUI 智能体视觉世界模型

    AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。

    推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。

  4. arXiv · 多模态、视频与世界模型64

    论文提出面向成功标准的辅助损失以改进潜在世界模型规划

    该论文提出一种以成功标准物理量为训练目标的辅助损失,用于提升潜在世界模型对任务成败的区分能力。作者在四个潜在世界模型中发现,末端执行器位置的潜在编码误差超过成功标准允许范围;该方法仅在训练阶段增加回归头,在 PushT 和 cube 上分别带来 3.5% 和 3.4% 的绝对成功率提升,训练后会丢弃回归头。论文链接为 https://arxiv.org/abs/2610.01224v1

  5. arXiv · 多模态、视频与世界模型72

    MMVistaReason提出开放数据后训练配方,提升多模态推理

    MMVistaReason提出一种面向多模态推理的开放数据后训练配方,结合分析型与真实世界推理数据、难度感知教师蒸馏、轨迹筛选和多教师在线蒸馏。该方法构建了MVR-SFT-528K与MVR-RL-63K,在15项多模态基准上,MVR-4B平均得分72.8,使用样本比MMFineReason少约70%;扩展到9B后平均得分达到74.4。

  6. arXiv · 多模态、视频与世界模型66

    CTWMs 学习保持通勤时间的世界模型以支持规划

    论文提出 Commute-Time-Preserving World Models(CTWMs),通过潜在位移预测器和 log-determinant 正则化,学习保持环境通勤时间的表示,用于潜在空间规划。在可逆确定性动力学和预测器固定点下,该方法可恢复正确缩放的 Laplacian 表示。数值模拟显示,CTWM 在多个复杂连续目标到达基准上匹配或超过 LeWM,同时参数量仅为其一半。

  7. The Decoder76

    Tavus推出 Griffin 人类交互模型,48%受试者将其误认真人

    Tavus推出 Griffin,这是一种面向实时面对面交流的 Human Interaction Model;Tavus称其研究中有48%的参与者在一分钟视频通话后相信 Griffin 是真人。

    推荐理由:材料提供了 Griffin 与真人及上一代 AI 的对照数据,并交代了研究预览的开放范围和安全前提,便于判断其当前成熟度。

10月1日周四
  1. arXiv · 多模态、视频与世界模型76

    《The Planning Limits of Latent World Models》揭示潜在世界模型的规划局限

    论文评估了基于 V-JEPA 2、V-JEPA 2.1、VideoMAEv2、VideoPrism 和 DINOv2 的世界模型在 Meta-World 与 BridgeData V2 机器人任务中的规划能力。

    推荐理由:论文将世界模型的可规划范围量化到控制步数,并比较了延长想象轨迹、MPC和专家子目标对远距离任务成功率的影响。

  2. arXiv · 多模态、视频与世界模型50

    MEQ提出互反馈多模态表征学习架构

    论文提出互反馈架构 MEQ,通过两个模态组件持续交换信息,将输入精炼为相互耦合的嵌入,并把交互固定点定义为最终输出。理论分析讨论了模型解释与避免失败的设计,分类和视觉定位实验显示,MEQ 在基于拼接的多模态分类任务上表现更优或具有竞争力,并能逐步改善视觉定位。

  3. arXiv · 多模态、视频与世界模型74

    PartiCam:通过奖励引导实现相机控制视频生成

    PartiCam 提出一种无需训练的相机控制视频生成方法,利用基于粒子过滤的全局与局部扩散奖励引导,使生成视频更准确地遵循指定相机轨迹。该方法基于 Sequential Monte-Carlo 引导加入局部细化阶段,在不重新训练模型的情况下改善轨迹遵循、减少漂移并提升视觉质量。

  4. arXiv · 多模态、视频与世界模型80

    为何传统世界模型难以学习元胞自动机?

    Shaoyang Guo 的研究发现,基于 Transformer 或卷积网络的自回归、扩散世界模型往往能预测多数像素,却难以完整复现元胞自动机的世界动力学。CNN 预测96.3%的细胞但仅完成18.9%的 rollout,联合扩散模型则未完成任何 rollout。

    推荐理由:论文用元胞自动机把世界模型的像素准确率与完整 rollout 区分开,并给出三类信息流修正,为时空一致性设计提供可复用的诊断框架。

  5. arXiv · 多模态、视频与世界模型63

    RoboCoach:用世界模型主动指导组合机器人技能改进

    RoboCoach提出由世界模型驱动的主动教练框架,通过想象失败定位未完成的首个子任务,再选择示范采集对象和专家适配器进行更新。在22组任务策略组合中,想象成功与实际部署成功的相关系数为0.840;额外采集150条子任务示范后,Franka成功率从13.3%升至75.0%,AgileX从40.0%升至83.8%。

  6. arXiv · 多模态、视频与世界模型73

    ShieldCLIP:面向多模态基础模型的选择性安全对齐框架

    论文提出 ShieldCLIP,根据每个模态的实际安全状态进行选择性安全对齐,在减少有害输出的同时保留原始嵌入空间的实用性。作者构建了包含 195k 个四元组、覆盖 578 个概念和 28 个类别的 ViSUv2 数据集,并在跨模态检索、Stable Diffusion v1.4、SDXL 和 LLaVA 任务上进行评估。

  7. arXiv · 多模态、视频与世界模型34

    超越策略对齐:PL-MPC 闭合学习世界模型机器人控制的规划—学习循环

    研究者提出 PL-MPC(Planning-Learning MPC),通过改进 critic 监督与规划器终端价值估计,闭合学习世界模型机器人控制的规划—学习循环。HumanoidBench 上,balance-hard 的 TAR 从 $98±18 升至 $387±255,hurdle 从 $199±13 升至 $466±200,表现仍具任务依赖性。

  8. arXiv · 多模态、视频与世界模型55

    球面插值实现向后兼容的多模态表示

    这篇研究提出在正交对齐后的新旧查询表示之间进行球面测地线插值,以在不重建图库嵌入的情况下改善跨模态检索。多组基准和模型族实验显示,该方法在多数评测设置中优于单独的正交对齐,并分析了有利的内部插值点为何会出现。论文已被 NeurIPS 2026 接收,代码已提供。

  9. arXiv · 多模态、视频与世界模型74

    DashVMC:在 Geometry Dash 中实现实时离散世界模型控制

    DashVMC 从约两小时的 Geometry Dash 游戏录像中学习紧凑的动作条件世界模型,并在冻结模型 rollout 中用行为克隆和 PPO 优化控制器。优化后的策略在三个官方关卡和一个留出的社区关卡中都比行为克隆初始策略存活更久;部署时,基线跳过视觉生成,在消费级 GPU 上维持 60-Hz 的捕获到动作循环。

  10. arXiv · 多模态、视频与世界模型76

    Radian:用表征空间对抗蒸馏增强自回归视频生成

    论文提出 Radian,通过冻结视觉基础模型提取多层视觉表征,并对自回归生成结果施加真实视频帧对抗监督,以改善细节退化、结构漂移和运动不稳定。基于 Wan2.1-1.3B 的实验显示,四步生成达到 VBench Total 0.8444 和 VideoAlign Total 0.8033,VBench-Long 从 0.7805 提升至 0.8041,且使用更少去噪步数。

    推荐理由:论文将视觉基础模型表征空间的对抗监督引入蒸馏,可为降低自回归视频生成中的时序误差传播提供一种训练思路。

  11. arXiv · 多模态、视频与世界模型46

    Social-WM:面向机器人社交导航的安全感知潜在世界模型

    Social-WM 提出一种基于第一视角 RGB 视频训练的高效潜在世界模型规划框架,通过预测动作实际执行后的未来并建模可实现性,在执行前评估社交导航安全风险。在 Social-HM3D 上成功率达 63.77%,人类碰撞率降至 21.67%,无需显式行人跟踪、特权人类状态或在线强化学习,并能零样本迁移至 Social-MP3D。

  12. arXiv · 多模态、视频与世界模型79

    LOCI:面向流式世界模型的空间线性记忆

    Ji Xia 等人提出 LOCI,一种结合 key-value cache 与循环线性注意力记忆的空间记忆架构,用于让视频世界模型更准确地复现摄像机重访区域。

    推荐理由:LOCI 将可保留视觉细节的 key-value cache 与线性循环记忆结合,为长视频中的场景重访和显存控制提供了具体架构参考。

  13. arXiv · 多模态、视频与世界模型77

    WorldAuditBench:用多模态智能体审计交互式3D世界

    WorldAuditBench提出一个交互式3D世界审计基准,包含基于Unreal Engine 5构建的13个环境和213项异常任务,覆盖五类异常。论文在固定探索预算下评估五个前沿模型,采用VLA探索后由VLM识别异常,以及端到端VLM智能体两种范式,成功率为6.6%至42.3%,低于人类的83.4%。

    推荐理由:WorldAuditBench将3D世界审计拆为探索行动与视觉推理,并用统一预算比较两种范式,可用于评估多模态智能体的证据搜集能力。

  14. arXiv · 多模态、视频与世界模型85

    Physis-Lang:用自演化语言作为视频世界模型的物理表示

    Physis-Lang提出一种自演化框架,将物理语言作为视频世界模型在数据整理、模型训练和视频生成中的共享表示。在四个物理视频基准上,使用 Wan 和 Cosmos 主干的实验显示物理可信度持续提升;基于开源 Cosmos3-Nano 的增强模型超过 Veo 3.1。

    推荐理由:论文将物理过程拆成可优化的语言断言,并通过 PhysCapBench 与语言引导检索改善视频世界模型的物理可信度。

  15. arXiv · 多模态、视频与世界模型80

    Multimodal Flow在嵌入空间统一建模语言与视觉

    Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。

    推荐理由:该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。

  16. 可灵 · 模型与创作实践89

    可灵 Kling 4.0 进入早期访问,支持原生 30 秒生成与多参考控制

    可灵 Kling 4.0 进入早期访问,支持单次生成最长 30 秒视频、最多 15 个参考素材和最多 10 个关键帧。Kling 4.0 Flash 将于 9 月 28 日向 Ultra Yearly 订阅者开放,Kling 4.0 计划在 10 月扩大开放。新版本还加入音画同步、21:9 超宽画幅和更精细的视频编辑,10-bit HDR 输出将在后续提供。

    推荐理由:这次更新把长视频生成、多参考控制和时间线工作流放在同一升级中,适合比较连续叙事与商品广告制作的可控性。

  17. arXiv · 多模态、视频与世界模型78

    Audible World Models 提出面向 3D 世界的空间感知声音生成框架

    论文提出 Audible World Models,一种 training-free 框架,可从文本提示构建全景 3D proxy,将声音源锚定到重建几何,并根据听者视点和运动渲染空间音频。对 80 个生成场景的实验显示,该方法在空间一致性上优于文本、视频和全景图条件基线,同时保持有竞争力的语义对齐;论文已被 NeurIPS 2026 接收。

    推荐理由:论文将声音源位置、3D 几何与几何声学传播纳入世界状态,为构建随观察者移动而变化且保持空间一致性的多模态世界模型提供了可复用路线。

  18. arXiv · 多模态、视频与世界模型74

    梯度冲突能预测理解与生成的权衡吗?对统一多模态模型冲突指标有效性的受控审计

    这项研究在受控测试床 GRIDUMM 中审计梯度冲突指标能否预测统一多模态模型的理解与生成权衡。在 63 个配置和 372 个测量检查点中,没有方向性冲突指标达到绝对 Spearman 相关系数 0.3 且置信区间排除零;单调压低冲突也未改变权衡结果。研究发现,功能干扰指标优于方向性冲突指标,训练损失则能较强地追踪该权衡,作者计划在论文接收后公开审计代码。

  19. arXiv · 多模态、视频与世界模型79

    统一多模态模型中的位置级梯度冲突与位置感知调制

    该研究提出位置级干扰图,用于定位统一多模态模型中图像理解与自回归图像生成之间的梯度冲突。在 Show-o 和 Janus-Pro 上,视觉 token 位置可解释较大比例的冲突差异,序列前四分之一的平均梯度余弦为 -0.18,末四分之一为 -0.02。

    推荐理由:该研究为统一多模态模型理解与生成目标的梯度冲突提供了位置级诊断,并给出无需改架构的调制方法。

  20. arXiv · 多模态、视频与世界模型54

    MM-FinEval:面向真实世界金融预测的多任务多模态基准

    MM-FinEval 是一个用于评估多模态大语言模型金融预测能力的基准,涵盖 2019 至 2022 年的 2,045 个 S&P 500 财报电话会,并设置 12 个金融任务标签。每条输入包含逐字稿、电话会演示文稿和完整音频,论文进一步比较了 19 个基线模型。结果显示,处理三种模态的小型 Any-to-Any 模型表现较强,部分情况下优于仅处理两种模态的大型专有模型。

  21. arXiv · 多模态、视频与世界模型80

    LongTake:学习在长时域视频生成中维持动态

    LongTake提出由 Long-Horizon Teacher Forcing 和 DMD 构成的两阶段训练流程,让自回归视频扩散模型基于长真实视频前缀预测后续帧,以维持长时域生成中的场景动态和视觉质量。在相同的五秒 DMD 训练设置下,该初始化在30秒生成中以相近美学质量获得更高动态程度;Hybrid DMD 在30秒和60秒自回滚评测中取得被评估方法中的最高动态程度。

    推荐理由:Long-Horizon Teacher Forcing 将长视频真实前缀引入训练,结合 Hybrid DMD,为提升长时域生成的动态持续性和画质提供了可复用的训练思路。

  22. arXiv · 多模态、视频与世界模型71

    Exo2EgoHOI:面向手物交互保持的第三人称到第一人称视频生成

    Exo2EgoHOI提出一种手物交互感知的视频生成框架,将第三人称操作视频转换为第一人称观察,以保持手物交互和对象一致性。该方法结合4D HOI先验、双分支残差适配器和分解式门控交叉注意力,在ARCTIC-HOI和Ego-Exo4D上进行实验;在ARCTIC-HOI上,相比对应最佳基线,object mIoU提升32.3%,MPJPE和PA-MPJPE分别降低34.7%和50.0%。

  23. arXiv · 多模态、视频与世界模型76

    EPIC:基于极线一致性的360°沉浸式立体视频生成

    EPIC提出一种零样本生成流程,将现有视频扩散模型扩展到4K立体360°视频生成。论文设计了感知极线几何的360°图像匹配指标,用于捕捉跨视角的时序与立体不一致,并在有限训练数据下进行直接偏好优化。

    推荐理由:论文将极线感知的360°图像匹配指标作为偏好信号,用于有限训练数据下的直接偏好优化,为沉浸式视频的一致性优化提供了可复用思路。

  24. arXiv · 多模态、视频与世界模型77

    研究提出 SEGUE,提升视频生成中途提示词切换的状态过渡

    该研究提出 SEGUE 框架,让视频生成器在中途切换提示词时先完成必要的状态过渡,再交还控制权给用户提示词。在包含 1,800 次切换的 OpenTrans-360 上,SEGUE 将整体得分从 0.866 提升至 0.887,并在八项过渡指标中均排名第一;其规划器也能迁移到无需重新训练的冻结自回归生成器。

    推荐理由:论文将中途提示词切换拆解为带状态和时长的过渡,并用两个基准展示了对生成连贯性与指令响应的改善。

  25. arXiv · 多模态、视频与世界模型76

    UniEvo-VL 提出多模态模型自我改进的在策略自蒸馏训练方法

    UniEvo-VL 提出一种让单个多模态模型分别充当教师和学生、利用自我批评反馈进行在策略自蒸馏的方法,以改进图像生成能力。在开源 Qwen-image-2512 上,GenEval 从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。

    推荐理由:论文给出不依赖独立教师的多模态自蒸馏路径,并用 GenEval 与 GenEval2 Soft-TIFA 的分数变化展示其对图像生成改进的测量方式。

  26. arXiv · 多模态、视频与世界模型74

    研究发现未来视频生成表征比观测视频更贴近人类视觉皮层

    一项研究比较了视频扩散模型中未来视频生成与观测视频重建的内部表征,发现前者与人类观看视频时的视觉皮层响应更一致。观测视频重建的对齐主要集中在低阶视觉皮层,未来视频生成则更多集中于高阶视觉皮层;行为实验中,受试者更偏好增强相关层贡献后生成的视频。