论文提出面向成功标准的辅助损失以改进潜在世界模型规划
该论文提出一种以成功标准物理量为训练目标的辅助损失,用于提升潜在世界模型对任务成败的区分能力。作者在四个潜在世界模型中发现,末端执行器位置的潜在编码误差超过成功标准允许范围;该方法仅在训练阶段增加回归头,在 PushT 和 cube 上分别带来 3.5% 和 3.4% 的绝对成功率提升,训练后会丢弃回归头。论文链接为 https://arxiv.org/abs/2610.01224v1
该论文提出一种以成功标准物理量为训练目标的辅助损失,用于提升潜在世界模型对任务成败的区分能力。作者在四个潜在世界模型中发现,末端执行器位置的潜在编码误差超过成功标准允许范围;该方法仅在训练阶段增加回归头,在 PushT 和 cube 上分别带来 3.5% 和 3.4% 的绝对成功率提升,训练后会丢弃回归头。论文链接为 https://arxiv.org/abs/2610.01224v1
MMVistaReason提出一种面向多模态推理的开放数据后训练配方,结合分析型与真实世界推理数据、难度感知教师蒸馏、轨迹筛选和多教师在线蒸馏。该方法构建了MVR-SFT-528K与MVR-RL-63K,在15项多模态基准上,MVR-4B平均得分72.8,使用样本比MMFineReason少约70%;扩展到9B后平均得分达到74.4。
论文提出 Commute-Time-Preserving World Models(CTWMs),通过潜在位移预测器和 log-determinant 正则化,学习保持环境通勤时间的表示,用于潜在空间规划。在可逆确定性动力学和预测器固定点下,该方法可恢复正确缩放的 Laplacian 表示。数值模拟显示,CTWM 在多个复杂连续目标到达基准上匹配或超过 LeWM,同时参数量仅为其一半。
论文评估了基于 V-JEPA 2、V-JEPA 2.1、VideoMAEv2、VideoPrism 和 DINOv2 的世界模型在 Meta-World 与 BridgeData V2 机器人任务中的规划能力。
推荐理由:论文将世界模型的可规划范围量化到控制步数,并比较了延长想象轨迹、MPC和专家子目标对远距离任务成功率的影响。
论文提出互反馈架构 MEQ,通过两个模态组件持续交换信息,将输入精炼为相互耦合的嵌入,并把交互固定点定义为最终输出。理论分析讨论了模型解释与避免失败的设计,分类和视觉定位实验显示,MEQ 在基于拼接的多模态分类任务上表现更优或具有竞争力,并能逐步改善视觉定位。
PartiCam 提出一种无需训练的相机控制视频生成方法,利用基于粒子过滤的全局与局部扩散奖励引导,使生成视频更准确地遵循指定相机轨迹。该方法基于 Sequential Monte-Carlo 引导加入局部细化阶段,在不重新训练模型的情况下改善轨迹遵循、减少漂移并提升视觉质量。
Shaoyang Guo 的研究发现,基于 Transformer 或卷积网络的自回归、扩散世界模型往往能预测多数像素,却难以完整复现元胞自动机的世界动力学。CNN 预测96.3%的细胞但仅完成18.9%的 rollout,联合扩散模型则未完成任何 rollout。
推荐理由:论文用元胞自动机把世界模型的像素准确率与完整 rollout 区分开,并给出三类信息流修正,为时空一致性设计提供可复用的诊断框架。
RoboCoach提出由世界模型驱动的主动教练框架,通过想象失败定位未完成的首个子任务,再选择示范采集对象和专家适配器进行更新。在22组任务策略组合中,想象成功与实际部署成功的相关系数为0.840;额外采集150条子任务示范后,Franka成功率从13.3%升至75.0%,AgileX从40.0%升至83.8%。
论文提出 ShieldCLIP,根据每个模态的实际安全状态进行选择性安全对齐,在减少有害输出的同时保留原始嵌入空间的实用性。作者构建了包含 195k 个四元组、覆盖 578 个概念和 28 个类别的 ViSUv2 数据集,并在跨模态检索、Stable Diffusion v1.4、SDXL 和 LLaVA 任务上进行评估。
研究者提出 PL-MPC(Planning-Learning MPC),通过改进 critic 监督与规划器终端价值估计,闭合学习世界模型机器人控制的规划—学习循环。HumanoidBench 上,balance-hard 的 TAR 从 $98±18 升至 $387±255,hurdle 从 $199±13 升至 $466±200,表现仍具任务依赖性。
这篇研究提出在正交对齐后的新旧查询表示之间进行球面测地线插值,以在不重建图库嵌入的情况下改善跨模态检索。多组基准和模型族实验显示,该方法在多数评测设置中优于单独的正交对齐,并分析了有利的内部插值点为何会出现。论文已被 NeurIPS 2026 接收,代码已提供。
论文提出多模态因果蒸馏框架 MCD,通过结构保持的 token 干预识别并迁移教师模型使用多模态证据的方式。在三个 LVLM 家族和七个基准上,学生模型平均提升 7.23 分,较 vanilla distillation 高 4.68 分。
DashVMC 从约两小时的 Geometry Dash 游戏录像中学习紧凑的动作条件世界模型,并在冻结模型 rollout 中用行为克隆和 PPO 优化控制器。优化后的策略在三个官方关卡和一个留出的社区关卡中都比行为克隆初始策略存活更久;部署时,基线跳过视觉生成,在消费级 GPU 上维持 60-Hz 的捕获到动作循环。
研究基于 XD-Violence 的 443 个样本,利用面部区域外观、时间对齐音频和人体运动特征,在排除事件本身的前提下识别暴力发生前的短时风险。对 Swin-Tiny、ViT-Tiny 和 DeiT-Tiny 的消融实验显示,多模态组合效果更好。
论文提出 Radian,通过冻结视觉基础模型提取多层视觉表征,并对自回归生成结果施加真实视频帧对抗监督,以改善细节退化、结构漂移和运动不稳定。基于 Wan2.1-1.3B 的实验显示,四步生成达到 VBench Total 0.8444 和 VideoAlign Total 0.8033,VBench-Long 从 0.7805 提升至 0.8041,且使用更少去噪步数。
推荐理由:论文将视觉基础模型表征空间的对抗监督引入蒸馏,可为降低自回归视频生成中的时序误差传播提供一种训练思路。
Social-WM 提出一种基于第一视角 RGB 视频训练的高效潜在世界模型规划框架,通过预测动作实际执行后的未来并建模可实现性,在执行前评估社交导航安全风险。在 Social-HM3D 上成功率达 63.77%,人类碰撞率降至 21.67%,无需显式行人跟踪、特权人类状态或在线强化学习,并能零样本迁移至 Social-MP3D。
Ji Xia 等人提出 LOCI,一种结合 key-value cache 与循环线性注意力记忆的空间记忆架构,用于让视频世界模型更准确地复现摄像机重访区域。
推荐理由:LOCI 将可保留视觉细节的 key-value cache 与线性循环记忆结合,为长视频中的场景重访和显存控制提供了具体架构参考。
WorldAuditBench提出一个交互式3D世界审计基准,包含基于Unreal Engine 5构建的13个环境和213项异常任务,覆盖五类异常。论文在固定探索预算下评估五个前沿模型,采用VLA探索后由VLM识别异常,以及端到端VLM智能体两种范式,成功率为6.6%至42.3%,低于人类的83.4%。
推荐理由:WorldAuditBench将3D世界审计拆为探索行动与视觉推理,并用统一预算比较两种范式,可用于评估多模态智能体的证据搜集能力。
Physis-Lang提出一种自演化框架,将物理语言作为视频世界模型在数据整理、模型训练和视频生成中的共享表示。在四个物理视频基准上,使用 Wan 和 Cosmos 主干的实验显示物理可信度持续提升;基于开源 Cosmos3-Nano 的增强模型超过 Veo 3.1。
推荐理由:论文将物理过程拆成可优化的语言断言,并通过 PhysCapBench 与语言引导检索改善视频世界模型的物理可信度。
论文提出 Ranking-PE,将多模态临床诊断的提示优化目标从准确率改为基于正负样本排序的 AUROC。在 MIMIC 的三种疾病上,Ranking-PE 相比准确率方案在 fine-tuned Qwen3-VL-8B 上提升 +5.8 AUROC pp,在 MedGemma-4B 上提升 +16.2 pp,且无需额外模型调用或 surrogate loss。
Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。
推荐理由:该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。
SimTrace提出一种基于计算机使用客户端智能体的框架,通过匿名化真实交互并结合给定网页环境的模拟副本,生成与网页观察和用户上下文配对的细粒度合成多模态点击流。
论文提出 Audible World Models,一种 training-free 框架,可从文本提示构建全景 3D proxy,将声音源锚定到重建几何,并根据听者视点和运动渲染空间音频。对 80 个生成场景的实验显示,该方法在空间一致性上优于文本、视频和全景图条件基线,同时保持有竞争力的语义对齐;论文已被 NeurIPS 2026 接收。
推荐理由:论文将声音源位置、3D 几何与几何声学传播纳入世界状态,为构建随观察者移动而变化且保持空间一致性的多模态世界模型提供了可复用路线。
这项研究在受控测试床 GRIDUMM 中审计梯度冲突指标能否预测统一多模态模型的理解与生成权衡。在 63 个配置和 372 个测量检查点中,没有方向性冲突指标达到绝对 Spearman 相关系数 0.3 且置信区间排除零;单调压低冲突也未改变权衡结果。研究发现,功能干扰指标优于方向性冲突指标,训练损失则能较强地追踪该权衡,作者计划在论文接收后公开审计代码。
该研究提出位置级干扰图,用于定位统一多模态模型中图像理解与自回归图像生成之间的梯度冲突。在 Show-o 和 Janus-Pro 上,视觉 token 位置可解释较大比例的冲突差异,序列前四分之一的平均梯度余弦为 -0.18,末四分之一为 -0.02。
推荐理由:该研究为统一多模态模型理解与生成目标的梯度冲突提供了位置级诊断,并给出无需改架构的调制方法。
MM-FinEval 是一个用于评估多模态大语言模型金融预测能力的基准,涵盖 2019 至 2022 年的 2,045 个 S&P 500 财报电话会,并设置 12 个金融任务标签。每条输入包含逐字稿、电话会演示文稿和完整音频,论文进一步比较了 19 个基线模型。结果显示,处理三种模态的小型 Any-to-Any 模型表现较强,部分情况下优于仅处理两种模态的大型专有模型。
LongTake提出由 Long-Horizon Teacher Forcing 和 DMD 构成的两阶段训练流程,让自回归视频扩散模型基于长真实视频前缀预测后续帧,以维持长时域生成中的场景动态和视觉质量。在相同的五秒 DMD 训练设置下,该初始化在30秒生成中以相近美学质量获得更高动态程度;Hybrid DMD 在30秒和60秒自回滚评测中取得被评估方法中的最高动态程度。
推荐理由:Long-Horizon Teacher Forcing 将长视频真实前缀引入训练,结合 Hybrid DMD,为提升长时域生成的动态持续性和画质提供了可复用的训练思路。
Exo2EgoHOI提出一种手物交互感知的视频生成框架,将第三人称操作视频转换为第一人称观察,以保持手物交互和对象一致性。该方法结合4D HOI先验、双分支残差适配器和分解式门控交叉注意力,在ARCTIC-HOI和Ego-Exo4D上进行实验;在ARCTIC-HOI上,相比对应最佳基线,object mIoU提升32.3%,MPJPE和PA-MPJPE分别降低34.7%和50.0%。
EPIC提出一种零样本生成流程,将现有视频扩散模型扩展到4K立体360°视频生成。论文设计了感知极线几何的360°图像匹配指标,用于捕捉跨视角的时序与立体不一致,并在有限训练数据下进行直接偏好优化。
推荐理由:论文将极线感知的360°图像匹配指标作为偏好信号,用于有限训练数据下的直接偏好优化,为沉浸式视频的一致性优化提供了可复用思路。
该研究提出 SEGUE 框架,让视频生成器在中途切换提示词时先完成必要的状态过渡,再交还控制权给用户提示词。在包含 1,800 次切换的 OpenTrans-360 上,SEGUE 将整体得分从 0.866 提升至 0.887,并在八项过渡指标中均排名第一;其规划器也能迁移到无需重新训练的冻结自回归生成器。
推荐理由:论文将中途提示词切换拆解为带状态和时长的过渡,并用两个基准展示了对生成连贯性与指令响应的改善。
UniEvo-VL 提出一种让单个多模态模型分别充当教师和学生、利用自我批评反馈进行在策略自蒸馏的方法,以改进图像生成能力。在开源 Qwen-image-2512 上,GenEval 从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。
推荐理由:论文给出不依赖独立教师的多模态自蒸馏路径,并用 GenEval 与 GenEval2 Soft-TIFA 的分数变化展示其对图像生成改进的测量方式。
一项研究比较了视频扩散模型中未来视频生成与观测视频重建的内部表征,发现前者与人类观看视频时的视觉皮层响应更一致。观测视频重建的对齐主要集中在低阶视觉皮层,未来视频生成则更多集中于高阶视觉皮层;行为实验中,受试者更偏好增强相关层贡献后生成的视频。
论文提出 DecoMoE,通过 Sample-Adaptive Visual Boundary 和 Routing-Calibrated Expert Prefix 分别压缩视觉传播与专家计算,并在 Qwen3-VL-MoE 和 InternVL3.5-30B-A3B 上进行六项基准评测。
论文提出 FrameMorrow,通过预测代表未来信息需求的少量 prospective tokens,从历史中选择相关帧,以支持长时视频生成。该方法选择显式历史帧而非模型内部状态,可接入包括闭源模型在内的不同生成器,并在 5 个基准、11 个生成模型上评估了长视频生成、交互生成和动作条件世界模型任务,报告了长程一致性、视觉质量与动作对齐的持续提升。
推荐理由:论文把历史选择从当前相关性转向未来信息需求,并以显式历史帧接入不同生成器,为长视频和交互生成的记忆设计提供了可复用思路。
SceneJail 提出一种自适应黑盒越狱框架,通过构造兼容场景并搜索场景相关提示词,攻击视频多模态大语言模型。该方法在包含八个 Video-MLLMs 的评测中,SceneJail-F 的平均攻击成功率最高达 91.5%,较最强基线高 29.1 个百分点。将有害查询分布到连续帧的 SceneJail-S 在严格图像过滤下仍达到 72.3% 的攻击成功率。
推荐理由:论文将视频场景从有害查询的载体提升为攻击面,为 Video-MLLM 安全评测和防御设计提供了可复用的测试思路。
论文提出 World-As-Graph(WAG),一种基于图的对象中心世界模型,将关系归纳偏置引入 JEPA 风格的预测表示学习。WAG通过关系感知结构诱导构建随时间变化的潜空间图,并结合邻近对象关系与历史记忆更新对象级动态状态,用于自回归未来预测;论文在视觉推理和机器人操作任务上进行了实验。
论文提出 BadAction,用预定义动作模式作为后门触发器,使交互式视频生成模型在触发后生成不再响应后续动作的冻结未来帧,同时保持对正常动作序列的行为。实验显示,动作单模态触发器的平均攻击成功率为 91.0%,多模态触发器为 80.4%;该方法还成功绕过现有后门检测方法,暴露交互式视频生成流程中的安全缺口。
推荐理由:论文把交互式视频生成的攻击面具体化为动作序列触发器,并给出攻防实验,便于评估模型在可控生成场景中的安全边界。
该研究提出基于 LLM 的多模态对话情绪评估框架,在 IEMOCAP 上同时进行离散情绪识别和 Valence-Arousal-Dominance(VAD)维度评估,并比较 LLaMA、GPT 和 Qwen 系列的零样本、少样本提示与 LoRA 微调。
这篇论文提出回顾性世界建模,让 VLM 智能体根据状态转移反向估计最可能导致该转移的动作。作者进一步设计自洽奖励,将策略动作与回顾性解释之间的一致性转化为强化学习中的逐转移反馈;实验显示,该方法相比仅使用前向世界建模的基线提升了策略的鲁棒性和泛化能力。
S-OPD 提出一种多模态 On-Policy Distillation 框架,通过 Teacher-calibrated Policy Contrast 和 Policy Agreement 强化学生对视觉证据的依赖及抗噪感知。该方法无需额外数据标注、模型参数或推理操作,覆盖八个基准测试,LogicVista 最高提升 4.25 分,并可与教师侧监督方法结合获得进一步提升。