DiVid 诊断视频生成模型的分维度多样性坍缩
论文提出 DiVid,将视频生成多样性拆分为语义、风格、主体、场景、运动和摄影机六个维度。对代表性视频生成模型的系统评测显示,模型可能拥有较高全局多样性分数,却在运动和摄影机等因素上坍缩;这些差异在过滤不忠实生成后仍然存在。受控提示词实验进一步归纳出默认模式收敛和实现缺口两类瓶颈,框架计划发布以支持后续研究。
推荐理由:DiVid将视频多样性拆成六个维度,并区分默认模式收敛与实现缺口,可为评测和训练目标设计提供更细的定位框架。
论文提出 DiVid,将视频生成多样性拆分为语义、风格、主体、场景、运动和摄影机六个维度。对代表性视频生成模型的系统评测显示,模型可能拥有较高全局多样性分数,却在运动和摄影机等因素上坍缩;这些差异在过滤不忠实生成后仍然存在。受控提示词实验进一步归纳出默认模式收敛和实现缺口两类瓶颈,框架计划发布以支持后续研究。
推荐理由:DiVid将视频多样性拆成六个维度,并区分默认模式收敛与实现缺口,可为评测和训练目标设计提供更细的定位框架。
Latent-Foresight 提出端到端框架,联合学习潜在 tokenizer 与 flow-based 生成动力学模型,以获得更适合时间预测的表示。实验显示,该方法在多个未来场景理解任务和预测时间跨度上优于两阶段基线,并提供实现代码和模型权重。
MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。
推荐理由:MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。
HiPhy提出一种基于强化学习的层级物理对齐框架,使视频生成同时遵循多个物理原理并保持场景的物理与语义一致性。研究构建了包含 50K 提示词的数据集和 MultiPhyBench 基准,实验显示 HiPhy 在多个基准上显著优于既有方法,涉及多种并发物理原理的场景提升最大。
推荐理由:论文将物理规律拆分为局部动态与全局场景一致性目标,并用 MultiPhyBench 支持多物理原理视频生成的比较评估。
Honglei Brinkmann 提出一种面向流形混合数据的拉回几何,以潜在高斯混合分布构造黎曼度量,减少将分离模态映射到单一高斯区域造成的传输变形。该方法通过支持自适应混合学习的 normalizing flow,实现分量级重建和局部有效维度估计。在合成几何数据、多视图图像和 MNIST 实验中,方法展现出较低的传输失真、接近参考轨迹的恢复结果和更真实的插值效果。
论文提出 CF-JEPA,将 JEPA 世界模型的潜空间拆分为可控与不可控子空间,以隔离视觉背景干扰。该方法在 2D 和 3D 控制任务的正常条件下表现相当,并在受干扰条件下提升性能,且论文称其是唯一未出现潜表示坍塌的模型;作者还在模拟机器人任务中进行了验证。
论文提出开源评测框架 Kepler,用可执行世界模型、回溯转移检查和条件预测检查审计 ARC-AGI-3 智能体行为。在固定 Claude Opus 5 配置下,Kepler 在 25 个公开游戏上取得服务器验证的 100.00 RHAE,并记录了 3 类评测失败,包括源代码泄漏、控制条件下重建被移除的 harness,以及自主修复掩盖规划器故障。
推荐理由:论文把 ARC-AGI-3 的高分拆解为可审计的验证、成本与失败记录,为交互式世界模型评测提供了可复用的报告框架。
研究提出一种动作条件网络世界模型,用于在复杂系统中评估干预行动并辅助算法设计。在 8 个网络任务和 5 个扩散模型的 141 个设置中,设计出的算法在 138 个设置达到或超过最强基线,rollout 速度最高为 Monte Carlo simulation 的 14.5 倍;代码将在接收后发布。
PhysicsLENS 提出面向机器人物理属性合理性的评测数据集与基准,使用相同条件帧和任务、不同场景物理描述的配对场景,覆盖碰撞、重力、动量、摩擦、形变、流体和因果七个领域。对四个视频生成模型的评测包含 400 多个人工标注,结果显示 47 个外观合理的视频中有 34 个忽略了指定物理属性;明确写出该属性只使合理性略有下降,且未达到显著水平。
推荐理由:该基准把视觉上难以辨认的物理属性纳入视频模型评测,为判断生成视频能否支持机器人学习与规划提供了更具体的测试维度。
MMVistaReason提出一种面向多模态推理的开放数据后训练配方,结合分析型与真实世界推理数据、难度感知教师蒸馏、轨迹筛选和多教师在线蒸馏。该方法构建了MVR-SFT-528K与MVR-RL-63K,在15项多模态基准上,MVR-4B平均得分72.8,使用样本比MMFineReason少约70%;扩展到9B后平均得分达到74.4。
PartiCam 提出一种无需训练的相机控制视频生成方法,利用基于粒子过滤的全局与局部扩散奖励引导,使生成视频更准确地遵循指定相机轨迹。该方法基于 Sequential Monte-Carlo 引导加入局部细化阶段,在不重新训练模型的情况下改善轨迹遵循、减少漂移并提升视觉质量。
这篇研究提出在正交对齐后的新旧查询表示之间进行球面测地线插值,以在不重建图库嵌入的情况下改善跨模态检索。多组基准和模型族实验显示,该方法在多数评测设置中优于单独的正交对齐,并分析了有利的内部插值点为何会出现。论文已被 NeurIPS 2026 接收,代码已提供。
WorldAuditBench提出一个交互式3D世界审计基准,包含基于Unreal Engine 5构建的13个环境和213项异常任务,覆盖五类异常。论文在固定探索预算下评估五个前沿模型,采用VLA探索后由VLM识别异常,以及端到端VLM智能体两种范式,成功率为6.6%至42.3%,低于人类的83.4%。
推荐理由:WorldAuditBench将3D世界审计拆为探索行动与视觉推理,并用统一预算比较两种范式,可用于评估多模态智能体的证据搜集能力。
Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。
推荐理由:该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。
MM-FinEval 是一个用于评估多模态大语言模型金融预测能力的基准,涵盖 2019 至 2022 年的 2,045 个 S&P 500 财报电话会,并设置 12 个金融任务标签。每条输入包含逐字稿、电话会演示文稿和完整音频,论文进一步比较了 19 个基线模型。结果显示,处理三种模态的小型 Any-to-Any 模型表现较强,部分情况下优于仅处理两种模态的大型专有模型。
EPIC提出一种零样本生成流程,将现有视频扩散模型扩展到4K立体360°视频生成。论文设计了感知极线几何的360°图像匹配指标,用于捕捉跨视角的时序与立体不一致,并在有限训练数据下进行直接偏好优化。
推荐理由:论文将极线感知的360°图像匹配指标作为偏好信号,用于有限训练数据下的直接偏好优化,为沉浸式视频的一致性优化提供了可复用思路。
该研究提出 SEGUE 框架,让视频生成器在中途切换提示词时先完成必要的状态过渡,再交还控制权给用户提示词。在包含 1,800 次切换的 OpenTrans-360 上,SEGUE 将整体得分从 0.866 提升至 0.887,并在八项过渡指标中均排名第一;其规划器也能迁移到无需重新训练的冻结自回归生成器。
推荐理由:论文将中途提示词切换拆解为带状态和时长的过渡,并用两个基准展示了对生成连贯性与指令响应的改善。
论文提出 World-As-Graph(WAG),一种基于图的对象中心世界模型,将关系归纳偏置引入 JEPA 风格的预测表示学习。WAG通过关系感知结构诱导构建随时间变化的潜空间图,并结合邻近对象关系与历史记忆更新对象级动态状态,用于自回归未来预测;论文在视觉推理和机器人操作任务上进行了实验。
论文提出 BadAction,用预定义动作模式作为后门触发器,使交互式视频生成模型在触发后生成不再响应后续动作的冻结未来帧,同时保持对正常动作序列的行为。实验显示,动作单模态触发器的平均攻击成功率为 91.0%,多模态触发器为 80.4%;该方法还成功绕过现有后门检测方法,暴露交互式视频生成流程中的安全缺口。
推荐理由:论文把交互式视频生成的攻击面具体化为动作序列触发器,并给出攻防实验,便于评估模型在可控生成场景中的安全边界。
论文提出 LongLive-Plug,一种将蒸馏能力学习为基础模型 LoRA 的一次性框架,可免训练即插即用于兼容的下游视频模型。它覆盖单次 CFG、少步采样和长上下文错误校正,并在三类骨干网络、54 个下游模型和八类任务上进行了验证。
推荐理由:论文给出把单次 CFG、少步采样和长上下文纠错封装为可复用 LoRA 的方案,并以 54 个下游模型展示跨任务免训练部署路径。