跳到正文

全部动态

今日 9 条
10月2日周五
  1. arXiv · 多模态、视频与世界模型70

    Gestalt:提出基于多模态交互的大型多模态模型

    Zequn Yang 等作者提出 Gestalt,一种围绕多模态交互构建的大型多模态模型。该模型采用多模态交互金字塔、统一离散扩散框架和通过可学习交互 token 促进跨模态交换的架构,论文称其在图像生成、多模态理解和纯文本评测中提升了跨模态融合,同时保留模态特有信息。

  2. arXiv · 多模态、视频与世界模型76

    SemanTok:面向高效自回归视频生成的可预测语义 token

    论文提出 SemanTok,一种将冻结的 DINO 特征输入编码器并由各保留 token 前缀独立重建的可变长度视频 tokenizer,用于自回归视频生成。201M SemanTok AR 模型的表现可匹配或超过参数规模为其 3.4 倍的 VideoFlexTok AR 模型。SemanTok 的短 token 前缀预测成本更低且生成保真度更高,像素细节则延后到后续 token。

    推荐理由:论文通过让每个保留 token 前缀独立重建冻结的 DINO 特征,提升自回归视频生成的语义对齐,并降低短前缀预测成本。

  3. arXiv · 多模态、视频与世界模型81

    Soundwich:用分层可控音频生成与视频同步

    Soundwich 提出一种无需训练的框架,将冻结的联合音视频 flow-matching 模型转化为可生成多条同步、可独立编辑音频轨道的系统。框架通过共享场景表示传递全局视听上下文,并让每条音频轨道与对应视觉来源进行跨模态交互,以保持声音与视频协调。论文称实验和人工评估显示其在时间控制、来源分离和自然度方面有所改善,生成的音频轨道可独立调整时序、静音、替换或重混。

    推荐理由:论文展示了如何在不训练新模型的情况下,把单一混音拆成可独立编辑的同步音频轨道,为音视频生成的后期重混与来源级控制提供参考。

  4. arXiv · 多模态、视频与世界模型72

    论文分析真实场景中的多模态 LLM 图像交互任务

    一项研究分析了40,000多条去标识化的 Microsoft Copilot 图像上传对话,并用涵盖感知、认知和生成的十类能力刻画用户任务。研究发现,多数图像任务涉及多种能力,且多模态使用覆盖的任务空间比纯文本交互更广。对照253个基准后,研究指出现有评测更集中于感知和固定答案推理,而文本、代码与数据生成等常见工作流覆盖较少;研究还在独立的 ChatGPT 数据集上验证了分类框架和发现。

  5. arXiv · 多模态、视频与世界模型56

    超越单模态基础:面向多模态数据的拉回几何

    Honglei Brinkmann 提出一种面向流形混合数据的拉回几何,以潜在高斯混合分布构造黎曼度量,减少将分离模态映射到单一高斯区域造成的传输变形。该方法通过支持自适应混合学习的 normalizing flow,实现分量级重建和局部有效维度估计。在合成几何数据、多视图图像和 MNIST 实验中,方法展现出较低的传输失真、接近参考轨迹的恢复结果和更真实的插值效果。

  6. arXiv · 多模态、视频与世界模型75

    JEPA-TTT:持续测试时训练让潜在世界模型适应动力学变化

    JEPA-TTT在测试时持续更新预训练、动作条件化JEPA世界模型的潜在动力学预测器,同时固定视觉编码器和奖励头,以适应训练与测试环境之间的动力学变化。该方法通过dense replay积累跨回合的预测窗口,规划不需要目标图像或在线环境奖励。在四个连续控制环境的八种动力学变化中,经过500个测试回合后,潜在自回归预测误差平均降低83%,规划性能较冻结的JEPA世界模型提升153%。

  7. arXiv · 多模态、视频与世界模型66

    CF-JEPA 通过可控性分解提升 JEPA 世界模型鲁棒性

    论文提出 CF-JEPA,将 JEPA 世界模型的潜空间拆分为可控与不可控子空间,以隔离视觉背景干扰。该方法在 2D 和 3D 控制任务的正常条件下表现相当,并在受干扰条件下提升性能,且论文称其是唯一未出现潜表示坍塌的模型;作者还在模拟机器人任务中进行了验证。

  8. arXiv · 多模态、视频与世界模型68

    多模态 LLM 视频标注的有效性与成本评估

    研究者系统评估短视频 VLM 标注中的采样、图像网格和单模态等启发式方法,比较分类准确率、下游推断有效性与每视频 token 成本。结果显示,准确率最高的配置可能导出错误结论,文本单模态也可能取得较强表现;通过简单镜头切换检测构建的单个 2×8 图像网格,其 κ 值与全视频理解相差不超过 .05,token 成本约为后者的 15%。

  9. arXiv · 多模态、视频与世界模型69

    《视频生成模型的后训练与对齐》综述

    Chaoyu Li 等作者发表《视频生成模型的后训练与对齐》综述,系统梳理预训练视频模型的后训练与对齐方法。论文按隐式与显式对齐区分方法,并归纳为监督微调、自训练与蒸馏、偏好与奖励、推理时方法四类,同时总结数据集、基准和评测实践。文章还讨论可扩展奖励设计、长时域时序一致性、稳定性与表现力权衡,以及安全生成等开放问题。

  10. arXiv · 多模态、视频与世界模型77

    Align Then Reason 提出多语言唇形同步评判器,提升配音质检效果

    Rui Liu 等提出 Align Then Reason(ATR),用静音视频和候选文本判断配音台词的内容与时序是否匹配。在七语言基准上,ATR 相比对应的 Qwen3.5 SFT 基线,2B、4B 和 9B 推理器的平均 AUC 分别提升 59.4%、50.2% 和 50.8%。

    推荐理由:论文把逐帧唇部表征与候选台词的音素单元先做单调对齐,再交给 LLM 联合判断内容和时序,为无配音音频时的配音审片提供了可复用流程。

  11. arXiv · 多模态、视频与世界模型79

    Kepler:面向 ARC-AGI-3 的可审计世界模型

    论文提出开源评测框架 Kepler,用可执行世界模型、回溯转移检查和条件预测检查审计 ARC-AGI-3 智能体行为。在固定 Claude Opus 5 配置下,Kepler 在 25 个公开游戏上取得服务器验证的 100.00 RHAE,并记录了 3 类评测失败,包括源代码泄漏、控制条件下重建被移除的 harness,以及自主修复掩盖规划器故障。

    推荐理由:论文把 ARC-AGI-3 的高分拆解为可审计的验证、成本与失败记录,为交互式世界模型评测提供了可复用的报告框架。

  12. arXiv · 多模态、视频与世界模型66

    CANOPY 提出面向多模态 RAG 的自适应粒度证据压缩框架

    CANOPY 提出一种面向多模态 RAG 的自适应粒度证据压缩框架,将文本、表格、图像和视频组织为层级结构,并按查询选择不同范围的证据区域。在包含 33M 个异构项目的语料库和五个问答基准上,CANOPY 的平均答案准确率高于评测中的检索基线;在 unrouted Qwen3-VL-8B-Instruct 设置中,压缩使读者输入证据 token 减少 14.2-27.7%,同时保持相近答案准确率。

  13. arXiv · 多模态、视频与世界模型77

    FutureWorlds 提出从替代未来学习机器人世界模型的方法

    FutureWorlds 提出一种从替代未来学习机器人世界模型的框架,结合多样化束搜索、候选专属记忆和 MemSPO 优化预测。在 RT-1、BridgeV2 和 RoboCasa 上,32 帧预测的 LPIPS 相比各自最强基线分别降低 14.78%、20.84% 和 9.12%。

    推荐理由:论文将候选未来的多样性、历史维护与相对质量学习放进同一训练框架,为机器人视频预测中的时序一致性和动作结果建模提供了可复用思路。

  14. arXiv · 多模态、视频与世界模型81

    论文提出 DynSC-Eval 评估长视频生成中的动态主体一致性

    论文提出 DynSC-Eval,通过动态跟踪视频中主体的可见生命周期,使用六项对象级指标评估局部连续性、全局身份保持和不一致事件。对5s、15s和60s视频生成的评测显示,传统指标会掩盖不同模型的主体一致性差异。

    推荐理由:论文将主体的可见生命周期纳入动态评测,并把一致性指标用于后训练,为长视频主体一致性的测量与优化提供了可复用思路。

  15. arXiv · 多模态、视频与世界模型82

    Ego2Act 提出面向目标驱动操作的第一视角视频生成评测基准

    论文作者提出 Ego2Act,用包含2,640段视频和110项日常任务的基准,评估模型根据初始场景图像和高层目标生成第一视角操作视频的能力。论文同时提出无参考评测流程 Ego2ActJudge,并发现模型常跳过或部分执行中间步骤,在复杂物体操作和持续世界建模中的细粒度物理动态表现不足。

    推荐理由:Ego2Act将多步物理操作和目标完成纳入视频生成评测,并提供无参考评测流程,便于比较模型的目标驱动模拟能力。

  16. arXiv · 多模态、视频与世界模型77

    PhysicsLENS 发布视频生成模型物理属性盲点评测基准

    PhysicsLENS 提出面向机器人物理属性合理性的评测数据集与基准,使用相同条件帧和任务、不同场景物理描述的配对场景,覆盖碰撞、重力、动量、摩擦、形变、流体和因果七个领域。对四个视频生成模型的评测包含 400 多个人工标注,结果显示 47 个外观合理的视频中有 34 个忽略了指定物理属性;明确写出该属性只使合理性略有下降,且未达到显著水平。

    推荐理由:该基准把视觉上难以辨认的物理属性纳入视频模型评测,为判断生成视频能否支持机器人学习与规划提供了更具体的测试维度。

  17. arXiv · 多模态、视频与世界模型65

    ReCast:面向固定接口多模态推理的关系保持保护框架

    论文提出 ReCast,一种面向固定媒体接口的智能体框架,通过替换源内容并保留任务相关关系来保护多模态推理输入。在 4,000 个 ChartQA 和 NMSQA 留出样本上,ReCast 达到 75.10% 准确率,保留未保护远程推理准确率的 92.43%;模型审计在 7.95% 的求解请求中标记出源内容泄露。

  18. arXiv · 多模态、视频与世界模型81

    AutoGUIWorld:用图像生成器构建 GUI 智能体视觉世界模型

    AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。

    推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。

  19. arXiv · 多模态、视频与世界模型64

    论文提出面向成功标准的辅助损失以改进潜在世界模型规划

    该论文提出一种以成功标准物理量为训练目标的辅助损失,用于提升潜在世界模型对任务成败的区分能力。作者在四个潜在世界模型中发现,末端执行器位置的潜在编码误差超过成功标准允许范围;该方法仅在训练阶段增加回归头,在 PushT 和 cube 上分别带来 3.5% 和 3.4% 的绝对成功率提升,训练后会丢弃回归头。论文链接为 https://arxiv.org/abs/2610.01224v1

  20. arXiv · 多模态、视频与世界模型72

    MMVistaReason提出开放数据后训练配方,提升多模态推理

    MMVistaReason提出一种面向多模态推理的开放数据后训练配方,结合分析型与真实世界推理数据、难度感知教师蒸馏、轨迹筛选和多教师在线蒸馏。该方法构建了MVR-SFT-528K与MVR-RL-63K,在15项多模态基准上,MVR-4B平均得分72.8,使用样本比MMFineReason少约70%;扩展到9B后平均得分达到74.4。

  21. arXiv · 多模态、视频与世界模型66

    CTWMs 学习保持通勤时间的世界模型以支持规划

    论文提出 Commute-Time-Preserving World Models(CTWMs),通过潜在位移预测器和 log-determinant 正则化,学习保持环境通勤时间的表示,用于潜在空间规划。在可逆确定性动力学和预测器固定点下,该方法可恢复正确缩放的 Laplacian 表示。数值模拟显示,CTWM 在多个复杂连续目标到达基准上匹配或超过 LeWM,同时参数量仅为其一半。

  22. The Decoder76

    Tavus推出 Griffin 人类交互模型,48%受试者将其误认真人

    Tavus推出 Griffin,这是一种面向实时面对面交流的 Human Interaction Model;Tavus称其研究中有48%的参与者在一分钟视频通话后相信 Griffin 是真人。

    推荐理由:材料提供了 Griffin 与真人及上一代 AI 的对照数据,并交代了研究预览的开放范围和安全前提,便于判断其当前成熟度。

  23. NVIDIA Blog36

    NVIDIA AI 工厂如何通过高效、耐用与通用性最大化投资回报

    NVIDIA通过高效、耐用和通用的AI工厂平台提升吞吐、延长硬件收益期,并扩大可承载的AI与非AI工作负载,以最大化投资回报。每兆瓦工厂成本约为$60 million,Vera Rubin NVL72较GB300 NVL72吞吐量提升超过30x,在DeepSeek V4 Pro上每百万tokens成本最高降低45x。A100自2020年出货后仍持续商用,CUDA跨代运行可避免既有硬件闲置。

  24. ComfyUI · 工作流与实践86

    ComfyUI 发布 Comfy Agent,现已登陆 Comfy Cloud

    ComfyUI 发布 Comfy Agent,现已向所有 Comfy Cloud 用户开放,并计划在几周后进入 Comfy Desktop。它可在画布中根据描述构建、运行和迭代工作流,支持比较模型、解释工作流、批量处理 20 张图片,并允许最多 5 个并行聊天。Comfy Agent 目前处于 beta 阶段,可领取免费初始聊天次数,并使用已有的 Comfy Credits。

    推荐理由:Comfy Agent 将工作流搭建、运行、迭代与错误处理放进对话协作,呈现了智能体介入 ComfyUI 创作流程的具体方式。

  25. ComfyUI · 工作流与实践77

    Comfy Agent 与 852話 Hakoniwa 如何创作动画短片《YUI》

    Comfy Agent 与 AI 动画艺术家 852話 Hakoniwa 共同完成了首部使用 Comfy Agent 创作的动画短片《YUI》。项目最终成片时长为 4:20,主要使用 Seedance 2.5 制作正片、MiniMax H3 制作幕后视频,并比较了 Wan 等视频模型。

    推荐理由:文章拆解了从角色设计、分镜准备到镜头重生成、模型比较和一致性检查的流程,并给出成本与工时参考。

10月1日周四
  1. arXiv · 多模态、视频与世界模型76

    《The Planning Limits of Latent World Models》揭示潜在世界模型的规划局限

    论文评估了基于 V-JEPA 2、V-JEPA 2.1、VideoMAEv2、VideoPrism 和 DINOv2 的世界模型在 Meta-World 与 BridgeData V2 机器人任务中的规划能力。

    推荐理由:论文将世界模型的可规划范围量化到控制步数,并比较了延长想象轨迹、MPC和专家子目标对远距离任务成功率的影响。

  2. arXiv · 多模态、视频与世界模型50

    MEQ提出互反馈多模态表征学习架构

    论文提出互反馈架构 MEQ,通过两个模态组件持续交换信息,将输入精炼为相互耦合的嵌入,并把交互固定点定义为最终输出。理论分析讨论了模型解释与避免失败的设计,分类和视觉定位实验显示,MEQ 在基于拼接的多模态分类任务上表现更优或具有竞争力,并能逐步改善视觉定位。

  3. arXiv · 多模态、视频与世界模型74

    PartiCam:通过奖励引导实现相机控制视频生成

    PartiCam 提出一种无需训练的相机控制视频生成方法,利用基于粒子过滤的全局与局部扩散奖励引导,使生成视频更准确地遵循指定相机轨迹。该方法基于 Sequential Monte-Carlo 引导加入局部细化阶段,在不重新训练模型的情况下改善轨迹遵循、减少漂移并提升视觉质量。