跳到正文
10月3日 · 周六

最新精选

10月2日周五
  1. arXiv · 多模态、视频与世界模型79

    VTR-Bench:系统评测视频生成中的视觉文本渲染

    研究提出VTR-Bench,用于系统评测视频生成模型在场景文本渲染上的表现。基准包含覆盖五类场景的300个提示词,并通过结合人工对齐的自动化流程分别评估文本保真度及场景、运动要求。对11个模型的实验显示,最佳模型整体词错误率(WER)为0.250,研究还提出由Director agent协调图像与视频生成、视觉评估和迭代筛选的Keyframe-Guided Agentic Framework。

    推荐理由:VTR-Bench将视频生成中的文本渲染拆分为可测指标,并用11个模型的结果呈现当前短板,为广告和科学视频的模型评测提供了具体参照。

  2. arXiv · 多模态、视频与世界模型84

    Oneira:从开放式生成走向视频世界模型的开放世界交互

    Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。

    推荐理由:论文将视频世界模型的交互能力拆分为开放世界交互与持久状态,为评估生成环境能否支持长期可控探索提供了具体框架。

  3. arXiv · 多模态、视频与世界模型80

    DiVid 诊断视频生成模型的分维度多样性坍缩

    论文提出 DiVid,将视频生成多样性拆分为语义、风格、主体、场景、运动和摄影机六个维度。对代表性视频生成模型的系统评测显示,模型可能拥有较高全局多样性分数,却在运动和摄影机等因素上坍缩;这些差异在过滤不忠实生成后仍然存在。受控提示词实验进一步归纳出默认模式收敛和实现缺口两类瓶颈,框架计划发布以支持后续研究。

    推荐理由:DiVid将视频多样性拆成六个维度,并区分默认模式收敛与实现缺口,可为评测和训练目标设计提供更细的定位框架。

  4. arXiv · 多模态、视频与世界模型83

    多模态 RL 如何学会看:Same Reward, Different Skills 研究视觉学习信号

    论文研究发现,即使训练时不使用视觉信息,模型在测试时仍能恢复部分真实图像带来的能力增益,但持续使用真实图像训练可能削弱 grounding。作者提出 visual resolvability 设计规则,并在反事实坐标场景中用 GRPO 训练 7B 模型,使目标发现准确率从 0.425 提升至 0.875。

    推荐理由:论文提出视觉可解性这一设计规则,并用对照实验区分图像出现在提示中与视觉证据真正进入学习信号的差异。

  5. arXiv · 多模态、视频与世界模型79

    MosaiChunk:用时空记忆拼接提升自回归视频生成的一致性

    MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。

    推荐理由:MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。

  6. arXiv · 多模态、视频与世界模型85

    4Director:用刚性 3D 几何控制视频世界模型

    论文提出4Director,一种以显式4D场景表示控制相机和物体运动的视频世界模型。它为每个物体重建规范网格,并为每帧指定刚性变换,再通过Motion Adapter生成视角一致的外观、光照和非刚性动态。

    推荐理由:论文将刚性3D几何、视频生成和身份保持评测结合,为可控视频世界模型的设计与比较提供了具体参考。

  7. arXiv · 多模态、视频与世界模型83

    World Observer 通过联合演员与观察者生成实现持久世界建模

    论文提出 World Observer,通过联合生成面向智能体视角的演员和观察选定区域的全景观察者,让离开演员视野的物体继续演化并在重新进入时恢复更新后的状态。该方法基于共享全景源进行几何对应,并引入高分辨率透视参考的 Observer Sink,同时提出用于评估视野外演化的世界空间指标和覆盖真实、合成场景的基准。

    推荐理由:论文将视角外物体的持续演化转化为可观测、可评测的问题,为世界模型的空间覆盖与状态保持提供了具体设计和基准。

  8. arXiv · 多模态、视频与世界模型82

    HiPhy:通过层级对齐实现符合物理规律的多原理视频生成

    HiPhy提出一种基于强化学习的层级物理对齐框架,使视频生成同时遵循多个物理原理并保持场景的物理与语义一致性。研究构建了包含 50K 提示词的数据集和 MultiPhyBench 基准,实验显示 HiPhy 在多个基准上显著优于既有方法,涉及多种并发物理原理的场景提升最大。

    推荐理由:论文将物理规律拆分为局部动态与全局场景一致性目标,并用 MultiPhyBench 支持多物理原理视频生成的比较评估。

  9. Hugging Face Blog70

    AutoSynthData 将模型失败转为企业智能体训练数据

    ServiceNow CoreAI介绍 AutoSynthData,它利用目标模型的失败和更强教师模型的成功,生成并验证适用于企业环境的智能体训练任务。该流程通过可执行性检查、正负验证、修复和批次覆盖审查筛选数据,并将训练目标移向模型仍然困难的能力边界。

    推荐理由:文章把企业智能体训练拆成失败诊断、任务生成、环境执行和正负验证闭环,为构建可复用且难度贴合的 SFT 数据流程提供了具体参考。

  10. The Decoder78

    Black Forest Labs 发布 Flux 3 Image,支持不改变其他区域的多步编辑

    Black Forest Labs 发布 Flux 3 Image,主打在多步编辑中保持图像其他区域不变,并支持文生图、图生图、文字渲染和写实图像。模型支持用边界框构图、最多加入 10 张参考图,输出最高 4K;免费演示已开放,API 在 10 月 8 日前五折,商业权重可授权企业在自有基础设施上运行和微调,开放权重预计未来几周发布。

    推荐理由:Flux 3 Image 将多步局部编辑、参考图和边界框构图结合起来,适合评估图像工作流中的可控性与商品或角色保真需求。

  11. arXiv · 多模态、视频与世界模型85

    Memorizon:训练超越上下文窗口的世界模型

    论文《Memorizon》提出一种超越上下文窗口训练世界模型的方法,将长跨度重访监督与完整序列注意力解耦。训练样本可覆盖任意长度,但只对最后 k 个 chunks 评分,各 chunk 按相机共视关系检索自身的 top-K latents,共享 bank 上限为 kK;跨度从 100 s 增至 400 s 时,单步耗时增加 12%。

    推荐理由:论文将长跨度重访监督与完整序列注意力解耦,为训练世界模型的时序一致性提供了可复用的检索式方案和成本参考。

  12. arXiv · 多模态、视频与世界模型76

    SemanTok:面向高效自回归视频生成的可预测语义 token

    论文提出 SemanTok,一种将冻结的 DINO 特征输入编码器并由各保留 token 前缀独立重建的可变长度视频 tokenizer,用于自回归视频生成。201M SemanTok AR 模型的表现可匹配或超过参数规模为其 3.4 倍的 VideoFlexTok AR 模型。SemanTok 的短 token 前缀预测成本更低且生成保真度更高,像素细节则延后到后续 token。

    推荐理由:论文通过让每个保留 token 前缀独立重建冻结的 DINO 特征,提升自回归视频生成的语义对齐,并降低短前缀预测成本。

  13. arXiv · 多模态、视频与世界模型81

    Soundwich:用分层可控音频生成与视频同步

    Soundwich 提出一种无需训练的框架,将冻结的联合音视频 flow-matching 模型转化为可生成多条同步、可独立编辑音频轨道的系统。框架通过共享场景表示传递全局视听上下文,并让每条音频轨道与对应视觉来源进行跨模态交互,以保持声音与视频协调。论文称实验和人工评估显示其在时间控制、来源分离和自然度方面有所改善,生成的音频轨道可独立调整时序、静音、替换或重混。

    推荐理由:论文展示了如何在不训练新模型的情况下,把单一混音拆成可独立编辑的同步音频轨道,为音视频生成的后期重混与来源级控制提供参考。

  14. arXiv · 多模态、视频与世界模型77

    Align Then Reason 提出多语言唇形同步评判器,提升配音质检效果

    Rui Liu 等提出 Align Then Reason(ATR),用静音视频和候选文本判断配音台词的内容与时序是否匹配。在七语言基准上,ATR 相比对应的 Qwen3.5 SFT 基线,2B、4B 和 9B 推理器的平均 AUC 分别提升 59.4%、50.2% 和 50.8%。

    推荐理由:论文把逐帧唇部表征与候选台词的音素单元先做单调对齐,再交给 LLM 联合判断内容和时序,为无配音音频时的配音审片提供了可复用流程。

  15. arXiv · 多模态、视频与世界模型79

    Kepler:面向 ARC-AGI-3 的可审计世界模型

    论文提出开源评测框架 Kepler,用可执行世界模型、回溯转移检查和条件预测检查审计 ARC-AGI-3 智能体行为。在固定 Claude Opus 5 配置下,Kepler 在 25 个公开游戏上取得服务器验证的 100.00 RHAE,并记录了 3 类评测失败,包括源代码泄漏、控制条件下重建被移除的 harness,以及自主修复掩盖规划器故障。

    推荐理由:论文把 ARC-AGI-3 的高分拆解为可审计的验证、成本与失败记录,为交互式世界模型评测提供了可复用的报告框架。

  16. arXiv · 多模态、视频与世界模型77

    FutureWorlds 提出从替代未来学习机器人世界模型的方法

    FutureWorlds 提出一种从替代未来学习机器人世界模型的框架,结合多样化束搜索、候选专属记忆和 MemSPO 优化预测。在 RT-1、BridgeV2 和 RoboCasa 上,32 帧预测的 LPIPS 相比各自最强基线分别降低 14.78%、20.84% 和 9.12%。

    推荐理由:论文将候选未来的多样性、历史维护与相对质量学习放进同一训练框架,为机器人视频预测中的时序一致性和动作结果建模提供了可复用思路。

  17. arXiv · 多模态、视频与世界模型81

    论文提出 DynSC-Eval 评估长视频生成中的动态主体一致性

    论文提出 DynSC-Eval,通过动态跟踪视频中主体的可见生命周期,使用六项对象级指标评估局部连续性、全局身份保持和不一致事件。对5s、15s和60s视频生成的评测显示,传统指标会掩盖不同模型的主体一致性差异。

    推荐理由:论文将主体的可见生命周期纳入动态评测,并把一致性指标用于后训练,为长视频主体一致性的测量与优化提供了可复用思路。

  18. arXiv · 多模态、视频与世界模型82

    Ego2Act 提出面向目标驱动操作的第一视角视频生成评测基准

    论文作者提出 Ego2Act,用包含2,640段视频和110项日常任务的基准,评估模型根据初始场景图像和高层目标生成第一视角操作视频的能力。论文同时提出无参考评测流程 Ego2ActJudge,并发现模型常跳过或部分执行中间步骤,在复杂物体操作和持续世界建模中的细粒度物理动态表现不足。

    推荐理由:Ego2Act将多步物理操作和目标完成纳入视频生成评测,并提供无参考评测流程,便于比较模型的目标驱动模拟能力。

  19. arXiv · 多模态、视频与世界模型77

    PhysicsLENS 发布视频生成模型物理属性盲点评测基准

    PhysicsLENS 提出面向机器人物理属性合理性的评测数据集与基准,使用相同条件帧和任务、不同场景物理描述的配对场景,覆盖碰撞、重力、动量、摩擦、形变、流体和因果七个领域。对四个视频生成模型的评测包含 400 多个人工标注,结果显示 47 个外观合理的视频中有 34 个忽略了指定物理属性;明确写出该属性只使合理性略有下降,且未达到显著水平。

    推荐理由:该基准把视觉上难以辨认的物理属性纳入视频模型评测,为判断生成视频能否支持机器人学习与规划提供了更具体的测试维度。

  20. arXiv · 多模态、视频与世界模型81

    AutoGUIWorld:用图像生成器构建 GUI 智能体视觉世界模型

    AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。

    推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。