时间序列世界模型中预测精度与机制一致性的分歧
该论文形式化并基准测试时间序列世界模型,发现预测误差与模型对改变后行动的机制一致性可能明显分离。基准涵盖八个公开数据集、七种骨干网络和五个随机种子;冻结潜在预测空间使平均 MAE 降低 9.9%,门控输出融合较输入拼接降低 12.7%。方向监督可在不改变 MAE 的情况下提升受惩罚机制上的一致性。
该论文形式化并基准测试时间序列世界模型,发现预测误差与模型对改变后行动的机制一致性可能明显分离。基准涵盖八个公开数据集、七种骨干网络和五个随机种子;冻结潜在预测空间使平均 MAE 降低 9.9%,门控输出融合较输入拼接降低 12.7%。方向监督可在不改变 MAE 的情况下提升受惩罚机制上的一致性。
论文提出一种针对返回图像的多模态 RAG 系统的自适应黑盒数据提取攻击,将恶意指令嵌入用户输入图像,并通过检索反馈探索嵌入空间。在单次 2500 次查询中,该方法最多重构 611 张放射学图像、566 份文档扫描件和 416 张通用图像,获得的数据存储项数量最高为非自适应基线的 5.6 倍。
论文研究发现,即使训练时不使用视觉信息,模型在测试时仍能恢复部分真实图像带来的能力增益,但持续使用真实图像训练可能削弱 grounding。作者提出 visual resolvability 设计规则,并在反事实坐标场景中用 GRPO 训练 7B 模型,使目标发现准确率从 0.425 提升至 0.875。
推荐理由:论文提出视觉可解性这一设计规则,并用对照实验区分图像出现在提示中与视觉证据真正进入学习信号的差异。
论文提出数据无关方法 ExpertLens,从预训练多模态 MoE 的路由权重中识别领域专长专家,并选择性微调目标领域相关专家。在数学、医疗和遥感任务上,该方法仅更新 21.7 - 47.0% 的模型参数,平均训练速度提升 4.0x,效果达到或超过全量微调。ExpertLens 在适配性能和训练效率上均优于 LoRA。
ServiceNow CoreAI介绍 AutoSynthData,它利用目标模型的失败和更强教师模型的成功,生成并验证适用于企业环境的智能体训练任务。该流程通过可执行性检查、正负验证、修复和批次覆盖审查筛选数据,并将训练目标移向模型仍然困难的能力边界。
推荐理由:文章把企业智能体训练拆成失败诊断、任务生成、环境执行和正负验证闭环,为构建可复用且难度贴合的 SFT 数据流程提供了具体参考。
论文《Memorizon》提出一种超越上下文窗口训练世界模型的方法,将长跨度重访监督与完整序列注意力解耦。训练样本可覆盖任意长度,但只对最后 k 个 chunks 评分,各 chunk 按相机共视关系检索自身的 top-K latents,共享 bank 上限为 kK;跨度从 100 s 增至 400 s 时,单步耗时增加 12%。
推荐理由:论文将长跨度重访监督与完整序列注意力解耦,为训练世界模型的时序一致性提供了可复用的检索式方案和成本参考。
Honglei Brinkmann 提出一种面向流形混合数据的拉回几何,以潜在高斯混合分布构造黎曼度量,减少将分离模态映射到单一高斯区域造成的传输变形。该方法通过支持自适应混合学习的 normalizing flow,实现分量级重建和局部有效维度估计。在合成几何数据、多视图图像和 MNIST 实验中,方法展现出较低的传输失真、接近参考轨迹的恢复结果和更真实的插值效果。
PhysicsLENS 提出面向机器人物理属性合理性的评测数据集与基准,使用相同条件帧和任务、不同场景物理描述的配对场景,覆盖碰撞、重力、动量、摩擦、形变、流体和因果七个领域。对四个视频生成模型的评测包含 400 多个人工标注,结果显示 47 个外观合理的视频中有 34 个忽略了指定物理属性;明确写出该属性只使合理性略有下降,且未达到显著水平。
推荐理由:该基准把视觉上难以辨认的物理属性纳入视频模型评测,为判断生成视频能否支持机器人学习与规划提供了更具体的测试维度。
AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。
推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。
该论文提出一种以成功标准物理量为训练目标的辅助损失,用于提升潜在世界模型对任务成败的区分能力。作者在四个潜在世界模型中发现,末端执行器位置的潜在编码误差超过成功标准允许范围;该方法仅在训练阶段增加回归头,在 PushT 和 cube 上分别带来 3.5% 和 3.4% 的绝对成功率提升,训练后会丢弃回归头。论文链接为 https://arxiv.org/abs/2610.01224v1
MMVistaReason提出一种面向多模态推理的开放数据后训练配方,结合分析型与真实世界推理数据、难度感知教师蒸馏、轨迹筛选和多教师在线蒸馏。该方法构建了MVR-SFT-528K与MVR-RL-63K,在15项多模态基准上,MVR-4B平均得分72.8,使用样本比MMFineReason少约70%;扩展到9B后平均得分达到74.4。
RoboCoach提出由世界模型驱动的主动教练框架,通过想象失败定位未完成的首个子任务,再选择示范采集对象和专家适配器进行更新。在22组任务策略组合中,想象成功与实际部署成功的相关系数为0.840;额外采集150条子任务示范后,Franka成功率从13.3%升至75.0%,AgileX从40.0%升至83.8%。
论文提出多模态因果蒸馏框架 MCD,通过结构保持的 token 干预识别并迁移教师模型使用多模态证据的方式。在三个 LVLM 家族和七个基准上,学生模型平均提升 7.23 分,较 vanilla distillation 高 4.68 分。
Physis-Lang提出一种自演化框架,将物理语言作为视频世界模型在数据整理、模型训练和视频生成中的共享表示。在四个物理视频基准上,使用 Wan 和 Cosmos 主干的实验显示物理可信度持续提升;基于开源 Cosmos3-Nano 的增强模型超过 Veo 3.1。
推荐理由:论文将物理过程拆成可优化的语言断言,并通过 PhysCapBench 与语言引导检索改善视频世界模型的物理可信度。
Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。
推荐理由:该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。
SimTrace提出一种基于计算机使用客户端智能体的框架,通过匿名化真实交互并结合给定网页环境的模拟副本,生成与网页观察和用户上下文配对的细粒度合成多模态点击流。
这项研究在受控测试床 GRIDUMM 中审计梯度冲突指标能否预测统一多模态模型的理解与生成权衡。在 63 个配置和 372 个测量检查点中,没有方向性冲突指标达到绝对 Spearman 相关系数 0.3 且置信区间排除零;单调压低冲突也未改变权衡结果。研究发现,功能干扰指标优于方向性冲突指标,训练损失则能较强地追踪该权衡,作者计划在论文接收后公开审计代码。
该研究提出位置级干扰图,用于定位统一多模态模型中图像理解与自回归图像生成之间的梯度冲突。在 Show-o 和 Janus-Pro 上,视觉 token 位置可解释较大比例的冲突差异,序列前四分之一的平均梯度余弦为 -0.18,末四分之一为 -0.02。
推荐理由:该研究为统一多模态模型理解与生成目标的梯度冲突提供了位置级诊断,并给出无需改架构的调制方法。
UniEvo-VL 提出一种让单个多模态模型分别充当教师和学生、利用自我批评反馈进行在策略自蒸馏的方法,以改进图像生成能力。在开源 Qwen-image-2512 上,GenEval 从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。
推荐理由:论文给出不依赖独立教师的多模态自蒸馏路径,并用 GenEval 与 GenEval2 Soft-TIFA 的分数变化展示其对图像生成改进的测量方式。
S-OPD 提出一种多模态 On-Policy Distillation 框架,通过 Teacher-calibrated Policy Contrast 和 Policy Agreement 强化学生对视觉证据的依赖及抗噪感知。该方法无需额外数据标注、模型参数或推理操作,覆盖八个基准测试,LogicVista 最高提升 4.25 分,并可与教师侧监督方法结合获得进一步提升。
论文提出 Token 级感知落地优势估计(TPAE),利用 token 的视觉依赖与预测熵,为多模态推理生成细粒度强化学习监督信号。分析显示,正确推理链在视觉落地增强时熵下降更明显,关键 token 也是正确推理链联合分布中的统计异常点。TPAE 在七个基准上持续优于强基线,并带来更稳定、高效的优化。
Runway宣布Praxis-1,这是其首个开放权重世界动作模型,目前正与早期伙伴在不同机器人具身和环境中测试,并计划未来几个月公开发布。Praxis-1基于大规模视频预训练,Runway称其在世界模型中模拟机器人策略与现实结果的相关性达到0.95。早期测试伙伴包括Noble Machines、Standard Bots和Ultra,模型将在各自硬件上运行。
推荐理由:Praxis-1将视频预训练用于跨具身机器人策略,并以0.95相关性仿真结果和多种硬件测试说明其开放权重路线。
Google DeepMind 发布 SynthID Bio,可将不可感知的签名嵌入蛋白质序列或预测的3D结构,并在合成后的实体蛋白质上验证来源。实验覆盖 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标,水印设计保持了未加水印版本的命中率、结合亲和力和天然序列多样性。Google DeepMind 同时开放方法论文、代码、体外数据和研究权重。
推荐理由:文章同时给出蛋白序列与3D结构水印的实现路径、实验边界和开放内容,便于判断其在生物安全审查与科研数据库溯源中的落地位置。
PRISM提出一个真实到仿真再到真实框架,用少量真实视频生成大规模多样的人体与物体交互训练数据。研究通过视频到视频生成数百条反事实视频,再重建并调整人和物体的运动轨迹,训练出无需真实世界微调的策略。搭载该策略的人形机器人仅使用机载深度观测,就能在不同物体实例、尺寸和初始配置下完成箱子、桶、箱体和球的拾取、搬运与放下。
推荐理由:PRISM展示了如何用少量真实交互视频生成反事实数据,并通过真实到仿真再到真实流程训练人形机器人的移动操作策略。
Hugging Face Blog介绍了用 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人数据流闭环的方法。
推荐理由:文章展示了机器人示范采集、增量同步、远程流式训练和硬件部署如何串成闭环,并交代了桶存储的审计与安全边界。
World Labs 公布其 R2S2R(real-to-sim-to-real)引擎的早期结果:模型可将一个真实机器人任务重建为可交互仿真,并系统性变化外观、物体配置、杂乱度、物理、机器人状态与相机视角,生成数千种变体。
NVIDIA 发布 Cosmos-H-Dreams,将 Cosmos-H-Surgical-Simulator 的手术世界模型能力蒸馏为可由机器人动作控制的实时生成式模拟器。
推荐理由:文章展示了如何通过蒸馏和流式推理把手术世界模型用于实时闭环模拟,便于理解其在策略评估与合成数据生成中的工作流。
Photoroom 发布 PRX 系列第四篇,介绍其预训练数据管线:混合公开与内部数据集,用 VLM 重新生成约 100-200 词的长描述,再转为 MDS 供训练流式读取。
推荐理由:Photoroom 公开 PRX 预训练数据管线的取舍与实测数据,为自建文生图数据流程提供可迁移的工程参考。
World Labs 发布文章,把当前被称为世界模型的能力拆成三类功能:渲染器输出像素、追求视觉保真;模拟器输出状态,要求几何、物理与动力学忠实;规划器输出动作,回答智能体下一步该做什么。
推荐理由:World Labs 把世界模型拆成渲染、模拟、规划三类,并说明模拟为何是连接视觉与行动的关键环节。
字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。
推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。
字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。
推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。
Replicate 发布创作案例汇总,介绍 ShieldGemma 2、Hunyuan3D 2Mini、CSM-1B、Orpheus-3B、Luma 和 Kling v1.6 Pro 等模型与社区实验。
Replicate 周报汇总本周开源 AI 动态:Black Forest Labs 发布图像生成模型套件 FLUX.1,含 pro、dev 和以 Apache 2.0 许可开源的 schnell 三个版本。
推荐理由:汇总一周开源模型与工具动态,并借编辑手记讨论生成模型作为世界镜像的反馈循环。
Fal.ai 发布 68 亿参数开源文生图模型 AuraFlow,性能对标闭源方案。研究者推出 llama.ttf,将完整语言模型推理引擎嵌入字体文件。Google DeepMind 提出 JEST 方法,数据筛选效率比随机采样高 13 倍,可用 10 倍更少算力训练高质量多模态模型。