跳到正文

全部动态

今日 1 条
10月1日周四
  1. arXiv · 多模态、视频与世界模型76

    FrameMorrow:用前瞻 tokens 指导长时视频生成中的帧选择

    论文提出 FrameMorrow,通过预测代表未来信息需求的少量 prospective tokens,从历史中选择相关帧,以支持长时视频生成。该方法选择显式历史帧而非模型内部状态,可接入包括闭源模型在内的不同生成器,并在 5 个基准、11 个生成模型上评估了长视频生成、交互生成和动作条件世界模型任务,报告了长程一致性、视觉质量与动作对齐的持续提升。

    推荐理由:论文把历史选择从当前相关性转向未来信息需求,并以显式历史帧接入不同生成器,为长视频和交互生成的记忆设计提供了可复用思路。

  2. arXiv · 多模态、视频与世界模型79

    SceneJail 利用视频场景上下文攻击多模态大语言模型

    SceneJail 提出一种自适应黑盒越狱框架,通过构造兼容场景并搜索场景相关提示词,攻击视频多模态大语言模型。该方法在包含八个 Video-MLLMs 的评测中,SceneJail-F 的平均攻击成功率最高达 91.5%,较最强基线高 29.1 个百分点。将有害查询分布到连续帧的 SceneJail-S 在严格图像过滤下仍达到 72.3% 的攻击成功率。

    推荐理由:论文将视频场景从有害查询的载体提升为攻击面,为 Video-MLLM 安全评测和防御设计提供了可复用的测试思路。

  3. arXiv · 多模态、视频与世界模型68

    World-As-Graph:通过潜空间图进行关系世界建模

    论文提出 World-As-Graph(WAG),一种基于图的对象中心世界模型,将关系归纳偏置引入 JEPA 风格的预测表示学习。WAG通过关系感知结构诱导构建随时间变化的潜空间图,并结合邻近对象关系与历史记忆更新对象级动态状态,用于自回归未来预测;论文在视觉推理和机器人操作任务上进行了实验。

  4. arXiv · 多模态、视频与世界模型79

    BadAction:通过动作引导触发器攻击交互式视频生成

    论文提出 BadAction,用预定义动作模式作为后门触发器,使交互式视频生成模型在触发后生成不再响应后续动作的冻结未来帧,同时保持对正常动作序列的行为。实验显示,动作单模态触发器的平均攻击成功率为 91.0%,多模态触发器为 80.4%;该方法还成功绕过现有后门检测方法,暴露交互式视频生成流程中的安全缺口。

    推荐理由:论文把交互式视频生成的攻击面具体化为动作序列触发器,并给出攻防实验,便于评估模型在可控生成场景中的安全边界。

  5. arXiv · 多模态、视频与世界模型71

    超越预测:用回顾性世界建模引导 VLM 智能体

    这篇论文提出回顾性世界建模,让 VLM 智能体根据状态转移反向估计最可能导致该转移的动作。作者进一步设计自洽奖励,将策略动作与回顾性解释之间的一致性转化为强化学习中的逐转移反馈;实验显示,该方法相比仅使用前向世界建模的基线提升了策略的鲁棒性和泛化能力。

  6. arXiv · 多模态、视频与世界模型71

    S-OPD:仅增强教师监督足以解锁多模态 On-Policy Distillation 的学生侧学习吗?

    S-OPD 提出一种多模态 On-Policy Distillation 框架,通过 Teacher-calibrated Policy Contrast 和 Policy Agreement 强化学生对视觉证据的依赖及抗噪感知。该方法无需额外数据标注、模型参数或推理操作,覆盖八个基准测试,LogicVista 最高提升 4.25 分,并可与教师侧监督方法结合获得进一步提升。

  7. arXiv · 多模态、视频与世界模型75

    UACD:面向少步视频生成的不确定性感知一致性蒸馏

    Lingyu Liu 提出不确定性感知一致性蒸馏方法 UACD,通过局部不确定性估计降低高难度时空区域的一致性监督权重。结合特征空间对抗训练、语义对齐和 LoRA 适配后,50步 Wan 模型实现了4步视频生成,在 VBench 2.0 上取得 0.556 mean score,并在用户研究中获得更高偏好。

  8. arXiv · 多模态、视频与世界模型86

    Asking the World 提出智能体世界建模与探测方法,提升视频物理推理

    Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。

    推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。

  9. arXiv · 多模态、视频与世界模型80

    MindWorldBench:评估图生视频中的心理状态到行为推理

    Ruiqi Li 等人提出 MindWorldBench,评估图生视频模型根据心理状态生成行为的能力。该基准使用 Zero-Action Prompting 和包含 744 个提示的反事实设计,并对 11 个模型进行评测。结果显示,模型虽然具备视觉保真度和物理推理能力,但难以让行为与潜在心理状态一致,常出现偏向客观世界状态而非人的主观信念的 Omniscient Bias。

    推荐理由:论文用 744 个反事实提示评估图生视频的心理状态到行为推理,并揭示模型偏向客观世界状态的失败模式。

  10. arXiv · 多模态、视频与世界模型38

    线性循环记忆足以蒸馏用于机器人空气曲棍球的世界模型策略

    一项机器人空气曲棍球防守研究表明,采用64维状态的纯线性循环模型(k=0)蒸馏DreamerV3教师策略后,在暂时失去冰球追踪时的表现可匹配GRU基线和教师策略。五个匹配随机种子的实验显示,增加非线性创新秩未带来测得收益;该模型循环参数更少、计算量更低。结论仅限于文中设定的模拟任务、教师、状态维度和 blackout horizon。

  11. arXiv · 多模态、视频与世界模型66

    TPAE:通过 Token 级视觉落地优势估计强化多模态推理

    论文提出 Token 级感知落地优势估计(TPAE),利用 token 的视觉依赖与预测熵,为多模态推理生成细粒度强化学习监督信号。分析显示,正确推理链在视觉落地增强时熵下降更明显,关键 token 也是正确推理链联合分布中的统计异常点。TPAE 在七个基准上持续优于强基线,并带来更稳定、高效的优化。

  12. arXiv · 多模态、视频与世界模型31

    LocoWM:世界模型引导的残差适应实现高精度运动控制

    LocoWM提出世界模型引导的预主动残差适应框架,提升机器人高精度运动控制能力。基础策略负责跟随运动指令,动作条件世界模型根据本体感知历史预测未来物理状态,残差适配器据此生成动作修正。地形调平、加速度补偿和推搡恢复实验显示,LocoWM相比端到端和反应式残差基线具有更高控制精度与抗扰性。

  13. arXiv · 多模态、视频与世界模型79

    MEND:无标签检测、定位与校正世界模型中的潜在幻觉

    论文提出 MEND,用一个基于真实状态转移训练的条件 score network,在没有错误标签的情况下检测、定位并尝试校正冻结世界模型中的潜在幻觉。在两个导航环境中,MEND 的幻觉检测 AUROC 最高达 0.80,逐 token 定位 AUPRC 最高达 0.87,且不使用动作信息。推理时校正可降低单步潜在误差并改善预测,但部分误差位于数据流形切向方向,论文因此重点讨论检测与定位。

    推荐理由:论文把世界模型的潜在幻觉拆成检测、定位和推理时校正三个可评估环节,并给出无需错误标签的指标结果,适合参考相关鲁棒性研究设计。

  14. TechCrunch · AI53

    Google 发布 Gemini 4 Argon,主打防御性网络安全与复杂任务处理

    Google 发布 Gemini 4 Argon,称其面向编码、研究和写作等任务,尤其擅长防御性网络安全,并可自主发现、验证和修复关键软件漏洞。Argon 目前仅通过 Fairwind Program 向一组选定的网络安全合作伙伴开放。Google 还称其在多项基准测试中高于 OpenAI 的 GPT-6 Astra 及 Anthropic 的 Fable、Opus。

  15. The Decoder84

    Google 发布 Gemini 4 Argon,性能追近 OpenAI 和 Anthropic 但未形成明确领先

    Google 发布前沿模型 Gemini 4 Argon,支持文本、图像、视频和音频输入,输出文本,初期仅向 Fairwind 计划中的“trusted cyber defenders”和内部团队开放。

    推荐理由:文章同时给出独立评测、价格与 token 消耗,能帮助读者区分 Gemini 4 Argon 的性能追赶、成本优势和效率代价。

  16. 宝玉74

    谷歌发布新一代旗舰模型 Gemini 4 Argon,在 19 项对比测试中 13 项第一,输出上限从上一代 6.4 万 token 提升到单次最多 100 万 token。

    引用Sundar Pichai@sundarpichai

    Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:

  17. Runway · 研究与模型81

    Runway 宣布开放权重世界动作模型 Praxis-1

    Runway宣布Praxis-1,这是其首个开放权重世界动作模型,目前正与早期伙伴在不同机器人具身和环境中测试,并计划未来几个月公开发布。Praxis-1基于大规模视频预训练,Runway称其在世界模型中模拟机器人策略与现实结果的相关性达到0.95。早期测试伙伴包括Noble Machines、Standard Bots和Ultra,模型将在各自硬件上运行。

    推荐理由:Praxis-1将视频预训练用于跨具身机器人策略,并以0.95相关性仿真结果和多种硬件测试说明其开放权重路线。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 发布 SynthID Bio,为 AI 设计蛋白质加入可验证水印

    Google DeepMind 发布 SynthID Bio,可将不可感知的签名嵌入蛋白质序列或预测的3D结构,并在合成后的实体蛋白质上验证来源。实验覆盖 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标,水印设计保持了未加水印版本的命中率、结合亲和力和天然序列多样性。Google DeepMind 同时开放方法论文、代码、体外数据和研究权重。

    推荐理由:文章同时给出蛋白序列与3D结构水印的实现路径、实验边界和开放内容,便于判断其在生物安全审查与科研数据库溯源中的落地位置。

  2. 可灵 · 模型与创作实践81

    Kling 4.0 与 3.0 有哪些不同

    Kling 4.0将于2026年10月正式发布,原生视频生成时长从3–15秒扩展至3–30秒,并支持最多10个关键帧。新版本还支持最多15个组合参考资产、10-bit HDR、双声道立体声和定向多模态视频编辑。Kling 4.0 Flash已于9月28日向有限用户开放提前体验。

    推荐理由:这篇对比把时长、关键帧、参考资产和视频编辑放在同一框架中,便于按项目复杂度选择 Kling 3.0 或 4.0。

  3. 可灵 · 模型与创作实践83

    Kling 4.0 AI 视频创作完整指南:多模态参考与30秒生成

    Kling 4.0完整模型计划于2026年10月发布,新创作体验自9月28日起向有限用户逐步开放早期访问。模型支持3至30秒原生视频生成、最多10个关键帧,以及最多15个组合参考素材,并提升运动稳定性、角色与商品一致性、音画同步和视频编辑能力。

    推荐理由:文章梳理了从多模态参考、关键帧到时间线审片的完整链路,可用于规划商品广告和短叙事视频的生成与修订流程。

  4. Hugging Face Blog77

    Hugging Face 发布 Open TTS Leaderboard,支持多语言与语音克隆评测

    Hugging Face 发布 Open TTS Leaderboard,用客观指标评估开放源码 TTS 模型的可懂度、速度和说话人相似度,并覆盖多语言与语音克隆场景。排行榜使用 WER/CER、RTFx、TTFA 和 SIM,支持在 H200 GPU 与 CPU 上比较流式性能,并提供 Listen 标签页供用户试听和投票。

    推荐理由:该排行榜把 WER/CER、推理速度和说话人相似度纳入统一评测,并保留试听投票,便于比较开放源码 TTS 在多语言和流式场景中的取舍。

  5. arXiv · 多模态、视频与世界模型76

    PRISM通过反事实视频生成扩展人形机器人移动操作训练

    PRISM提出一个真实到仿真再到真实框架,用少量真实视频生成大规模多样的人体与物体交互训练数据。研究通过视频到视频生成数百条反事实视频,再重建并调整人和物体的运动轨迹,训练出无需真实世界微调的策略。搭载该策略的人形机器人仅使用机载深度观测,就能在不同物体实例、尺寸和初始配置下完成箱子、桶、箱体和球的拾取、搬运与放下。

    推荐理由:PRISM展示了如何用少量真实交互视频生成反事实数据,并通过真实到仿真再到真实流程训练人形机器人的移动操作策略。

  6. arXiv · 多模态、视频与世界模型82

    LongLive-Plug 提出一次性蒸馏框架,支持视频生成模型即插即用复用

    论文提出 LongLive-Plug,一种将蒸馏能力学习为基础模型 LoRA 的一次性框架,可免训练即插即用于兼容的下游视频模型。它覆盖单次 CFG、少步采样和长上下文错误校正,并在三类骨干网络、54 个下游模型和八类任务上进行了验证。

    推荐理由:论文给出把单次 CFG、少步采样和长上下文纠错封装为可复用 LoRA 的方案,并以 54 个下游模型展示跨任务免训练部署路径。

  7. arXiv · 多模态、视频与世界模型82

    FracGen 论文提出受物理信号控制的断裂视频生成模型

    FracGen 论文提出一种从单张完整物体图像生成可控断裂视频的模型,并通过物理信号建模撕裂与形变过程。作者构建 FracSim 生成带有密集像素对齐物理场的断裂视频数据,用联合预测和物理约束损失训练模型。实验显示,FracGen 在物理保真度和视觉保真度上均优于现有视频生成基线,并可控制撕裂位置、裂纹传播速度及失效前形变量。

    推荐理由:论文将断裂模拟产生的物理场用于视频生成训练与约束,为可控物理动态建模提供了具体技术路径。

  8. arXiv · 多模态、视频与世界模型77

    LIFT:通过在策略自蒸馏实现大视点变化下的未来布局视频生成

    研究团队提出 LIFT 图像到视频生成框架,用最后一帧布局控制未来视图中应出现的内容及其位置。该方法通过在策略自蒸馏,将密集布局教师的控制能力迁移到最后一帧布局学生,并构建包含大视点变化、相机与时序一致布局标注的 LIFT-Vista 数据集;实验显示其视频质量、未来布局可控性和相机可控性优于其他方法。

    推荐理由:论文把最后一帧布局引入大视点变化的视频生成,为未来画面内容与空间位置的联合控制提供了可复用思路。

  9. arXiv · 多模态、视频与世界模型88

    HelixWorld:实时交互式音视频世界模型

    论文提出HelixWorld,使视觉场景与基于相机的空间立体声音在用户交互下共同演化。研究通过6-DoF相机轨迹和用户动作进行训练,并将模型蒸馏为低延迟流式模型,在单GPU上以24 FPS生成无漂移的音视频轨迹。论文还提出空间声学一致性与HelixBench,用于评估声音场是否跟随动态视点变化。

    推荐理由:论文将空间立体声纳入实时世界模型,并以24 FPS单GPU交互和HelixBench展示音画协同建模与评测路径。

9月28日周一
  1. Hugging Face Blog62

    H 公司发布 Holo4 系列通用电脑操作智能体模型

    H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。

    推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。

  2. ElevenLabs · 音频创作75

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型

    ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。

    推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。

9月24日周四
  1. Black Forest Labs · 图像与视频84

    Black Forest Labs 发布 FLUX 3 Action,开放 7B 机器人动作策略权重

    Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。

    推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。

9月23日周三
9月22日周二
9月16日周三
9月10日周四
  1. OpenAI News62

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色与电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,读者可据此判断语音类应用的接入门槛与能力边界。

9月8日周二
  1. OpenAI News60

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,官方称生成结果能更好地体现用户的想法。

    推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与生成定位,可据此判断参考图生图能力在创作流程中的位置。

9月3日周四