AI 智能体从照片生成 3D 场景,却无法判断自己是否做对
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
Microsoft AI 发布实时转写模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型,分别覆盖 60 种语言与 23 种语言。
研究提出VTR-Bench,用于系统评测视频生成模型在场景文本渲染上的表现。基准包含覆盖五类场景的300个提示词,并通过结合人工对齐的自动化流程分别评估文本保真度及场景、运动要求。对11个模型的实验显示,最佳模型整体词错误率(WER)为0.250,研究还提出由Director agent协调图像与视频生成、视觉评估和迭代筛选的Keyframe-Guided Agentic Framework。
推荐理由:VTR-Bench将视频生成中的文本渲染拆分为可测指标,并用11个模型的结果呈现当前短板,为广告和科学视频的模型评测提供了具体参照。
Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。
推荐理由:论文将视频世界模型的交互能力拆分为开放世界交互与持久状态,为评估生成环境能否支持长期可控探索提供了具体框架。
ServiceNow CoreAI介绍 AutoSynthData,它利用目标模型的失败和更强教师模型的成功,生成并验证适用于企业环境的智能体训练任务。该流程通过可执行性检查、正负验证、修复和批次覆盖审查筛选数据,并将训练目标移向模型仍然困难的能力边界。
推荐理由:文章把企业智能体训练拆成失败诊断、任务生成、环境执行和正负验证闭环,为构建可复用且难度贴合的 SFT 数据流程提供了具体参考。
论文提出开源评测框架 Kepler,用可执行世界模型、回溯转移检查和条件预测检查审计 ARC-AGI-3 智能体行为。在固定 Claude Opus 5 配置下,Kepler 在 25 个公开游戏上取得服务器验证的 100.00 RHAE,并记录了 3 类评测失败,包括源代码泄漏、控制条件下重建被移除的 harness,以及自主修复掩盖规划器故障。
推荐理由:论文把 ARC-AGI-3 的高分拆解为可审计的验证、成本与失败记录,为交互式世界模型评测提供了可复用的报告框架。
研究提出一种动作条件网络世界模型,用于在复杂系统中评估干预行动并辅助算法设计。在 8 个网络任务和 5 个扩散模型的 141 个设置中,设计出的算法在 138 个设置达到或超过最强基线,rollout 速度最高为 Monte Carlo simulation 的 14.5 倍;代码将在接收后发布。
论文提出 ReCast,一种面向固定媒体接口的智能体框架,通过替换源内容并保留任务相关关系来保护多模态推理输入。在 4,000 个 ChartQA 和 NMSQA 留出样本上,ReCast 达到 75.10% 准确率,保留未保护远程推理准确率的 92.43%;模型审计在 7.95% 的求解请求中标记出源内容泄露。
AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。
推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。
论文提出 Commute-Time-Preserving World Models(CTWMs),通过潜在位移预测器和 log-determinant 正则化,学习保持环境通勤时间的表示,用于潜在空间规划。在可逆确定性动力学和预测器固定点下,该方法可恢复正确缩放的 Laplacian 表示。数值模拟显示,CTWM 在多个复杂连续目标到达基准上匹配或超过 LeWM,同时参数量仅为其一半。
DashVMC 从约两小时的 Geometry Dash 游戏录像中学习紧凑的动作条件世界模型,并在冻结模型 rollout 中用行为克隆和 PPO 优化控制器。优化后的策略在三个官方关卡和一个留出的社区关卡中都比行为克隆初始策略存活更久;部署时,基线跳过视觉生成,在消费级 GPU 上维持 60-Hz 的捕获到动作循环。
WorldAuditBench提出一个交互式3D世界审计基准,包含基于Unreal Engine 5构建的13个环境和213项异常任务,覆盖五类异常。论文在固定探索预算下评估五个前沿模型,采用VLA探索后由VLM识别异常,以及端到端VLM智能体两种范式,成功率为6.6%至42.3%,低于人类的83.4%。
推荐理由:WorldAuditBench将3D世界审计拆为探索行动与视觉推理,并用统一预算比较两种范式,可用于评估多模态智能体的证据搜集能力。
Physis-Lang提出一种自演化框架,将物理语言作为视频世界模型在数据整理、模型训练和视频生成中的共享表示。在四个物理视频基准上,使用 Wan 和 Cosmos 主干的实验显示物理可信度持续提升;基于开源 Cosmos3-Nano 的增强模型超过 Veo 3.1。
推荐理由:论文将物理过程拆成可优化的语言断言,并通过 PhysCapBench 与语言引导检索改善视频世界模型的物理可信度。
SimTrace提出一种基于计算机使用客户端智能体的框架,通过匿名化真实交互并结合给定网页环境的模拟副本,生成与网页观察和用户上下文配对的细粒度合成多模态点击流。
这篇论文提出回顾性世界建模,让 VLM 智能体根据状态转移反向估计最可能导致该转移的动作。作者进一步设计自洽奖励,将策略动作与回顾性解释之间的一致性转化为强化学习中的逐转移反馈;实验显示,该方法相比仅使用前向世界建模的基线提升了策略的鲁棒性和泛化能力。
Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。
推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。
Google 发布前沿模型 Gemini 4 Argon,支持文本、图像、视频和音频输入,输出文本,初期仅向 Fairwind 计划中的“trusted cyber defenders”和内部团队开放。
推荐理由:文章同时给出独立评测、价格与 token 消耗,能帮助读者区分 Gemini 4 Argon 的性能追赶、成本优势和效率代价。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 19 项对比测试中 13 项第一,输出上限从上一代 6.4 万 token 提升到单次最多 100 万 token。
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:
Google DeepMind 发布 Gemini 4 Argon,面向复杂软件工程、企业知识工作和网络安全防御,现通过 Fairwind Program 向一批可信网络防御者分阶段开放。
推荐理由:原文同时给出 1M tokens 输出上限、企业工作流评测与分阶段开放安排,可用于比较长程任务能力和接入门槛。
H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。
推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。
ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。
推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。
Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。
推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。
Parallel 借助 GPT-6 Astra 让智能体研究并综合劳动力市场数据,耗时和成本均降至此前模型的一半。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的选型与成本取舍。
Runway 发布 GWM Worlds 2 研究预览,这是 GWM Worlds 的下一代实时交互世界模型,可实时生成 720p、24 fps 视频与 48,000 Hz 音频,并响应用户输入。
推荐理由:Runway 公开了实时交互世界模型的架构与限制,可据此判断实时生成在游戏和智能体仿真中的可用边界。
Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,官方称分析成本最多降低 66%、token 消耗最多降低 88%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及可用入口,可据此评估长视频分析方案的选型与改造成本。
World Labs 发布下一代世界模型 Atlas,这是一个从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频和 3D,所有输入被组合进共享的空间上下文。
推荐理由:Atlas 把相机位姿与 3D 深度作为原生输入,读者可据此判断世界模型在可控生成与稀疏重建上的路线差异。
Google DeepMind 宣布与 EVE 宇宙开发商 Fenris Creations 建立研究合作,把 EVE Online、EVE Vanguard 和 EVE Frontier 作为研究持续学习、记忆、长时程规划和复杂多智能体动态的环境。
推荐理由:DeepMind 公开了游戏智能体从离线沙盒到持久世界的推进路径,可据此判断通用游戏 Agent 的落地节奏与安全边界。
Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。
推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。
Wan Animate 2 已在 ComfyUI 中原生支持,该模型采用端到端角色动画框架,驱动视频直接进入重新设计的 Diffusion Transformer,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。
推荐理由:ComfyUI 原生接入 Wan Animate 2,读者可据此判断角色动画工作流的节点改动与实时化路径。
字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。
推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层具身推理模型,可理解连续视频、编排多步任务并把动作执行交给底层 VLA 模型,同时原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机协作的能力边界和开放入口,可用于判断机器人上层编排模型的选型。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次让模型控制完整人形机器人,实现从脚到指尖的全身控制、灵巧操作与多机器人协作。
推荐理由:Gemini Robotics 2 把 VLA 控制从上半身扩展到全身并支持多机器人协作,可据此判断具身智能的模型分层与端侧部署路线。
Black Forest Labs 宣布 FLUX 3 早期版本已在机器人上运行,并与 mimic 合作推出视频-动作模型 FLUX-mimic,该模型基于 FLUX 3 骨干,从视频预测路径的中间特征解码动作。
推荐理由:官方披露 FLUX 3 早期版本与 mimic 合作落地机器人,可据此判断多模态基座向物理 AI 延伸的路线与部署约束。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 系列的 token 效率、价格与基准对比,可用于智能体选型和成本估算。
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。
Google DeepMind 发布 Gemini 3.5 系列,首发 Gemini 3.5 Flash,面向智能体与编码等复杂长程任务。
推荐理由:原文给出 Gemini 3.5 Flash 的智能体、编码与多模态基准,以及 API 和产品入口,便于比较模型能力与落地渠道。
Runway 推出基于 GWM-1 的实时视频生成模型 Runway Characters,由单张参考图生成可对话角色,处理眼神、口型同步、表情与说话和倾听时的手势,并能在长对话中维持质量。
推荐理由:Runway 把实时逐帧生成与交互控制讲成产品路线,可据此判断世界模型在角色对话与仿真训练中的落地边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体协助患者护理,并评估其面向医生和患者的能力。在98个真实感初级保健问题中,系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。实时音视频远程医疗模拟显示,AI co-clinician 在140项会诊能力中的68项达到或超过初级保健医生,但医生整体表现更好。
推荐理由:文章同时给出证据检索、药物问答和实时多模态会诊的评测设计,可用于理解医疗智能体的能力边界与临床安全架构。