AI 智能体从照片生成 3D 场景,却无法判断自己是否做对
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
三年之后,大家是会拥有「一个」极其「懂你」的Agent,还是会拥有「一群」分工协作的 Agent Team? 基于你的判断,当下要做点什么方向调整吗?
Ready for a DevDay side quest? 10 builder challenges. 5 Codex Micros up for grabs. Complete any 5 side quests to earn 1 raffle ticket for each. 48 hours. Join from anywhere 🌎
NVIDIA DGX Spark 将推出 64GB 统一内存配置,支持在设备上运行最多 100B 参数模型,起售价为 $4,999。两台设备可通过 NVIDIA Sync Cluster Assistant 组建 128GB 集群,将模型支持范围扩展至最多 200B 参数;NVIDIA 在 Qwen 3.8 27B 测试中称,双机性能最高达到单机的 1.7x。
推荐理由:64GB 配置提供了从单机本地智能体到双机集群的渐进路径,适合评估本地推理、长上下文和多智能体工作流的硬件需求。
Microsoft AI 发布实时转写模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型,分别覆盖 60 种语言与 23 种语言。
研究提出VTR-Bench,用于系统评测视频生成模型在场景文本渲染上的表现。基准包含覆盖五类场景的300个提示词,并通过结合人工对齐的自动化流程分别评估文本保真度及场景、运动要求。对11个模型的实验显示,最佳模型整体词错误率(WER)为0.250,研究还提出由Director agent协调图像与视频生成、视觉评估和迭代筛选的Keyframe-Guided Agentic Framework。
推荐理由:VTR-Bench将视频生成中的文本渲染拆分为可测指标,并用11个模型的结果呈现当前短板,为广告和科学视频的模型评测提供了具体参照。
Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。
推荐理由:论文将视频世界模型的交互能力拆分为开放世界交互与持久状态,为评估生成环境能否支持长期可控探索提供了具体框架。
ServiceNow CoreAI介绍 AutoSynthData,它利用目标模型的失败和更强教师模型的成功,生成并验证适用于企业环境的智能体训练任务。该流程通过可执行性检查、正负验证、修复和批次覆盖审查筛选数据,并将训练目标移向模型仍然困难的能力边界。
推荐理由:文章把企业智能体训练拆成失败诊断、任务生成、环境执行和正负验证闭环,为构建可复用且难度贴合的 SFT 数据流程提供了具体参考。
彻底舒服了
论文提出开源评测框架 Kepler,用可执行世界模型、回溯转移检查和条件预测检查审计 ARC-AGI-3 智能体行为。在固定 Claude Opus 5 配置下,Kepler 在 25 个公开游戏上取得服务器验证的 100.00 RHAE,并记录了 3 类评测失败,包括源代码泄漏、控制条件下重建被移除的 harness,以及自主修复掩盖规划器故障。
推荐理由:论文把 ARC-AGI-3 的高分拆解为可审计的验证、成本与失败记录,为交互式世界模型评测提供了可复用的报告框架。
研究提出一种动作条件网络世界模型,用于在复杂系统中评估干预行动并辅助算法设计。在 8 个网络任务和 5 个扩散模型的 141 个设置中,设计出的算法在 138 个设置达到或超过最强基线,rollout 速度最高为 Monte Carlo simulation 的 14.5 倍;代码将在接收后发布。
论文提出 ReCast,一种面向固定媒体接口的智能体框架,通过替换源内容并保留任务相关关系来保护多模态推理输入。在 4,000 个 ChartQA 和 NMSQA 留出样本上,ReCast 达到 75.10% 准确率,保留未保护远程推理准确率的 92.43%;模型审计在 7.95% 的求解请求中标记出源内容泄露。
AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。
推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。
论文提出 Commute-Time-Preserving World Models(CTWMs),通过潜在位移预测器和 log-determinant 正则化,学习保持环境通勤时间的表示,用于潜在空间规划。在可逆确定性动力学和预测器固定点下,该方法可恢复正确缩放的 Laplacian 表示。数值模拟显示,CTWM 在多个复杂连续目标到达基准上匹配或超过 LeWM,同时参数量仅为其一半。
ComfyUI 发布 Comfy Agent,现已向所有 Comfy Cloud 用户开放,并计划在几周后进入 Comfy Desktop。它可在画布中根据描述构建、运行和迭代工作流,支持比较模型、解释工作流、批量处理 20 张图片,并允许最多 5 个并行聊天。Comfy Agent 目前处于 beta 阶段,可领取免费初始聊天次数,并使用已有的 Comfy Credits。
推荐理由:Comfy Agent 将工作流搭建、运行、迭代与错误处理放进对话协作,呈现了智能体介入 ComfyUI 创作流程的具体方式。
Comfy Agent 与 AI 动画艺术家 852話 Hakoniwa 共同完成了首部使用 Comfy Agent 创作的动画短片《YUI》。项目最终成片时长为 4:20,主要使用 Seedance 2.5 制作正片、MiniMax H3 制作幕后视频,并比较了 Wan 等视频模型。
推荐理由:文章拆解了从角色设计、分镜准备到镜头重生成、模型比较和一致性检查的流程,并给出成本与工时参考。
DashVMC 从约两小时的 Geometry Dash 游戏录像中学习紧凑的动作条件世界模型,并在冻结模型 rollout 中用行为克隆和 PPO 优化控制器。优化后的策略在三个官方关卡和一个留出的社区关卡中都比行为克隆初始策略存活更久;部署时,基线跳过视觉生成,在消费级 GPU 上维持 60-Hz 的捕获到动作循环。
WorldAuditBench提出一个交互式3D世界审计基准,包含基于Unreal Engine 5构建的13个环境和213项异常任务,覆盖五类异常。论文在固定探索预算下评估五个前沿模型,采用VLA探索后由VLM识别异常,以及端到端VLM智能体两种范式,成功率为6.6%至42.3%,低于人类的83.4%。
推荐理由:WorldAuditBench将3D世界审计拆为探索行动与视觉推理,并用统一预算比较两种范式,可用于评估多模态智能体的证据搜集能力。
Physis-Lang提出一种自演化框架,将物理语言作为视频世界模型在数据整理、模型训练和视频生成中的共享表示。在四个物理视频基准上,使用 Wan 和 Cosmos 主干的实验显示物理可信度持续提升;基于开源 Cosmos3-Nano 的增强模型超过 Veo 3.1。
推荐理由:论文将物理过程拆成可优化的语言断言,并通过 PhysCapBench 与语言引导检索改善视频世界模型的物理可信度。
SimTrace提出一种基于计算机使用客户端智能体的框架,通过匿名化真实交互并结合给定网页环境的模拟副本,生成与网页观察和用户上下文配对的细粒度合成多模态点击流。
这篇论文提出回顾性世界建模,让 VLM 智能体根据状态转移反向估计最可能导致该转移的动作。作者进一步设计自洽奖励,将策略动作与回顾性解释之间的一致性转化为强化学习中的逐转移反馈;实验显示,该方法相比仅使用前向世界建模的基线提升了策略的鲁棒性和泛化能力。
Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。
推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。
OpenAI 在 Dev Day 宣布让 ChatGPT 承担应用发现、启动和使用,并推出“Sign in with ChatGPT”、企业应用市场及 Dots 智能体。ChatGPT 将根据对话推荐应用,支持交互式扩展面板;Dots 可连接超过 4,000 个应用,企业市场首批有 30 多家合作方。OpenAI 尚未公布类似传统应用商店的计费或收入分成机制。
推荐理由:原文把 ChatGPT 的应用分发、身份层、企业市场与 Dots 串成一套路径,可用于判断 AI 入口如何改变软件发现和调用方式。
Google 发布前沿模型 Gemini 4 Argon,支持文本、图像、视频和音频输入,输出文本,初期仅向 Fairwind 计划中的“trusted cyber defenders”和内部团队开放。
推荐理由:文章同时给出独立评测、价格与 token 消耗,能帮助读者区分 Gemini 4 Argon 的性能追赶、成本优势和效率代价。
Flow Engineering 完成 $50 million Series B 融资,估值达 $750 million,Valar Equity Partners、Atreides Management 和 Sequoia Capital 参与投资。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 19 项对比测试中 13 项第一,输出上限从上一代 6.4 万 token 提升到单次最多 100 万 token。
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:
Google DeepMind 发布 Gemini 4 Argon,面向复杂软件工程、企业知识工作和网络安全防御,现通过 Fairwind Program 向一批可信网络防御者分阶段开放。
推荐理由:原文同时给出 1M tokens 输出上限、企业工作流评测与分阶段开放安排,可用于比较长程任务能力和接入门槛。
OpenAI在Dev Day上披露了Decisions API有限预览,可让模型在预设选项中快速作出决策,并支持图像理解、广泛语言和安全能力。该API被认为与TypeSafe AI面向软件自动化的Jev相似,后者可低成本、高速输出选项概率。QueryStory的演示显示,用Jev监控每次智能体行动的成本为$2.94,而使用frontier LLM为$372。
Google 正在全球 Gemini 聊天中推出 Skills,用于保存和调用特定任务的详细提示词,并取代 Gems。用户可输入“/”加 Skill 名称调用,Gemini 还能从历史对话生成 Skills,并在检测到匹配提示时自动运行;Skills 支持文本文档、PDF 和图片作为参考材料。
推荐理由:这次迁移展示了 Google 如何把可复用提示词、自动触发和多份参考材料组织进 Gemini 的智能体工作流,便于比较不同厂商的 Skills 方向。
ElevenLabs完成$300 million员工要约收购,估值达到$22 billion,是其2026年2月Series D估值的两倍。公司称企业客户已贡献55%的收入,ElevenAgents每周处理超过15 million次对话,较2月增长3x;其语音智能体平均比聊天智能体快31%解决问题。
推荐理由:企业收入占比、智能体处理量和多渠道部署数据,提供了观察语音智能体商业化进展的具体参照。
Give your app real-time decision-making with Decisions API, powered by GPT-6 Luna. Define questions and possible answers to classify content, route requests, or choose an agent’s next action. Available in limited preview.
Canva 宣布为 Meta 的个人 AI 智能体 Muse 接入 Canva 连接器,用户可在对话中创建设计,并使用品牌字体、颜色和素材。连接器还支持搜索设计库、导出文件,生成的 Canva 设计可继续编辑;该功能面向美国和加拿大用户开放。
推荐理由:这项连接把对话式规划与品牌素材、设计库搜索和可编辑设计串起来,可参考其在智能体创作工作流中的分工方式。
Luma 发布了一份护肤与美妆品牌 AI 提示词指南,提供 15 组覆盖产品图像、社交内容、邮件、广告和视频的提示词结构。指南强调七部分美妆产品图像提示词框架,以及针对 Instagram、TikTok 等平台调整格式和叙事方式。它还介绍了用 Layers 保留既有构图进行局部修改,并提到 Luma Agents、Skills 和 Ray 3.2 在连续创作流程中的应用。
H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。
推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。
ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。
推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。
Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。
推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。
Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。
推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。