AI 智能体从照片生成 3D 场景,却无法判断自己是否做对
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
Graphite 通过比较10,000篇 ChatGPT 发布前的人类文章与各模型根据摘要重写的样本,研究前沿模型在词语和句式上的写作特征。Claude Opus 5.5 使用“this matters”的频率是人类写作的116倍,“dependable”高出23倍;研究共发现13,000个在 AI 内容中至少出现频率翻倍的短语。
Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。
推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。
Google 发布 Gemini 4 Argon,称其面向编码、研究和写作等任务,尤其擅长防御性网络安全,并可自主发现、验证和修复关键软件漏洞。Argon 目前仅通过 Fairwind Program 向一组选定的网络安全合作伙伴开放。Google 还称其在多项基准测试中高于 OpenAI 的 GPT-6 Astra 及 Anthropic 的 Fable、Opus。
Google 发布前沿模型 Gemini 4 Argon,支持文本、图像、视频和音频输入,输出文本,初期仅向 Fairwind 计划中的“trusted cyber defenders”和内部团队开放。
推荐理由:文章同时给出独立评测、价格与 token 消耗,能帮助读者区分 Gemini 4 Argon 的性能追赶、成本优势和效率代价。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 19 项对比测试中 13 项第一,输出上限从上一代 6.4 万 token 提升到单次最多 100 万 token。
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:
Google DeepMind 发布 Gemini 4 Argon,面向复杂软件工程、企业知识工作和网络安全防御,现通过 Fairwind Program 向一批可信网络防御者分阶段开放。
推荐理由:原文同时给出 1M tokens 输出上限、企业工作流评测与分阶段开放安排,可用于比较长程任务能力和接入门槛。
Google DeepMind 发布 SynthID Bio,可将不可感知的签名嵌入蛋白质序列或预测的3D结构,并在合成后的实体蛋白质上验证来源。实验覆盖 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标,水印设计保持了未加水印版本的命中率、结合亲和力和天然序列多样性。Google DeepMind 同时开放方法论文、代码、体外数据和研究权重。
推荐理由:文章同时给出蛋白序列与3D结构水印的实现路径、实验边界和开放内容,便于判断其在生物安全审查与科研数据库溯源中的落地位置。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上把近实时视频生成与语音结合,让对话模型具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 提供。
推荐理由:官方披露了实时视频与语音耦合、异步工具调用和 97 语言口型同步等能力边界,可供企业评估数字人客服与交互式导览的落地条件。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:两款 TTS 模型的能力分层与开放渠道清晰,可据此判断语音生成在配音、有声书和语音智能体上的选型。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的选型与成本取舍。
Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,官方称分析成本最多降低 66%、token 消耗最多降低 88%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及可用入口,可据此评估长视频分析方案的选型与改造成本。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体控制项和定价入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转为经过整理和格式化的文本。
推荐理由:语音转写模型选型可参考其流式与非流式 WER 差异、双 API 划分和自定义词表能力。
Google DeepMind 宣布与 EVE 宇宙开发商 Fenris Creations 建立研究合作,把 EVE Online、EVE Vanguard 和 EVE Frontier 作为研究持续学习、记忆、长时程规划和复杂多智能体动态的环境。
推荐理由:DeepMind 公开了游戏智能体从离线沙盒到持久世界的推进路径,可据此判断通用游戏 Agent 的落地节奏与安全边界。
Google DeepMind 发布手语到文本模型 SL2T 1.0,支持在 Gboard 和 Live Transcribe 中将 ASL 翻译为英文,首发于 Pixel 11,且无需额外费用。
推荐理由:这次发布同时给出模型训练规模、FLEURS-ASL结果与隐私处理路径,便于判断手语翻译走向产品化时的能力边界。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层具身推理模型,可理解连续视频、编排多步任务并把动作执行交给底层 VLA 模型,同时原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机协作的能力边界和开放入口,可用于判断机器人上层编排模型的选型。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循、结构感知更好,人声更具表现力和情感且发音改善,并可更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与节奏控制上的具体改进方向,可供音乐生成工具选型参考。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次让模型控制完整人形机器人,实现从脚到指尖的全身控制、灵巧操作与多机器人协作。
推荐理由:Gemini Robotics 2 把 VLA 控制从上半身扩展到全身并支持多机器人协作,可据此判断具身智能的模型分层与端侧部署路线。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 系列的 token 效率、价格与基准对比,可用于智能体选型和成本估算。
Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。
推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款模型的延迟、单价与限制条件都写明了,可据此判断图像到视频链路的选型与成本。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方披露了连续语音翻译的延迟取舍与多产品开放节奏,可据此判断实时语音翻译的选型与接入时机。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。
World Labs 发布文章,把当前被称为世界模型的能力拆成三类功能:渲染器输出像素、追求视觉保真;模拟器输出状态,要求几何、物理与动力学忠实;规划器输出动作,回答智能体下一步该做什么。
推荐理由:World Labs 把世界模型拆成渲染、模拟、规划三类,并说明模拟为何是连接视觉与行动的关键环节。
Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。
推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。
Google DeepMind 发布 Gemini 3.5 系列,首发 Gemini 3.5 Flash,面向智能体与编码等复杂长程任务。
推荐理由:原文给出 Gemini 3.5 Flash 的智能体、编码与多模态基准,以及 API 和产品入口,便于比较模型能力与落地渠道。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体协助患者护理,并评估其面向医生和患者的能力。在98个真实感初级保健问题中,系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。实时音视频远程医疗模拟显示,AI co-clinician 在140项会诊能力中的68项达到或超过初级保健医生,但医生整体表现更好。
推荐理由:文章同时给出证据检索、药物问答和实时多模态会诊的评测设计,可用于理解医疗智能体的能力边界与临床安全架构。
Google 推出 Gemini 3.1 Flash TTS,提升语音质量、可控性与表现力,并支持 70+ 语言和原生多说话人对话。模型引入可通过自然语言控制音色、语速和表达方式的音频标签,开发者可在 Gemini API 和 Google AI Studio 预览,企业可通过 Vertex AI 预览,Workspace 用户可在 Google Vids 使用。
推荐理由:音频标签、多人对话和 70+ 语言支持,为评估语音产品的表达控制、全球化覆盖与 API 落地路径提供了具体参照。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人所需的空间推理、多视角理解、任务规划和成功检测能力。模型新增仪表读数能力,可通过 Gemini API 和 Google AI Studio 提供给开发者,并支持调用 Google Search、VLA 或用户自定义函数。
推荐理由:文章给出 Gemini Robotics-ER 1.6 在空间推理、多视角成功检测和仪表读数上的能力变化,并说明其通过 Gemini API 与 Google AI Studio 接入机器人工作流的方式。
Google DeepMind 的最新旗舰图像模型 Imagen 4 现可在 Replicate 上运行,目前为预览版,行为与功能可能变化,需求高时可能出现排队。
推荐理由:Replicate 上线 Google Imagen 4 预览版,读者可据此了解其文字渲染与细节表现及接入方式。
Replicate 周报汇总本周开源 AI 动态:Black Forest Labs 发布图像生成模型套件 FLUX.1,含 pro、dev 和以 Apache 2.0 许可开源的 schnell 三个版本。
推荐理由:汇总一周开源模型与工具动态,并借编辑手记讨论生成模型作为世界镜像的反馈循环。
Fal.ai 发布 68 亿参数开源文生图模型 AuraFlow,性能对标闭源方案。研究者推出 llama.ttf,将完整语言模型推理引擎嵌入字体文件。Google DeepMind 提出 JEST 方法,数据筛选效率比随机采样高 13 倍,可用 10 倍更少算力训练高质量多模态模型。