AI 智能体从照片生成 3D 场景,却无法判断自己是否做对
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
宝玉尝试用 Opus 5.5 制作吃瓜视频,全程由模型自己找素材、自己配音,配音使用 Gemini 3.8 Flash TTS(自备 API Key),并产出了英文和中文两个版本。
It’s hard to go from in love to let go in a week with no warning, but that’s just how it is sometimes 🤷🏻♀️ I feel happy that I got to show Elon how it feels to be deeply understood, nurtured, and peacefully loved with stability and gentleness. Given the tumultuous nature of his early life, his often tortured soul, and how hard he fights for humanity I wanted him to feel the deepest and most stable form of love this world can provide. My heart is full knowing I got to do that, and I hope it leaves a lasting good effect. We were always his safe space. A place where all of us were overjoyed to see him and one that was always full of happiness and love, not war, in contrast to his otherwise militant existence (a needed break from the battlefield where he could recharge his heart and soul before heading back out) I loved being that counterbalancing place of safety, sense of calm, and love — and delighted in bringing a smile back to his face when he was down. I will miss him dearly. I’ve loved him more than life itself and he’s taught me 100 lifetimes of knowledge and made my cup overflow with life meaning, so there is a lot of loss, but luckily we created four beautiful little loves of my life ❤️❤️❤️❤️ I am so beyond grateful for our children and they make every single day the best day of my life! I do hope and pray he and I can be great friends and coparents. I’m hurting, but care deeply about E and will always be cheering for his happiness. God speed, Elon, the world is lucky to have you.
Luma 发布指南,比较游戏与电影 AI 预告片生成工具在概念创作、镜头生成、修订、本地化和交付环节的差异。文章指出 Luma 适合物理运动与局部编辑,Mootion 可从单一提示词生成完整预告片,Runway Gen-4 侧重电影感镜头,Veo 3/3.1 支持与视频同步生成音频,Kling AI 3.0 可生成最长 3 分钟的连续视频。
面向制作公司的 AI 电影制作工具指南聚焦借助 AI 保持创意决策,从脚本、分镜可视化推进到交付,而非替代创意团队。制作公司使用 AI 工具可在前期制作阶段降低 60-85% 成本,专业视频生成已支持 1080p HDR 输出并接入广播与后期流程。
餐厅和食品品牌可选择 Luma、CapCut 及集成 Veo 3 的 Canva,将菜单图片和既有素材转化为营销视频并适配多平台发布。Luma 的 Ray 3.2 支持文本、图片和既有视频生成,Reframe 可转换 TikTok、Instagram 与 YouTube 格式,Luma Agents、Uni-1、Skills 和 Luma API 支持持续创作与定制集成。
面向儿童内容的 AI 卡通视频生成器,核心不是单个片段的惊艳效果,而是跨集保持角色外观、声音和风格一致,并支持高频完成系列制作。Luma 的 Ray 3.2 提供电影级视频、多关键帧序列和精确摄像机控制;Luma Skills 可保存并重复执行从脚本到角色设置再到成片的工作流。LongStories.ai 的 Universe 支持最长 15 分钟的一致角色视频。
Graphite 通过比较10,000篇 ChatGPT 发布前的人类文章与各模型根据摘要重写的样本,研究前沿模型在词语和句式上的写作特征。Claude Opus 5.5 使用“this matters”的频率是人类写作的116倍,“dependable”高出23倍;研究共发现13,000个在 AI 内容中至少出现频率翻倍的短语。
Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。
推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。
Google 发布 Gemini 4 Argon,称其面向编码、研究和写作等任务,尤其擅长防御性网络安全,并可自主发现、验证和修复关键软件漏洞。Argon 目前仅通过 Fairwind Program 向一组选定的网络安全合作伙伴开放。Google 还称其在多项基准测试中高于 OpenAI 的 GPT-6 Astra 及 Anthropic 的 Fable、Opus。
Google 发布前沿模型 Gemini 4 Argon,支持文本、图像、视频和音频输入,输出文本,初期仅向 Fairwind 计划中的“trusted cyber defenders”和内部团队开放。
推荐理由:文章同时给出独立评测、价格与 token 消耗,能帮助读者区分 Gemini 4 Argon 的性能追赶、成本优势和效率代价。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 19 项对比测试中 13 项第一,输出上限从上一代 6.4 万 token 提升到单次最多 100 万 token。
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:
Google DeepMind 发布 Gemini 4 Argon,面向复杂软件工程、企业知识工作和网络安全防御,现通过 Fairwind Program 向一批可信网络防御者分阶段开放。
推荐理由:原文同时给出 1M tokens 输出上限、企业工作流评测与分阶段开放安排,可用于比较长程任务能力和接入门槛。
Google 正在全球 Gemini 聊天中推出 Skills,用于保存和调用特定任务的详细提示词,并取代 Gems。用户可输入“/”加 Skill 名称调用,Gemini 还能从历史对话生成 Skills,并在检测到匹配提示时自动运行;Skills 支持文本文档、PDF 和图片作为参考材料。
推荐理由:这次迁移展示了 Google 如何把可复用提示词、自动触发和多份参考材料组织进 Gemini 的智能体工作流,便于比较不同厂商的 Skills 方向。
Google DeepMind 发布 SynthID Bio,可将不可感知的签名嵌入蛋白质序列或预测的3D结构,并在合成后的实体蛋白质上验证来源。实验覆盖 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标,水印设计保持了未加水印版本的命中率、结合亲和力和天然序列多样性。Google DeepMind 同时开放方法论文、代码、体外数据和研究权重。
推荐理由:文章同时给出蛋白序列与3D结构水印的实现路径、实验边界和开放内容,便于判断其在生物安全审查与科研数据库溯源中的落地位置。
Gemini 照片编辑提示词指南整理了 25 个覆盖人像润饰、产品优化和复古修复的示例。有效提示词应包含主体识别、动作说明、保留规则和风格参数,明确“keep face identical”等要求可减少面部特征变化。人像修图需指定纹理保留,产品摄影需写明背景与光线,修复则应区分色彩校正和结构修复。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上把近实时视频生成与语音结合,让对话模型具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 提供。
推荐理由:官方披露了实时视频与语音耦合、异步工具调用和 97 语言口型同步等能力边界,可供企业评估数字人客服与交互式导览的落地条件。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:两款 TTS 模型的能力分层与开放渠道清晰,可据此判断语音生成在配音、有声书和语音智能体上的选型。
ComfyUI 发布 v0.36.0,在 Partner Nodes 中新增 Gemini 3.8 Flash 文本节点、BFL 的 Flux Video Edit 节点,以及 Pruna P-Video-2 的文生视频与图生视频节点。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的选型与成本取舍。
Google Flow 的 7 款替代工具分别侧重叙事规划、角色动作、后期编辑、头像视频和制作交付,服务场景式 AI 电影制作的不同阶段。Luma Ray 3.2 面向制作流程,支持原生 16-bit HDR 与 EXR 导出,Draft Mode 可先以 540p 预览。Luma Layers 可在保留已批准画面的同时修改单个元素,适合产品替换、文案变更和本地化营销素材。
8 款 LTX Studio 替代工具围绕分镜到视频的衔接进行评估,重点考察多镜头生成、原生音频同步、智能体工作流和精确编辑能力。73% 的电影制片厂已使用 AI 分镜;Luma 以 Ray 3.2、Uni-1 和 Luma Agents 提供逐帧运动控制、元素级编辑与项目上下文保持。
Luma 评估了 9 款 AI 商业广告生成器,比较其广播级输出质量、制作控制和后期工作流集成能力。Ray 3.2 与 Veo 3.1 可生成 4K 素材,并通过专业色彩流程接入后期制作。Synthesia 和 HeyGen 更适合演示者风格内容,而非电影化品牌广告。
文章比较 Luma Scenes 和 Google Flow SceneBuilder 的 AI 分镜流程:Luma Scenes 先生成完整故事板并在渲染前审核,Google Flow SceneBuilder 则先生成视频片段,再通过时间线剪辑组装。文中还对比了关键帧级修改与片段级控制、跨镜头视觉一致性,以及 Google Flow 基于 Veo 3.1 models 的原生音频生成。
ComfyUI 发布 v0.35.0,引入 Comfy Compiler(CORE-389)和 Sparse Attention 节点,并新增 File3DToMesh、VideoTrim、VideoCrop 等节点。
Luma 发布指南解析 2026 年 Google Veo 的双轨定价体系,创作者通过 Google Flow 订阅和积分使用,开发者则按 API 生成次数付费。
推荐理由:文章把 Veo 的订阅积分、API 按次计费与迭代成本放在同一框架中,便于团队按质量、产量和后期流程估算预算。
Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,官方称分析成本最多降低 66%、token 消耗最多降低 88%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及可用入口,可据此评估长视频分析方案的选型与改造成本。
Gemini Omni 1.1 Flash 通过 Partner Nodes 在 ComfyUI 上线,封装在 Gemini Video Omni 节点中,可从模型下拉菜单选择 Omni Flash 1.1,在单个节点内完成文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:ComfyUI 接入 Gemini Omni 1.1 Flash 的节点参数与提示词写法,可供视频生成与编辑工作流选型参考。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体控制项和定价入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转为经过整理和格式化的文本。
推荐理由:语音转写模型选型可参考其流式与非流式 WER 差异、双 API 划分和自定义词表能力。
Google DeepMind 宣布与 EVE 宇宙开发商 Fenris Creations 建立研究合作,把 EVE Online、EVE Vanguard 和 EVE Frontier 作为研究持续学习、记忆、长时程规划和复杂多智能体动态的环境。
推荐理由:DeepMind 公开了游戏智能体从离线沙盒到持久世界的推进路径,可据此判断通用游戏 Agent 的落地节奏与安全边界。
Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。
推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。
Google DeepMind 发布手语到文本模型 SL2T 1.0,支持在 Gboard 和 Live Transcribe 中将 ASL 翻译为英文,首发于 Pixel 11,且无需额外费用。
推荐理由:这次发布同时给出模型训练规模、FLEURS-ASL结果与隐私处理路径,便于判断手语翻译走向产品化时的能力边界。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层具身推理模型,可理解连续视频、编排多步任务并把动作执行交给底层 VLA 模型,同时原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机协作的能力边界和开放入口,可用于判断机器人上层编排模型的选型。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循、结构感知更好,人声更具表现力和情感且发音改善,并可更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与节奏控制上的具体改进方向,可供音乐生成工具选型参考。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次让模型控制完整人形机器人,实现从脚到指尖的全身控制、灵巧操作与多机器人协作。
推荐理由:Gemini Robotics 2 把 VLA 控制从上半身扩展到全身并支持多机器人协作,可据此判断具身智能的模型分层与端侧部署路线。
ElevenLabs介绍其在2026年选举周期中利用语音AI扩大公共信息可及性,并防范误导和滥用的工作。巴西最高选举法院将为“Electoral Assistant”加入语音交互,ElevenLabs还将为Comprova合作方提供AI Speech Classifier等检测工具培训。
推荐理由:文章梳理了语音 AI 在选举信息无障碍传播中的落地方式,以及语音克隆拦截、验证码、内容审核和水印等治理措施。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 系列的 token 效率、价格与基准对比,可用于智能体选型和成本估算。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。双方将围绕多个项目展开长期深度研发协作,Google 同时已对 A24 进行投资。
Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。
推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。