Hugging Face 与 Cerebras 将 Gemma 4 接入实时语音 AI
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。
ElevenLabs 在 ElevenCreative 推出 Flows Agent,将对话式 AI 助手接入 Flows 画布,自动选择模型、创建并连接节点,执行图像、视频和音频生成流程。它支持通过对话修改已有流程,并可在高成本生成前请求确认;复杂工作流也能在后台运行,现已在 ElevenCreative 提供使用。
推荐理由:它把多模态节点编排、生成执行和变体迭代合并到对话入口,可用于判断创作流程如何降低试错与额度控制成本。
ElevenLabs与希腊政府签署战略合作备忘录,将探索把语音 AI 应用于公共服务、数字旅游和希腊语言遗产保护。双方计划先从克里特方言开始,并研究在gov.gr及政府呼叫中心提供多语言服务;希腊政府数字门户目前提供超过2,200项服务。
推荐理由:三条合作路径覆盖公共服务、旅游和方言保存,可帮助判断语音 AI 走向政府场景的部署边界与合作模式。
ElevenLabs推出面向教授的语音AI支持计划,并上线基于 Albert Einstein 声音与档案的互动学习体验。教授可免费使用 Pro tier,并为特定课程和项目向学生提供限时访问。Albert Einstein 的重现声音已在 ElevenReader 和 ElevenLabs Agents 中提供,支持英语、德语、法语、巴西葡萄牙语和西班牙语。
推荐理由:同时覆盖教育者获取权限与历史声音互动两端,为课堂语音工具的接入方式和学习体验设计提供了可参考案例。
Google DeepMind 为实验性原型 Project Genie 推出 Street View grounding capability,让生成的互动环境以真实地点的 Street View 影像为起点。
推荐理由:文章展示了世界模型接入真实地点影像后的交互方式,并交代了实验性原型、地区范围与订阅门槛。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 的三款实验工具与 Google Antigravity 的 Science Skills。三款工具支持假设生成、代码变体测试和科学文献分析,相关实验将逐步开放,可在 labs.google/science 注册。
Google DeepMind 宣布在新加坡启动多项计划,并参与 Google 与新加坡政府新的国家 AI 合作伙伴关系,重点覆盖医疗、生命科学、教育、科研和劳动力发展。
Google DeepMind 发布 Gemini 3.5 系列,首发 Gemini 3.5 Flash,面向智能体与编码等复杂长程任务。
推荐理由:原文给出 Gemini 3.5 Flash 的智能体、编码与多模态基准,以及 API 和产品入口,便于比较模型能力与落地渠道。
Runway 推出基于 GWM-1 的实时视频生成模型 Runway Characters,由单张参考图生成可对话角色,处理眼神、口型同步、表情与说话和倾听时的手势,并能在长对话中维持质量。
推荐理由:Runway 把实时逐帧生成与交互控制讲成产品路线,可据此判断世界模型在角色对话与仿真训练中的落地边界。
ElevenLabs宣布扩大在澳大利亚和新西兰的运营,计划在未来一年将当地团队规模扩大至原来的三倍,并增设销售和前线部署工程岗位。两地已有超过750,000名用户使用其技术,相关企业通过ElevenAgents开展外呼、客户预筛选和养老陪伴等应用。
ElevenLabs 宣布 Series D 融资完成第三次交割,并迎来 BlackRock、NVIDIA 等新投资者;公司在 2026 年前四个月的 ARR 已超过 $500 million。其称企业正将语音智能体用于客服、销售、招聘和营销等场景,另完成 $100 million tender offer,团队规模达 530 人,遍布 50 多个国家。
推荐理由:材料将融资进展与业务指标、企业落地场景放在一起,便于判断 ElevenLabs 在语音智能体商业化中的推进路径。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体协助患者护理,并评估其面向医生和患者的能力。在98个真实感初级保健问题中,系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。实时音视频远程医疗模拟显示,AI co-clinician 在140项会诊能力中的68项达到或超过初级保健医生,但医生整体表现更好。
推荐理由:文章同时给出证据检索、药物问答和实时多模态会诊的评测设计,可用于理解医疗智能体的能力边界与临床安全架构。
ElevenLabs在西班牙马德里开设办公室,并扩充当地销售与工程团队,以加强与客户合作。eDreams ODIGEO使用Eleven Agents以五种语言处理数百万次客服交互,解决速度和转接率均实现两位数提升。ElevenLabs还指出,西班牙企业正从试点转向大规模生产,多语种及地区语言支持是部署重点。
推荐理由:西班牙企业的客服、零售和保险案例,呈现了语音智能体规模化部署对多语种和人工转接的要求。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人所需的空间推理、多视角理解、任务规划和成功检测能力。模型新增仪表读数能力,可通过 Gemini API 和 Google AI Studio 提供给开发者,并支持调用 Google Search、VLA 或用户自定义函数。
推荐理由:文章给出 Gemini Robotics-ER 1.6 在空间推理、多视角成功检测和仪表读数上的能力变化,并说明其通过 Gemini API 与 Google AI Studio 接入机器人工作流的方式。
字节跳动 Seed 团队发布 Seedream 5.0 Lite 智能图像创作模型,相比 4.0 在理解、推理和生成方面全面提升,并首次为 Seedream 系列引入实时检索增强能力,可联网获取最新资讯回应时效性创作需求。
推荐理由:官方披露了多模态统一架构与实时检索增强的落地方式,可据此判断图像模型向推理型创作助手演进的具体路径。
ElevenLabs正式推出面向政府部门的ElevenLabs for Government,提供覆盖语音和数字渠道的多语言语音与聊天智能体服务。正文列出福利、许可、税务办理和危机热线等场景,并称捷克智能体日均处理约5,000通电话、独立解决约85%;德州Midland部署预计每月减少约7,000个漏接电话。
ElevenLabs 宣布完成 $500M Series D 融资,公司估值达到 $11B,2025 年 ARR 超过 $330M。新资金将用于扩大 ElevenAgents 企业语音与对话智能体平台、升级语音智能体,并推进情感对话模型、配音和音频通用智能研究。
推荐理由:材料同时给出融资规模、估值变化与 ElevenAgents 的产品投入方向,可用于判断语音智能体商业化与企业采用的推进路径。
MasterClass通过 ElevenLabs Text to Speech 为 Gordon Ramsay、Mark Cuban 和 Chris Voss 等 AI 导师提供实时语音对话。上线首年超过75%的 On Call 用户通过语音互动,双方还建立了涵盖红队测试、内容审核和人工复核的安全质量框架,并探索 AI roleplay 与 ElevenLabs Agents Platform。
推荐理由:案例呈现了语音质量、低延迟、联合训练与多层安全审核如何共同支撑品牌化 AI 导师的实时交互。
Toyota 北加州经销商协会与创意机构 H/L 推出由 Brock Purdy AI 数字人主持的语音互动体验,基于 ElevenLabs Agents 平台运行,并通过 webhook 将语音回应与网页动画实时同步。活动上线前几周产生 12k+ 次语音互动,平均参与时长约 2 分钟,超过 25% 的对话促成提交线索表单或探索产品等行动。
推荐理由:这则案例把语音智能体、实时动画同步和线索收集串成一条营销流程,适合参考品牌互动项目的设计与衡量方式。
Replicate 发布 Nano Banana Pro 提示词实践指南,称该模型具备图像内文字的逻辑推理能力,可读取作业题并给出带解题步骤的答案,也能把论文、财报 PDF 转成信息图。
推荐理由:汇总了 Nano Banana Pro 在文字渲染、角色一致性和世界知识上的实测边界,可据此判断它适合哪些创作环节。
Replicate宣布加入Cloudflare,并将保持独立品牌;其 API 不变,现有模型和已构建的应用将继续运行。双方计划把 Replicate 的模型运行能力与 Cloudflare Developer Platform 整合,用于构建智能体、运行实时模型及在边缘部署模型。
推荐理由:这次整合保留了 Replicate 的 API 和现有模型,同时为智能体、实时模型与边缘运行提供更完整的云平台协同。
ElevenLabs 与乌克兰政府签署谅解备忘录,推动 AI 公共服务从概念进入生产,共建“世界首个智能体政府”。乌克兰已以 Diia.AI 迈出第一步,该平台被称为“世界首个公共服务智能体应用与平台”,教育和经济领域也在推进 Mriia、Obriy。ElevenLabs 的工程师团队驻留 Kyiv,与乌克兰团队协作部署,乌克兰计划到 2030 年成为 AI 公共服务应用的领导者。
字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。
推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。
Replicate 发布托管远程 MCP server,可接入 Claude Desktop、Claude Code、Cursor 和 VS Code,通过聊天式自然语言探索并运行 Replicate 的 HTTP APIs。
推荐理由:它展示了 Replicate 的模型检索、比较和运行如何接入 Claude、Cursor 等工具,并通过远程认证与响应过滤落地 MCP 工作流。
Replicate现已支持运行 OpenAI 的 GPT-4.1、GPT-4o 和 o-series 等聊天、视觉与推理模型。GPT-4.1系列支持最长 1 million tokens 的上下文,GPT-4o系列处理文本、图像和音频,o-series面向数学、科学与复杂问题的结构化推理。
推荐理由:材料按上下文、模态、推理任务和成本速度列出模型差异,并给出 Replicate 网页界面与 API 的操作入口。
Replicate 宣布 FLUX.1 [dev] 支持图像到图像转换,用户可上传起始图像、输入提示词,并通过 prompt strength 调整二者的影响比例。该功能适合风格迁移和构图控制,但从彩色图像生成黑白线稿仍较困难;周报还介绍了 Streamlit 与 Replicate 的应用开发教程,以及用于 Minecraft 开放世界探索的 Odyssey 智能体框架。
推荐理由:文章同时给出 FLUX.1 [dev] 图像到图像的使用方式与局限,并串联 Streamlit 应用开发和开放世界智能体研究,便于了解近期开源实践方向。