ElevenLabs 发布 Dubbing v2,支持保留原始表演的多语言配音
ElevenLabs 发布 Dubbing v2,通过直接参考原始表演,将语气、节奏、情绪和表达方式迁移到 90+ 种语言中。
推荐理由:Dubbing v2将原始表演纳入配音生成并自动对齐节奏,为多语言视频本地化提供了更完整的工作流参考。
ElevenLabs 发布 Dubbing v2,通过直接参考原始表演,将语气、节奏、情绪和表达方式迁移到 90+ 种语言中。
推荐理由:Dubbing v2将原始表演纳入配音生成并自动对齐节奏,为多语言视频本地化提供了更完整的工作流参考。
ElevenLabs与希腊政府签署战略合作备忘录,将探索把语音 AI 应用于公共服务、数字旅游和希腊语言遗产保护。双方计划先从克里特方言开始,并研究在gov.gr及政府呼叫中心提供多语言服务;希腊政府数字门户目前提供超过2,200项服务。
推荐理由:三条合作路径覆盖公共服务、旅游和方言保存,可帮助判断语音 AI 走向政府场景的部署边界与合作模式。
ElevenLabs 发布 Music v2 音乐生成模型,提升人声、器乐、编曲和多语言支持,并支持更复杂的歌曲结构。模型支持按片段局部重绘、分段构建完整歌曲,以及在同一首歌中处理多种曲风、快速说唱和非音乐音效。
推荐理由:Music v2 将局部重绘、分段作曲和多语言演唱整合到音乐生成流程,便于比较创作者、品牌与开发者的不同接入方式。
ElevenLabs表示,Voice Marketplace上的语音创作者收入在六个月内从$11 million翻倍至超过$22 million,平台已有10,400+名创作者。创作者可自行设定使用场景、价格档位和通知期,客户使用语音时按用量和条款产生收入,平台还提供同意、限制用途和移除语音等控制。Voice Library现覆盖32种语言,并向客户提供免费商业使用许可。
推荐理由:收入与创作者规模数据,结合授权条款、使用计费和撤回机制,呈现了语音 IP 从一次性授权转向持续分成的商业路径。
ElevenLabs推出面向教授的语音AI支持计划,并上线基于 Albert Einstein 声音与档案的互动学习体验。教授可免费使用 Pro tier,并为特定课程和项目向学生提供限时访问。Albert Einstein 的重现声音已在 ElevenReader 和 ElevenLabs Agents 中提供,支持英语、德语、法语、巴西葡萄牙语和西班牙语。
推荐理由:同时覆盖教育者获取权限与历史声音互动两端,为课堂语音工具的接入方式和学习体验设计提供了可参考案例。
Google DeepMind 为实验性原型 Project Genie 推出 Street View grounding capability,让生成的互动环境以真实地点的 Street View 影像为起点。
推荐理由:文章展示了世界模型接入真实地点影像后的交互方式,并交代了实验性原型、地区范围与订阅门槛。
Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。
推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 的三款实验工具与 Google Antigravity 的 Science Skills。三款工具支持假设生成、代码变体测试和科学文献分析,相关实验将逐步开放,可在 labs.google/science 注册。
Google DeepMind 宣布在新加坡启动多项计划,并参与 Google 与新加坡政府新的国家 AI 合作伙伴关系,重点覆盖医疗、生命科学、教育、科研和劳动力发展。
Google DeepMind 发布 Gemini 3.5 系列,首发 Gemini 3.5 Flash,面向智能体与编码等复杂长程任务。
推荐理由:原文给出 Gemini 3.5 Flash 的智能体、编码与多模态基准,以及 API 和产品入口,便于比较模型能力与落地渠道。
Runway 推出基于 GWM-1 的实时视频生成模型 Runway Characters,由单张参考图生成可对话角色,处理眼神、口型同步、表情与说话和倾听时的手势,并能在长对话中维持质量。
推荐理由:Runway 把实时逐帧生成与交互控制讲成产品路线,可据此判断世界模型在角色对话与仿真训练中的落地边界。
ElevenLabs宣布扩大在澳大利亚和新西兰的运营,计划在未来一年将当地团队规模扩大至原来的三倍,并增设销售和前线部署工程岗位。两地已有超过750,000名用户使用其技术,相关企业通过ElevenAgents开展外呼、客户预筛选和养老陪伴等应用。
ElevenLabs 宣布 Series D 融资完成第三次交割,并迎来 BlackRock、NVIDIA 等新投资者;公司在 2026 年前四个月的 ARR 已超过 $500 million。其称企业正将语音智能体用于客服、销售、招聘和营销等场景,另完成 $100 million tender offer,团队规模达 530 人,遍布 50 多个国家。
推荐理由:材料将融资进展与业务指标、企业落地场景放在一起,便于判断 ElevenLabs 在语音智能体商业化中的推进路径。
Hugging Face 的 Diffusers 发布 0.38.0,新增多条图像与音频管线,包括离散扩散语言模型 LLaDA2、2B 激活 17B 参数的稀疏 MoE 图像模型 NucleusMoE-Image。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体协助患者护理,并评估其面向医生和患者的能力。在98个真实感初级保健问题中,系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。实时音视频远程医疗模拟显示,AI co-clinician 在140项会诊能力中的68项达到或超过初级保健医生,但医生整体表现更好。
推荐理由:文章同时给出证据检索、药物问答和实时多模态会诊的评测设计,可用于理解医疗智能体的能力边界与临床安全架构。
ElevenLabs 发布 AI 音乐发现与创作平台 ElevenMusic,将听歌、重混、原创创作、发布和变现连接在一起。平台上线时已有超过 4,000 名独立及新兴艺术家参与,用户可调整曲风和速度重混曲目,也可从歌词、旋律或情绪创作完整曲目。ElevenMusic 同步推出 Eleven Album Vol. 2,并已开放 App 和网页版使用;创作者收益取决于听众参与度、资格门槛和平台收入。
推荐理由:ElevenMusic把音乐发现、重混、原创创作与发布变现放在同一平台,呈现了面向创作者和听众的参与式音乐工作流。
ElevenLabs在西班牙马德里开设办公室,并扩充当地销售与工程团队,以加强与客户合作。eDreams ODIGEO使用Eleven Agents以五种语言处理数百万次客服交互,解决速度和转接率均实现两位数提升。ElevenLabs还指出,西班牙企业正从试点转向大规模生产,多语种及地区语言支持是部署重点。
推荐理由:西班牙企业的客服、零售和保险案例,呈现了语音智能体规模化部署对多语种和人工转接的要求。
字节 Seed 正式发布新一代 3D 生成大模型 Seed3D 2.0,围绕几何精度和材质质量做架构升级,官方称在几何生成、纹理材质生成两项核心指标上均取得 SOTA。
推荐理由:官方披露了两阶段 DiT 几何生成与统一 PBR 材质方案,可据此判断 3D 生成在仿真与部件级建模上的可用边界。
Google 推出 Gemini 3.1 Flash TTS,提升语音质量、可控性与表现力,并支持 70+ 语言和原生多说话人对话。模型引入可通过自然语言控制音色、语速和表达方式的音频标签,开发者可在 Gemini API 和 Google AI Studio 预览,企业可通过 Vertex AI 预览,Workspace 用户可在 Google Vids 使用。
推荐理由:音频标签、多人对话和 70+ 语言支持,为评估语音产品的表达控制、全球化覆盖与 API 落地路径提供了具体参照。
Replicate 发布 Seedance 2.0 使用教程,介绍该模型可同时接收最多 9 张图片、3 段视频、3 个音频和文本提示,并用 [Image1]、[Audio1] 等标记在提示词中引用素材。
推荐理由:通过参考素材组合、时间码分镜和音画同源三条实操路径,可迁移到需要角色一致性与多镜头调度的视频创作流程。
World Labs 发布 Spark 2.0,为基于 THREE.js 和 WebGL2 的开源 3DGS 渲染器加入 Level-of-Detail 系统,可按视角连续调整细节并通过网络流式加载数据。
推荐理由:World Labs 公开了 Spark 2.0 的 LoD、渐进流式与虚拟显存三项技术细节,可据此判断大场景 3DGS 在浏览器端的落地条件。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人所需的空间推理、多视角理解、任务规划和成功检测能力。模型新增仪表读数能力,可通过 Gemini API 和 Google AI Studio 提供给开发者,并支持调用 Google Search、VLA 或用户自定义函数。
推荐理由:文章给出 Gemini Robotics-ER 1.6 在空间推理、多视角成功检测和仪表读数上的能力变化,并说明其通过 Gemini API 与 Google AI Studio 接入机器人工作流的方式。
ElevenLabs宣布支持 On-Premise 和 On-Device 部署,将语音 AI 扩展到云端和 VPC 之外。On-Premise 与 On-Device 目前处于 early access,首批版本预计在 2026 年上半年推出;VPC 部署现已可用,并支持自定义声音和针对语言或方言的微调。
推荐理由:材料清晰区分了 On-Premise、On-Device 与 VPC 的部署边界,便于企业按数据驻留和离线推理需求选择方案。
字节 Seed 正式推出原生全双工语音大模型 Seeduplex,基于边听边说框架,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其复杂场景误回复率和误打断率减少一半,抢话比例相对下降 40%,判停 MOS 分提高 8%、对话流畅度 MOS 分提升 12%,快问快答场景时延降低约 250ms。
推荐理由:官方给出全双工语音模型的架构思路与多项对比数据,可据此判断实时语音交互的技术路线与落地进度。
ElevenLabs与欧盟理事会秘书处合作,在2025年波兰担任欧盟理事会轮值主席国期间,为外交新闻发布会制作英语、法语和波兰语AI配音。20多场部长级会议相关录音发布在主席国官方YouTube频道,观众可选择音轨,配音保留发言人的语气和节奏。翻译由ElevenProductions人工核验,发言人提供符合GDPR的明确同意,语音模型仅限官方会议翻译使用,所有AI生成录音均明确标注。
推荐理由:案例展示了外交音频在多语种扩展中如何结合AI配音、人工核验与GDPR同意流程,适合参考高敏感内容的上线控制。
Hugging Face 发布 Diffusers 0.37.0,引入 Modular Diffusers,用可复用模块组合自定义扩散管线,与原有 DiffusionPipeline 并存。
推荐理由:Diffusers 0.37.0 的模块化管线与新增图像视频模型清单,可供选型与工作流搭建时对照参考。
World Labs 发布长文《3D as code》,提出 3D 是描述和交互物理与虚拟世界的通用接口,类比关系为 3D 相当于代码、神经图形相当于编程语言、仿真引擎相当于芯片。
推荐理由:World Labs 把 3D 类比为代码、仿真引擎类比为芯片,为判断世界模型该走端到端还是混合架构提供了一条清晰的分析框架。
Replicate 发布 Seedream 5.0 提示词实践指南,基于大量实测总结该模型在摄影语言理解、示例式编辑、风格迁移、多步推理、精确指令跟随、专业领域知识和文字渲染上的表现。示例式编辑可给出一组前后对比图加第三张图,让模型自行推断变化并套用,无需文字描述;提示词建议用自然语言而非关键词堆叠,需要渲染的文字用双引号包裹,复杂编辑可用箭头、方框或彩色区域标注位置。
推荐理由:Replicate 实测 Seedream 5.0 的提示词写法,示例式编辑和视觉标记对复杂改图流程有直接借鉴。
World Labs 宣布获得 $1 billion 新融资,投资方包括 AMD、Autodesk、NVIDIA 和 Sea 等。公司表示将加速空间智能与世界模型研发,其首款产品 Marble 可根据图像、视频或文本创建具有空间连贯性、高保真度和持久性的 3D 世界。
推荐理由:融资规模与投资方名单呈现了 World Labs 推进空间智能和世界模型产品化的资源基础,Marble 的输入形式也提供了创作工具选型参考。
Recraft 发布图像生成模型 Recraft V4,主打所谓“设计品味”,在构图、光线和色彩上做出更接近美术指导的视觉决策。
推荐理由:四个版本在分辨率、速度与价格上的差异,以及原生 SVG 输出,可作为图像生成选型与设计资产工作流的参考。
字节跳动 Seed 团队发布 Seedream 5.0 Lite 智能图像创作模型,相比 4.0 在理解、推理和生成方面全面提升,并首次为 Seedream 系列引入实时检索增强能力,可联网获取最新资讯回应时效性创作需求。
推荐理由:官方披露了多模态统一架构与实时检索增强的落地方式,可据此判断图像模型向推理型创作助手演进的具体路径。
ElevenLabs正式推出面向政府部门的ElevenLabs for Government,提供覆盖语音和数字渠道的多语言语音与聊天智能体服务。正文列出福利、许可、税务办理和危机热线等场景,并称捷克智能体日均处理约5,000通电话、独立解决约85%;德州Midland部署预计每月减少约7,000个漏接电话。
ElevenLabs 宣布完成 $500M Series D 融资,公司估值达到 $11B,2025 年 ARR 超过 $330M。新资金将用于扩大 ElevenAgents 企业语音与对话智能体平台、升级语音智能体,并推进情感对话模型、配音和音频通用智能研究。
推荐理由:材料同时给出融资规模、估值变化与 ElevenAgents 的产品投入方向,可用于判断语音智能体商业化与企业采用的推进路径。
ElevenLabs 宣布 Eleven v3 文本转语音模型结束 Alpha 阶段并正式可用,现已在所有平台开放。在覆盖 8 种语言、27 个类别的内部基准中,错误率从 15.3% 降至 4.9%,错误减少 68%;测试中用户有 72% 的时间更偏好新版本而非此前 Alpha 版本。更新重点包括更准确处理数字、符号和专业记号,例如将电话号码、货币、化学式和体育比分按上下文朗读。
推荐理由:这次更新提供了文本转语音模型在跨语言符号朗读和稳定性上的具体变化,便于评估号码、公式与复杂格式的生成可用性。
ElevenLabs 与 Audi Revolut F1 Team 展开合作,探索将 AI 音频与语音生成技术用于车队运营、沟通及全球车迷连接。双方还将研究如何借助相关技术支持赛道工作,并通过数字平台和新形式改变车迷体验。
World Labs 发布 World API,调用 Marble 多模态世界模型,可从文本、图像、全景、多视图输入和视频生成可导航的 3D 世界。生成结果支持浏览器渲染、导出到下游工具,或集成进互动系统与模拟流程。World API 已通过 World Labs Platform 提供,平台支持管理 API keys、查看用量与计费、购买 credits 及访问文档。
推荐理由:World API 将多种视觉与文本输入转为可探索 3D 世界,并提供渲染、导出和应用集成入口,可用于评估空间内容生成工作流。
ElevenLabs 发布《The Eleven Album》,由 Liza Minnelli、Art Garfunkel 等艺术家与 Eleven Music 共同创作原创音乐,涵盖说唱、流行、R&B、EDM、电影配乐和全球音乐等风格。Eleven Music 可根据简单提示生成完整作品,并支持调整歌词、时序和乐器,以及下载最多六条录音室质量分轨。专辑现已上线。
推荐理由:发布既展示了 Eleven Music 在音乐创作中的具体工作流,也交代了原创、商用授权和分轨下载等面向制作环节的能力。
MasterClass通过 ElevenLabs Text to Speech 为 Gordon Ramsay、Mark Cuban 和 Chris Voss 等 AI 导师提供实时语音对话。上线首年超过75%的 On Call 用户通过语音互动,双方还建立了涵盖红队测试、内容审核和人工复核的安全质量框架,并探索 AI roleplay 与 ElevenLabs Agents Platform。
推荐理由:案例呈现了语音质量、低延迟、联合训练与多层安全审核如何共同支撑品牌化 AI 导师的实时交互。
Deutsche Telekom 与 ElevenLabs 宣布合作,将 ElevenLabs 的 AI voice agents 引入欧洲最大电信运营商的客户服务,覆盖 app 和电话渠道。Deutsche Telekom 客户很快将获得 24/7、无需等待的逼真 AI voice agents,以更个性化、类人的互动增强客户支持。
ElevenLabs 发布 Scribe v2,面向批量转录、字幕和听写场景,强化了长音频、停顿、语气变化、长静音及多说话人和口音的处理。Scribe v2 支持最多 100 个关键词或短语提示、最多 56 类实体检测及精确时间戳,并能自动转录单个音频文件中的多种语言。
推荐理由:Scribe v2针对长音频、多语言和复杂说话场景优化,并结合关键词提示与实体时间戳,适合评估批量转录和审片工作流。