跳到正文

#语音

今日 0 条
9月30日周三
  1. Hugging Face Blog77

    Hugging Face 发布 Open TTS Leaderboard,支持多语言与语音克隆评测

    Hugging Face 发布 Open TTS Leaderboard,用客观指标评估开放源码 TTS 模型的可懂度、速度和说话人相似度,并覆盖多语言与语音克隆场景。排行榜使用 WER/CER、RTFx、TTFA 和 SIM,支持在 H200 GPU 与 CPU 上比较流式性能,并提供 Listen 标签页供用户试听和投票。

    推荐理由:该排行榜把 WER/CER、推理速度和说话人相似度纳入统一评测,并保留试听投票,便于比较开放源码 TTS 在多语言和流式场景中的取舍。

  2. ElevenLabs · 音频创作73

    ElevenLabs完成$300 million员工要约收购,估值升至$22 billion

    ElevenLabs完成$300 million员工要约收购,估值达到$22 billion,是其2026年2月Series D估值的两倍。公司称企业客户已贡献55%的收入,ElevenAgents每周处理超过15 million次对话,较2月增长3x;其语音智能体平均比聊天智能体快31%解决问题。

    推荐理由:企业收入占比、智能体处理量和多渠道部署数据,提供了观察语音智能体商业化进展的具体参照。

9月28日周一
  1. ElevenLabs · 音频创作75

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型

    ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。

    推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。

9月16日周三
9月15日周二
  1. Luma · 创作产品与实践45

    AI Lip Sync:如何提示出与嘴型匹配的对白

    AI Lip Sync 提示词应包含清晰音频、正面或四分之三侧脸、角色语气与情绪,并使用短句和恰当标点,以提升对白与嘴型的同步效果。系统通过分析 phonemes、映射 visemes,再逐帧生成口型动画,现已覆盖 30+ languages。集成式工作流可将本地化和客户修改变成修订任务,避免每次从头重建视频。

9月10日周四
  1. OpenAI News62

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色与电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,读者可据此判断语音类应用的接入门槛与能力边界。

9月8日周二
8月28日周五
  1. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言标签页上的首个印度语言。

    推荐理由:公开 ASR 榜单首次纳入印地语与印度英语,并公开说话人元数据与格参考,可用于判断语音模型的地域偏差。

8月27日周四
8月24日周一
8月21日周五
8月11日周二
  1. Hugging Face Blog65

    NVIDIA 发布 Magpie TTS 多语言开源权重模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖与 TTFA 实测数据,可供语音 Agent 选型时比较自部署延迟与可控性。

8月5日周三
  1. ByteDance Seed · 音频与多模态交互83

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,已在豆包 App 全量上线

    字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。

    推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。

7月24日周五
  1. ElevenLabs · 音频创作72

    ElevenLabs介绍以语音AI扩大选举信息可及性并防范滥用

    ElevenLabs介绍其在2026年选举周期中利用语音AI扩大公共信息可及性,并防范误导和滥用的工作。巴西最高选举法院将为“Electoral Assistant”加入语音交互,ElevenLabs还将为Comprova合作方提供AI Speech Classifier等检测工具培训。

    推荐理由:文章梳理了语音 AI 在选举信息无障碍传播中的落地方式,以及语音克隆拦截、验证码、内容审核和水印等治理措施。

7月20日周一
  1. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布音频创作模型 Seed Audio 1.0

    字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,并已在火山方舟体验中心上线。模型支持一条 prompt 编排对白、音效与环境声,时间控制精度达 100ms,支持零样本音色生成与参考音频延展,单次可生成约 2 分钟音频并继续延长以保持角色一致性。

    推荐理由:官方披露了统一建模多要素音频、100ms 时间控制与 20+ 语种等能力,可据此判断其在配音与多语种内容生产中的可用边界。

7月15日周三
  1. Hugging Face Blog79

    Hugging Face 发布 Real World VoiceEQ 语音 AI 人类质量基准

    Real World VoiceEQ 评估语音 AI 的人类交互质量,覆盖 40 多个专有和开源语音模型、15 多个维度及 60 多项指标。该基准基于超过 1 million 个人类评分,涵盖 ASR、TTS、S2S 和语音理解,结果显示不同模型在技术准确性、情绪理解、表达力与鲁棒性之间存在明显专长差异。

    推荐理由:该基准将语音模型评测从 WER 和延迟扩展到情绪、身份与背景声等人类感知维度,可帮助定位真实对话中的听辨与回应短板。

7月7日周二
  1. ElevenLabs · 音频创作61

    ElevenLabs 在加拿大正式开展业务并计划扩大团队

    ElevenLabs 宣布在加拿大正式开展业务,任命 Max Lemmens 为加拿大总经理,并计划在今年将当地团队规模扩大一倍、在多伦多开设首个加拿大办公室。公司称其在加拿大已有 30,000 名用户,TELUS Digital 使用其 AI 语音智能体进行员工培训后将入职培训时间缩短了 20%。

    推荐理由:这次加拿大布局同时给出用户规模、团队扩张和本地案例,可用于观察语音 AI 的企业落地路径。

7月1日周三
6月22日周一
  1. ElevenLabs · 音频创作71

    ElevenLabs 在 ElevenCreative 推出 Ads Engine,主打广告本地化

    ElevenLabs 在 ElevenCreative 内推出 Ads Engine,首个能力是广告本地化,可接入 Google Ads 和 Meta Ads 账号,拉取现有素材与投放数据,同时完成文本翻译、图像适配和视频配音,再把本地化版本推回 Google、Meta 和 LinkedIn。

    推荐理由:官方披露广告本地化引擎的接入方式与工作流,可据此判断多语言投放的素材生产与审片环节如何变化。

6月9日周二
6月8日周一
  1. ElevenLabs · 音频创作70

    ElevenLabs 与英国政府签署语音 AI 合作协议并扩大伦敦总部

    ElevenLabs 与英国科学、创新与技术部(DSIT)签署谅解备忘录,探索将语音 AI 用于公共服务可及性、AI 安全研究和人才培养。ElevenLabs 今年将在伦敦启用一座面积为现有办公室三倍的新总部,并将英国员工数量翻倍至 200 人;合作还将借助 ElevenLabs for Government 推进相关公共部门项目。

    推荐理由:这项合作同时覆盖公共服务可及性、AI 安全研究和人才培养,并给出英国团队扩张规模,可供观察语音 AI 的政务落地路径。

6月1日周一
  1. ElevenLabs · 音频创作37

    ElevenLabs 将峰会带回华沙

    ElevenLabs 在华沙举办峰会,约2,500名来自波兰和欧洲的创始人、研究人员、开发者、艺术家及机构代表参加。作为公司第三场峰会,活动将展示其迈向人类水平沟通的 AI 进展,并讨论 AI 如何打破语言障碍、让创意更易触达。

5月28日周四
  1. ElevenLabs · 音频创作67

    ElevenLabs与希腊政府签署语音 AI 战略合作备忘录

    ElevenLabs与希腊政府签署战略合作备忘录,将探索把语音 AI 应用于公共服务、数字旅游和希腊语言遗产保护。双方计划先从克里特方言开始,并研究在gov.gr及政府呼叫中心提供多语言服务;希腊政府数字门户目前提供超过2,200项服务。

    推荐理由:三条合作路径覆盖公共服务、旅游和方言保存,可帮助判断语音 AI 走向政府场景的部署边界与合作模式。

5月19日周二
  1. ElevenLabs · 音频创作62

    ElevenLabs推出教授语音AI支持计划与 Albert Einstein 互动学习体验

    ElevenLabs推出面向教授的语音AI支持计划,并上线基于 Albert Einstein 声音与档案的互动学习体验。教授可免费使用 Pro tier,并为特定课程和项目向学生提供限时访问。Albert Einstein 的重现声音已在 ElevenReader 和 ElevenLabs Agents 中提供,支持英语、德语、法语、巴西葡萄牙语和西班牙语。

    推荐理由:同时覆盖教育者获取权限与历史声音互动两端,为课堂语音工具的接入方式和学习体验设计提供了可参考案例。

5月7日周四
5月5日周二
  1. ElevenLabs · 音频创作73

    ElevenLabs ARR 超过 $500 million,Series D 第三次交割迎来新投资者

    ElevenLabs 宣布 Series D 融资完成第三次交割,并迎来 BlackRock、NVIDIA 等新投资者;公司在 2026 年前四个月的 ARR 已超过 $500 million。其称企业正将语音智能体用于客服、销售、招聘和营销等场景,另完成 $100 million tender offer,团队规模达 530 人,遍布 50 多个国家。

    推荐理由:材料将融资进展与业务指标、企业落地场景放在一起,便于判断 ElevenLabs 在语音智能体商业化中的推进路径。

4月28日周二
  1. ElevenLabs · 音频创作61

    ElevenLabs在西班牙马德里开设办公室并扩充团队

    ElevenLabs在西班牙马德里开设办公室,并扩充当地销售与工程团队,以加强与客户合作。eDreams ODIGEO使用Eleven Agents以五种语言处理数百万次客服交互,解决速度和转接率均实现两位数提升。ElevenLabs还指出,西班牙企业正从试点转向大规模生产,多语种及地区语言支持是部署重点。

    推荐理由:西班牙企业的客服、零售和保险案例,呈现了语音智能体规模化部署对多语种和人工转接的要求。

4月9日周四
  1. ElevenLabs · 音频创作67

    ElevenLabs推出本地部署方案,支持 On-Premise 与 On-Device

    ElevenLabs宣布支持 On-Premise 和 On-Device 部署,将语音 AI 扩展到云端和 VPC 之外。On-Premise 与 On-Device 目前处于 early access,首批版本预计在 2026 年上半年推出;VPC 部署现已可用,并支持自定义声音和针对语言或方言的微调。

    推荐理由:材料清晰区分了 On-Premise、On-Device 与 VPC 的部署边界,便于企业按数据驻留和离线推理需求选择方案。

  2. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布全双工语音大模型 Seeduplex,已在豆包 App 全量上线

    字节 Seed 正式推出原生全双工语音大模型 Seeduplex,基于边听边说框架,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其复杂场景误回复率和误打断率减少一半,抢话比例相对下降 40%,判停 MOS 分提高 8%、对话流畅度 MOS 分提升 12%,快问快答场景时延降低约 250ms。

    推荐理由:官方给出全双工语音模型的架构思路与多项对比数据,可据此判断实时语音交互的技术路线与落地进度。

2月11日周三
2月4日周三
  1. ElevenLabs · 音频创作78

    ElevenLabs 完成 $500M Series D 融资,估值达 $11B

    ElevenLabs 宣布完成 $500M Series D 融资,公司估值达到 $11B,2025 年 ARR 超过 $330M。新资金将用于扩大 ElevenAgents 企业语音与对话智能体平台、升级语音智能体,并推进情感对话模型、配音和音频通用智能研究。

    推荐理由:材料同时给出融资规模、估值变化与 ElevenAgents 的产品投入方向,可用于判断语音智能体商业化与企业采用的推进路径。

1月29日周四
1月15日周四
  1. ElevenLabs · 音频创作68

    MasterClass借助 ElevenLabs 让 AI 导师实现实时语音互动

    MasterClass通过 ElevenLabs Text to Speech 为 Gordon Ramsay、Mark Cuban 和 Chris Voss 等 AI 导师提供实时语音对话。上线首年超过75%的 On Call 用户通过语音互动,双方还建立了涵盖红队测试、内容审核和人工复核的安全质量框架,并探索 AI roleplay 与 ElevenLabs Agents Platform。

    推荐理由:案例呈现了语音质量、低延迟、联合训练与多层安全审核如何共同支撑品牌化 AI 导师的实时交互。

1月14日周三
1月9日周五
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布语音转录模型 Scribe v2

    ElevenLabs 发布 Scribe v2,面向批量转录、字幕和听写场景,强化了长音频、停顿、语气变化、长静音及多说话人和口音的处理。Scribe v2 支持最多 100 个关键词或短语提示、最多 56 类实体检测及精确时间戳,并能自动转录单个音频文件中的多种语言。

    推荐理由:Scribe v2针对长音频、多语言和复杂说话场景优化,并结合关键词提示与实体时间戳,适合评估批量转录和审片工作流。

12月4日周四
  1. ElevenLabs · 音频创作68

    Toyota 借助 ElevenLabs 打造 Brock Purdy AI 语音互动体验

    Toyota 北加州经销商协会与创意机构 H/L 推出由 Brock Purdy AI 数字人主持的语音互动体验,基于 ElevenLabs Agents 平台运行,并通过 webhook 将语音回应与网页动画实时同步。活动上线前几周产生 12k+ 次语音互动,平均参与时长约 2 分钟,超过 25% 的对话促成提交线索表单或探索产品等行动。

    推荐理由:这则案例把语音智能体、实时动画同步和线索收集串成一条营销流程,适合参考品牌互动项目的设计与衡量方式。

11月21日周五
  1. ElevenLabs · 音频创作62

    ElevenLabs与Liberty Global达成合作并获战略投资,加速欧洲语音AI扩张

    ElevenLabs宣布与Liberty Global Ventures达成商业合作,并获得其战略投资,以推进语音AI在欧洲电信和娱乐产品中的应用。双方将探索AI客户服务智能体、联网电视与流媒体语音界面,以及客户沟通和营销等场景;该投资由Liberty Global Ventures Partner Rebecca Hunt领投,支持ElevenLabs扩大全球基础语音模型和多语言语音AI。

    推荐理由:这项合作同时覆盖战略投资与电信、娱乐落地场景,可用于观察语音 AI 从模型能力走向客户服务和电视交互的商业化路径。

11月12日周三
  1. ElevenLabs · 音频创作21

    Harvey 与 ElevenLabs 合作,为法律行业打造全球多语言语音能力

    Harvey 与 ElevenLabs 合作,为法律行业打造全球多语言语音能力,使 Harvey 能以数十种语言、方言或口音自然交流。首阶段将支持 Harvey 几乎以任何语言或方言朗读回答,能力由 ElevenLabs 的 Text to Speech 和 Speech to Text 驱动;后续将加入多语言语音翻译、voice mode、口头庭审模拟和语调定制。