跳到正文

#语音

今日 0 条
11月21日周五
  1. ElevenLabs · 音频创作62

    ElevenLabs与Liberty Global达成合作并获战略投资,加速欧洲语音AI扩张

    ElevenLabs宣布与Liberty Global Ventures达成商业合作,并获得其战略投资,以推进语音AI在欧洲电信和娱乐产品中的应用。双方将探索AI客户服务智能体、联网电视与流媒体语音界面,以及客户沟通和营销等场景;该投资由Liberty Global Ventures Partner Rebecca Hunt领投,支持ElevenLabs扩大全球基础语音模型和多语言语音AI。

    推荐理由:这项合作同时覆盖战略投资与电信、娱乐落地场景,可用于观察语音 AI 从模型能力走向客户服务和电视交互的商业化路径。

11月12日周三
  1. ElevenLabs · 音频创作21

    Harvey 与 ElevenLabs 合作,为法律行业打造全球多语言语音能力

    Harvey 与 ElevenLabs 合作,为法律行业打造全球多语言语音能力,使 Harvey 能以数十种语言、方言或口音自然交流。首阶段将支持 Harvey 几乎以任何语言或方言朗读回答,能力由 ElevenLabs 的 Text to Speech 和 Speech to Text 驱动;后续将加入多语言语音翻译、voice mode、口头庭审模拟和语调定制。

11月6日周四
  1. ElevenLabs · 音频创作49

    ElevenLabs 与乌克兰共建首个智能体政府

    ElevenLabs 与乌克兰政府签署谅解备忘录,推动 AI 公共服务从概念进入生产,共建“世界首个智能体政府”。乌克兰已以 Diia.AI 迈出第一步,该平台被称为“世界首个公共服务智能体应用与平台”,教育和经济领域也在推进 Mriia、Obriy。ElevenLabs 的工程师团队驻留 Kyiv,与乌克兰团队协作部署,乌克兰计划到 2030 年成为 AI 公共服务应用的领导者。

7月24日周四
  1. ByteDance Seed · 音频与多模态交互73

    字节 Seed 发布端到端同声传译模型 Seed LiveInterpret 2.0,延迟低至 2-3 秒

    字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。

    推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。

5月6日周二
  1. Replicate · 模型与制作实践67

    Replicate 提供 MiniMax Speech-02 语音模型 API

    Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。

    推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。

3月28日周五
1月20日周一
  1. ByteDance Seed · 音频与多模态交互73

    豆包实时语音大模型上线并全量开放,端到端语音对话支持随时打断

    豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。

    推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。