跳到正文

音频与数字人

声音、音乐、配音、数字人和多语言制作。

61条精选

最新精选

第 41–60 条 · 共 61 条
4月28日周二
  1. ElevenLabs · 音频创作61

    ElevenLabs在西班牙马德里开设办公室并扩充团队

    ElevenLabs在西班牙马德里开设办公室,并扩充当地销售与工程团队,以加强与客户合作。eDreams ODIGEO使用Eleven Agents以五种语言处理数百万次客服交互,解决速度和转接率均实现两位数提升。ElevenLabs还指出,西班牙企业正从试点转向大规模生产,多语种及地区语言支持是部署重点。

    推荐理由:西班牙企业的客服、零售和保险案例,呈现了语音智能体规模化部署对多语种和人工转接的要求。

4月16日周四
  1. Google DeepMind82

    Google 发布 Gemini 3.1 Flash TTS 语音模型

    Google 推出 Gemini 3.1 Flash TTS,提升语音质量、可控性与表现力,并支持 70+ 语言和原生多说话人对话。模型引入可通过自然语言控制音色、语速和表达方式的音频标签,开发者可在 Gemini API 和 Google AI Studio 预览,企业可通过 Vertex AI 预览,Workspace 用户可在 Google Vids 使用。

    推荐理由:音频标签、多人对话和 70+ 语言支持,为评估语音产品的表达控制、全球化覆盖与 API 落地路径提供了具体参照。

4月9日周四
  1. ElevenLabs · 音频创作67

    ElevenLabs推出本地部署方案,支持 On-Premise 与 On-Device

    ElevenLabs宣布支持 On-Premise 和 On-Device 部署,将语音 AI 扩展到云端和 VPC 之外。On-Premise 与 On-Device 目前处于 early access,首批版本预计在 2026 年上半年推出;VPC 部署现已可用,并支持自定义声音和针对语言或方言的微调。

    推荐理由:材料清晰区分了 On-Premise、On-Device 与 VPC 的部署边界,便于企业按数据驻留和离线推理需求选择方案。

  2. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布全双工语音大模型 Seeduplex,已在豆包 App 全量上线

    字节 Seed 正式推出原生全双工语音大模型 Seeduplex,基于边听边说框架,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其复杂场景误回复率和误打断率减少一半,抢话比例相对下降 40%,判停 MOS 分提高 8%、对话流畅度 MOS 分提升 12%,快问快答场景时延降低约 250ms。

    推荐理由:官方给出全双工语音模型的架构思路与多项对比数据,可据此判断实时语音交互的技术路线与落地进度。

3月31日周二
  1. ElevenLabs · 音频创作65

    ElevenLabs与欧盟理事会秘书处合作,为波兰轮值主席国外交发布会提供多语种AI配音

    ElevenLabs与欧盟理事会秘书处合作,在2025年波兰担任欧盟理事会轮值主席国期间,为外交新闻发布会制作英语、法语和波兰语AI配音。20多场部长级会议相关录音发布在主席国官方YouTube频道,观众可选择音轨,配音保留发言人的语气和节奏。翻译由ElevenProductions人工核验,发言人提供符合GDPR的明确同意,语音模型仅限官方会议翻译使用,所有AI生成录音均明确标注。

    推荐理由:案例展示了外交音频在多语种扩展中如何结合AI配音、人工核验与GDPR同意流程,适合参考高敏感内容的上线控制。

2月4日周三
  1. ElevenLabs · 音频创作78

    ElevenLabs 完成 $500M Series D 融资,估值达 $11B

    ElevenLabs 宣布完成 $500M Series D 融资,公司估值达到 $11B,2025 年 ARR 超过 $330M。新资金将用于扩大 ElevenAgents 企业语音与对话智能体平台、升级语音智能体,并推进情感对话模型、配音和音频通用智能研究。

    推荐理由:材料同时给出融资规模、估值变化与 ElevenAgents 的产品投入方向,可用于判断语音智能体商业化与企业采用的推进路径。

2月2日周一
  1. ElevenLabs · 音频创作69

    ElevenLabs 发布正式可用的 Eleven v3 文本转语音模型

    ElevenLabs 宣布 Eleven v3 文本转语音模型结束 Alpha 阶段并正式可用,现已在所有平台开放。在覆盖 8 种语言、27 个类别的内部基准中,错误率从 15.3% 降至 4.9%,错误减少 68%;测试中用户有 72% 的时间更偏好新版本而非此前 Alpha 版本。更新重点包括更准确处理数字、符号和专业记号,例如将电话号码、货币、化学式和体育比分按上下文朗读。

    推荐理由:这次更新提供了文本转语音模型在跨语言符号朗读和稳定性上的具体变化,便于评估号码、公式与复杂格式的生成可用性。

1月21日周三
  1. ElevenLabs · 音频创作67

    ElevenLabs 发布由 Eleven Music 驱动的《The Eleven Album》

    ElevenLabs 发布《The Eleven Album》,由 Liza Minnelli、Art Garfunkel 等艺术家与 Eleven Music 共同创作原创音乐,涵盖说唱、流行、R&B、EDM、电影配乐和全球音乐等风格。Eleven Music 可根据简单提示生成完整作品,并支持调整歌词、时序和乐器,以及下载最多六条录音室质量分轨。专辑现已上线。

    推荐理由:发布既展示了 Eleven Music 在音乐创作中的具体工作流,也交代了原创、商用授权和分轨下载等面向制作环节的能力。

1月15日周四
  1. ElevenLabs · 音频创作68

    MasterClass借助 ElevenLabs 让 AI 导师实现实时语音互动

    MasterClass通过 ElevenLabs Text to Speech 为 Gordon Ramsay、Mark Cuban 和 Chris Voss 等 AI 导师提供实时语音对话。上线首年超过75%的 On Call 用户通过语音互动,双方还建立了涵盖红队测试、内容审核和人工复核的安全质量框架,并探索 AI roleplay 与 ElevenLabs Agents Platform。

    推荐理由:案例呈现了语音质量、低延迟、联合训练与多层安全审核如何共同支撑品牌化 AI 导师的实时交互。

1月9日周五
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布语音转录模型 Scribe v2

    ElevenLabs 发布 Scribe v2,面向批量转录、字幕和听写场景,强化了长音频、停顿、语气变化、长静音及多说话人和口音的处理。Scribe v2 支持最多 100 个关键词或短语提示、最多 56 类实体检测及精确时间戳,并能自动转录单个音频文件中的多种语言。

    推荐理由:Scribe v2针对长音频、多语言和复杂说话场景优化,并结合关键词提示与实体时间戳,适合评估批量转录和审片工作流。

12月16日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节 Seedance 1.5 pro 音视频创作模型正式发布

    字节 Seed 团队正式发布新一代音视频创作模型 Seedance 1.5 pro,支持文本到音视频合成与图像引导的音视频生成,已上线即梦AI和豆包。模型采用基于 MMDiT 的统一音视频联合生成框架,实现口型、语调与表演节奏的音画同步,原生支持中文、英文、日文、韩语、西班牙语、印尼语及四川话、粤语等方言。

    推荐理由:官方披露了音视频联合生成的架构与评测细节,可据此判断音画同步能力在短剧、广告等场景的可用边界。

12月4日周四
  1. ElevenLabs · 音频创作68

    Toyota 借助 ElevenLabs 打造 Brock Purdy AI 语音互动体验

    Toyota 北加州经销商协会与创意机构 H/L 推出由 Brock Purdy AI 数字人主持的语音互动体验,基于 ElevenLabs Agents 平台运行,并通过 webhook 将语音回应与网页动画实时同步。活动上线前几周产生 12k+ 次语音互动,平均参与时长约 2 分钟,超过 25% 的对话促成提交线索表单或探索产品等行动。

    推荐理由:这则案例把语音智能体、实时动画同步和线索收集串成一条营销流程,适合参考品牌互动项目的设计与衡量方式。

11月21日周五
  1. ElevenLabs · 音频创作62

    ElevenLabs与Liberty Global达成合作并获战略投资,加速欧洲语音AI扩张

    ElevenLabs宣布与Liberty Global Ventures达成商业合作,并获得其战略投资,以推进语音AI在欧洲电信和娱乐产品中的应用。双方将探索AI客户服务智能体、联网电视与流媒体语音界面,以及客户沟通和营销等场景;该投资由Liberty Global Ventures Partner Rebecca Hunt领投,支持ElevenLabs扩大全球基础语音模型和多语言语音AI。

    推荐理由:这项合作同时覆盖战略投资与电信、娱乐落地场景,可用于观察语音 AI 从模型能力走向客户服务和电视交互的商业化路径。

11月17日周一
  1. ElevenLabs · 音频创作85

    ElevenLabs 发布 Image & Video(Beta),整合图像、视频与音频创作

    ElevenLabs 发布 Image & Video(Beta),将图像、视频和音频创作整合到同一平台工作流中。用户可调用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,也可使用 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成图像,并在 Studio 中完成配音、音乐、音效、口型同步、时间线调整和导出。

    推荐理由:将图像、视频生成与配音、音乐、音效及时间线编辑放进同一工作流,便于评估一站式多模态创作的实际覆盖范围。

11月11日周二
  1. ElevenLabs · 音频创作67

    ElevenLabs 与 Sir Michael Caine 合作推出 Iconic Marketplace

    ElevenLabs 与 Sir Michael Caine 合作,并推出 Iconic Marketplace,为公司申请使用知名人才参与项目和内容提供双边平台。平台目前已有超过 25 种标志性声音,并与包括 CMG Worldwide 在内的机构合作,强调授权、同意和创作真实性。

    推荐理由:该平台把名人声音合作放在授权、同意与创作真实性框架下,为品牌和工作室评估 AI 音频商业化与版权流程提供了具体案例。

7月24日周四
  1. ByteDance Seed · 音频与多模态交互73

    字节 Seed 发布端到端同声传译模型 Seed LiveInterpret 2.0,延迟低至 2-3 秒

    字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。

    推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。

6月10日周二
  1. Replicate · 模型与制作实践60

    Replicate 发布 Veo 3 提示词指南:如何写出最佳效果

    Replicate 发布 Veo 3 提示词指南,建议在提示词中明确主体、场景、动作、风格、镜头运动、构图与氛围,并单独描述对白、环境音、音效和音乐。文中指出 Veo 3 对同一提示词多次生成结果高度相似,想探索不同效果应改用差异较大的提示词;保持角色描述逐字一致可提升跨场景视觉连续性。

    推荐理由:Replicate 基于实测给出 Veo 3 的提示词结构、音频与角色一致性写法,可迁移到视频生成工作流。

6月6日周五
  1. Replicate · 模型与制作实践79

    Google Veo 3 使用指南:从原生音频到镜头提示词

    Replicate介绍 Google Veo 3 的视频生成能力,并分享一套涵盖镜头构图、焦段效果、风格和运镜的提示词方法。文章还展示了对话与口型同步、视频游戏世界等案例,并给出冰柱特写示例提示词。

    推荐理由:文章整理了 Veo 3 的镜头构图、焦段、风格与运镜提示词,并结合对话、口型同步和游戏世界生成案例,便于复用其视频创作流程。

5月6日周二
  1. Replicate · 模型与制作实践67

    Replicate 提供 MiniMax Speech-02 语音模型 API

    Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。

    推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。

4月16日周三
  1. Replicate · 模型与制作实践70

    Easel AI 两款模型上线 Replicate,支持全身换脸与 AI avatars

    Easel AI 的全身换脸和 AI avatars 两款模型现已在 Replicate 提供,可通过网页或 API 调用。全身换脸可在单张图中替换一或两人并保留服装、光线和图像风格;AI avatars 只需单个提示词即可生成一或两人的头像,无需训练或 LoRAs。

    推荐理由:这次接入同时覆盖全身换脸与免训练头像生成,能帮助开发者比较单人和多人场景的接入方式及 API 使用路径。