ElevenLabs 发布语音转录模型 Scribe v2
ElevenLabs 发布 Scribe v2,面向批量转录、字幕和听写场景,强化了长音频、停顿、语气变化、长静音及多说话人和口音的处理。Scribe v2 支持最多 100 个关键词或短语提示、最多 56 类实体检测及精确时间戳,并能自动转录单个音频文件中的多种语言。
推荐理由:Scribe v2针对长音频、多语言和复杂说话场景优化,并结合关键词提示与实体时间戳,适合评估批量转录和审片工作流。
ElevenLabs 发布 Scribe v2,面向批量转录、字幕和听写场景,强化了长音频、停顿、语气变化、长静音及多说话人和口音的处理。Scribe v2 支持最多 100 个关键词或短语提示、最多 56 类实体检测及精确时间戳,并能自动转录单个音频文件中的多种语言。
推荐理由:Scribe v2针对长音频、多语言和复杂说话场景优化,并结合关键词提示与实体时间戳,适合评估批量转录和审片工作流。
Toyota 北加州经销商协会与创意机构 H/L 推出由 Brock Purdy AI 数字人主持的语音互动体验,基于 ElevenLabs Agents 平台运行,并通过 webhook 将语音回应与网页动画实时同步。活动上线前几周产生 12k+ 次语音互动,平均参与时长约 2 分钟,超过 25% 的对话促成提交线索表单或探索产品等行动。
推荐理由:这则案例把语音智能体、实时动画同步和线索收集串成一条营销流程,适合参考品牌互动项目的设计与衡量方式。
ElevenLabs宣布与Liberty Global Ventures达成商业合作,并获得其战略投资,以推进语音AI在欧洲电信和娱乐产品中的应用。双方将探索AI客户服务智能体、联网电视与流媒体语音界面,以及客户沟通和营销等场景;该投资由Liberty Global Ventures Partner Rebecca Hunt领投,支持ElevenLabs扩大全球基础语音模型和多语言语音AI。
推荐理由:这项合作同时覆盖战略投资与电信、娱乐落地场景,可用于观察语音 AI 从模型能力走向客户服务和电视交互的商业化路径。
Harvey 与 ElevenLabs 合作,为法律行业打造全球多语言语音能力,使 Harvey 能以数十种语言、方言或口音自然交流。首阶段将支持 Harvey 几乎以任何语言或方言朗读回答,能力由 ElevenLabs 的 Text to Speech 和 Speech to Text 驱动;后续将加入多语言语音翻译、voice mode、口头庭审模拟和语调定制。
ElevenLabs 与乌克兰政府签署谅解备忘录,推动 AI 公共服务从概念进入生产,共建“世界首个智能体政府”。乌克兰已以 Diia.AI 迈出第一步,该平台被称为“世界首个公共服务智能体应用与平台”,教育和经济领域也在推进 Mriia、Obriy。ElevenLabs 的工程师团队驻留 Kyiv,与乌克兰团队协作部署,乌克兰计划到 2030 年成为 AI 公共服务应用的领导者。
字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。
推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。
Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。
推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。
Replicate 发布创作案例汇总,介绍 ShieldGemma 2、Hunyuan3D 2Mini、CSM-1B、Orpheus-3B、Luma 和 Kling v1.6 Pro 等模型与社区实验。
豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。
推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。