Microsoft AI 发布 MAI-Transcribe-2-Streaming 与 MAI-Voice-2.1 语音模型
Microsoft AI 发布实时转写模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型,分别覆盖 60 种语言与 23 种语言。
Microsoft AI 发布实时转写模型 MAI-Transcribe-2-Streaming 和两款文本转语音模型,分别覆盖 60 种语言与 23 种语言。
Tavus推出 Griffin,这是一种面向实时面对面交流的 Human Interaction Model;Tavus称其研究中有48%的参与者在一分钟视频通话后相信 Griffin 是真人。
推荐理由:材料提供了 Griffin 与真人及上一代 AI 的对照数据,并交代了研究预览的开放范围和安全前提,便于判断其当前成熟度。
该研究提出基于 LLM 的多模态对话情绪评估框架,在 IEMOCAP 上同时进行离散情绪识别和 Valence-Arousal-Dominance(VAD)维度评估,并比较 LLaMA、GPT 和 Qwen 系列的零样本、少样本提示与 LoRA 微调。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评估开放源码 TTS 模型的可懂度、速度和说话人相似度,并覆盖多语言与语音克隆场景。排行榜使用 WER/CER、RTFx、TTFA 和 SIM,支持在 H200 GPU 与 CPU 上比较流式性能,并提供 Listen 标签页供用户试听和投票。
推荐理由:该排行榜把 WER/CER、推理速度和说话人相似度纳入统一评测,并保留试听投票,便于比较开放源码 TTS 在多语言和流式场景中的取舍。
ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。
推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的选型与成本取舍。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色与电话(telephony)接入。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,读者可据此判断语音类应用的接入门槛与能力边界。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言标签页上的首个印度语言。
推荐理由:公开 ASR 榜单首次纳入印地语与印度英语,并公开说话人元数据与格参考,可用于判断语音模型的地域偏差。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转为经过整理和格式化的文本。
推荐理由:语音转写模型选型可参考其流式与非流式 WER 差异、双 API 划分和自定义词表能力。
Hugging Face 的最新研究提出三项测试,用于量化语音识别模型针对公开基准进行优化的程度,并评估了 11 个常用开源 ASR 模型。
推荐理由:研究把参考文本错误、静音数字和拼写切换转化为三项可量化测试,为语音模型选型和评测集设计提供了具体方法。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖与 TTFA 实测数据,可供语音 Agent 选型时比较自部署延迟与可控性。
字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。
推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。
字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,并已在火山方舟体验中心上线。模型支持一条 prompt 编排对白、音效与环境声,时间控制精度达 100ms,支持零样本音色生成与参考音频延展,单次可生成约 2 分钟音频并继续延长以保持角色一致性。
推荐理由:官方披露了统一建模多要素音频、100ms 时间控制与 20+ 语种等能力,可据此判断其在配音与多语种内容生产中的可用边界。
Real World VoiceEQ 评估语音 AI 的人类交互质量,覆盖 40 多个专有和开源语音模型、15 多个维度及 60 多项指标。该基准基于超过 1 million 个人类评分,涵盖 ASR、TTS、S2S 和语音理解,结果显示不同模型在技术准确性、情绪理解、表达力与鲁棒性之间存在明显专长差异。
推荐理由:该基准将语音模型评测从 WER 和延迟扩展到情绪、身份与背景声等人类感知维度,可帮助定位真实对话中的听辨与回应短板。
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方披露了连续语音翻译的延迟取舍与多产品开放节奏,可据此判断实时语音翻译的选型与接入时机。
字节 Seed 正式推出原生全双工语音大模型 Seeduplex,基于边听边说框架,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其复杂场景误回复率和误打断率减少一半,抢话比例相对下降 40%,判停 MOS 分提高 8%、对话流畅度 MOS 分提升 12%,快问快答场景时延降低约 250ms。
推荐理由:官方给出全双工语音模型的架构思路与多项对比数据,可据此判断实时语音交互的技术路线与落地进度。
字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。
推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。
豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。
推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。