跳到正文

#音频/音乐

今日 0 条
9月30日周三
  1. 可灵 · 模型与创作实践62

    2026 年 5 款 UGC 视频生成 AI 工具对比与 Kling AI 实践指南

    可灵发布一篇 2026 年 UGC 视频生成工具指南,对比 Kling AI、Higgsfield、Dreamina、HeyGen 和 CapCut 在场景生成、数字人呈现与视频组装等工作流中的适用方向,强调这不是基准排名。

    推荐理由:文章按产品场景、脚本呈现与后期组装拆分工具差异,并给出从参考素材到审片修复的 Kling AI UGC 工作流,便于评估商品保真与制作成本。

  2. 可灵 · 模型与创作实践81

    Kling 4.0 与 3.0 有哪些不同

    Kling 4.0将于2026年10月正式发布,原生视频生成时长从3–15秒扩展至3–30秒,并支持最多10个关键帧。新版本还支持最多15个组合参考资产、10-bit HDR、双声道立体声和定向多模态视频编辑。Kling 4.0 Flash已于9月28日向有限用户开放提前体验。

    推荐理由:这篇对比把时长、关键帧、参考资产和视频编辑放在同一框架中,便于按项目复杂度选择 Kling 3.0 或 4.0。

9月28日周一
9月21日周一
9月15日周二
  1. Luma · 创作产品与实践52

    Luma Scenes 与 Google Flow SceneBuilder 对比:哪种 AI 分镜方式更适合故事板制作?

    文章比较 Luma Scenes 和 Google Flow SceneBuilder 的 AI 分镜流程:Luma Scenes 先生成完整故事板并在渲染前审核,Google Flow SceneBuilder 则先生成视频片段,再通过时间线剪辑组装。文中还对比了关键帧级修改与片段级控制、跨镜头视觉一致性,以及 Google Flow 基于 Veo 3.1 models 的原生音频生成。

9月10日周四
  1. ElevenLabs · 音频创作62

    ElevenLabs 与环球音乐达成多年战略协议,将推出授权音乐创作平台

    ElevenLabs 与环球音乐集团(UMG)宣布达成多年授权协议和战略合作,这是 ElevenLabs 首次与主流唱片公司签约,涵盖音乐授权与产品开发。双方将共同为艺人和词曲作者开发 AI 音频产品,并推出一个面向粉丝的 AI 音乐创作平台,支持对参与艺人的曲目进行混音、串烧、新演绎和个性化人声体验。

    推荐理由:ElevenLabs 与 UMG 的授权合作给出了 AI 音乐平台在版权与分成上的落地路径,可供判断音乐生成产品的合规边界。

9月4日周五
9月3日周四
8月20日周四
  1. Diffusers · Releases62

    Diffusers 0.40.0 发布:新增 LTX-2.5、MiniMax-H3 等管线并支持张量并行

    Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。

    推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。

  2. ComfyUI · 工作流与实践77

    ComfyUI 与 MiniMax 发起 H3 音画同步社区挑战赛

    ComfyUI 与 MiniMax 团队发起 H3 音画同步社区挑战赛,要求参赛者用 H3 在同一轮生成视频和同步音频,作品最长 90 秒且每人限投一次。参赛者还需提交实际的 ComfyUI `.json` 工作流,活动支持本地运行或 Comfy Cloud,9/2 公布结果。

    推荐理由:挑战同时要求 H3 在同一轮生成音频与视频,并提交可复现的 ComfyUI 工作流,呈现了音画同步创作的实践约束。

8月14日周五
8月8日周六
  1. ComfyUI · Releases78

    ComfyUI v0.31.0 更新,新增 Wan-Animate2、Flux 3 视频和 SeeDance 2.5 支持

    ComfyUI 发布 v0.31.0,新增 Wan-Animate2、Flux 3 视频模型和 SeeDance 2.5 支持,并改进多项 MiniMax H3 与音频处理。版本还加入 ImageCompositor 节点、Bloom 2 和 Wonder 3.5 支持,并对 LTX、Wan 做加速;同时修复 Linux 内存、采样器和 MiniMax H3 相关问题。

    推荐理由:该版本集中带来视频、图像合成与音频处理更新,读者可据新增节点、模型接入和性能修复安排升级。

8月6日周四
8月4日周二
  1. Black Forest Labs · 图像与视频80

    Black Forest Labs 发布 FLUX 3 Video,支持文生视频与图生视频

    Black Forest Labs 通过 BFL API 和部分合作方开放 FLUX 3 Video 生成能力的初始版本,可生成最长 20 秒的 HD 视频并同步生成原生音频,Full HD 通过超分输出。

    推荐理由:官方给出 FLUX 3 Video 的生成能力、分辨率与草稿模式,可据此判断多模态视频生成在创作流程中的可用边界。

8月3日周一
  1. ComfyUI · 工作流与实践89

    MiniMax H3 发布并获 ComfyUI Day-0 支持,开放权重支持原生音频与 2K 视频

    MiniMax H3 今日发布开放权重,并在 ComfyUI 中获得 Day-0 原生支持,可接收文本、图像、视频或音频,生成带立体声的 2K、最长 15 秒视频。

    推荐理由:文章把 H3 的多模态输入、原生立体声和 ComfyUI 本地运行路径放在一起,并给出显存缩减与工作流入口,便于评估视频创作部署成本。

7月30日周四
  1. Google DeepMind60

    Google DeepMind 在 Flow Music 发布音乐生成模型 Lyria 3.5

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循、结构感知更好,人声更具表现力和情感且发音改善,并可更便捷地控制输出节奏与时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与节奏控制上的具体改进方向,可供音乐生成工具选型参考。

7月23日周四
  1. Black Forest Labs · 图像与视频78

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access,联合学习图像、视频和音频,可混合模态生成图像与带音频的视频,单次生成视频最长 20 秒。

    推荐理由:FLUX 3 把图像、视频、音频与动作预测放进同一架构,并给出与多家视频模型的早期对比,可供多模态选型参考。

6月4日周四
  1. ElevenLabs · 音频创作85

    ElevenLabs 在 ElevenCreative 推出 Flows Agent

    ElevenLabs 在 ElevenCreative 推出 Flows Agent,将对话式 AI 助手接入 Flows 画布,自动选择模型、创建并连接节点,执行图像、视频和音频生成流程。它支持通过对话修改已有流程,并可在高成本生成前请求确认;复杂工作流也能在后台运行,现已在 ElevenCreative 提供使用。

    推荐理由:它把多模态节点编排、生成执行和变体迭代合并到对话入口,可用于判断创作流程如何降低试错与额度控制成本。

5月26日周二
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布 Music v2 音乐生成模型

    ElevenLabs 发布 Music v2 音乐生成模型,提升人声、器乐、编曲和多语言支持,并支持更复杂的歌曲结构。模型支持按片段局部重绘、分段构建完整歌曲,以及在同一首歌中处理多种曲风、快速说唱和非音乐音效。

    推荐理由:Music v2 将局部重绘、分段作曲和多语言演唱整合到音乐生成流程,便于比较创作者、品牌与开发者的不同接入方式。

5月22日周五
  1. ElevenLabs · 音频创作76

    ElevenLabs Voice Marketplace创作者收入增至$22 million,创作者超10,400人

    ElevenLabs表示,Voice Marketplace上的语音创作者收入在六个月内从$11 million翻倍至超过$22 million,平台已有10,400+名创作者。创作者可自行设定使用场景、价格档位和通知期,客户使用语音时按用量和条款产生收入,平台还提供同意、限制用途和移除语音等控制。Voice Library现覆盖32种语言,并向客户提供免费商业使用许可。

    推荐理由:收入与创作者规模数据,结合授权条款、使用计费和撤回机制,呈现了语音 IP 从一次性授权转向持续分成的商业路径。

5月1日周五
4月29日周三
  1. ElevenLabs · 音频创作76

    ElevenLabs 发布音乐发现与创作平台 ElevenMusic

    ElevenLabs 发布 AI 音乐发现与创作平台 ElevenMusic,将听歌、重混、原创创作、发布和变现连接在一起。平台上线时已有超过 4,000 名独立及新兴艺术家参与,用户可调整曲风和速度重混曲目,也可从歌词、旋律或情绪创作完整曲目。ElevenMusic 同步推出 Eleven Album Vol. 2,并已开放 App 和网页版使用;创作者收益取决于听众参与度、资格门槛和平台收入。

    推荐理由:ElevenMusic把音乐发现、重混、原创创作与发布变现放在同一平台,呈现了面向创作者和听众的参与式音乐工作流。

4月16日周四
  1. Google DeepMind82

    Google 发布 Gemini 3.1 Flash TTS 语音模型

    Google 推出 Gemini 3.1 Flash TTS,提升语音质量、可控性与表现力,并支持 70+ 语言和原生多说话人对话。模型引入可通过自然语言控制音色、语速和表达方式的音频标签,开发者可在 Gemini API 和 Google AI Studio 预览,企业可通过 Vertex AI 预览,Workspace 用户可在 Google Vids 使用。

    推荐理由:音频标签、多人对话和 70+ 语言支持,为评估语音产品的表达控制、全球化覆盖与 API 落地路径提供了具体参照。

3月31日周二
  1. ElevenLabs · 音频创作65

    ElevenLabs与欧盟理事会秘书处合作,为波兰轮值主席国外交发布会提供多语种AI配音

    ElevenLabs与欧盟理事会秘书处合作,在2025年波兰担任欧盟理事会轮值主席国期间,为外交新闻发布会制作英语、法语和波兰语AI配音。20多场部长级会议相关录音发布在主席国官方YouTube频道,观众可选择音轨,配音保留发言人的语气和节奏。翻译由ElevenProductions人工核验,发言人提供符合GDPR的明确同意,语音模型仅限官方会议翻译使用,所有AI生成录音均明确标注。

    推荐理由:案例展示了外交音频在多语种扩展中如何结合AI配音、人工核验与GDPR同意流程,适合参考高敏感内容的上线控制。

2月12日周四
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.0 正式发布,支持四种模态输入与音视频联合生成

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入,可同时输入多达 9 张图片、3 段视频、3 段音频及自然语言指令。

    推荐理由:官方给出多模态参考、视频编辑与双声道音频的能力边界和失败项,可据此判断其在电商与影视流程中的可用位置。

2月4日周三
  1. ElevenLabs · 音频创作78

    ElevenLabs 完成 $500M Series D 融资,估值达 $11B

    ElevenLabs 宣布完成 $500M Series D 融资,公司估值达到 $11B,2025 年 ARR 超过 $330M。新资金将用于扩大 ElevenAgents 企业语音与对话智能体平台、升级语音智能体,并推进情感对话模型、配音和音频通用智能研究。

    推荐理由:材料同时给出融资规模、估值变化与 ElevenAgents 的产品投入方向,可用于判断语音智能体商业化与企业采用的推进路径。

2月2日周一
  1. ElevenLabs · 音频创作69

    ElevenLabs 发布正式可用的 Eleven v3 文本转语音模型

    ElevenLabs 宣布 Eleven v3 文本转语音模型结束 Alpha 阶段并正式可用,现已在所有平台开放。在覆盖 8 种语言、27 个类别的内部基准中,错误率从 15.3% 降至 4.9%,错误减少 68%;测试中用户有 72% 的时间更偏好新版本而非此前 Alpha 版本。更新重点包括更准确处理数字、符号和专业记号,例如将电话号码、货币、化学式和体育比分按上下文朗读。

    推荐理由:这次更新提供了文本转语音模型在跨语言符号朗读和稳定性上的具体变化,便于评估号码、公式与复杂格式的生成可用性。

1月21日周三
  1. ElevenLabs · 音频创作67

    ElevenLabs 发布由 Eleven Music 驱动的《The Eleven Album》

    ElevenLabs 发布《The Eleven Album》,由 Liza Minnelli、Art Garfunkel 等艺术家与 Eleven Music 共同创作原创音乐,涵盖说唱、流行、R&B、EDM、电影配乐和全球音乐等风格。Eleven Music 可根据简单提示生成完整作品,并支持调整歌词、时序和乐器,以及下载最多六条录音室质量分轨。专辑现已上线。

    推荐理由:发布既展示了 Eleven Music 在音乐创作中的具体工作流,也交代了原创、商用授权和分轨下载等面向制作环节的能力。

12月16日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节 Seedance 1.5 pro 音视频创作模型正式发布

    字节 Seed 团队正式发布新一代音视频创作模型 Seedance 1.5 pro,支持文本到音视频合成与图像引导的音视频生成,已上线即梦AI和豆包。模型采用基于 MMDiT 的统一音视频联合生成框架,实现口型、语调与表演节奏的音画同步,原生支持中文、英文、日文、韩语、西班牙语、印尼语及四川话、粤语等方言。

    推荐理由:官方披露了音视频联合生成的架构与评测细节,可据此判断音画同步能力在短剧、广告等场景的可用边界。

11月17日周一
  1. ElevenLabs · 音频创作85

    ElevenLabs 发布 Image & Video(Beta),整合图像、视频与音频创作

    ElevenLabs 发布 Image & Video(Beta),将图像、视频和音频创作整合到同一平台工作流中。用户可调用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,也可使用 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成图像,并在 Studio 中完成配音、音乐、音效、口型同步、时间线调整和导出。

    推荐理由:将图像、视频生成与配音、音乐、音效及时间线编辑放进同一工作流,便于评估一站式多模态创作的实际覆盖范围。

11月11日周二
  1. ElevenLabs · 音频创作67

    ElevenLabs 与 Sir Michael Caine 合作推出 Iconic Marketplace

    ElevenLabs 与 Sir Michael Caine 合作,并推出 Iconic Marketplace,为公司申请使用知名人才参与项目和内容提供双边平台。平台目前已有超过 25 种标志性声音,并与包括 CMG Worldwide 在内的机构合作,强调授权、同意和创作真实性。

    推荐理由:该平台把名人声音合作放在授权、同意与创作真实性框架下,为品牌和工作室评估 AI 音频商业化与版权流程提供了具体案例。

6月10日周二
  1. Replicate · 模型与制作实践60

    Replicate 发布 Veo 3 提示词指南:如何写出最佳效果

    Replicate 发布 Veo 3 提示词指南,建议在提示词中明确主体、场景、动作、风格、镜头运动、构图与氛围,并单独描述对白、环境音、音效和音乐。文中指出 Veo 3 对同一提示词多次生成结果高度相似,想探索不同效果应改用差异较大的提示词;保持角色描述逐字一致可提升跨场景视觉连续性。

    推荐理由:Replicate 基于实测给出 Veo 3 的提示词结构、音频与角色一致性写法,可迁移到视频生成工作流。

6月6日周五
  1. Replicate · 模型与制作实践79

    Google Veo 3 使用指南:从原生音频到镜头提示词

    Replicate介绍 Google Veo 3 的视频生成能力,并分享一套涵盖镜头构图、焦段效果、风格和运镜的提示词方法。文章还展示了对话与口型同步、视频游戏世界等案例,并给出冰柱特写示例提示词。

    推荐理由:文章整理了 Veo 3 的镜头构图、焦段、风格与运镜提示词,并结合对话、口型同步和游戏世界生成案例,便于复用其视频创作流程。

1月17日周五