跳到正文

全部动态

今日 2 条
5月28日周四
5月19日周二
  1. ElevenLabs · 音频创作62

    ElevenLabs推出教授语音AI支持计划与 Albert Einstein 互动学习体验

    ElevenLabs推出面向教授的语音AI支持计划,并上线基于 Albert Einstein 声音与档案的互动学习体验。教授可免费使用 Pro tier,并为特定课程和项目向学生提供限时访问。Albert Einstein 的重现声音已在 ElevenReader 和 ElevenLabs Agents 中提供,支持英语、德语、法语、巴西葡萄牙语和西班牙语。

    推荐理由:同时覆盖教育者获取权限与历史声音互动两端,为课堂语音工具的接入方式和学习体验设计提供了可参考案例。

5月18日周一
5月17日周日
5月7日周四
4月29日周三
  1. ElevenLabs · 音频创作76

    ElevenLabs 发布音乐发现与创作平台 ElevenMusic

    ElevenLabs 发布 AI 音乐发现与创作平台 ElevenMusic,将听歌、重混、原创创作、发布和变现连接在一起。平台上线时已有超过 4,000 名独立及新兴艺术家参与,用户可调整曲风和速度重混曲目,也可从歌词、旋律或情绪创作完整曲目。ElevenMusic 同步推出 Eleven Album Vol. 2,并已开放 App 和网页版使用;创作者收益取决于听众参与度、资格门槛和平台收入。

    推荐理由:ElevenMusic把音乐发现、重混、原创创作与发布变现放在同一平台,呈现了面向创作者和听众的参与式音乐工作流。

4月9日周四
  1. ElevenLabs · 音频创作67

    ElevenLabs推出本地部署方案,支持 On-Premise 与 On-Device

    ElevenLabs宣布支持 On-Premise 和 On-Device 部署,将语音 AI 扩展到云端和 VPC 之外。On-Premise 与 On-Device 目前处于 early access,首批版本预计在 2026 年上半年推出;VPC 部署现已可用,并支持自定义声音和针对语言或方言的微调。

    推荐理由:材料清晰区分了 On-Premise、On-Device 与 VPC 的部署边界,便于企业按数据驻留和离线推理需求选择方案。

3月5日周四
2月11日周三
1月21日周三
  1. World Labs · 空间智能与世界模型86

    World Labs 发布 World API,将文本和视频生成可探索 3D 世界

    World Labs 发布 World API,调用 Marble 多模态世界模型,可从文本、图像、全景、多视图输入和视频生成可导航的 3D 世界。生成结果支持浏览器渲染、导出到下游工具,或集成进互动系统与模拟流程。World API 已通过 World Labs Platform 提供,平台支持管理 API keys、查看用量与计费、购买 credits 及访问文档。

    推荐理由:World API 将多种视觉与文本输入转为可探索 3D 世界,并提供渲染、导出和应用集成入口,可用于评估空间内容生成工作流。

  2. ElevenLabs · 音频创作67

    ElevenLabs 发布由 Eleven Music 驱动的《The Eleven Album》

    ElevenLabs 发布《The Eleven Album》,由 Liza Minnelli、Art Garfunkel 等艺术家与 Eleven Music 共同创作原创音乐,涵盖说唱、流行、R&B、EDM、电影配乐和全球音乐等风格。Eleven Music 可根据简单提示生成完整作品,并支持调整歌词、时序和乐器,以及下载最多六条录音室质量分轨。专辑现已上线。

    推荐理由:发布既展示了 Eleven Music 在音乐创作中的具体工作流,也交代了原创、商用授权和分轨下载等面向制作环节的能力。

1月15日周四
  1. ElevenLabs · 音频创作68

    MasterClass借助 ElevenLabs 让 AI 导师实现实时语音互动

    MasterClass通过 ElevenLabs Text to Speech 为 Gordon Ramsay、Mark Cuban 和 Chris Voss 等 AI 导师提供实时语音对话。上线首年超过75%的 On Call 用户通过语音互动,双方还建立了涵盖红队测试、内容审核和人工复核的安全质量框架,并探索 AI roleplay 与 ElevenLabs Agents Platform。

    推荐理由:案例呈现了语音质量、低延迟、联合训练与多层安全审核如何共同支撑品牌化 AI 导师的实时交互。

1月9日周五
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布语音转录模型 Scribe v2

    ElevenLabs 发布 Scribe v2,面向批量转录、字幕和听写场景,强化了长音频、停顿、语气变化、长静音及多说话人和口音的处理。Scribe v2 支持最多 100 个关键词或短语提示、最多 56 类实体检测及精确时间戳,并能自动转录单个音频文件中的多种语言。

    推荐理由:Scribe v2针对长音频、多语言和复杂说话场景优化,并结合关键词提示与实体时间戳,适合评估批量转录和审片工作流。

12月8日周一
  1. Diffusers · Releases62

    Diffusers 0.36.0 发布:新增多条图像与视频管线、TaylorSeer 缓存和 kernels 注意力后端

    Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。

    推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。

11月19日周三
  1. Replicate · 模型与制作实践66

    Retro Diffusion 四款像素艺术模型上线 Replicate

    Retro Diffusion 的 rd-fast、rd-plus、rd-tile 和 rd-animation 四款像素艺术模型现已可在 Replicate 上运行,面向游戏素材、角色精灵、瓦片和复古图形生成。模型支持多种风格预设,部分模型支持自定义尺寸、输入图像、调色板图像、背景移除和无缝平铺;其中 rd-animation 用于生成具有一致构图的动画精灵或精灵表。

    推荐理由:四款模型分别覆盖快速生成、高质量图像、瓦片集和动画精灵,读者可据此按游戏素材类型选择像素艺术生成工作流。

11月17日周一
  1. ElevenLabs · 音频创作85

    ElevenLabs 发布 Image & Video(Beta),整合图像、视频与音频创作

    ElevenLabs 发布 Image & Video(Beta),将图像、视频和音频创作整合到同一平台工作流中。用户可调用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,也可使用 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成图像,并在 Studio 中完成配音、音乐、音效、口型同步、时间线调整和导出。

    推荐理由:将图像、视频生成与配音、音乐、音效及时间线编辑放进同一工作流,便于评估一站式多模态创作的实际覆盖范围。

11月12日周三
  1. ElevenLabs · 音频创作21

    Harvey 与 ElevenLabs 合作,为法律行业打造全球多语言语音能力

    Harvey 与 ElevenLabs 合作,为法律行业打造全球多语言语音能力,使 Harvey 能以数十种语言、方言或口音自然交流。首阶段将支持 Harvey 几乎以任何语言或方言朗读回答,能力由 ElevenLabs 的 Text to Speech 和 Speech to Text 驱动;后续将加入多语言语音翻译、voice mode、口头庭审模拟和语调定制。

11月11日周二
  1. ElevenLabs · 音频创作67

    ElevenLabs 与 Sir Michael Caine 合作推出 Iconic Marketplace

    ElevenLabs 与 Sir Michael Caine 合作,并推出 Iconic Marketplace,为公司申请使用知名人才参与项目和内容提供双边平台。平台目前已有超过 25 种标志性声音,并与包括 CMG Worldwide 在内的机构合作,强调授权、同意和创作真实性。

    推荐理由:该平台把名人声音合作放在授权、同意与创作真实性框架下,为品牌和工作室评估 AI 音频商业化与版权流程提供了具体案例。

10月21日周二
  1. Replicate · 模型与制作实践65

    Replicate上线Datalab Marker与OCR文档解析模型

    Replicate上线Datalab的Marker与OCR模型,可将PDF、DOCX、PPTX和图像解析为Markdown或JSON。Marker支持表格、数学公式、代码、图像提取及按JSON Schema提取字段;OCR支持90种语言,并返回阅读顺序和表格网格。

    推荐理由:这次接入同时给出结构化抽取、处理速度、基准对比与计价,便于评估文档解析和 OCR 工作流的落地成本。

10月15日周三
9月8日周一
  1. Replicate · 模型与制作实践73

    Replicate 为 torch.compile 编译产物增加缓存,模型冷启动提速 2–3 倍

    Replicate 开始缓存 PyTorch 模型的 torch.compile 编译产物,以减少模型容器启动时的编译开销,black-forest-labs/flux-kontext-dev、prunaai/flux-schnell 和 prunaai/flux.1-dev-lora 的启动速度提升 2–3 倍。

    推荐理由:Replicate的缓存机制针对torch.compile首次编译开销,给出了多个模型冷启动时间变化,可用于评估部署优化收益。

8月10日周日
  1. Replicate · 模型与制作实践76

    Replicate 发布远程 MCP server,支持通过自然语言探索和运行 HTTP APIs

    Replicate 发布托管远程 MCP server,可接入 Claude Desktop、Claude Code、Cursor 和 VS Code,通过聊天式自然语言探索并运行 Replicate 的 HTTP APIs。

    推荐理由:它展示了 Replicate 的模型检索、比较和运行如何接入 Claude、Cursor 等工具,并通过远程认证与响应过滤落地 MCP 工作流。

7月31日周四
  1. Replicate · 模型与制作实践75

    Replicate 联合 Pruna AI 发布优化版 Wan 2.2 视频模型

    Replicate 与 Pruna AI 合作发布优化版 Wan 2.2,FAST 文生视频和图生视频 480p 每条 0.05 美元、720p 每条 0.10 美元,推理时间约 30 秒。未优化的图生视频 480p 每条 0.40 美元、720p 每条 1.00 美元,可通过 Replicate API 调用。Replicate 称未来几天将发布更多与 Pruna 的优化版本。

    推荐理由:Replicate 与 Pruna AI 优化的 Wan 2.2 给出了按条计费的视频生成价格与推理耗时,可据此评估低成本视频试错方案。

7月17日周四
  1. Replicate · 模型与制作实践69

    Replicate 上线 Bria 商业安全视觉 AI 模型套件

    Replicate 与 Bria 合作,将 Bria 的视觉 AI 模型套件上线平台,包含基于授权数据训练的 Bria 3.2 文生图模型。套件还提供移除背景、局部重绘、增加分辨率、扩展画布和背景生成等功能;Bria 表示其模型使用来自 Getty Images、Envato、Freepik 等来源的 100% licensed data。

    推荐理由:读者可据此了解一组覆盖生成、抠图、局部重绘与扩图的视觉工具,以及其面向企业场景强调的授权数据与合规边界。

6月24日周二
5月22日周四
  1. Replicate · 模型与制作实践68

    Replicate上线 OpenAI 最新聊天、视觉与推理模型

    Replicate现已支持运行 OpenAI 的 GPT-4.1、GPT-4o 和 o-series 等聊天、视觉与推理模型。GPT-4.1系列支持最长 1 million tokens 的上下文,GPT-4o系列处理文本、图像和音频,o-series面向数学、科学与复杂问题的结构化推理。

    推荐理由:材料按上下文、模态、推理任务和成本速度列出模型差异,并给出 Replicate 网页界面与 API 的操作入口。

5月15日周四
5月6日周二
  1. Replicate · 模型与制作实践67

    Replicate 提供 MiniMax Speech-02 语音模型 API

    Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。

    推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。

4月16日周三
  1. Replicate · 模型与制作实践70

    Easel AI 两款模型上线 Replicate,支持全身换脸与 AI avatars

    Easel AI 的全身换脸和 AI avatars 两款模型现已在 Replicate 提供,可通过网页或 API 调用。全身换脸可在单张图中替换一或两人并保留服装、光线和图像风格;AI avatars 只需单个提示词即可生成一或两人的头像,无需训练或 LoRAs。

    推荐理由:这次接入同时覆盖全身换脸与免训练头像生成,能帮助开发者比较单人和多人场景的接入方式及 API 使用路径。

4月9日周三
  1. Diffusers · Releases88

    Diffusers 0.33.0 发布,新增 Wan2.1 视频管线与多项显存优化

    Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。

    推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。

1月16日周四
12月24日周二
  1. Diffusers · Releases91

    Diffusers 0.32.0 发布:新增视频与图像生成管线、量化后端及训练脚本

    Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。

    推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。

11月26日周二
  1. Replicate · 模型与制作实践62

    Replicate 让 FLUX 微调推理提速,并支持从 Hugging Face、Civitai 加载 LoRA

    Replicate 宣布 FLUX 微调推理大幅提速,微调模型运行速度已与基础模型相同:FLUX.1 [schnell] 在 512x512、4 步下为 0.6 秒(P50),FLUX.1 [dev] 在 1024x1024、28 步下为 2.8 秒(P50)。

    推荐理由:Replicate 公布了 FLUX 微调推理的加速数据与开源优化路径,可据此判断自建或托管微调服务的成本与质量取舍。

10月22日周二
  1. Replicate · 模型与制作实践62

    Ideogram v2 局部重绘功能上线 Replicate API

    Ideogram 为 Ideogram v2 推出局部重绘功能,Replicate 同步将该模型接入自家 API,提供 ideogram-ai/ideogram-v2 与 ideogram-ai/ideogram-v2-turbo 两个版本,前者图像质量更好、后者速度更快。

    推荐理由:Replicate 接入 Ideogram v2 局部重绘,并给出提示词写法与开源 demo,可作图像编辑工作流的选型参考。

10月10日周四
  1. Replicate · 模型与制作实践81

    Replicate 提升 FLUX 生成速度并开源优化代码

    Replicate 宣布 FLUX 在其平台上的端到端生成速度提升,并将相关优化代码开源。在美国西海岸使用 Python 客户端测试时,FLUX.1 [schnell] 在 512x512、4 steps 下为 0.29 秒,1024x1024、4 steps 下为 0.72 秒;FLUX.1 [dev] 在 1024x1024、28 steps 下为 3.03 秒。

    推荐理由:文中给出的端到端测速和可关闭的优化开关,为比较 FLUX 在不同分辨率与步数下的速度、质量和部署取舍提供了具体依据。

8月16日周五
  1. Replicate · 模型与制作实践73

    Replicate Intelligence #11:Replicate 支持微调 FLUX.1,汇总数字人、可控视频与可玩游戏世界项目

    Replicate 宣布支持在平台上用自有图片微调 FLUX.1 图像生成模型,用户可上传 12-20 张多样图片并设置触发词,约 30 分钟生成定制模型。

    推荐理由:这期内容给出 FLUX.1 微调所需的图片数量与耗时,并串联数字人、可控视频和可玩游戏世界案例,便于比较不同生成工作流。

8月9日周五
  1. Replicate · 模型与制作实践70

    Replicate 支持 FLUX.1 [dev] 图像到图像转换

    Replicate 宣布 FLUX.1 [dev] 支持图像到图像转换,用户可上传起始图像、输入提示词,并通过 prompt strength 调整二者的影响比例。该功能适合风格迁移和构图控制,但从彩色图像生成黑白线稿仍较困难;周报还介绍了 Streamlit 与 Replicate 的应用开发教程,以及用于 Minecraft 开放世界探索的 Odyssey 智能体框架。

    推荐理由:文章同时给出 FLUX.1 [dev] 图像到图像的使用方式与局限,并串联 Streamlit 应用开发和开放世界智能体研究,便于了解近期开源实践方向。

8月1日周四
  1. Replicate · 模型与制作实践87

    FLUX.1 开源图像生成模型上线 Replicate API

    Black Forest Labs 开发的 FLUX.1 开源图像生成模型已在 Replicate 提供,可通过浏览器或一行代码调用。模型分为 FLUX.1 [pro]、[dev] 和 [schnell],分别面向高性能、非商业应用和本地开发;文中列出的单图价格为 $0.055、$0.030 和 0.003。

    推荐理由:文章并列介绍 FLUX.1 的三种版本、适用场景与单图价格,便于比较云端调用、非商业应用和本地开发的选择。