跳到正文

全部动态

今日 1 条
7月23日周四
  1. Black Forest Labs · 图像与视频78

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access,联合学习图像、视频和音频,可混合模态生成图像与带音频的视频,单次生成视频最长 20 秒。

    推荐理由:FLUX 3 把图像、视频、音频与动作预测放进同一架构,并给出与多家视频模型的早期对比,可供多模态选型参考。

7月21日周二
  1. Hugging Face Blog65

    Grabette 发布开源低成本机器人操作数据采集系统

    Pollen Robotics 发布 Grabette,一套用手持夹爪记录机器人操作数据的开源系统,可将演示自动处理为 LeRobot 数据集并上传到 Hugging Face Hub。

    推荐理由:文章给出了从手持采集到 LeRobot 数据集的完整流程,以及硬件成本和示例训练链路,便于评估机器人数据采集的落地门槛。

  2. World Labs · 空间智能与世界模型64

    World Labs 收购机器人公司 SceniX

    World Labs 宣布收购机器人公司 SceniX,SceniX 将加入 World Labs。World Labs 表示,双方将结合空间智能、世界模型、学习型仿真与真实世界学习闭环推进机器人相关技术,后续将分享 SceniX 已构建的早期技术及发展方向。

    推荐理由:这项收购展示了 World Labs 将空间智能和世界模型能力延伸至机器人及真实世界学习闭环的技术路线。

7月20日周一
  1. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布音频创作模型 Seed Audio 1.0

    字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,并已在火山方舟体验中心上线。模型支持一条 prompt 编排对白、音效与环境声,时间控制精度达 100ms,支持零样本音色生成与参考音频延展,单次可生成约 2 分钟音频并继续延长以保持角色一致性。

    推荐理由:官方披露了统一建模多要素音频、100ms 时间控制与 20+ 语种等能力,可据此判断其在配音与多语种内容生产中的可用边界。

7月16日周四
7月15日周三
  1. ComfyUI · Releases79

    ComfyUI v0.28.0 更新,新增 ByteDance 模型与 3D 节点并修复四个漏洞

    ComfyUI 发布 v0.28.0,新增 Seed Audio 1.0、Seedream 5 Pro、SeedVR2 支持以及 Save 3D (Advanced) 节点族。版本还修复了四个安全漏洞,改进 Qwen3-VL、自定义嵌入、视频音频流和 int4 模型等问题。

    推荐理由:该版本把模型接入、3D 工作流与安全修复集中在一次更新中,可用于评估 ComfyUI 对视频、图像和 3D 创作链路的覆盖变化。

  2. Hugging Face Blog79

    Hugging Face 发布 Real World VoiceEQ 语音 AI 人类质量基准

    Real World VoiceEQ 评估语音 AI 的人类交互质量,覆盖 40 多个专有和开源语音模型、15 多个维度及 60 多项指标。该基准基于超过 1 million 个人类评分,涵盖 ASR、TTS、S2S 和语音理解,结果显示不同模型在技术准确性、情绪理解、表达力与鲁棒性之间存在明显专长差异。

    推荐理由:该基准将语音模型评测从 WER 和延迟扩展到情绪、身份与背景声等人类感知维度,可帮助定位真实对话中的听辨与回应短板。

7月8日周三
  1. ByteDance Seed · 视觉生成与编辑80

    字节 Seedream 5.0 Pro 发布,主打复杂信息图与交互式精准编辑

    字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面提升,并带来复杂信息可视化、交互式精准编辑、真实影像与人像质感、原生多语种输入与生成四大能力突破。

    推荐理由:官方给出信息图生成、交互式精准编辑与多语种渲染的能力边界,可据此判断图像模型在专业设计流程中的可用程度。

7月7日周二
  1. Hugging Face Blog60

    微软 Foundry 上线 Hugging Face 模型托管计算

    微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型纳入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 平台。

    推荐理由:原文给出开源权重在 Azure 上的一键部署路径与运行时选型,可据此判断企业自托管开源模型的落地条件。

  2. ElevenLabs · 音频创作61

    ElevenLabs 在加拿大正式开展业务并计划扩大团队

    ElevenLabs 宣布在加拿大正式开展业务,任命 Max Lemmens 为加拿大总经理,并计划在今年将当地团队规模扩大一倍、在多伦多开设首个加拿大办公室。公司称其在加拿大已有 30,000 名用户,TELUS Digital 使用其 AI 语音智能体进行员工培训后将入职培训时间缩短了 20%。

    推荐理由:这次加拿大布局同时给出用户规模、团队扩张和本地案例,可用于观察语音 AI 的企业落地路径。

7月6日周一
  1. Hugging Face Blog62

    Photoroom 详解 PRX 数据策略:从 Lance 构建到 MDS 流式训练

    Photoroom 发布 PRX 系列第四篇,介绍其预训练数据管线:混合公开与内部数据集,用 VLM 重新生成约 100-200 词的长描述,再转为 MDS 供训练流式读取。

    推荐理由:Photoroom 公开 PRX 预训练数据管线的取舍与实测数据,为自建文生图数据流程提供可迁移的工程参考。

7月3日周五
  1. Diffusers · Releases62

    Diffusers 0.39.0 发布:新增 Cosmos 3、Ideogram 4、Krea 2 等多条图像与视频管线

    Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。

    推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。

7月1日周三
6月24日周三
  1. ComfyUI · Releases83

    ComfyUI v0.26.0 发布

    ComfyUI 发布 v0.26.0,新增 Qwen3-VL 文本生成、Boogu-Image、Krea2、Load3DAdvanced 以及 LTX2 的 Context Windows sampling 支持。

    推荐理由:该版本把多种模型节点、分辨率支持和工作流基础设施集中到一次更新中,便于评估 ComfyUI 的模型接入与创作流程变化。

6月22日周一
  1. ElevenLabs · 音频创作71

    ElevenLabs 在 ElevenCreative 推出 Ads Engine,主打广告本地化

    ElevenLabs 在 ElevenCreative 内推出 Ads Engine,首个能力是广告本地化,可接入 Google Ads 和 Meta Ads 账号,拉取现有素材与投放数据,同时完成文本翻译、图像适配和视频配音,再把本地化版本推回 Google、Meta 和 LinkedIn。

    推荐理由:官方披露广告本地化引擎的接入方式与工作流,可据此判断多语言投放的素材生产与审片环节如何变化。

6月19日周五
6月18日周四
  1. ElevenLabs · 音频创作68

    波兰政府通过Vinci入股ElevenLabs并发起AI Lab Poland

    波兰政府通过BGK集团旗下Vinci入股ElevenLabs,并与其共同发起AI Lab Poland。该计划将资本、技术、科学与人才汇聚于一处,目标是帮助波兰新一代AI企业从起步阶段面向全球发展。

    推荐理由:这笔投资将政府资本、技术、科研与人才整合到AI Lab Poland,提供了观察欧洲国家参与AI产业建设的具体案例。

6月17日周三
  1. Black Forest Labs · 图像与视频73

    Envato 如何基于 FLUX 构建创意 AI 引擎

    Envato 基于 FLUX 将参考图变体、纯图像生成和多参考图像编辑整合进统一创作体验。FLUX 已贡献平台约 25% 的图像生成量,累计生成超过 51 million 张图片;其中 Stock riffing 可在 8 秒内生成 5 个变体。Black Forest Labs 称,FLUX.2 在写实、电影感和产品图场景中较可比模型高约 10%,下载率高于平台平均值 16%。

    推荐理由:案例展示了创意平台如何按任务路由模型,将参考图变体、纯文生图和多参考编辑整合进统一工作流,并以延迟与生成量衡量落地效果。

6月9日周二
  1. Google DeepMind73

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。

6月8日周一
  1. ElevenLabs · 音频创作70

    ElevenLabs 与英国政府签署语音 AI 合作协议并扩大伦敦总部

    ElevenLabs 与英国科学、创新与技术部(DSIT)签署谅解备忘录,探索将语音 AI 用于公共服务可及性、AI 安全研究和人才培养。ElevenLabs 今年将在伦敦启用一座面积为现有办公室三倍的新总部,并将英国员工数量翻倍至 200 人;合作还将借助 ElevenLabs for Government 推进相关公共部门项目。

    推荐理由:这项合作同时覆盖公共服务可及性、AI 安全研究和人才培养,并给出英国团队扩张规模,可供观察语音 AI 的政务落地路径。

6月4日周四
  1. Black Forest Labs · 图像与视频81

    FLUX.2 [klein] 4B 预装至 ASUS ProArt 笔记本,支持本地图像生成

    Black Forest Labs 宣布,FLUX.2 [klein] 4B 将预装在新一代搭载 RTX GPU 的 ASUS ProArt 笔记本的 MuseTree 应用中,无需 API 或互联网即可生成图像。该方案的目标是在 8GB VRAM 笔记本上、后台运行其他专业应用时,将图像生成时间控制在 5 秒以内。

    推荐理由:这次合作把 FLUX.2 [klein] 4B 的本地部署条件、离线使用方式和性能目标放到具体硬件上,便于评估其对隐私敏感与低延迟创作流程的适配度。

  2. ElevenLabs · 音频创作85

    ElevenLabs 在 ElevenCreative 推出 Flows Agent

    ElevenLabs 在 ElevenCreative 推出 Flows Agent,将对话式 AI 助手接入 Flows 画布,自动选择模型、创建并连接节点,执行图像、视频和音频生成流程。它支持通过对话修改已有流程,并可在高成本生成前请求确认;复杂工作流也能在后台运行,现已在 ElevenCreative 提供使用。

    推荐理由:它把多模态节点编排、生成执行和变体迭代合并到对话入口,可用于判断创作流程如何降低试错与额度控制成本。

6月3日周三
  1. World Labs · 空间智能与世界模型62

    World Labs 提出世界模型功能分类:渲染器、模拟器与规划器

    World Labs 发布文章,把当前被称为世界模型的能力拆成三类功能:渲染器输出像素、追求视觉保真;模拟器输出状态,要求几何、物理与动力学忠实;规划器输出动作,回答智能体下一步该做什么。

    推荐理由:World Labs 把世界模型拆成渲染、模拟、规划三类,并说明模拟为何是连接视觉与行动的关键环节。

6月1日周一
  1. ElevenLabs · 音频创作37

    ElevenLabs 将峰会带回华沙

    ElevenLabs 在华沙举办峰会,约2,500名来自波兰和欧洲的创始人、研究人员、开发者、艺术家及机构代表参加。作为公司第三场峰会,活动将展示其迈向人类水平沟通的 AI 进展,并讨论 AI 如何打破语言障碍、让创意更易触达。

5月29日周五
  1. Black Forest Labs · 图像与视频82

    FLUX VTO 公开发布,面向大规模商品目录的虚拟试衣模型

    FLUX VTO 公开发布,主打面向大规模商品目录的虚拟试衣,单次生成耗时低于 4 秒。模型可保留人物身份以及服装的 logo、印花、缝线和五金细节,支持一次应用最多四件衣物并进行叠穿。精准的身体和服装尺码仍在演进,输出更适合用于视觉造型参考;默认政策不支持泳装和内衣。

    推荐理由:原文同时给出速度、商品细节保真和多件叠穿能力,可帮助评估虚拟试衣在商品目录与交互购物中的落地条件。

5月28日周四
  1. ElevenLabs · 音频创作67

    ElevenLabs与希腊政府签署语音 AI 战略合作备忘录

    ElevenLabs与希腊政府签署战略合作备忘录,将探索把语音 AI 应用于公共服务、数字旅游和希腊语言遗产保护。双方计划先从克里特方言开始,并研究在gov.gr及政府呼叫中心提供多语言服务;希腊政府数字门户目前提供超过2,200项服务。

    推荐理由:三条合作路径覆盖公共服务、旅游和方言保存,可帮助判断语音 AI 走向政府场景的部署边界与合作模式。

5月26日周二
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布 Music v2 音乐生成模型

    ElevenLabs 发布 Music v2 音乐生成模型,提升人声、器乐、编曲和多语言支持,并支持更复杂的歌曲结构。模型支持按片段局部重绘、分段构建完整歌曲,以及在同一首歌中处理多种曲风、快速说唱和非音乐音效。

    推荐理由:Music v2 将局部重绘、分段作曲和多语言演唱整合到音乐生成流程,便于比较创作者、品牌与开发者的不同接入方式。