ComfyUI v0.34.0 发布:新增 Wan 3.0、Seedance 2.5 1080p、Gemini 3.7 Flash 等节点
ComfyUI 发布 v0.34.0,新增 Wan 3.0 视频生成、Seedance 2.5 的 1080p 分辨率与视频延长 task_type、Gemini 3.7 Flash 文本节点、Flux Video Upscale、Meshy-7、Pixverse V6 等 Partner Nodes。
ComfyUI 发布 v0.34.0,新增 Wan 3.0 视频生成、Seedance 2.5 的 1080p 分辨率与视频延长 task_type、Gemini 3.7 Flash 文本节点、Flux Video Upscale、Meshy-7、Pixverse V6 等 Partner Nodes。
Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点类型与多端点 API 用法,可据此判断多步生成管线如何一次搭好并直接调用。
ElevenLabs 发布 CLI v1,将 ElevenLabs API 直接带入终端,并为编码智能体提供结构化 JSON 结果、--dry-run 预览和可解析错误。
推荐理由:ElevenLabs 将 API、结构化结果和 agents-as-code 纳入 CLI,展示了编码智能体管理语音应用与生产配置的可复用工作流。
Black Forest Labs 推出 FLUX Video Upscale,作为独立的 FLUX Tool 和 endpoint,可将 480p 起的视频重新生成到最高原生 4K,并原生理解 FLUX 3 的输出,修复通用放大器容易遗漏的模糊人脸、水面和草地纹理网格伪影。
推荐理由:官方给出两种模式的价格与倍率差异,便于按交付分辨率在成本与修复细节之间取舍。
Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。
推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。
ComfyUI 开源 Comfy MCP 本地连接,让 Claude、Codex、Cursor 等 Agent 连接本机 ComfyUI,并与 Cloud MCP 统一。Agent 可读取本机 GPU、已安装节点和磁盘模型,判断模型是否适合本地运行,自动完成模型与工作流配置并执行任务。
推荐理由:它把本地 GPU、节点和模型检查接入智能体工作流,可帮助创作者在下载模型前判断硬件适配,并减少本地部署与工作流配置的手工步骤。
Sentence Transformers v6.0 新增 MultiVectorEncoder,将 PyLate、Stanford-NLP ColBERT 和 ColPali 系列模型统一到同一 API,支持基于 MaxSim 的多向量检索。文章展示了文本、页面图像、音频和视频的编码与检索方法,并比较了索引存储、Token Pooling、检索后重排和多种向量数据库方案。
推荐理由:文章用代码串起模型加载、MaxSim 评分、索引与多模态检索,便于评估 token 级匹配在质量和存储成本之间的取舍。
ComfyUI 发布 v0.33.1,新增 MiniMax Music 3 及 CUDA Graphs 核心支持,并为 MiniMax 加入 ContextIR 和 Regenerate To 2K 节点。
ComfyUI 发布 v0.32.0,新增 LTX 2.5 支持及对应 Partner Nodes,并上线 Qwen-Image 3.0 Pro、Grok-Imagine-Image-2.0 模型节点。该版本最低官方支持的 PyTorch 升至 2.7,同时优化 MiniMax-H3 VAE、修复 H3 峰值内存与分块音频解码等问题。
Wan Animate 2 已在 ComfyUI 中原生支持,该模型采用端到端角色动画框架,驱动视频直接进入重新设计的 Diffusion Transformer,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。
推荐理由:ComfyUI 原生接入 Wan Animate 2,读者可据此判断角色动画工作流的节点改动与实时化路径。
Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,单次生成一段连续 30 秒视频,无需拼接短片。单次生成最多可接入 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中逐条指定。
推荐理由:ComfyUI 接入 Seedance 2.5 后,可据此判断单次 30 秒连续生成与 50 个参考素材对现有分镜拼接流程的替代空间。
ComfyUI 发布 v0.31.0,新增 Wan-Animate2、Flux 3 视频模型和 SeeDance 2.5 支持,并改进多项 MiniMax H3 与音频处理。版本还加入 ImageCompositor 节点、Bloom 2 和 Wonder 3.5 支持,并对 LTX、Wan 做加速;同时修复 Linux 内存、采样器和 MiniMax H3 相关问题。
推荐理由:该版本集中带来视频、图像合成与音频处理更新,读者可据新增节点、模型接入和性能修复安排升级。
ComfyUI 发布 v0.30.0,新增 MiniMax H3 模型支持(含 768P 分辨率)和更快的 LTX2.3 解码器 PrunaVAED,并加入 int8 convrot embedding lookup。该版本还引入数据集文件夹隔离、视频节点 crf 选项与 mp4 元数据前置存储,前端包升级至 1.47.11,工作流模板更新至 v0.11.27。
ComfyUI 发布 v0.29.2,更新包含前端修复以及新的 api/partner 节点。完整变更内容可查看 Full Changelog。
ComfyUI 发布 v0.29.0,更新视频转码、视频处理节点与训练支持,并新增 JoyImageEdit、Gemma4 12B、MageFlow 和 Wan 的 Uni3C Controlnet 原生支持。Partner Nodes 新增 GPT5.6、Gemini 3.5 Flash、Claude Opus 5、Recraft V4.1 等模型或节点,同时包含多项性能优化与修复。
推荐理由:这次更新把视频处理、控制模型和第三方模型接入集中到同一版本,便于评估 ComfyUI 工作流的兼容范围与处理效率。
ComfyUI 发布 Comfy Team 团队版,把整个团队放进一个共享工作区,共用同一积分池和同一账单,管理员可管理计费、充值、邮件邀请成员并随时移除权限。
推荐理由:ComfyUI 团队版把席位制改成共享积分池,做团队协作和成本核算的可以据此判断是否迁移。
Black Forest Labs 宣布 FLUX 3 早期版本已在机器人上运行,并与 mimic 合作推出视频-动作模型 FLUX-mimic,该模型基于 FLUX 3 骨干,从视频预测路径的中间特征解码动作。
推荐理由:官方披露 FLUX 3 早期版本与 mimic 合作落地机器人,可据此判断多模态基座向物理 AI 延伸的路线与部署约束。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 的 SVDQuant 4-bit 检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,可据此判断消费级 GPU 跑扩散模型的量化选型。
Pollen Robotics 发布 Grabette,一套用手持夹爪记录机器人操作数据的开源系统,可将演示自动处理为 LeRobot 数据集并上传到 Hugging Face Hub。
推荐理由:文章给出了从手持采集到 LeRobot 数据集的完整流程,以及硬件成本和示例训练链路,便于评估机器人数据采集的落地门槛。
ComfyUI 发布 v0.28.0,新增 Seed Audio 1.0、Seedream 5 Pro、SeedVR2 支持以及 Save 3D (Advanced) 节点族。版本还修复了四个安全漏洞,改进 Qwen3-VL、自定义嵌入、视频音频流和 int4 模型等问题。
推荐理由:该版本把模型接入、3D 工作流与安全修复集中在一次更新中,可用于评估 ComfyUI 对视频、图像和 3D 创作链路的覆盖变化。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型纳入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 平台。
推荐理由:原文给出开源权重在 Azure 上的一键部署路径与运行时选型,可据此判断企业自托管开源模型的落地条件。
Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。
推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。
ComfyUI 发布 v0.27.0,加入 int8 convrot 模型支持,并改进 int8 LoRA 应用、Turing GPU 支持和内存泄漏问题。
推荐理由:该版本将 int8 支持覆盖到模型、LoRA 应用和 Turing GPU,并同步补充多个合作方节点,可用于评估 ComfyUI 工作流升级。
ComfyUI 发布 v0.26.0,新增 Qwen3-VL 文本生成、Boogu-Image、Krea2、Load3DAdvanced 以及 LTX2 的 Context Windows sampling 支持。
推荐理由:该版本把多种模型节点、分辨率支持和工作流基础设施集中到一次更新中,便于评估 ComfyUI 的模型接入与创作流程变化。
ElevenLabs 在 ElevenCreative 内推出 Ads Engine,首个能力是广告本地化,可接入 Google Ads 和 Meta Ads 账号,拉取现有素材与投放数据,同时完成文本翻译、图像适配和视频配音,再把本地化版本推回 Google、Meta 和 LinkedIn。
推荐理由:官方披露广告本地化引擎的接入方式与工作流,可据此判断多语言投放的素材生产与审片环节如何变化。
ComfyUI 发布 v0.25.1,新增对 Kling V3-Turbo 模型的支持。该版本为不可变发布版本,自本次发布以来 master 分支已有 604 次提交,只有发布标题和说明可修改。
Black Forest Labs 宣布,FLUX.2 [klein] 4B 将预装在新一代搭载 RTX GPU 的 ASUS ProArt 笔记本的 MuseTree 应用中,无需 API 或互联网即可生成图像。该方案的目标是在 8GB VRAM 笔记本上、后台运行其他专业应用时,将图像生成时间控制在 5 秒以内。
推荐理由:这次合作把 FLUX.2 [klein] 4B 的本地部署条件、离线使用方式和性能目标放到具体硬件上,便于评估其对隐私敏感与低延迟创作流程的适配度。
ElevenLabs 在 ElevenCreative 推出 Flows Agent,将对话式 AI 助手接入 Flows 画布,自动选择模型、创建并连接节点,执行图像、视频和音频生成流程。它支持通过对话修改已有流程,并可在高成本生成前请求确认;复杂工作流也能在后台运行,现已在 ElevenCreative 提供使用。
推荐理由:它把多模态节点编排、生成执行和变体迭代合并到对话入口,可用于判断创作流程如何降低试错与额度控制成本。
ElevenLabs 发布 Dubbing v2,通过直接参考原始表演,将语气、节奏、情绪和表达方式迁移到 90+ 种语言中。
推荐理由:Dubbing v2将原始表演纳入配音生成并自动对齐节奏,为多语言视频本地化提供了更完整的工作流参考。
ElevenLabs推出面向教授的语音AI支持计划,并上线基于 Albert Einstein 声音与档案的互动学习体验。教授可免费使用 Pro tier,并为特定课程和项目向学生提供限时访问。Albert Einstein 的重现声音已在 ElevenReader 和 ElevenLabs Agents 中提供,支持英语、德语、法语、巴西葡萄牙语和西班牙语。
推荐理由:同时覆盖教育者获取权限与历史声音互动两端,为课堂语音工具的接入方式和学习体验设计提供了可参考案例。
Google DeepMind 为实验性原型 Project Genie 推出 Street View grounding capability,让生成的互动环境以真实地点的 Street View 影像为起点。
推荐理由:文章展示了世界模型接入真实地点影像后的交互方式,并交代了实验性原型、地区范围与订阅门槛。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 的三款实验工具与 Google Antigravity 的 Science Skills。三款工具支持假设生成、代码变体测试和科学文献分析,相关实验将逐步开放,可在 labs.google/science 注册。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频、音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;该验证功能已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,可据此判断内容溯源工具链的可用入口与行业协作范围。
Runway 推出基于 GWM-1 的实时视频生成模型 Runway Characters,由单张参考图生成可对话角色,处理眼神、口型同步、表情与说话和倾听时的手势,并能在长对话中维持质量。
推荐理由:Runway 把实时逐帧生成与交互控制讲成产品路线,可据此判断世界模型在角色对话与仿真训练中的落地边界。
Hugging Face 的 Diffusers 发布 0.38.0,新增多条图像与音频管线,包括离散扩散语言模型 LLaDA2、2B 激活 17B 参数的稀疏 MoE 图像模型 NucleusMoE-Image。
ElevenLabs 发布 AI 音乐发现与创作平台 ElevenMusic,将听歌、重混、原创创作、发布和变现连接在一起。平台上线时已有超过 4,000 名独立及新兴艺术家参与,用户可调整曲风和速度重混曲目,也可从歌词、旋律或情绪创作完整曲目。ElevenMusic 同步推出 Eleven Album Vol. 2,并已开放 App 和网页版使用;创作者收益取决于听众参与度、资格门槛和平台收入。
推荐理由:ElevenMusic把音乐发现、重混、原创创作与发布变现放在同一平台,呈现了面向创作者和听众的参与式音乐工作流。
World Labs 发布 Spark 2.0,为基于 THREE.js 和 WebGL2 的开源 3DGS 渲染器加入 Level-of-Detail 系统,可按视角连续调整细节并通过网络流式加载数据。
推荐理由:World Labs 公开了 Spark 2.0 的 LoD、渐进流式与虚拟显存三项技术细节,可据此判断大场景 3DGS 在浏览器端的落地条件。
ElevenLabs宣布支持 On-Premise 和 On-Device 部署,将语音 AI 扩展到云端和 VPC 之外。On-Premise 与 On-Device 目前处于 early access,首批版本预计在 2026 年上半年推出;VPC 部署现已可用,并支持自定义声音和针对语言或方言的微调。
推荐理由:材料清晰区分了 On-Premise、On-Device 与 VPC 的部署边界,便于企业按数据驻留和离线推理需求选择方案。
Hugging Face 发布 Diffusers 0.37.0,引入 Modular Diffusers,用可复用模块组合自定义扩散管线,与原有 DiffusionPipeline 并存。
推荐理由:Diffusers 0.37.0 的模块化管线与新增图像视频模型清单,可供选型与工作流搭建时对照参考。