Comfy 发布 Comfy Router,用一个 API 调用前沿图像视频模型
Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。
推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。
Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。
推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。
ComfyUI 官方称 MiniMax H3 视频 VAE 编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:ComfyUI 官方给出 MiniMax H3 视频 VAE 的加速细节与开启方式,可据此判断视频工作流的耗时与画质取舍。
ComfyUI 发布 v0.35.0,引入 Comfy Compiler(CORE-389)和 Sparse Attention 节点,并新增 File3DToMesh、VideoTrim、VideoCrop 等节点。
ComfyUI × MiniMax H3 Sync Sound Challenge 公布获奖结果,要求用 MiniMax H3 在 ComfyUI 中让音频与视频同一次生成产出,不得后期配乐或配音。
Comfy 宣布成为 MiniMax H3 商业使用许可证的首个官方转售商,面向在自有硬件本地运行 H3 的商业创作场景。许可证覆盖生成内容的商业权利、微调与 LoRA 训练,以及客户和下游项目;但不包含运营向他人出售 H3 访问权限的推理平台或市场。
推荐理由:这项授权安排明确了 H3 本地商业使用、LoRA 微调和客户项目的许可边界,也提示平台化售卖访问权限不在覆盖范围内。
Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。
推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。
ComfyUI 与 MiniMax 团队发起 H3 音画同步社区挑战赛,要求参赛者用 H3 在同一轮生成视频和同步音频,作品最长 90 秒且每人限投一次。参赛者还需提交实际的 ComfyUI `.json` 工作流,活动支持本地运行或 Comfy Cloud,9/2 公布结果。
推荐理由:挑战同时要求 H3 在同一轮生成音频与视频,并提交可复现的 ComfyUI 工作流,呈现了音画同步创作的实践约束。
ComfyUI 发布 v0.33.1,新增 MiniMax Music 3 及 CUDA Graphs 核心支持,并为 MiniMax 加入 ContextIR 和 Regenerate To 2K 节点。
ComfyUI 发布 v0.32.0,新增 LTX 2.5 支持及对应 Partner Nodes,并上线 Qwen-Image 3.0 Pro、Grok-Imagine-Image-2.0 模型节点。该版本最低官方支持的 PyTorch 升至 2.7,同时优化 MiniMax-H3 VAE、修复 H3 峰值内存与分块音频解码等问题。
ComfyUI 发布 v0.30.0,新增 MiniMax H3 模型支持(含 768P 分辨率)和更快的 LTX2.3 解码器 PrunaVAED,并加入 int8 convrot embedding lookup。该版本还引入数据集文件夹隔离、视频节点 crf 选项与 mp4 元数据前置存储,前端包升级至 1.47.11,工作流模板更新至 v0.11.27。
MiniMax H3 今日发布开放权重,并在 ComfyUI 中获得 Day-0 原生支持,可接收文本、图像、视频或音频,生成带立体声的 2K、最长 15 秒视频。
推荐理由:文章把 H3 的多模态输入、原生立体声和 ComfyUI 本地运行路径放在一起,并给出显存缩减与工作流入口,便于评估视频创作部署成本。
Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。
推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。
Replicate playground 提供一套生成 AI 短视频的工作流:先用 datacte/flux-aesthetic-anime 等图像模型生成起始图,再用 minimax/video-01-live 以首帧图加提示词生成视频,最后用 zsxkib/mmaudio 模型按提示词配音。