Diffusers 0.37.0 发布:模块化 Diffusers 与多款图像视频管线
Hugging Face 发布 Diffusers 0.37.0,引入 Modular Diffusers,用可复用模块组合自定义扩散管线,与原有 DiffusionPipeline 并存。
推荐理由:Diffusers 0.37.0 的模块化管线与新增图像视频模型清单,可供选型与工作流搭建时对照参考。
Hugging Face 发布 Diffusers 0.37.0,引入 Modular Diffusers,用可复用模块组合自定义扩散管线,与原有 DiffusionPipeline 并存。
推荐理由:Diffusers 0.37.0 的模块化管线与新增图像视频模型清单,可供选型与工作流搭建时对照参考。
字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入,可同时输入多达 9 张图片、3 段视频、3 段音频及自然语言指令。
推荐理由:官方给出多模态参考、视频编辑与双声道音频的能力边界和失败项,可据此判断其在电商与影视流程中的可用位置。
字节 Seed 团队正式发布新一代音视频创作模型 Seedance 1.5 pro,支持文本到音视频合成与图像引导的音视频生成,已上线即梦AI和豆包。模型采用基于 MMDiT 的统一音视频联合生成框架,实现口型、语调与表演节奏的音画同步,原生支持中文、英文、日文、韩语、西班牙语、印尼语及四川话、粤语等方言。
推荐理由:官方披露了音视频联合生成的架构与评测细节,可据此判断音画同步能力在短剧、广告等场景的可用边界。
Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。
推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。
ElevenLabs 发布 Image & Video(Beta),将图像、视频和音频创作整合到同一平台工作流中。用户可调用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,也可使用 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成图像,并在 Studio 中完成配音、音乐、音效、口型同步、时间线调整和导出。
推荐理由:将图像、视频生成与配音、音乐、音效及时间线编辑放进同一工作流,便于评估一站式多模态创作的实际覆盖范围。
Replicate 介绍 Veo 3.1 的提示词编写方法,以及参考生视频、首尾帧生视频和增强图生视频功能。参考生视频最多接收三张图片并结合文本生成连贯场景,其余端点提供耗时低于 60 秒、价格约为标准版本一半的快速生成选项。
推荐理由:文章把镜头构图、焦段、风格和运动等提示词要素,与参考图、首尾帧及快速版本的使用场景对应起来,便于设计可控的视频生成流程。
Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。
推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。
Replicate 发布 Veo 3 图像输入的使用技巧,实测显示模型能在动画中保持输入图的画风、滤镜和调色,并让文字在复杂背景中保持清晰可读。输入图始终作为视频首帧,可用提示词只动画局部元素、其余保持静止,也可先用 Ideogram 3.0 生成特定风格图再交给 Veo 3 做动作与运镜,从而把风格控制交给图像模型。
推荐理由:Replicate 实测了 Veo 3 图像输入在风格保持、文字动画和局部动画上的表现,可据此调整参考图加提示词的创作流程。
Replicate 与 Pruna AI 合作发布优化版 Wan 2.2,FAST 文生视频和图生视频 480p 每条 0.05 美元、720p 每条 0.10 美元,推理时间约 30 秒。未优化的图生视频 480p 每条 0.40 美元、720p 每条 1.00 美元,可通过 Replicate API 调用。Replicate 称未来几天将发布更多与 Pruna 的优化版本。
推荐理由:Replicate 与 Pruna AI 优化的 Wan 2.2 给出了按条计费的视频生成价格与推理耗时,可据此评估低成本视频试错方案。
Replicate 发布 AI 视频模型对比,列出 Google Veo 3、字节 Seedance 1、MiniMax Hailuo 02、快手 Kling 2.1。
Hugging Face Diffusers 发布 0.34.0,新增 Wan VACE、Cosmos Predict2 等视频与图像生成 pipeline,并改善 torch.compile 支持。
推荐理由:该版本同时覆盖可控视频生成与低显存部署,读者可据此评估 Wan VACE 等 pipeline 的控制能力和 torch.compile、量化、卸载组合。
字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。
推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。
Replicate 发布 Veo 3 提示词指南,建议在提示词中明确主体、场景、动作、风格、镜头运动、构图与氛围,并单独描述对白、环境音、音效和音乐。文中指出 Veo 3 对同一提示词多次生成结果高度相似,想探索不同效果应改用差异较大的提示词;保持角色描述逐字一致可提升跨场景视觉连续性。
推荐理由:Replicate 基于实测给出 Veo 3 的提示词结构、音频与角色一致性写法,可迁移到视频生成工作流。
Replicate介绍 Google Veo 3 的视频生成能力,并分享一套涵盖镜头构图、焦段效果、风格和运镜的提示词方法。文章还展示了对话与口型同步、视频游戏世界等案例,并给出冰柱特写示例提示词。
推荐理由:文章整理了 Veo 3 的镜头构图、焦段、风格与运镜提示词,并结合对话、口型同步和游戏世界生成案例,便于复用其视频创作流程。
Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。
推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。
Wan 2.1 支持从文本或图像生成视频,并可通过 LoRA 进行风格迁移。Replicate 提供了 480p 和 720p 的文本生视频模型,以及使用预制权重或自有图片训练风格 LoRA 的流程;自定义训练至少需要 25 张图片和一个 trigger_word。
推荐理由:材料展示了使用预制 LoRA 和自有图片训练风格 LoRA 的 Wan 2.1 视频工作流,包含可复用的输入与训练步骤。
Replicate 发布创作案例汇总,介绍 ShieldGemma 2、Hunyuan3D 2Mini、CSM-1B、Orpheus-3B、Luma 和 Kling v1.6 Pro 等模型与社区实验。
Replicate 为 Wan2.1 提供可扩展云端 API,支持 480p/720p 文本生视频与图像生视频。14B 模型在 Replicate 上生成 5s 视频,480p 约需 39s、720p 约需 150s;另有面向消费级 GPU 的 1.3B 模型。文章还介绍了 guide_scale、shift 和 steps 等可调参数。
推荐理由:文章同时给出 Wan2.1 的文本生视频与图像生视频 API 入口、分辨率和参数设置,便于按实验速度与输出分辨率选择模型版本。
Replicate 对 Alibaba 的 WAN2.1 14b 文生视频模型进行参数扫描,测试 720p 输出中 guide scale 与 shift 对生成效果的影响。
推荐理由:这组参数扫描把 guide scale 与 shift 对 WAN2.1 14b 720p 视频输出的影响拆开,提供可复用的调参区间和观察依据。
Replicate 已将 Musubi Tuner 适配到平台,支持用户用自有视觉内容微调 HunyuanVideo 视频模型。文章提供从视频切片与字幕生成、LoRA 训练到浏览器或 API 调用的流程,默认训练通常需要约 5-10 分钟。
推荐理由:文章把视频微调拆成数据准备、训练和调用四步,并给出训练时长与参数调节建议,适合评估自定义视觉风格和运动效果的落地路径。
Replicate playground 提供一套生成 AI 短视频的工作流:先用 datacte/flux-aesthetic-anime 等图像模型生成起始图,再用 minimax/video-01-live 以首帧图加提示词生成视频,最后用 zsxkib/mmaudio 模型按提示词配音。
Diffusers 发布 v0.32.2 补丁版本,修复了 Flux 加载 Comfy UI 格式单文件 checkpoint 的回归问题,并支持将 LoRA 加载进 bitsandbytes 4bit 量化的 Flux 模型。
Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。
推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。
Replicate 作者 fofr 认为,Sora 让外界看到视频模型的可能性却无法使用,如今一批质量接近 Sora 的模型已经可用,AI 视频正经历类似 Stable Diffusion 的爆发。
推荐理由:梳理了 Sora 之后一批视频模型的 ELO、速度、时长与开源情况,便于按质量、成本和可微调性做选型比较。
Replicate 宣布支持在平台上用自有图片微调 FLUX.1 图像生成模型,用户可上传 12-20 张多样图片并设置触发词,约 30 分钟生成定制模型。
推荐理由:这期内容给出 FLUX.1 微调所需的图片数量与耗时,并串联数字人、可控视频和可玩游戏世界案例,便于比较不同生成工作流。