Diffusers 0.34.0 发布,新增 Wan VACE 等视频与图像生成 pipeline
Hugging Face Diffusers 发布 0.34.0,新增 Wan VACE、Cosmos Predict2 等视频与图像生成 pipeline,并改善 torch.compile 支持。
推荐理由:该版本同时覆盖可控视频生成与低显存部署,读者可据此评估 Wan VACE 等 pipeline 的控制能力和 torch.compile、量化、卸载组合。
Hugging Face Diffusers 发布 0.34.0,新增 Wan VACE、Cosmos Predict2 等视频与图像生成 pipeline,并改善 torch.compile 支持。
推荐理由:该版本同时覆盖可控视频生成与低显存部署,读者可据此评估 Wan VACE 等 pipeline 的控制能力和 torch.compile、量化、卸载组合。
字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。
推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。
Replicate 发布 Veo 3 提示词指南,建议在提示词中明确主体、场景、动作、风格、镜头运动、构图与氛围,并单独描述对白、环境音、音效和音乐。文中指出 Veo 3 对同一提示词多次生成结果高度相似,想探索不同效果应改用差异较大的提示词;保持角色描述逐字一致可提升跨场景视觉连续性。
推荐理由:Replicate 基于实测给出 Veo 3 的提示词结构、音频与角色一致性写法,可迁移到视频生成工作流。
Replicate介绍 Google Veo 3 的视频生成能力,并分享一套涵盖镜头构图、焦段效果、风格和运镜的提示词方法。文章还展示了对话与口型同步、视频游戏世界等案例,并给出冰柱特写示例提示词。
推荐理由:文章整理了 Veo 3 的镜头构图、焦段、风格与运镜提示词,并结合对话、口型同步和游戏世界生成案例,便于复用其视频创作流程。
Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。
推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。
Wan 2.1 支持从文本或图像生成视频,并可通过 LoRA 进行风格迁移。Replicate 提供了 480p 和 720p 的文本生视频模型,以及使用预制权重或自有图片训练风格 LoRA 的流程;自定义训练至少需要 25 张图片和一个 trigger_word。
推荐理由:材料展示了使用预制 LoRA 和自有图片训练风格 LoRA 的 Wan 2.1 视频工作流,包含可复用的输入与训练步骤。
Replicate 发布创作案例汇总,介绍 ShieldGemma 2、Hunyuan3D 2Mini、CSM-1B、Orpheus-3B、Luma 和 Kling v1.6 Pro 等模型与社区实验。
Replicate 为 Wan2.1 提供可扩展云端 API,支持 480p/720p 文本生视频与图像生视频。14B 模型在 Replicate 上生成 5s 视频,480p 约需 39s、720p 约需 150s;另有面向消费级 GPU 的 1.3B 模型。文章还介绍了 guide_scale、shift 和 steps 等可调参数。
推荐理由:文章同时给出 Wan2.1 的文本生视频与图像生视频 API 入口、分辨率和参数设置,便于按实验速度与输出分辨率选择模型版本。
Replicate 对 Alibaba 的 WAN2.1 14b 文生视频模型进行参数扫描,测试 720p 输出中 guide scale 与 shift 对生成效果的影响。
推荐理由:这组参数扫描把 guide scale 与 shift 对 WAN2.1 14b 720p 视频输出的影响拆开,提供可复用的调参区间和观察依据。
Replicate 已将 Musubi Tuner 适配到平台,支持用户用自有视觉内容微调 HunyuanVideo 视频模型。文章提供从视频切片与字幕生成、LoRA 训练到浏览器或 API 调用的流程,默认训练通常需要约 5-10 分钟。
推荐理由:文章把视频微调拆成数据准备、训练和调用四步,并给出训练时长与参数调节建议,适合评估自定义视觉风格和运动效果的落地路径。
Replicate playground 提供一套生成 AI 短视频的工作流:先用 datacte/flux-aesthetic-anime 等图像模型生成起始图,再用 minimax/video-01-live 以首帧图加提示词生成视频,最后用 zsxkib/mmaudio 模型按提示词配音。
Diffusers 发布 v0.32.2 补丁版本,修复了 Flux 加载 Comfy UI 格式单文件 checkpoint 的回归问题,并支持将 LoRA 加载进 bitsandbytes 4bit 量化的 Flux 模型。
Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。
推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。
Replicate 作者 fofr 认为,Sora 让外界看到视频模型的可能性却无法使用,如今一批质量接近 Sora 的模型已经可用,AI 视频正经历类似 Stable Diffusion 的爆发。
推荐理由:梳理了 Sora 之后一批视频模型的 ELO、速度、时长与开源情况,便于按质量、成本和可微调性做选型比较。
Replicate 宣布支持在平台上用自有图片微调 FLUX.1 图像生成模型,用户可上传 12-20 张多样图片并设置触发词,约 30 分钟生成定制模型。
推荐理由:这期内容给出 FLUX.1 微调所需的图片数量与耗时,并串联数字人、可控视频和可玩游戏世界案例,便于比较不同生成工作流。