Diffusers v0.35.2-patch 修复 transformers 模型与导入问题
Diffusers 发布 v0.35.2-patch,修复初始化 transformers 模型时的 offload_state_dict 处理,以及 TRANSFORMERS_FLAX_WEIGHTS_NAME 导入问题。该版本还加入 PyTorch 2.3.1 兼容性版本检查,并修复 wan 和 ltx 的 scale_shift_factor 位于 CPU 的问题。
Diffusers 发布 v0.35.2-patch,修复初始化 transformers 模型时的 offload_state_dict 处理,以及 TRANSFORMERS_FLAX_WEIGHTS_NAME 导入问题。该版本还加入 PyTorch 2.3.1 兼容性版本检查,并修复 wan 和 ltx 的 scale_shift_factor 位于 CPU 的问题。
Replicate 对多款图像编辑模型进行了对象移除、视角转换、背景编辑、文字编辑和风格迁移测试,并比较了价格与推理时间。
推荐理由:这份按对象移除、视角转换、背景编辑、文字编辑和风格迁移展开的对比,可为图像编辑模型的任务选型提供具体参照。
World Labs 发布 Marble 有限访问测试版,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由探索的 3D 世界,官方称无时间限制、无变形、无一致性问题。
推荐理由:World Labs 首次开放 Marble 有限测试,可据此判断图像或文本生成可持久导航 3D 世界在创作流程中的可用边界。
字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。
推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。
Replicate 开始缓存 PyTorch 模型的 torch.compile 编译产物,以减少模型容器启动时的编译开销,black-forest-labs/flux-kontext-dev、prunaai/flux-schnell 和 prunaai/flux.1-dev-lora 的启动速度提升 2–3 倍。
推荐理由:Replicate的缓存机制针对torch.compile首次编译开销,给出了多个模型冷启动时间变化,可用于评估部署优化收益。
Hugging Face 发布 Diffusers v0.35.1,重点改进 Qwen-Image Edit。该版本包含 PR #12188 和 #12190,贡献者为 naykun。
Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。
推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。
Replicate 发布托管远程 MCP server,可接入 Claude Desktop、Claude Code、Cursor 和 VS Code,通过聊天式自然语言探索并运行 Replicate 的 HTTP APIs。
推荐理由:它展示了 Replicate 的模型检索、比较和运行如何接入 Claude、Cursor 等工具,并通过远程认证与响应过滤落地 MCP 工作流。
Replicate 发布 Veo 3 图像输入的使用技巧,实测显示模型能在动画中保持输入图的画风、滤镜和调色,并让文字在复杂背景中保持清晰可读。输入图始终作为视频首帧,可用提示词只动画局部元素、其余保持静止,也可先用 Ideogram 3.0 生成特定风格图再交给 Veo 3 做动作与运镜,从而把风格控制交给图像模型。
推荐理由:Replicate 实测了 Veo 3 图像输入在风格保持、文字动画和局部动画上的表现,可据此调整参考图加提示词的创作流程。
Replicate 与 Pruna AI 合作发布优化版 Wan 2.2,FAST 文生视频和图生视频 480p 每条 0.05 美元、720p 每条 0.10 美元,推理时间约 30 秒。未优化的图生视频 480p 每条 0.40 美元、720p 每条 1.00 美元,可通过 Replicate API 调用。Replicate 称未来几天将发布更多与 Pruna 的优化版本。
推荐理由:Replicate 与 Pruna AI 优化的 Wan 2.2 给出了按条计费的视频生成价格与推理耗时,可据此评估低成本视频试错方案。
字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。
推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。
Replicate 对比了截至 2025 年 7 月可用于单张参考图生成一致角色的四款模型:OpenAI gpt-image-1、Runway Gen-4 Image、Black Forest Labs FLUX.1 Kontext 和字节 SeedEdit 3,并补充了之后发布的 Ideogram Character 与 Gen-4 Image Turbo。
推荐理由:作者用同一参考图横向实测四款图像模型,给出角色一致性与风格化任务的选型建议和失败边界。
Replicate 与 Bria 合作,将 Bria 的视觉 AI 模型套件上线平台,包含基于授权数据训练的 Bria 3.2 文生图模型。套件还提供移除背景、局部重绘、增加分辨率、扩展画布和背景生成等功能;Bria 表示其模型使用来自 Getty Images、Envato、Freepik 等来源的 100% licensed data。
推荐理由:读者可据此了解一组覆盖生成、抠图、局部重绘与扩图的视觉工具,以及其面向企业场景强调的授权数据与合规边界。
Replicate 公开了其 FLUX.1 Kontext [dev] 实现的优化方法 TaylorSeer,用缓存的特征导数配合 Taylor 级数近似被跳过的去噪步,把模型调用从约 30 步降到 10 至 15 步,同时尽量保持质量。
推荐理由:Replicate 公开了 FLUX.1 Kontext 的 TaylorSeer 缓存加速实现,读者可据此理解扩散模型跳步近似与质量取舍。
Replicate 发布 AI 视频模型对比,列出 Google Veo 3、字节 Seedance 1、MiniMax Hailuo 02、快手 Kling 2.1。
Replicate 联合 Black Forest Labs 举办 FLUX.1 Kontext 黑客松,120 多名参与者用这款图像编辑模型和 Resemble AI 的 Chatterbox 语音模型在数小时内完成 30 个参赛项目。
Hugging Face Diffusers 发布 0.34.0,新增 Wan VACE、Cosmos Predict2 等视频与图像生成 pipeline,并改善 torch.compile 支持。
推荐理由:该版本同时覆盖可控视频生成与低显存部署,读者可据此评估 Wan VACE 等 pipeline 的控制能力和 torch.compile、量化、卸载组合。
字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。
推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。
Replicate 发布 Veo 3 提示词指南,建议在提示词中明确主体、场景、动作、风格、镜头运动、构图与氛围,并单独描述对白、环境音、音效和音乐。文中指出 Veo 3 对同一提示词多次生成结果高度相似,想探索不同效果应改用差异较大的提示词;保持角色描述逐字一致可提升跨场景视觉连续性。
推荐理由:Replicate 基于实测给出 Veo 3 的提示词结构、音频与角色一致性写法,可迁移到视频生成工作流。
字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。
推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。
Replicate介绍 Google Veo 3 的视频生成能力,并分享一套涵盖镜头构图、焦段效果、风格和运镜的提示词方法。文章还展示了对话与口型同步、视频游戏世界等案例,并给出冰柱特写示例提示词。
推荐理由:文章整理了 Veo 3 的镜头构图、焦段、风格与运镜提示词,并结合对话、口型同步和游戏世界生成案例,便于复用其视频创作流程。
Black Forest Labs 发布图像编辑模型 FLUX.1 Kontext,提供 [pro]、[max] 和即将推出的 [dev] 三个版本,可进行颜色替换、背景编辑、文字替换和风格迁移,并保持角色一致性。Replicate 还介绍了社区在发型变换、职业头像、老图修复、画幅扩展和移除文字等场景中的使用案例,以及 Kontext Chat 和可直接使用的 Kontext 应用。
推荐理由:文章同时梳理 FLUX.1 Kontext 的版本差异、提示词方法与社区案例,适合参考图像编辑和社交内容改版的工作流。
Black Forest Labs 推出图像编辑模型 FLUX.1 Kontext,Replicate 已上线 [pro] 与 [max] 两个版本,开放权重的 [dev] 版本即将发布。
推荐理由:梳理了 FLUX.1 Kontext 三个版本的开放方式与提示词写法,可据此判断图像编辑的选型与可控编辑流程。
Google DeepMind 的最新旗舰图像模型 Imagen 4 现可在 Replicate 上运行,目前为预览版,行为与功能可能变化,需求高时可能出现排队。
推荐理由:Replicate 上线 Google Imagen 4 预览版,读者可据此了解其文字渲染与细节表现及接入方式。
Replicate现已支持运行 OpenAI 的 GPT-4.1、GPT-4o 和 o-series 等聊天、视觉与推理模型。GPT-4.1系列支持最长 1 million tokens 的上下文,GPT-4o系列处理文本、图像和音频,o-series面向数学、科学与复杂问题的结构化推理。
推荐理由:材料按上下文、模态、推理任务和成本速度列出模型差异,并给出 Replicate 网页界面与 API 的操作入口。
Hugging Face 上的 3 万多个 LoRA 现可直接在 Hub 上通过 Replicate 运行推理。用户选择支持的 LoRA 模型并将 Replicate 设为推理提供方后,请求会被路由到 Replicate 的 black-forest-labs/flux-dev-lora 模型,LoRA 以 lora_weights 参数动态传入,无需为每个 LoRA 单独托管模型。
Ideogram 发布文生图模型 3.0 版本,在真实感、风格控制和版式生成上有较大改进,并分为 Turbo、Balanced、Quality 三个档位,均已上线 Replicate。Turbo 适合快速迭代,Quality 追求最高保真,Balanced 居中。该版本支持用参考图做风格迁移,并宣称在人工评测的 ELO 打分中于真实感、对齐度和多样性上高于其他图像生成模型。
推荐理由:Ideogram 3.0 三个档位在文字渲染、版式与风格参考上的分工,可供设计营销类图像选型参考。
Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。
推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。
Easel AI 的全身换脸和 AI avatars 两款模型现已在 Replicate 提供,可通过网页或 API 调用。全身换脸可在单张图中替换一或两人并保留服装、光线和图像风格;AI avatars 只需单个提示词即可生成一或两人的头像,无需训练或 LoRAs。
推荐理由:这次接入同时覆盖全身换脸与免训练头像生成,能帮助开发者比较单人和多人场景的接入方式及 API 使用路径。
字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。
推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。
Diffusers 发布 v0.33.1,修复了 wan pipelines 的 ftfy 导入问题,该修复由 @yiyixuxu 在 #11262 中提交。此版本距上一版本已有 1620 次提交。
Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。
推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。
Wan 2.1 支持从文本或图像生成视频,并可通过 LoRA 进行风格迁移。Replicate 提供了 480p 和 720p 的文本生视频模型,以及使用预制权重或自有图片训练风格 LoRA 的流程;自定义训练至少需要 25 张图片和一个 trigger_word。
推荐理由:材料展示了使用预制 LoRA 和自有图片训练风格 LoRA 的 Wan 2.1 视频工作流,包含可复用的输入与训练步骤。
Replicate 发布创作案例汇总,介绍 ShieldGemma 2、Hunyuan3D 2Mini、CSM-1B、Orpheus-3B、Luma 和 Kling v1.6 Pro 等模型与社区实验。
Replicate 为 Wan2.1 提供可扩展云端 API,支持 480p/720p 文本生视频与图像生视频。14B 模型在 Replicate 上生成 5s 视频,480p 约需 39s、720p 约需 150s;另有面向消费级 GPU 的 1.3B 模型。文章还介绍了 guide_scale、shift 和 steps 等可调参数。
推荐理由:文章同时给出 Wan2.1 的文本生视频与图像生视频 API 入口、分辨率和参数设置,便于按实验速度与输出分辨率选择模型版本。
Replicate 对 Alibaba 的 WAN2.1 14b 文生视频模型进行参数扫描,测试 720p 输出中 guide scale 与 shift 对生成效果的影响。
推荐理由:这组参数扫描把 guide scale 与 shift 对 WAN2.1 14b 720p 视频输出的影响拆开,提供可复用的调参区间和观察依据。
Replicate 已将 Musubi Tuner 适配到平台,支持用户用自有视觉内容微调 HunyuanVideo 视频模型。文章提供从视频切片与字幕生成、LoRA 训练到浏览器或 API 调用的流程,默认训练通常需要约 5-10 分钟。
推荐理由:文章把视频微调拆成数据准备、训练和调用四步,并给出训练时长与参数调节建议,适合评估自定义视觉风格和运动效果的落地路径。
豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。
推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。
Replicate playground 提供一套生成 AI 短视频的工作流:先用 datacte/flux-aesthetic-anime 等图像模型生成起始图,再用 minimax/video-01-live 以首帧图加提示词生成视频,最后用 zsxkib/mmaudio 模型按提示词配音。
Diffusers 发布 v0.32.2 补丁版本,修复了 Flux 加载 Comfy UI 格式单文件 checkpoint 的回归问题,并支持将 LoRA 加载进 bitsandbytes 4bit 量化的 Flux 模型。