Diffusers v0.32.2 发布:修复 Flux 与 Hunyuan Video 加载问题
Diffusers 发布 v0.32.2 补丁版本,修复了 Flux 加载 Comfy UI 格式单文件 checkpoint 的回归问题,并支持将 LoRA 加载进 bitsandbytes 4bit 量化的 Flux 模型。
Diffusers 发布 v0.32.2 补丁版本,修复了 Flux 加载 Comfy UI 格式单文件 checkpoint 的回归问题,并支持将 LoRA 加载进 bitsandbytes 4bit 量化的 Flux 模型。
Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。
推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。
Replicate 作者 fofr 认为,Sora 让外界看到视频模型的可能性却无法使用,如今一批质量接近 Sora 的模型已经可用,AI 视频正经历类似 Stable Diffusion 的爆发。
推荐理由:梳理了 Sora 之后一批视频模型的 ELO、速度、时长与开源情况,便于按质量、成本和可微调性做选型比较。
Replicate 宣布 FLUX 微调推理大幅提速,微调模型运行速度已与基础模型相同:FLUX.1 [schnell] 在 512x512、4 步下为 0.6 秒(P50),FLUX.1 [dev] 在 1024x1024、28 步下为 2.8 秒(P50)。
推荐理由:Replicate 公布了 FLUX 微调推理的加速数据与开源优化路径,可据此判断自建或托管微调服务的成本与质量取舍。
Black Forest Labs 发布 FLUX.1 Tools,为 FLUX 文生图模型增加控制与可引导能力,包含 Fill、Canny、Depth、Redux 四项功能。
推荐理由:FLUX.1 Tools 把局部重绘、边缘与深度控制、图像变体整合进同一模型族,可据此判断可控生成在编辑流程中的可用边界。
Replicate 宣布 Stable Diffusion 3.5 已上线,提供 Large、Large Turbo 和 Medium 三种版本,分别侧重画质、速度与消费级硬件运行。
推荐理由:文章同时给出三种规格、API价格和Medium权重入口,便于按画质、速度与本地运行条件选择模型。
Ideogram 为 Ideogram v2 推出局部重绘功能,Replicate 同步将该模型接入自家 API,提供 ideogram-ai/ideogram-v2 与 ideogram-ai/ideogram-v2-turbo 两个版本,前者图像质量更好、后者速度更快。
推荐理由:Replicate 接入 Ideogram v2 局部重绘,并给出提示词写法与开源 demo,可作图像编辑工作流的选型参考。
Replicate 宣布 FLUX 在其平台上的端到端生成速度提升,并将相关优化代码开源。在美国西海岸使用 Python 客户端测试时,FLUX.1 [schnell] 在 512x512、4 steps 下为 0.29 秒,1024x1024、4 steps 下为 0.72 秒;FLUX.1 [dev] 在 1024x1024、28 steps 下为 3.03 秒。
推荐理由:文中给出的端到端测速和可关闭的优化开关,为比较 FLUX 在不同分辨率与步数下的速度、质量和部署取舍提供了具体依据。
Black Forest Labs 发布 FLUX1.1 [pro],这是 FLUX.1 [pro] 的更快版本,生成速度为前代 6 倍,并提升图像质量、提示词遵循度和输出多样性。
推荐理由:文章同时给出 FLUX1.1 [pro] 的速度、质量与价格变化,并展示 Prompt upsampling 对图像生成工作流的影响。
Replicate 介绍了利用合成训练数据改进 Flux 微调模型的方法,涵盖从单张图片生成训练集、筛选模型优质输出再训练,以及组合多个 LoRA 扩展风格。文章还说明了通过 Replicate API 使用 `extra_lora` 和 `extra_lora_scale` 的方式,并建议在 0.9 到 1.1 的范围内调整 LoRA 权重。
推荐理由:文章将单图扩增、筛选微调模型优质输出和组合 LoRA 整理成可复用流程,适合改善 Flux 微调数据的多样性与风格范围。
Replicate 发布教程,展示如何通过其 HTTP API 以编程方式微调 FLUX.1、发布模型并生成图像。教程覆盖训练图片准备、API token、模型创建、数据上传、训练状态检查,以及使用 trigger_word 调用微调模型。使用约20张图片和1000 steps时,训练通常约需20分钟、成本约为$1.85,训练运行在 Nvidia H100 上并按秒计费。
推荐理由:这篇教程把 FLUX.1 微调拆成可执行的 API 流程,涵盖训练数据、成本、版本发布和调用,适合复用到自定义图像模型工作流。
Replicate 发布教程,介绍如何用少量个人照片在 Replicate 上微调 FLUX.1,生成包含本人形象的图像。教程建议至少准备10张不同角度、光线和场景的照片,设置独特触发词,并使用1000步训练。以约20张训练图为例,训练通常需要约20分钟、费用约为$1.85,完成后可通过网页或 API 生成图像。
推荐理由:教程给出个人照片微调、触发词设置和模型调用的完整步骤,并提供1000步训练约20分钟、约$1.85的成本参考,便于复用这套肖像生成流程。
Replicate 第 12 期周报聚焦 FLUX.1 图像生成工具、Deep-Live-Cam 换脸项目及睡眠中大脑自博弈研究。ReFlux 支持在无限画布上使用多个微调后的 FLUX.1 模型,Multi-LoRA Explorer 可在单张图像中组合多个 LoRA。Deep-Live-Cam 是开源项目,据称支持实时换脸,但作者在 MacBook Pro 上未达到满意帧率。
Replicate 宣布支持在平台上用自有图片微调 FLUX.1 图像生成模型,用户可上传 12-20 张多样图片并设置触发词,约 30 分钟生成定制模型。
推荐理由:这期内容给出 FLUX.1 微调所需的图片数量与耗时,并串联数字人、可控视频和可玩游戏世界案例,便于比较不同生成工作流。
Replicate 支持使用 Ostris’s AI Toolkit 和 LoRA,通过网页或 API 用自有图像微调 FLUX.1 [dev],以定制特定风格、角色或物体。
推荐理由:文章给出从准备 12–20 张图像到调用微调模型的完整路径,并说明训练时长、成本和 FLUX.1 [dev] 的商业使用边界。
Replicate 宣布 FLUX.1 [dev] 支持图像到图像转换,用户可上传起始图像、输入提示词,并通过 prompt strength 调整二者的影响比例。该功能适合风格迁移和构图控制,但从彩色图像生成黑白线稿仍较困难;周报还介绍了 Streamlit 与 Replicate 的应用开发教程,以及用于 Minecraft 开放世界探索的 Odyssey 智能体框架。
推荐理由:文章同时给出 FLUX.1 [dev] 图像到图像的使用方式与局限,并串联 Streamlit 应用开发和开放世界智能体研究,便于了解近期开源实践方向。
Replicate 介绍 FLUX.1,这款可根据文字生成图像的新 AI 模型采用 flow matching,而非扩散模型。文章通过文字渲染、玻璃花朵、复杂场景和艺术风格等提示词,观察其在文字、光影、材质与构图方面的表现。文中所有图片均使用面向速度和本地执行优化的 FLUX.1 [schnell] 生成,可在 Replicate 上试用。
推荐理由:文章通过多组提示词展示 FLUX.1 在文字渲染、光影材质和复杂构图上的表现,并呈现 flow matching 带来的流动感审美。
Replicate 周报汇总本周开源 AI 动态:Black Forest Labs 发布图像生成模型套件 FLUX.1,含 pro、dev 和以 Apache 2.0 许可开源的 schnell 三个版本。
推荐理由:汇总一周开源模型与工具动态,并借编辑手记讨论生成模型作为世界镜像的反馈循环。
Black Forest Labs 开发的 FLUX.1 开源图像生成模型已在 Replicate 提供,可通过浏览器或一行代码调用。模型分为 FLUX.1 [pro]、[dev] 和 [schnell],分别面向高性能、非商业应用和本地开发;文中列出的单图价格为 $0.055、$0.030 和 0.003。
推荐理由:文章并列介绍 FLUX.1 的三种版本、适用场景与单图价格,便于比较云端调用、非商业应用和本地开发的选择。
Fal.ai 发布 68 亿参数开源文生图模型 AuraFlow,性能对标闭源方案。研究者推出 llama.ttf,将完整语言模型推理引擎嵌入字体文件。Google DeepMind 提出 JEST 方法,数据筛选效率比随机采样高 13 倍,可用 10 倍更少算力训练高质量多模态模型。