Black Forest Labs 发布 FLUX-mimic:基于 FLUX 3 的视频-动作模型
Black Forest Labs 宣布 FLUX 3 早期版本已在机器人上运行,并与 mimic 合作推出视频-动作模型 FLUX-mimic,该模型基于 FLUX 3 骨干,从视频预测路径的中间特征解码动作。
推荐理由:官方披露 FLUX 3 早期版本与 mimic 合作落地机器人,可据此判断多模态基座向物理 AI 延伸的路线与部署约束。
Black Forest Labs 宣布 FLUX 3 早期版本已在机器人上运行,并与 mimic 合作推出视频-动作模型 FLUX-mimic,该模型基于 FLUX 3 骨干,从视频预测路径的中间特征解码动作。
推荐理由:官方披露 FLUX 3 早期版本与 mimic 合作落地机器人,可据此判断多模态基座向物理 AI 延伸的路线与部署约束。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 的 SVDQuant 4-bit 检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,可据此判断消费级 GPU 跑扩散模型的量化选型。
Pollen Robotics 发布 Grabette,一套用手持夹爪记录机器人操作数据的开源系统,可将演示自动处理为 LeRobot 数据集并上传到 Hugging Face Hub。
推荐理由:文章给出了从手持采集到 LeRobot 数据集的完整流程,以及硬件成本和示例训练链路,便于评估机器人数据采集的落地门槛。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型纳入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 平台。
推荐理由:原文给出开源权重在 Azure 上的一键部署路径与运行时选型,可据此判断企业自托管开源模型的落地条件。
Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。
推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。
Hugging Face 与 Cerebras 演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理,串联 Nvidia Parakeet 语音识别与阿里 Qwen3TTS 语音合成。
推荐理由:展示了开源级联语音到语音栈的模块化组合方式,可借鉴其用快速推理压低长尾延迟的思路。
ComfyUI 发布 v0.27.0,加入 int8 convrot 模型支持,并改进 int8 LoRA 应用、Turing GPU 支持和内存泄漏问题。
推荐理由:该版本将 int8 支持覆盖到模型、LoRA 应用和 Turing GPU,并同步补充多个合作方节点,可用于评估 ComfyUI 工作流升级。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。
Black Forest Labs 宣布,FLUX.2 [klein] 4B 将预装在新一代搭载 RTX GPU 的 ASUS ProArt 笔记本的 MuseTree 应用中,无需 API 或互联网即可生成图像。该方案的目标是在 8GB VRAM 笔记本上、后台运行其他专业应用时,将图像生成时间控制在 5 秒以内。
推荐理由:这次合作把 FLUX.2 [klein] 4B 的本地部署条件、离线使用方式和性能目标放到具体硬件上,便于评估其对隐私敏感与低延迟创作流程的适配度。
Google DeepMind 发布 Gemini 3.5 系列,首发 Gemini 3.5 Flash,面向智能体与编码等复杂长程任务。
推荐理由:原文给出 Gemini 3.5 Flash 的智能体、编码与多模态基准,以及 API 和产品入口,便于比较模型能力与落地渠道。
World Labs 发布 Spark 2.0,为基于 THREE.js 和 WebGL2 的开源 3DGS 渲染器加入 Level-of-Detail 系统,可按视角连续调整细节并通过网络流式加载数据。
推荐理由:World Labs 公开了 Spark 2.0 的 LoD、渐进流式与虚拟显存三项技术细节,可据此判断大场景 3DGS 在浏览器端的落地条件。
ElevenLabs宣布支持 On-Premise 和 On-Device 部署,将语音 AI 扩展到云端和 VPC 之外。On-Premise 与 On-Device 目前处于 early access,首批版本预计在 2026 年上半年推出;VPC 部署现已可用,并支持自定义声音和针对语言或方言的微调。
推荐理由:材料清晰区分了 On-Premise、On-Device 与 VPC 的部署边界,便于企业按数据驻留和离线推理需求选择方案。
Hugging Face 发布 Diffusers 0.37.0,引入 Modular Diffusers,用可复用模块组合自定义扩散管线,与原有 DiffusionPipeline 并存。
推荐理由:Diffusers 0.37.0 的模块化管线与新增图像视频模型清单,可供选型与工作流搭建时对照参考。
Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。
推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。
Replicate宣布加入Cloudflare,并将保持独立品牌;其 API 不变,现有模型和已构建的应用将继续运行。双方计划把 Replicate 的模型运行能力与 Cloudflare Developer Platform 整合,用于构建智能体、运行实时模型及在边缘部署模型。
推荐理由:这次整合保留了 Replicate 的 API 和现有模型,同时为智能体、实时模型与边缘运行提供更完整的云平台协同。
Replicate上线Datalab的Marker与OCR模型,可将PDF、DOCX、PPTX和图像解析为Markdown或JSON。Marker支持表格、数学公式、代码、图像提取及按JSON Schema提取字段;OCR支持90种语言,并返回阅读顺序和表格网格。
推荐理由:这次接入同时给出结构化抽取、处理速度、基准对比与计价,便于评估文档解析和 OCR 工作流的落地成本。
World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可随交互实时生成视频,用于探索生成的 3D 世界和真实场景,今日以 research preview 形式开放,并可在浏览器中体验。
推荐理由:RTFM 把世界模型做成单卡实时渲染器,读者可据此判断实时 3D 生成在算力与持久性上的可行边界。
Diffusers 发布 v0.35.2-patch,修复初始化 transformers 模型时的 offload_state_dict 处理,以及 TRANSFORMERS_FLAX_WEIGHTS_NAME 导入问题。该版本还加入 PyTorch 2.3.1 兼容性版本检查,并修复 wan 和 ltx 的 scale_shift_factor 位于 CPU 的问题。
Replicate 开始缓存 PyTorch 模型的 torch.compile 编译产物,以减少模型容器启动时的编译开销,black-forest-labs/flux-kontext-dev、prunaai/flux-schnell 和 prunaai/flux.1-dev-lora 的启动速度提升 2–3 倍。
推荐理由:Replicate的缓存机制针对torch.compile首次编译开销,给出了多个模型冷启动时间变化,可用于评估部署优化收益。
Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。
推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。
Replicate 发布托管远程 MCP server,可接入 Claude Desktop、Claude Code、Cursor 和 VS Code,通过聊天式自然语言探索并运行 Replicate 的 HTTP APIs。
推荐理由:它展示了 Replicate 的模型检索、比较和运行如何接入 Claude、Cursor 等工具,并通过远程认证与响应过滤落地 MCP 工作流。
Replicate 公开了其 FLUX.1 Kontext [dev] 实现的优化方法 TaylorSeer,用缓存的特征导数配合 Taylor 级数近似被跳过的去噪步,把模型调用从约 30 步降到 10 至 15 步,同时尽量保持质量。
推荐理由:Replicate 公开了 FLUX.1 Kontext 的 TaylorSeer 缓存加速实现,读者可据此理解扩散模型跳步近似与质量取舍。
Hugging Face Diffusers 发布 0.34.0,新增 Wan VACE、Cosmos Predict2 等视频与图像生成 pipeline,并改善 torch.compile 支持。
推荐理由:该版本同时覆盖可控视频生成与低显存部署,读者可据此评估 Wan VACE 等 pipeline 的控制能力和 torch.compile、量化、卸载组合。
Google DeepMind 的最新旗舰图像模型 Imagen 4 现可在 Replicate 上运行,目前为预览版,行为与功能可能变化,需求高时可能出现排队。
推荐理由:Replicate 上线 Google Imagen 4 预览版,读者可据此了解其文字渲染与细节表现及接入方式。
Hugging Face 上的 3 万多个 LoRA 现可直接在 Hub 上通过 Replicate 运行推理。用户选择支持的 LoRA 模型并将 Replicate 设为推理提供方后,请求会被路由到 Replicate 的 black-forest-labs/flux-dev-lora 模型,LoRA 以 lora_weights 参数动态传入,无需为每个 LoRA 单独托管模型。
Diffusers 发布 v0.33.1,修复了 wan pipelines 的 ftfy 导入问题,该修复由 @yiyixuxu 在 #11262 中提交。此版本距上一版本已有 1620 次提交。
Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。
推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。
Replicate 为 Wan2.1 提供可扩展云端 API,支持 480p/720p 文本生视频与图像生视频。14B 模型在 Replicate 上生成 5s 视频,480p 约需 39s、720p 约需 150s;另有面向消费级 GPU 的 1.3B 模型。文章还介绍了 guide_scale、shift 和 steps 等可调参数。
推荐理由:文章同时给出 Wan2.1 的文本生视频与图像生视频 API 入口、分辨率和参数设置,便于按实验速度与输出分辨率选择模型版本。
Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。
推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。
Replicate 宣布 FLUX 微调推理大幅提速,微调模型运行速度已与基础模型相同:FLUX.1 [schnell] 在 512x512、4 步下为 0.6 秒(P50),FLUX.1 [dev] 在 1024x1024、28 步下为 2.8 秒(P50)。
推荐理由:Replicate 公布了 FLUX 微调推理的加速数据与开源优化路径,可据此判断自建或托管微调服务的成本与质量取舍。
Replicate 宣布 Stable Diffusion 3.5 已上线,提供 Large、Large Turbo 和 Medium 三种版本,分别侧重画质、速度与消费级硬件运行。
推荐理由:文章同时给出三种规格、API价格和Medium权重入口,便于按画质、速度与本地运行条件选择模型。
Replicate 宣布 FLUX 在其平台上的端到端生成速度提升,并将相关优化代码开源。在美国西海岸使用 Python 客户端测试时,FLUX.1 [schnell] 在 512x512、4 steps 下为 0.29 秒,1024x1024、4 steps 下为 0.72 秒;FLUX.1 [dev] 在 1024x1024、28 steps 下为 3.03 秒。
推荐理由:文中给出的端到端测速和可关闭的优化开关,为比较 FLUX 在不同分辨率与步数下的速度、质量和部署取舍提供了具体依据。
Replicate 发布教程,展示如何通过其 HTTP API 以编程方式微调 FLUX.1、发布模型并生成图像。教程覆盖训练图片准备、API token、模型创建、数据上传、训练状态检查,以及使用 trigger_word 调用微调模型。使用约20张图片和1000 steps时,训练通常约需20分钟、成本约为$1.85,训练运行在 Nvidia H100 上并按秒计费。
推荐理由:这篇教程把 FLUX.1 微调拆成可执行的 API 流程,涵盖训练数据、成本、版本发布和调用,适合复用到自定义图像模型工作流。