Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,为 LFM2.5-VL-3B 加速视觉语言推理
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下提升推理速度。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高加速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下提升推理速度。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高加速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
推荐理由:用 73 个节点复刻 A1111 全部功能并暴露 REST 与 MCP 接口,可据此判断节点式创作工作流的搭建与复用方式。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 三个世界模型策略,让机器人策略在训练中预测未来、推理时零额外成本。
Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。
推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。
字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。
推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。
Perceptron AI 发布 Isaac 0.1,一个 2B 参数的开源权重视觉语言模型,面向有依据的感知任务,现可在 Replicate 上运行。该模型能回答图像问题、推理空间关系、在杂乱环境中读取文字,并给出与答案对应的边界框或区域以提供依据。官方称其在 OCR、物体识别和视觉推理上可媲美体量大得多的模型,且仅需少量标注示例即可适配新任务,无需微调。
推荐理由:可了解一个 2B 开源视觉语言模型在 OCR、空间推理与少样本适配上的定位,供选型参考。
Diffusers 发布 v0.35.2-patch,修复初始化 transformers 模型时的 offload_state_dict 处理,以及 TRANSFORMERS_FLAX_WEIGHTS_NAME 导入问题。该版本还加入 PyTorch 2.3.1 兼容性版本检查,并修复 wan 和 ltx 的 scale_shift_factor 位于 CPU 的问题。
Hugging Face 发布 Diffusers v0.35.1,重点改进 Qwen-Image Edit。该版本包含 PR #12188 和 #12190,贡献者为 naykun。
Replicate 联合 Black Forest Labs 举办 FLUX.1 Kontext 黑客松,120 多名参与者用这款图像编辑模型和 Resemble AI 的 Chatterbox 语音模型在数小时内完成 30 个参赛项目。
Diffusers 发布 v0.33.1,修复了 wan pipelines 的 ftfy 导入问题,该修复由 @yiyixuxu 在 #11262 中提交。此版本距上一版本已有 1620 次提交。
Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。
推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。
Fal.ai 发布 68 亿参数开源文生图模型 AuraFlow,性能对标闭源方案。研究者推出 llama.ttf,将完整语言模型推理引擎嵌入字体文件。Google DeepMind 提出 JEST 方法,数据筛选效率比随机采样高 13 倍,可用 10 倍更少算力训练高质量多模态模型。