跳到正文

#开源/仓库

今日 0 条
9月24日周四
9月10日周四
  1. Hugging Face Blog66

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111,Workflow1111 含 73 个节点

    Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。

    推荐理由:用 73 个节点复刻 A1111 全部功能并暴露 REST 与 MCP 接口,可据此判断节点式创作工作流的搭建与复用方式。

7月7日周二
12月8日周一
  1. Diffusers · Releases62

    Diffusers 0.36.0 发布:新增多条图像与视频管线、TaylorSeer 缓存和 kernels 注意力后端

    Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。

    推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。

11月27日周四
  1. ByteDance Seed · 视觉生成与编辑77

    字节跳动 Seed 发布 Depth Anything 3,单一 Transformer 实现任意视角空间重建

    字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。

    推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。

11月26日周三
  1. Replicate · 模型与制作实践62

    Perceptron AI 发布 Isaac 0.1 视觉语言模型,已在 Replicate 上线

    Perceptron AI 发布 Isaac 0.1,一个 2B 参数的开源权重视觉语言模型,面向有依据的感知任务,现可在 Replicate 上运行。该模型能回答图像问题、推理空间关系、在杂乱环境中读取文字,并给出与答案对应的边界框或区域以提供依据。官方称其在 OCR、物体识别和视觉推理上可媲美体量大得多的模型,且仅需少量标注示例即可适配新任务,无需微调。

    推荐理由:可了解一个 2B 开源视觉语言模型在 OCR、空间推理与少样本适配上的定位,供选型参考。

10月15日周三
8月20日周三
7月1日周二
4月10日周四
12月24日周二
  1. Diffusers · Releases91

    Diffusers 0.32.0 发布:新增视频与图像生成管线、量化后端及训练脚本

    Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。

    推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。

7月12日周五