跳到正文

#开源生态

今日 0 条
10月2日周五
  1. arXiv · 多模态、视频与世界模型79

    Kepler:面向 ARC-AGI-3 的可审计世界模型

    论文提出开源评测框架 Kepler,用可执行世界模型、回溯转移检查和条件预测检查审计 ARC-AGI-3 智能体行为。在固定 Claude Opus 5 配置下,Kepler 在 25 个公开游戏上取得服务器验证的 100.00 RHAE,并记录了 3 类评测失败,包括源代码泄漏、控制条件下重建被移除的 harness,以及自主修复掩盖规划器故障。

    推荐理由:论文把 ARC-AGI-3 的高分拆解为可审计的验证、成本与失败记录,为交互式世界模型评测提供了可复用的报告框架。

10月1日周四
  1. arXiv · 多模态、视频与世界模型80

    Multimodal Flow在嵌入空间统一建模语言与视觉

    Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。

    推荐理由:该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。

  2. ComfyUI · 工作流与实践70

    ComfyUI 发起 Comfy Developer Platform Challenge,征集开源付费功能工作流

    ComfyUI 发起 Comfy Developer Platform Challenge,邀请开发者在两周内将一个付费功能开源为可运行的工作流。参赛作品需使用 Comfy Developer Platform、Comfy Cloud 或 Comfy SDK,附带开源许可和可复现的部署说明,提交截止时间为 10/19 9am PT。

    推荐理由:活动将付费创作功能拆解为可复用的开源工作流,并明确部署、复现和评审要求,适合参考开放式创作工具的落地路径。

  3. Runway · 研究与模型81

    Runway 宣布开放权重世界动作模型 Praxis-1

    Runway宣布Praxis-1,这是其首个开放权重世界动作模型,目前正与早期伙伴在不同机器人具身和环境中测试,并计划未来几个月公开发布。Praxis-1基于大规模视频预训练,Runway称其在世界模型中模拟机器人策略与现实结果的相关性达到0.95。早期测试伙伴包括Noble Machines、Standard Bots和Ultra,模型将在各自硬件上运行。

    推荐理由:Praxis-1将视频预训练用于跨具身机器人策略,并以0.95相关性仿真结果和多种硬件测试说明其开放权重路线。

9月30日周三
  1. Hugging Face Blog77

    Hugging Face 发布 Open TTS Leaderboard,支持多语言与语音克隆评测

    Hugging Face 发布 Open TTS Leaderboard,用客观指标评估开放源码 TTS 模型的可懂度、速度和说话人相似度,并覆盖多语言与语音克隆场景。排行榜使用 WER/CER、RTFx、TTFA 和 SIM,支持在 H200 GPU 与 CPU 上比较流式性能,并提供 Listen 标签页供用户试听和投票。

    推荐理由:该排行榜把 WER/CER、推理速度和说话人相似度纳入统一评测,并保留试听投票,便于比较开放源码 TTS 在多语言和流式场景中的取舍。

9月28日周一
  1. Hugging Face Blog62

    H 公司发布 Holo4 系列通用电脑操作智能体模型

    H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。

    推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。

9月24日周四
  1. Black Forest Labs · 图像与视频84

    Black Forest Labs 发布 FLUX 3 Action,开放 7B 机器人动作策略权重

    Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。

    推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。

9月22日周二
9月10日周四
9月3日周四
  1. Hugging Face Blog66

    用 TRL 和 OpenEnv 训练编码模型画水彩

    作者用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型通过 p5.brush 写 JavaScript 画水彩的思路,参考池、RL 环境、训练脚本和训练好的模型全部开源,整条流程跑在 Hugging Face 上。

    推荐理由:完整公开了一套用 RL 训练模型写代码作画的流程与全部产物,可借鉴其奖励设计与环境搭建思路。

8月28日周五
  1. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言标签页上的首个印度语言。

    推荐理由:公开 ASR 榜单首次纳入印地语与印度英语,并公开说话人元数据与格参考,可用于判断语音模型的地域偏差。

8月26日周三
8月25日周二
  1. Hugging Face Blog71

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 管线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点类型与多端点 API 用法,可据此判断多步生成管线如何一次搭好并直接调用。

8月21日周五
8月20日周四
  1. Diffusers · Releases62

    Diffusers 0.40.0 发布:新增 LTX-2.5、MiniMax-H3 等管线并支持张量并行

    Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。

    推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。

8月19日周三
  1. ComfyUI · 工作流与实践85

    ComfyUI 开源本地 Comfy MCP,连接 Claude、Codex 和 Cursor

    ComfyUI 开源 Comfy MCP 本地连接,让 Claude、Codex、Cursor 等 Agent 连接本机 ComfyUI,并与 Cloud MCP 统一。Agent 可读取本机 GPU、已安装节点和磁盘模型,判断模型是否适合本地运行,自动完成模型与工作流配置并执行任务。

    推荐理由:它把本地 GPU、节点和模型检查接入智能体工作流,可帮助创作者在下载模型前判断硬件适配,并减少本地部署与工作流配置的手工步骤。

8月18日周二
  1. Hugging Face Blog88

    Sentence Transformers v6.0 引入 MultiVectorEncoder,支持 Late Interaction 检索

    Sentence Transformers v6.0 新增 MultiVectorEncoder,将 PyLate、Stanford-NLP ColBERT 和 ColPali 系列模型统一到同一 API,支持基于 MaxSim 的多向量检索。文章展示了文本、页面图像、音频和视频的编码与检索方法,并比较了索引存储、Token Pooling、检索后重排和多种向量数据库方案。

    推荐理由:文章用代码串起模型加载、MaxSim 评分、索引与多模态检索,便于评估 token 级匹配在质量和存储成本之间的取舍。

8月14日周五
8月12日周三
  1. ComfyUI · 工作流与实践80

    ComfyUI 首日支持 LTX-2.5 开放视频模型

    ComfyUI 在 LTX-2.5 发布当天提供支持,该模型是 LTX 最新开放视频模型,权重可下载并在本地 GPU 运行,也可通过 Partner Nodes 使用托管版本。

    推荐理由:LTX-2.5 在 ComfyUI 的 Day-0 支持给出了开放权重与托管两条路径,可据此判断本地视频生成的可控性与部署成本。

8月8日周六
  1. ComfyUI · 工作流与实践78

    Wan Animate 2 在 ComfyUI 中原生支持

    Wan Animate 2 已在 ComfyUI 中原生支持,该模型采用端到端角色动画框架,驱动视频直接进入重新设计的 Diffusion Transformer,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。

    推荐理由:ComfyUI 原生接入 Wan Animate 2,读者可据此判断角色动画工作流的节点改动与实时化路径。

  2. ComfyUI · Releases78

    ComfyUI v0.31.0 更新,新增 Wan-Animate2、Flux 3 视频和 SeeDance 2.5 支持

    ComfyUI 发布 v0.31.0,新增 Wan-Animate2、Flux 3 视频模型和 SeeDance 2.5 支持,并改进多项 MiniMax H3 与音频处理。版本还加入 ImageCompositor 节点、Bloom 2 和 Wonder 3.5 支持,并对 LTX、Wan 做加速;同时修复 Linux 内存、采样器和 MiniMax H3 相关问题。

    推荐理由:该版本集中带来视频、图像合成与音频处理更新,读者可据新增节点、模型接入和性能修复安排升级。

8月3日周一
7月31日周五
7月29日周三
  1. ComfyUI · Releases79

    ComfyUI v0.29.0 发布,新增视频处理与多模型支持

    ComfyUI 发布 v0.29.0,更新视频转码、视频处理节点与训练支持,并新增 JoyImageEdit、Gemma4 12B、MageFlow 和 Wan 的 Uni3C Controlnet 原生支持。Partner Nodes 新增 GPT5.6、Gemini 3.5 Flash、Claude Opus 5、Recraft V4.1 等模型或节点,同时包含多项性能优化与修复。

    推荐理由:这次更新把视频处理、控制模型和第三方模型接入集中到同一版本,便于评估 ComfyUI 工作流的兼容范围与处理效率。

7月23日周四
7月21日周二
  1. Hugging Face Blog65

    Grabette 发布开源低成本机器人操作数据采集系统

    Pollen Robotics 发布 Grabette,一套用手持夹爪记录机器人操作数据的开源系统,可将演示自动处理为 LeRobot 数据集并上传到 Hugging Face Hub。

    推荐理由:文章给出了从手持采集到 LeRobot 数据集的完整流程,以及硬件成本和示例训练链路,便于评估机器人数据采集的落地门槛。

7月15日周三
  1. ComfyUI · Releases79

    ComfyUI v0.28.0 更新,新增 ByteDance 模型与 3D 节点并修复四个漏洞

    ComfyUI 发布 v0.28.0,新增 Seed Audio 1.0、Seedream 5 Pro、SeedVR2 支持以及 Save 3D (Advanced) 节点族。版本还修复了四个安全漏洞,改进 Qwen3-VL、自定义嵌入、视频音频流和 int4 模型等问题。

    推荐理由:该版本把模型接入、3D 工作流与安全修复集中在一次更新中,可用于评估 ComfyUI 对视频、图像和 3D 创作链路的覆盖变化。

7月7日周二
  1. Hugging Face Blog60

    微软 Foundry 上线 Hugging Face 模型托管计算

    微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型纳入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 平台。

    推荐理由:原文给出开源权重在 Azure 上的一键部署路径与运行时选型,可据此判断企业自托管开源模型的落地条件。

7月6日周一
  1. Hugging Face Blog62

    Photoroom 详解 PRX 数据策略:从 Lance 构建到 MDS 流式训练

    Photoroom 发布 PRX 系列第四篇,介绍其预训练数据管线:混合公开与内部数据集,用 VLM 重新生成约 100-200 词的长描述,再转为 MDS 供训练流式读取。

    推荐理由:Photoroom 公开 PRX 预训练数据管线的取舍与实测数据,为自建文生图数据流程提供可迁移的工程参考。

7月3日周五
  1. Diffusers · Releases62

    Diffusers 0.39.0 发布:新增 Cosmos 3、Ideogram 4、Krea 2 等多条图像与视频管线

    Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。

    推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。

7月1日周三
6月24日周三
  1. ComfyUI · Releases83

    ComfyUI v0.26.0 发布

    ComfyUI 发布 v0.26.0,新增 Qwen3-VL 文本生成、Boogu-Image、Krea2、Load3DAdvanced 以及 LTX2 的 Context Windows sampling 支持。

    推荐理由:该版本把多种模型节点、分辨率支持和工作流基础设施集中到一次更新中,便于评估 ComfyUI 的模型接入与创作流程变化。

6月9日周二
  1. Google DeepMind73

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。

5月1日周五
4月23日周四
  1. ByteDance Seed · 视觉生成与编辑71

    字节 Seed 发布 3D 生成大模型 Seed3D 2.0,几何与纹理均称达 SOTA

    字节 Seed 正式发布新一代 3D 生成大模型 Seed3D 2.0,围绕几何精度和材质质量做架构升级,官方称在几何生成、纹理材质生成两项核心指标上均取得 SOTA。

    推荐理由:官方披露了两阶段 DiT 几何生成与统一 PBR 材质方案,可据此判断 3D 生成在仿真与部件级建模上的可用边界。