跳到正文

#部署/工程

今日 0 条
10月2日周五
  1. arXiv · 多模态、视频与世界模型68

    ExpertLens 通过多模态 MoE 领域专家实现高效适配

    论文提出数据无关方法 ExpertLens,从预训练多模态 MoE 的路由权重中识别领域专长专家,并选择性微调目标领域相关专家。在数学、医疗和遥感任务上,该方法仅更新 21.7 - 47.0% 的模型参数,平均训练速度提升 4.0x,效果达到或超过全量微调。ExpertLens 在适配性能和训练效率上均优于 LoRA。

10月1日周四
  1. Runway · 研究与模型81

    Runway 宣布开放权重世界动作模型 Praxis-1

    Runway宣布Praxis-1,这是其首个开放权重世界动作模型,目前正与早期伙伴在不同机器人具身和环境中测试,并计划未来几个月公开发布。Praxis-1基于大规模视频预训练,Runway称其在世界模型中模拟机器人策略与现实结果的相关性达到0.95。早期测试伙伴包括Noble Machines、Standard Bots和Ultra,模型将在各自硬件上运行。

    推荐理由:Praxis-1将视频预训练用于跨具身机器人策略,并以0.95相关性仿真结果和多种硬件测试说明其开放权重路线。

9月30日周三
  1. arXiv · 多模态、视频与世界模型82

    LongLive-Plug 提出一次性蒸馏框架,支持视频生成模型即插即用复用

    论文提出 LongLive-Plug,一种将蒸馏能力学习为基础模型 LoRA 的一次性框架,可免训练即插即用于兼容的下游视频模型。它覆盖单次 CFG、少步采样和长上下文错误校正,并在三类骨干网络、54 个下游模型和八类任务上进行了验证。

    推荐理由:论文给出把单次 CFG、少步采样和长上下文纠错封装为可复用 LoRA 的方案,并以 54 个下游模型展示跨任务免训练部署路径。

9月28日周一
  1. Hugging Face Blog62

    H 公司发布 Holo4 系列通用电脑操作智能体模型

    H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。

    推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。

9月24日周四
  1. Black Forest Labs · 图像与视频84

    Black Forest Labs 发布 FLUX 3 Action,开放 7B 机器人动作策略权重

    Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。

    推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。

8月27日周四
8月12日周三
8月10日周一
  1. Hugging Face Blog90

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。

    推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。

8月3日周一
  1. ComfyUI · 工作流与实践89

    MiniMax H3 发布并获 ComfyUI Day-0 支持,开放权重支持原生音频与 2K 视频

    MiniMax H3 今日发布开放权重,并在 ComfyUI 中获得 Day-0 原生支持,可接收文本、图像、视频或音频,生成带立体声的 2K、最长 15 秒视频。

    推荐理由:文章把 H3 的多模态输入、原生立体声和 ComfyUI 本地运行路径放在一起,并给出显存缩减与工作流入口,便于评估视频创作部署成本。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层具身推理模型,可理解连续视频、编排多步任务并把动作执行交给底层 VLA 模型,同时原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机协作的能力边界和开放入口,可用于判断机器人上层编排模型的选型。

7月28日周二
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次让模型控制完整人形机器人,实现从脚到指尖的全身控制、灵巧操作与多机器人协作。

    推荐理由:Gemini Robotics 2 把 VLA 控制从上半身扩展到全身并支持多机器人协作,可据此判断具身智能的模型分层与端侧部署路线。

7月27日周一
7月23日周四
  1. Black Forest Labs · 图像与视频74

    Black Forest Labs 发布 FLUX-mimic:基于 FLUX 3 的视频-动作模型

    Black Forest Labs 宣布 FLUX 3 早期版本已在机器人上运行,并与 mimic 合作推出视频-动作模型 FLUX-mimic,该模型基于 FLUX 3 骨干,从视频预测路径的中间特征解码动作。

    推荐理由:官方披露 FLUX 3 早期版本与 mimic 合作落地机器人,可据此判断多模态基座向物理 AI 延伸的路线与部署约束。

7月3日周五
  1. Diffusers · Releases62

    Diffusers 0.39.0 发布:新增 Cosmos 3、Ideogram 4、Krea 2 等多条图像与视频管线

    Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。

    推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。

7月1日周三
6月9日周二
  1. Google DeepMind73

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。

5月16日周六
4月14日周二
  1. World Labs · 空间智能与世界模型76

    World Labs 发布 Spark 2.0,为网页端 3DGS 加入 LoD 流式渲染

    World Labs 发布 Spark 2.0,为基于 THREE.js 和 WebGL2 的开源 3DGS 渲染器加入 Level-of-Detail 系统,可按视角连续调整细节并通过网络流式加载数据。

    推荐理由:World Labs 公开了 Spark 2.0 的 LoD、渐进流式与虚拟显存三项技术细节,可据此判断大场景 3DGS 在浏览器端的落地条件。

10月16日周四
  1. World Labs · 空间智能与世界模型78

    World Labs 发布实时世界模型 RTFM

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可随交互实时生成视频,用于探索生成的 3D 世界和真实场景,今日以 research preview 形式开放,并可在浏览器中体验。

    推荐理由:RTFM 把世界模型做成单卡实时渲染器,读者可据此判断实时 3D 生成在算力与持久性上的可行边界。

8月19日周二
  1. Diffusers · Releases90

    Diffusers 0.35.0 发布,新增 Qwen Image、Flux Kontext 和 Wan 2.2 管线

    Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。

    推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。

7月16日周三
  1. Replicate · 模型与制作实践62

    Replicate 如何优化 FLUX.1 Kontext [dev]

    Replicate 公开了其 FLUX.1 Kontext [dev] 实现的优化方法 TaylorSeer,用缓存的特征导数配合 Taylor 级数近似被跳过的去噪步,把模型调用从约 30 步降到 10 至 15 步,同时尽量保持质量。

    推荐理由:Replicate 公开了 FLUX.1 Kontext 的 TaylorSeer 缓存加速实现,读者可据此理解扩散模型跳步近似与质量取舍。

5月22日周四
4月10日周四
10月22日周二