跳到正文

#多模态

今日 0 条
9月23日周三
9月3日周四
9月1日周二
  1. World Labs · 空间智能与世界模型85

    World Labs 发布世界模型 Atlas,原生支持文本、图像、视频与 3D

    World Labs 发布下一代世界模型 Atlas,这是一个从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频和 3D,所有输入被组合进共享的空间上下文。

    推荐理由:Atlas 把相机位姿与 3D 深度作为原生输入,读者可据此判断世界模型在可控生成与稀疏重建上的路线差异。

8月28日周五
  1. ComfyUI · 工作流与实践66

    Gemini Omni 1.1 Flash 接入 ComfyUI:支持视频生成、编辑与 4K 输出

    Gemini Omni 1.1 Flash 通过 Partner Nodes 在 ComfyUI 上线,封装在 Gemini Video Omni 节点中,可从模型下拉菜单选择 Omni Flash 1.1,在单个节点内完成文生视频、图生视频、参考生视频、视频编辑和场景延展。

    推荐理由:ComfyUI 接入 Gemini Omni 1.1 Flash 的节点参数与提示词写法,可供视频生成与编辑工作流选型参考。

8月25日周二
  1. ComfyUI · 工作流与实践87

    Wan 3.0 接入 ComfyUI,支持原生 30 秒视频与 Omni-Reference 控制

    Alibaba 的 Wan 3.0 已接入 ComfyUI,支持原生生成最长 30 秒的视频,并提供 Omni-Reference 控制。模型支持 480p、720p 和 1080p,可使用最多 10 张图片、5 个视频和 5 段音频等参考素材,还支持视频编辑与扩展。使用这些功能需将 ComfyUI 更新至 v0.33.4,或访问 Comfy Cloud。

    推荐理由:原文同时给出时长、参考素材和分辨率选项,便于评估 Wan 3.0 在长镜头、多素材控制与低成本草稿中的工作流价值。

8月21日周五
  1. Google DeepMind62

    Google DeepMind 与 Fenris Creations 合作,用 EVE 宇宙推进通用游戏智能体研究

    Google DeepMind 宣布与 EVE 宇宙开发商 Fenris Creations 建立研究合作,把 EVE Online、EVE Vanguard 和 EVE Frontier 作为研究持续学习、记忆、长时程规划和复杂多智能体动态的环境。

    推荐理由:DeepMind 公开了游戏智能体从离线沙盒到持久世界的推进路径,可据此判断通用游戏 Agent 的落地节奏与安全边界。

8月18日周二
  1. Hugging Face Blog88

    Sentence Transformers v6.0 引入 MultiVectorEncoder,支持 Late Interaction 检索

    Sentence Transformers v6.0 新增 MultiVectorEncoder,将 PyLate、Stanford-NLP ColBERT 和 ColPali 系列模型统一到同一 API,支持基于 MaxSim 的多向量检索。文章展示了文本、页面图像、音频和视频的编码与检索方法,并比较了索引存储、Token Pooling、检索后重排和多种向量数据库方案。

    推荐理由:文章用代码串起模型加载、MaxSim 评分、索引与多模态检索,便于评估 token 级匹配在质量和存储成本之间的取舍。

8月12日周三
8月10日周一
  1. Hugging Face Blog90

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。

    推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。

8月8日周六
  1. ComfyUI · 工作流与实践78

    Wan Animate 2 在 ComfyUI 中原生支持

    Wan Animate 2 已在 ComfyUI 中原生支持,该模型采用端到端角色动画框架,驱动视频直接进入重新设计的 Diffusion Transformer,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。

    推荐理由:ComfyUI 原生接入 Wan Animate 2,读者可据此判断角色动画工作流的节点改动与实时化路径。

  2. ComfyUI · 工作流与实践78

    Seedance 2.5 通过 Partner Nodes 上线 ComfyUI

    Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,单次生成一段连续 30 秒视频,无需拼接短片。单次生成最多可接入 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中逐条指定。

    推荐理由:ComfyUI 接入 Seedance 2.5 后,可据此判断单次 30 秒连续生成与 50 个参考素材对现有分镜拼接流程的替代空间。

8月6日周四
8月5日周三
  1. ByteDance Seed · 音频与多模态交互83

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,已在豆包 App 全量上线

    字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。

    推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。

8月4日周二
  1. Black Forest Labs · 图像与视频80

    Black Forest Labs 发布 FLUX 3 Video,支持文生视频与图生视频

    Black Forest Labs 通过 BFL API 和部分合作方开放 FLUX 3 Video 生成能力的初始版本,可生成最长 20 秒的 HD 视频并同步生成原生音频,Full HD 通过超分输出。

    推荐理由:官方给出 FLUX 3 Video 的生成能力、分辨率与草稿模式,可据此判断多模态视频生成在创作流程中的可用边界。

8月3日周一
  1. ComfyUI · 工作流与实践89

    MiniMax H3 发布并获 ComfyUI Day-0 支持,开放权重支持原生音频与 2K 视频

    MiniMax H3 今日发布开放权重,并在 ComfyUI 中获得 Day-0 原生支持,可接收文本、图像、视频或音频,生成带立体声的 2K、最长 15 秒视频。

    推荐理由:文章把 H3 的多模态输入、原生立体声和 ComfyUI 本地运行路径放在一起,并给出显存缩减与工作流入口,便于评估视频创作部署成本。

7月31日周五
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.5 正式发布:单次生成 30 秒、支持多轮延长

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,延续 Seedance 2.0 统一的多模态音视频联合生成架构,重点突破长叙事、多模态参考和编辑能力。

    推荐理由:官方给出 30 秒单次生成、多模态参考与时间戳编辑的具体能力边界,可据此判断长叙事视频工作流的可用性。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层具身推理模型,可理解连续视频、编排多步任务并把动作执行交给底层 VLA 模型,同时原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机协作的能力边界和开放入口,可用于判断机器人上层编排模型的选型。

7月29日周三
  1. ComfyUI · Releases79

    ComfyUI v0.29.0 发布,新增视频处理与多模型支持

    ComfyUI 发布 v0.29.0,更新视频转码、视频处理节点与训练支持,并新增 JoyImageEdit、Gemma4 12B、MageFlow 和 Wan 的 Uni3C Controlnet 原生支持。Partner Nodes 新增 GPT5.6、Gemini 3.5 Flash、Claude Opus 5、Recraft V4.1 等模型或节点,同时包含多项性能优化与修复。

    推荐理由:这次更新把视频处理、控制模型和第三方模型接入集中到同一版本,便于评估 ComfyUI 工作流的兼容范围与处理效率。

7月28日周二
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次让模型控制完整人形机器人,实现从脚到指尖的全身控制、灵巧操作与多机器人协作。

    推荐理由:Gemini Robotics 2 把 VLA 控制从上半身扩展到全身并支持多机器人协作,可据此判断具身智能的模型分层与端侧部署路线。

7月23日周四
  1. Black Forest Labs · 图像与视频78

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access,联合学习图像、视频和音频,可混合模态生成图像与带音频的视频,单次生成视频最长 20 秒。

    推荐理由:FLUX 3 把图像、视频、音频与动作预测放进同一架构,并给出与多家视频模型的早期对比,可供多模态选型参考。

7月20日周一
  1. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布音频创作模型 Seed Audio 1.0

    字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,并已在火山方舟体验中心上线。模型支持一条 prompt 编排对白、音效与环境声,时间控制精度达 100ms,支持零样本音色生成与参考音频延展,单次可生成约 2 分钟音频并继续延长以保持角色一致性。

    推荐理由:官方披露了统一建模多要素音频、100ms 时间控制与 20+ 语种等能力,可据此判断其在配音与多语种内容生产中的可用边界。

7月15日周三
7月8日周三
  1. ByteDance Seed · 视觉生成与编辑80

    字节 Seedream 5.0 Pro 发布,主打复杂信息图与交互式精准编辑

    字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面提升,并带来复杂信息可视化、交互式精准编辑、真实影像与人像质感、原生多语种输入与生成四大能力突破。

    推荐理由:官方给出信息图生成、交互式精准编辑与多语种渲染的能力边界,可据此判断图像模型在专业设计流程中的可用程度。

7月7日周二
7月3日周五
  1. Diffusers · Releases62

    Diffusers 0.39.0 发布:新增 Cosmos 3、Ideogram 4、Krea 2 等多条图像与视频管线

    Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。

    推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。

7月1日周三
6月24日周三
  1. ComfyUI · Releases83

    ComfyUI v0.26.0 发布

    ComfyUI 发布 v0.26.0,新增 Qwen3-VL 文本生成、Boogu-Image、Krea2、Load3DAdvanced 以及 LTX2 的 Context Windows sampling 支持。

    推荐理由:该版本把多种模型节点、分辨率支持和工作流基础设施集中到一次更新中,便于评估 ComfyUI 的模型接入与创作流程变化。

6月22日周一
  1. ElevenLabs · 音频创作71

    ElevenLabs 在 ElevenCreative 推出 Ads Engine,主打广告本地化

    ElevenLabs 在 ElevenCreative 内推出 Ads Engine,首个能力是广告本地化,可接入 Google Ads 和 Meta Ads 账号,拉取现有素材与投放数据,同时完成文本翻译、图像适配和视频配音,再把本地化版本推回 Google、Meta 和 LinkedIn。

    推荐理由:官方披露广告本地化引擎的接入方式与工作流,可据此判断多语言投放的素材生产与审片环节如何变化。

6月9日周二
  1. Google DeepMind73

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。

6月4日周四
  1. ElevenLabs · 音频创作85

    ElevenLabs 在 ElevenCreative 推出 Flows Agent

    ElevenLabs 在 ElevenCreative 推出 Flows Agent,将对话式 AI 助手接入 Flows 画布,自动选择模型、创建并连接节点,执行图像、视频和音频生成流程。它支持通过对话修改已有流程,并可在高成本生成前请求确认;复杂工作流也能在后台运行,现已在 ElevenCreative 提供使用。

    推荐理由:它把多模态节点编排、生成执行和变体迭代合并到对话入口,可用于判断创作流程如何降低试错与额度控制成本。

5月18日周一
  1. Google DeepMind91

    Google DeepMind 发布 Gemini Omni,首个模型 Gemini Omni Flash 开始上线

    Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。

    推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。

5月16日周六
5月11日周一
  1. Runway · 研究与模型71

    Runway 发布实时视频生成模型 Runway Characters

    Runway 推出基于 GWM-1 的实时视频生成模型 Runway Characters,由单张参考图生成可对话角色,处理眼神、口型同步、表情与说话和倾听时的手势,并能在长对话中维持质量。

    推荐理由:Runway 把实时逐帧生成与交互控制讲成产品路线,可据此判断世界模型在角色对话与仿真训练中的落地边界。

4月30日周四
  1. Google DeepMind66

    Google DeepMind 宣布 AI co-clinician 研究计划,探索临床监督下的医疗协作

    Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体协助患者护理,并评估其面向医生和患者的能力。在98个真实感初级保健问题中,系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。实时音视频远程医疗模拟显示,AI co-clinician 在140项会诊能力中的68项达到或超过初级保健医生,但医生整体表现更好。

    推荐理由:文章同时给出证据检索、药物问答和实时多模态会诊的评测设计,可用于理解医疗智能体的能力边界与临床安全架构。

4月23日周四
  1. ByteDance Seed · 视觉生成与编辑71

    字节 Seed 发布 3D 生成大模型 Seed3D 2.0,几何与纹理均称达 SOTA

    字节 Seed 正式发布新一代 3D 生成大模型 Seed3D 2.0,围绕几何精度和材质质量做架构升级,官方称在几何生成、纹理材质生成两项核心指标上均取得 SOTA。

    推荐理由:官方披露了两阶段 DiT 几何生成与统一 PBR 材质方案,可据此判断 3D 生成在仿真与部件级建模上的可用边界。

4月15日周三
  1. Replicate · 模型与制作实践76

    如何用 Seedance 2.0 制作出色视频

    Replicate 发布 Seedance 2.0 使用教程,介绍该模型可同时接收最多 9 张图片、3 段视频、3 个音频和文本提示,并用 [Image1]、[Audio1] 等标记在提示词中引用素材。

    推荐理由:通过参考素材组合、时间码分镜和音画同源三条实操路径,可迁移到需要角色一致性与多镜头调度的视频创作流程。