跳到正文

#模型发布

今日 0 条
7月1日周三
6月9日周二
  1. Google DeepMind73

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。

5月29日周五
  1. Black Forest Labs · 图像与视频82

    FLUX VTO 公开发布,面向大规模商品目录的虚拟试衣模型

    FLUX VTO 公开发布,主打面向大规模商品目录的虚拟试衣,单次生成耗时低于 4 秒。模型可保留人物身份以及服装的 logo、印花、缝线和五金细节,支持一次应用最多四件衣物并进行叠穿。精准的身体和服装尺码仍在演进,输出更适合用于视觉造型参考;默认政策不支持泳装和内衣。

    推荐理由:原文同时给出速度、商品细节保真和多件叠穿能力,可帮助评估虚拟试衣在商品目录与交互购物中的落地条件。

5月26日周二
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布 Music v2 音乐生成模型

    ElevenLabs 发布 Music v2 音乐生成模型,提升人声、器乐、编曲和多语言支持,并支持更复杂的歌曲结构。模型支持按片段局部重绘、分段构建完整歌曲,以及在同一首歌中处理多种曲风、快速说唱和非音乐音效。

    推荐理由:Music v2 将局部重绘、分段作曲和多语言演唱整合到音乐生成流程,便于比较创作者、品牌与开发者的不同接入方式。

5月18日周一
  1. Google DeepMind91

    Google DeepMind 发布 Gemini Omni,首个模型 Gemini Omni Flash 开始上线

    Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。

    推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。

5月16日周六
4月23日周四
  1. ByteDance Seed · 视觉生成与编辑71

    字节 Seed 发布 3D 生成大模型 Seed3D 2.0,几何与纹理均称达 SOTA

    字节 Seed 正式发布新一代 3D 生成大模型 Seed3D 2.0,围绕几何精度和材质质量做架构升级,官方称在几何生成、纹理材质生成两项核心指标上均取得 SOTA。

    推荐理由:官方披露了两阶段 DiT 几何生成与统一 PBR 材质方案,可据此判断 3D 生成在仿真与部件级建模上的可用边界。

4月16日周四
  1. Google DeepMind82

    Google 发布 Gemini 3.1 Flash TTS 语音模型

    Google 推出 Gemini 3.1 Flash TTS,提升语音质量、可控性与表现力,并支持 70+ 语言和原生多说话人对话。模型引入可通过自然语言控制音色、语速和表达方式的音频标签,开发者可在 Gemini API 和 Google AI Studio 预览,企业可通过 Vertex AI 预览,Workspace 用户可在 Google Vids 使用。

    推荐理由:音频标签、多人对话和 70+ 语言支持,为评估语音产品的表达控制、全球化覆盖与 API 落地路径提供了具体参照。

4月13日周一
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人所需的空间推理、多视角理解、任务规划和成功检测能力。模型新增仪表读数能力,可通过 Gemini API 和 Google AI Studio 提供给开发者,并支持调用 Google Search、VLA 或用户自定义函数。

    推荐理由:文章给出 Gemini Robotics-ER 1.6 在空间推理、多视角成功检测和仪表读数上的能力变化,并说明其通过 Gemini API 与 Google AI Studio 接入机器人工作流的方式。

4月9日周四
  1. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布全双工语音大模型 Seeduplex,已在豆包 App 全量上线

    字节 Seed 正式推出原生全双工语音大模型 Seeduplex,基于边听边说框架,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其复杂场景误回复率和误打断率减少一半,抢话比例相对下降 40%,判停 MOS 分提高 8%、对话流畅度 MOS 分提升 12%,快问快答场景时延降低约 250ms。

    推荐理由:官方给出全双工语音模型的架构思路与多项对比数据,可据此判断实时语音交互的技术路线与落地进度。

2月18日周三
2月13日周五
  1. ByteDance Seed · 视觉生成与编辑77

    字节 Seedream 5.0 Lite 发布:引入实时检索增强与多步视觉推理

    字节跳动 Seed 团队发布 Seedream 5.0 Lite 智能图像创作模型,相比 4.0 在理解、推理和生成方面全面提升,并首次为 Seedream 系列引入实时检索增强能力,可联网获取最新资讯回应时效性创作需求。

    推荐理由:官方披露了多模态统一架构与实时检索增强的落地方式,可据此判断图像模型向推理型创作助手演进的具体路径。

2月2日周一
  1. ElevenLabs · 音频创作69

    ElevenLabs 发布正式可用的 Eleven v3 文本转语音模型

    ElevenLabs 宣布 Eleven v3 文本转语音模型结束 Alpha 阶段并正式可用,现已在所有平台开放。在覆盖 8 种语言、27 个类别的内部基准中,错误率从 15.3% 降至 4.9%,错误减少 68%;测试中用户有 72% 的时间更偏好新版本而非此前 Alpha 版本。更新重点包括更准确处理数字、符号和专业记号,例如将电话号码、货币、化学式和体育比分按上下文朗读。

    推荐理由:这次更新提供了文本转语音模型在跨语言符号朗读和稳定性上的具体变化,便于评估号码、公式与复杂格式的生成可用性。

1月9日周五
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布语音转录模型 Scribe v2

    ElevenLabs 发布 Scribe v2,面向批量转录、字幕和听写场景,强化了长音频、停顿、语气变化、长静音及多说话人和口音的处理。Scribe v2 支持最多 100 个关键词或短语提示、最多 56 类实体检测及精确时间戳,并能自动转录单个音频文件中的多种语言。

    推荐理由:Scribe v2针对长音频、多语言和复杂说话场景优化,并结合关键词提示与实体时间戳,适合评估批量转录和审片工作流。

11月27日周四
  1. ByteDance Seed · 视觉生成与编辑77

    字节跳动 Seed 发布 Depth Anything 3,单一 Transformer 实现任意视角空间重建

    字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。

    推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。

11月12日周三
  1. World Labs · 空间智能与世界模型92

    World Labs 开放 Marble 多模态世界模型,支持多输入生成与 3D 编辑

    World Labs 宣布 Marble 多模态世界模型面向所有用户开放,可从文本、图像、视频或粗略 3D 布局生成 3D 世界。Marble 支持交互式编辑、扩展和组合世界,并可导出为 Gaussian splats、网格或视频;同时推出创作中心 Marble Labs。

    推荐理由:Marble 将文本、图像、视频和粗略 3D 布局纳入同一创作流程,并提供编辑、扩展与导出能力,可用于判断其对世界构建工作流的适配度。

10月23日周四
  1. ByteDance Seed · 视觉生成与编辑74

    字节 Seed 发布 Seed3D 1.0,单图生成高精度 3D 模型

    字节跳动 Seed 团队发布 3D 生成大模型 Seed3D 1.0,可从单张图像端到端生成含精细几何、真实纹理和 PBR 材质的完整 3D 模型。模型基于 Diffusion Transformer 架构,1.5B 参数版本在几何生成上超过 3B 参数的 Hunyuan3D-2.1,纹理与材质生成性能超过此前开源及闭源模型。

    推荐理由:官方给出架构、参数规模与对比基线,可据此判断单图生成仿真级 3D 资产在机器人训练中的可用边界。

10月16日周四
  1. World Labs · 空间智能与世界模型78

    World Labs 发布实时世界模型 RTFM

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可随交互实时生成视频,用于探索生成的 3D 世界和真实场景,今日以 research preview 形式开放,并可在浏览器中体验。

    推荐理由:RTFM 把世界模型做成单卡实时渲染器,读者可据此判断实时 3D 生成在算力与持久性上的可行边界。

9月9日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节跳动 Seed 团队发布 Seedream 4.0 图像创作模型

    字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。

    推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。

7月24日周四
  1. ByteDance Seed · 音频与多模态交互73

    字节 Seed 发布端到端同声传译模型 Seed LiveInterpret 2.0,延迟低至 2-3 秒

    字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。

    推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。

6月11日周三
  1. ByteDance Seed · 视觉生成与编辑86

    字节跳动 Seed 发布 Seedance 1.0 视频生成模型并公开技术报告

    字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。

    推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。

6月6日周五
  1. ByteDance Seed · 视觉生成与编辑78

    字节跳动 Seed 发布图像编辑模型 SeedEdit 3.0

    字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。

    推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。

6月2日周一
  1. Replicate · 模型与制作实践80

    FLUX.1 Kontext 发布,Replicate 汇总社区图像编辑案例

    Black Forest Labs 发布图像编辑模型 FLUX.1 Kontext,提供 [pro]、[max] 和即将推出的 [dev] 三个版本,可进行颜色替换、背景编辑、文字替换和风格迁移,并保持角色一致性。Replicate 还介绍了社区在发型变换、职业头像、老图修复、画幅扩展和移除文字等场景中的使用案例,以及 Kontext Chat 和可直接使用的 Kontext 应用。

    推荐理由:文章同时梳理 FLUX.1 Kontext 的版本差异、提示词方法与社区案例,适合参考图像编辑和社交内容改版的工作流。

3月5日周三
  1. Replicate · 模型与制作实践80

    Replicate 接入 Wan2.1,提供 API 生成 480p 和 720p 视频

    Replicate 为 Wan2.1 提供可扩展云端 API,支持 480p/720p 文本生视频与图像生视频。14B 模型在 Replicate 上生成 5s 视频,480p 约需 39s、720p 约需 150s;另有面向消费级 GPU 的 1.3B 模型。文章还介绍了 guide_scale、shift 和 steps 等可调参数。

    推荐理由:文章同时给出 Wan2.1 的文本生视频与图像生视频 API 入口、分辨率和参数设置,便于按实验速度与输出分辨率选择模型版本。

1月20日周一
  1. ByteDance Seed · 音频与多模态交互73

    豆包实时语音大模型上线并全量开放,端到端语音对话支持随时打断

    豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。

    推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。

11月21日周四
10月22日周二
10月3日周四
8月2日周五
  1. Replicate · 模型与制作实践75

    FLUX.1 首次体验:文字、材质与复杂构图表现

    Replicate 介绍 FLUX.1,这款可根据文字生成图像的新 AI 模型采用 flow matching,而非扩散模型。文章通过文字渲染、玻璃花朵、复杂场景和艺术风格等提示词,观察其在文字、光影、材质与构图方面的表现。文中所有图片均使用面向速度和本地执行优化的 FLUX.1 [schnell] 生成,可在 Replicate 上试用。

    推荐理由:文章通过多组提示词展示 FLUX.1 在文字渲染、光影材质和复杂构图上的表现,并呈现 flow matching 带来的流动感审美。

8月1日周四
  1. Replicate · 模型与制作实践87

    FLUX.1 开源图像生成模型上线 Replicate API

    Black Forest Labs 开发的 FLUX.1 开源图像生成模型已在 Replicate 提供,可通过浏览器或一行代码调用。模型分为 FLUX.1 [pro]、[dev] 和 [schnell],分别面向高性能、非商业应用和本地开发;文中列出的单图价格为 $0.055、$0.030 和 0.003。

    推荐理由:文章并列介绍 FLUX.1 的三种版本、适用场景与单图价格,便于比较云端调用、非商业应用和本地开发的选择。

7月12日周五