Google DeepMind 发布手语翻译模型 SL2T 1.0
Google DeepMind 发布手语到文本模型 SL2T 1.0,支持在 Gboard 和 Live Transcribe 中将 ASL 翻译为英文,首发于 Pixel 11,且无需额外费用。
推荐理由:这次发布同时给出模型训练规模、FLEURS-ASL结果与隐私处理路径,便于判断手语翻译走向产品化时的能力边界。
按模型发布浏览相关 AIGC 创作资讯,保留原始出处、阶段与证据。
Google DeepMind 发布手语到文本模型 SL2T 1.0,支持在 Gboard 和 Live Transcribe 中将 ASL 翻译为英文,首发于 Pixel 11,且无需额外费用。
推荐理由:这次发布同时给出模型训练规模、FLEURS-ASL结果与隐私处理路径,便于判断手语翻译走向产品化时的能力边界。
ComfyUI 在 LTX-2.5 发布当天提供支持,该模型是 LTX 最新开放视频模型,权重可下载并在本地 GPU 运行,也可通过 Partner Nodes 使用托管版本。
推荐理由:LTX-2.5 在 ComfyUI 的 Day-0 支持给出了开放权重与托管两条路径,可据此判断本地视频生成的可控性与部署成本。
Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。
推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。
字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。
推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。
MiniMax H3 今日发布开放权重,并在 ComfyUI 中获得 Day-0 原生支持,可接收文本、图像、视频或音频,生成带立体声的 2K、最长 15 秒视频。
推荐理由:文章把 H3 的多模态输入、原生立体声和 ComfyUI 本地运行路径放在一起,并给出显存缩减与工作流入口,便于评估视频创作部署成本。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层具身推理模型,可理解连续视频、编排多步任务并把动作执行交给底层 VLA 模型,同时原生调用 Google Search 等工具。
推荐理由:官方给出视频理解、任务编排与多机协作的能力边界和开放入口,可用于判断机器人上层编排模型的选型。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循、结构感知更好,人声更具表现力和情感且发音改善,并可更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与节奏控制上的具体改进方向,可供音乐生成工具选型参考。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次让模型控制完整人形机器人,实现从脚到指尖的全身控制、灵巧操作与多机器人协作。
推荐理由:Gemini Robotics 2 把 VLA 控制从上半身扩展到全身并支持多机器人协作,可据此判断具身智能的模型分层与端侧部署路线。
NVIDIA 发布 Cosmos-H-Dreams,将 Cosmos-H-Surgical-Simulator 的手术世界模型能力蒸馏为可由机器人动作控制的实时生成式模拟器。
推荐理由:文章展示了如何通过蒸馏和流式推理把手术世界模型用于实时闭环模拟,便于理解其在策略评估与合成数据生成中的工作流。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款 Flash 系列的 token 效率、价格与基准对比,可用于智能体选型和成本估算。
字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,并已在火山方舟体验中心上线。模型支持一条 prompt 编排对白、音效与环境声,时间控制精度达 100ms,支持零样本音色生成与参考音频延展,单次可生成约 2 分钟音频并继续延长以保持角色一致性。
推荐理由:官方披露了统一建模多要素音频、100ms 时间控制与 20+ 语种等能力,可据此判断其在配音与多语种内容生产中的可用边界。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款模型的延迟、单价与限制条件都写明了,可据此判断图像到视频链路的选型与成本。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方披露了连续语音翻译的延迟取舍与多产品开放节奏,可据此判断实时语音翻译的选型与接入时机。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。
FLUX VTO 公开发布,主打面向大规模商品目录的虚拟试衣,单次生成耗时低于 4 秒。模型可保留人物身份以及服装的 logo、印花、缝线和五金细节,支持一次应用最多四件衣物并进行叠穿。精准的身体和服装尺码仍在演进,输出更适合用于视觉造型参考;默认政策不支持泳装和内衣。
推荐理由:原文同时给出速度、商品细节保真和多件叠穿能力,可帮助评估虚拟试衣在商品目录与交互购物中的落地条件。
ElevenLabs 发布 Music v2 音乐生成模型,提升人声、器乐、编曲和多语言支持,并支持更复杂的歌曲结构。模型支持按片段局部重绘、分段构建完整歌曲,以及在同一首歌中处理多种曲风、快速说唱和非音乐音效。
推荐理由:Music v2 将局部重绘、分段作曲和多语言演唱整合到音乐生成流程,便于比较创作者、品牌与开发者的不同接入方式。
Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。
推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。
Google DeepMind 发布 Gemini 3.5 系列,首发 Gemini 3.5 Flash,面向智能体与编码等复杂长程任务。
推荐理由:原文给出 Gemini 3.5 Flash 的智能体、编码与多模态基准,以及 API 和产品入口,便于比较模型能力与落地渠道。
字节 Seed 正式发布新一代 3D 生成大模型 Seed3D 2.0,围绕几何精度和材质质量做架构升级,官方称在几何生成、纹理材质生成两项核心指标上均取得 SOTA。
推荐理由:官方披露了两阶段 DiT 几何生成与统一 PBR 材质方案,可据此判断 3D 生成在仿真与部件级建模上的可用边界。
Google 推出 Gemini 3.1 Flash TTS,提升语音质量、可控性与表现力,并支持 70+ 语言和原生多说话人对话。模型引入可通过自然语言控制音色、语速和表达方式的音频标签,开发者可在 Gemini API 和 Google AI Studio 预览,企业可通过 Vertex AI 预览,Workspace 用户可在 Google Vids 使用。
推荐理由:音频标签、多人对话和 70+ 语言支持,为评估语音产品的表达控制、全球化覆盖与 API 落地路径提供了具体参照。