跳到正文

#产品更新

今日 1 条
今天10月3日周六
10月2日周五
  1. NVIDIA Blog72

    NVIDIA DGX Spark 推出 64GB 配置,支持双机集群扩展本地 AI

    NVIDIA DGX Spark 将推出 64GB 统一内存配置,支持在设备上运行最多 100B 参数模型,起售价为 $4,999。两台设备可通过 NVIDIA Sync Cluster Assistant 组建 128GB 集群,将模型支持范围扩展至最多 200B 参数;NVIDIA 在 Qwen 3.8 27B 测试中称,双机性能最高达到单机的 1.7x。

    推荐理由:64GB 配置提供了从单机本地智能体到双机集群的渐进路径,适合评估本地推理、长上下文和多智能体工作流的硬件需求。

  2. ComfyUI · 工作流与实践86

    ComfyUI 发布 Comfy Agent,现已登陆 Comfy Cloud

    ComfyUI 发布 Comfy Agent,现已向所有 Comfy Cloud 用户开放,并计划在几周后进入 Comfy Desktop。它可在画布中根据描述构建、运行和迭代工作流,支持比较模型、解释工作流、批量处理 20 张图片,并允许最多 5 个并行聊天。Comfy Agent 目前处于 beta 阶段,可领取免费初始聊天次数,并使用已有的 Comfy Credits。

    推荐理由:Comfy Agent 将工作流搭建、运行、迭代与错误处理放进对话协作,呈现了智能体介入 ComfyUI 创作流程的具体方式。

10月1日周四
  1. Luma · 创作产品与实践81

    Luma 上线 Variants,支持静态广告多尺寸多语言生成

    Luma 上线 Variants,用户上传一份已批准的静态广告后,可生成不同版式和语言的广告版本。产品提供 Story 9:16、Portrait 4:5、Square 1:1、Medium Rectangle 6:5 和 Widescreen 16:9 五种标准版式,并返回每种尺寸与语言组合。用户可预览各版本、重新生成不合适的版本,下载成品或导出到 Luma Canvas 审核。

    推荐理由:Luma Variants把已批准静态广告的尺寸适配、文案翻译和交付整合到同一流程,适合参考多市场广告批量制作。

  2. 可灵 · 模型与创作实践89

    可灵 Kling 4.0 进入早期访问,支持原生 30 秒生成与多参考控制

    可灵 Kling 4.0 进入早期访问,支持单次生成最长 30 秒视频、最多 15 个参考素材和最多 10 个关键帧。Kling 4.0 Flash 将于 9 月 28 日向 Ultra Yearly 订阅者开放,Kling 4.0 计划在 10 月扩大开放。新版本还加入音画同步、21:9 超宽画幅和更精细的视频编辑,10-bit HDR 输出将在后续提供。

    推荐理由:这次更新把长视频生成、多参考控制和时间线工作流放在同一升级中,适合比较连续叙事与商品广告制作的可控性。

  3. ComfyUI · 工作流与实践86

    Comfy API 上线,将 ComfyUI 工作流部署为生产 API

    Comfy API 面向付费 Comfy plan 用户上线,可将 ComfyUI 工作流及其 custom nodes、LoRAs、models 和 Python dependencies 打包为可自动扩缩的 API endpoint。

    推荐理由:它把 ComfyUI 工作流的环境封装、版本固定与弹性部署合并进同一流程,适合评估从本地创作到产品化 API 的迁移成本。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 发布 SynthID Bio,为 AI 设计蛋白质加入可验证水印

    Google DeepMind 发布 SynthID Bio,可将不可感知的签名嵌入蛋白质序列或预测的3D结构,并在合成后的实体蛋白质上验证来源。实验覆盖 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标,水印设计保持了未加水印版本的命中率、结合亲和力和天然序列多样性。Google DeepMind 同时开放方法论文、代码、体外数据和研究权重。

    推荐理由:文章同时给出蛋白序列与3D结构水印的实现路径、实验边界和开放内容,便于判断其在生物安全审查与科研数据库溯源中的落地位置。

  2. Hugging Face Blog77

    Hugging Face 发布 Open TTS Leaderboard,支持多语言与语音克隆评测

    Hugging Face 发布 Open TTS Leaderboard,用客观指标评估开放源码 TTS 模型的可懂度、速度和说话人相似度,并覆盖多语言与语音克隆场景。排行榜使用 WER/CER、RTFx、TTFA 和 SIM,支持在 H200 GPU 与 CPU 上比较流式性能,并提供 Listen 标签页供用户试听和投票。

    推荐理由:该排行榜把 WER/CER、推理速度和说话人相似度纳入统一评测,并保留试听投票,便于比较开放源码 TTS 在多语言和流式场景中的取舍。

9月29日周二
  1. Canva · 创作产品77

    Canva 为 Meta 的 Muse 接入 AI 连接器,支持对话生成设计

    Canva 宣布为 Meta 的个人 AI 智能体 Muse 接入 Canva 连接器,用户可在对话中创建设计,并使用品牌字体、颜色和素材。连接器还支持搜索设计库、导出文件,生成的 Canva 设计可继续编辑;该功能面向美国和加拿大用户开放。

    推荐理由:这项连接把对话式规划与品牌素材、设计库搜索和可编辑设计串起来,可参考其在智能体创作工作流中的分工方式。

9月23日周三
  1. ComfyUI · 工作流与实践75

    Comfy 发布 Comfy Router,用一个 API 调用前沿图像视频模型

    Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。

    推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。

9月22日周二
9月21日周一
9月17日周四
9月16日周三
9月15日周二
  1. Luma · 创作产品与实践41

    AI-first 制作团队的 7 个 StudioBinder 替代方案

    面向 AI-first 制作团队,7 个 StudioBinder 替代方案覆盖素材生成、编辑、审片协作与传统拍摄规划。Luma Agents 可从创意到交付持续保留视频、图像、音频和文案的创作上下文,适合产品发布、社交内容及无实体拍摄的广告变体。AI-first 工具可在几天内实施并立即开始创作,还能在保留其他内容的同时修改单一元素。

9月10日周四
9月8日周二
  1. OpenAI News60

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,官方称生成结果能更好地体现用户的想法。

    推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与生成定位,可据此判断参考图生图能力在创作流程中的位置。

9月5日周六
  1. ComfyUI · 工作流与实践22

    ComfyUI 推出 Forward Deployed Creatives 企业服务

    ComfyUI 推出 Forward Deployed Creatives(FDCT)企业服务,由 Comfy 专家嵌入企业团队,在客户自己的 Comfy Enterprise 环境中构建工作流,并按 Validate、Build、Enable、Own 四个阶段交付。该服务强调赋能而非代做,以团队能否自行修改工作流作为衡量标准,最终工作流归企业所有。

9月3日周四
  1. Canva · 创作产品75

    Canva Visual Suite 推出 100 多项更新,覆盖 Docs、Sheets、Whiteboards、Presentations 和 Websites

    Canva宣布 Visual Suite 自年初推出 100 多项更新,覆盖 Docs、Sheets、Whiteboards、Presentations 和 Websites,并已向全球所有 Canva 用户陆续开放。

    推荐理由:材料展示了 Canva 如何把白板、文档、表格、演示和网站串成连续项目流程,可用于评估一站式创作与协作工具的迁移价值。

9月2日周三
8月28日周五
  1. ComfyUI · 工作流与实践66

    Gemini Omni 1.1 Flash 接入 ComfyUI:支持视频生成、编辑与 4K 输出

    Gemini Omni 1.1 Flash 通过 Partner Nodes 在 ComfyUI 上线,封装在 Gemini Video Omni 节点中,可从模型下拉菜单选择 Omni Flash 1.1,在单个节点内完成文生视频、图生视频、参考生视频、视频编辑和场景延展。

    推荐理由:ComfyUI 接入 Gemini Omni 1.1 Flash 的节点参数与提示词写法,可供视频生成与编辑工作流选型参考。

  2. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言标签页上的首个印度语言。

    推荐理由:公开 ASR 榜单首次纳入印地语与印度英语,并公开说话人元数据与格参考,可用于判断语音模型的地域偏差。

8月26日周三
8月25日周二
  1. Hugging Face Blog71

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 管线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点类型与多端点 API 用法,可据此判断多步生成管线如何一次搭好并直接调用。

8月24日周一
8月21日周五
  1. Black Forest Labs · 图像与视频71

    Black Forest Labs 发布 FLUX Video Upscale,支持最高原生 4K

    Black Forest Labs 推出 FLUX Video Upscale,作为独立的 FLUX Tool 和 endpoint,可将 480p 起的视频重新生成到最高原生 4K,并原生理解 FLUX 3 的输出,修复通用放大器容易遗漏的模糊人脸、水面和草地纹理网格伪影。

    推荐理由:官方给出两种模式的价格与倍率差异,便于按交付分辨率在成本与修复细节之间取舍。

8月20日周四
  1. Diffusers · Releases62

    Diffusers 0.40.0 发布:新增 LTX-2.5、MiniMax-H3 等管线并支持张量并行

    Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。

    推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。

8月19日周三
  1. ComfyUI · 工作流与实践85

    ComfyUI 开源本地 Comfy MCP,连接 Claude、Codex 和 Cursor

    ComfyUI 开源 Comfy MCP 本地连接,让 Claude、Codex、Cursor 等 Agent 连接本机 ComfyUI,并与 Cloud MCP 统一。Agent 可读取本机 GPU、已安装节点和磁盘模型,判断模型是否适合本地运行,自动完成模型与工作流配置并执行任务。

    推荐理由:它把本地 GPU、节点和模型检查接入智能体工作流,可帮助创作者在下载模型前判断硬件适配,并减少本地部署与工作流配置的手工步骤。

8月18日周二
  1. Hugging Face Blog88

    Sentence Transformers v6.0 引入 MultiVectorEncoder,支持 Late Interaction 检索

    Sentence Transformers v6.0 新增 MultiVectorEncoder,将 PyLate、Stanford-NLP ColBERT 和 ColPali 系列模型统一到同一 API,支持基于 MaxSim 的多向量检索。文章展示了文本、页面图像、音频和视频的编码与检索方法,并比较了索引存储、Token Pooling、检索后重排和多种向量数据库方案。

    推荐理由:文章用代码串起模型加载、MaxSim 评分、索引与多模态检索,便于评估 token 级匹配在质量和存储成本之间的取舍。

8月14日周五
8月12日周三