跳到正文

#Agent

今日 0 条
10月2日周五
  1. NVIDIA Blog72

    NVIDIA DGX Spark 推出 64GB 配置,支持双机集群扩展本地 AI

    NVIDIA DGX Spark 将推出 64GB 统一内存配置,支持在设备上运行最多 100B 参数模型,起售价为 $4,999。两台设备可通过 NVIDIA Sync Cluster Assistant 组建 128GB 集群,将模型支持范围扩展至最多 200B 参数;NVIDIA 在 Qwen 3.8 27B 测试中称,双机性能最高达到单机的 1.7x。

    推荐理由:64GB 配置提供了从单机本地智能体到双机集群的渐进路径,适合评估本地推理、长上下文和多智能体工作流的硬件需求。

  2. Hugging Face Blog70

    AutoSynthData 将模型失败转为企业智能体训练数据

    ServiceNow CoreAI介绍 AutoSynthData,它利用目标模型的失败和更强教师模型的成功,生成并验证适用于企业环境的智能体训练任务。该流程通过可执行性检查、正负验证、修复和批次覆盖审查筛选数据,并将训练目标移向模型仍然困难的能力边界。

    推荐理由:文章把企业智能体训练拆成失败诊断、任务生成、环境执行和正负验证闭环,为构建可复用且难度贴合的 SFT 数据流程提供了具体参考。

  3. ComfyUI · 工作流与实践86

    ComfyUI 发布 Comfy Agent,现已登陆 Comfy Cloud

    ComfyUI 发布 Comfy Agent,现已向所有 Comfy Cloud 用户开放,并计划在几周后进入 Comfy Desktop。它可在画布中根据描述构建、运行和迭代工作流,支持比较模型、解释工作流、批量处理 20 张图片,并允许最多 5 个并行聊天。Comfy Agent 目前处于 beta 阶段,可领取免费初始聊天次数,并使用已有的 Comfy Credits。

    推荐理由:Comfy Agent 将工作流搭建、运行、迭代与错误处理放进对话协作,呈现了智能体介入 ComfyUI 创作流程的具体方式。

  4. ComfyUI · 工作流与实践77

    Comfy Agent 与 852話 Hakoniwa 如何创作动画短片《YUI》

    Comfy Agent 与 AI 动画艺术家 852話 Hakoniwa 共同完成了首部使用 Comfy Agent 创作的动画短片《YUI》。项目最终成片时长为 4:20,主要使用 Seedance 2.5 制作正片、MiniMax H3 制作幕后视频,并比较了 Wan 等视频模型。

    推荐理由:文章拆解了从角色设计、分镜准备到镜头重生成、模型比较和一致性检查的流程,并给出成本与工时参考。

10月1日周四
9月30日周三
  1. ElevenLabs · 音频创作73

    ElevenLabs完成$300 million员工要约收购,估值升至$22 billion

    ElevenLabs完成$300 million员工要约收购,估值达到$22 billion,是其2026年2月Series D估值的两倍。公司称企业客户已贡献55%的收入,ElevenAgents每周处理超过15 million次对话,较2月增长3x;其语音智能体平均比聊天智能体快31%解决问题。

    推荐理由:企业收入占比、智能体处理量和多渠道部署数据,提供了观察语音智能体商业化进展的具体参照。

9月29日周二
  1. Canva · 创作产品77

    Canva 为 Meta 的 Muse 接入 AI 连接器,支持对话生成设计

    Canva 宣布为 Meta 的个人 AI 智能体 Muse 接入 Canva 连接器,用户可在对话中创建设计,并使用品牌字体、颜色和素材。连接器还支持搜索设计库、导出文件,生成的 Canva 设计可继续编辑;该功能面向美国和加拿大用户开放。

    推荐理由:这项连接把对话式规划与品牌素材、设计库搜索和可编辑设计串起来,可参考其在智能体创作工作流中的分工方式。

  2. Luma · 创作产品与实践53

    Luma 2026 年护肤与美妆品牌 AI 提示词指南

    Luma 发布了一份护肤与美妆品牌 AI 提示词指南,提供 15 组覆盖产品图像、社交内容、邮件、广告和视频的提示词结构。指南强调七部分美妆产品图像提示词框架,以及针对 Instagram、TikTok 等平台调整格式和叙事方式。它还介绍了用 Layers 保留既有构图进行局部修改,并提到 Luma Agents、Skills 和 Ray 3.2 在连续创作流程中的应用。

9月28日周一
  1. Hugging Face Blog62

    H 公司发布 Holo4 系列通用电脑操作智能体模型

    H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。

    推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。

  2. ElevenLabs · 音频创作75

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型

    ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。

    推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。

9月24日周四
  1. Black Forest Labs · 图像与视频84

    Black Forest Labs 发布 FLUX 3 Action,开放 7B 机器人动作策略权重

    Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。

    推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。

9月23日周三
  1. ComfyUI · 工作流与实践75

    Comfy 发布 Comfy Router,用一个 API 调用前沿图像视频模型

    Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。

    推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。

9月22日周二
  1. Luma · 创作产品与实践52

    Luma 的 2026 年房地产房源与虚拟布置 AI 照片提示词指南

    Luma 介绍了面向房地产房源和虚拟布置的六部分 AI 照片提示词结构,涵盖房间类型、风格、材质、色彩、光线和氛围。文章还给出客厅、厨房、卧室、外景、物体移除和天空替换示例,并讨论建筑结构保留、MLS 对 AI 图像的披露要求,以及 Luma Agents、Uni-1、Layers、Ray 3.2 和 Skills 在房源营销工作流中的应用。

9月21日周一
9月17日周四
9月16日周三
9月15日周二
9月10日周四
  1. Hugging Face Blog66

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111,Workflow1111 含 73 个节点

    Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。

    推荐理由:用 73 个节点复刻 A1111 全部功能并暴露 REST 与 MCP 接口,可据此判断节点式创作工作流的搭建与复用方式。

9月9日周三
  1. OpenAI News62

    OpenAI 发布 GPT-6 Astra,面向企业工作场景

    OpenAI 发布 GPT-6 Astra,称其是面向企业场景能力最强的模型,具备更强的推理、computer use 以及写作与设计判断能力。目前官方仅给出这一简要介绍,未披露版本细节、开放方式与可用范围。

    推荐理由:OpenAI 官方给出 GPT-6 Astra 的定位与能力方向,可用于判断企业级模型选型与智能体落地的下一步。

9月3日周四
  1. Hugging Face Blog66

    用 TRL 和 OpenEnv 训练编码模型画水彩

    作者用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型通过 p5.brush 写 JavaScript 画水彩的思路,参考池、RL 环境、训练脚本和训练好的模型全部开源,整条流程跑在 Hugging Face 上。

    推荐理由:完整公开了一套用 RL 训练模型写代码作画的流程与全部产物,可借鉴其奖励设计与环境搭建思路。

9月2日周三
9月1日周二
  1. World Labs · 空间智能与世界模型85

    World Labs 发布世界模型 Atlas,原生支持文本、图像、视频与 3D

    World Labs 发布下一代世界模型 Atlas,这是一个从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频和 3D,所有输入被组合进共享的空间上下文。

    推荐理由:Atlas 把相机位姿与 3D 深度作为原生输入,读者可据此判断世界模型在可控生成与稀疏重建上的路线差异。

8月25日周二
  1. Hugging Face Blog71

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 管线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点类型与多端点 API 用法,可据此判断多步生成管线如何一次搭好并直接调用。

8月24日周一
8月21日周五
  1. Google DeepMind62

    Google DeepMind 与 Fenris Creations 合作,用 EVE 宇宙推进通用游戏智能体研究

    Google DeepMind 宣布与 EVE 宇宙开发商 Fenris Creations 建立研究合作,把 EVE Online、EVE Vanguard 和 EVE Frontier 作为研究持续学习、记忆、长时程规划和复杂多智能体动态的环境。

    推荐理由:DeepMind 公开了游戏智能体从离线沙盒到持久世界的推进路径,可据此判断通用游戏 Agent 的落地节奏与安全边界。

8月20日周四
  1. ComfyUI · 工作流与实践77

    ComfyUI 与 MiniMax 发起 H3 音画同步社区挑战赛

    ComfyUI 与 MiniMax 团队发起 H3 音画同步社区挑战赛,要求参赛者用 H3 在同一轮生成视频和同步音频,作品最长 90 秒且每人限投一次。参赛者还需提交实际的 ComfyUI `.json` 工作流,活动支持本地运行或 Comfy Cloud,9/2 公布结果。

    推荐理由:挑战同时要求 H3 在同一轮生成音频与视频,并提交可复现的 ComfyUI 工作流,呈现了音画同步创作的实践约束。

8月19日周三
  1. ComfyUI · 工作流与实践85

    ComfyUI 开源本地 Comfy MCP,连接 Claude、Codex 和 Cursor

    ComfyUI 开源 Comfy MCP 本地连接,让 Claude、Codex、Cursor 等 Agent 连接本机 ComfyUI,并与 Cloud MCP 统一。Agent 可读取本机 GPU、已安装节点和磁盘模型,判断模型是否适合本地运行,自动完成模型与工作流配置并执行任务。

    推荐理由:它把本地 GPU、节点和模型检查接入智能体工作流,可帮助创作者在下载模型前判断硬件适配,并减少本地部署与工作流配置的手工步骤。

8月14日周五
8月10日周一
  1. Hugging Face Blog90

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。

    推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。

8月8日周六
  1. ComfyUI · 工作流与实践78

    Wan Animate 2 在 ComfyUI 中原生支持

    Wan Animate 2 已在 ComfyUI 中原生支持,该模型采用端到端角色动画框架,驱动视频直接进入重新设计的 Diffusion Transformer,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。

    推荐理由:ComfyUI 原生接入 Wan Animate 2,读者可据此判断角色动画工作流的节点改动与实时化路径。

8月5日周三
  1. ByteDance Seed · 音频与多模态交互83

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,已在豆包 App 全量上线

    字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。

    推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。

7月31日周五
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.5 正式发布:单次生成 30 秒、支持多轮延长

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,延续 Seedance 2.0 统一的多模态音视频联合生成架构,重点突破长叙事、多模态参考和编辑能力。

    推荐理由:官方给出 30 秒单次生成、多模态参考与时间戳编辑的具体能力边界,可据此判断长叙事视频工作流的可用性。