跳到正文

#Agent

今日 3 条
9月22日周二
  1. Luma · 创作产品与实践52

    Luma 的 2026 年房地产房源与虚拟布置 AI 照片提示词指南

    Luma 介绍了面向房地产房源和虚拟布置的六部分 AI 照片提示词结构,涵盖房间类型、风格、材质、色彩、光线和氛围。文章还给出客厅、厨房、卧室、外景、物体移除和天空替换示例,并讨论建筑结构保留、MLS 对 AI 图像的披露要求,以及 Luma Agents、Uni-1、Layers、Ray 3.2 和 Skills 在房源营销工作流中的应用。

9月21日周一
9月19日周六
9月17日周四
9月16日周三
9月15日周二
9月10日周四
9月3日周四
  1. Hugging Face Blog66

    用 TRL 和 OpenEnv 训练编码模型画水彩

    作者用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型通过 p5.brush 写 JavaScript 画水彩的思路,参考池、RL 环境、训练脚本和训练好的模型全部开源,整条流程跑在 Hugging Face 上。

    推荐理由:完整公开了一套用 RL 训练模型写代码作画的流程与全部产物,可借鉴其奖励设计与环境搭建思路。

9月2日周三
9月1日周二
  1. World Labs · 空间智能与世界模型85

    World Labs 发布世界模型 Atlas,原生支持文本、图像、视频与 3D

    World Labs 发布下一代世界模型 Atlas,这是一个从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频和 3D,所有输入被组合进共享的空间上下文。

    推荐理由:Atlas 把相机位姿与 3D 深度作为原生输入,读者可据此判断世界模型在可控生成与稀疏重建上的路线差异。

8月25日周二
  1. Hugging Face Blog71

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 管线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点类型与多端点 API 用法,可据此判断多步生成管线如何一次搭好并直接调用。

8月24日周一
8月21日周五
  1. Google DeepMind62

    Google DeepMind 与 Fenris Creations 合作,用 EVE 宇宙推进通用游戏智能体研究

    Google DeepMind 宣布与 EVE 宇宙开发商 Fenris Creations 建立研究合作,把 EVE Online、EVE Vanguard 和 EVE Frontier 作为研究持续学习、记忆、长时程规划和复杂多智能体动态的环境。

    推荐理由:DeepMind 公开了游戏智能体从离线沙盒到持久世界的推进路径,可据此判断通用游戏 Agent 的落地节奏与安全边界。

8月20日周四
  1. ComfyUI · 工作流与实践77

    ComfyUI 与 MiniMax 发起 H3 音画同步社区挑战赛

    ComfyUI 与 MiniMax 团队发起 H3 音画同步社区挑战赛,要求参赛者用 H3 在同一轮生成视频和同步音频,作品最长 90 秒且每人限投一次。参赛者还需提交实际的 ComfyUI `.json` 工作流,活动支持本地运行或 Comfy Cloud,9/2 公布结果。

    推荐理由:挑战同时要求 H3 在同一轮生成音频与视频,并提交可复现的 ComfyUI 工作流,呈现了音画同步创作的实践约束。

8月19日周三
  1. ComfyUI · 工作流与实践85

    ComfyUI 开源本地 Comfy MCP,连接 Claude、Codex 和 Cursor

    ComfyUI 开源 Comfy MCP 本地连接,让 Claude、Codex、Cursor 等 Agent 连接本机 ComfyUI,并与 Cloud MCP 统一。Agent 可读取本机 GPU、已安装节点和磁盘模型,判断模型是否适合本地运行,自动完成模型与工作流配置并执行任务。

    推荐理由:它把本地 GPU、节点和模型检查接入智能体工作流,可帮助创作者在下载模型前判断硬件适配,并减少本地部署与工作流配置的手工步骤。

8月14日周五
8月10日周一
  1. Hugging Face Blog90

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。

    推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。

8月8日周六
  1. ComfyUI · 工作流与实践78

    Wan Animate 2 在 ComfyUI 中原生支持

    Wan Animate 2 已在 ComfyUI 中原生支持,该模型采用端到端角色动画框架,驱动视频直接进入重新设计的 Diffusion Transformer,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。

    推荐理由:ComfyUI 原生接入 Wan Animate 2,读者可据此判断角色动画工作流的节点改动与实时化路径。

8月5日周三
  1. ByteDance Seed · 音频与多模态交互83

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,已在豆包 App 全量上线

    字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。

    推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层具身推理模型,可理解连续视频、编排多步任务并把动作执行交给底层 VLA 模型,同时原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机协作的能力边界和开放入口,可用于判断机器人上层编排模型的选型。

7月28日周二
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次让模型控制完整人形机器人,实现从脚到指尖的全身控制、灵巧操作与多机器人协作。

    推荐理由:Gemini Robotics 2 把 VLA 控制从上半身扩展到全身并支持多机器人协作,可据此判断具身智能的模型分层与端侧部署路线。

7月23日周四
  1. Black Forest Labs · 图像与视频74

    Black Forest Labs 发布 FLUX-mimic:基于 FLUX 3 的视频-动作模型

    Black Forest Labs 宣布 FLUX 3 早期版本已在机器人上运行,并与 mimic 合作推出视频-动作模型 FLUX-mimic,该模型基于 FLUX 3 骨干,从视频预测路径的中间特征解码动作。

    推荐理由:官方披露 FLUX 3 早期版本与 mimic 合作落地机器人,可据此判断多模态基座向物理 AI 延伸的路线与部署约束。

7月21日周二
7月1日周三
6月9日周二
  1. Google DeepMind73

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 的无编码器架构与 16GB 本地运行门槛,为端侧多模态与智能体选型提供了新的权衡参考。

6月4日周四
  1. ElevenLabs · 音频创作85

    ElevenLabs 在 ElevenCreative 推出 Flows Agent

    ElevenLabs 在 ElevenCreative 推出 Flows Agent,将对话式 AI 助手接入 Flows 画布,自动选择模型、创建并连接节点,执行图像、视频和音频生成流程。它支持通过对话修改已有流程,并可在高成本生成前请求确认;复杂工作流也能在后台运行,现已在 ElevenCreative 提供使用。

    推荐理由:它把多模态节点编排、生成执行和变体迭代合并到对话入口,可用于判断创作流程如何降低试错与额度控制成本。

5月28日周四
  1. ElevenLabs · 音频创作67

    ElevenLabs与希腊政府签署语音 AI 战略合作备忘录

    ElevenLabs与希腊政府签署战略合作备忘录,将探索把语音 AI 应用于公共服务、数字旅游和希腊语言遗产保护。双方计划先从克里特方言开始,并研究在gov.gr及政府呼叫中心提供多语言服务;希腊政府数字门户目前提供超过2,200项服务。

    推荐理由:三条合作路径覆盖公共服务、旅游和方言保存,可帮助判断语音 AI 走向政府场景的部署边界与合作模式。

5月19日周二
  1. ElevenLabs · 音频创作62

    ElevenLabs推出教授语音AI支持计划与 Albert Einstein 互动学习体验

    ElevenLabs推出面向教授的语音AI支持计划,并上线基于 Albert Einstein 声音与档案的互动学习体验。教授可免费使用 Pro tier,并为特定课程和项目向学生提供限时访问。Albert Einstein 的重现声音已在 ElevenReader 和 ElevenLabs Agents 中提供,支持英语、德语、法语、巴西葡萄牙语和西班牙语。

    推荐理由:同时覆盖教育者获取权限与历史声音互动两端,为课堂语音工具的接入方式和学习体验设计提供了可参考案例。

5月18日周一
5月17日周日
5月16日周六
5月11日周一
  1. Runway · 研究与模型71

    Runway 发布实时视频生成模型 Runway Characters

    Runway 推出基于 GWM-1 的实时视频生成模型 Runway Characters,由单张参考图生成可对话角色,处理眼神、口型同步、表情与说话和倾听时的手势,并能在长对话中维持质量。

    推荐理由:Runway 把实时逐帧生成与交互控制讲成产品路线,可据此判断世界模型在角色对话与仿真训练中的落地边界。

5月7日周四