跳到正文

全部动态

今日 10 条
9月6日周日
  1. Luma · 创作产品与实践54

    Luma 总结 18 个更接近真实摄影的 AI 图像提示词

    Luma 总结了18个面向写实 AI 图像的提示词示例,强调在描述主体之外,还要明确光线、镜头特征、环境细节、材质反射和自然瑕疵。文章将图像生成定位为起点,建议通过 Layers 进行局部编辑,并由 Luma Agents 在概念、修改、变体生成和最终交付之间保持创作上下文。

  2. Luma · 创作产品与实践51

    Luma提供20组平面设计AI提示词,覆盖海报、图标与社交媒体图形

    Luma发布一份平面设计指南,提供20组可直接复用的AI提示词,覆盖海报、图标和社交媒体图形。指南总结了由主体、格式、风格、品牌线索、尺寸、情绪和文字组成的七要素公式,并给出A3、300 DPI、1080x1080和1080x1920等规格示例。文章还强调将生成素材作为可编辑的初稿,通过局部元素修改、品牌模板和多市场本地化完成后续制作。

9月5日周六
  1. ComfyUI · 工作流与实践22

    ComfyUI 推出 Forward Deployed Creatives 企业服务

    ComfyUI 推出 Forward Deployed Creatives(FDCT)企业服务,由 Comfy 专家嵌入企业团队,在客户自己的 Comfy Enterprise 环境中构建工作流,并按 Validate、Build、Enable、Own 四个阶段交付。该服务强调赋能而非代做,以团队能否自行修改工作流作为衡量标准,最终工作流归企业所有。

9月4日周五
9月3日周四
  1. Hugging Face Blog66

    用 TRL 和 OpenEnv 训练编码模型画水彩

    作者用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型通过 p5.brush 写 JavaScript 画水彩的思路,参考池、RL 环境、训练脚本和训练好的模型全部开源,整条流程跑在 Hugging Face 上。

    推荐理由:完整公开了一套用 RL 训练模型写代码作画的流程与全部产物,可借鉴其奖励设计与环境搭建思路。

  2. Canva · 创作产品75

    Canva Visual Suite 推出 100 多项更新,覆盖 Docs、Sheets、Whiteboards、Presentations 和 Websites

    Canva宣布 Visual Suite 自年初推出 100 多项更新,覆盖 Docs、Sheets、Whiteboards、Presentations 和 Websites,并已向全球所有 Canva 用户陆续开放。

    推荐理由:材料展示了 Canva 如何把白板、文档、表格、演示和网站串成连续项目流程,可用于评估一站式创作与协作工具的迁移价值。

9月2日周三
9月1日周二
  1. World Labs · 空间智能与世界模型85

    World Labs 发布世界模型 Atlas,原生支持文本、图像、视频与 3D

    World Labs 发布下一代世界模型 Atlas,这是一个从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频和 3D,所有输入被组合进共享的空间上下文。

    推荐理由:Atlas 把相机位姿与 3D 深度作为原生输入,读者可据此判断世界模型在可控生成与稀疏重建上的路线差异。

  2. ComfyUI · 工作流与实践78

    Trellis.2 与 Pixal3D 原生接入 ComfyUI

    ComfyUI 将 Trellis.2 和 Pixal3D 两个 3D 生成模型做进核心节点,无需自定义节点、编译 CUDA 扩展或降级 PyTorch,并移除了原流程中限制商用的 nvdiffrast 与 nvdiffrec 依赖。

    推荐理由:ComfyUI 原生接入两个开源 3D 生成模型并重建网格后处理与 PBR 贴图链路,可据此判断本地 3D 资产生产流程的可行边界。

8月28日周五
  1. ComfyUI · 工作流与实践66

    Gemini Omni 1.1 Flash 接入 ComfyUI:支持视频生成、编辑与 4K 输出

    Gemini Omni 1.1 Flash 通过 Partner Nodes 在 ComfyUI 上线,封装在 Gemini Video Omni 节点中,可从模型下拉菜单选择 Omni Flash 1.1,在单个节点内完成文生视频、图生视频、参考生视频、视频编辑和场景延展。

    推荐理由:ComfyUI 接入 Gemini Omni 1.1 Flash 的节点参数与提示词写法,可供视频生成与编辑工作流选型参考。

  2. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言标签页上的首个印度语言。

    推荐理由:公开 ASR 榜单首次纳入印地语与印度英语,并公开说话人元数据与格参考,可用于判断语音模型的地域偏差。

  3. ComfyUI · 工作流与实践80

    Comfy 成为 MiniMax H3 商业许可证首个官方转售商

    Comfy 宣布成为 MiniMax H3 商业使用许可证的首个官方转售商,面向在自有硬件本地运行 H3 的商业创作场景。许可证覆盖生成内容的商业权利、微调与 LoRA 训练,以及客户和下游项目;但不包含运营向他人出售 H3 访问权限的推理平台或市场。

    推荐理由:这项授权安排明确了 H3 本地商业使用、LoRA 微调和客户项目的许可边界,也提示平台化售卖访问权限不在覆盖范围内。

8月27日周四
8月26日周三
8月25日周二
  1. ComfyUI · 工作流与实践87

    Wan 3.0 接入 ComfyUI,支持原生 30 秒视频与 Omni-Reference 控制

    Alibaba 的 Wan 3.0 已接入 ComfyUI,支持原生生成最长 30 秒的视频,并提供 Omni-Reference 控制。模型支持 480p、720p 和 1080p,可使用最多 10 张图片、5 个视频和 5 段音频等参考素材,还支持视频编辑与扩展。使用这些功能需将 ComfyUI 更新至 v0.33.4,或访问 Comfy Cloud。

    推荐理由:原文同时给出时长、参考素材和分辨率选项,便于评估 Wan 3.0 在长镜头、多素材控制与低成本草稿中的工作流价值。

  2. Hugging Face Blog71

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 管线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点类型与多端点 API 用法,可据此判断多步生成管线如何一次搭好并直接调用。

8月24日周一
8月21日周五
  1. Google DeepMind62

    Google DeepMind 与 Fenris Creations 合作,用 EVE 宇宙推进通用游戏智能体研究

    Google DeepMind 宣布与 EVE 宇宙开发商 Fenris Creations 建立研究合作,把 EVE Online、EVE Vanguard 和 EVE Frontier 作为研究持续学习、记忆、长时程规划和复杂多智能体动态的环境。

    推荐理由:DeepMind 公开了游戏智能体从离线沙盒到持久世界的推进路径,可据此判断通用游戏 Agent 的落地节奏与安全边界。

  2. Black Forest Labs · 图像与视频71

    Black Forest Labs 发布 FLUX Video Upscale,支持最高原生 4K

    Black Forest Labs 推出 FLUX Video Upscale,作为独立的 FLUX Tool 和 endpoint,可将 480p 起的视频重新生成到最高原生 4K,并原生理解 FLUX 3 的输出,修复通用放大器容易遗漏的模糊人脸、水面和草地纹理网格伪影。

    推荐理由:官方给出两种模式的价格与倍率差异,便于按交付分辨率在成本与修复细节之间取舍。

8月20日周四
  1. Diffusers · Releases62

    Diffusers 0.40.0 发布:新增 LTX-2.5、MiniMax-H3 等管线并支持张量并行

    Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。

    推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。

  2. ComfyUI · 工作流与实践77

    ComfyUI 与 MiniMax 发起 H3 音画同步社区挑战赛

    ComfyUI 与 MiniMax 团队发起 H3 音画同步社区挑战赛,要求参赛者用 H3 在同一轮生成视频和同步音频,作品最长 90 秒且每人限投一次。参赛者还需提交实际的 ComfyUI `.json` 工作流,活动支持本地运行或 Comfy Cloud,9/2 公布结果。

    推荐理由:挑战同时要求 H3 在同一轮生成音频与视频,并提交可复现的 ComfyUI 工作流,呈现了音画同步创作的实践约束。

8月19日周三
  1. ComfyUI · 工作流与实践85

    ComfyUI 开源本地 Comfy MCP,连接 Claude、Codex 和 Cursor

    ComfyUI 开源 Comfy MCP 本地连接,让 Claude、Codex、Cursor 等 Agent 连接本机 ComfyUI,并与 Cloud MCP 统一。Agent 可读取本机 GPU、已安装节点和磁盘模型,判断模型是否适合本地运行,自动完成模型与工作流配置并执行任务。

    推荐理由:它把本地 GPU、节点和模型检查接入智能体工作流,可帮助创作者在下载模型前判断硬件适配,并减少本地部署与工作流配置的手工步骤。

8月18日周二
  1. Hugging Face Blog88

    Sentence Transformers v6.0 引入 MultiVectorEncoder,支持 Late Interaction 检索

    Sentence Transformers v6.0 新增 MultiVectorEncoder,将 PyLate、Stanford-NLP ColBERT 和 ColPali 系列模型统一到同一 API,支持基于 MaxSim 的多向量检索。文章展示了文本、页面图像、音频和视频的编码与检索方法,并比较了索引存储、Token Pooling、检索后重排和多种向量数据库方案。

    推荐理由:文章用代码串起模型加载、MaxSim 评分、索引与多模态检索,便于评估 token 级匹配在质量和存储成本之间的取舍。

8月14日周五
8月12日周三
  1. ComfyUI · 工作流与实践80

    ComfyUI 首日支持 LTX-2.5 开放视频模型

    ComfyUI 在 LTX-2.5 发布当天提供支持,该模型是 LTX 最新开放视频模型,权重可下载并在本地 GPU 运行,也可通过 Partner Nodes 使用托管版本。

    推荐理由:LTX-2.5 在 ComfyUI 的 Day-0 支持给出了开放权重与托管两条路径,可据此判断本地视频生成的可控性与部署成本。

8月11日周二
  1. Hugging Face Blog65

    NVIDIA 发布 Magpie TTS 多语言开源权重模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖与 TTFA 实测数据,可供语音 Agent 选型时比较自部署延迟与可控性。

8月10日周一
  1. Hugging Face Blog90

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。

    推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。