Suno推出Speech功能,可生成口播与匹配背景音乐
Suno新增Speech功能,用户输入想法或文字并描述声音和音乐风格后,可生成包含口播和匹配背景音乐的单条音频。该功能仍处于测试阶段,存在口音等问题;Suno尚未说明模型训练方式,相关版权争议仍在持续。
Suno新增Speech功能,用户输入想法或文字并描述声音和音乐风格后,可生成包含口播和匹配背景音乐的单条音频。该功能仍处于测试阶段,存在口音等问题;Suno尚未说明模型训练方式,相关版权争议仍在持续。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
NVIDIA DGX Spark 将推出 64GB 统一内存配置,支持在设备上运行最多 100B 参数模型,起售价为 $4,999。两台设备可通过 NVIDIA Sync Cluster Assistant 组建 128GB 集群,将模型支持范围扩展至最多 200B 参数;NVIDIA 在 Qwen 3.8 27B 测试中称,双机性能最高达到单机的 1.7x。
推荐理由:64GB 配置提供了从单机本地智能体到双机集群的渐进路径,适合评估本地推理、长上下文和多智能体工作流的硬件需求。
彻底舒服了
2026 年建筑师的 AI 渲染工具选择正从试验转向工作流决策,重点比较建筑信息建模集成、画质与设计修改能力;44% 的建筑师已用 AI 制作概念图,74% 计划增加使用。Luma 以 Ray 3.2、图层编辑、场景变换和可重复工作流覆盖从概念图到动画制作;Veras 可直接连接 Revit、SketchUp、Rhino 等六个平台,Enscape 则提供实时渲染与虚拟现实漫游。
2026 年 AI 创意工具指南按从概念到交付的创作流程,盘点 Luma AI、Jasper AI、Canva AI、Midjourney 和 OpusClip。
OpenAI 全球推出 ChatGPT 的虚拟试穿和 Favorites 商品收藏功能,用户可上传自拍、全身照或商品图片,通过购物结果中的 Try On 按钮查看服装和配饰上身效果。两项功能使用 ChatGPT Images 2.5,收藏商品会保存到应用内的 Library,并与试穿图片放在一起。
Luma、Packify.ai、Midjourney 和 ChatGPT 等 AI 工具覆盖 CPG 品牌包装从概念探索、技术制版到营销素材延展的不同环节。Packify.ai 聚焦 dieline、准确排版和 production-ready files,提供 3,000+ dielines 与 5,000+ mockups;Midjourney 更适合前期视觉方向探索。
ComfyUI 发布 Comfy Agent,现已向所有 Comfy Cloud 用户开放,并计划在几周后进入 Comfy Desktop。它可在画布中根据描述构建、运行和迭代工作流,支持比较模型、解释工作流、批量处理 20 张图片,并允许最多 5 个并行聊天。Comfy Agent 目前处于 beta 阶段,可领取免费初始聊天次数,并使用已有的 Comfy Credits。
推荐理由:Comfy Agent 将工作流搭建、运行、迭代与错误处理放进对话协作,呈现了智能体介入 ComfyUI 创作流程的具体方式。
ComfyUI 发起 Comfy Developer Platform Challenge,邀请开发者在两周内将一个付费功能开源为可运行的工作流。参赛作品需使用 Comfy Developer Platform、Comfy Cloud 或 Comfy SDK,附带开源许可和可复现的部署说明,提交截止时间为 10/19 9am PT。
推荐理由:活动将付费创作功能拆解为可复用的开源工作流,并明确部署、复现和评审要求,适合参考开放式创作工具的落地路径。
Luma 上线 Variants,用户上传一份已批准的静态广告后,可生成不同版式和语言的广告版本。产品提供 Story 9:16、Portrait 4:5、Square 1:1、Medium Rectangle 6:5 和 Widescreen 16:9 五种标准版式,并返回每种尺寸与语言组合。用户可预览各版本、重新生成不合适的版本,下载成品或导出到 Luma Canvas 审核。
推荐理由:Luma Variants把已批准静态广告的尺寸适配、文案翻译和交付整合到同一流程,适合参考多市场广告批量制作。
OpenAI 在 Dev Day 宣布让 ChatGPT 承担应用发现、启动和使用,并推出“Sign in with ChatGPT”、企业应用市场及 Dots 智能体。ChatGPT 将根据对话推荐应用,支持交互式扩展面板;Dots 可连接超过 4,000 个应用,企业市场首批有 30 多家合作方。OpenAI 尚未公布类似传统应用商店的计费或收入分成机制。
推荐理由:原文把 ChatGPT 的应用分发、身份层、企业市场与 Dots 串成一套路径,可用于判断 AI 入口如何改变软件发现和调用方式。
OpenAI在Dev Day上披露了Decisions API有限预览,可让模型在预设选项中快速作出决策,并支持图像理解、广泛语言和安全能力。该API被认为与TypeSafe AI面向软件自动化的Jev相似,后者可低成本、高速输出选项概率。QueryStory的演示显示,用Jev监控每次智能体行动的成本为$2.94,而使用frontier LLM为$372。
Google 正在全球 Gemini 聊天中推出 Skills,用于保存和调用特定任务的详细提示词,并取代 Gems。用户可输入“/”加 Skill 名称调用,Gemini 还能从历史对话生成 Skills,并在检测到匹配提示时自动运行;Skills 支持文本文档、PDF 和图片作为参考材料。
推荐理由:这次迁移展示了 Google 如何把可复用提示词、自动触发和多份参考材料组织进 Gemini 的智能体工作流,便于比较不同厂商的 Skills 方向。
Comfy API 面向付费 Comfy plan 用户上线,可将 ComfyUI 工作流及其 custom nodes、LoRAs、models 和 Python dependencies 打包为可自动扩缩的 API endpoint。
推荐理由:它把 ComfyUI 工作流的环境封装、版本固定与弹性部署合并进同一流程,适合评估从本地创作到产品化 API 的迁移成本。
Give your app real-time decision-making with Decisions API, powered by GPT-6 Luna. Define questions and possible answers to classify content, route requests, or choose an agent’s next action. Available in limited preview.
ComfyUI 发布 v0.38.0,新增多项模型支持与 Partner Nodes,并改进 KV cache、Transformer 编译、显存使用和资产扫描。
推荐理由:该版本同时覆盖模型接入、显存与编译优化、资产扫描和 HDR 处理,便于创作者评估升级对现有工作流的影响。
Canva 宣布为 Meta 的个人 AI 智能体 Muse 接入 Canva 连接器,用户可在对话中创建设计,并使用品牌字体、颜色和素材。连接器还支持搜索设计库、导出文件,生成的 Canva 设计可继续编辑;该功能面向美国和加拿大用户开放。
推荐理由:这项连接把对话式规划与品牌素材、设计库搜索和可编辑设计串起来,可参考其在智能体创作工作流中的分工方式。
OpenAI DevDay 2026 汇总了 20 多项公告,涉及 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。
推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。
invideo 借助 GPT‑6 Astra 实现更精准的剪辑规划,调色与色彩校正效率提升 3 倍,并在一天内产出 50 个自定义特效。
ComfyUI 官方称 MiniMax H3 视频 VAE 编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:ComfyUI 官方给出 MiniMax H3 视频 VAE 的加速细节与开启方式,可据此判断视频工作流的耗时与画质取舍。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
NVIDIA指出,Physical AI规模化部署必须将安全覆盖硬件、软件、AI、运行环境及部署全生命周期,而非上线前一次性检查。NVIDIA Halos是面向Physical AI的全栈安全系统,覆盖自动驾驶与机器人开发、验证和部署,并结合仿真、合成数据与真实世界验证。
Higgsfield AI 借助 GPT-6 Astra,在一天内上线了新的视频功能,让小型企业制作视频广告更简单,并更快将新创意工具推向市场。
面向 DTC 品牌的 AI UGC 视频生成器指南,评估从创意、生成到交付的工具,重点考察生成、精修、品牌一致性与本地化能力。Luma 将视频、图像、音频和创意规划整合在一个工作区,Ray 3.2 支持 4K HDR 输出,Uni-1 维护布局、对象、文本与视觉识别一致性,Layers 提供可编辑图层。
AI 包装设计工具已覆盖从概念探索、mockup 到可生产文件和营销活动延展的不同环节,Luma、Packify.ai、Midjourney 与 ChatGPT各有侧重。Packify.ai支持dieline导出、3D mockup及3,000+ dielines和5,000+ mockups,Luma则用Layers保留已批准布局并替换产品、标题和本地化文案。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能,支持律所自定义工作流、接入法律数据源,并配备面向保密客户工作的法律级管控。该产品隶属 OpenAI for Law。
Canva 发布 ProSuite,首次把 Affinity、Cavalry、Flourish 和 Leonardo 连接起来,与 Canva 共同构成从初稿到交付的端到端创作生态。
推荐理由:Canva 把 Affinity、Cavalry、Flourish、Leonardo 串成一条专业创作链路,可据此判断设计工具与 AI 辅助的整合方向。
Google Flow 的 7 款替代工具分别侧重叙事规划、角色动作、后期编辑、头像视频和制作交付,服务场景式 AI 电影制作的不同阶段。Luma Ray 3.2 面向制作流程,支持原生 16-bit HDR 与 EXR 导出,Draft Mode 可先以 540p 预览。Luma Layers 可在保留已批准画面的同时修改单个元素,适合产品替换、文案变更和本地化营销素材。
面向 AI-first 制作团队,7 个 StudioBinder 替代方案覆盖素材生成、编辑、审片协作与传统拍摄规划。Luma Agents 可从创意到交付持续保留视频、图像、音频和文案的创作上下文,适合产品发布、社交内容及无实体拍摄的广告变体。AI-first 工具可在几天内实施并立即开始创作,还能在保留其他内容的同时修改单一元素。
8 款 LTX Studio 替代工具围绕分镜到视频的衔接进行评估,重点考察多镜头生成、原生音频同步、智能体工作流和精确编辑能力。73% 的电影制片厂已使用 AI 分镜;Luma 以 Ray 3.2、Uni-1 和 Luma Agents 提供逐帧运动控制、元素级编辑与项目上下文保持。
Sora 在 2026 年仅剩 API 访问,按模型和分辨率每生成 1 秒收费 $0.10-$0.70,API 计划于 9 月 24 日停用。1080p 每 10 秒的原始生成费用为 $7,Batch API 对非紧急生成提供 50% 折扣。文章估算,考虑 3-7 次迭代后,每个可用视频的实际成本会达到单次生成价格的 3-7 倍。
推荐理由:文章将 Sora 的单秒定价、迭代成本与 API 终止时间放在同一预算框架中,便于创作团队评估批量生成和迁移安排。
Pika在2026年提供Basic、Standard、Pro和Fancy四档方案,价格从免费到$76/月(年付),额度从80到6,000 credits不等;免费档使用Pika 2.5时限于480p,但支持无水印下载和商业使用。
文章比较 Luma Scenes 和 Google Flow SceneBuilder 的 AI 分镜流程:Luma Scenes 先生成完整故事板并在渲染前审核,Google Flow SceneBuilder 则先生成视频片段,再通过时间线剪辑组装。文中还对比了关键帧级修改与片段级控制、跨镜头视觉一致性,以及 Google Flow 基于 Veo 3.1 models 的原生音频生成。
InVideo AI 的 2026 年定价采用 credit 制,Basic 为 $9/月含 190 credits,Pro 为 $30/月含 1,000 credits。
2026 年 AI 分镜生成器榜单比较 10 款工具,重点考察脚本到分镜自动化、角色一致性与制作流程衔接。传统分镜每格需 30 至 90 分钟,部分工具可在 5 分钟内将脚本处理成完整分镜;目前 73% 的大型制片厂已在前期流程中使用 AI 分镜。
创意自动化平台可将一个获批的主设计在数小时内转化为数百个本地化、调整尺寸和个性化广告变体,生产时间减少50%或更多。指南覆盖 Luma Ray、Celtra、Adobe GenStudio 等工具,面向企业、区域团队和小团队的不同制作需求。Celtra支持100+市场的全球活动治理,Adobe GenStudio通过Firefly AI提供20+生成与创意操作。
Synthesia 2026 年采用 Basic、Starter、Creator 和 Enterprise 四档定价,面向不同内容产量与组织需求。