Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:两款 TTS 模型的能力分层与开放渠道清晰,可据此判断语音生成在配音、有声书和语音智能体上的选型。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:两款 TTS 模型的能力分层与开放渠道清晰,可据此判断语音生成在配音、有声书和语音智能体上的选型。
invideo 借助 GPT‑6 Astra 实现更精准的剪辑规划,调色与色彩校正效率提升 3 倍,并在一天内产出 50 个自定义特效。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 落地进展,新加坡 HTX 将研究使用 Nemotron 3 Super 与 Nemotron 3 Nano Omni 模型推进公共安全 AI。
ComfyUI 官方称 MiniMax H3 视频 VAE 编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:ComfyUI 官方给出 MiniMax H3 视频 VAE 的加速细节与开启方式,可据此判断视频工作流的耗时与画质取舍。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,两者在能力与成本上有不同的平衡取向。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
Parallel 借助 GPT-6 Astra 让智能体研究并综合劳动力市场数据,耗时和成本均降至此前模型的一半。
这篇指南比较 Kling AI、Leonardo、Canva 和 CapCut 四种背景移除工具,覆盖图像抠图、视频背景处理、设计编辑与 API 集成。Kling IMAGE 3.0 Omni 支持透明抠图、背景重建及 2K 和 4K 输出,VIDEO 3.0 Omni 可用自然语言和参考图重做现有视频背景,无需绿幕。
Luma 发布一份文本生视频提示词指南,提出以主体、动作、场景、镜头和风格组成五要素结构,并强调将核心动作放在开头。指南建议提示词控制在50-80词、每次只使用一个主要镜头运动,并通过参考图、逐变量修复和模板复用提升角色、商品与多资产的一致性。文中还介绍 Ray 3.2 的 multi-keyframe sequencing、native 1080p、HDR 和 EXR export 能力。
Luma 介绍了面向房地产房源和虚拟布置的六部分 AI 照片提示词结构,涵盖房间类型、风格、材质、色彩、光线和氛围。文章还给出客厅、厨房、卧室、外景、物体移除和天空替换示例,并讨论建筑结构保留、MLS 对 AI 图像的披露要求,以及 Luma Agents、Uni-1、Layers、Ray 3.2 和 Skills 在房源营销工作流中的应用。
Luma 对760名创意专业人士的调查显示,81%已经发布过 AI 制作内容,但团队在培训、工作流整合和审批机制上仍存在明显缺口。团队过去一年平均评估6.1个 AI 工具、采用4.3个并弃用2.9个;AI Leaders 发布 AI 占多数的视频比例为78%,AI Laggards为11%。
推荐理由:调查将 AI 采用与工作流整合拆开衡量,并用团队分层、工具流失和案例数据,为创意团队制定培训与审批流程提供了具体参照。
营销团队可用 30 个面向营销活动的 AI 提示词示例,覆盖策略、内容创作、分发和优化四个工作流阶段,并以角色、上下文、任务、语气、约束、格式、质量七部分构建可复用提示词。结构化提示词可将 persona 创建从每月 40 小时降至 5 小时,团队每天节省 2.5 小时;加入行为上下文的个性化邮件内容可带来 82% 更高转化率。
Luma 发布一份 AI 音乐视频提示词指南,按流行、嘻哈、电子、摇滚等类型提供 20 个示例,并将歌曲段落、主体动作、场景、镜头运动、灯光色彩和连续性列为提示词的六个要素。指南还介绍了从生成、审片、调整到多平台素材延展的流程,并提到 Ray 3.2、Luma Agents 和由 Uni-1 驱动的 Layers。
Luma介绍面向餐厅与 CPG 品牌的 AI 食物摄影方法,建议用菜品参考、机位、材质、光线方向、构图、用途和保真指令组成七要素提示词。文章区分 photo enhancers 与 text generators,并称 AI enhancement tools 可在 90 seconds 内产出菜单可用图片。
Luma 提供一套用于品牌视觉识别、品牌语调和跨格式一致性的 AI 提示词工作流,涵盖品牌基础、语调校准、活动变体与本地化创意。流程建议上传 5-10 份多样内容样本,视觉识别设置需 15-30 分钟;团队报告内容创作可节省 50-70% 时间。视频与图像可在同一创作工作区产出,减少从概念到交付的交接。
Luma 发布一篇 AI 照明提示词教程,围绕黄金时段、硬光、实景灯、霓虹和多点布光,给出 15 组提示词结构与示例。文章称,Image-to-Video 的色温一致性为 88%,高于 text-to-video 的 42%,并建议先生成光线正确的参考图再进行动画化。
Luma 发布时尚摄影提示词指南,提供 15 组覆盖人像、产品特写、季节活动和包容性呈现的模板。指南称,AI 工作流可将传统 6-8 周的系列画册制作压缩至 3-5 天,完整流程通常需要 12-22 小时,并强调统一虚拟模特、定向编辑和 AI 加传统拍摄的混合工作流。
NVIDIA指出,Physical AI规模化部署必须将安全覆盖硬件、软件、AI、运行环境及部署全生命周期,而非上线前一次性检查。NVIDIA Halos是面向Physical AI的全栈安全系统,覆盖自动驾驶与机器人开发、验证和部署,并结合仿真、合成数据与真实世界验证。
Higgsfield AI 借助 GPT-6 Astra,在一天内上线了新的视频功能,让小型企业制作视频广告更简单,并更快将新创意工具推向市场。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,为新兴 AI 研究结果的审查与沟通提供指导。
NVIDIA 展示 ThinkLabs AI、Atomic Canyon、Redwood Materials、TerraPower 和 CFS 将 AI 用于清洁能源项目,推进低碳电网建设。
ComfyUI 发布 v0.37.0,新增 Qwen-Image 2.1、MoGe 3 和 Meshy 7.1 支持,并为 GPT Image 2 加入透明背景功能。该版本集成 Aimdo 0.5.5,可自动检测并在高速磁盘上启用 --fast-disk,同时为 Qwen3/3.5/3.8 加入 cudagraphs 与 w4a8 gemv 支持。
面向 DTC 品牌的 AI UGC 视频生成器指南,评估从创意、生成到交付的工具,重点考察生成、精修、品牌一致性与本地化能力。Luma 将视频、图像、音频和创意规划整合在一个工作区,Ray 3.2 支持 4K HDR 输出,Uni-1 维护布局、对象、文本与视觉识别一致性,Layers 提供可编辑图层。
Luma 发布指南,比较 10 款面向音乐人和唱片公司的 AI 音乐视频生成器,并将其分为自动化优先与控制优先两类。指南从音画同步、创作控制、输出质量和实际采用情况进行对比,涵盖 Luma Dream Machine、Neural Frames、Freebeat、Runway、Kaiber、Pika 等工具。
这份指南比较了适用于无真人出镜 YouTube 频道的多款 AI 视频工具,涵盖 Luma、Pictory、Faceless.so、Synthesia、Steve AI、AutoShorts.ai、Fliki 和 Canva。
面向平面设计师的指南评估了十款 AI 图像生成器,覆盖从概念构思到最终本地化资产的创作阶段,比较输出质量、设计相关性、工作流集成和商业可行性。Luma凭借分层编辑、Skills和Agents,以及能保留其他元素的Uni-1,主打需要多版本、格式适配和多市场本地化的广告项目。
AI 包装设计工具已覆盖从概念探索、mockup 到可生产文件和营销活动延展的不同环节,Luma、Packify.ai、Midjourney 与 ChatGPT各有侧重。Packify.ai支持dieline导出、3D mockup及3,000+ dielines和5,000+ mockups,Luma则用Layers保留已批准布局并替换产品、标题和本地化文案。
Luma 发布一份面向房地产经纪人的 AI 视频工具指南,比较 Ray 3.2、Reel-E、BetterSpace、AutoReel、CapCut、Canva 和 Captions AI 的适用场景与工作流。
面向动画工作室的指南盘点 AI 动画生成器,指出采用相关工具可将制作时间最多缩短 40%、成本最多降低 30%,并支持从创意到交付的流程迭代。
阿里 Qwen 团队的最新图像模型 Qwen-Image-2.1 已在 ComfyUI 获得原生支持,开放权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:原文给出 RGBA 直出与 10 张参考图等具体能力,可据此判断图像编辑工作流是否需要替换现有抠图环节。
Canva 在 AI Vision London 2026 上总结出五条经验:当 AI 几秒就能套用品牌规范,差异化而非一致性才是真正的竞争优势。OpenAI 国际营销负责人 Elke Karskens 建议从工作流而非模型入手,作家 Azeem Azhar 则强调机器负责生成、人负责判断。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能,支持律所自定义工作流、接入法律数据源,并配备面向保密客户工作的法律级管控。该产品隶属 OpenAI for Law。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents 和面向营销人员的工具,并接入 HubSpot 与 Shopify。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,让员工愿意主动分享。
OpenAI 经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中反复出现的固定环节。
Canva 发布 ProSuite,首次把 Affinity、Cavalry、Flourish 和 Leonardo 连接起来,与 Canva 共同构成从初稿到交付的端到端创作生态。
推荐理由:Canva 把 Affinity、Cavalry、Flourish、Leonardo 串成一条专业创作链路,可据此判断设计工具与 AI 辅助的整合方向。
ComfyUI 发布 v0.36.0,在 Partner Nodes 中新增 Gemini 3.8 Flash 文本节点、BFL 的 Flux Video Edit 节点,以及 Pruna P-Video-2 的文生视频与图生视频节点。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的选型与成本取舍。