Canva 为 Meta 的 Muse 接入 AI 连接器,支持对话生成设计
Canva 宣布为 Meta 的个人 AI 智能体 Muse 接入 Canva 连接器,用户可在对话中创建设计,并使用品牌字体、颜色和素材。连接器还支持搜索设计库、导出文件,生成的 Canva 设计可继续编辑;该功能面向美国和加拿大用户开放。
推荐理由:这项连接把对话式规划与品牌素材、设计库搜索和可编辑设计串起来,可参考其在智能体创作工作流中的分工方式。
Canva 宣布为 Meta 的个人 AI 智能体 Muse 接入 Canva 连接器,用户可在对话中创建设计,并使用品牌字体、颜色和素材。连接器还支持搜索设计库、导出文件,生成的 Canva 设计可继续编辑;该功能面向美国和加拿大用户开放。
推荐理由:这项连接把对话式规划与品牌素材、设计库搜索和可编辑设计串起来,可参考其在智能体创作工作流中的分工方式。
OpenAI DevDay 2026 汇总了 20 多项公告,涉及 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
好玩!这也太丝滑了吧! 炫技成分有点浓!! 大神 @RyanSael 用Opus5.5做出来的家装模拟器!
女同事摸一下午鱼,竟然是在玩这个!! 该说不说,还是挺好玩的,解压又治愈, 赛博版手工插花,她说还可以制作成贺卡! 挺有意思!!
Gemini 照片编辑提示词指南整理了 25 个覆盖人像润饰、产品优化和复古修复的示例。有效提示词应包含主体识别、动作说明、保留规则和风格参数,明确“keep face identical”等要求可减少面部特征变化。人像修图需指定纹理保留,产品摄影需写明背景与光线,修复则应区分色彩校正和结构修复。
15条可直接复制的专业 AI 头像提示词覆盖企业、创业公司、高管、创意行业等场景,强调保留参考照片的真实面部结构,并用提示词控制服装、环境、镜头设置和光线。AI 头像可由单张参考照片生成10-50种变体,支持更换背景和局部调整而无需重新生成;拥有专业照片的 LinkedIn 资料获得的浏览量和消息量分别高出14倍和36倍。
Luma 介绍一套用于 AI 照片编辑的四部分提示词方法,覆盖颜色、光线、背景和皮肤修复,并强调保护不应改变的元素。文章建议每次只执行一个编辑,再检查身份、皮肤纹理、颜色准确度、光线方向和边缘质量。文中还介绍 Luma 的 Uni-1、Layers 和 Luma Agents 如何用于保持品牌颜色、皮肤纹理、背景与多轮编辑的一致性。
Luma AI的汽车摄影指南覆盖棚拍、动态行驶和外景三类广告镜头,并给出15个可复用提示词。指南将提示词拆为车辆描述、机位、光线、背景或地点、氛围和保真要求,强调动态镜头中的背景运动模糊与车辆细节清晰。文章还介绍了使用Layers和Uni-1调整背景或车辆元素,以及用Ray 3.2将视觉方向延伸到动态内容。
Luma 发布指南,介绍如何通过先锁定身份特征、再加入创意方向的提示词结构,生成在多种场景中保持人脸相似度的 AI 自拍。指南提供 15 组可复用提示词,并建议使用 3-5 张不同角度的清晰参考照片,通过多轮生成和局部编辑逐步完善结果;文中称提示词方案的报告成功率为 50-60%,更高级的微调方法可达到 80-90% 一致性。
Luma 发布了一份护肤与美妆品牌 AI 提示词指南,提供 15 组覆盖产品图像、社交内容、邮件、广告和视频的提示词结构。指南强调七部分美妆产品图像提示词框架,以及针对 Instagram、TikTok 等平台调整格式和叙事方式。它还介绍了用 Layers 保留既有构图进行局部修改,并提到 Luma Agents、Skills 和 Ray 3.2 在连续创作流程中的应用。
Luma围绕饮料与 CPG 产品发布给出一套 AI 提示词方法,主张将传统 12 至 18 个月的流程压缩至两个月或更短。文中称,AI 提示词可使发布周期缩短 50-80%,结构化提示词可将内容制作时间减少 80%;56%的 CPG 负责人所在组织经常使用生成式 AI。
结构化 AI Avatar 提示词通过角色、外貌、场景和输出风格等细节,帮助生成适用于 LinkedIn、企业网站及品牌材料的统一头像与角色。案例中,团队用四天完成 43 张头像,并通过 Seed 值、negative prompts 和多轮迭代保持身份与视觉一致性。Google 研究显示,高质量提示词平均约 21 个词。
H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。
推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。
OpenAI 扩大 Lenfest AI 协作与奖学金计划,提供 500 万美元资金,以及最高 500 万美元的软件额度和工程支持。
面向不同创作需求,Kling AI、Midjourney、Adobe Firefly、Ideogram、Leonardo AI 和 Canva 六款 AI 艺术生成器分别侧重参考生图与图像系列、风格探索、Creative Cloud 工作流、文字图像、迭代编辑和社交内容布局。
AI 照片增强工具指南比较了 Kling AI、Leonardo AI、Adobe Firefly、Runway、Topaz Photo 和 Remini 的适用场景与增强重点。Kling IMAGE 3.0 Omni 支持自然语言编辑、图像到图像工作流,以及原生 2K/4K 输出,可调整清晰度、细节、色彩和光照并保持原构图一致。
这份指南对比 Kling AI、Leonardo、Adobe Firefly 和 Krea 的 AI 图像放大工具与工作流,重点展示 Kling AI 如何通过参考图优化现有视觉或生成高分辨率图像。
ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。
推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。
Kling VIDEO 3.0 Omni支持基于已有音乐表演视频替换背景,并通过上传素材、描述或引用新场景、生成后复检三步完成编辑。教程还介绍了使用Kling VIDEO 3.0从文本或图片生成全新表演场景,以及通过Native Audio生成音乐、环境音和对白的方法。发布前需检查歌曲、录音、视频和参考素材的版权许可。
为篮球联赛标志创建提示词应明确联赛身份、篮球元素、风格、构图、颜色和背景,再用 Kling IMAGE 3.0 将文字概念转成视觉标志方向。文中提供 professional、modern、youth、retro、minimal 和 street 6 种示例,并支持通过 Text to Image 或参考图生成、评审和调整方案。
可灵文章解释文本生成视频模型如何理解提示、生成运动并维持时序与音画一致性,同时梳理模型选型时应关注的能力。文章介绍 Kling VIDEO 3.0 的 Multi-Shot、Subject Consistency 和 Native Audio,可生成 3–15 秒视频,支持部分工作流下最高 4K 输出。
可灵发布教程,介绍如何用 Kling IMAGE 3.0 从文字描述或照片创建 AI 图像,并通过提示词和自然语言指令持续修正结果。教程涵盖参考图上传、主体与构图描述、画面比例选择及生成后的审片;IMAGE 3.0 支持最多 10 张参考图,用于保持角色、商品、构图或视觉风格等细节的一致性。
Kling AI 介绍了通过光线、材质、比例、透视和镜头感等具体视觉细节提升 AI 图片真实感的方法。文章给出“主体、场景、光线、构图、材质细节、相机感、关键约束”的提示词结构,并说明 Kling IMAGE 3.0 支持文本生成、参考图生成和自然语言图像编辑。实践中应先定位最明显的不自然之处,再逐项调整并检查皮肤纹理、接触阴影、材质反光和商品轮廓。
推荐理由:文章将光线、材质、透视和镜头感拆成可操作的提示词要素,并结合 Kling IMAGE 3.0 的参考图与局部修复流程,适合用于提升图像真实感和商品细节控制。
World Labs 已签署最终协议加入 AMD,交易预计在 2026 年底前完成,尚待监管批准及其他惯例交割条件。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接与 CEO 苏姿丰共事;Justin Johnson 和 Ben Mildenhall 将与李飞飞继续领导 World Labs 团队,并入 AMD 后组建前沿研究组织。
推荐理由:World Labs 被 AMD 收购并给出团队去向与开放生态目标,可据此判断空间智能赛道的硬件整合走向。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上把近实时视频生成与语音结合,让对话模型具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 提供。
推荐理由:官方披露了实时视频与语音耦合、异步工具调用和 97 语言口型同步等能力边界,可供企业评估数字人客服与交互式导览的落地条件。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下提升推理速度。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高加速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
这份指南对比 Kling AI、Leonardo AI、Runway、OpenArt、Dreamina、Adobe Firefly、Higgsfield 和 Fotor,按不同照片编辑需求梳理各自工作流与优势。
Kling AI 发布一份指南,对比 6 款水印移除工具及其适用场景,并重点介绍 Kling IMAGE 3.0 与 IMAGE 3.0 Omni 的图像修复流程。指南指出,纯色背景更易处理,头发、纹理、细节主体和重复图案需要更谨慎的局部编辑与全尺寸复检;IMAGE 3.0 Omni 支持继续修复并输出原生 2K/4K 图像。
Kling AI 提供从上传原图、描述修复需求到生成对比并导出的三步流程,可处理老照片的褪色、划痕、污渍、折痕和细节缺失。Kling IMAGE 3.0 支持自然语言编辑、精确细节修改,并可从最多 10 张参考图提取特征;Kling IMAGE 3.0 Omni 支持直接输出 2K 和 4K。
Kling 发布的创作实践文章梳理了当前 AI 视频生成的 6 项局限,并给出参考图、分镜、分步提示和后期处理等应对方法。文章指出,角色与商品跨镜头不一致、运动和物理表现异常、长视频连贯性不足、文字细节失真及提示词控制有限,仍是常见问题。
推荐理由:文章把一致性、物理运动、长视频、文字细节和提示词控制等问题对应到具体工作流,便于判断何时使用参考图、分镜或后期处理。
Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。
推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。
Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。
推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:两款 TTS 模型的能力分层与开放渠道清晰,可据此判断语音生成在配音、有声书和语音智能体上的选型。
invideo 借助 GPT‑6 Astra 实现更精准的剪辑规划,调色与色彩校正效率提升 3 倍,并在一天内产出 50 个自定义特效。