跳到正文

#一致性/可控性

今日 0 条
9月22日周二
  1. Luma · 创作产品与实践54

    Luma 时尚摄影提示词指南:15 组模板覆盖系列画册与营销活动

    Luma 发布时尚摄影提示词指南,提供 15 组覆盖人像、产品特写、季节活动和包容性呈现的模板。指南称,AI 工作流可将传统 6-8 周的系列画册制作压缩至 3-5 天,完整流程通常需要 12-22 小时,并强调统一虚拟模特、定向编辑和 AI 加传统拍摄的混合工作流。

9月21日周一
  1. Luma · 创作产品与实践42

    2026 年 DTC 品牌最佳 AI UGC 视频生成器

    面向 DTC 品牌的 AI UGC 视频生成器指南,评估从创意、生成到交付的工具,重点考察生成、精修、品牌一致性与本地化能力。Luma 将视频、图像、音频和创意规划整合在一个工作区,Ray 3.2 支持 4K HDR 输出,Uni-1 维护布局、对象、文本与视觉识别一致性,Layers 提供可编辑图层。

  2. Luma · 创作产品与实践46

    面向平面设计师的 2026 年最佳 AI 图像生成器

    面向平面设计师的指南评估了十款 AI 图像生成器,覆盖从概念构思到最终本地化资产的创作阶段,比较输出质量、设计相关性、工作流集成和商业可行性。Luma凭借分层编辑、Skills和Agents,以及能保留其他元素的Uni-1,主打需要多版本、格式适配和多市场本地化的广告项目。

9月18日周五
9月15日周二
  1. Luma · 创作产品与实践48

    Google Flow 替代方案:2026 年场景式 AI 电影制作的 7 款工具

    Google Flow 的 7 款替代工具分别侧重叙事规划、角色动作、后期编辑、头像视频和制作交付,服务场景式 AI 电影制作的不同阶段。Luma Ray 3.2 面向制作流程,支持原生 16-bit HDR 与 EXR 导出,Draft Mode 可先以 540p 预览。Luma Layers 可在保留已批准画面的同时修改单个元素,适合产品替换、文案变更和本地化营销素材。

  2. Luma · 创作产品与实践55

    Storyboarder.ai 评测:故事板之后,制作流程还缺什么?

    Storyboarder.ai 可将剧本快速转换为视觉分镜,30页剧本约10分钟生成120个镜头,部分套餐支持无限图像生成,角色一致性覆盖120多个镜头的项目。文章认为其更适合提案和前期可视化,平台虽可输出基础 animatics,却不具备生产级视频生成能力,也没有与剪辑或项目管理软件的原生集成,后续交接和多市场修改仍需手动完成。

  3. Luma · 创作产品与实践41

    AI-first 制作团队的 7 个 StudioBinder 替代方案

    面向 AI-first 制作团队,7 个 StudioBinder 替代方案覆盖素材生成、编辑、审片协作与传统拍摄规划。Luma Agents 可从创意到交付持续保留视频、图像、音频和文案的创作上下文,适合产品发布、社交内容及无实体拍摄的广告变体。AI-first 工具可在几天内实施并立即开始创作,还能在保留其他内容的同时修改单一元素。

  4. Luma · 创作产品与实践44

    Luma:AI 视频转场提示词——剪切、擦除与匹配剪辑

    AI 视频转场提示词通过结构化描述连接不同场景,帮助剪切、擦除与匹配剪辑形成连贯叙事。文章建议采用“镜头运动+主体+动作+环境+光照+风格/情绪”公式,并在关键帧转场中匹配镜头角度、色温和主体位置。匹配剪辑需在生成前规划视觉相似性,AI 转场也可减少广告制作中的重复修改。

  5. Luma · 创作产品与实践52

    LTX Studio 评测:故事板优先工作流是否值得投入

    LTX Studio采用故事板优先流程,先将脚本拆分为镜头并通过Elements管理角色、物体和场景,再生成视频,以提升多镜头项目的一致性并减少无效生成。原文指出,该平台的学习成本较高、与外部剪辑软件缺少原生连接,LTX-2.3比Kling 3.0 Pro、Seedance 2.0和Veo 3.1更节省资源。

  6. Luma · 创作产品与实践52

    Luma Scenes 与 Google Flow SceneBuilder 对比:哪种 AI 分镜方式更适合故事板制作?

    文章比较 Luma Scenes 和 Google Flow SceneBuilder 的 AI 分镜流程:Luma Scenes 先生成完整故事板并在渲染前审核,Google Flow SceneBuilder 则先生成视频片段,再通过时间线剪辑组装。文中还对比了关键帧级修改与片段级控制、跨镜头视觉一致性,以及 Google Flow 基于 Veo 3.1 models 的原生音频生成。

9月7日周一
  1. Luma · 创作产品与实践79

    Sora 关停后,创意团队如何评估视频工作流替代方案

    OpenAI 已于 2026 年 4 月 26 日关闭 Sora 网页和应用,API 将于 2026 年 9 月 24 日停止,用户需在期限前导出数据。文章建议团队从工作流整合、关键帧控制、精准修改和专业导出格式等方面评估替代方案,并介绍 Luma Ray 3.2 的 16-keyframe 控制以及 HDR、EXR 导出能力。

    推荐理由:文章以 Sora 关停为背景,提醒创意团队从数据迁移、版本修订和最终交付等完整流程评估视频工具。

9月6日周日
  1. Luma · 创作产品与实践45

    Luma:20 个 AI 图片编辑提示词:修图、重塑风格并转换任意图片

    Luma 整理 20 个 AI 图片编辑提示词,帮助创意团队在保留已批准布局、光线和阴影的同时替换产品、更新文案与背景,快速生成不同市场和平台的营销变体。提示词应明确主体、修改动作、需保留内容和风格;Uni-1 可分析布局、对象、文本及视觉关系,让编辑保持上下文一致,并缩短传统拍摄、修图和变体制作流程。

  2. Luma · 创作产品与实践54

    Luma 总结 18 个更接近真实摄影的 AI 图像提示词

    Luma 总结了18个面向写实 AI 图像的提示词示例,强调在描述主体之外,还要明确光线、镜头特征、环境细节、材质反射和自然瑕疵。文章将图像生成定位为起点,建议通过 Layers 进行局部编辑,并由 Luma Agents 在概念、修改、变体生成和最终交付之间保持创作上下文。

  3. Luma · 创作产品与实践51

    Luma提供20组平面设计AI提示词,覆盖海报、图标与社交媒体图形

    Luma发布一份平面设计指南,提供20组可直接复用的AI提示词,覆盖海报、图标和社交媒体图形。指南总结了由主体、格式、风格、品牌线索、尺寸、情绪和文字组成的七要素公式,并给出A3、300 DPI、1080x1080和1080x1920等规格示例。文章还强调将生成素材作为可编辑的初稿,通过局部元素修改、品牌模板和多市场本地化完成后续制作。

9月4日周五
9月1日周二
  1. ComfyUI · 工作流与实践78

    Trellis.2 与 Pixal3D 原生接入 ComfyUI

    ComfyUI 将 Trellis.2 和 Pixal3D 两个 3D 生成模型做进核心节点,无需自定义节点、编译 CUDA 扩展或降级 PyTorch,并移除了原流程中限制商用的 nvdiffrast 与 nvdiffrec 依赖。

    推荐理由:ComfyUI 原生接入两个开源 3D 生成模型并重建网格后处理与 PBR 贴图链路,可据此判断本地 3D 资产生产流程的可行边界。

8月12日周三
  1. ComfyUI · 工作流与实践80

    ComfyUI 首日支持 LTX-2.5 开放视频模型

    ComfyUI 在 LTX-2.5 发布当天提供支持,该模型是 LTX 最新开放视频模型,权重可下载并在本地 GPU 运行,也可通过 Partner Nodes 使用托管版本。

    推荐理由:LTX-2.5 在 ComfyUI 的 Day-0 支持给出了开放权重与托管两条路径,可据此判断本地视频生成的可控性与部署成本。

8月4日周二
  1. Black Forest Labs · 图像与视频80

    Black Forest Labs 发布 FLUX 3 Video,支持文生视频与图生视频

    Black Forest Labs 通过 BFL API 和部分合作方开放 FLUX 3 Video 生成能力的初始版本,可生成最长 20 秒的 HD 视频并同步生成原生音频,Full HD 通过超分输出。

    推荐理由:官方给出 FLUX 3 Video 的生成能力、分辨率与草稿模式,可据此判断多模态视频生成在创作流程中的可用边界。

6月17日周三
  1. Black Forest Labs · 图像与视频73

    Envato 如何基于 FLUX 构建创意 AI 引擎

    Envato 基于 FLUX 将参考图变体、纯图像生成和多参考图像编辑整合进统一创作体验。FLUX 已贡献平台约 25% 的图像生成量,累计生成超过 51 million 张图片;其中 Stock riffing 可在 8 秒内生成 5 个变体。Black Forest Labs 称,FLUX.2 在写实、电影感和产品图场景中较可比模型高约 10%,下载率高于平台平均值 16%。

    推荐理由:案例展示了创意平台如何按任务路由模型,将参考图变体、纯文生图和多参考编辑整合进统一工作流,并以延迟与生成量衡量落地效果。

5月29日周五
  1. Black Forest Labs · 图像与视频82

    FLUX VTO 公开发布,面向大规模商品目录的虚拟试衣模型

    FLUX VTO 公开发布,主打面向大规模商品目录的虚拟试衣,单次生成耗时低于 4 秒。模型可保留人物身份以及服装的 logo、印花、缝线和五金细节,支持一次应用最多四件衣物并进行叠穿。精准的身体和服装尺码仍在演进,输出更适合用于视觉造型参考;默认政策不支持泳装和内衣。

    推荐理由:原文同时给出速度、商品细节保真和多件叠穿能力,可帮助评估虚拟试衣在商品目录与交互购物中的落地条件。

5月26日周二
  1. ElevenLabs · 音频创作78

    ElevenLabs 发布 Music v2 音乐生成模型

    ElevenLabs 发布 Music v2 音乐生成模型,提升人声、器乐、编曲和多语言支持,并支持更复杂的歌曲结构。模型支持按片段局部重绘、分段构建完整歌曲,以及在同一首歌中处理多种曲风、快速说唱和非音乐音效。

    推荐理由:Music v2 将局部重绘、分段作曲和多语言演唱整合到音乐生成流程,便于比较创作者、品牌与开发者的不同接入方式。

5月18日周一
  1. Google DeepMind91

    Google DeepMind 发布 Gemini Omni,首个模型 Gemini Omni Flash 开始上线

    Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。

    推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。

3月3日周二
  1. World Labs · 空间智能与世界模型62

    World Labs 长文:3D 是人与机器交互的代码,世界模型将走向可编程空间系统

    World Labs 发布长文《3D as code》,提出 3D 是描述和交互物理与虚拟世界的通用接口,类比关系为 3D 相当于代码、神经图形相当于编程语言、仿真引擎相当于芯片。

    推荐理由:World Labs 把 3D 类比为代码、仿真引擎类比为芯片,为判断世界模型该走端到端还是混合架构提供了一条清晰的分析框架。

2月24日周二
  1. Replicate · 模型与制作实践62

    Replicate 实测 Seedream 5.0 提示词写法

    Replicate 发布 Seedream 5.0 提示词实践指南,基于大量实测总结该模型在摄影语言理解、示例式编辑、风格迁移、多步推理、精确指令跟随、专业领域知识和文字渲染上的表现。示例式编辑可给出一组前后对比图加第三张图,让模型自行推断变化并套用,无需文字描述;提示词建议用自然语言而非关键词堆叠,需要渲染的文字用双引号包裹,复杂编辑可用箭头、方框或彩色区域标注位置。

    推荐理由:Replicate 实测 Seedream 5.0 的提示词写法,示例式编辑和视觉标记对复杂改图流程有直接借鉴。

2月18日周三
2月12日周四
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.0 正式发布,支持四种模态输入与音视频联合生成

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入,可同时输入多达 9 张图片、3 段视频、3 段音频及自然语言指令。

    推荐理由:官方给出多模态参考、视频编辑与双声道音频的能力边界和失败项,可据此判断其在电商与影视流程中的可用位置。

12月16日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节 Seedance 1.5 pro 音视频创作模型正式发布

    字节 Seed 团队正式发布新一代音视频创作模型 Seedance 1.5 pro,支持文本到音视频合成与图像引导的音视频生成,已上线即梦AI和豆包。模型采用基于 MMDiT 的统一音视频联合生成框架,实现口型、语调与表演节奏的音画同步,原生支持中文、英文、日文、韩语、西班牙语、印尼语及四川话、粤语等方言。

    推荐理由:官方披露了音视频联合生成的架构与评测细节,可据此判断音画同步能力在短剧、广告等场景的可用边界。

11月25日周二
11月20日周四
  1. Replicate · 模型与制作实践73

    如何为 Nano Banana Pro 写提示词:Replicate 实测其逻辑推理、文字渲染与角色一致性

    Replicate 发布 Nano Banana Pro 提示词实践指南,称该模型具备图像内文字的逻辑推理能力,可读取作业题并给出带解题步骤的答案,也能把论文、财报 PDF 转成信息图。

    推荐理由:汇总了 Nano Banana Pro 在文字渲染、角色一致性和世界知识上的实测边界,可据此判断它适合哪些创作环节。

11月12日周三
  1. World Labs · 空间智能与世界模型92

    World Labs 开放 Marble 多模态世界模型,支持多输入生成与 3D 编辑

    World Labs 宣布 Marble 多模态世界模型面向所有用户开放,可从文本、图像、视频或粗略 3D 布局生成 3D 世界。Marble 支持交互式编辑、扩展和组合世界,并可导出为 Gaussian splats、网格或视频;同时推出创作中心 Marble Labs。

    推荐理由:Marble 将文本、图像、视频和粗略 3D 布局纳入同一创作流程,并提供编辑、扩展与导出能力,可用于判断其对世界构建工作流的适配度。

10月16日周四
  1. World Labs · 空间智能与世界模型78

    World Labs 发布实时世界模型 RTFM

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可随交互实时生成视频,用于探索生成的 3D 世界和真实场景,今日以 research preview 形式开放,并可在浏览器中体验。

    推荐理由:RTFM 把世界模型做成单卡实时渲染器,读者可据此判断实时 3D 生成在算力与持久性上的可行边界。

  2. Replicate · 模型与制作实践84

    Veo 3.1 提示词编写指南:参考生视频与首尾帧控制

    Replicate 介绍 Veo 3.1 的提示词编写方法,以及参考生视频、首尾帧生视频和增强图生视频功能。参考生视频最多接收三张图片并结合文本生成连贯场景,其余端点提供耗时低于 60 秒、价格约为标准版本一半的快速生成选项。

    推荐理由:文章把镜头构图、焦段、风格和运动等提示词要素,与参考图、首尾帧及快速版本的使用场景对应起来,便于设计可控的视频生成流程。

9月23日周二
  1. Replicate · 模型与制作实践68

    Replicate 对多款图像编辑模型的对比评测:如何选择合适模型

    Replicate 对多款图像编辑模型进行了对象移除、视角转换、背景编辑、文字编辑和风格迁移测试,并比较了价格与推理时间。

    推荐理由:这份按对象移除、视角转换、背景编辑、文字编辑和风格迁移展开的对比,可为图像编辑模型的任务选型提供具体参照。

8月1日周五
  1. Replicate · 模型与制作实践60

    如何用图像提示 Veo 3:Replicate 实测风格保持与文字动画

    Replicate 发布 Veo 3 图像输入的使用技巧,实测显示模型能在动画中保持输入图的画风、滤镜和调色,并让文字在复杂背景中保持清晰可读。输入图始终作为视频首帧,可用提示词只动画局部元素、其余保持静止,也可先用 Ideogram 3.0 生成特定风格图再交给 Veo 3 做动作与运镜,从而把风格控制交给图像模型。

    推荐理由:Replicate 实测了 Veo 3 图像输入在风格保持、文字动画和局部动画上的表现,可据此调整参考图加提示词的创作流程。