Luma 总结 18 个更接近真实摄影的 AI 图像提示词
Luma 总结了18个面向写实 AI 图像的提示词示例,强调在描述主体之外,还要明确光线、镜头特征、环境细节、材质反射和自然瑕疵。文章将图像生成定位为起点,建议通过 Layers 进行局部编辑,并由 Luma Agents 在概念、修改、变体生成和最终交付之间保持创作上下文。
Luma 总结了18个面向写实 AI 图像的提示词示例,强调在描述主体之外,还要明确光线、镜头特征、环境细节、材质反射和自然瑕疵。文章将图像生成定位为起点,建议通过 Layers 进行局部编辑,并由 Luma Agents 在概念、修改、变体生成和最终交付之间保持创作上下文。
Luma 分享 20 个室内设计 AI 提示词,覆盖客厅、卧室、厨房、商业空间、情绪板和房地产虚拟布置,并总结了房间、风格、材料、颜色、光线和氛围六部分结构。
ComfyUI 发布 v0.31.0,新增 Wan-Animate2、Flux 3 视频模型和 SeeDance 2.5 支持,并改进多项 MiniMax H3 与音频处理。版本还加入 ImageCompositor 节点、Bloom 2 和 Wonder 3.5 支持,并对 LTX、Wan 做加速;同时修复 Linux 内存、采样器和 MiniMax H3 相关问题。
推荐理由:该版本集中带来视频、图像合成与音频处理更新,读者可据新增节点、模型接入和性能修复安排升级。
ComfyUI 发布 v0.28.0,新增 Seed Audio 1.0、Seedream 5 Pro、SeedVR2 支持以及 Save 3D (Advanced) 节点族。版本还修复了四个安全漏洞,改进 Qwen3-VL、自定义嵌入、视频音频流和 int4 模型等问题。
推荐理由:该版本把模型接入、3D 工作流与安全修复集中在一次更新中,可用于评估 ComfyUI 对视频、图像和 3D 创作链路的覆盖变化。
Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。
推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款模型的延迟、单价与限制条件都写明了,可据此判断图像到视频链路的选型与成本。
ComfyUI 发布 v0.26.0,新增 Qwen3-VL 文本生成、Boogu-Image、Krea2、Load3DAdvanced 以及 LTX2 的 Context Windows sampling 支持。
推荐理由:该版本把多种模型节点、分辨率支持和工作流基础设施集中到一次更新中,便于评估 ComfyUI 的模型接入与创作流程变化。
Envato 基于 FLUX 将参考图变体、纯图像生成和多参考图像编辑整合进统一创作体验。FLUX 已贡献平台约 25% 的图像生成量,累计生成超过 51 million 张图片;其中 Stock riffing 可在 8 秒内生成 5 个变体。Black Forest Labs 称,FLUX.2 在写实、电影感和产品图场景中较可比模型高约 10%,下载率高于平台平均值 16%。
推荐理由:案例展示了创意平台如何按任务路由模型,将参考图变体、纯文生图和多参考编辑整合进统一工作流,并以延迟与生成量衡量落地效果。
Black Forest Labs 宣布,FLUX.2 [klein] 4B 将预装在新一代搭载 RTX GPU 的 ASUS ProArt 笔记本的 MuseTree 应用中,无需 API 或互联网即可生成图像。该方案的目标是在 8GB VRAM 笔记本上、后台运行其他专业应用时,将图像生成时间控制在 5 秒以内。
推荐理由:这次合作把 FLUX.2 [klein] 4B 的本地部署条件、离线使用方式和性能目标放到具体硬件上,便于评估其对隐私敏感与低延迟创作流程的适配度。
Black Forest Labs 宣布 Martin Scorsese 担任公司顾问,并与其开展使用 FLUX 的电影分镜工作。Scorsese 表示,借助该工具可以更清晰、高效地向制作设计师、艺术设计师和摄影师分享视觉构想,并在前期制作中更快推进分镜。
FLUX VTO 公开发布,主打面向大规模商品目录的虚拟试衣,单次生成耗时低于 4 秒。模型可保留人物身份以及服装的 logo、印花、缝线和五金细节,支持一次应用最多四件衣物并进行叠穿。精准的身体和服装尺码仍在演进,输出更适合用于视觉造型参考;默认政策不支持泳装和内衣。
推荐理由:原文同时给出速度、商品细节保真和多件叠穿能力,可帮助评估虚拟试衣在商品目录与交互购物中的落地条件。
Hugging Face 的 Diffusers 发布 0.38.0,新增多条图像与音频管线,包括离散扩散语言模型 LLaDA2、2B 激活 17B 参数的稀疏 MoE 图像模型 NucleusMoE-Image。
Hugging Face 发布 Diffusers 0.37.0,引入 Modular Diffusers,用可复用模块组合自定义扩散管线,与原有 DiffusionPipeline 并存。
推荐理由:Diffusers 0.37.0 的模块化管线与新增图像视频模型清单,可供选型与工作流搭建时对照参考。
Replicate 发布 Seedream 5.0 提示词实践指南,基于大量实测总结该模型在摄影语言理解、示例式编辑、风格迁移、多步推理、精确指令跟随、专业领域知识和文字渲染上的表现。示例式编辑可给出一组前后对比图加第三张图,让模型自行推断变化并套用,无需文字描述;提示词建议用自然语言而非关键词堆叠,需要渲染的文字用双引号包裹,复杂编辑可用箭头、方框或彩色区域标注位置。
推荐理由:Replicate 实测 Seedream 5.0 的提示词写法,示例式编辑和视觉标记对复杂改图流程有直接借鉴。
Recraft 发布图像生成模型 Recraft V4,主打所谓“设计品味”,在构图、光线和色彩上做出更接近美术指导的视觉决策。
推荐理由:四个版本在分辨率、速度与价格上的差异,以及原生 SVG 输出,可作为图像生成选型与设计资产工作流的参考。
字节跳动 Seed 团队发布 Seedream 5.0 Lite 智能图像创作模型,相比 4.0 在理解、推理和生成方面全面提升,并首次为 Seedream 系列引入实时检索增强能力,可联网获取最新资讯回应时效性创作需求。
推荐理由:官方披露了多模态统一架构与实时检索增强的落地方式,可据此判断图像模型向推理型创作助手演进的具体路径。
Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。
推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。
Replicate 发布 Nano Banana Pro 提示词实践指南,称该模型具备图像内文字的逻辑推理能力,可读取作业题并给出带解题步骤的答案,也能把论文、财报 PDF 转成信息图。
推荐理由:汇总了 Nano Banana Pro 在文字渲染、角色一致性和世界知识上的实测边界,可据此判断它适合哪些创作环节。
Retro Diffusion 的 rd-fast、rd-plus、rd-tile 和 rd-animation 四款像素艺术模型现已可在 Replicate 上运行,面向游戏素材、角色精灵、瓦片和复古图形生成。模型支持多种风格预设,部分模型支持自定义尺寸、输入图像、调色板图像、背景移除和无缝平铺;其中 rd-animation 用于生成具有一致构图的动画精灵或精灵表。
推荐理由:四款模型分别覆盖快速生成、高质量图像、瓦片集和动画精灵,读者可据此按游戏素材类型选择像素艺术生成工作流。
Replicate 对多款图像编辑模型进行了对象移除、视角转换、背景编辑、文字编辑和风格迁移测试,并比较了价格与推理时间。
推荐理由:这份按对象移除、视角转换、背景编辑、文字编辑和风格迁移展开的对比,可为图像编辑模型的任务选型提供具体参照。
字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。
推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。
Hugging Face 发布 Diffusers v0.35.1,重点改进 Qwen-Image Edit。该版本包含 PR #12188 和 #12190,贡献者为 naykun。
Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。
推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。
Replicate 对比了截至 2025 年 7 月可用于单张参考图生成一致角色的四款模型:OpenAI gpt-image-1、Runway Gen-4 Image、Black Forest Labs FLUX.1 Kontext 和字节 SeedEdit 3,并补充了之后发布的 Ideogram Character 与 Gen-4 Image Turbo。
推荐理由:作者用同一参考图横向实测四款图像模型,给出角色一致性与风格化任务的选型建议和失败边界。
Replicate 与 Bria 合作,将 Bria 的视觉 AI 模型套件上线平台,包含基于授权数据训练的 Bria 3.2 文生图模型。套件还提供移除背景、局部重绘、增加分辨率、扩展画布和背景生成等功能;Bria 表示其模型使用来自 Getty Images、Envato、Freepik 等来源的 100% licensed data。
推荐理由:读者可据此了解一组覆盖生成、抠图、局部重绘与扩图的视觉工具,以及其面向企业场景强调的授权数据与合规边界。
Replicate 公开了其 FLUX.1 Kontext [dev] 实现的优化方法 TaylorSeer,用缓存的特征导数配合 Taylor 级数近似被跳过的去噪步,把模型调用从约 30 步降到 10 至 15 步,同时尽量保持质量。
推荐理由:Replicate 公开了 FLUX.1 Kontext 的 TaylorSeer 缓存加速实现,读者可据此理解扩散模型跳步近似与质量取舍。
Replicate 联合 Black Forest Labs 举办 FLUX.1 Kontext 黑客松,120 多名参与者用这款图像编辑模型和 Resemble AI 的 Chatterbox 语音模型在数小时内完成 30 个参赛项目。
Hugging Face Diffusers 发布 0.34.0,新增 Wan VACE、Cosmos Predict2 等视频与图像生成 pipeline,并改善 torch.compile 支持。
推荐理由:该版本同时覆盖可控视频生成与低显存部署,读者可据此评估 Wan VACE 等 pipeline 的控制能力和 torch.compile、量化、卸载组合。
字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。
推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。
Black Forest Labs 发布图像编辑模型 FLUX.1 Kontext,提供 [pro]、[max] 和即将推出的 [dev] 三个版本,可进行颜色替换、背景编辑、文字替换和风格迁移,并保持角色一致性。Replicate 还介绍了社区在发型变换、职业头像、老图修复、画幅扩展和移除文字等场景中的使用案例,以及 Kontext Chat 和可直接使用的 Kontext 应用。
推荐理由:文章同时梳理 FLUX.1 Kontext 的版本差异、提示词方法与社区案例,适合参考图像编辑和社交内容改版的工作流。
Black Forest Labs 推出图像编辑模型 FLUX.1 Kontext,Replicate 已上线 [pro] 与 [max] 两个版本,开放权重的 [dev] 版本即将发布。
推荐理由:梳理了 FLUX.1 Kontext 三个版本的开放方式与提示词写法,可据此判断图像编辑的选型与可控编辑流程。
Google DeepMind 的最新旗舰图像模型 Imagen 4 现可在 Replicate 上运行,目前为预览版,行为与功能可能变化,需求高时可能出现排队。
推荐理由:Replicate 上线 Google Imagen 4 预览版,读者可据此了解其文字渲染与细节表现及接入方式。
Hugging Face 上的 3 万多个 LoRA 现可直接在 Hub 上通过 Replicate 运行推理。用户选择支持的 LoRA 模型并将 Replicate 设为推理提供方后,请求会被路由到 Replicate 的 black-forest-labs/flux-dev-lora 模型,LoRA 以 lora_weights 参数动态传入,无需为每个 LoRA 单独托管模型。
Ideogram 发布文生图模型 3.0 版本,在真实感、风格控制和版式生成上有较大改进,并分为 Turbo、Balanced、Quality 三个档位,均已上线 Replicate。Turbo 适合快速迭代,Quality 追求最高保真,Balanced 居中。该版本支持用参考图做风格迁移,并宣称在人工评测的 ELO 打分中于真实感、对齐度和多样性上高于其他图像生成模型。
推荐理由:Ideogram 3.0 三个档位在文字渲染、版式与风格参考上的分工,可供设计营销类图像选型参考。
Easel AI 的全身换脸和 AI avatars 两款模型现已在 Replicate 提供,可通过网页或 API 调用。全身换脸可在单张图中替换一或两人并保留服装、光线和图像风格;AI avatars 只需单个提示词即可生成一或两人的头像,无需训练或 LoRAs。
推荐理由:这次接入同时覆盖全身换脸与免训练头像生成,能帮助开发者比较单人和多人场景的接入方式及 API 使用路径。
字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。
推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。
Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。
推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。
Diffusers 发布 v0.32.2 补丁版本,修复了 Flux 加载 Comfy UI 格式单文件 checkpoint 的回归问题,并支持将 LoRA 加载进 bitsandbytes 4bit 量化的 Flux 模型。
Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。
推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。
Replicate 宣布 FLUX 微调推理大幅提速,微调模型运行速度已与基础模型相同:FLUX.1 [schnell] 在 512x512、4 步下为 0.6 秒(P50),FLUX.1 [dev] 在 1024x1024、28 步下为 2.8 秒(P50)。
推荐理由:Replicate 公布了 FLUX 微调推理的加速数据与开源优化路径,可据此判断自建或托管微调服务的成本与质量取舍。