跳到正文

#图像生成

今日 1 条
今天10月3日周六
10月2日周五
  1. The Decoder78

    Black Forest Labs 发布 Flux 3 Image,支持不改变其他区域的多步编辑

    Black Forest Labs 发布 Flux 3 Image,主打在多步编辑中保持图像其他区域不变,并支持文生图、图生图、文字渲染和写实图像。模型支持用边界框构图、最多加入 10 张参考图,输出最高 4K;免费演示已开放,API 在 10 月 8 日前五折,商业权重可授权企业在自有基础设施上运行和微调,开放权重预计未来几周发布。

    推荐理由:Flux 3 Image 将多步局部编辑、参考图和边界框构图结合起来,适合评估图像工作流中的可控性与商品或角色保真需求。

  2. Luma · 创作产品与实践50

    2026 年建筑师最佳 AI 渲染工具

    2026 年建筑师的 AI 渲染工具选择正从试验转向工作流决策,重点比较建筑信息建模集成、画质与设计修改能力;44% 的建筑师已用 AI 制作概念图,74% 计划增加使用。Luma 以 Ray 3.2、图层编辑、场景变换和可重复工作流覆盖从概念图到动画制作;Veras 可直接连接 Revit、SketchUp、Rhino 等六个平台,Enscape 则提供实时渲染与虚拟现实漫游。

  3. arXiv · 多模态、视频与世界模型70

    Gestalt:提出基于多模态交互的大型多模态模型

    Zequn Yang 等作者提出 Gestalt,一种围绕多模态交互构建的大型多模态模型。该模型采用多模态交互金字塔、统一离散扩散框架和通过可学习交互 token 促进跨模态交换的架构,论文称其在图像生成、多模态理解和纯文本评测中提升了跨模态融合,同时保留模态特有信息。

  4. arXiv · 多模态、视频与世界模型81

    AutoGUIWorld:用图像生成器构建 GUI 智能体视觉世界模型

    AutoGUIWorld 提出一种无需部署或运行对应软件环境的 GUI 交互轨迹生成框架,将规划器与图像生成器结合,迭代生成界面状态和动作后果。

    推荐理由:论文展示了用图像生成器合成 GUI 交互轨迹的路径,并用 OSWorld 与 ScienceBoard 结果说明其对智能体训练的潜在价值。

10月1日周四
  1. arXiv · 多模态、视频与世界模型73

    ShieldCLIP:面向多模态基础模型的选择性安全对齐框架

    论文提出 ShieldCLIP,根据每个模态的实际安全状态进行选择性安全对齐,在减少有害输出的同时保留原始嵌入空间的实用性。作者构建了包含 195k 个四元组、覆盖 578 个概念和 28 个类别的 ViSUv2 数据集,并在跨模态检索、Stable Diffusion v1.4、SDXL 和 LLaVA 任务上进行评估。

  2. arXiv · 多模态、视频与世界模型76

    UniEvo-VL 提出多模态模型自我改进的在策略自蒸馏训练方法

    UniEvo-VL 提出一种让单个多模态模型分别充当教师和学生、利用自我批评反馈进行在策略自蒸馏的方法,以改进图像生成能力。在开源 Qwen-image-2512 上,GenEval 从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。

    推荐理由:论文给出不依赖独立教师的多模态自蒸馏路径,并用 GenEval 与 GenEval2 Soft-TIFA 的分数变化展示其对图像生成改进的测量方式。

9月30日周三
9月29日周二
  1. Luma · 创作产品与实践46

    AI 头像提示词:2026 年专业肖像的 15 条提示词

    15条可直接复制的专业 AI 头像提示词覆盖企业、创业公司、高管、创意行业等场景,强调保留参考照片的真实面部结构,并用提示词控制服装、环境、镜头设置和光线。AI 头像可由单张参考照片生成10-50种变体,支持更换背景和局部调整而无需重新生成;拥有专业照片的 LinkedIn 资料获得的浏览量和消息量分别高出14倍和36倍。

  2. Luma · 创作产品与实践53

    Luma AI汽车摄影提示词指南:覆盖棚拍、动态与外景镜头

    Luma AI的汽车摄影指南覆盖棚拍、动态行驶和外景三类广告镜头,并给出15个可复用提示词。指南将提示词拆为车辆描述、机位、光线、背景或地点、氛围和保真要求,强调动态镜头中的背景运动模糊与车辆细节清晰。文章还介绍了使用Layers和Uni-1调整背景或车辆元素,以及用Ray 3.2将视觉方向延伸到动态内容。

  3. Luma · 创作产品与实践54

    Luma 教你如何通过提示词保持 AI 自拍的人脸相似度

    Luma 发布指南,介绍如何通过先锁定身份特征、再加入创意方向的提示词结构,生成在多种场景中保持人脸相似度的 AI 自拍。指南提供 15 组可复用提示词,并建议使用 3-5 张不同角度的清晰参考照片,通过多轮生成和局部编辑逐步完善结果;文中称提示词方案的报告成功率为 50-60%,更高级的微调方法可达到 80-90% 一致性。

  4. Luma · 创作产品与实践53

    Luma 2026 年护肤与美妆品牌 AI 提示词指南

    Luma 发布了一份护肤与美妆品牌 AI 提示词指南,提供 15 组覆盖产品图像、社交内容、邮件、广告和视频的提示词结构。指南强调七部分美妆产品图像提示词框架,以及针对 Instagram、TikTok 等平台调整格式和叙事方式。它还介绍了用 Layers 保留既有构图进行局部修改,并提到 Luma Agents、Skills 和 Ray 3.2 在连续创作流程中的应用。

  5. Luma · 创作产品与实践40

    AI Avatar 提示词:打造个人头像与品牌角色

    结构化 AI Avatar 提示词通过角色、外貌、场景和输出风格等细节,帮助生成适用于 LinkedIn、企业网站及品牌材料的统一头像与角色。案例中,团队用四天完成 43 张头像,并通过 Seed 值、negative prompts 和多轮迭代保持身份与视觉一致性。Google 研究显示,高质量提示词平均约 21 个词。

9月28日周一
  1. 可灵 · 模型与创作实践50

    如何为篮球联赛标志创建醒目的提示词:Kling IMAGE 3.0 实践指南

    为篮球联赛标志创建提示词应明确联赛身份、篮球元素、风格、构图、颜色和背景,再用 Kling IMAGE 3.0 将文字概念转成视觉标志方向。文中提供 professional、modern、youth、retro、minimal 和 street 6 种示例,并支持通过 Text to Image 或参考图生成、评审和调整方案。

  2. 可灵 · 模型与创作实践56

    Kling IMAGE 3.0 如何从文字或照片创建 AI 图像

    可灵发布教程,介绍如何用 Kling IMAGE 3.0 从文字描述或照片创建 AI 图像,并通过提示词和自然语言指令持续修正结果。教程涵盖参考图上传、主体与构图描述、画面比例选择及生成后的审片;IMAGE 3.0 支持最多 10 张参考图,用于保持角色、商品、构图或视觉风格等细节的一致性。

  3. 可灵 · 模型与创作实践63

    Kling AI 如何通过提示词让 AI 图片更真实

    Kling AI 介绍了通过光线、材质、比例、透视和镜头感等具体视觉细节提升 AI 图片真实感的方法。文章给出“主体、场景、光线、构图、材质细节、相机感、关键约束”的提示词结构,并说明 Kling IMAGE 3.0 支持文本生成、参考图生成和自然语言图像编辑。实践中应先定位最明显的不自然之处,再逐项调整并检查皮肤纹理、接触阴影、材质反光和商品轮廓。

    推荐理由:文章将光线、材质、透视和镜头感拆成可操作的提示词要素,并结合 Kling IMAGE 3.0 的参考图与局部修复流程,适合用于提升图像真实感和商品细节控制。

9月24日周四
  1. 可灵 · 模型与创作实践54

    6 款水印移除工具对比:Kling AI 如何处理复杂图像修复

    Kling AI 发布一份指南,对比 6 款水印移除工具及其适用场景,并重点介绍 Kling IMAGE 3.0 与 IMAGE 3.0 Omni 的图像修复流程。指南指出,纯色背景更易处理,头发、纹理、细节主体和重复图案需要更谨慎的局部编辑与全尺寸复检;IMAGE 3.0 Omni 支持继续修复并输出原生 2K/4K 图像。

9月22日周二
  1. Luma · 创作产品与实践52

    Luma 的 2026 年房地产房源与虚拟布置 AI 照片提示词指南

    Luma 介绍了面向房地产房源和虚拟布置的六部分 AI 照片提示词结构,涵盖房间类型、风格、材质、色彩、光线和氛围。文章还给出客厅、厨房、卧室、外景、物体移除和天空替换示例,并讨论建筑结构保留、MLS 对 AI 图像的披露要求,以及 Luma Agents、Uni-1、Layers、Ray 3.2 和 Skills 在房源营销工作流中的应用。

  2. Luma · 创作产品与实践54

    Luma 时尚摄影提示词指南:15 组模板覆盖系列画册与营销活动

    Luma 发布时尚摄影提示词指南,提供 15 组覆盖人像、产品特写、季节活动和包容性呈现的模板。指南称,AI 工作流可将传统 6-8 周的系列画册制作压缩至 3-5 天,完整流程通常需要 12-22 小时,并强调统一虚拟模特、定向编辑和 AI 加传统拍摄的混合工作流。

9月21日周一
  1. Luma · 创作产品与实践46

    面向平面设计师的 2026 年最佳 AI 图像生成器

    面向平面设计师的指南评估了十款 AI 图像生成器,覆盖从概念构思到最终本地化资产的创作阶段,比较输出质量、设计相关性、工作流集成和商业可行性。Luma凭借分层编辑、Skills和Agents,以及能保留其他元素的Uni-1,主打需要多版本、格式适配和多市场本地化的广告项目。

9月8日周二
  1. OpenAI News60

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,官方称生成结果能更好地体现用户的想法。

    推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与生成定位,可据此判断参考图生图能力在创作流程中的位置。

9月6日周日
  1. Luma · 创作产品与实践45

    Luma:20 个 AI 图片编辑提示词:修图、重塑风格并转换任意图片

    Luma 整理 20 个 AI 图片编辑提示词,帮助创意团队在保留已批准布局、光线和阴影的同时替换产品、更新文案与背景,快速生成不同市场和平台的营销变体。提示词应明确主体、修改动作、需保留内容和风格;Uni-1 可分析布局、对象、文本及视觉关系,让编辑保持上下文一致,并缩短传统拍摄、修图和变体制作流程。

  2. Luma · 创作产品与实践54

    Luma 总结 18 个更接近真实摄影的 AI 图像提示词

    Luma 总结了18个面向写实 AI 图像的提示词示例,强调在描述主体之外,还要明确光线、镜头特征、环境细节、材质反射和自然瑕疵。文章将图像生成定位为起点,建议通过 Layers 进行局部编辑,并由 Luma Agents 在概念、修改、变体生成和最终交付之间保持创作上下文。