跳到正文

图像生成与编辑

图像生成、局部编辑、设计排版和商品素材制作。

52条精选

最新精选

第 21–40 条 · 共 52 条
11月19日周三
  1. Replicate · 模型与制作实践66

    Retro Diffusion 四款像素艺术模型上线 Replicate

    Retro Diffusion 的 rd-fast、rd-plus、rd-tile 和 rd-animation 四款像素艺术模型现已可在 Replicate 上运行,面向游戏素材、角色精灵、瓦片和复古图形生成。模型支持多种风格预设,部分模型支持自定义尺寸、输入图像、调色板图像、背景移除和无缝平铺;其中 rd-animation 用于生成具有一致构图的动画精灵或精灵表。

    推荐理由:四款模型分别覆盖快速生成、高质量图像、瓦片集和动画精灵,读者可据此按游戏素材类型选择像素艺术生成工作流。

9月23日周二
  1. Replicate · 模型与制作实践68

    Replicate 对多款图像编辑模型的对比评测:如何选择合适模型

    Replicate 对多款图像编辑模型进行了对象移除、视角转换、背景编辑、文字编辑和风格迁移测试,并比较了价格与推理时间。

    推荐理由:这份按对象移除、视角转换、背景编辑、文字编辑和风格迁移展开的对比,可为图像编辑模型的任务选型提供具体参照。

9月9日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节跳动 Seed 团队发布 Seedream 4.0 图像创作模型

    字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。

    推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。

8月19日周二
  1. Diffusers · Releases90

    Diffusers 0.35.0 发布,新增 Qwen Image、Flux Kontext 和 Wan 2.2 管线

    Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。

    推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。

7月21日周一
  1. Replicate · 模型与制作实践62

    Replicate 实测四款图像模型:单张参考图生成一致角色谁更强

    Replicate 对比了截至 2025 年 7 月可用于单张参考图生成一致角色的四款模型:OpenAI gpt-image-1、Runway Gen-4 Image、Black Forest Labs FLUX.1 Kontext 和字节 SeedEdit 3,并补充了之后发布的 Ideogram Character 与 Gen-4 Image Turbo。

    推荐理由:作者用同一参考图横向实测四款图像模型,给出角色一致性与风格化任务的选型建议和失败边界。

7月17日周四
  1. Replicate · 模型与制作实践69

    Replicate 上线 Bria 商业安全视觉 AI 模型套件

    Replicate 与 Bria 合作,将 Bria 的视觉 AI 模型套件上线平台,包含基于授权数据训练的 Bria 3.2 文生图模型。套件还提供移除背景、局部重绘、增加分辨率、扩展画布和背景生成等功能;Bria 表示其模型使用来自 Getty Images、Envato、Freepik 等来源的 100% licensed data。

    推荐理由:读者可据此了解一组覆盖生成、抠图、局部重绘与扩图的视觉工具,以及其面向企业场景强调的授权数据与合规边界。

7月16日周三
  1. Replicate · 模型与制作实践62

    Replicate 如何优化 FLUX.1 Kontext [dev]

    Replicate 公开了其 FLUX.1 Kontext [dev] 实现的优化方法 TaylorSeer,用缓存的特征导数配合 Taylor 级数近似被跳过的去噪步,把模型调用从约 30 步降到 10 至 15 步,同时尽量保持质量。

    推荐理由:Replicate 公开了 FLUX.1 Kontext 的 TaylorSeer 缓存加速实现,读者可据此理解扩散模型跳步近似与质量取舍。

6月24日周二
6月6日周五
  1. ByteDance Seed · 视觉生成与编辑78

    字节跳动 Seed 发布图像编辑模型 SeedEdit 3.0

    字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。

    推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。

6月2日周一
  1. Replicate · 模型与制作实践80

    FLUX.1 Kontext 发布,Replicate 汇总社区图像编辑案例

    Black Forest Labs 发布图像编辑模型 FLUX.1 Kontext,提供 [pro]、[max] 和即将推出的 [dev] 三个版本,可进行颜色替换、背景编辑、文字替换和风格迁移,并保持角色一致性。Replicate 还介绍了社区在发型变换、职业头像、老图修复、画幅扩展和移除文字等场景中的使用案例,以及 Kontext Chat 和可直接使用的 Kontext 应用。

    推荐理由:文章同时梳理 FLUX.1 Kontext 的版本差异、提示词方法与社区案例,适合参考图像编辑和社交内容改版的工作流。

5月29日周四
5月22日周四
5月7日周三
  1. Replicate · 模型与制作实践62

    Ideogram 3.0 上线 Replicate,分 Turbo、Balanced、Quality 三档

    Ideogram 发布文生图模型 3.0 版本,在真实感、风格控制和版式生成上有较大改进,并分为 Turbo、Balanced、Quality 三个档位,均已上线 Replicate。Turbo 适合快速迭代,Quality 追求最高保真,Balanced 居中。该版本支持用参考图做风格迁移,并宣称在人工评测的 ELO 打分中于真实感、对齐度和多样性上高于其他图像生成模型。

    推荐理由:Ideogram 3.0 三个档位在文字渲染、版式与风格参考上的分工,可供设计营销类图像选型参考。

4月16日周三
  1. Replicate · 模型与制作实践70

    Easel AI 两款模型上线 Replicate,支持全身换脸与 AI avatars

    Easel AI 的全身换脸和 AI avatars 两款模型现已在 Replicate 提供,可通过网页或 API 调用。全身换脸可在单张图中替换一或两人并保留服装、光线和图像风格;AI avatars 只需单个提示词即可生成一或两人的头像,无需训练或 LoRAs。

    推荐理由:这次接入同时覆盖全身换脸与免训练头像生成,能帮助开发者比较单人和多人场景的接入方式及 API 使用路径。

  2. ByteDance Seed · 视觉生成与编辑82

    字节 Seed 发布 Seedream 3.0 文生图模型技术报告

    字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。

    推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。

4月9日周三
  1. Diffusers · Releases88

    Diffusers 0.33.0 发布,新增 Wan2.1 视频管线与多项显存优化

    Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。

    推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。

12月24日周二
  1. Diffusers · Releases91

    Diffusers 0.32.0 发布:新增视频与图像生成管线、量化后端及训练脚本

    Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。

    推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。

11月26日周二
  1. Replicate · 模型与制作实践62

    Replicate 让 FLUX 微调推理提速,并支持从 Hugging Face、Civitai 加载 LoRA

    Replicate 宣布 FLUX 微调推理大幅提速,微调模型运行速度已与基础模型相同:FLUX.1 [schnell] 在 512x512、4 步下为 0.6 秒(P50),FLUX.1 [dev] 在 1024x1024、28 步下为 2.8 秒(P50)。

    推荐理由:Replicate 公布了 FLUX 微调推理的加速数据与开源优化路径,可据此判断自建或托管微调服务的成本与质量取舍。

11月21日周四
10月22日周二