跳到正文

全部动态

今日 9 条
7月7日周一
7月1日周二
6月24日周二
6月11日周三
  1. ByteDance Seed · 视觉生成与编辑86

    字节跳动 Seed 发布 Seedance 1.0 视频生成模型并公开技术报告

    字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。

    推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。

6月10日周二
  1. Replicate · 模型与制作实践60

    Replicate 发布 Veo 3 提示词指南:如何写出最佳效果

    Replicate 发布 Veo 3 提示词指南,建议在提示词中明确主体、场景、动作、风格、镜头运动、构图与氛围,并单独描述对白、环境音、音效和音乐。文中指出 Veo 3 对同一提示词多次生成结果高度相似,想探索不同效果应改用差异较大的提示词;保持角色描述逐字一致可提升跨场景视觉连续性。

    推荐理由:Replicate 基于实测给出 Veo 3 的提示词结构、音频与角色一致性写法,可迁移到视频生成工作流。

6月6日周五
  1. ByteDance Seed · 视觉生成与编辑78

    字节跳动 Seed 发布图像编辑模型 SeedEdit 3.0

    字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。

    推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。

  2. Replicate · 模型与制作实践79

    Google Veo 3 使用指南:从原生音频到镜头提示词

    Replicate介绍 Google Veo 3 的视频生成能力,并分享一套涵盖镜头构图、焦段效果、风格和运镜的提示词方法。文章还展示了对话与口型同步、视频游戏世界等案例,并给出冰柱特写示例提示词。

    推荐理由:文章整理了 Veo 3 的镜头构图、焦段、风格与运镜提示词,并结合对话、口型同步和游戏世界生成案例,便于复用其视频创作流程。

6月2日周一
  1. Replicate · 模型与制作实践80

    FLUX.1 Kontext 发布,Replicate 汇总社区图像编辑案例

    Black Forest Labs 发布图像编辑模型 FLUX.1 Kontext,提供 [pro]、[max] 和即将推出的 [dev] 三个版本,可进行颜色替换、背景编辑、文字替换和风格迁移,并保持角色一致性。Replicate 还介绍了社区在发型变换、职业头像、老图修复、画幅扩展和移除文字等场景中的使用案例,以及 Kontext Chat 和可直接使用的 Kontext 应用。

    推荐理由:文章同时梳理 FLUX.1 Kontext 的版本差异、提示词方法与社区案例,适合参考图像编辑和社交内容改版的工作流。

5月29日周四
5月22日周四
  1. Replicate · 模型与制作实践68

    Replicate上线 OpenAI 最新聊天、视觉与推理模型

    Replicate现已支持运行 OpenAI 的 GPT-4.1、GPT-4o 和 o-series 等聊天、视觉与推理模型。GPT-4.1系列支持最长 1 million tokens 的上下文,GPT-4o系列处理文本、图像和音频,o-series面向数学、科学与复杂问题的结构化推理。

    推荐理由:材料按上下文、模态、推理任务和成本速度列出模型差异,并给出 Replicate 网页界面与 API 的操作入口。

5月15日周四
5月7日周三
  1. Replicate · 模型与制作实践62

    Ideogram 3.0 上线 Replicate,分 Turbo、Balanced、Quality 三档

    Ideogram 发布文生图模型 3.0 版本,在真实感、风格控制和版式生成上有较大改进,并分为 Turbo、Balanced、Quality 三个档位,均已上线 Replicate。Turbo 适合快速迭代,Quality 追求最高保真,Balanced 居中。该版本支持用参考图做风格迁移,并宣称在人工评测的 ELO 打分中于真实感、对齐度和多样性上高于其他图像生成模型。

    推荐理由:Ideogram 3.0 三个档位在文字渲染、版式与风格参考上的分工,可供设计营销类图像选型参考。

5月6日周二
  1. Replicate · 模型与制作实践67

    Replicate 提供 MiniMax Speech-02 语音模型 API

    Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。

    推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。

4月16日周三
  1. Replicate · 模型与制作实践70

    Easel AI 两款模型上线 Replicate,支持全身换脸与 AI avatars

    Easel AI 的全身换脸和 AI avatars 两款模型现已在 Replicate 提供,可通过网页或 API 调用。全身换脸可在单张图中替换一或两人并保留服装、光线和图像风格;AI avatars 只需单个提示词即可生成一或两人的头像,无需训练或 LoRAs。

    推荐理由:这次接入同时覆盖全身换脸与免训练头像生成,能帮助开发者比较单人和多人场景的接入方式及 API 使用路径。

  2. ByteDance Seed · 视觉生成与编辑82

    字节 Seed 发布 Seedream 3.0 文生图模型技术报告

    字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。

    推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。

4月10日周四
4月9日周三
  1. Diffusers · Releases88

    Diffusers 0.33.0 发布,新增 Wan2.1 视频管线与多项显存优化

    Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。

    推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。

4月1日周二
  1. Replicate · 模型与制作实践77

    Wan 2.1 如何制作风格化视频

    Wan 2.1 支持从文本或图像生成视频,并可通过 LoRA 进行风格迁移。Replicate 提供了 480p 和 720p 的文本生视频模型,以及使用预制权重或自有图片训练风格 LoRA 的流程;自定义训练至少需要 25 张图片和一个 trigger_word。

    推荐理由:材料展示了使用预制 LoRA 和自有图片训练风格 LoRA 的 Wan 2.1 视频工作流,包含可复用的输入与训练步骤。

3月28日周五
3月5日周三
  1. Replicate · 模型与制作实践80

    Replicate 接入 Wan2.1,提供 API 生成 480p 和 720p 视频

    Replicate 为 Wan2.1 提供可扩展云端 API,支持 480p/720p 文本生视频与图像生视频。14B 模型在 Replicate 上生成 5s 视频,480p 约需 39s、720p 约需 150s;另有面向消费级 GPU 的 1.3B 模型。文章还介绍了 guide_scale、shift 和 steps 等可调参数。

    推荐理由:文章同时给出 Wan2.1 的文本生视频与图像生视频 API 入口、分辨率和参数设置,便于按实验速度与输出分辨率选择模型版本。

1月24日周五
  1. Replicate · 模型与制作实践87

    Replicate 支持微调开源视频模型 HunyuanVideo

    Replicate 已将 Musubi Tuner 适配到平台,支持用户用自有视觉内容微调 HunyuanVideo 视频模型。文章提供从视频切片与字幕生成、LoRA 训练到浏览器或 API 调用的流程,默认训练通常需要约 5-10 分钟。

    推荐理由:文章把视频微调拆成数据准备、训练和调用四步,并给出训练时长与参数调节建议,适合评估自定义视觉风格和运动效果的落地路径。

1月20日周一
  1. ByteDance Seed · 音频与多模态交互73

    豆包实时语音大模型上线并全量开放,端到端语音对话支持随时打断

    豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。

    推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。

1月17日周五
1月16日周四
12月24日周二
  1. Diffusers · Releases91

    Diffusers 0.32.0 发布:新增视频与图像生成管线、量化后端及训练脚本

    Diffusers 0.32.0 发布,新增 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 视频生成管线,以及多组图像生成管线。该版本还加入 TorchAO、GGUF 量化后端和 Flux、SANA、Hunyuan Video 等训练脚本。Sana-0.6B 可部署在 16GB laptop GPU 上,并在不到 1 秒内生成 1024×1024 图像。

    推荐理由:该版本把 Mochi-1、Allegro、LTXVideo 和 HunyuanVideo 接入统一库,并补充量化后端与训练脚本,便于比较开放视频模型的使用与微调路径。

12月16日周一
  1. Replicate · 模型与制作实践66

    AI 视频正迎来自己的 Stable Diffusion 时刻

    Replicate 作者 fofr 认为,Sora 让外界看到视频模型的可能性却无法使用,如今一批质量接近 Sora 的模型已经可用,AI 视频正经历类似 Stable Diffusion 的爆发。

    推荐理由:梳理了 Sora 之后一批视频模型的 ELO、速度、时长与开源情况,便于按质量、成本和可微调性做选型比较。

11月26日周二
  1. Replicate · 模型与制作实践62

    Replicate 让 FLUX 微调推理提速,并支持从 Hugging Face、Civitai 加载 LoRA

    Replicate 宣布 FLUX 微调推理大幅提速,微调模型运行速度已与基础模型相同:FLUX.1 [schnell] 在 512x512、4 步下为 0.6 秒(P50),FLUX.1 [dev] 在 1024x1024、28 步下为 2.8 秒(P50)。

    推荐理由:Replicate 公布了 FLUX 微调推理的加速数据与开源优化路径,可据此判断自建或托管微调服务的成本与质量取舍。

11月21日周四
10月22日周二
  1. Replicate · 模型与制作实践62

    Ideogram v2 局部重绘功能上线 Replicate API

    Ideogram 为 Ideogram v2 推出局部重绘功能,Replicate 同步将该模型接入自家 API,提供 ideogram-ai/ideogram-v2 与 ideogram-ai/ideogram-v2-turbo 两个版本,前者图像质量更好、后者速度更快。

    推荐理由:Replicate 接入 Ideogram v2 局部重绘,并给出提示词写法与开源 demo,可作图像编辑工作流的选型参考。

10月10日周四
  1. Replicate · 模型与制作实践81

    Replicate 提升 FLUX 生成速度并开源优化代码

    Replicate 宣布 FLUX 在其平台上的端到端生成速度提升,并将相关优化代码开源。在美国西海岸使用 Python 客户端测试时,FLUX.1 [schnell] 在 512x512、4 steps 下为 0.29 秒,1024x1024、4 steps 下为 0.72 秒;FLUX.1 [dev] 在 1024x1024、28 steps 下为 3.03 秒。

    推荐理由:文中给出的端到端测速和可关闭的优化开关,为比较 FLUX 在不同分辨率与步数下的速度、质量和部署取舍提供了具体依据。

10月3日周四
9月20日周五
  1. Replicate · 模型与制作实践78

    Replicate 教你用合成训练数据改进 Flux 微调

    Replicate 介绍了利用合成训练数据改进 Flux 微调模型的方法,涵盖从单张图片生成训练集、筛选模型优质输出再训练,以及组合多个 LoRA 扩展风格。文章还说明了通过 Replicate API 使用 `extra_lora` 和 `extra_lora_scale` 的方式,并建议在 0.9 到 1.1 的范围内调整 LoRA 权重。

    推荐理由:文章将单图扩增、筛选微调模型优质输出和组合 LoRA 整理成可复用流程,适合改善 Flux 微调数据的多样性与风格范围。

9月9日周一
  1. Replicate · 模型与制作实践79

    Replicate 教程:用 API 微调 FLUX.1

    Replicate 发布教程,展示如何通过其 HTTP API 以编程方式微调 FLUX.1、发布模型并生成图像。教程覆盖训练图片准备、API token、模型创建、数据上传、训练状态检查,以及使用 trigger_word 调用微调模型。使用约20张图片和1000 steps时,训练通常约需20分钟、成本约为$1.85,训练运行在 Nvidia H100 上并按秒计费。

    推荐理由:这篇教程把 FLUX.1 微调拆成可执行的 API 流程,涵盖训练数据、成本、版本发布和调用,适合复用到自定义图像模型工作流。

8月30日周五
  1. Replicate · 模型与制作实践82

    Replicate 教程:如何用 FLUX.1 微调生成自己的肖像图像

    Replicate 发布教程,介绍如何用少量个人照片在 Replicate 上微调 FLUX.1,生成包含本人形象的图像。教程建议至少准备10张不同角度、光线和场景的照片,设置独特触发词,并使用1000步训练。以约20张训练图为例,训练通常需要约20分钟、费用约为$1.85,完成后可通过网页或 API 生成图像。

    推荐理由:教程给出个人照片微调、触发词设置和模型调用的完整步骤,并提供1000步训练约20分钟、约$1.85的成本参考,便于复用这套肖像生成流程。

8月23日周五
  1. Replicate · 模型与制作实践49

    Replicate Intelligence #12:FLUX.1 工具、Deep-Live-Cam 与睡眠自博弈研究

    Replicate 第 12 期周报聚焦 FLUX.1 图像生成工具、Deep-Live-Cam 换脸项目及睡眠中大脑自博弈研究。ReFlux 支持在无限画布上使用多个微调后的 FLUX.1 模型,Multi-LoRA Explorer 可在单张图像中组合多个 LoRA。Deep-Live-Cam 是开源项目,据称支持实时换脸,但作者在 MacBook Pro 上未达到满意帧率。

8月16日周五
  1. Replicate · 模型与制作实践73

    Replicate Intelligence #11:Replicate 支持微调 FLUX.1,汇总数字人、可控视频与可玩游戏世界项目

    Replicate 宣布支持在平台上用自有图片微调 FLUX.1 图像生成模型,用户可上传 12-20 张多样图片并设置触发词,约 30 分钟生成定制模型。

    推荐理由:这期内容给出 FLUX.1 微调所需的图片数量与耗时,并串联数字人、可控视频和可玩游戏世界案例,便于比较不同生成工作流。

8月15日周四