跳到正文

全部动态

今日 1 条
10月15日周三
9月23日周二
  1. Replicate · 模型与制作实践68

    Replicate 对多款图像编辑模型的对比评测:如何选择合适模型

    Replicate 对多款图像编辑模型进行了对象移除、视角转换、背景编辑、文字编辑和风格迁移测试,并比较了价格与推理时间。

    推荐理由:这份按对象移除、视角转换、背景编辑、文字编辑和风格迁移展开的对比,可为图像编辑模型的任务选型提供具体参照。

9月16日周二
  1. World Labs · 空间智能与世界模型78

    World Labs 推出 Marble 有限测试版,图像或文本可生成可导航 3D 世界

    World Labs 发布 Marble 有限访问测试版,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由探索的 3D 世界,官方称无时间限制、无变形、无一致性问题。

    推荐理由:World Labs 首次开放 Marble 有限测试,可据此判断图像或文本生成可持久导航 3D 世界在创作流程中的可用边界。

9月9日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节跳动 Seed 团队发布 Seedream 4.0 图像创作模型

    字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。

    推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。

9月8日周一
  1. Replicate · 模型与制作实践73

    Replicate 为 torch.compile 编译产物增加缓存,模型冷启动提速 2–3 倍

    Replicate 开始缓存 PyTorch 模型的 torch.compile 编译产物,以减少模型容器启动时的编译开销,black-forest-labs/flux-kontext-dev、prunaai/flux-schnell 和 prunaai/flux.1-dev-lora 的启动速度提升 2–3 倍。

    推荐理由:Replicate的缓存机制针对torch.compile首次编译开销,给出了多个模型冷启动时间变化,可用于评估部署优化收益。

8月20日周三
8月19日周二
  1. Diffusers · Releases90

    Diffusers 0.35.0 发布,新增 Qwen Image、Flux Kontext 和 Wan 2.2 管线

    Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。

    推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。

8月10日周日
  1. Replicate · 模型与制作实践76

    Replicate 发布远程 MCP server,支持通过自然语言探索和运行 HTTP APIs

    Replicate 发布托管远程 MCP server,可接入 Claude Desktop、Claude Code、Cursor 和 VS Code,通过聊天式自然语言探索并运行 Replicate 的 HTTP APIs。

    推荐理由:它展示了 Replicate 的模型检索、比较和运行如何接入 Claude、Cursor 等工具,并通过远程认证与响应过滤落地 MCP 工作流。

8月1日周五
  1. Replicate · 模型与制作实践60

    如何用图像提示 Veo 3:Replicate 实测风格保持与文字动画

    Replicate 发布 Veo 3 图像输入的使用技巧,实测显示模型能在动画中保持输入图的画风、滤镜和调色,并让文字在复杂背景中保持清晰可读。输入图始终作为视频首帧,可用提示词只动画局部元素、其余保持静止,也可先用 Ideogram 3.0 生成特定风格图再交给 Veo 3 做动作与运镜,从而把风格控制交给图像模型。

    推荐理由:Replicate 实测了 Veo 3 图像输入在风格保持、文字动画和局部动画上的表现,可据此调整参考图加提示词的创作流程。

7月31日周四
  1. Replicate · 模型与制作实践75

    Replicate 联合 Pruna AI 发布优化版 Wan 2.2 视频模型

    Replicate 与 Pruna AI 合作发布优化版 Wan 2.2,FAST 文生视频和图生视频 480p 每条 0.05 美元、720p 每条 0.10 美元,推理时间约 30 秒。未优化的图生视频 480p 每条 0.40 美元、720p 每条 1.00 美元,可通过 Replicate API 调用。Replicate 称未来几天将发布更多与 Pruna 的优化版本。

    推荐理由:Replicate 与 Pruna AI 优化的 Wan 2.2 给出了按条计费的视频生成价格与推理耗时,可据此评估低成本视频试错方案。

7月24日周四
  1. ByteDance Seed · 音频与多模态交互73

    字节 Seed 发布端到端同声传译模型 Seed LiveInterpret 2.0,延迟低至 2-3 秒

    字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。

    推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。

7月21日周一
  1. Replicate · 模型与制作实践62

    Replicate 实测四款图像模型:单张参考图生成一致角色谁更强

    Replicate 对比了截至 2025 年 7 月可用于单张参考图生成一致角色的四款模型:OpenAI gpt-image-1、Runway Gen-4 Image、Black Forest Labs FLUX.1 Kontext 和字节 SeedEdit 3,并补充了之后发布的 Ideogram Character 与 Gen-4 Image Turbo。

    推荐理由:作者用同一参考图横向实测四款图像模型,给出角色一致性与风格化任务的选型建议和失败边界。

7月17日周四
  1. Replicate · 模型与制作实践69

    Replicate 上线 Bria 商业安全视觉 AI 模型套件

    Replicate 与 Bria 合作,将 Bria 的视觉 AI 模型套件上线平台,包含基于授权数据训练的 Bria 3.2 文生图模型。套件还提供移除背景、局部重绘、增加分辨率、扩展画布和背景生成等功能;Bria 表示其模型使用来自 Getty Images、Envato、Freepik 等来源的 100% licensed data。

    推荐理由:读者可据此了解一组覆盖生成、抠图、局部重绘与扩图的视觉工具,以及其面向企业场景强调的授权数据与合规边界。

7月16日周三
  1. Replicate · 模型与制作实践62

    Replicate 如何优化 FLUX.1 Kontext [dev]

    Replicate 公开了其 FLUX.1 Kontext [dev] 实现的优化方法 TaylorSeer,用缓存的特征导数配合 Taylor 级数近似被跳过的去噪步,把模型调用从约 30 步降到 10 至 15 步,同时尽量保持质量。

    推荐理由:Replicate 公开了 FLUX.1 Kontext 的 TaylorSeer 缓存加速实现,读者可据此理解扩散模型跳步近似与质量取舍。

7月7日周一
7月1日周二
6月24日周二
6月11日周三
  1. ByteDance Seed · 视觉生成与编辑86

    字节跳动 Seed 发布 Seedance 1.0 视频生成模型并公开技术报告

    字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。

    推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。

6月10日周二
  1. Replicate · 模型与制作实践60

    Replicate 发布 Veo 3 提示词指南:如何写出最佳效果

    Replicate 发布 Veo 3 提示词指南,建议在提示词中明确主体、场景、动作、风格、镜头运动、构图与氛围,并单独描述对白、环境音、音效和音乐。文中指出 Veo 3 对同一提示词多次生成结果高度相似,想探索不同效果应改用差异较大的提示词;保持角色描述逐字一致可提升跨场景视觉连续性。

    推荐理由:Replicate 基于实测给出 Veo 3 的提示词结构、音频与角色一致性写法,可迁移到视频生成工作流。

6月6日周五
  1. ByteDance Seed · 视觉生成与编辑78

    字节跳动 Seed 发布图像编辑模型 SeedEdit 3.0

    字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。

    推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。

  2. Replicate · 模型与制作实践79

    Google Veo 3 使用指南:从原生音频到镜头提示词

    Replicate介绍 Google Veo 3 的视频生成能力,并分享一套涵盖镜头构图、焦段效果、风格和运镜的提示词方法。文章还展示了对话与口型同步、视频游戏世界等案例,并给出冰柱特写示例提示词。

    推荐理由:文章整理了 Veo 3 的镜头构图、焦段、风格与运镜提示词,并结合对话、口型同步和游戏世界生成案例,便于复用其视频创作流程。

6月2日周一
  1. Replicate · 模型与制作实践80

    FLUX.1 Kontext 发布,Replicate 汇总社区图像编辑案例

    Black Forest Labs 发布图像编辑模型 FLUX.1 Kontext,提供 [pro]、[max] 和即将推出的 [dev] 三个版本,可进行颜色替换、背景编辑、文字替换和风格迁移,并保持角色一致性。Replicate 还介绍了社区在发型变换、职业头像、老图修复、画幅扩展和移除文字等场景中的使用案例,以及 Kontext Chat 和可直接使用的 Kontext 应用。

    推荐理由:文章同时梳理 FLUX.1 Kontext 的版本差异、提示词方法与社区案例,适合参考图像编辑和社交内容改版的工作流。

5月29日周四
5月22日周四
  1. Replicate · 模型与制作实践68

    Replicate上线 OpenAI 最新聊天、视觉与推理模型

    Replicate现已支持运行 OpenAI 的 GPT-4.1、GPT-4o 和 o-series 等聊天、视觉与推理模型。GPT-4.1系列支持最长 1 million tokens 的上下文,GPT-4o系列处理文本、图像和音频,o-series面向数学、科学与复杂问题的结构化推理。

    推荐理由:材料按上下文、模态、推理任务和成本速度列出模型差异,并给出 Replicate 网页界面与 API 的操作入口。

5月15日周四
5月7日周三
  1. Replicate · 模型与制作实践62

    Ideogram 3.0 上线 Replicate,分 Turbo、Balanced、Quality 三档

    Ideogram 发布文生图模型 3.0 版本,在真实感、风格控制和版式生成上有较大改进,并分为 Turbo、Balanced、Quality 三个档位,均已上线 Replicate。Turbo 适合快速迭代,Quality 追求最高保真,Balanced 居中。该版本支持用参考图做风格迁移,并宣称在人工评测的 ELO 打分中于真实感、对齐度和多样性上高于其他图像生成模型。

    推荐理由:Ideogram 3.0 三个档位在文字渲染、版式与风格参考上的分工,可供设计营销类图像选型参考。

5月6日周二
  1. Replicate · 模型与制作实践67

    Replicate 提供 MiniMax Speech-02 语音模型 API

    Replicate 提供 MiniMax Speech-02-HD 和 Speech-02-Turbo 的 API,可用于多语言文本转语音、情感控制和语音克隆。两款模型支持超过 30 种语言和口音,语音克隆需要至少 10 秒音频;Turbo 按 $30 per million characters 计费,HD 按 $50 per million characters 计费,克隆声音每个收费 $3。

    推荐理由:文章并列说明 Speech-02-HD 与 Speech-02-Turbo 的定位、语音克隆条件和价格,便于评估不同实时语音场景的接入成本。

4月16日周三
  1. Replicate · 模型与制作实践70

    Easel AI 两款模型上线 Replicate,支持全身换脸与 AI avatars

    Easel AI 的全身换脸和 AI avatars 两款模型现已在 Replicate 提供,可通过网页或 API 调用。全身换脸可在单张图中替换一或两人并保留服装、光线和图像风格;AI avatars 只需单个提示词即可生成一或两人的头像,无需训练或 LoRAs。

    推荐理由:这次接入同时覆盖全身换脸与免训练头像生成,能帮助开发者比较单人和多人场景的接入方式及 API 使用路径。

  2. ByteDance Seed · 视觉生成与编辑82

    字节 Seed 发布 Seedream 3.0 文生图模型技术报告

    字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。

    推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。

4月10日周四
4月9日周三
  1. Diffusers · Releases88

    Diffusers 0.33.0 发布,新增 Wan2.1 视频管线与多项显存优化

    Diffusers 发布 0.33.0,新增 Wan2.1、LTX Video 0.9.5、Hunyuan Image to Video 等视频管线,以及 SANA-Sprint、Lumina2 和 OmniGen 等图像生成管线。该版本加入层级权重转换、分组卸载、远程 VAE、缓存推理和 Quanto 量化,并支持 LoRA 热插拔与管线 dtype map。

    推荐理由:Diffusers 0.33.0 将 Wan2.1、LTX Video 0.9.5 等视频管线与层级卸载、缓存推理和量化能力整合到同一版本,便于评估生成工作流的显存与速度取舍。

4月1日周二
  1. Replicate · 模型与制作实践77

    Wan 2.1 如何制作风格化视频

    Wan 2.1 支持从文本或图像生成视频,并可通过 LoRA 进行风格迁移。Replicate 提供了 480p 和 720p 的文本生视频模型,以及使用预制权重或自有图片训练风格 LoRA 的流程;自定义训练至少需要 25 张图片和一个 trigger_word。

    推荐理由:材料展示了使用预制 LoRA 和自有图片训练风格 LoRA 的 Wan 2.1 视频工作流,包含可复用的输入与训练步骤。

3月28日周五
3月5日周三
  1. Replicate · 模型与制作实践80

    Replicate 接入 Wan2.1,提供 API 生成 480p 和 720p 视频

    Replicate 为 Wan2.1 提供可扩展云端 API,支持 480p/720p 文本生视频与图像生视频。14B 模型在 Replicate 上生成 5s 视频,480p 约需 39s、720p 约需 150s;另有面向消费级 GPU 的 1.3B 模型。文章还介绍了 guide_scale、shift 和 steps 等可调参数。

    推荐理由:文章同时给出 Wan2.1 的文本生视频与图像生视频 API 入口、分辨率和参数设置,便于按实验速度与输出分辨率选择模型版本。

1月24日周五
  1. Replicate · 模型与制作实践87

    Replicate 支持微调开源视频模型 HunyuanVideo

    Replicate 已将 Musubi Tuner 适配到平台,支持用户用自有视觉内容微调 HunyuanVideo 视频模型。文章提供从视频切片与字幕生成、LoRA 训练到浏览器或 API 调用的流程,默认训练通常需要约 5-10 分钟。

    推荐理由:文章把视频微调拆成数据准备、训练和调用四步,并给出训练时长与参数调节建议,适合评估自定义视觉风格和运动效果的落地路径。

1月20日周一
  1. ByteDance Seed · 音频与多模态交互73

    豆包实时语音大模型上线并全量开放,端到端语音对话支持随时打断

    豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。

    推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。

1月17日周五
1月16日周四