跳到正文

Seed / 即梦 / 剪映

多模态生成与编辑、Seedance / Seedream、即梦与剪映的创作流程及开放方式。

24条精选

最新精选

第 1–20 条 · 共 24 条
9月23日周三
  1. ComfyUI · 工作流与实践75

    Comfy 发布 Comfy Router,用一个 API 调用前沿图像视频模型

    Comfy 在 Comfy Developer Platform 上线 Comfy Router,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,并按任务选择供应商。

    推荐理由:Comfy Router 把多家供应商的前沿图像视频模型收进一个 API,读者可据此判断多供应商切换与排队重试对现有生成流程的改动。

8月8日周六
  1. ComfyUI · 工作流与实践78

    Seedance 2.5 通过 Partner Nodes 上线 ComfyUI

    Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,单次生成一段连续 30 秒视频,无需拼接短片。单次生成最多可接入 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中逐条指定。

    推荐理由:ComfyUI 接入 Seedance 2.5 后,可据此判断单次 30 秒连续生成与 50 个参考素材对现有分镜拼接流程的替代空间。

8月5日周三
  1. ByteDance Seed · 音频与多模态交互83

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,已在豆包 App 全量上线

    字节 Seed 正式推出原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持在连续多模态流上实时交互。官方称端到端人工评测中,相比级联模型音视频对话节奏问题减少一半,单次对话顺畅完整交流的概率明显提升。该模型已在豆包 App 全量上线,更新后在对话框选择打电话进入视频通话即可体验。

    推荐理由:官方披露了统一架构、端到端评测口径与豆包全量上线入口,可据此判断全双工音视频交互的落地形态。

7月31日周五
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.5 正式发布:单次生成 30 秒、支持多轮延长

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,延续 Seedance 2.0 统一的多模态音视频联合生成架构,重点突破长叙事、多模态参考和编辑能力。

    推荐理由:官方给出 30 秒单次生成、多模态参考与时间戳编辑的具体能力边界,可据此判断长叙事视频工作流的可用性。

7月20日周一
  1. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布音频创作模型 Seed Audio 1.0

    字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,并已在火山方舟体验中心上线。模型支持一条 prompt 编排对白、音效与环境声,时间控制精度达 100ms,支持零样本音色生成与参考音频延展,单次可生成约 2 分钟音频并继续延长以保持角色一致性。

    推荐理由:官方披露了统一建模多要素音频、100ms 时间控制与 20+ 语种等能力,可据此判断其在配音与多语种内容生产中的可用边界。

7月8日周三
  1. ByteDance Seed · 视觉生成与编辑80

    字节 Seedream 5.0 Pro 发布,主打复杂信息图与交互式精准编辑

    字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面提升,并带来复杂信息可视化、交互式精准编辑、真实影像与人像质感、原生多语种输入与生成四大能力突破。

    推荐理由:官方给出信息图生成、交互式精准编辑与多语种渲染的能力边界,可据此判断图像模型在专业设计流程中的可用程度。

7月3日周五
  1. Diffusers · Releases62

    Diffusers 0.39.0 发布:新增 Cosmos 3、Ideogram 4、Krea 2 等多条图像与视频管线

    Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。

    推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。

4月23日周四
  1. ByteDance Seed · 视觉生成与编辑71

    字节 Seed 发布 3D 生成大模型 Seed3D 2.0,几何与纹理均称达 SOTA

    字节 Seed 正式发布新一代 3D 生成大模型 Seed3D 2.0,围绕几何精度和材质质量做架构升级,官方称在几何生成、纹理材质生成两项核心指标上均取得 SOTA。

    推荐理由:官方披露了两阶段 DiT 几何生成与统一 PBR 材质方案,可据此判断 3D 生成在仿真与部件级建模上的可用边界。

4月15日周三
  1. Replicate · 模型与制作实践76

    如何用 Seedance 2.0 制作出色视频

    Replicate 发布 Seedance 2.0 使用教程,介绍该模型可同时接收最多 9 张图片、3 段视频、3 个音频和文本提示,并用 [Image1]、[Audio1] 等标记在提示词中引用素材。

    推荐理由:通过参考素材组合、时间码分镜和音画同源三条实操路径,可迁移到需要角色一致性与多镜头调度的视频创作流程。

4月9日周四
  1. ByteDance Seed · 音频与多模态交互77

    字节 Seed 发布全双工语音大模型 Seeduplex,已在豆包 App 全量上线

    字节 Seed 正式推出原生全双工语音大模型 Seeduplex,基于边听边说框架,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其复杂场景误回复率和误打断率减少一半,抢话比例相对下降 40%,判停 MOS 分提高 8%、对话流畅度 MOS 分提升 12%,快问快答场景时延降低约 250ms。

    推荐理由:官方给出全双工语音模型的架构思路与多项对比数据,可据此判断实时语音交互的技术路线与落地进度。

2月24日周二
  1. Replicate · 模型与制作实践62

    Replicate 实测 Seedream 5.0 提示词写法

    Replicate 发布 Seedream 5.0 提示词实践指南,基于大量实测总结该模型在摄影语言理解、示例式编辑、风格迁移、多步推理、精确指令跟随、专业领域知识和文字渲染上的表现。示例式编辑可给出一组前后对比图加第三张图,让模型自行推断变化并套用,无需文字描述;提示词建议用自然语言而非关键词堆叠,需要渲染的文字用双引号包裹,复杂编辑可用箭头、方框或彩色区域标注位置。

    推荐理由:Replicate 实测 Seedream 5.0 的提示词写法,示例式编辑和视觉标记对复杂改图流程有直接借鉴。

2月13日周五
  1. ByteDance Seed · 视觉生成与编辑77

    字节 Seedream 5.0 Lite 发布:引入实时检索增强与多步视觉推理

    字节跳动 Seed 团队发布 Seedream 5.0 Lite 智能图像创作模型,相比 4.0 在理解、推理和生成方面全面提升,并首次为 Seedream 系列引入实时检索增强能力,可联网获取最新资讯回应时效性创作需求。

    推荐理由:官方披露了多模态统一架构与实时检索增强的落地方式,可据此判断图像模型向推理型创作助手演进的具体路径。

2月12日周四
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.0 正式发布,支持四种模态输入与音视频联合生成

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入,可同时输入多达 9 张图片、3 段视频、3 段音频及自然语言指令。

    推荐理由:官方给出多模态参考、视频编辑与双声道音频的能力边界和失败项,可据此判断其在电商与影视流程中的可用位置。

12月16日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节 Seedance 1.5 pro 音视频创作模型正式发布

    字节 Seed 团队正式发布新一代音视频创作模型 Seedance 1.5 pro,支持文本到音视频合成与图像引导的音视频生成,已上线即梦AI和豆包。模型采用基于 MMDiT 的统一音视频联合生成框架,实现口型、语调与表演节奏的音画同步,原生支持中文、英文、日文、韩语、西班牙语、印尼语及四川话、粤语等方言。

    推荐理由:官方披露了音视频联合生成的架构与评测细节,可据此判断音画同步能力在短剧、广告等场景的可用边界。

11月27日周四
  1. ByteDance Seed · 视觉生成与编辑77

    字节跳动 Seed 发布 Depth Anything 3,单一 Transformer 实现任意视角空间重建

    字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。

    推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。

10月23日周四
  1. ByteDance Seed · 视觉生成与编辑74

    字节 Seed 发布 Seed3D 1.0,单图生成高精度 3D 模型

    字节跳动 Seed 团队发布 3D 生成大模型 Seed3D 1.0,可从单张图像端到端生成含精细几何、真实纹理和 PBR 材质的完整 3D 模型。模型基于 Diffusion Transformer 架构,1.5B 参数版本在几何生成上超过 3B 参数的 Hunyuan3D-2.1,纹理与材质生成性能超过此前开源及闭源模型。

    推荐理由:官方给出架构、参数规模与对比基线,可据此判断单图生成仿真级 3D 资产在机器人训练中的可用边界。

9月23日周二
  1. Replicate · 模型与制作实践68

    Replicate 对多款图像编辑模型的对比评测:如何选择合适模型

    Replicate 对多款图像编辑模型进行了对象移除、视角转换、背景编辑、文字编辑和风格迁移测试,并比较了价格与推理时间。

    推荐理由:这份按对象移除、视角转换、背景编辑、文字编辑和风格迁移展开的对比,可为图像编辑模型的任务选型提供具体参照。

9月9日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节跳动 Seed 团队发布 Seedream 4.0 图像创作模型

    字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。

    推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。

7月24日周四
  1. ByteDance Seed · 音频与多模态交互73

    字节 Seed 发布端到端同声传译模型 Seed LiveInterpret 2.0,延迟低至 2-3 秒

    字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。

    推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。

7月21日周一
  1. Replicate · 模型与制作实践62

    Replicate 实测四款图像模型:单张参考图生成一致角色谁更强

    Replicate 对比了截至 2025 年 7 月可用于单张参考图生成一致角色的四款模型:OpenAI gpt-image-1、Runway Gen-4 Image、Black Forest Labs FLUX.1 Kontext 和字节 SeedEdit 3,并补充了之后发布的 Ideogram Character 与 Gen-4 Image Turbo。

    推荐理由:作者用同一参考图横向实测四款图像模型,给出角色一致性与风格化任务的选型建议和失败边界。