跳到正文

Seed / 即梦 / 剪映

多模态生成与编辑、Seedance / Seedream、即梦与剪映的创作流程及开放方式。

24条精选

最新精选

第 21–24 条 · 共 24 条
6月11日周三
  1. ByteDance Seed · 视觉生成与编辑86

    字节跳动 Seed 发布 Seedance 1.0 视频生成模型并公开技术报告

    字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。

    推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。

6月6日周五
  1. ByteDance Seed · 视觉生成与编辑78

    字节跳动 Seed 发布图像编辑模型 SeedEdit 3.0

    字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。

    推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。

4月16日周三
  1. ByteDance Seed · 视觉生成与编辑82

    字节 Seed 发布 Seedream 3.0 文生图模型技术报告

    字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。

    推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。

1月20日周一
  1. ByteDance Seed · 音频与多模态交互73

    豆包实时语音大模型上线并全量开放,端到端语音对话支持随时打断

    豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。

    推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。