跳到正文

多模态基模

统一理解与生成,跨图像、视频、音频的模型能力和技术报告。

66条精选

最新精选

第 61–66 条 · 共 66 条
11月12日周三
  1. World Labs · 空间智能与世界模型92

    World Labs 开放 Marble 多模态世界模型,支持多输入生成与 3D 编辑

    World Labs 宣布 Marble 多模态世界模型面向所有用户开放,可从文本、图像、视频或粗略 3D 布局生成 3D 世界。Marble 支持交互式编辑、扩展和组合世界,并可导出为 Gaussian splats、网格或视频;同时推出创作中心 Marble Labs。

    推荐理由:Marble 将文本、图像、视频和粗略 3D 布局纳入同一创作流程,并提供编辑、扩展与导出能力,可用于判断其对世界构建工作流的适配度。

9月9日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节跳动 Seed 团队发布 Seedream 4.0 图像创作模型

    字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。

    推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。

7月24日周四
  1. ByteDance Seed · 音频与多模态交互73

    字节 Seed 发布端到端同声传译模型 Seed LiveInterpret 2.0,延迟低至 2-3 秒

    字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。

    推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。

6月11日周三
  1. ByteDance Seed · 视觉生成与编辑86

    字节跳动 Seed 发布 Seedance 1.0 视频生成模型并公开技术报告

    字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。

    推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。

5月22日周四
  1. Replicate · 模型与制作实践68

    Replicate上线 OpenAI 最新聊天、视觉与推理模型

    Replicate现已支持运行 OpenAI 的 GPT-4.1、GPT-4o 和 o-series 等聊天、视觉与推理模型。GPT-4.1系列支持最长 1 million tokens 的上下文,GPT-4o系列处理文本、图像和音频,o-series面向数学、科学与复杂问题的结构化推理。

    推荐理由:材料按上下文、模态、推理任务和成本速度列出模型差异,并给出 Replicate 网页界面与 API 的操作入口。

1月20日周一
  1. ByteDance Seed · 音频与多模态交互73

    豆包实时语音大模型上线并全量开放,端到端语音对话支持随时打断

    豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。

    推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。