World Labs 发布 Spark 2.0,为网页端 3DGS 加入 LoD 流式渲染
World Labs 发布 Spark 2.0,为基于 THREE.js 和 WebGL2 的开源 3DGS 渲染器加入 Level-of-Detail 系统,可按视角连续调整细节并通过网络流式加载数据。
推荐理由:World Labs 公开了 Spark 2.0 的 LoD、渐进流式与虚拟显存三项技术细节,可据此判断大场景 3DGS 在浏览器端的落地条件。
World Labs 发布 Spark 2.0,为基于 THREE.js 和 WebGL2 的开源 3DGS 渲染器加入 Level-of-Detail 系统,可按视角连续调整细节并通过网络流式加载数据。
推荐理由:World Labs 公开了 Spark 2.0 的 LoD、渐进流式与虚拟显存三项技术细节,可据此判断大场景 3DGS 在浏览器端的落地条件。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人所需的空间推理、多视角理解、任务规划和成功检测能力。模型新增仪表读数能力,可通过 Gemini API 和 Google AI Studio 提供给开发者,并支持调用 Google Search、VLA 或用户自定义函数。
推荐理由:文章给出 Gemini Robotics-ER 1.6 在空间推理、多视角成功检测和仪表读数上的能力变化,并说明其通过 Gemini API 与 Google AI Studio 接入机器人工作流的方式。
字节 Seed 正式推出原生全双工语音大模型 Seeduplex,基于边听边说框架,已在豆包 App 全量上线。官方称相比上一代半双工豆包端到端语音模型,其复杂场景误回复率和误打断率减少一半,抢话比例相对下降 40%,判停 MOS 分提高 8%、对话流畅度 MOS 分提升 12%,快问快答场景时延降低约 250ms。
推荐理由:官方给出全双工语音模型的架构思路与多项对比数据,可据此判断实时语音交互的技术路线与落地进度。
World Labs 发布长文《3D as code》,提出 3D 是描述和交互物理与虚拟世界的通用接口,类比关系为 3D 相当于代码、神经图形相当于编程语言、仿真引擎相当于芯片。
推荐理由:World Labs 把 3D 类比为代码、仿真引擎类比为芯片,为判断世界模型该走端到端还是混合架构提供了一条清晰的分析框架。
Recraft 发布图像生成模型 Recraft V4,主打所谓“设计品味”,在构图、光线和色彩上做出更接近美术指导的视觉决策。
推荐理由:四个版本在分辨率、速度与价格上的差异,以及原生 SVG 输出,可作为图像生成选型与设计资产工作流的参考。
字节跳动 Seed 团队发布 Seedream 5.0 Lite 智能图像创作模型,相比 4.0 在理解、推理和生成方面全面提升,并首次为 Seedream 系列引入实时检索增强能力,可联网获取最新资讯回应时效性创作需求。
推荐理由:官方披露了多模态统一架构与实时检索增强的落地方式,可据此判断图像模型向推理型创作助手演进的具体路径。
ElevenLabs 宣布 Eleven v3 文本转语音模型结束 Alpha 阶段并正式可用,现已在所有平台开放。在覆盖 8 种语言、27 个类别的内部基准中,错误率从 15.3% 降至 4.9%,错误减少 68%;测试中用户有 72% 的时间更偏好新版本而非此前 Alpha 版本。更新重点包括更准确处理数字、符号和专业记号,例如将电话号码、货币、化学式和体育比分按上下文朗读。
推荐理由:这次更新提供了文本转语音模型在跨语言符号朗读和稳定性上的具体变化,便于评估号码、公式与复杂格式的生成可用性。
字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。
推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。
World Labs 宣布 Marble 多模态世界模型面向所有用户开放,可从文本、图像、视频或粗略 3D 布局生成 3D 世界。Marble 支持交互式编辑、扩展和组合世界,并可导出为 Gaussian splats、网格或视频;同时推出创作中心 Marble Labs。
推荐理由:Marble 将文本、图像、视频和粗略 3D 布局纳入同一创作流程,并提供编辑、扩展与导出能力,可用于判断其对世界构建工作流的适配度。
字节跳动 Seed 团队发布 3D 生成大模型 Seed3D 1.0,可从单张图像端到端生成含精细几何、真实纹理和 PBR 材质的完整 3D 模型。模型基于 Diffusion Transformer 架构,1.5B 参数版本在几何生成上超过 3B 参数的 Hunyuan3D-2.1,纹理与材质生成性能超过此前开源及闭源模型。
推荐理由:官方给出架构、参数规模与对比基线,可据此判断单图生成仿真级 3D 资产在机器人训练中的可用边界。
World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可随交互实时生成视频,用于探索生成的 3D 世界和真实场景,今日以 research preview 形式开放,并可在浏览器中体验。
推荐理由:RTFM 把世界模型做成单卡实时渲染器,读者可据此判断实时 3D 生成在算力与持久性上的可行边界。
World Labs 发布 Marble 有限访问测试版,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由探索的 3D 世界,官方称无时间限制、无变形、无一致性问题。
推荐理由:World Labs 首次开放 Marble 有限测试,可据此判断图像或文本生成可持久导航 3D 世界在创作流程中的可用边界。
字节跳动 Seed 团队正式发布新一代图像创作模型 Seedream 4.0,用同一套架构统一文生图与通用编辑能力,并融合常识与推理。相比 Seedream 3.0 和 SeedEdit 3.0,其多模态玩法、风格化美感、逻辑理解力均有提升,最高分辨率从 2K 扩展至 4K,DiT 生图推理速度提升超 10 倍。
推荐理由:官方给出统一架构下的生成与编辑能力、4K 与推理加速细节,可据此判断图像创作工具链的选型方向。
Hugging Face 发布 Diffusers v0.35.1,重点改进 Qwen-Image Edit。该版本包含 PR #12188 和 #12190,贡献者为 naykun。
Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。
推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。
字节跳动 Seed 团队发布端到端同声传译模型 Seed LiveInterpret 2.0,支持中英互译,采用全双工语音理解生成框架实现边听边说,翻译延迟低至 2-3 秒,较传统机器同传降低超 60%。
推荐理由:官方给出中英同传的准确率、延迟与声音复刻数据,可据此判断实时语音翻译的可用边界。
Replicate 公开了其 FLUX.1 Kontext [dev] 实现的优化方法 TaylorSeer,用缓存的特征导数配合 Taylor 级数近似被跳过的去噪步,把模型调用从约 30 步降到 10 至 15 步,同时尽量保持质量。
推荐理由:Replicate 公开了 FLUX.1 Kontext 的 TaylorSeer 缓存加速实现,读者可据此理解扩散模型跳步近似与质量取舍。
Replicate 发布 AI 视频模型对比,列出 Google Veo 3、字节 Seedance 1、MiniMax Hailuo 02、快手 Kling 2.1。
字节跳动 Seed 团队发布视频生成基础模型 Seedance 1.0,支持文字与图片输入,可生成多镜头无缝切换的 1080p 视频,并已公开技术报告。官方称在第三方评测榜单 Artificial Analysis 的文生视频、图生视频两个任务上均位居首位,5 秒 1080p 视频在 L20 上实测推理耗时 41.4 秒。模型已通过即梦、豆包及火山引擎 API 开放使用,技术报告可在项目主页查看。
推荐理由:官方技术报告披露了多镜头叙事、统一任务框架与推理加速的具体设计,可供视频生成选型与创作流程参考。
字节跳动 Seed 团队发布图像编辑模型 SeedEdit 3.0,基于文生图模型 Seedream 3.0 构建,可处理并生成 1K 以上高清图像,在主体、背景和细节保持上进一步提升。
推荐理由:官方披露了保持力与可用率的量化提升及数据融合、奖励模型等训练细节,可供图像编辑选型与工作流设计参考。
Black Forest Labs 发布图像编辑模型 FLUX.1 Kontext,提供 [pro]、[max] 和即将推出的 [dev] 三个版本,可进行颜色替换、背景编辑、文字替换和风格迁移,并保持角色一致性。Replicate 还介绍了社区在发型变换、职业头像、老图修复、画幅扩展和移除文字等场景中的使用案例,以及 Kontext Chat 和可直接使用的 Kontext 应用。
推荐理由:文章同时梳理 FLUX.1 Kontext 的版本差异、提示词方法与社区案例,适合参考图像编辑和社交内容改版的工作流。
Black Forest Labs 推出图像编辑模型 FLUX.1 Kontext,Replicate 已上线 [pro] 与 [max] 两个版本,开放权重的 [dev] 版本即将发布。
推荐理由:梳理了 FLUX.1 Kontext 三个版本的开放方式与提示词写法,可据此判断图像编辑的选型与可控编辑流程。
Google DeepMind 的最新旗舰图像模型 Imagen 4 现可在 Replicate 上运行,目前为预览版,行为与功能可能变化,需求高时可能出现排队。
推荐理由:Replicate 上线 Google Imagen 4 预览版,读者可据此了解其文字渲染与细节表现及接入方式。
Ideogram 发布文生图模型 3.0 版本,在真实感、风格控制和版式生成上有较大改进,并分为 Turbo、Balanced、Quality 三个档位,均已上线 Replicate。Turbo 适合快速迭代,Quality 追求最高保真,Balanced 居中。该版本支持用参考图做风格迁移,并宣称在人工评测的 ELO 打分中于真实感、对齐度和多样性上高于其他图像生成模型。
推荐理由:Ideogram 3.0 三个档位在文字渲染、版式与风格参考上的分工,可供设计营销类图像选型参考。
字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。
推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。
Diffusers 发布 v0.33.1,修复了 wan pipelines 的 ftfy 导入问题,该修复由 @yiyixuxu 在 #11262 中提交。此版本距上一版本已有 1620 次提交。
豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。
推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。
Black Forest Labs 发布 FLUX.1 Tools,为 FLUX 文生图模型增加控制与可引导能力,包含 Fill、Canny、Depth、Redux 四项功能。
推荐理由:FLUX.1 Tools 把局部重绘、边缘与深度控制、图像变体整合进同一模型族,可据此判断可控生成在编辑流程中的可用边界。
Replicate 宣布 Stable Diffusion 3.5 已上线,提供 Large、Large Turbo 和 Medium 三种版本,分别侧重画质、速度与消费级硬件运行。
推荐理由:文章同时给出三种规格、API价格和Medium权重入口,便于按画质、速度与本地运行条件选择模型。
Black Forest Labs 发布 FLUX1.1 [pro],这是 FLUX.1 [pro] 的更快版本,生成速度为前代 6 倍,并提升图像质量、提示词遵循度和输出多样性。
推荐理由:文章同时给出 FLUX1.1 [pro] 的速度、质量与价格变化,并展示 Prompt upsampling 对图像生成工作流的影响。
Replicate 介绍 FLUX.1,这款可根据文字生成图像的新 AI 模型采用 flow matching,而非扩散模型。文章通过文字渲染、玻璃花朵、复杂场景和艺术风格等提示词,观察其在文字、光影、材质与构图方面的表现。文中所有图片均使用面向速度和本地执行优化的 FLUX.1 [schnell] 生成,可在 Replicate 上试用。
推荐理由:文章通过多组提示词展示 FLUX.1 在文字渲染、光影材质和复杂构图上的表现,并呈现 flow matching 带来的流动感审美。
Replicate 周报汇总本周开源 AI 动态:Black Forest Labs 发布图像生成模型套件 FLUX.1,含 pro、dev 和以 Apache 2.0 许可开源的 schnell 三个版本。
推荐理由:汇总一周开源模型与工具动态,并借编辑手记讨论生成模型作为世界镜像的反馈循环。
Fal.ai 发布 68 亿参数开源文生图模型 AuraFlow,性能对标闭源方案。研究者推出 llama.ttf,将完整语言模型推理引擎嵌入字体文件。Google DeepMind 提出 JEST 方法,数据筛选效率比随机采样高 13 倍,可用 10 倍更少算力训练高质量多模态模型。