跳到正文

#3D/空间

今日 0 条
10月2日周五
  1. Luma · 创作产品与实践50

    2026 年建筑师最佳 AI 渲染工具

    2026 年建筑师的 AI 渲染工具选择正从试验转向工作流决策,重点比较建筑信息建模集成、画质与设计修改能力;44% 的建筑师已用 AI 制作概念图,74% 计划增加使用。Luma 以 Ray 3.2、图层编辑、场景变换和可重复工作流覆盖从概念图到动画制作;Veras 可直接连接 Revit、SketchUp、Rhino 等六个平台,Enscape 则提供实时渲染与虚拟现实漫游。

9月22日周二
9月21日周一
9月15日周二
9月10日周四
9月1日周二
  1. World Labs · 空间智能与世界模型85

    World Labs 发布世界模型 Atlas,原生支持文本、图像、视频与 3D

    World Labs 发布下一代世界模型 Atlas,这是一个从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频和 3D,所有输入被组合进共享的空间上下文。

    推荐理由:Atlas 把相机位姿与 3D 深度作为原生输入,读者可据此判断世界模型在可控生成与稀疏重建上的路线差异。

8月26日周三
7月28日周二
7月21日周二
  1. Hugging Face Blog65

    Grabette 发布开源低成本机器人操作数据采集系统

    Pollen Robotics 发布 Grabette,一套用手持夹爪记录机器人操作数据的开源系统,可将演示自动处理为 LeRobot 数据集并上传到 Hugging Face Hub。

    推荐理由:文章给出了从手持采集到 LeRobot 数据集的完整流程,以及硬件成本和示例训练链路,便于评估机器人数据采集的落地门槛。

7月15日周三
  1. ComfyUI · Releases79

    ComfyUI v0.28.0 更新,新增 ByteDance 模型与 3D 节点并修复四个漏洞

    ComfyUI 发布 v0.28.0,新增 Seed Audio 1.0、Seedream 5 Pro、SeedVR2 支持以及 Save 3D (Advanced) 节点族。版本还修复了四个安全漏洞,改进 Qwen3-VL、自定义嵌入、视频音频流和 int4 模型等问题。

    推荐理由:该版本把模型接入、3D 工作流与安全修复集中在一次更新中,可用于评估 ComfyUI 对视频、图像和 3D 创作链路的覆盖变化。

6月3日周三
  1. World Labs · 空间智能与世界模型62

    World Labs 提出世界模型功能分类:渲染器、模拟器与规划器

    World Labs 发布文章,把当前被称为世界模型的能力拆成三类功能:渲染器输出像素、追求视觉保真;模拟器输出状态,要求几何、物理与动力学忠实;规划器输出动作,回答智能体下一步该做什么。

    推荐理由:World Labs 把世界模型拆成渲染、模拟、规划三类,并说明模拟为何是连接视觉与行动的关键环节。

4月23日周四
  1. ByteDance Seed · 视觉生成与编辑71

    字节 Seed 发布 3D 生成大模型 Seed3D 2.0,几何与纹理均称达 SOTA

    字节 Seed 正式发布新一代 3D 生成大模型 Seed3D 2.0,围绕几何精度和材质质量做架构升级,官方称在几何生成、纹理材质生成两项核心指标上均取得 SOTA。

    推荐理由:官方披露了两阶段 DiT 几何生成与统一 PBR 材质方案,可据此判断 3D 生成在仿真与部件级建模上的可用边界。

4月14日周二
  1. World Labs · 空间智能与世界模型76

    World Labs 发布 Spark 2.0,为网页端 3DGS 加入 LoD 流式渲染

    World Labs 发布 Spark 2.0,为基于 THREE.js 和 WebGL2 的开源 3DGS 渲染器加入 Level-of-Detail 系统,可按视角连续调整细节并通过网络流式加载数据。

    推荐理由:World Labs 公开了 Spark 2.0 的 LoD、渐进流式与虚拟显存三项技术细节,可据此判断大场景 3DGS 在浏览器端的落地条件。

4月13日周一
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人所需的空间推理、多视角理解、任务规划和成功检测能力。模型新增仪表读数能力,可通过 Gemini API 和 Google AI Studio 提供给开发者,并支持调用 Google Search、VLA 或用户自定义函数。

    推荐理由:文章给出 Gemini Robotics-ER 1.6 在空间推理、多视角成功检测和仪表读数上的能力变化,并说明其通过 Gemini API 与 Google AI Studio 接入机器人工作流的方式。

3月3日周二
  1. World Labs · 空间智能与世界模型62

    World Labs 长文:3D 是人与机器交互的代码,世界模型将走向可编程空间系统

    World Labs 发布长文《3D as code》,提出 3D 是描述和交互物理与虚拟世界的通用接口,类比关系为 3D 相当于代码、神经图形相当于编程语言、仿真引擎相当于芯片。

    推荐理由:World Labs 把 3D 类比为代码、仿真引擎类比为芯片,为判断世界模型该走端到端还是混合架构提供了一条清晰的分析框架。

2月18日周三
  1. World Labs · 空间智能与世界模型73

    World Labs 宣布获得 $1 billion 新融资

    World Labs 宣布获得 $1 billion 新融资,投资方包括 AMD、Autodesk、NVIDIA 和 Sea 等。公司表示将加速空间智能与世界模型研发,其首款产品 Marble 可根据图像、视频或文本创建具有空间连贯性、高保真度和持久性的 3D 世界。

    推荐理由:融资规模与投资方名单呈现了 World Labs 推进空间智能和世界模型产品化的资源基础,Marble 的输入形式也提供了创作工具选型参考。

1月21日周三
  1. World Labs · 空间智能与世界模型86

    World Labs 发布 World API,将文本和视频生成可探索 3D 世界

    World Labs 发布 World API,调用 Marble 多模态世界模型,可从文本、图像、全景、多视图输入和视频生成可导航的 3D 世界。生成结果支持浏览器渲染、导出到下游工具,或集成进互动系统与模拟流程。World API 已通过 World Labs Platform 提供,平台支持管理 API keys、查看用量与计费、购买 credits 及访问文档。

    推荐理由:World API 将多种视觉与文本输入转为可探索 3D 世界,并提供渲染、导出和应用集成入口,可用于评估空间内容生成工作流。

11月27日周四
  1. ByteDance Seed · 视觉生成与编辑77

    字节跳动 Seed 发布 Depth Anything 3,单一 Transformer 实现任意视角空间重建

    字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。

    推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。

11月12日周三
  1. World Labs · 空间智能与世界模型92

    World Labs 开放 Marble 多模态世界模型,支持多输入生成与 3D 编辑

    World Labs 宣布 Marble 多模态世界模型面向所有用户开放,可从文本、图像、视频或粗略 3D 布局生成 3D 世界。Marble 支持交互式编辑、扩展和组合世界,并可导出为 Gaussian splats、网格或视频;同时推出创作中心 Marble Labs。

    推荐理由:Marble 将文本、图像、视频和粗略 3D 布局纳入同一创作流程,并提供编辑、扩展与导出能力,可用于判断其对世界构建工作流的适配度。

10月23日周四
  1. ByteDance Seed · 视觉生成与编辑74

    字节 Seed 发布 Seed3D 1.0,单图生成高精度 3D 模型

    字节跳动 Seed 团队发布 3D 生成大模型 Seed3D 1.0,可从单张图像端到端生成含精细几何、真实纹理和 PBR 材质的完整 3D 模型。模型基于 Diffusion Transformer 架构,1.5B 参数版本在几何生成上超过 3B 参数的 Hunyuan3D-2.1,纹理与材质生成性能超过此前开源及闭源模型。

    推荐理由:官方给出架构、参数规模与对比基线,可据此判断单图生成仿真级 3D 资产在机器人训练中的可用边界。

10月16日周四
  1. World Labs · 空间智能与世界模型78

    World Labs 发布实时世界模型 RTFM

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可随交互实时生成视频,用于探索生成的 3D 世界和真实场景,今日以 research preview 形式开放,并可在浏览器中体验。

    推荐理由:RTFM 把世界模型做成单卡实时渲染器,读者可据此判断实时 3D 生成在算力与持久性上的可行边界。

9月16日周二
  1. World Labs · 空间智能与世界模型78

    World Labs 推出 Marble 有限测试版,图像或文本可生成可导航 3D 世界

    World Labs 发布 Marble 有限访问测试版,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由探索的 3D 世界,官方称无时间限制、无变形、无一致性问题。

    推荐理由:World Labs 首次开放 Marble 有限测试,可据此判断图像或文本生成可持久导航 3D 世界在创作流程中的可用边界。

3月28日周五
8月16日周五
  1. Replicate · 模型与制作实践73

    Replicate Intelligence #11:Replicate 支持微调 FLUX.1,汇总数字人、可控视频与可玩游戏世界项目

    Replicate 宣布支持在平台上用自有图片微调 FLUX.1 图像生成模型,用户可上传 12-20 张多样图片并设置触发词,约 30 分钟生成定制模型。

    推荐理由:这期内容给出 FLUX.1 微调所需的图片数量与耗时,并串联数字人、可控视频和可玩游戏世界案例,便于比较不同生成工作流。