科普
基础 已发布

AI 三维建模究竟生成了什么

点云、网格、体素、NeRF 和 3D Gaussian 都能描述三维场景,但它们的可编辑性、渲染方式和适用任务不同。

点云 离散采样点
网格 顶点、边与面
体素 三维规则网格
神经场 / Gaussian 连续场或显式高斯
本页目录

AI 三维建模究竟生成了什么

“生成了一个三维模型”不是一个足够精确的描述。屏幕上能够旋转的结果,背后可能是点、三角面、规则体素、神经辐射场或一组带方向和颜色的高斯。它们都能产生三维观感,却不一定能进入同一套编辑、绑定和动画流程。

先看四种常见表示

点云由离散的三维采样点组成。每个点可以携带颜色、法线等属性。它适合保存扫描结果和观察几何分布,但点与点之间没有天然的表面连接关系。

网格用顶点、边和面描述表面。游戏角色常用三角网格,因为骨骼蒙皮、UV、材质、碰撞和 LOD 都有成熟的网格工具链。网格是否“能用”,不只取决于外形,还取决于面的连接方式。

体素把空间划分为三维格子。它便于表达占用关系和内部结构,代价是分辨率提高后内存增长很快。

神经场与 3D Gaussian主要面向新视角合成。NeRF 用神经网络表示空间中的密度与颜色;3D Gaussian Splatting 使用可优化的三维高斯进行实时渲染。它们可以保留丰富的视图外观,但不能直接替代角色制作所需的整洁网格、UV 和骨骼结构。

“看起来像三维”与“可编辑资产”不同

判断一种表示是否适合人物资产,可以依次问:

  1. 能否选择并修改明确的部件?
  2. 能否给表面建立连续的 UV 和材质?
  3. 顶点是否有稳定的语义,能否跟随骨骼变形?
  4. 能否导出到 Blender、Godot、Unity 或 Unreal 的常用格式?
  5. 修改一个局部后,是否需要重新训练或重新优化整个表示?

对本文研究目标而言,图像生成的中间表示可以多样,但最终仍需要落到分层、可编辑、拓扑可控的网格资产。NeRF 或 Gaussian 可以作为外观与视图信息的来源,不能单独完成角色交付。

网格还包含哪些信息

一份人物网格通常还要配合:

信息作用缺失时的直接后果
法线决定表面如何参与光照明暗断裂或方向错误
UV把二维纹理映射到三维表面纹理无法稳定贴合
材质参数描述底色、粗糙度、金属度等外观只停留在几何灰模
骨骼与权重控制网格随关节变形角色不能可靠地做动作
部件层级区分身体、头发、衣物和附件难以替换、隐藏或独立模拟

继续阅读

下一节从相机开始:三维点为什么会在图像里落到某个像素上。