Blog3dgenPart V · 前馈大重建 LRM
Part V · 前馈大重建 LRM

把"图像→3D"压进一次前向

SDS 逐资产优化、多视图还要跑采样循环。LRM 更狠:一个大 transformer,一次前向, 直接把一张(或几张)图映射成 3D 表示。代价从"每个资产推理时优化"挪到了"一次性大规模训练"(Objaverse)。 主攻 痛点 (d) 速度。按输出表示分三代:triplane-NeRF → Gaussian → 直出 mesh。

§5.1开山 · triplane-NeRF 时代

LRM— Large Reconstruction Model for Single Image to 3D
ICLR 2024Hong, Zhang, Gu et al. · Adobe / ANU · arXiv:2311.04400 · project
逐资产优化太慢,且只能做特定类别。

关键想法:一个 5 亿参数的 transformer,从 ~100 万物体里"图像→3D"的映射,而不是逐个优化。DINO 编码图像 → image-to-triplane transformer(triplane token 对图像 token 做 cross-attention 取证据、彼此 self-attention 保 3D 一致)→ triplane-NeRF。

把"逐场景拟合"替换成"一次大规模训练 + 一次前向"——5 秒内出 3D。
Demo 6 · Triplane 查询 · 一个点怎么变成密度
Demo 6 · Triplane 查询 · 一个点怎么变成密度

三张特征平面(XY/XZ/YZ)。在最左边 XY 平面里拖动那个黑点改变查询点的 (x,y)(x,y)。 每张平面在投影位置采一个特征,三者求和 → 小 MLP → 密度。这就是 triplane-NeRF 的"查询一个点"全过程, 也是 LRM 把图像 token 解码成 triplane 之后、渲染时反复做的事。

TripoSR— Fast 3D Object Reconstruction from a Single Image
2024.03Tochilkin, Boss, Jampani et al. · Stability AI / Tripo · arXiv:2403.02151 · code
开源 LRM 还不够快、不够好用。

关键想法:重做数据 / 通道 / 训练细节后的 LRM,单图 <0.5 秒出 mesh,MIT 协议开源——把前馈重建推成了人人能用的基线。

同样的 triplane-NeRF LRM 配方,工程化到亚秒级 + 完全开源。

这一代还有 OpenLRM(开源复现)、Instant3D(文本→4 视图→triplane LRM,来自 Part IV)、 DMV3D2311.09217,把 LRM 放进扩散去噪器里——生成与重建合一,这是通往原生扩散的第一座桥)、 PF-LRM(pose-free,联合估位姿)。

§5.2Gaussian 时代 · 把 triplane 换成像素对齐高斯

triplane-NeRF 渲染慢、容量受限。2024 年这一代把输出换成 像素对齐的 3D 高斯,延迟砍到 ~0.1–0.2 秒。

LGM / GRM / GS-LRM— Large/Gaussian Reconstruction Models(多视图 → 高斯)
triplane-NeRF 是速度/质量瓶颈。

关键想法:从多视图直接预测每像素一个 3D 高斯。LGM 用高吞吐非对称 U-Net;GRM 用纯 transformer(4 视图 ~0.1s);GS-LRM 把 patch 化的图像 token 直接解码成每像素高斯参数(0.23s),还能上场景尺度。

把 LRM 的输出从 triplane-NeRF 换成 3DGS——更快、能渲实时、能处理场景。

同代还有 Splatter Image2312.13150,单图 U-Net 每像素一个高斯,38 FPS)、 GeoLRM(几何感知、稀疏锚点 + 可变形 cross-attention)、Long-LRM(Mamba2+transformer 吃 32 张高分辨率视图做大场景)。 注意 pixelSplat / MVSplat 架构同源但目标是真实场景的新视角合成(不是 Objaverse 物体生成)——细节在隔壁 Feedforward 3DGS 站。

§5.3直出 mesh 时代 · 游戏能直接用的资产

InstantMesh / MeshLRM / CRM— sparse-view LRM 直出 FlexiCubes / DiffMC 网格
NeRF/高斯输出还得后处理才成 mesh,且不水密、无 UV(痛点 d 的"能用")。

关键想法:把可微取面(FlexiCubes / DiffMC,见 §1.3)烤进 LRM,端到端用 mesh 渲染 loss 训练,直出水密网格。InstantMesh 用多视图扩散出 6 视图 → sparse-view LRM + FlexiCubes(~10s);MeshLRM 内嵌 DiffMC(4 视图 <1s);CRM 用卷积 U-Net 出正交三视图→triplane→FlexiCubes。

输出从隐式场/高斯换成直出水密 mesh——省掉后处理,朝生产管线靠了一大步。

还有 MeshFormer(稀疏体素特征 + 3D 卷积 + 法线监督,8 卡可训)、 SF3D2408.00653,TripoSR 后继:快速 UV 展开 + 材质预测 + 去光照,~0.5s 出引擎可用资产)。 注意"去光照 / 材质"这件事——它是 Part VIII 的主题。

§5.4速度 vs 保真 · 为什么还要原生扩散

输入关键词,全站正文即刻可搜(中文分词友好)。
    ↑↓ 选择 · Enter 打开 · Esc 关闭Pagefind