关键想法:一个 5 亿参数的 transformer,从 ~100 万物体里学"图像→3D"的映射,而不是逐个优化。DINO 编码图像 → image-to-triplane transformer(triplane token 对图像 token 做 cross-attention 取证据、彼此 self-attention 保 3D 一致)→ triplane-NeRF。
把"图像→3D"压进一次前向
SDS 逐资产优化、多视图还要跑采样循环。LRM 更狠:一个大 transformer,一次前向, 直接把一张(或几张)图映射成 3D 表示。代价从"每个资产推理时优化"挪到了"一次性大规模训练"(Objaverse)。 主攻 痛点 (d) 速度。按输出表示分三代:triplane-NeRF → Gaussian → 直出 mesh。
§5.1开山 · triplane-NeRF 时代
三张特征平面(XY/XZ/YZ)。在最左边 XY 平面里拖动那个黑点改变查询点的 。 每张平面在投影位置采一个特征,三者求和 → 小 MLP → 密度。这就是 triplane-NeRF 的"查询一个点"全过程, 也是 LRM 把图像 token 解码成 triplane 之后、渲染时反复做的事。
关键想法:重做数据 / 通道 / 训练细节后的 LRM,单图 <0.5 秒出 mesh,MIT 协议开源——把前馈重建推成了人人能用的基线。
这一代还有 OpenLRM(开源复现)、Instant3D(文本→4 视图→triplane LRM,来自 Part IV)、 DMV3D(2311.09217,把 LRM 放进扩散去噪器里——生成与重建合一,这是通往原生扩散的第一座桥)、 PF-LRM(pose-free,联合估位姿)。
§5.2Gaussian 时代 · 把 triplane 换成像素对齐高斯
triplane-NeRF 渲染慢、容量受限。2024 年这一代把输出换成 像素对齐的 3D 高斯,延迟砍到 ~0.1–0.2 秒。
关键想法:从多视图直接预测每像素一个 3D 高斯。LGM 用高吞吐非对称 U-Net;GRM 用纯 transformer(4 视图 ~0.1s);GS-LRM 把 patch 化的图像 token 直接解码成每像素高斯参数(0.23s),还能上场景尺度。
同代还有 Splatter Image(2312.13150,单图 U-Net 每像素一个高斯,38 FPS)、 GeoLRM(几何感知、稀疏锚点 + 可变形 cross-attention)、Long-LRM(Mamba2+transformer 吃 32 张高分辨率视图做大场景)。 注意 pixelSplat / MVSplat 架构同源但目标是真实场景的新视角合成(不是 Objaverse 物体生成)——细节在隔壁 Feedforward 3DGS 站。
§5.3直出 mesh 时代 · 游戏能直接用的资产
关键想法:把可微取面(FlexiCubes / DiffMC,见 §1.3)烤进 LRM,端到端用 mesh 渲染 loss 训练,直出水密网格。InstantMesh 用多视图扩散出 6 视图 → sparse-view LRM + FlexiCubes(~10s);MeshLRM 内嵌 DiffMC(4 视图 <1s);CRM 用卷积 U-Net 出正交三视图→triplane→FlexiCubes。
还有 MeshFormer(稀疏体素特征 + 3D 卷积 + 法线监督,8 卡可训)、 SF3D(2408.00653,TripoSR 后继:快速 UV 展开 + 材质预测 + 去光照,~0.5s 出引擎可用资产)。 注意"去光照 / 材质"这件事——它是 Part VIII 的主题。