LiTo: Surface Light Field Tokenization
论文信息: arXiv:2603.11047v1 [cs.CV], 11 Mar 2026, Jen-Hao Rick Chang, Xiaoming Zhao, Dorian Chan, Oncel Tuzel, Apple
Link: arXiv:2603.11047 | Project Page | Code | ICLR 2026
核心问题是什么?
目的
提出一种3D latent表示,联合建模物体几何和视角相关外观(view-dependent appearance),实现从单张图像生成带有真实光照和材质效果的3D对象。
输入输出
Tokenizer(训练阶段):
- 输入:多视角 RGB-D 图像(RGB + 深度图)→ 表面光场采样 $\mathcal{X} = {(x_i, \hat{d}i, c_i)}{i=1}^N$
- $x_i \in \mathbb{R}^3$:3D 表面点(来自深度图反投影)
- $\hat{d}_i \in S^2$:观察方向(单位向量,从相机中心指向表面点)
- $c_i \in \mathbb{R}^3$:出射颜色(来自 RGB 图像)
- $N \approx 100$ 万:随机子采样的 token 数量
- 输出:k 个 d 维 latent vectors $\mathcal{S} = {\mathbf{s}j}{j=1}^k$
- 同时编码几何信息和视角相关辐射度信息
生成模型(推理阶段):
- 输入:单张 RGB 图像(通过 DINOv2 提取特征作为条件)
- 输出:完整 3D 对象(3D Gaussian Splatting 格式)
- 几何:3DGS 的位置、尺度、不透明度
- 视角相关外观:3DGS 的球谐函数系数(高阶 SH 捕捉高光、菲涅尔反射等)
- 输出坐标系与输入图像视角天然对齐
现有方法及局限性
| 方法类型 | 代表方法 | 几何 | 外观 | 视角相关 | 局限性 |
|---|---|---|---|---|---|
| 纯几何 | ShapeToken, TripoSG, Hunyuan3D | ✅ | ❌ | ❌ | 无法表达纹理、材质、光照效果 |
| 几何+视角无关外观 | TRELLIS | ✅ | ✅(漫反射) | ❌ | 多视角特征mean-pooling,丢失角度变化信息 |
| 几何+PBR材质 | 3DTopia-XL (PrimX) | ✅ | ✅(roughness/metallicity) | ❌ | 需要从mesh优化构建primitive,数据准备复杂 |
| 网格体素 | Direct3D, XCube | ✅ | ❌ | ❌ | 分辨率与内存的权衡,需要watertight mesh预处理 |
核心问题:
- 现有方法无法捕捉视角相关效果(view-dependent effects):高光(specular highlights)、菲涅尔反射(Fresnel reflections)、复杂光照下的材质变化
- TRELLIS虽然编码了外观,但多视角特征做均值池化后变成视角无关,无法区分不同角度的外观差异
- TRELLIS需要两阶段生成(先粗几何→再填充外观),且生成结果在标准坐标系中,需要后处理对齐输入图像
本文方法
提出 LiTo (Surface Light Field Tokenization):
- 核心洞察:RGB-D多视角图像提供了**表面光场(Surface Light Field)**的采样
- 统一表示:将表面光场编码为一组紧凑的3D latent vectors,同时包含几何和视角相关辐射度信息
- 生成模型:在latent空间上训练flow matching模型,从单张图像生成完整3D对象
核心贡献是什么?
-
表面光场3D latent表示 ⭐ 核心创新
- 将表面光场编码为紧凑的latent vector集合 $\mathcal{S} = {\mathbf{s}j}{j=1}^k$
- 不同于仅编码几何+颜色(如RGB点云),额外输入观察方向,捕捉材质随角度变化
- 通过高阶球谐函数的3D Gaussian Splatting解码,重现视角相关效果
-
间接监督训练框架
- 不直接重建稀疏的表面光场采样(因为采样不完整)
- 几何监督:flow matching将3D表面建模为概率密度函数
- 辐射度监督:通过多视角渲染对比监督视角相关辐射度
-
局部注意力Transformer编码器
- 设计localized attention pattern,支持100万输入token
- 提高效率的同时保持重建质量
-
Latent Flow Matching生成模型
- 在tokenizer的latent空间上训练条件flow matching
- 单张图像→完整3D对象(单阶段,无需先验几何)
- 生成对象与输入图像坐标系对齐
大致方法是什么?
┌─────────────────────────────────────────────────────────────────────┐
│ LiTo 方法流程 │
├─────────────────────────────────────────────────────────────────────┤
│ │
│ ═══════════════ Part 1: Tokenizer(编码器-解码器)═══════════════ │
│ │
│ Step 1: 表面光场采样 │
│ ┌──────────────────────────────────────────────────────────┐ │
│ │ RGB-D多视角图像 → 表面光场采样 │ │
│ │ X = {(x_i, d_i, c_i)} i=1..N │ │
│ │ - x_i: 3D表面点(来自深度图) │ │
│ │ - d_i: 观察方向(单位向量) │ │
│ │ - c_i: 出射颜色(来自RGB图像) │ │
│ │ 使用随机子采样,而非密集采样 │ │
│ └──────────────────────────────────────────────────────────┘ │
│ │
│ Step 2: 编码 │
│ ┌──────────────────────────────────────────────────────────┐ │
│ │ 输入: N个表面光场采样(~100万token) │ │
│ │ 编码器: Transformer + 局部注意力 │ │
│ │ 输出: k个d维latent vectors S = {s_j}_{j=1}^k │ │
│ └──────────────────────────────────────────────────────────┘ │
│ │
│ Step 3: 解码 + 双重监督 │
│ ┌──────────────────────────────────────────────────────────┐ │
│ │ │ │
│ │ 几何监督 (L_geo): │ │
│ │ - latent S 参数化3D分布 p(x|S) │ │
│ │ - 通过flow matching对齐到真实3D表面 │ │
│ │ - p(x|S) ≈ δ(x ∈ ∂Ω) │ │
│ │ - 可采样得到表面点云,可零样本估计法线 │ │
│ │ │ │
│ │ 辐射度监督 (L_rad): │ │
│ │ - 解码器输出3D Gaussian Splatting + 高阶球谐函数(SH) │ │
│ │ - 渲染多视角图像 │ │
│ │ - 与真实多视角图像对比 │ │
│ │ - 高阶SH捕捉视角相关效果(高光、菲涅尔反射等) │ │
│ │ │ │
│ └──────────────────────────────────────────────────────────┘ │
│ │
│ ═══════════════ Part 2: 生成模型 ═══════════════════════════════ │
│ │
│ Step 4: Latent Flow Matching │
│ ┌──────────────────────────────────────────────────────────┐ │
│ │ 条件: 单张输入图像 │ │
│ │ 学习: latent S 的分布 p(S | image) │ │
│ │ 生成: 从噪声→通过ODE积分→生成完整latent S │ │
│ │ 解码: S → 3D Gaussian Splatting(含几何+视角相关外观) │ │
│ └──────────────────────────────────────────────────────────┘ │
│ │
│ 输出: 完整3D对象,几何匹配输入视角,外观反映输入的光照和材质 │
│ │
└─────────────────────────────────────────────────────────────────────┘
关键数学
表面光场:
ℓ(x, d̂): ℝ³ × S² → ℝ³
- x ∈ ∂Ω: 3D表面上的点
- d̂ ∈ S²: 观察方向(单位向量)
- ℓ(x, d̂) ∈ ℝ³: 从点x沿方向d̂出射的颜色
如果完美表示表面光场,可以从任意视角渲染任意图像
几何监督 - Flow Matching:
L_geo(θ) = E_{t~U(0,1)} E_x ||V(x_t; t) - (x - ε)||² dt
- x_t = t·x + (1-t)·ε (插值轨迹)
- V: flow matching decoder,估计速度场
- ε ~ N(0, I): 标准正态噪声
- x: 从表面光场采样的3D点
辐射度监督 - 可微渲染:
L_rad = Σ_v ||render(S, v) - I_v||²
- v: 视角索引
- render(S, v): 从latent S解码的3DGS在视角v的渲染
- I_v: 真实视角v的图像
- 解码器预测3DGS参数 + 高阶球谐函数系数
与TRELLIS的关键区别
| 维度 | TRELLIS | LiTo |
|---|---|---|
| 外观建模 | 多视角DINOv2特征均值池化 → 视角无关 | 表面光场采样 → 视角相关 |
| 生成阶段 | 两阶段(粗几何→填充外观) | 单阶段(latent直接编码完整信息) |
| 坐标系 | 标准坐标系,需后处理对齐输入 | 基于点的输入,训练时做坐标变换,天然对齐 |
| latent结构 | 稀疏体素网格(SLAT) | 紧凑latent vector集合 |
| 数据需求 | ~500K资产 | 更少,不需要预构建体素 |
训练
数据集
| 数据集 | 说明 |
|---|---|
| Objaverse-XL | 大规模3D资产数据集,用于训练和评估 |
Loss
L_total = L_geo + L_rad + L_reg
- L_geo: flow matching几何损失(Eq. 2)
- L_rad: 多视角渲染辐射度损失
- L_reg: 正则化项(见Sec. E.4)
训练策略
Tokenizer配置: | 参数 | 值 | |------|-----| | 编码器 | Transformer + 局部注意力 | | 输入token数 | ~100万 | | latent维度d | 实验中使用多种配置 | | 球谐函数阶数 | 高阶(消融见Sec. F.1) |
生成模型配置: | 参数 | 值 | |------|-----| | 模型类型 | Latent Flow Matching | | 条件 | 单张图像(DINOv2特征) | | ODE积分 | 用于推理时从噪声生成latent |
实验与结论
重建结果
- 重建质量优于TRELLIS、TripoSG、Hunyuan3D、3DTopia-XL、ShapeToken
- 视角相关效果(高光、反射)明显优于仅建模漫反射的方法
- 几何精度没有因为建模外观而显著下降
生成结果
- 单图→3D生成:视觉质量和输入保真度均优于现有方法
- 生成的3D对象外观与输入图像的光照和材质一致
- 坐标系与输入视角对齐(TRELLIS输出方向可能不正确)
消融实验
- 高阶球谐函数对视角相关效果至关重要
- 局部注意力设计有效支持百万级输入token
- 随机子采样+间接监督的策略有效
与 FlashWorld (238) 的对比
| 维度 | FlashWorld (238) | LiTo (241) |
|---|---|---|
| 目标 | 秒级3D场景生成 | 3D物体几何+视角相关外观 |
| 3D表示 | 3D Gaussian Splatting(直接生成) | Latent vectors → 3DGS(通过tokenizer解码) |
| 外观建模 | 视角无关纹理 | 视角相关(高光、菲涅尔反射) |
| 核心创新 | 结合MV-oriented和3D-oriented范式的效率优化 | 表面光场tokenization + 视角相关辐射度 |
| 生成方式 | 文本/图像→3D场景 | 单图→3D物体 |
| 生成速度 | 秒级(核心卖点) | 未强调速度 |
有效
-
表面光场作为统一框架:将几何和视角相关外观统一到表面光场表示中,理论基础扎实
-
随机子采样+间接监督:不需要密集的表面光场,用随机子采样即可训练,降低数据需求
-
高阶球谐函数:通过3DGS + SH自然地捕捉视角相关效果,无需显式建模BRDF参数
-
单阶段生成:latent直接编码完整信息,不需要两阶段pipeline
-
坐标系对齐:基于点的输入允许训练时做坐标变换,生成结果天然与输入视角对齐
局限性
-
需要多视角RGB-D训练数据:表面光场采样依赖深度信息
-
物体级方法:面向单个物体,不适用于复杂场景
-
训练分布外泛化:对训练集外的物体类型泛化能力有限
-
高分辨率细节:生成高分辨率纹理细节仍有挑战
启发
-
表面光场的潜力:将RGB-D图像理解为表面光场采样,为3D表示提供了新的理论视角
-
间接监督策略:当直接重建不可行时(如稀疏采样),设计间接监督信号是有效的替代方案
-
视角相关 vs 视角无关:对于真实感渲染,视角相关效果(高光、反射)比漫反射颜色更重要
-
基于点的输入优势:相比体素网格,基于点的输入更灵活,支持坐标变换
遗留问题
-
无深度输入的扩展:能否仅从多视角RGB(无深度)估计表面光场?
-
动态物体:能否扩展到动态场景的视角相关外观建模?
-
场景级扩展:能否将表面光场tokenization扩展到完整3D场景?
-
与物理渲染结合:能否将latent表示与PBR材质参数关联,实现更可控的材质编辑?
参考材料
- 3D Gaussian Splatting: arXiv:2308.04079
- TRELLIS: arXiv:2412.01506
- ShapeToken: Chang et al. 2024
- Surface Light Field: Wood et al. 2000
- Flow Matching: arXiv:2210.02747