LiTo: Surface Light Field Tokenization

论文信息: arXiv:2603.11047v1 [cs.CV], 11 Mar 2026, Jen-Hao Rick Chang, Xiaoming Zhao, Dorian Chan, Oncel Tuzel, Apple

Link: arXiv:2603.11047 | Project Page | Code | ICLR 2026


核心问题是什么?

目的

提出一种3D latent表示,联合建模物体几何和视角相关外观(view-dependent appearance),实现从单张图像生成带有真实光照和材质效果的3D对象。

输入输出

Tokenizer(训练阶段)

  • 输入:多视角 RGB-D 图像(RGB + 深度图)→ 表面光场采样 $\mathcal{X} = {(x_i, \hat{d}i, c_i)}{i=1}^N$
    • $x_i \in \mathbb{R}^3$:3D 表面点(来自深度图反投影)
    • $\hat{d}_i \in S^2$:观察方向(单位向量,从相机中心指向表面点)
    • $c_i \in \mathbb{R}^3$:出射颜色(来自 RGB 图像)
    • $N \approx 100$ 万:随机子采样的 token 数量
  • 输出:k 个 d 维 latent vectors $\mathcal{S} = {\mathbf{s}j}{j=1}^k$
    • 同时编码几何信息和视角相关辐射度信息

生成模型(推理阶段)

  • 输入:单张 RGB 图像(通过 DINOv2 提取特征作为条件)
  • 输出:完整 3D 对象(3D Gaussian Splatting 格式)
    • 几何:3DGS 的位置、尺度、不透明度
    • 视角相关外观:3DGS 的球谐函数系数(高阶 SH 捕捉高光、菲涅尔反射等)
    • 输出坐标系与输入图像视角天然对齐

现有方法及局限性

方法类型代表方法几何外观视角相关局限性
纯几何ShapeToken, TripoSG, Hunyuan3D无法表达纹理、材质、光照效果
几何+视角无关外观TRELLIS✅(漫反射)多视角特征mean-pooling,丢失角度变化信息
几何+PBR材质3DTopia-XL (PrimX)✅(roughness/metallicity)需要从mesh优化构建primitive,数据准备复杂
网格体素Direct3D, XCube分辨率与内存的权衡,需要watertight mesh预处理

核心问题

  • 现有方法无法捕捉视角相关效果(view-dependent effects):高光(specular highlights)、菲涅尔反射(Fresnel reflections)、复杂光照下的材质变化
  • TRELLIS虽然编码了外观,但多视角特征做均值池化后变成视角无关,无法区分不同角度的外观差异
  • TRELLIS需要两阶段生成(先粗几何→再填充外观),且生成结果在标准坐标系中,需要后处理对齐输入图像

本文方法

提出 LiTo (Surface Light Field Tokenization)

  1. 核心洞察:RGB-D多视角图像提供了**表面光场(Surface Light Field)**的采样
  2. 统一表示:将表面光场编码为一组紧凑的3D latent vectors,同时包含几何和视角相关辐射度信息
  3. 生成模型:在latent空间上训练flow matching模型,从单张图像生成完整3D对象

核心贡献是什么?

  1. 表面光场3D latent表示 ⭐ 核心创新

    • 将表面光场编码为紧凑的latent vector集合 $\mathcal{S} = {\mathbf{s}j}{j=1}^k$
    • 不同于仅编码几何+颜色(如RGB点云),额外输入观察方向,捕捉材质随角度变化
    • 通过高阶球谐函数的3D Gaussian Splatting解码,重现视角相关效果
  2. 间接监督训练框架

    • 不直接重建稀疏的表面光场采样(因为采样不完整)
    • 几何监督:flow matching将3D表面建模为概率密度函数
    • 辐射度监督:通过多视角渲染对比监督视角相关辐射度
  3. 局部注意力Transformer编码器

    • 设计localized attention pattern,支持100万输入token
    • 提高效率的同时保持重建质量
  4. Latent Flow Matching生成模型

    • 在tokenizer的latent空间上训练条件flow matching
    • 单张图像→完整3D对象(单阶段,无需先验几何)
    • 生成对象与输入图像坐标系对齐

大致方法是什么?

┌─────────────────────────────────────────────────────────────────────┐
│                    LiTo 方法流程                                      │
├─────────────────────────────────────────────────────────────────────┤
│                                                                     │
│  ═══════════════ Part 1: Tokenizer(编码器-解码器)═══════════════    │
│                                                                     │
│  Step 1: 表面光场采样                                                │
│  ┌──────────────────────────────────────────────────────────┐      │
│  │  RGB-D多视角图像 → 表面光场采样                             │      │
│  │  X = {(x_i, d_i, c_i)}  i=1..N                          │      │
│  │  - x_i: 3D表面点(来自深度图)                              │      │
│  │  - d_i: 观察方向(单位向量)                                │      │
│  │  - c_i: 出射颜色(来自RGB图像)                             │      │
│  │  使用随机子采样,而非密集采样                                │      │
│  └──────────────────────────────────────────────────────────┘      │
│                                                                     │
│  Step 2: 编码                                                       │
│  ┌──────────────────────────────────────────────────────────┐      │
│  │  输入: N个表面光场采样(~100万token)                       │      │
│  │  编码器: Transformer + 局部注意力                           │      │
│  │  输出: k个d维latent vectors S = {s_j}_{j=1}^k            │      │
│  └──────────────────────────────────────────────────────────┘      │
│                                                                     │
│  Step 3: 解码 + 双重监督                                            │
│  ┌──────────────────────────────────────────────────────────┐      │
│  │                                                          │      │
│  │  几何监督 (L_geo):                                        │      │
│  │  - latent S 参数化3D分布 p(x|S)                           │      │
│  │  - 通过flow matching对齐到真实3D表面                       │      │
│  │  - p(x|S) ≈ δ(x ∈ ∂Ω)                                   │      │
│  │  - 可采样得到表面点云,可零样本估计法线                      │      │
│  │                                                          │      │
│  │  辐射度监督 (L_rad):                                      │      │
│  │  - 解码器输出3D Gaussian Splatting + 高阶球谐函数(SH)      │      │
│  │  - 渲染多视角图像                                         │      │
│  │  - 与真实多视角图像对比                                     │      │
│  │  - 高阶SH捕捉视角相关效果(高光、菲涅尔反射等)              │      │
│  │                                                          │      │
│  └──────────────────────────────────────────────────────────┘      │
│                                                                     │
│  ═══════════════ Part 2: 生成模型 ═══════════════════════════════    │
│                                                                     │
│  Step 4: Latent Flow Matching                                       │
│  ┌──────────────────────────────────────────────────────────┐      │
│  │  条件: 单张输入图像                                        │      │
│  │  学习: latent S 的分布 p(S | image)                       │      │
│  │  生成: 从噪声→通过ODE积分→生成完整latent S                 │      │
│  │  解码: S → 3D Gaussian Splatting(含几何+视角相关外观)     │      │
│  └──────────────────────────────────────────────────────────┘      │
│                                                                     │
│  输出: 完整3D对象,几何匹配输入视角,外观反映输入的光照和材质          │
│                                                                     │
└─────────────────────────────────────────────────────────────────────┘

关键数学

表面光场

ℓ(x, d̂): ℝ³ × S² → ℝ³
- x ∈ ∂Ω: 3D表面上的点
- d̂ ∈ S²: 观察方向(单位向量)
- ℓ(x, d̂) ∈ ℝ³: 从点x沿方向d̂出射的颜色

如果完美表示表面光场,可以从任意视角渲染任意图像

几何监督 - Flow Matching

L_geo(θ) = E_{t~U(0,1)} E_x ||V(x_t; t) - (x - ε)||² dt

- x_t = t·x + (1-t)·ε  (插值轨迹)
- V: flow matching decoder,估计速度场
- ε ~ N(0, I): 标准正态噪声
- x: 从表面光场采样的3D点

辐射度监督 - 可微渲染

L_rad = Σ_v ||render(S, v) - I_v||²

- v: 视角索引
- render(S, v): 从latent S解码的3DGS在视角v的渲染
- I_v: 真实视角v的图像
- 解码器预测3DGS参数 + 高阶球谐函数系数

与TRELLIS的关键区别

维度TRELLISLiTo
外观建模多视角DINOv2特征均值池化 → 视角无关表面光场采样 → 视角相关
生成阶段两阶段(粗几何→填充外观)单阶段(latent直接编码完整信息)
坐标系标准坐标系,需后处理对齐输入基于点的输入,训练时做坐标变换,天然对齐
latent结构稀疏体素网格(SLAT)紧凑latent vector集合
数据需求~500K资产更少,不需要预构建体素

训练

数据集

数据集说明
Objaverse-XL大规模3D资产数据集,用于训练和评估

Loss

L_total = L_geo + L_rad + L_reg

- L_geo: flow matching几何损失(Eq. 2)
- L_rad: 多视角渲染辐射度损失
- L_reg: 正则化项(见Sec. E.4)

训练策略

Tokenizer配置: | 参数 | 值 | |------|-----| | 编码器 | Transformer + 局部注意力 | | 输入token数 | ~100万 | | latent维度d | 实验中使用多种配置 | | 球谐函数阶数 | 高阶(消融见Sec. F.1) |

生成模型配置: | 参数 | 值 | |------|-----| | 模型类型 | Latent Flow Matching | | 条件 | 单张图像(DINOv2特征) | | ODE积分 | 用于推理时从噪声生成latent |


实验与结论

重建结果

  • 重建质量优于TRELLIS、TripoSG、Hunyuan3D、3DTopia-XL、ShapeToken
  • 视角相关效果(高光、反射)明显优于仅建模漫反射的方法
  • 几何精度没有因为建模外观而显著下降

生成结果

  • 单图→3D生成:视觉质量和输入保真度均优于现有方法
  • 生成的3D对象外观与输入图像的光照和材质一致
  • 坐标系与输入视角对齐(TRELLIS输出方向可能不正确)

消融实验

  • 高阶球谐函数对视角相关效果至关重要
  • 局部注意力设计有效支持百万级输入token
  • 随机子采样+间接监督的策略有效

与 FlashWorld (238) 的对比

维度FlashWorld (238)LiTo (241)
目标秒级3D场景生成3D物体几何+视角相关外观
3D表示3D Gaussian Splatting(直接生成)Latent vectors → 3DGS(通过tokenizer解码)
外观建模视角无关纹理视角相关(高光、菲涅尔反射)
核心创新结合MV-oriented和3D-oriented范式的效率优化表面光场tokenization + 视角相关辐射度
生成方式文本/图像→3D场景单图→3D物体
生成速度秒级(核心卖点)未强调速度

有效

  1. 表面光场作为统一框架:将几何和视角相关外观统一到表面光场表示中,理论基础扎实

  2. 随机子采样+间接监督:不需要密集的表面光场,用随机子采样即可训练,降低数据需求

  3. 高阶球谐函数:通过3DGS + SH自然地捕捉视角相关效果,无需显式建模BRDF参数

  4. 单阶段生成:latent直接编码完整信息,不需要两阶段pipeline

  5. 坐标系对齐:基于点的输入允许训练时做坐标变换,生成结果天然与输入视角对齐


局限性

  1. 需要多视角RGB-D训练数据:表面光场采样依赖深度信息

  2. 物体级方法:面向单个物体,不适用于复杂场景

  3. 训练分布外泛化:对训练集外的物体类型泛化能力有限

  4. 高分辨率细节:生成高分辨率纹理细节仍有挑战


启发

  1. 表面光场的潜力:将RGB-D图像理解为表面光场采样,为3D表示提供了新的理论视角

  2. 间接监督策略:当直接重建不可行时(如稀疏采样),设计间接监督信号是有效的替代方案

  3. 视角相关 vs 视角无关:对于真实感渲染,视角相关效果(高光、反射)比漫反射颜色更重要

  4. 基于点的输入优势:相比体素网格,基于点的输入更灵活,支持坐标变换


遗留问题

  1. 无深度输入的扩展:能否仅从多视角RGB(无深度)估计表面光场?

  2. 动态物体:能否扩展到动态场景的视角相关外观建模?

  3. 场景级扩展:能否将表面光场tokenization扩展到完整3D场景?

  4. 与物理渲染结合:能否将latent表示与PBR材质参数关联,实现更可控的材质编辑?


参考材料