FlashWorld: High-Quality 3D Scene Generation Within Seconds

论文信息: arXiv:2510.13678v1 [cs.CV], 15 Oct 2025, Xinyang Li et al., 厦门大学 / 腾讯 / 复旦大学

Link: arXiv:2510.13678 | Project Page


核心问题是什么?

目的

实现秒级高质量3D场景生成,从单张图像或文本提示快速生成完整的3D场景(3D Gaussian表示)。

现有方法及局限性

方法类型代表方法时间局限性
组装式方法预先3D资产拼接-缺乏整体场景理解,语义不连贯
迭代重建SceneScape, RealmDreamer分钟级多视角一致性差
MV-orientedCAT3D, Bolt3D, Wonderland15秒~77分钟多视角不一致→纹理噪声、几何伪影
3D-orientedDual3D, Director3D分钟级视觉质量差、模糊、需要额外精修

MV-oriented 方法问题

  • 扩散模型生成多视角图像时缺乏显式3D约束
  • 不同视角间几何和语义不一致
  • 重建的3D场景与新视角合成存在质量差距

3D-oriented 方法问题

  • 直接生成3D表示保证一致性,但视觉模糊
  • 需要额外的精修阶段,降低效率
  • 直接应用蒸馏会放大固有缺陷

本文方法

提出FlashWorld框架,结合两种范式的优势:

┌─────────────────────────────────────────────────────────────────────┐ │ 两种3D生成范式 │ ├─────────────────────────────────────────────────────────────────────┤ │ │ │ 范式1: MV-oriented (多视角导向) │ │ ┌─────────┐ ┌────────────────┐ ┌──────────────┐ │ │ │ 输入 │───→│ 生成多视角图像 │───→│ 3D重建 │ │ │ │ 文本/图 │ │ (2D空间) │ │ (NeRF/3DGS) │ │ │ └─────────┘ └────────────────┘ └──────────────┘ │ │ │ │ 优势: ✅ 视觉质量高 (2D图像生成是扩散模型擅长的) │ │ 劣势: ❌ 多视角不一致 → 重建出噪声 │ │ │ │ ───────────────────────────────────────────────────────────────── │ │ │ │ 范式2: 3D-oriented (3D导向) │ │ ┌─────────┐ ┌────────────────────────────┐ │ │ │ 输入 │───→│ 直接生成3D表示 │ │ │ │ 文本/图 │ │ (通过可微渲染保证3D一致性) │ │ │ └─────────┘ └────────────────────────────┘ │ │ │ │ 优势: ✅ 3D一致性好 (原生保证,无需后处理) │ │ 劣势: ❌ 视觉质量差 (模糊,细节丢失) │ │ │ └─────────────────────────────────────────────────────────────────────┘

  1. 双模式预训练:基于视频扩散模型训练同时支持MV-oriented和3D-oriented的多视角扩散模型
  2. 跨模式后训练蒸馏:MV-oriented(教师,高质量)→ 3D-oriented(学生,3D一致)
  3. 分布外数据协同训练:利用大量单视角图像+文本提升泛化能力

效果

指标本文最佳Baseline
生成速度9秒 (H20)15秒 (Bolt3D, A100)
WorldScore平均分68.7266.43 (WonderWorld)
风格一致性81.5275.92 (WonderWorld)
主观质量54.6348.02 (LucidDreamer)

加速比: 相比MV-oriented方法快 10~100×


核心贡献是什么?

  1. 双模式预训练策略

    • 基于视频扩散模型(WAN 2.2-5B)初始化
    • 联合训练MV-oriented和3D-oriented两种模式
    • 3D-oriented模式通过3DGS decoder直接输出高斯参数
  2. 跨模式后训练蒸馏

    • 利用DMD(Distribution Matching Distillation)进行知识迁移
    • MV-oriented作为Teacher提供视觉质量梯度
    • 3D-oriented作为Student保持3D一致性
    • 跨模式一致性损失(CMC)消除浮空伪影
  3. 分布外数据协同训练

    • 利用无标签单视角图像和文本提示
    • 配合随机相机轨迹增强泛化
    • 提升对OOD输入的适应性
  4. 高效推理

    • 仅需4步去噪(timesteps: {1000, 900, 750, 500})
    • 9秒生成完整3D场景
    • 统一模型支持image-to-3D和text-to-3D

大致方法是什么?

┌─────────────────────────────────────────────────────────────────┐
│                    FlashWorld 框架流程                           │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  Phase 1: 双模式预训练 (Dual-Mode Pre-training)                 │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  输入: 多视角图像 X, 相机参数 C, 条件 y (文本/图像)       │   │
│  │           ↓                                             │   │
│  │  VAE Encoder: Z = E(X)                                  │   │
│  │           ↓                                             │   │
│  │  加噪: Zt = αt·Z + σt·ε                                 │   │
│  │           ↓                                             │   │
│  │  DiT (带3D Attention) + 相机条件                         │   │
│  │           ↓                                             │   │
│  │      ┌────┴────┐                                        │   │
│  │      ↓         ↓                                        │   │
│  │  MV模式      3D模式                                      │   │
│  │  (直接输出)   (3DGS Decoder)                              │   │
│  │      ↓         ↓                                        │   │
│  │  多视角潜变量  {深度,旋转,缩放,不透明度,SH系数}             │   │
│  │      ↓         ↓                                        │   │
│  │   L_MSE     L_Render (渲染损失)                          │   │
│  └─────────────────────────────────────────────────────────┘   │
│                                                                 │
│  Phase 2: 跨模式后训练蒸馏 (Cross-Mode Post-training)           │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  Teacher: MV-oriented (冻结)                             │   │
│  │      ↓                                                  │   │
│  │  计算 Real Score (真实分布梯度)                           │   │
│  │      ↓                                                  │   │
│  │  Student: 3D-oriented (4步生成)                          │   │
│  │      ↓                                                  │   │
│  │  计算 Fake Score (当前分布梯度)                           │   │
│  │      ↓                                                  │   │
│  │  优化目标:                                               │   │
│  │  • DMD Loss: 分布匹配                                   │   │
│  │  • GAN Loss: 增强视觉质量                                │   │
│  │  • CMC Loss: 跨模式一致性约束                            │   │
│  └─────────────────────────────────────────────────────────┘   │
│                                                                 │
│  Phase 3: OOD数据协同训练                                       │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  单视角图像 + 文本 + 随机相机轨迹                         │   │
│  │  → 提升泛化能力                                          │   │
│  └─────────────────────────────────────────────────────────┘   │
│                                                                 │
│  输出: 3D Gaussian Splatting 场景                               │
└─────────────────────────────────────────────────────────────────┘

关键组件

1. 3DGS Decoder

输入: 多视角特征 F
输出: {τ, q, s, α, c}
  - τ: 深度 (depth)
  - q: 旋转四元数 (rotation quaternion)
  - s: 缩放 (scale)
  - α: 不透明度 (opacity)
  - c: 球谐系数 (spherical harmonics)

像素对齐高斯点: μ = o + τ·d
  - o: 相机原点
  - d: 射线方向

2. 相机表示

  • 使用 Reference-Point Plücker Coordinates (raymaps)
  • 编码相机位姿和内外参

3. 跨模式一致性损失 (CMC)

L_CMC = E[||E(R(G_3D, C), C) - G_MV||²]

作用: 约束3D-oriented和MV-oriented输出对齐
原因: MV-oriented不受渲染梯度噪声影响,提供更稳定的监督

训练

数据集

数据集类型分辨率用途
MVImgNet物体为中心480×704预训练+后训练
DL3DV场景级别-预训练+后训练
单视角图像数据集无标签多样OOD协同训练

Loss

预训练阶段:

L_MV = E[||Z - Ẑ_MV||²]          # MV模式重建损失
L_3D = E[||X_novel - R(G, C_novel)||²]  # 3D模式渲染损失

后训练阶段:

# DMD Loss (分布匹配蒸馏)
∇L_DMD = -E_t[∫(s_real - s_fake) · dG_θ/dz dz]

# GAN Loss (非饱和GAN)
L_GAN: 标准非饱和GAN目标 + R1正则化

# CMC Loss (跨模式一致性)
L_CMC = λ · E[||E(R(G_3D, C), C) - G_MV||²]
其中 λ = 0.1

训练策略

预训练配置: | 参数 | 值 | |------|-----| | 基础模型 | WAN2.2-5B-IT2V | | 输入视角数 | 24 | | 空间下采样 | 16× | | 特征通道数 | 1024 | | 学习率 | 2×10⁻⁶ | | 优化器 | Adam (β₁=0.9, β₂=0.95) | | 权重衰减 | 1×10⁻⁶ | | Warmup | 1,000 steps | | 总训练步数 | 20,000 | | 训练时间 | ~3天 |

后训练配置: | 参数 | 值 | |------|-----| | 时间步调度 | {1000, 900, 750, 500} (4步) | | Generator学习率 | 1×10⁻⁶ | | Discriminator学习率 | 5×10⁻⁷ | | GAN损失权重 | 5×10⁻³ | | Fake Score更新次数 | 4次/Generator更新 | | Warmup | 1,000 steps | | 总训练步数 | 10,000 | | 训练时间 | ~2天 |

任务采样比例:

  • MV-oriented模式 : 3D-oriented输入视角 : 3D-oriented新视角 = 1:3:1
  • 多视角数据 : OOD数据 = 2:1

硬件配置:

  • 64× NVIDIA H20 GPUs
  • Batch size: 64
  • 精度: bf16
  • 分布式策略: FSDP + Activation Checkpointing

实验与结论

Image-to-3D场景生成

方法问题
CAT3D模糊、几何细节缺失
Bolt3D几何不准确(树枝、树叶)
Wonderland高斯伪影、重复扭曲
本文高保真、精细结构恢复

Text-to-3D场景生成定量对比

方法Q-Align IQACLIP ScoreCLIP Aesthetic时间
Director3D3.240.432.517 min
Prometheus2.340.341.9915 sec
本文4.120.542.359 sec

WorldScore Benchmark

指标WonderJourneyLucidDreamerWonderWorld本文
3D一致性80.6090.3786.9185.87
光度一致性79.0390.2085.5686.72
物体控制34.8143.4852.0949.61
内容对齐38.3759.4156.8253.96
风格一致性67.5266.4175.9281.52
主观质量61.4948.0241.2854.63
平均分60.3066.3266.4368.72
时间6 min6 min10 sec9 sec

消融实验

变体问题
w/ MV-Diff多视角不一致→3D重建噪声
w/ 3D-Diff视觉效果模糊
w/ MV-Dist不一致加剧
w/o CMC定量指标接近,但有浮空伪影
w/o OOD语义对齐下降,泛化能力减弱
Full Model质量+一致性+速度兼顾

结论

  • 提出跨模式蒸馏策略,将MV-oriented的高质量迁移到3D-oriented
  • 双模式预训练+跨模式后训练+OOD协同训练
  • 实现9秒生成高质量3D场景,比现有方法快10~100×
  • 统一模型支持image-to-3D和text-to-3D

局限性

Loss

  • 3D一致性分数较低: 相比使用单目深度估计的baseline(如LucidDreamer),本文仅使用RGB监督,缺乏显式深度引导
  • 内容对齐分数较低: 本文不直接操作锚帧内容,而baseline方法会直接编辑锚帧

其他局限

  • 预训练依赖多视角数据集,数据多样性受限
  • 跨模式一致性损失权重λ=0.1为经验值,可能需要针对不同场景调整
  • 仅支持静态场景,未涉及动态场景

有效

  1. 视频扩散模型初始化: 相比图像扩散模型,收敛更快,VAE压缩率更高,支持更多视角(24)和更高分辨率(480P)

  2. 跨模式一致性损失(CMC): 有效消除3D-oriented模式的浮空伪影,提升稳定性

  3. OOD数据协同训练: 显著提升模型对分布外输入的泛化能力

  4. 4步推理: 通过DMD蒸馏实现少步生成,同时保持质量


局限性

  1. 深度监督缺失: 未利用显式深度信息,3D一致性指标略逊于使用深度的方法

  2. 锚帧编辑能力: 不支持直接编辑输入图像内容

  3. 动态场景: 当前仅处理静态3D场景

  4. 经验参数: CMC损失权重等超参数需要手动调节


启发

  1. 双模式设计思路: 同一模型支持多种生成模式,通过蒸馏互补优势,可用于其他需要平衡多个目标的生成任务

  2. 跨模式蒸馏框架: Teacher-Student跨不同表示空间的知识迁移,为解决一致性与质量的trade-off提供新思路

  3. 视频模型用于3D生成: 视频扩散模型具有时序一致性先验,天然适合多视角生成任务

  4. OOD数据利用策略: 在post-training阶段引入无标签数据提升泛化,低成本高效

  5. 3DGS作为中间表示: 可微渲染保证3D一致性,同时支持高效渲染


遗留问题

  1. 如何引入显式深度监督提升3D一致性?

  2. 如何支持动态4D场景生成?(作者提到未来方向)

  3. 如何结合自回归生成实现更复杂的场景?

  4. 如何减少对多视角数据的依赖,进一步提升泛化?

  5. 跨模式一致性损失的自适应权重能否自动学习?


参考材料