FlashWorld: High-Quality 3D Scene Generation Within Seconds
论文信息: arXiv:2510.13678v1 [cs.CV], 15 Oct 2025, Xinyang Li et al., 厦门大学 / 腾讯 / 复旦大学
Link: arXiv:2510.13678 | Project Page
核心问题是什么?
目的
实现秒级高质量3D场景生成,从单张图像或文本提示快速生成完整的3D场景(3D Gaussian表示)。
现有方法及局限性
| 方法类型 | 代表方法 | 时间 | 局限性 |
|---|---|---|---|
| 组装式方法 | 预先3D资产拼接 | - | 缺乏整体场景理解,语义不连贯 |
| 迭代重建 | SceneScape, RealmDreamer | 分钟级 | 多视角一致性差 |
| MV-oriented | CAT3D, Bolt3D, Wonderland | 15秒~77分钟 | 多视角不一致→纹理噪声、几何伪影 |
| 3D-oriented | Dual3D, Director3D | 分钟级 | 视觉质量差、模糊、需要额外精修 |
MV-oriented 方法问题:
- 扩散模型生成多视角图像时缺乏显式3D约束
- 不同视角间几何和语义不一致
- 重建的3D场景与新视角合成存在质量差距
3D-oriented 方法问题:
- 直接生成3D表示保证一致性,但视觉模糊
- 需要额外的精修阶段,降低效率
- 直接应用蒸馏会放大固有缺陷
本文方法
提出FlashWorld框架,结合两种范式的优势:
┌─────────────────────────────────────────────────────────────────────┐ │ 两种3D生成范式 │ ├─────────────────────────────────────────────────────────────────────┤ │ │ │ 范式1: MV-oriented (多视角导向) │ │ ┌─────────┐ ┌────────────────┐ ┌──────────────┐ │ │ │ 输入 │───→│ 生成多视角图像 │───→│ 3D重建 │ │ │ │ 文本/图 │ │ (2D空间) │ │ (NeRF/3DGS) │ │ │ └─────────┘ └────────────────┘ └──────────────┘ │ │ │ │ 优势: ✅ 视觉质量高 (2D图像生成是扩散模型擅长的) │ │ 劣势: ❌ 多视角不一致 → 重建出噪声 │ │ │ │ ───────────────────────────────────────────────────────────────── │ │ │ │ 范式2: 3D-oriented (3D导向) │ │ ┌─────────┐ ┌────────────────────────────┐ │ │ │ 输入 │───→│ 直接生成3D表示 │ │ │ │ 文本/图 │ │ (通过可微渲染保证3D一致性) │ │ │ └─────────┘ └────────────────────────────┘ │ │ │ │ 优势: ✅ 3D一致性好 (原生保证,无需后处理) │ │ 劣势: ❌ 视觉质量差 (模糊,细节丢失) │ │ │ └─────────────────────────────────────────────────────────────────────┘
- 双模式预训练:基于视频扩散模型训练同时支持MV-oriented和3D-oriented的多视角扩散模型
- 跨模式后训练蒸馏:MV-oriented(教师,高质量)→ 3D-oriented(学生,3D一致)
- 分布外数据协同训练:利用大量单视角图像+文本提升泛化能力
效果
| 指标 | 本文 | 最佳Baseline |
|---|---|---|
| 生成速度 | 9秒 (H20) | 15秒 (Bolt3D, A100) |
| WorldScore平均分 | 68.72 | 66.43 (WonderWorld) |
| 风格一致性 | 81.52 | 75.92 (WonderWorld) |
| 主观质量 | 54.63 | 48.02 (LucidDreamer) |
加速比: 相比MV-oriented方法快 10~100×
核心贡献是什么?
-
双模式预训练策略
- 基于视频扩散模型(WAN 2.2-5B)初始化
- 联合训练MV-oriented和3D-oriented两种模式
- 3D-oriented模式通过3DGS decoder直接输出高斯参数
-
跨模式后训练蒸馏
- 利用DMD(Distribution Matching Distillation)进行知识迁移
- MV-oriented作为Teacher提供视觉质量梯度
- 3D-oriented作为Student保持3D一致性
- 跨模式一致性损失(CMC)消除浮空伪影
-
分布外数据协同训练
- 利用无标签单视角图像和文本提示
- 配合随机相机轨迹增强泛化
- 提升对OOD输入的适应性
-
高效推理
- 仅需4步去噪(timesteps: {1000, 900, 750, 500})
- 9秒生成完整3D场景
- 统一模型支持image-to-3D和text-to-3D
大致方法是什么?
┌─────────────────────────────────────────────────────────────────┐
│ FlashWorld 框架流程 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ Phase 1: 双模式预训练 (Dual-Mode Pre-training) │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 输入: 多视角图像 X, 相机参数 C, 条件 y (文本/图像) │ │
│ │ ↓ │ │
│ │ VAE Encoder: Z = E(X) │ │
│ │ ↓ │ │
│ │ 加噪: Zt = αt·Z + σt·ε │ │
│ │ ↓ │ │
│ │ DiT (带3D Attention) + 相机条件 │ │
│ │ ↓ │ │
│ │ ┌────┴────┐ │ │
│ │ ↓ ↓ │ │
│ │ MV模式 3D模式 │ │
│ │ (直接输出) (3DGS Decoder) │ │
│ │ ↓ ↓ │ │
│ │ 多视角潜变量 {深度,旋转,缩放,不透明度,SH系数} │ │
│ │ ↓ ↓ │ │
│ │ L_MSE L_Render (渲染损失) │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │
│ Phase 2: 跨模式后训练蒸馏 (Cross-Mode Post-training) │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ Teacher: MV-oriented (冻结) │ │
│ │ ↓ │ │
│ │ 计算 Real Score (真实分布梯度) │ │
│ │ ↓ │ │
│ │ Student: 3D-oriented (4步生成) │ │
│ │ ↓ │ │
│ │ 计算 Fake Score (当前分布梯度) │ │
│ │ ↓ │ │
│ │ 优化目标: │ │
│ │ • DMD Loss: 分布匹配 │ │
│ │ • GAN Loss: 增强视觉质量 │ │
│ │ • CMC Loss: 跨模式一致性约束 │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │
│ Phase 3: OOD数据协同训练 │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 单视角图像 + 文本 + 随机相机轨迹 │ │
│ │ → 提升泛化能力 │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │
│ 输出: 3D Gaussian Splatting 场景 │
└─────────────────────────────────────────────────────────────────┘
关键组件
1. 3DGS Decoder
输入: 多视角特征 F
输出: {τ, q, s, α, c}
- τ: 深度 (depth)
- q: 旋转四元数 (rotation quaternion)
- s: 缩放 (scale)
- α: 不透明度 (opacity)
- c: 球谐系数 (spherical harmonics)
像素对齐高斯点: μ = o + τ·d
- o: 相机原点
- d: 射线方向
2. 相机表示
- 使用 Reference-Point Plücker Coordinates (raymaps)
- 编码相机位姿和内外参
3. 跨模式一致性损失 (CMC)
L_CMC = E[||E(R(G_3D, C), C) - G_MV||²]
作用: 约束3D-oriented和MV-oriented输出对齐
原因: MV-oriented不受渲染梯度噪声影响,提供更稳定的监督
训练
数据集
| 数据集 | 类型 | 分辨率 | 用途 |
|---|---|---|---|
| MVImgNet | 物体为中心 | 480×704 | 预训练+后训练 |
| DL3DV | 场景级别 | - | 预训练+后训练 |
| 单视角图像数据集 | 无标签 | 多样 | OOD协同训练 |
Loss
预训练阶段:
L_MV = E[||Z - Ẑ_MV||²] # MV模式重建损失
L_3D = E[||X_novel - R(G, C_novel)||²] # 3D模式渲染损失
后训练阶段:
# DMD Loss (分布匹配蒸馏)
∇L_DMD = -E_t[∫(s_real - s_fake) · dG_θ/dz dz]
# GAN Loss (非饱和GAN)
L_GAN: 标准非饱和GAN目标 + R1正则化
# CMC Loss (跨模式一致性)
L_CMC = λ · E[||E(R(G_3D, C), C) - G_MV||²]
其中 λ = 0.1
训练策略
预训练配置: | 参数 | 值 | |------|-----| | 基础模型 | WAN2.2-5B-IT2V | | 输入视角数 | 24 | | 空间下采样 | 16× | | 特征通道数 | 1024 | | 学习率 | 2×10⁻⁶ | | 优化器 | Adam (β₁=0.9, β₂=0.95) | | 权重衰减 | 1×10⁻⁶ | | Warmup | 1,000 steps | | 总训练步数 | 20,000 | | 训练时间 | ~3天 |
后训练配置: | 参数 | 值 | |------|-----| | 时间步调度 | {1000, 900, 750, 500} (4步) | | Generator学习率 | 1×10⁻⁶ | | Discriminator学习率 | 5×10⁻⁷ | | GAN损失权重 | 5×10⁻³ | | Fake Score更新次数 | 4次/Generator更新 | | Warmup | 1,000 steps | | 总训练步数 | 10,000 | | 训练时间 | ~2天 |
任务采样比例:
- MV-oriented模式 : 3D-oriented输入视角 : 3D-oriented新视角 = 1:3:1
- 多视角数据 : OOD数据 = 2:1
硬件配置:
- 64× NVIDIA H20 GPUs
- Batch size: 64
- 精度: bf16
- 分布式策略: FSDP + Activation Checkpointing
实验与结论
Image-to-3D场景生成
| 方法 | 问题 |
|---|---|
| CAT3D | 模糊、几何细节缺失 |
| Bolt3D | 几何不准确(树枝、树叶) |
| Wonderland | 高斯伪影、重复扭曲 |
| 本文 | 高保真、精细结构恢复 |
Text-to-3D场景生成定量对比
| 方法 | Q-Align IQA | CLIP Score | CLIP Aesthetic | 时间 |
|---|---|---|---|---|
| Director3D | 3.24 | 0.43 | 2.51 | 7 min |
| Prometheus | 2.34 | 0.34 | 1.99 | 15 sec |
| 本文 | 4.12 | 0.54 | 2.35 | 9 sec |
WorldScore Benchmark
| 指标 | WonderJourney | LucidDreamer | WonderWorld | 本文 |
|---|---|---|---|---|
| 3D一致性 | 80.60 | 90.37 | 86.91 | 85.87 |
| 光度一致性 | 79.03 | 90.20 | 85.56 | 86.72 |
| 物体控制 | 34.81 | 43.48 | 52.09 | 49.61 |
| 内容对齐 | 38.37 | 59.41 | 56.82 | 53.96 |
| 风格一致性 | 67.52 | 66.41 | 75.92 | 81.52 |
| 主观质量 | 61.49 | 48.02 | 41.28 | 54.63 |
| 平均分 | 60.30 | 66.32 | 66.43 | 68.72 |
| 时间 | 6 min | 6 min | 10 sec | 9 sec |
消融实验
| 变体 | 问题 |
|---|---|
| w/ MV-Diff | 多视角不一致→3D重建噪声 |
| w/ 3D-Diff | 视觉效果模糊 |
| w/ MV-Dist | 不一致加剧 |
| w/o CMC | 定量指标接近,但有浮空伪影 |
| w/o OOD | 语义对齐下降,泛化能力减弱 |
| Full Model | 质量+一致性+速度兼顾 |
结论
- 提出跨模式蒸馏策略,将MV-oriented的高质量迁移到3D-oriented
- 双模式预训练+跨模式后训练+OOD协同训练
- 实现9秒生成高质量3D场景,比现有方法快10~100×
- 统一模型支持image-to-3D和text-to-3D
局限性
Loss
- 3D一致性分数较低: 相比使用单目深度估计的baseline(如LucidDreamer),本文仅使用RGB监督,缺乏显式深度引导
- 内容对齐分数较低: 本文不直接操作锚帧内容,而baseline方法会直接编辑锚帧
其他局限
- 预训练依赖多视角数据集,数据多样性受限
- 跨模式一致性损失权重λ=0.1为经验值,可能需要针对不同场景调整
- 仅支持静态场景,未涉及动态场景
有效
-
视频扩散模型初始化: 相比图像扩散模型,收敛更快,VAE压缩率更高,支持更多视角(24)和更高分辨率(480P)
-
跨模式一致性损失(CMC): 有效消除3D-oriented模式的浮空伪影,提升稳定性
-
OOD数据协同训练: 显著提升模型对分布外输入的泛化能力
-
4步推理: 通过DMD蒸馏实现少步生成,同时保持质量
局限性
-
深度监督缺失: 未利用显式深度信息,3D一致性指标略逊于使用深度的方法
-
锚帧编辑能力: 不支持直接编辑输入图像内容
-
动态场景: 当前仅处理静态3D场景
-
经验参数: CMC损失权重等超参数需要手动调节
启发
-
双模式设计思路: 同一模型支持多种生成模式,通过蒸馏互补优势,可用于其他需要平衡多个目标的生成任务
-
跨模式蒸馏框架: Teacher-Student跨不同表示空间的知识迁移,为解决一致性与质量的trade-off提供新思路
-
视频模型用于3D生成: 视频扩散模型具有时序一致性先验,天然适合多视角生成任务
-
OOD数据利用策略: 在post-training阶段引入无标签数据提升泛化,低成本高效
-
3DGS作为中间表示: 可微渲染保证3D一致性,同时支持高效渲染
遗留问题
-
如何引入显式深度监督提升3D一致性?
-
如何支持动态4D场景生成?(作者提到未来方向)
-
如何结合自回归生成实现更复杂的场景?
-
如何减少对多视角数据的依赖,进一步提升泛化?
-
跨模式一致性损失的自适应权重能否自动学习?
参考材料
- 3D Gaussian Splatting: arXiv:2308.04079
- Distribution Matching Distillation: arXiv:2405.14867
- WAN Video Diffusion: arXiv:2503.20314
- CAT3D: arXiv:2405.10319
- Wonderland: arXiv:2405.15980