CVPR 2025|Tripo AI 與北京航空航天大學開源 MIDI:從單張影像生成組合式 3D 場景

這項工作由來自 VAST、北京航空航天大學、清華大學與香港大學的研究人員主導。第一作者為北京航空航天大學碩士生 Huang Zehuan,其研究聚焦於生成式 AI 與 3D vision。通訊作者為 VAST 首席科學家 Yanpei Cao,以及北京航空航天大學副教授 Lv Sheng。
隨著 Sora 點燃 world models 的革命,作為物理世界數位基底的 3D scenes,正逐漸成為構建動態且可互動 AI systems 的關鍵基礎設施。當前從單張影像生成 3D assets的突破,已為 3D content creation 提供了「從想像到 3D」的原子級能力。
然而,隨著技術朝向複合場景生成演進,單物體生成範式的限制也逐漸顯現。現有方法生成的 3D assets 如同零散的「digital atoms」,難以自我組織成具有合理空間關係的「molecular structures」。這導致了幾個核心挑戰:① 實例分離困境(如何從單一視角準確解耦重疊物體);② 物理約束建模(如何避免不真實的相交與碰撞);③ 場景層級語意理解(如何維持物體功能與空間佈局之間的一致性)。這些瓶頸嚴重阻礙了從「digital atoms」高效構建「interactive worlds」。
近日,來自北京航空航天大學、VAST 與其他機構的研究團隊提出了一個全新模型——MIDI——可從單張影像生成具備高幾何品質、可實例分離的 3D composite scenes,在單視角 3D scene generation 方面取得突破,並為生成 interactive worlds 奠定基礎。

- 論文:https://arxiv.org/abs/2412.03558
- 專案頁面:https://huanngzh.github.io/MIDI-Page/
- 程式碼:https://github.com/VAST-AI-Research/MIDI-3D
- 線上 Demo:https://huggingface.co/spaces/VAST-AI/MIDI-3D

技術突破
傳統的 compositional 3D scene reconstruction 技術通常依賴多階段、逐物體生成與場景最佳化,導致流程冗長,且生成的場景往往幾何品質較低、空間佈局不準確。為了解決這些問題,MIDI (Multi-Instance Diffusion Model) 創新性地利用 3D object generation models,將其擴展為能同時生成多個 3D instances 且具備精確空間關係的 multi-instance diffusion model,實現高效率且高品質的 3D scene generation:
- 從單物體到多實例生成: 透過同時對多個 3D instances 的 latent representations 進行 denoising,並在 denoising 過程中引入 multi-instance tokens 之間的互動,MIDI 將 3D object generation models 擴展為可同時生成多個具互動建模能力的 instances,之後再直接組合成 3D scene。
- 多實例 Self-Attention 機制: 透過將 object generation models 的 self-attention 機制擴展為 multi-instance self-attention,MIDI 能在生成過程中有效捕捉 instances 之間的空間關聯與整體場景的一致性,無需逐場景最佳化。
- 訓練期間的資料增強: 透過使用有限的 scene data 監督 3D instances 之間的互動,同時以 object data 進行訓練增強,MIDI 能有效建模場景佈局,並維持 pre-training 的泛化能力。
生成結果
基於單張影像,MIDI 可以生成高品質的 compositional 3D scenes:




線上 Demo
卓越效能
MIDI 的特點在於其精確的空間佈局建模、優異的幾何生成品質、生成效率與廣泛適用性。實驗結果顯示,該模型在多個資料集上優於現有方法,在 3D instance 空間關係、3D instance 幾何品質以及端到端生成速度方面均表現出色。

應用:3D 場景內容創作的新工具
MIDI 為 3D 場景創作提供了全新的解決方案。這項技術在建築設計、virtual reality、電影特效與遊戲開發等多個領域展現出巨大潛力。憑藉其高精度、高幾何品質的 3D scene generation 能力,MIDI 能滿足複雜場景對高品質內容的需求,為創作者帶來更多可能性。
Tripo:AI 驅動的 3D Model Generator
當 MIDI 正在革新 3D scene composition 時,Tripo 則以尖端 AI 能力提升單一 asset creation:
單張影像轉 3D Model
- 即時將單張 2D 影像轉換為高品質 3D model。
- AI 驅動的重建可確保精準的形狀與紋理。
- 非常適合快速原型製作與概念視覺化。

多張影像轉 3D Model
- 使用來自不同角度的多張影像,以獲得更佳的深度與細節。
- 提升幾何精度與真實感。
- 非常適合精準的物件建模與產品設計。

Text 轉 3D Model
- 從簡單的文字描述生成 3D models。
- AI 會解讀 prompts 以建立細緻且富創意的 assets。
- 加快遊戲、VR 與動畫的概念生成流程。

Auto Rigging & Animation
- 以極少的操作即可立即為模型完成動畫綁定。
- AI 驅動的骨架結構與動作生成。
- 讓模型可直接用於遊戲,實現無縫整合。

未來工作
儘管該模型表現卓越,MIDI 開發團隊也認知到仍有許多可改進與探索的空間。例如,進一步最佳化其對複雜互動場景的適應能力,以及提升物體生成細節,都是未來工作的重點。團隊希望透過持續改進與完善,這一研究方向不僅能推動單視角複合 3D scene generation 技術的發展,也能促進 3D 技術在實際應用中的廣泛普及。





