VAST Open Source Month | TripoSG & TripoSF,在 3D Generation 樹立全新 SOTA

2024 年 3 月,VAST 與 Stability AI 共同將大規模 3D model TripoSR 開源。憑藉其革命性的能力,能在僅 0.5 秒內從單張圖片生成 3D model,它迅速成為全球 3D creators 的首選工具。
同年,open-source projects 持續推動 AI 產業的邊界,帶動 academic research 與 commercial applications 的快速成長。
VAST 進一步推進其 Tripo 系列,於 2024 年 9 月推出 Tripo 2.0,並於 2025 年 1 月推出 Tripo 2.5。這些版本以數千萬高品質原生 3D assets 訓練而成,持續在 generation speed、model accuracy 與整體成功率方面突破新高,並以卓越的 geometric precision 重新定義 3D model creation 的前沿。
在我們全球追求技術進步的過程中,我們深知,對 foundational model teams 而言,基礎架構中的顛覆性創新與 model capabilities 的突破至關重要。當我們持續在封閉環境中將 Tripo 打磨成愈加「perfect solution」的同時,我們相信,更重要的是將自身轉化為 open-source ecosystem 中的「fundamental building block」。開放的 technical ecosystem 所具備的長期價值,遠遠大於封閉系統。
基於此,我們於 2025 年 3 月啟動了「Technology Open-Source Month」計畫。
我們計劃依序將八個涵蓋完整技術鏈的重要專案開源——從 foundational generation models、核心功能元件,到創新構想的探索。我們的目標是打造全球首個 end-to-end 的 open-source 3D generation system,也誠摯希望 3D generation 領域的 researchers 與 developers 能從我們的工作中獲得啟發與價值。

現在,VAST 正式釋出兩個 foundational 3D generation models:

TripoSG 與 TripoSF。


TripoSG 的重大升級:3D Generation 中首個 MoE Transformer Architecture

TripoSG 是一個基於 Rectified Flow (RF) 的 MoE Transformer architecture 所建構的 foundational 3D generation model。在此次釋出中,我們開源了 15 億參數 TripoSG model 的 weights 與 inference code,你也可以透過 HuggingFace 上的 interactive demo 親自體驗。
測試顯示,TripoSG 的輸出品質已可與 Tripo 2.0 比肩——超越目前所有既有的 open-source 3D generation projects。其突出的優勢包括在生成複雜複合物體時,具備優秀的 generalization 與高度穩定性。

遵循 Scaling Law、利用更高品質的資料,以及採用更大的 models,依然是 TripoSG 成功背後的關鍵因素。以下是其在 efficient training、architecture design 與 data governance 方面的四項核心創新:

1. 率先將基於 RF 的 Transformer 用於 3D Shape Generation

從 Tripo 2.0 開發初期開始,我們便發現,相較於傳統 diffusion models,Rectified Flow 在 noise 與 data 之間提供了更直接的線性路徑。這使 training 更穩定且更高效;而當它與 DiT 結合時,更能顯著提升 model stability。

2. 引入 3D 領域首個 MoE Transformer,以實現更佳 Scaling

儘管 MoE Transformers 已被應用於 language、image 與 video models,TripoSG 標誌著它首次在 3D 領域中被高效應用。這種方法大幅提升了 model 的參數容量——尤其是在更深且更關鍵的 layers——同時不會明顯增加 inference cost。 此外,建立在 Transformer framework 之上,TripoSG 還整合了 skip-connections 等關鍵增強機制,以改善跨層 feature fusion。獨立的 cross-attention mechanism 也能高效注入全域(CLIP)與局部(DINOv2)image features,確保輸入的 2D images 與生成的 3D shapes 之間精準對齊。

3. 透過高品質 VAE 與創新的 Geometric Supervision 強化幾何表徵

我們持續追求更優秀的 geometric representations。在 TripoSG 中,我們採用了使用 Signed Distance Functions (SDFs) 進行 geometric encoding 的 VAE,相較於先前流行的 occupancy grids,能提供更高的精度。此外,基於 Transformer 的 VAE architecture 在不同 resolutions 間具有極佳的 generalization 能力,能處理高解析度輸入而無需 retraining。

4. 以完整的 Data Construction Pipeline 強調 Data Governance

data quality 與 quantity 同樣關鍵。VAST 擁有全球最大規模的高品質原生 3D data 收藏,並為 open-source community 開發了一套 end-to-end 的 data governance pipeline。
其流程包含:Quality Scoring → Data Filtering → Fixing & Augmentation → SDF Production

透過這條 pipeline,我們建立了一個包含 200 萬組高品質「image-SDF」training pairs 的 dataset。Ablation studies 清楚顯示,使用這個精煉 dataset 訓練出的 models,明顯優於使用更大、未經過濾 raw datasets 訓練的 models。

TripoSF 解鎖內部 3D 結構生成:突破性的 Tokenizer 在 3D Generation 達成全新 SOTA

TripoSF 是 VAST 基於一種名為 SparseFlex 的新型 3D representation 所開發的 foundational 3D model。
測試結果顯示,其表現超越所有現有的 open-source 與 closed-source 工作。我們現已開源 TripoSF 的 pre-trained VAE model 與相關 inference code,而完整的「all-out」版本將於 Tripo 3.0 中正式揭曉。

TripoSF 重新定義了「model quality 的上限」。這是首次,model 不僅能生成物體的「背面」,還能生成其「內部結構」(如公車座椅與駕駛艙示例所示)。

此外,過往的方法在生成服裝或花瓣時,往往會產生過厚的幾何結構,而 TripoSF 則能以極高的細膩度處理 open-surface assets。

它在其他 model 類別上的豐富細節表現也前所未見。

開發 TripoSF 的首要目標,是突破傳統 3D modeling 在細節、複雜結構與 scalability 方面的瓶頸。過去的方法常因 preprocessing 階段造成細節流失、對複雜幾何表達不足,或在高解析度下需要極其高昂的 memory 與 computation cost。為了尋找一種能將 3D generation 推向極限的 tokenizer,我們最終開發出 SparseFlex——這是重要的一大步。
SparseFlex 結合了 Flexicubes 的優勢——其可 differentiably extract meshes with sharp features——同時創新地引入 sparse voxel structure,只在物體表面附近儲存與計算 voxel information。其優勢十分顯著:

  • 大幅降低 Memory Usage: 使 TripoSF 能以 1024³ 的高解析度進行 training 與 inference。
  • 原生支援 Arbitrary Topologies: 透過省略空白區域中的 voxels,它能自然表達 open surfaces(如布料與葉片),同時有效捕捉內部結構。
  • 可透過 Rendering Loss 直接最佳化: SparseFlex 具可微性,使 TripoSF 能使用 rendering loss 進行 end-to-end training,並避免資料轉換(例如 watertightness 調整)所造成的細節劣化。

實驗結果顯示,TripoSF 樹立了新的 state-of-the-art。在多項標準 benchmarks 上,與先前方法相比,TripoSF 的 Chamfer Distance 約降低了 82%,F-score 約提升了 88%。

Resources

【TripoSG 】

【 TripoSF 】

關於我們 open-source projects 的更多更新與增強內容,將會即時發布於 VAST AI Research 的官方 GitHub、HuggingFace 與 X(前身為 Twitter):

除了這些 open-source projects 之外,Tripo Web 上提供的工具,以及我們具成本效益的 API,也能讓你無縫使用 VAST 提供的最新 model services。
如有任何技術或學術上的建議與合作,歡迎透過 research@vastai3d.com 與我們聯繫。
掃描器無法捕捉月球背面每一道縫隙,但荒野之中始終有人在礦坑中辛勤勞作。十字鎬敲擊土地的聲音不斷迴響,直到有一天它們匯聚為一——那是一記響亮的證明:開源就像十字鎬敲擊地面,因為在沒有地圖的月球背面,仍有人持續開鑿。

探索更多


分享文章

用 3D 生成萬物

點擊下方,加入數百萬 3D 創作者的行列。體驗超高保真模型生成與一流的 PBR 貼圖。