CVPR 2025|Tripo AI та Beihang University відкривають MIDI у відкритому доступі: генерація композиційних 3D-сцен з одного зображення

Цю роботу виконали дослідники з VAST, Beihang University, Tsinghua University та University of Hong Kong. Перший автор — Zehuan Huang, магістрант Beihang University, чиї дослідження зосереджені на generative AI та 3D vision. Авторами-кореспондентами є Yanpei Cao, Chief Scientist у VAST, та Lv Sheng, Associate Professor у Beihang University.


Після того як Sora започаткувала революцію у world models, 3D-сцени, будучи цифровою основою фізичного світу, стають критично важливою інфраструктурою для створення динамічних та інтерактивних AI-систем. Сучасні прориви у генерації 3D-об’єктів з одного зображення забезпечили базову можливість «від уяви до 3D» для створення 3D-контенту.


Однак із розвитком технологій у напрямі генерації складених сцен обмеження парадигм генерації окремих об’єктів стають очевидними. Наявні методи генерують 3D-об’єкти як розрізнені «цифрові атоми», яким складно самоорганізуватися у «молекулярні структури» з коректними просторовими взаємозв’язками. Це призводить до кількох ключових проблем: ① дилема розділення екземплярів (як точно відокремити об’єкти, що перекриваються, з одного ракурсу); ② моделювання фізичних обмежень (як уникнути нереалістичних перетинів і зіткнень); ③ семантичне розуміння на рівні сцени (як зберегти узгодженість між функцією об’єкта та просторовим розташуванням). Ці вузькі місця серйозно перешкоджають ефективній побудові «інтерактивних світів» із «цифрових атомів».


Нещодавно дослідницька команда з Beihang University, VAST та інших установ представила нову модель — MIDI, яка може генерувати 3D-композиційні сцени з високою геометричною якістю та можливістю розділення екземплярів з одного зображення. Це стало проривом у генерації 3D-сцен з одного ракурсу та заклало основу для створення інтерактивних світів.

Технологічний прорив

Традиційні методи реконструкції композиційних 3D-сцен часто покладаються на багатоетапну генерацію об’єкт за об’єктом та оптимізацію сцени, що призводить до тривалих процесів і часто створює сцени з низькою геометричною якістю та неточним просторовим розташуванням. Щоб вирішити ці проблеми, MIDI (Multi-Instance Diffusion Model) інноваційно використовує моделі генерації 3D-об’єктів, розширюючи їх до multi-instance diffusion model, здатної одночасно генерувати кілька 3D-екземплярів із точними просторовими взаємозв’язками, забезпечуючи ефективну та якісну генерацію 3D-сцен:

  1. Від генерації одного об’єкта до генерації кількох екземплярів: одночасно виконуючи denoising латентних представлень кількох 3D-екземплярів і додаючи взаємодію між multi-instance tokens під час процесу denoising, MIDI розширює моделі генерації 3D-об’єктів для одночасної генерації кількох екземплярів із моделюванням взаємодій, які потім безпосередньо об’єднуються у 3D-сцену.
  2. Механізм Multi-Instance Self-Attention: розширюючи механізм self-attention моделей генерації об’єктів до multi-instance self-attention, MIDI ефективно фіксує просторові кореляції між екземплярами та узгодженість усієї сцени під час генерації, усуваючи потребу в оптимізації кожної окремої сцени.
  3. Аугментація даних під час навчання: контролюючи взаємодію між 3D-екземплярами за допомогою обмеженого обсягу даних сцен і доповнюючи навчання даними об’єктів, MIDI ефективно моделює компонування сцен, зберігаючи здатність до узагальнення, отриману під час pre-training.

Згенеровані результати

На основі одного зображення MIDI може генерувати високоякісні композиційні 3D-сцени:

Онлайн-демо



Висока продуктивність

MIDI вирізняється точним моделюванням просторового розташування, високою якістю геометричної генерації, ефективністю генерації та широкою сферою застосування. Експериментальні результати демонструють, що модель перевершує наявні методи на кількох наборах даних, досягаючи чудових показників у просторових взаємозв’язках 3D-екземплярів, геометричній якості 3D-екземплярів і швидкості генерації end-to-end.



Застосування: новий інструмент для створення контенту 3D-сцен

MIDI пропонує нове рішення для створення 3D-сцен. Ця технологія має значний потенціал у таких галузях, як архітектурне проєктування, virtual reality, кіноефекти та розробка ігор. Завдяки можливостям генерації 3D-сцен із високою точністю та високою геометричною якістю MIDI може задовольнити потребу у високоякісному контенті для складних сцен, відкриваючи творцям більше можливостей.

Tripo: AI-Powered 3D Model Generator

Поки MIDI революціонізує композицію 3D-сцен, Tripo розширює можливості створення окремих об’єктів завдяки передовим AI-технологіям:

Перетворення одного зображення на 3D-модель

  • Миттєво перетворюйте одне 2D-зображення на високоякісну 3D-модель.
  • AI-powered reconstruction забезпечує точне відтворення форми й текстури.
  • Ідеально підходить для швидкого прототипування та візуалізації концепцій.

Перетворення кількох зображень на 3D-модель

  • Використовуйте кілька зображень із різних ракурсів для кращої передачі глибини та деталей.
  • Підвищує геометричну точність і реалістичність.
  • Ідеально підходить для точного моделювання об’єктів і дизайну продуктів.

Перетворення тексту на 3D-модель

  • Генеруйте 3D-моделі за простими текстовими описами.
  • AI інтерпретує prompts для створення деталізованих і креативних об’єктів.
  • Прискорює створення концепцій для ігор, VR та анімації.

Auto Rigging & Animation

  • Миттєво підготовлює моделі до анімації з мінімальними зусиллями.
  • AI-driven генерація кісткової структури та рухів.
  • Робить моделі готовими до використання в іграх для безшовної інтеграції.

Подальша робота

Попри чудову продуктивність моделі, команда розробників MIDI визнає, що залишається багато напрямів для вдосконалення та дослідження. Наприклад, подальша оптимізація адаптивності до складних інтерактивних сцен і підвищення деталізації генерації об’єктів є ключовими напрямами майбутньої роботи. Команда сподівається, що завдяки постійному вдосконаленню та доопрацюванню цей напрям досліджень не лише сприятиме розвитку технології генерації композиційних 3D-сцен з одного ракурсу, а й допоможе широкому впровадженню 3D-технологій у практичних застосуваннях.



Пов'язані статті

Дослідження
Deformable Radial Kernel Splatting: розширення Gaussian Splatting у більш загальний і гнучкий фреймворк

Дізнайтеся, як DRK розширює традиційний Gaussian splatting за допомогою навчуваних радіальних базисів, забезпечуючи гнучкіші, чіткіші та різноманітніші 3D-примітиви форм для високоточного відтворення сцени.

Tripo Team
📅 · 2025/11/26
Дослідження
DI-PCG: Ефективна зворотна процедурна генерація контенту на основі дифузії для створення високоякісних 3D-ресурсів

Дізнайтеся, як DI-PCG використовує легку дифузійну модель для виведення точних процедурних параметрів з одного зображення, забезпечуючи ефективну зворотну PCG та створення високоякісних 3D-ресурсів із чистою геометрією та сильною узагальнюваністю.

Tripo Team
📅 · 2025/11/26
Дослідження
Splatter a Video: відеопредставлення Gaussian для універсальної обробки

Дізнайтеся, як Splatter a Video представляє відео за допомогою 3D Gaussians, забезпечуючи універсальні завдання обробки, як-от відстеження, оцінювання глибини, редагування та синтез нових ракурсів без опори на явну інформацію про камеру.

Tripo Team
📅 · 2025/11/26
Поділитися статтею

Створюйте будь-що у 3D

Натисніть нижче, щоб приєднатися до мільйонів 3D-креаторів. Спробуйте генерацію моделей надвисокої якості та найкращі PBR-текстури.