Giới thiệu Project Eden: Một world model cho Multiplayer và Agents

Banner tiêu đề Project Eden hiển thị một quả táo đỏ khổng lồ trong khung cảnh hẻm núi sa mạc, bởi VAST AI Research

Chúng tôi đang phát hành bản xem trước nghiên cứu của Project Eden, một persistent world model được xây dựng cho môi trường multiplayer và các AI agents cùng chia sẻ một thế giới nhất quán. Nó chạy liên tục, ghi nhớ những gì bạn làm với nó, và duy trì tính nhất quán bất kể camera nào đang nhìn vào. Bản xem trước kỹ thuật đầy đủ có tại đây: Project Eden research preview.

Ý tưởng đằng sau Project Eden thì dễ nói ra nhưng rất khó xây dựng. Phần lớn các hệ thống hiện đang được gọi là "world models" thực chất là video generators; chúng dự đoán khung hình tiếp theo và quên mọi thứ ngay khi nó trôi khỏi màn hình. Thay vào đó, Project Eden giữ cho thế giới tiếp tục vận hành bên dưới hình ảnh. Dập tắt một đám cháy và nó sẽ tiếp tục tắt. Nhìn đi chỗ khác khỏi một bức tường, khi quay lại nó vẫn ở đó. Hai người chơi đua trên cùng một đường đua từ các góc nhìn khác nhau và vẫn ở trong cùng một thực tại.

Khác biệt đó chính là toàn bộ điểm cốt lõi. Các phần bên dưới giải thích vì sao điều đó quan trọng và cách nó hoạt động.

Vì Sao Phần Lớn "World Models" Không Phải Vậy

Generative video đã trở nên rất tốt. Các action-conditioned models phản hồi đầu vào của bạn và tạo ra chuyển động mượt mà, và ngành công nghiệp bắt đầu gọi chúng là world models.

Tuy vậy, vẫn có một khoảng cách giữa việc dự đoán pixel và mô phỏng một thế giới. Việc tạo ra khung hình tiếp theo cho bạn biết hình ảnh nên thay đổi như thế nào. Một world model thực sự phải theo dõi ý nghĩa của các pixel đó: các vật thể, không gian, quy tắc, ký ức, và các hệ quả vật lý cần được giữ nguyên dù camera có đang nhìn vào hay không.

Nghiên cứu cho đến nay đã tách thành hai hướng, và mỗi hướng đều chạm tường.

Action-conditioned video generation xử lý chuyển động tốt nhưng không có trí nhớ lâu dài. "Trạng thái" của thế giới nằm bên trong một cửa sổ ngắn gồm các khung hình gần đây, vì vậy bất cứ thứ gì rời khỏi camera đều có thể trôi lệch, biến mất, hoặc quay lại sai. Bạn có thời gian mà không có tính bền vững.

Static 3D scene generation cho bạn một không gian vững chắc, có thể đi lại, nhưng nó bị đóng băng. Physics, các sự kiện, và sự thay đổi không nằm trong thiết kế. Bạn có cấu trúc mà không có biến đổi.

Vì vậy, một hướng nhớ cách mọi thứ chuyển động nhưng quên rằng chúng tồn tại. Hướng kia nhớ rằng chúng tồn tại nhưng không thể để chúng thay đổi. Một world model thực sự cần cả hai.

Ý Tưởng Cốt Lõi: Trạng Thái Trước Rendering

Lựa chọn thiết kế chính của Project Eden là tách trạng thái thế giới khỏi rendering.

Thực tại vốn đã vận hành như vậy. Thế giới tồn tại trước khi bất kỳ camera nào nhìn vào nó. Đây là những câu hỏi về trạng thái, không phải về rendering. Vì thế, thay vì nhồi không gian, vật thể, sự kiện và diện mạo vào một dòng pixel, Project Eden giữ cho một thế giới nền tảng tự vận hành độc lập. Rendering trở thành một cách để quan sát thế giới đó, chứ không phải nơi thế giới được lưu trữ.

Cách Nó Hoạt Động: Ba Lớp

Một video generator làm mọi thứ được thay bằng ba lớp, mỗi lớp có một nhiệm vụ rõ ràng.

Một trạng thái có cấu trúc đang tiến hóa. Đây là nơi thế giới tồn tại. Nó là một biểu diễn cô đọng, không phải một đám mây điểm 4D khổng lồ, và nó theo dõi hình học thô, danh tính vật thể, ngữ nghĩa, và những gì hành động của bạn đã gây ra. Các vật thể rời khỏi khung hình không bị vứt bỏ. Các thay đổi được ghi ngược trở lại và được giữ lại.

Một giao diện từ state sang observation. Khi một góc nhìn cần được rendering, lớp này biến trạng thái thế giới thành các tín hiệu có điều kiện theo camera: hình học cục bộ, ngữ nghĩa, các thay đổi gần đây. Mọi góc nhìn đều lấy dữ liệu từ cùng một nguồn, vì vậy các camera khác nhau vẫn nhất quán về mặt vật lý.

Generative neural rendering. Bộ renderer nhận các tín hiệu đó và tạo ra thứ bạn nhìn thấy: ánh sáng, texture, vật liệu, khói, lửa, nước, chuyển động. Nó không cần phải ghi nhớ thế giới. Nó chỉ cần hiển thị nó.

Eden Có Thể Làm Gì

Việc tách trạng thái khỏi rendering mở ra những khả năng mà video thuần túy hoặc 3D tĩnh không thể cùng lúc làm được.

Các vật thể không biến mất khi rời khỏi khung hình. Chúng vẫn ở trong trạng thái nền tảng, nên bạn có thể nhìn đi chỗ khác bao lâu tùy thích và thế giới vẫn còn đó khi bạn quay lại. Trong bản demo dập lửa của chúng tôi, việc dập tắt đám cháy không phải là một hiệu ứng thoáng qua. Môi trường chuyển sang một trạng thái đã thay đổi và giữ nguyên trạng thái đó.

Physics phản hồi với nhiều loại đầu vào khác nhau. Lái thuyền hoặc lái xe, và hành động đó được ghi nhận vào trạng thái rồi cập nhật động lực học.

Thế giới có thể tái sử dụng và chỉnh sửa. Video generation chỉ chạy theo một chiều; một khi dòng thời gian đã trôi qua, bạn không thể quay lại can thiệp. Eden cho phép bạn tác động lên một thế giới đang vận hành lặp đi lặp lại. Để lại một dấu vết, di chuyển một vật thể, kích hoạt một kết quả, và nó sẽ tồn tại dai dẳng. Những người khác bước vào thế giới đó sẽ thấy cùng các thay đổi đó.

Multiplayer được tích hợp sẵn. Nhiều agents chia sẻ một trạng thái cô đọng duy nhất, với một góc nhìn riêng được rendering cho mỗi camera. Trong bản demo đua xe, hai chiếc xe chia sẻ một đường đua đồng bộ từ các góc nhìn khác nhau. Trong bản demo trường bắn, những người chơi khác nhau thực hiện các hành động khác nhau trong cùng một môi trường, và Eden xử lý chúng theo cùng một bộ quy tắc.

Nó có thể huấn luyện agents. Một thế giới có physics ổn định, tính nhất quán theo thời gian, và trí nhớ dài hạn sẽ hoạt động như một môi trường để huấn luyện và kiểm thử embodied AI, nơi các hành động có kết quả đáng tin cậy và thế giới không reset sau mỗi lần liếc nhìn.

Vì Sao Điều Này Quan Trọng

Eden phục vụ hai nhóm đối tượng. Với các nhà sáng tạo, đây là một engine cho nội dung tương tác: tạo ra một môi trường, thiết lập tương tác, mời mọi người vào cùng một không gian bền vững. Với các nhà nghiên cứu, đây là một nền tảng mô phỏng với tính nhất quán dài hạn, các quy tắc vật lý thực, kịch bản có thể chỉnh sửa, và các hệ quả có thể đo lường được, tức là những gì embodied agents cần để học một cách đáng tin cậy.

Đó là lý do chúng tôi không xếp world models vào dưới nhánh video generation. Một world model cần một trạng thái có thể thay đổi.

Tiếp Theo Là Gì

Đây là một research preview, không phải một world model đa dụng hoàn chỉnh, và công việc vẫn đang ở giai đoạn đầu. Chúng tôi đang xây dựng physics phong phú hơn, môi trường lớn hơn, khả năng khám phá free-viewpoint rộng hơn, tương tác vật thể tinh vi hơn, và một State Transition Model mạnh hơn để cập nhật thế giới từ hành động, quy tắc và phản hồi. Việc đánh giá cũng cần phát triển thêm, kiểm thử tính bền vững, tính nhất quán nhân quả, khả năng tuân theo quy tắc, và đồng bộ multi-agent, chứ không chỉ riêng chất lượng hình ảnh.

Việc chuyển từ dự đoán pixel tiếp theo sang mô phỏng trạng thái tiếp theo không chỉ là một thay đổi về kỹ thuật. Nó mở ra hướng đi cho AI có thể tạo ra, ghi nhớ và suy luận bên trong những thế giới có thể duy trì ổn định.

Hãy đọc bài viết đầy đủ, kèm demo và chi tiết kiến trúc, trong Project Eden research preview.

Về VAST AI Research: VAST AI Research xây dựng các 3D foundation models và world models. Tìm hiểu thêm tại tripo3d.ai/research và theo dõi @vastairesearch.

Chia sẻ bài viết

Tạo mọi thứ trong 3D

Nhấn vào đây để tham gia cùng hàng triệu nhà sáng tạo 3D. Trải nghiệm khả năng tạo mô hình siêu chi tiết và texture PBR hàng đầu.