Xây dựng thư viện tài sản 3D AI có thể tìm kiếm với Tripo và Zilliz

Tạo sinh 3D bằng AI đang giúp các nhóm tạo ra tài sản 3D với quy mô lớn dễ dàng hơn đáng kể. Với Tripo, các nhà sáng tạo có thể tạo ra các mô hình 3D chất lượng cao từ lời nhắc văn bản hoặc hình ảnh tham chiếu, hữu ích cho phát triển trò chơi, trực quan hóa thương mại điện tử, sản xuất tiếp thị, thiết kế ý tưởng và quy trình làm việc sáng tạo nội bộ.
Nhưng khi số lượng tài sản được tạo ra tăng lên, một vấn đề mới xuất hiện.
Làm thế nào để bạn tìm thấy đúng tài sản 3D một cách nhanh chóng?
Khi một nhóm chỉ có một vài mô hình, tên thư mục và duyệt thủ công có thể đủ. Nhưng khi có hàng trăm hoặc hàng nghìn tài sản được tạo ra, cách tiếp cận quản lý tệp truyền thống bắt đầu phá vỡ. Các nhà thiết kế có thể tạo ra các tài sản tương tự lặp đi lặp lại. Các nhóm trò chơi có thể mất dấu các biến thể nhân vật hoặc đạo cụ hữu ích. Các nhóm tiếp thị có thể dành nhiều thời gian tìm kiếm tài sản hơn là sử dụng chúng.
Đó là nơi một thư viện tài sản 3D AI có thể tìm kiếm trở nên có giá trị.
Trong quy trình làm việc này, Tripo tạo ra tài sản 3D, trong khi Zilliz Cloud đóng vai trò là lớp truy xuất cho vector đa phương thức và siêu dữ liệu. Nó lưu trữ các embedding đại diện cho mỗi hình ảnh render và kết nối chúng với các trường hữu ích như danh mục, phong cách, màu sắc, loại đối tượng, trường hợp sử dụng và tệp nguồn. Kết quả là một hệ thống truy xuất đa phương thức nhẹ, nơi người dùng có thể tìm kiếm bằng văn bản, hình ảnh tham chiếu hoặc cả hai, và nhận lại các hình ảnh render do Tripo tạo ra phù hợp với siêu dữ liệu có cấu trúc.
Zilliz là một công ty cơ sở hạ tầng dữ liệu AI và là người tạo ra Milvus, cơ sở dữ liệu vector mã nguồn mở đằng sau quy trình làm việc này. Milvus được xây dựng cho các trường hợp sử dụng AI sản xuất như RAG, tác tử AI, tìm kiếm đa phương thức, hệ thống khuyến nghị, cơ sở tri thức doanh nghiệp, tìm kiếm ngữ nghĩa và loại bỏ nội dung trùng lặp. Đây cũng là một dự án tốt nghiệp của Linux Foundation AI & Data với hơn 44.000 sao GitHub và hơn 100 triệu lượt kéo Docker, mang đến cho các nhóm một nền tảng quen thuộc để lưu trữ và truy xuất các embedding vector của dữ liệu phi cấu trúc.
Điều này quan trọng đối với người dùng Tripo vì mỗi tài sản 3D không chỉ là một tệp duy nhất. Mỗi mô hình có thể được kết nối với bản xem trước render, hình ảnh tham chiếu đầu vào, chú thích, thẻ, danh mục, màu sắc, trường hợp sử dụng, ID dự án và URL. Zilliz Cloud làm cho các tín hiệu này có thể tìm kiếm cùng nhau, do đó một thư viện ngày càng tăng các mô hình do AI tạo ra có thể trở thành một hệ thống tài sản sản xuất có thể tái sử dụng thay vì một thư mục chứa các đầu ra một lần.
Tại sao nên xây dựng thư viện tài sản 3D có thể tìm kiếm
Các công cụ 3D AI rất tốt về tốc độ sản xuất. Một nhà sáng tạo duy nhất có thể tạo ra nhiều ý tưởng nhân vật, mô hình sản phẩm, đạo cụ, yếu tố môi trường hoặc tài sản cách điệu trong một thời gian rất ngắn.
Tuy nhiên, tốc độ tạo ra khối lượng. Khối lượng tạo ra các vấn đề quản lý.
Một thư viện tài sản 3D có thể tìm kiếm giúp giải quyết một số vấn đề phổ biến:
- Các nhóm có thể nhanh chóng tìm thấy tài sản hiện có thay vì tạo ra các bản sao.
- Các nhà thiết kế có thể tìm kiếm theo khái niệm, phong cách, màu sắc, loại đối tượng hoặc trường hợp sử dụng.
- Các nhà phát triển có thể tái sử dụng tài sản 3D trên các dự án hiệu quả hơn.
- Các nhóm sáng tạo có thể xây dựng một thư viện nội bộ gồm các vật liệu trực quan đã được phê duyệt, có thể tái sử dụng.
- Các nhóm thương mại điện tử hoặc tiếp thị có thể tổ chức các tài sản 3D giống như sản phẩm theo danh mục và phong cách.
Thay vì coi các tệp 3D do AI tạo ra là đầu ra một lần, quy trình làm việc này biến chúng thành một hệ thống tài sản có thể tái sử dụng.
Tại sao Zilliz Cloud phù hợp với tìm kiếm tài sản 3D đa phương thức
Zilliz Cloud là một nền tảng Vector Lakebase được quản lý hoàn toàn do những người tạo ra Milvus xây dựng. Cốt lõi của nó là một cơ sở dữ liệu vector cấp sản xuất cho tìm kiếm vector thông lượng cao, độ trễ thấp ở quy mô 100 tỷ. Xung quanh cốt lõi đó, Zilliz Cloud mở rộng tìm kiếm vector với tính mở, khả năng mở rộng và kinh tế của các hồ dữ liệu đa phương thức, mang đến cho các nhóm một nền tảng duy nhất để tìm kiếm, phân tích và quản trị dữ liệu phi cấu trúc cho AI sản xuất.
Điều này phù hợp với thư viện tài sản Tripo vì dữ liệu về bản chất là đa phương thức. Một danh mục 3D có thể tìm kiếm có thể cần làm việc với hình ảnh render, hình ảnh tham chiếu, chú thích văn bản, siêu dữ liệu được tạo, trường sở hữu nhóm và thẻ dành riêng cho dự án cùng một lúc. Zilliz Cloud kết nối các tín hiệu đó thông qua tìm kiếm vector và truy xuất siêu dữ liệu, do đó người dùng có thể tìm thấy tài sản theo ý nghĩa, độ tương đồng thị giác, bộ lọc có cấu trúc hoặc kết hợp cả ba.
Zilliz giải thích sự phát triển sản phẩm này trong Từ cơ sở dữ liệu vector đến Vector Lakebase và Tại sao chúng tôi xây dựng Vector Lakebase. Ý tưởng chính là các hệ thống AI hiện đại cần nhiều hơn tìm kiếm lân cận gần nhất. Chúng cũng cần một nền tảng dữ liệu để phục vụ thời gian thực, khám phá lặp lại, phân tích hàng loạt và quản trị trên các tập dữ liệu phi cấu trúc đang phát triển nhanh chóng. Những nhu cầu đó ánh xạ trực tiếp đến các thư viện 3D AI, nơi các nhóm muốn truy xuất kết quả tốt nhất hôm nay và tiếp tục cải thiện danh mục theo thời gian.

Tổng quan quy trình làm việc
Bản demo này sử dụng ba loại dữ liệu cục bộ:
- Tệp CSV lưu trữ siêu dữ liệu cho mỗi tài sản 3D, chẳng hạn như danh mục, phong cách, loại đối tượng, màu sắc, trường hợp sử dụng, tên tệp và thông tin dự án liên quan.
- Thư mục milvus_render_images/ lưu trữ các hình ảnh xem trước được render của các tài sản do Tripo tạo ra. Các hình ảnh render này là mục tiêu truy xuất chính.
- Thư mục milvus_input_images/ lưu trữ các hình ảnh tham chiếu được sử dụng trong quá trình tạo sinh từ hình ảnh sang 3D. Chúng chủ yếu được sử dụng làm siêu dữ liệu và làm tham chiếu truy vấn tùy chọn.
Nói một cách đơn giản: thiết lập này cho phép người dùng mô tả những gì họ cần, tải lên một tham chiếu trực quan hoặc kết hợp cả hai đầu vào để tìm thấy tài sản liên quan từ thư viện.
Điều kiện tiên quyết
Trước khi bắt đầu, hãy đảm bảo bạn có những điều sau:
- Tài khoản Zilliz Cloud. Zilliz Cloud là một nền tảng Vector Lakebase được quản lý hoàn toàn do những người tạo ra Milvus xây dựng. Nó kết hợp một cơ sở dữ liệu vector cấp sản xuất với một nền tảng gốc hồ cho dữ liệu đa phương thức, do đó bạn có thể lưu trữ các embedding và siêu dữ liệu có cấu trúc mà không cần vận hành cơ sở hạ tầng vector của riêng mình. Bậc miễn phí đủ để làm theo. Đăng ký Zilliz Cloud, tạo một cụm miễn phí và lấy URI và mã thông báo của nó.
- Khóa API OpenRouter cho mô hình embedding đa phương thức Gemini được sử dụng bên dưới.
- Python 3.10+ với SDK Python Milvus được cài đặt (
pip install -U pymilvus). Xem hướng dẫn cài đặt PyMilvus nếu bạn mới làm quen. - Một bộ tài sản 3D do Tripo tạo ra — hình ảnh xem trước render và, tùy chọn, các hình ảnh tham chiếu được sử dụng cho tạo sinh từ hình ảnh sang 3D.
Bước 1: Chuẩn bị dữ liệu tài sản 3D do Tripo tạo ra
Bước đầu tiên là chuẩn bị dữ liệu được tạo ra thông qua Tripo.
Mỗi tài sản nên có ít nhất:
- Một hình ảnh xem trước render
- Một hàng siêu dữ liệu trong CSV
- Thông tin hình ảnh đầu vào/tham chiếu tùy chọn
- Các trường danh mục, phong cách, trường hợp sử dụng, đối tượng và màu sắc nếu có
Ví dụ: một tài sản có thể bao gồm siêu dữ liệu như thế này:
| Trường | Giá trị ví dụ |
|---|---|
| Danh mục | Nhân vật |
| Phong cách | Giả tưởng |
| Loại đối tượng | Nữ chiến binh |
| Màu sắc | Xanh dương, Bạc |
| Trường hợp sử dụng | Tài sản trò chơi |
| Tên tệp | warrior_female_01.webp |
Siêu dữ liệu này quan trọng vì chỉ riêng tìm kiếm vector không phải lúc nào cũng đủ. Trong một thư viện tài sản thực tế, người dùng thường muốn kết hợp tìm kiếm ngữ nghĩa với bộ lọc.
Ví dụ:
- Tìm một "nhân vật nữ" trong trường hợp sử dụng "tài sản trò chơi".
- Tìm "kiếm giả tưởng với đá quý màu xanh" trong danh mục "vũ khí".
- Tìm tài sản theo một phong cách trực quan cụ thể, chẳng hạn như thực tế, hoạt hình, khoa học viễn tưởng hoặc low poly.
Cấu trúc siêu dữ liệu của bạn càng tốt, thư viện tài sản của bạn càng hữu ích.
Ràng buộc định dạng hình ảnh để nhúng
Hình ảnh render và hình ảnh tham chiếu đầu vào được lưu trữ ở định dạng .webp để tiết kiệm lưu trữ.
Tuy nhiên, mô hình embedding Gemini (gemini-embedding-2-preview) chỉ hỗ trợ đáng tin cậy đầu vào PNG và JPEG. Hình ảnh WebP có thể gây lỗi nhúng tùy thuộc vào phần phụ trợ API.
Do đó, cần có bước tiền xử lý để chuyển đổi hình ảnh sang PNG hoặc JPEG trước khi tạo embedding.
Bước 2: Tạo một collection trong Zilliz Cloud
Trong Zilliz Cloud, mỗi bản ghi trong collection đại diện cho một tài sản 3D do Tripo tạo ra.
Đây là nơi mô hình Vector Lakebase trở nên hữu ích. Một cơ sở dữ liệu vector truyền thống rất tốt cho tìm kiếm tương tự thời gian thực. Một Vector Lakebase giữ đường dẫn truy xuất đó trong khi thêm một nền tảng dữ liệu gốc hồ dùng chung cho dữ liệu đa phương thức, phân tích hàng loạt, khám phá lặp lại và quản trị. Trong bản demo này, chúng ta sử dụng nó một cách nhẹ nhàng, nhưng cùng một cấu trúc có thể phát triển với một thư viện tài sản Tripo lớn hơn nhiều.
Collection lưu trữ cả siêu dữ liệu có cấu trúc và một vector đa phương thức. Trường vector chính là multimodal_vector. Trong bản demo này, kích thước vector là 3072 và COSINE được sử dụng làm số liệu tương tự.
Bởi vì các truy vấn văn bản, hình ảnh và văn bản cộng hình ảnh được nhúng vào cùng một không gian vector, hệ thống có thể tìm kiếm tất cả tài sản bằng một trường vector thống nhất.
Đây là thiết lập schema đơn giản:
from pymilvus import MilvusClient
client = MilvusClient(uri=ZILLIZ_URI, token=ZILLIZ_TOKEN)
schema = client.create_schema(auto_id=False, enable_dynamic_field=False)
schema.add_field("asset_id", datatype=DataType.VARCHAR, max_length=64, is_primary=True)
schema.add_field("project_id", datatype=DataType.VARCHAR, max_length=64)
schema.add_field("operator_id", datatype=DataType.VARCHAR, max_length=64)
schema.add_field("caption", datatype=DataType.VARCHAR, max_length=1024)
schema.add_field("llm_category", datatype=DataType.VARCHAR, max_length=256)
schema.add_field("llm_style", datatype=DataType.VARCHAR, max_length=256)
schema.add_field("llm_object_type", datatype=DataType.VARCHAR, max_length=256)
schema.add_field("llm_color", datatype=DataType.VARCHAR, max_length=256)
schema.add_field("llm_use_case", datatype=DataType.VARCHAR, max_length=256)
schema.add_field("generation_mode", datatype=DataType.VARCHAR, max_length=64)
schema.add_field("render_image_path", datatype=DataType.VARCHAR, max_length=1024)
schema.add_field("input_image_path", datatype=DataType.VARCHAR, max_length=1024)
schema.add_field("multimodal_vector", datatype=DataType.FLOAT_VECTOR, dim=3072)
Sau đó tạo chỉ mục vector:
index_params = client.prepare_index_params()
index_params.add_index(
field_name="multimodal_vector",
index_type="AUTOINDEX",
metric_type="COSINE"
)
Sau khi xác định schema và chỉ mục, chạy:
client.create_collection(
collection_name="tripo_asset_library",
schema=schema,
index_params=index_params
)
Khi lệnh hoàn tất, bạn sẽ thấy collection trong bảng điều khiển Zilliz Cloud.

Nhấp vào collection, bạn cũng có thể xem trạng thái, schema, các thực thể đã tải và cấu hình trường vector của nó.

Một lưu ý về chỉ mục: bản demo này sử dụng AUTOINDEX, cho phép Zilliz Cloud chọn và điều chỉnh chỉ mục vector cho bạn dựa trên dữ liệu của bạn — không cần chọn thủ công loại chỉ mục hoặc tham số. Loại số liệu COSINE phù hợp với các embedding được chuẩn hóa L2 được tạo trong bước tiếp theo. Và vì mỗi bản ghi là một thực thể trong một collection được quản lý, cùng một thiết lập có thể mở rộng từ hàng trăm tài sản đến hàng triệu mà không cần thiết kế lại kiến trúc.
Bước 3: Tạo embedding cho hình ảnh render
Tiếp theo, tạo embedding cho các hình ảnh xem trước render của Tripo.
Trong quy trình làm việc này, các hình ảnh render được chuyển đổi thành URL dữ liệu base64 và gửi đến một mô hình embedding. Các vector trả về được chuẩn hóa để có thể sử dụng với tìm kiếm tương tự COSINE.
Đây là logic cốt lõi:
import requests
import base64
def get_image_embedding(image_path: str) -> list[float]:
with open(image_path, "rb") as f:
b64 = base64.b64encode(f.read()).decode("utf-8")
data_url = f"data:image/png;base64,{b64}"
response = requests.post(
"https://openrouter.ai/api/v1/embeddings",
headers={"Authorization": f"Bearer {OPENROUTER_API_KEY}"},
json={
"model": "google/gemini-embedding-2-preview",
"input": [{"data": data_url, "type": "image"}]
}
)
embedding = response.json()["data"][0]["embedding"]
norm = sum(x*x for x in embedding) ** 0.5
return [x / norm for x in embedding]
Để xây dựng bộ nhớ cache embedding cho toàn bộ tập dữ liệu, chạy:
import csv, json
embedding_cache = {}
with open("asset_metadata.csv") as f:
reader = csv.DictReader(f)
for row in reader:
render_path = row["render_image_path"]
embedding_cache[render_path] = get_image_embedding(render_path)
with open("embedding_cache.json", "w") as f:
json.dump(embedding_cache, f)
Bước lưu cache hữu ích vì việc tạo embedding có thể tốn thời gian và phụ thuộc vào API. Thay vì tạo embedding mỗi khi bạn nhập dữ liệu, bạn có thể xây dựng cache một lần và tái sử dụng nó trong quá trình nhập.

Bước 4: Nhập dữ liệu vào Zilliz Cloud
Sau khi tạo cache embedding, mỗi hàng trong CSV được chuyển đổi thành một thực thể Zilliz Cloud.
Mỗi thực thể bao gồm:
- ID tài sản
- ID dự án
- ID người vận hành
- Chú thích
- Siêu dữ liệu do LLM tạo
- Chế độ tạo sinh
- Thông tin tệp hình ảnh render
- Thông tin tệp hình ảnh đầu vào
- Vector đa phương thức
Đây là phiên bản đơn giản của hàm chuyển đổi thực thể:
def csv_row_to_entity(row: dict, embedding_cache: dict) -> dict:
render_path = row["render_image_path"]
return {
"asset_id": row["asset_id"],
"project_id": row["project_id"],
"operator_id": row["operator_id"],
"caption": row["caption"],
"llm_category": row.get("category", ""),
"llm_style": row.get("style", ""),
"llm_object_type": row.get("object_type", ""),
"llm_color": row.get("color", ""),
"llm_use_case": row.get("use_case", ""),
"generation_mode": row.get("generation_mode", ""),
"render_image_path": render_path,
"input_image_path": row.get("input_image_path", ""),
"multimodal_vector": embedding_cache.get(render_path, [])
}
Sau đó nhập toàn bộ tập dữ liệu:
entities = []
with open("asset_metadata.csv") as f:
reader = csv.DictReader(f)
for row in reader:
entities.append(csv_row_to_entity(row, embedding_cache))
client.insert(collection_name="tripo_asset_library", data=entities)
Sau khi nhập hoàn tất, mở bảng điều khiển Zilliz Cloud và kiểm tra tab Dữ liệu. Bạn sẽ thấy các bản ghi tài sản đã nhập, bao gồm các trường siêu dữ liệu và thông tin vector.

Tại thời điểm này, các tài sản 3D do Tripo tạo ra không còn chỉ là các tệp cục bộ. Chúng giờ đây là các thực thể có thể tìm kiếm trong một cơ sở dữ liệu vector.
Bước 5: Tìm kiếm thư viện tài sản 3D
Hệ thống tìm kiếm hỗ trợ ba chế độ truy vấn:
- Tìm kiếm văn bản — tìm kiếm theo mô tả ngữ nghĩa
- Tìm kiếm hình ảnh — tìm kiếm theo độ tương đồng thị giác
- Tìm kiếm văn bản + hình ảnh — kết hợp cả hai để truy xuất chính xác hơn
Cả ba loại truy vấn đều được chuyển đổi thành vector bằng cùng một mô hình embedding đa phương thức. Sau đó, vector truy vấn được tìm kiếm trên trường multimodal_vector trong Zilliz Cloud.
Tìm kiếm văn bản
Tìm kiếm văn bản hữu ích khi người dùng đã biết họ muốn gì.
Truy vấn ví dụ: "Một nhân vật nữ với áo giáp xanh dương và bạc"
Hệ thống nhúng truy vấn văn bản, tìm kiếm trong collection và trả về các hình ảnh render gần nhất kèm siêu dữ liệu.
Điều này đặc biệt hữu ích cho các nhóm sáng tạo muốn tìm kiếm theo ý định ngữ nghĩa thay vì tên tệp chính xác. Ví dụ: một nhà thiết kế không cần nhớ tệp có tên char_f_warrior_01 hay f_warrior_blue. Họ có thể chỉ cần tìm kiếm: "nữ chiến binh áo giáp xanh". Đó là sự khác biệt giữa một kho lưu trữ tệp và một hệ thống truy xuất tài sản thực sự.
Tìm kiếm hình ảnh
Tìm kiếm hình ảnh hữu ích khi người dùng có một hình ảnh tham chiếu và muốn tìm các tài sản 3D tương tự về mặt thị giác.
Ví dụ: một nghệ sĩ trò chơi có thể tải lên một hình ảnh tham chiếu của một tấm khiên cách điệu và tìm kiếm các đạo cụ do Tripo tạo ra tương tự trong thư viện hiện có. Thay vì duyệt thủ công qua hàng trăm hình ảnh, hệ thống có thể truy xuất các tài sản khớp với cấu trúc thị giác, phong cách hoặc khái niệm đối tượng của tham chiếu được tải lên.
Tìm kiếm văn bản + hình ảnh
Tìm kiếm văn bản cộng hình ảnh là tùy chọn linh hoạt nhất. Nó cho phép người dùng kết hợp ý định ngữ nghĩa với hướng dẫn trực quan.
Ví dụ: người dùng có thể tải lên một hình ảnh tham chiếu thanh kiếm và thêm truy vấn văn bản: "kiếm giả tưởng với đá quý màu xanh". Hình ảnh cung cấp tham chiếu trực quan, trong khi văn bản thu hẹp ý định tìm kiếm. Điều này làm cho việc truy xuất cụ thể hơn so với chỉ sử dụng một trong hai đầu vào.
Đây là logic tìm kiếm đơn giản:
def search_assets(query_embedding: list[float], filter_expr: str = "", limit: int = 12):
return client.search(
collection_name="tripo_asset_library",
data=[query_embedding],
anns_field="multimodal_vector",
filter=filter_expr,
limit=limit,
output_fields=[
"asset_id", "caption", "llm_category",
"llm_style", "llm_use_case", "render_image_path"
]
)
Các kết quả trả về bao gồm cả điểm tương tự và siêu dữ liệu, giúp hiển thị bản xem trước tài sản phù hợp trong giao diện front-end.
Lưu ý rằng tìm kiếm không giới hạn ở độ tương tự vector thuần túy. Bởi vì mỗi tài sản cũng mang siêu dữ liệu có cấu trúc (danh mục, phong cách, trường hợp sử dụng, v.v.), bạn có thể kết hợp độ tương tự ngữ nghĩa với các điều kiện siêu dữ liệu trong một yêu cầu duy nhất — ví dụ: tìm kiếm "nữ" nhưng giới hạn kết quả ở llm_use_case == "game asset". Đây là tìm kiếm được lọc và nó biến một nhóm vector thành một danh mục tài sản có thể truy vấn. Nếu sau này bạn muốn khớp nhiều tín hiệu cùng một lúc, Zilliz Cloud cũng hỗ trợ tìm kiếm lai đa vector trên nhiều embedding cho mỗi tài sản.
Ví dụ 1: Tìm kiếm theo văn bản và trường hợp sử dụng
Trong bản demo, một truy vấn ví dụ sử dụng văn bản "nữ" với bộ lọc trường hợp sử dụng llm_use_case == "game asset" và đặt limit=12.
Điều này truy xuất 12 tài sản khớp hàng đầu có liên quan về mặt ngữ nghĩa đến "nữ" và thuộc trường hợp sử dụng tài sản trò chơi.
Loại tìm kiếm này hữu ích cho các quy trình phát triển trò chơi, nơi các nhóm cần nhanh chóng định vị các ý tưởng nhân vật, thiết kế NPC, hình đại diện cách điệu hoặc tài sản hình người từ một thư viện nội bộ lớn.
Ví dụ 2: Tìm kiếm theo văn bản và hình ảnh tham chiếu
Một ví dụ khác kết hợp truy vấn văn bản với hình ảnh tham chiếu.
Truy vấn văn bản là: "Vũ khí phong cách giả tưởng với trang trí chi tiết và hiệu ứng phát sáng". Truy vấn cũng bao gồm một hình ảnh tham chiếu trực quan. Hệ thống sau đó tạo một embedding chung cho văn bản và hình ảnh cùng nhau, tìm kiếm trên cùng một trường vector và trả về các hình ảnh render phù hợp nhất.
Điều này hữu ích khi ý định của người dùng quá cụ thể để chỉ dùng văn bản. Đối với tìm kiếm tài sản trực quan, "tương tự như thế này, nhưng giống thế kia hơn" thường chính là cách các nhà sáng tạo nghĩ.
Tại sao quy trình làm việc này quan trọng
Giá trị thực sự ở đây không chỉ là tìm kiếm hình ảnh — mà là cơ sở hạ tầng tài sản 3D AI có thể tái sử dụng. Tripo xử lý tạo sinh nhanh chóng; Zilliz Cloud xử lý lưu trữ vector, tìm kiếm tương tự, truy xuất siêu dữ liệu và lớp dữ liệu đằng sau tìm kiếm đa phương thức. Cùng nhau, chúng biến các đầu ra 3D riêng lẻ thành một thư viện có tổ chức, có thể tìm kiếm và tái sử dụng, giúp cải thiện trực tiếp hiệu quả sản xuất cho các nhóm tạo nội dung 3D ở quy mô lớn.
Bởi vì Zilliz Cloud được xây dựng cho AI sản xuất, cùng một mô hình có thể bắt đầu nhỏ và mở rộng theo nhóm. Các studio trò chơi có thể định vị các biến thể nhân vật, đạo cụ và môi trường; các nhóm thương mại điện tử có thể tổ chức các mô hình sản phẩm theo danh mục, màu sắc hoặc chất liệu; các nhóm tiếp thị có thể tái sử dụng hình ảnh hiện có thay vì tạo lại chúng; và các nhóm vận hành sáng tạo có thể duy trì một kho lưu trữ trung tâm, có thể tìm kiếm các tài sản đã được phê duyệt trên các dự án.
Kết luận
Tạo sinh 3D bằng AI giờ đây đủ nhanh để việc tạo ra không còn là nút thắt duy nhất. Thách thức tiếp theo là điều gì xảy ra sau khi một mô hình được tạo ra — cách nó được lưu trữ, tìm thấy lại, quản trị và tái sử dụng thay vì biến mất vào một thư mục.
Quy trình làm việc này kết nối Tripo và Zilliz Cloud để giải quyết chính xác điều đó: Tripo tạo ra các tài sản chất lượng cao từ văn bản hoặc hình ảnh tham chiếu, và Zilliz Cloud thêm lớp truy xuất — hình ảnh render, embedding đa phương thức, siêu dữ liệu có cấu trúc và tìm kiếm vector có thể mở rộng. Nói cách khác, Tripo trở thành công cụ tạo 3D, trong khi Zilliz Cloud trở thành cơ sở hạ tầng dữ liệu AI giữ cho các sáng tạo đó có thể tìm kiếm, tái sử dụng và sẵn sàng cho dự án tiếp theo.
Tự mình thử
Tạo sinh 3D bằng AI chỉ là bước đầu tiên — phần thưởng đến từ việc biến các tài sản được tạo thành một hệ thống có cấu trúc, có thể tìm kiếm, mở rộng trên các nhóm và dự án. Với Tripo, bạn tạo ra các tài sản 3D chất lượng cao từ lời nhắc văn bản hoặc hình ảnh tham chiếu. Với Zilliz Cloud, bạn tổ chức và truy xuất chúng thông qua tìm kiếm vector đa phương thức trên văn bản và hình ảnh, được hỗ trợ bởi một Vector Lakebase được quản lý được thiết kế cho các quy trình làm việc AI sản xuất.
- Đăng ký Zilliz Cloud và làm theo hướng dẫn này từ đầu đến cuối trên bậc miễn phí.
- Tạo tài sản 3D của bạn với Tripo




