Narzędzia · 5 MIN

Obraz-do-3D z TRELLIS: zasoby 3D z jednego promptu

TRELLIS tworzy z obrazu lub promptu zasób 3D w formacie GLB, na licencji MIT. Co opanowuje i jakiej obróbki jeszcze wymaga.

Obraz-do-3D z TRELLIS: zasoby 3D z jednego promptu
LOKALIZACJA
Świat
AUTOR
Aashwin Shrivastava
OPUBLIKOWANO
19 cze 2026
OBRAZ
WYGENEROWANE PRZEZ AI

Tłumaczenie wygenerowane automatycznie przez AI. Wersja niemiecka jest oryginałem zweryfikowanym redakcyjnie.

TRELLIS, otwarty generator 3D od Microsoft Research, w mniej niż dwie minuty na konsumenckiej karcie GPU tworzy z pojedynczego obrazu lub promptu tekstowego użyteczny zasób 3D, i jest dostępny na licencji MIT. Dla conceptingu, podglądów web i AR oraz makiet e-commerce to prawdziwy skrót. Dla pipeline'ów gamingowych lub CAD uczciwa ocena wygląda inaczej: należy traktować wynik jako szybki punkt startowy, który wymaga jeszcze obróbki, a nie jako gotowy zasób.

Ten artykuł omawia, czym jest TRELLIS, jak działa, gdzie pasuje w prawdziwym pipeline'ie zasobów i w którym momencie przestaje być odpowiedzią jednego kliknięcia.

01. Czym jest TRELLIS

TRELLIS to generatywny model 3D, który przyjmuje obraz, kilka obrazów lub prompt tekstowy i tworzy zasób 3D.

🔸 Ustrukturyzowane latenty (SLAT). Kluczowy pomysł to jednolity latent, który łączy rzadką siatkę wokseli 3D dla struktury z gęstymi cechami wizualnymi dla wyglądu. Oddzielenie formy od wyglądu jest tym, co sprawia, że ten sam latent może stać się różnymi wynikami.
🔸 Trzy wyniki z jednego latentu. Radiance fields, gaussiany 3D lub mesh wyeksportowany jako GLB. GLB jest praktycznym celem, ponieważ przenosi materiały do przeglądarek web i AR.
🔸 Otwarty i na licencji MIT. Koń roboczy dla obrazów, TRELLIS-image-large, ma 1,2 mld parametrów. Model i większość kodu są objęte licencją MIT, co ma znaczenie dla zastosowań komercyjnych. Nowsza seria 4B dodaje pełne materiały oparte na fizyce, warte obserwowania w miarę dojrzewania.
🔸 Trenowany na dużą skalę. Około 500 000 wyselekcjonowanych obiektów, a artykuł naukowy zdobył wyróżnienie CVPR 2025 Spotlight.

To stoi obok parametrycznego, sterowalnego krańca pracy 3D, który omawiamy w Grasshopper dla projektowania wspomaganego komputerowo. Generatywne 3D i parametryczne 3D rozwiązują różne problemy.

02. Jak to działa

Ten pipeline łatwo opisać i warto zrozumieć, zanim poświęci mu się GPU.

  1. Wejście. Pojedynczy obraz, kilka ujęć lub prompt tekstowy.
  2. Ustrukturyzowany latent. Dwuetapowy transformer rectified-flow najpierw generuje rzadką strukturę, a następnie wypełnia cechy SLAT.
  3. Dekodowanie. Latent dekoduje się do wybranego formatu: mesh, gaussiany lub radiance field.

W praktyce należy liczyć na około 16 GB VRAM jako dolną granicę, przy 24 GB komfortowo. Generowanie trwa poniżej dwóch minut na karcie RTX 4090. Buildy społecznościowe dalej obniżają zapotrzebowanie na pamięć, co realistycznie czyni TRELLIS możliwym do hostowania samodzielnie zamiast wynajmowania. Dla zespołów, które już rozważają wnioskowanie lokalne kontra hostowane, obowiązuje ten sam kompromis, który opisaliśmy w On-Premise kontra Cloud-LLM, także dla mediów generatywnych.

03. Gdzie pasuje w pipeline zasobów

Najmocniejsze dopasowanie znajduje się na początku pipeline'u, gdzie tempo liczy się bardziej niż wykończenie.

🔸 Zdjęcie produktu lub prompt zamieniony na GLB. Można je umieścić w przeglądarce three.js lub model-viewerze w sieci, przekonwertować do USDZ dla AR albo umieścić w scenie wizualizacyjnej. Szybki concepting i podglądy to obszar, w którym TRELLIS błyszczy.
🔸 Lokalna edycja. TRELLIS potrafi ponownie wygenerować lub dopracować region modelu, co jest rzadkością wśród generatorów z pojedynczego obrazu.
🔸 Uczciwie o topologii. Wynik to geometria generatywna, nie czyste artystycznie. Należy spodziewać się nierównych trójkątów, braku czystego przepływu krawędzi i automatycznie wygenerowanych UV. Dla gier lub filmu konieczne będzie retopologizowanie, ponowne mapowanie UV i przepiekanie tekstur. Nowsza seria uwzględniająca materiały zmniejsza tę lukę, nie zamykając jej całkowicie.

Test wartości dla danego zasobu jest więc prosty: czy musi dobrze wyglądać w przeglądarce w przyszłym tygodniu, czy musi być riggowalnym, zoptymalizowanym zasobem do gry? TRELLIS jest znakomity w pierwszym przypadku i stanowi punkt startowy dla drugiego.

04. TRELLIS kontra alternatywy

Otwarty i hostowany obszar 3D rozwija się szybko. Krótka orientacja:

ModelTypLicencjaUwaga
TRELLISObraz i tekst do 3DMITNaprawdę liberalna, wyjście w wielu formatach, lokalna edycja
Hunyuan3DObraz do 3D, tekstura wysokiej rozdzielczościSpołecznościowa, z warunkamiMocna jakość otwartej tekstury, licencja nie w pełni liberalna
Stable Fast 3DPojedynczy obraz do 3DBezpłatna poniżej progu przychodówNiemal natychmiastowe, niższa wierność szczegółów
TripoObraz i tekst do 3DKomercyjne SaaSCzystsze, bardziej gotowe do gier meshe
RodinObraz i tekst do 3DKomercyjne SaaSDopracowany wynik zbliżony do produkcyjnego

Gdzie plasuje się TRELLIS: najmocniejsza naprawdę licencjonowana na MIT opcja z wyjściem w wielu formatach i lokalną edycją. Hostowane narzędzia jak Tripo i Rodin biją go pod względem od razu czystej topologii, a Hunyuan często wygrywa pod względem tekstury, ale przy bardziej restrykcyjnej licencji. Jeśli wymaganiem jest posiadanie modelu i warunków prawnych na własność, TRELLIS jest oczywistym punktem startowym.

05. Szczere ograniczenia i jak z tego korzystamy

Kilka zastrzeżeń, które kładziemy na stół, zanim ktoś wdroży TRELLIS do produkcji:

🔸 Topologia i UV nie są gotowe do wdrożenia w grach czy CAD. Należy zaplanować budżet na retopologię.
🔸 CAD wykracza poza zakres. Generatywne meshe nie są parametrycznymi bryłami (solids), więc nie stanowią geometrii inżynierskiej.
🔸 Ryzyko wejściowe leży po Państwa stronie. Model jest na licencji MIT, ale ekspozycja prawna Państwa obrazu wejściowego lub promptu jest Państwa własną sprawą. Nie należy podawać zdjęć produktów, których nie można licencjonować.

Traktujemy TRELLIS jako silnik do conceptingu i previz: sposób na dostarczenie klientowi wiarygodnego zasobu 3D w ciągu jednego popołudnia, a następnie zdecydowanie, co zasługuje na ręcznie zbudowany pipeline. To ten sam instynkt, który stoi za tym, gdzie przydaje się obecna fala modeli wideo AI, oraz ta sama dyscyplina wyboru, którą stosujemy przy wyborze modelu obrazu. Narzędzie nie jest dostawą. Osąd, gdzie ono pasuje, jest nią.

← Signals

Wayne Dyer

“Gdy zmienia się sposób patrzenia na rzeczy, zmieniają się rzeczy, na które się patrzy.”