PROJEKTAI
FitGenie IQ
Realistyczne przenoszenie odzieży na modeli ludzkich i modeli AI z wykorzystaniem AI

90%+
93%+
96%+
Problem i motywacja


Proszę sobie wyobrazić, że robią Państwo zakupy online, wybierają sukienkę lub kurtkę i chcą zobaczyć, jak naprawdę leży ona Państwu, jak układają się logotypy marki i wzory, jak materiał zagina się przy Państwa pozie i czy pasują Państwa dodatki. Większość dzisiejszych narzędzi w prymitywny sposób zniekształca odzież albo prezentuje ją na generycznych modelach o ograniczonym realizmie. Ta przepaść między projektem odzieży a realistyczną wizualizacją dla użytkownika prowadzi do niepewności, zwrotów i niskiego zaangażowania.
Kogo to dotyczy?
- Marek modowych, które dążą do większego zaangażowania w e-commerce
- Sprzedawców internetowych, którzy chcą ograniczyć zwroty
- Konsumentów, którzy oczekują pewniejszego doświadczenia „try-before-you-buy”
- Stylistów, marketerów i twórców treści, którzy eksplorują wizualizacje stylizacji
Dlaczego teraz?
Najnowsze postępy w modelach dyfuzyjnych, segmentacji i architekturach embeddingów sprawiają, że wysokiej jakości synteza obrazu staje się bardziej praktyczna. Dzięki większej mocy obliczeniowej, inteligentniejszym funkcjom straty i modułowym pipeline'om możemy dziś generować fotorealistyczne obrazy odzieży na ciele na dużą skalę.
Cele:
Postawiliśmy sobie kilka celów:
- Dane wejściowe użytkownika → realistyczny wynik: na podstawie wyboru odzieży, wybranego modela (według typu sylwetki, pochodzenia etnicznego, stylu) oraz pozy generowanie wysokiej jakości wizualizacji z prawidłowym dopasowaniem, oświetleniem i kontekstem.
- Zachowanie integralności marki: logotypy, wzory i tekstury nie mogą być zafałszowane ani zniekształcone.
- Spójność póz i wyrównanie: w wielu pozach model ma zachowywać spójność dopasowania, pozycji logotypu i krawędzi.
- Rozbudowa modułowa: w dalszej kolejności obsługa dodatków (buty, czapki, biżuteria), które nakładają się bezbłędnie.
- Wysoce precyzyjna segmentacja i maskowanie: niezawodne rozróżnianie odzieży, ciała i dodatków.



Podejście i architektura
1. Wybór modelu i bazowy pipeline
- Oceniliśmy istniejące otwartoźródłowe modele generatywne i dyfuzyjne pod kątem kompromisów między wiernością tekstur, nakładem obliczeniowym i elastycznością dostrajania.
- Po testach porównawczych na przykładowych zbiorach danych odzieżowych wybraliśmy model dyfuzyjny o rozmiarze 64 GB oparty na hybrydowej architekturze autoenkodera i UNet. Warstwy multi-scale attention okazały się szczególnie pomocne w zachowaniu drobnych detali, takich jak szwy, logotypy i wzory.
- Początkowy pipeline:
- Wstępne przetwarzanie danych: kadrowanie, normalizacja, augmentacja
- Ekstrakcja cech: kodowanie cech odzieży i ciała
- Generowanie / dekodowanie: synteza warunkowa
- Przetwarzanie końcowe: blending, oczyszczanie masek, korekcja kolorów
W niewielkich testach rozwiązanie bazowe osiągnęło obiecującą wierność wizualną i dokładność dopasowania.
2. Precyzja logotypów i wzorów, trudny problem
Dużym wyzwaniem było zapewnienie, aby logotypy i elementy marki pozostawały ostre i niezniekształcone.
Co zrobiliśmy:
- Zebraliśmy własny zbiór danych logotypów: przycięte, opisane fragmenty logotypów z odzieży, w tym rotacje, częściowe przesłonięcia i zniekształcenia (zagięcia, rozciągnięcia).
- Augmentowaliśmy te logotypy w różnych kontekstach (na zagięciach, za paskami, pod szelkami), aby poprawić odporność modelu.
- Zaprojektowaliśmy własną złożoną funkcję straty, która łączy:
- Perceptual Loss (wspiera globalną spójność wyglądu)
- SSIM Loss (zachowuje podobieństwo strukturalne)
- Logo-Feature-Loss z wykorzystaniem embeddingów CLIP: porównanie syntetyzowanych obszarów logotypu z embeddingiem ground truth.
Dzięki temu model lepiej zachowywał branding, nie przeuczając się na stałych pozycjach logotypu.

Prace w toku: zaawansowany pipeline maskowania
Sednem kolejnej fazy usprawnień jest precyzyjniejsza segmentacja i maskowanie. Nasz rozszerzony pipeline obejmuje kilka nowatorskich warstw.
1. Hierarchiczna segmentacja semantyczna oparta na cechach
Opracowaliśmy wielorozdzielczy stos segmentacji, który analizuje jednocześnie kontekst globalny i drobnoziarniste detale. Pomaga to w następujących obszarach:
- Ostre granice (odzież / skóra / tło)
- Nakładająca się odzież, wielowarstwowe tkaniny, tekstury takie jak haft czy zagięcia
- Dynamiczne dopasowanie maski do zagięć, rozciągnięcia i naprężenia
2. Samonadzorowana optymalizacja masek z pętlami informacji zwrotnej
Zamiast wymagać pełnej anotacji pikselowej, zastosowaliśmy pętle samonadzorowane, aby poprawić jakość masek:
- Wykorzystanie pośrednich reprezentacji cech i strukturalnych „wskazówek” do wykrywania nadmiernej lub niedostatecznej segmentacji
- Ukierunkowanie korekt nawet w niejednoznacznych obszarach o niskim kontraście
- Poprawa spójności masek przy trudnych krawędziach lub nakładaniu się logotypów
3. Warstwowe maskowanie alfa do izolowania komponentów
Aby umożliwić elastyczność kompozycyjną, rozdzielamy kanały masek na:
- Bazową warstwę odzieży
- Dodatki (paski, czapki, biżuteria)
- Strukturę skóry i ciała
Każdy kanał ma własną logikę attention i blendingu. Wspiera to nieniszczące warstwowanie i ukierunkowane usprawnienia (np. wyostrzenie logotypów bez zmiany odcieni skóry).
4. Deformacja masek dostosowana do pozy
Aby obsłużyć wiele póz, włączamy punkty charakterystyczne pozy (pose landmarks) do logiki segmentacji. Granice masek odkształcają się zgodnie z rotacjami stawów i artykulacją (np. zgięte ramiona, przechylone biodra). Dzięki temu układ odzieży pozostaje naturalny w różnych pozach.
5. Strategia złożonej funkcji straty z karami specyficznymi dla regionów
Trening sterujemy funkcją straty, która karze za:
- Globalny realizm percepcyjny
- Dokładność granic na krawędziach i w miejscach nakładania
- Zniekształcenie lub błędne umiejscowienie obszarów logotypu
- Niespójność warstw (dodatki nie przenikają do odzieży itd.)
Ten wielowarstwowy cel wspiera zrównoważone uczenie w różnych domenach wizualnych.

Wyzwania i sposób, w jaki im sprostaliśmy
Ograniczone dane dla obszarów logotypów: logotypy są małe w stosunku do obrazów odzieży.
Rozwiązanie: Zbudowaliśmy wyselekcjonowany, augmentowany zbiór danych logotypów o zróżnicowanych kontekstach, aby podczas treningu podkreślić czytelność logotypów.
- Niejednoznaczne granice masek: w obszarach o podobnym kolorze lub teksturze (np. jasna odzież na jasnej skórze) segmentacja miała trudności.
Rozwiązanie: Pomogły samonadzorowane pętle informacji zwrotnej, wskazówki strukturalne i segmentacja hierarchiczna. - Złożoność póz i deformacji: zagięcia odzieży, rozciąganie i ruch prowadziły do zniekształceń.
Rozwiązanie: Deformacja masek świadoma pozy i wielowarstwowe mapy attention. - Przeuczenie a generalizacja: podkreślanie logotypów niosło ryzyko przeuczenia na kształtach lub pozycjach logotypów.
Rozwiązanie: Równoważenie funkcji straty, augmentacja danych (obrócone, przesłonięte logotypy) i regularyzacja.

Wyniki i wpływ
Choć zaawansowany pipeline maskowania jest wciąż w opracowaniu, wstępne metryki i wydajność wizualna są bardzo obiecujące.
Wizualizacje i przypadki użycia
- Użytkownicy mogą wybrać element odzieży (na przykład kurtkę), określić typ sylwetki modela i zobaczyć, jak kurtka przekonująco prezentuje się na nim w wielu pozach wraz z tłem.
- Logotypy, szwy i zagięcia wyglądają naturalnie, nie są zniekształcone ani nie sprawiają wrażenia unoszących się.
- W przyszłych wersjach użytkownicy będą mogli włączać i wyłączać dodatki (buty, czapki, biżuterię) i sprawdzać, jak się komponują.
Realny wpływ
- Platformy e-commerce ograniczają zwroty wynikające z niedopasowania lub zawiedzionych oczekiwań.
- Marki mogą wcześniej pokazywać szczegółowe prototypy (przed prototypowaniem fizycznym).
- Styliści, twórcy treści i aplikacje social commerce zyskują wydajne narzędzie wizualne.
Spostrzeżenia i wnioski
- Jakość masek ma kluczowe znaczenie: słaba segmentacja psuje nawet wydajny model generatywny. Postępy w końcowym realizmie obrazu wynikają w większości z lepszych masek, a nie po prostu z większej mocy obliczeniowej.
- Zrównoważone funkcje straty mają znaczenie: zbyt mocne podkreślanie jednego obszaru (np. logotypów) może pogorszyć krawędzie lub tekstury. Kluczem są złożone funkcje straty świadome regionów.
- Samonadzór przyspiesza usprawnienia: nawet przy ograniczonych anotacjach ręcznych pętle informacji zwrotnej pomagają dopracować zachowanie modelu.
- Modułowość wspiera rozwój: rozdzielenie odzieży, dodatków, skóry i pozy na moduły daje elastyczność przy przyszłych rozszerzeniach.
- Ramy zorientowane na użytkownika powinny kierować kompromisami: wydajność w czasie rzeczywistym, pamięć GPU i opóźnienie wnioskowania trzeba pogodzić z jakością wizualną.
Co dalej / przyszłe kierunki
Dodatki i rekwizyty: rozszerzenie pipeline'u, aby naturalnie warstwowo prezentować buty, czapki, okulary i biżuterię.
- Dynamiczne sceny i tła: wyjście poza neutralne tła w kierunku scenerii lifestyle'owych (plener, studio, wnętrze).
- Interaktywne dostosowanie: umożliwienie użytkownikom zmiany długości rękawa, dołu i rozmieszczenia wzoru na żywo.
- Wnioskowanie w czasie rzeczywistym i o niskim opóźnieniu: optymalizacja pod kątem zastosowania w sieci, na urządzeniach mobilnych lub w środowiskach AR/VR.
- Generatywne propozycje stylizacji: wykorzystanie AI stylizującej do rekomendowania dodatków, warstwowania i harmonii kolorów.
- Rozszerzenia 3D i wielowidokowe: połączenie 2D z renderowaniem 3D opartym na pozie, umożliwiającym rotacje i widoki dookolne.
- Generowanie wideo i reels z modelami: tworzenie treści do mediów społecznościowych i reels na podstawie wygenerowanych zdjęć.

















Dowiedz się więcej



MAJĄ PAŃSTWO ZŁOŻONY POMYSŁ, KTÓRY CHCIELIBYŚMY DLA PAŃSTWA WDROŻYĆ?
ZACZNIJMY OD PILOTAŻU DESIGN THINKING LUB ROZMOWY KONSULTACYJNEJ.