PROJEKTAI

FitGenie IQ

Realistyczne przenoszenie odzieży na modeli ludzkich i modeli AI z wykorzystaniem AI

FitGenie IQ, Ilustracja 1WYGENEROWANE PRZEZ AI

90%+

93%+

96%+

ROK
2025 (ongoing)
ZESPÓŁ
iiterate Technologies R&D Lab
TECH-STACK
Diffusion models, UNet + autoencoder hybrids, Seedream, Google Nano Banana, Flux Kontext, Qwen-Image Edit
LOKALIZACJA
Niemcy
OPUBLIKOWANO
11 paź 2025

Problem i motywacja

FitGenie IQ, Ilustracja 2WYGENEROWANE PRZEZ AI
FitGenie IQ, Ilustracja 2WYGENEROWANE PRZEZ AI

Proszę sobie wyobrazić, że robią Państwo zakupy online, wybierają sukienkę lub kurtkę i chcą zobaczyć, jak naprawdę leży ona Państwu, jak układają się logotypy marki i wzory, jak materiał zagina się przy Państwa pozie i czy pasują Państwa dodatki. Większość dzisiejszych narzędzi w prymitywny sposób zniekształca odzież albo prezentuje ją na generycznych modelach o ograniczonym realizmie. Ta przepaść między projektem odzieży a realistyczną wizualizacją dla użytkownika prowadzi do niepewności, zwrotów i niskiego zaangażowania.

Kogo to dotyczy?

  • Marek modowych, które dążą do większego zaangażowania w e-commerce
  • Sprzedawców internetowych, którzy chcą ograniczyć zwroty
  • Konsumentów, którzy oczekują pewniejszego doświadczenia „try-before-you-buy”
  • Stylistów, marketerów i twórców treści, którzy eksplorują wizualizacje stylizacji

Dlaczego teraz?
Najnowsze postępy w modelach dyfuzyjnych, segmentacji i architekturach embeddingów sprawiają, że wysokiej jakości synteza obrazu staje się bardziej praktyczna. Dzięki większej mocy obliczeniowej, inteligentniejszym funkcjom straty i modułowym pipeline'om możemy dziś generować fotorealistyczne obrazy odzieży na ciele na dużą skalę.

Cele:

Postawiliśmy sobie kilka celów:

  • Dane wejściowe użytkownika → realistyczny wynik: na podstawie wyboru odzieży, wybranego modela (według typu sylwetki, pochodzenia etnicznego, stylu) oraz pozy generowanie wysokiej jakości wizualizacji z prawidłowym dopasowaniem, oświetleniem i kontekstem.
  • Zachowanie integralności marki: logotypy, wzory i tekstury nie mogą być zafałszowane ani zniekształcone.
  • Spójność póz i wyrównanie: w wielu pozach model ma zachowywać spójność dopasowania, pozycji logotypu i krawędzi.
  • Rozbudowa modułowa: w dalszej kolejności obsługa dodatków (buty, czapki, biżuteria), które nakładają się bezbłędnie.
  • Wysoce precyzyjna segmentacja i maskowanie: niezawodne rozróżnianie odzieży, ciała i dodatków.
FitGenie IQ, Ilustracja 4WYGENEROWANE PRZEZ AIFitGenie IQ, Ilustracja 5WYGENEROWANE PRZEZ AIFitGenie IQ, Ilustracja 6WYGENEROWANE PRZEZ AI

Podejście i architektura

1. Wybór modelu i bazowy pipeline

  • Oceniliśmy istniejące otwartoźródłowe modele generatywne i dyfuzyjne pod kątem kompromisów między wiernością tekstur, nakładem obliczeniowym i elastycznością dostrajania.
  • Po testach porównawczych na przykładowych zbiorach danych odzieżowych wybraliśmy model dyfuzyjny o rozmiarze 64 GB oparty na hybrydowej architekturze autoenkodera i UNet. Warstwy multi-scale attention okazały się szczególnie pomocne w zachowaniu drobnych detali, takich jak szwy, logotypy i wzory.
  • Początkowy pipeline:
    1. Wstępne przetwarzanie danych: kadrowanie, normalizacja, augmentacja
    2. Ekstrakcja cech: kodowanie cech odzieży i ciała
    3. Generowanie / dekodowanie: synteza warunkowa
    4. Przetwarzanie końcowe: blending, oczyszczanie masek, korekcja kolorów

W niewielkich testach rozwiązanie bazowe osiągnęło obiecującą wierność wizualną i dokładność dopasowania.

2. Precyzja logotypów i wzorów, trudny problem

Dużym wyzwaniem było zapewnienie, aby logotypy i elementy marki pozostawały ostre i niezniekształcone.

Co zrobiliśmy:

  • Zebraliśmy własny zbiór danych logotypów: przycięte, opisane fragmenty logotypów z odzieży, w tym rotacje, częściowe przesłonięcia i zniekształcenia (zagięcia, rozciągnięcia).
  • Augmentowaliśmy te logotypy w różnych kontekstach (na zagięciach, za paskami, pod szelkami), aby poprawić odporność modelu.
  • Zaprojektowaliśmy własną złożoną funkcję straty, która łączy:
    • Perceptual Loss (wspiera globalną spójność wyglądu)
    • SSIM Loss (zachowuje podobieństwo strukturalne)
    • Logo-Feature-Loss z wykorzystaniem embeddingów CLIP: porównanie syntetyzowanych obszarów logotypu z embeddingiem ground truth.

Dzięki temu model lepiej zachowywał branding, nie przeuczając się na stałych pozycjach logotypu.

FitGenie IQ, Ilustracja 7WYGENEROWANE PRZEZ AI

Prace w toku: zaawansowany pipeline maskowania

Sednem kolejnej fazy usprawnień jest precyzyjniejsza segmentacja i maskowanie. Nasz rozszerzony pipeline obejmuje kilka nowatorskich warstw.

1. Hierarchiczna segmentacja semantyczna oparta na cechach

Opracowaliśmy wielorozdzielczy stos segmentacji, który analizuje jednocześnie kontekst globalny i drobnoziarniste detale. Pomaga to w następujących obszarach:

  • Ostre granice (odzież / skóra / tło)
  • Nakładająca się odzież, wielowarstwowe tkaniny, tekstury takie jak haft czy zagięcia
  • Dynamiczne dopasowanie maski do zagięć, rozciągnięcia i naprężenia

2. Samonadzorowana optymalizacja masek z pętlami informacji zwrotnej

Zamiast wymagać pełnej anotacji pikselowej, zastosowaliśmy pętle samonadzorowane, aby poprawić jakość masek:

  • Wykorzystanie pośrednich reprezentacji cech i strukturalnych „wskazówek” do wykrywania nadmiernej lub niedostatecznej segmentacji
  • Ukierunkowanie korekt nawet w niejednoznacznych obszarach o niskim kontraście
  • Poprawa spójności masek przy trudnych krawędziach lub nakładaniu się logotypów

3. Warstwowe maskowanie alfa do izolowania komponentów

Aby umożliwić elastyczność kompozycyjną, rozdzielamy kanały masek na:

  • Bazową warstwę odzieży
  • Dodatki (paski, czapki, biżuteria)
  • Strukturę skóry i ciała

Każdy kanał ma własną logikę attention i blendingu. Wspiera to nieniszczące warstwowanie i ukierunkowane usprawnienia (np. wyostrzenie logotypów bez zmiany odcieni skóry).

4. Deformacja masek dostosowana do pozy

Aby obsłużyć wiele póz, włączamy punkty charakterystyczne pozy (pose landmarks) do logiki segmentacji. Granice masek odkształcają się zgodnie z rotacjami stawów i artykulacją (np. zgięte ramiona, przechylone biodra). Dzięki temu układ odzieży pozostaje naturalny w różnych pozach.

5. Strategia złożonej funkcji straty z karami specyficznymi dla regionów

Trening sterujemy funkcją straty, która karze za:

  • Globalny realizm percepcyjny
  • Dokładność granic na krawędziach i w miejscach nakładania
  • Zniekształcenie lub błędne umiejscowienie obszarów logotypu
  • Niespójność warstw (dodatki nie przenikają do odzieży itd.)

Ten wielowarstwowy cel wspiera zrównoważone uczenie w różnych domenach wizualnych.

FitGenie IQ, Ilustracja 8

Wyzwania i sposób, w jaki im sprostaliśmy

Ograniczone dane dla obszarów logotypów: logotypy są małe w stosunku do obrazów odzieży.
Rozwiązanie: Zbudowaliśmy wyselekcjonowany, augmentowany zbiór danych logotypów o zróżnicowanych kontekstach, aby podczas treningu podkreślić czytelność logotypów.

  • Niejednoznaczne granice masek: w obszarach o podobnym kolorze lub teksturze (np. jasna odzież na jasnej skórze) segmentacja miała trudności.
    Rozwiązanie: Pomogły samonadzorowane pętle informacji zwrotnej, wskazówki strukturalne i segmentacja hierarchiczna.
  • Złożoność póz i deformacji: zagięcia odzieży, rozciąganie i ruch prowadziły do zniekształceń.
    Rozwiązanie: Deformacja masek świadoma pozy i wielowarstwowe mapy attention.
  • Przeuczenie a generalizacja: podkreślanie logotypów niosło ryzyko przeuczenia na kształtach lub pozycjach logotypów.
    Rozwiązanie: Równoważenie funkcji straty, augmentacja danych (obrócone, przesłonięte logotypy) i regularyzacja.
FitGenie IQ, Ilustracja 9WYGENEROWANE PRZEZ AI

Wyniki i wpływ

Choć zaawansowany pipeline maskowania jest wciąż w opracowaniu, wstępne metryki i wydajność wizualna są bardzo obiecujące.

Wizualizacje i przypadki użycia

  • Użytkownicy mogą wybrać element odzieży (na przykład kurtkę), określić typ sylwetki modela i zobaczyć, jak kurtka przekonująco prezentuje się na nim w wielu pozach wraz z tłem.
  • Logotypy, szwy i zagięcia wyglądają naturalnie, nie są zniekształcone ani nie sprawiają wrażenia unoszących się.
  • W przyszłych wersjach użytkownicy będą mogli włączać i wyłączać dodatki (buty, czapki, biżuterię) i sprawdzać, jak się komponują.

Realny wpływ

  • Platformy e-commerce ograniczają zwroty wynikające z niedopasowania lub zawiedzionych oczekiwań.
  • Marki mogą wcześniej pokazywać szczegółowe prototypy (przed prototypowaniem fizycznym).
  • Styliści, twórcy treści i aplikacje social commerce zyskują wydajne narzędzie wizualne.

Spostrzeżenia i wnioski

  • Jakość masek ma kluczowe znaczenie: słaba segmentacja psuje nawet wydajny model generatywny. Postępy w końcowym realizmie obrazu wynikają w większości z lepszych masek, a nie po prostu z większej mocy obliczeniowej.
  • Zrównoważone funkcje straty mają znaczenie: zbyt mocne podkreślanie jednego obszaru (np. logotypów) może pogorszyć krawędzie lub tekstury. Kluczem są złożone funkcje straty świadome regionów.
  • Samonadzór przyspiesza usprawnienia: nawet przy ograniczonych anotacjach ręcznych pętle informacji zwrotnej pomagają dopracować zachowanie modelu.
  • Modułowość wspiera rozwój: rozdzielenie odzieży, dodatków, skóry i pozy na moduły daje elastyczność przy przyszłych rozszerzeniach.
  • Ramy zorientowane na użytkownika powinny kierować kompromisami: wydajność w czasie rzeczywistym, pamięć GPU i opóźnienie wnioskowania trzeba pogodzić z jakością wizualną.

Co dalej / przyszłe kierunki

Dodatki i rekwizyty: rozszerzenie pipeline'u, aby naturalnie warstwowo prezentować buty, czapki, okulary i biżuterię.

  • Dynamiczne sceny i tła: wyjście poza neutralne tła w kierunku scenerii lifestyle'owych (plener, studio, wnętrze).
  • Interaktywne dostosowanie: umożliwienie użytkownikom zmiany długości rękawa, dołu i rozmieszczenia wzoru na żywo.
  • Wnioskowanie w czasie rzeczywistym i o niskim opóźnieniu: optymalizacja pod kątem zastosowania w sieci, na urządzeniach mobilnych lub w środowiskach AR/VR.
  • Generatywne propozycje stylizacji: wykorzystanie AI stylizującej do rekomendowania dodatków, warstwowania i harmonii kolorów.
  • Rozszerzenia 3D i wielowidokowe: połączenie 2D z renderowaniem 3D opartym na pozie, umożliwiającym rotacje i widoki dookolne.
  • Generowanie wideo i reels z modelami: tworzenie treści do mediów społecznościowych i reels na podstawie wygenerowanych zdjęć.
FitGenie IQ, Ilustracja 10FitGenie IQ, Ilustracja 11WYGENEROWANE PRZEZ AIFitGenie IQ, Ilustracja 12WYGENEROWANE PRZEZ AIFitGenie IQ, Ilustracja 13WYGENEROWANE PRZEZ AIFitGenie IQ, Ilustracja 14WYGENEROWANE PRZEZ AI

Dowiedz się więcej

MAJĄ PAŃSTWO ZŁOŻONY POMYSŁ, KTÓRY CHCIELIBYŚMY DLA PAŃSTWA WDROŻYĆ?
ZACZNIJMY OD PILOTAŻU DESIGN THINKING LUB ROZMOWY KONSULTACYJNEJ.

Skontaktuj się z nami

Alan Kay

“Najlepszym sposobem przewidzenia przyszłości jest jej wynalezienie.”