SAM 3D Body: jedno zdjęcie na wejściu, riggowalny człowiek na wyjściu, i gdzie po cichu zawodzi
Otwarty model SAM 3D Body od Meta buduje pełną siatkę człowieka z jednego zdjęcia, uruchamialną we własnym pipeline. Wiarygodny pozycyjnie, nie metrycznie dokładny.
Tłumaczenie wygenerowane automatycznie przez AI. Wersja niemiecka jest oryginałem zweryfikowanym redakcyjnie.
Prawdziwą nowością w SAM 3D Body nie jest to, że tworzy 3D ze zdjęcia. Akademicka rekonstrukcja siatki człowieka robi to od lat. Nowością jest to, że gotowy do produkcji, promptowalny, licencjonowany komercyjnie model ciała z jednego zdjęcia istnieje teraz jako otwarte wagi, które mogą Państwo uruchomić na własnej infrastrukturze. Meta opublikowała go 19 listopada 2025 roku. Dla zespołu B2B zmienia to sytuację z wysyłania zdjęć klientów do API dostawcy przy wirtualnym przymierzaniu, awatarach i analityce ruchu na uruchamianie tego na sprzęcie, który Państwo kontrolują. Haczyk, który demonstracje przemilczają, polega na tym, że model jest wiarygodny pozycyjnie, a nie dokładny metrycznie.
01. Co SAM 3D Body faktycznie robi
SAM 3D Body rekonstruuje siatkę całego ciała człowieka, łącznie z dłońmi i stopami, z pojedynczego zdjęcia i szacuje zarówno pozę, jak i kształt. Wprowadza nowy parametryczny format ciała, Momentum Human Rig (MHR), który oddziela szkielet od powierzchni tkanek miękkich, dzięki czemu rig i kształt ciała można rozpatrywać osobno. Podobnie jak reszta rodziny Segment Anything, model jest promptowalny: mogą Państwo przekazać punkty kluczowe 2D lub maski segmentacji, aby sterować wynikiem.
Szczegóły praktyczne liczą się dla każdego, kto chce go wdrożyć. Meta dostarczyła otwarte wagi w dwóch wariantach szkieletu (backbone), DINOv3-H+ z około 840M parametrów oraz ViT-H z około 631M, a do tego kod wnioskowania, dane treningowe i model MHR. Model zgłasza błąd siatki 3DPW (MPJPE) na poziomie 54,8 i już napędza działającą funkcję konsumencką, View in Room w Facebook Marketplace. Został wytrenowany na około 8 milionach zdjęć. To nie jest demo badawcze; od pierwszego dnia trafił do produktu.
02. Zysk B2B to pipeline, nie piksele
Strategiczny punkt dla niemieckiej lub unijnej firmy dotyczy tego, gdzie odbywają się obliczenia, a nie tego, jak sprytnie wygląda siatka. Zdjęcie ludzkiego ciała jest w świetle RODO wrażliwym danym osobowym. W momencie, gdy wysyłają Państwo zdjęcie klienta do zewnętrznego API rekonstrukcji, pojawia się umowa powierzenia przetwarzania danych, kwestia transferu danych i cena zaufania. Otwarte wagi eliminują ten krok: uruchamiają Państwo model we własnej sieci, a zdjęcie ciała nigdy jej nie opuszcza.
To przekształca kilka zastosowań z niewygodnych w możliwe do posiadania. Wirtualne przymierzanie i wizualizacja dopasowania, awatary AR i VR, analityka fitness i ruchu oraz previz do animacji lub produkcji wirtualnej, wszystko to może działać na infrastrukturze, którą Państwo kontrolują, przy tym samym UX, jaki oferowałoby hostowane API. To ta sama logika własnego pipeline'u, którą zastosowaliśmy przy tworzeniu zasobów 3D z jednego zdjęcia za pomocą TRELLIS: wartość to nie tylko model, to utrzymanie wrażliwych danych wejściowych po Państwa stronie muru. Licencję warto sprawdzić przed budową jako jedno z pierwszych: rig MHR jest potwierdzony jako liberalny komercyjnie, a wagi ciała pojawiają się na licencji SAM, więc proszę przeczytać rzeczywiste warunki dla swojego zastosowania.
03. Gdzie po cichu zawodzi
Właściwe dopasowanie przypadku użycia to cała sztuka, ponieważ rekonstrukcja z pojedynczego zdjęcia ma uczciwe ograniczenia, których żadna jakość modelu nie usunie. Niezależna analiza wykazała, że SAM 3D Body priorytetyzuje wiarygodną pozę ponad dokładność metryczną i przesuwa nietypowe ciała (skolioza, zmiany związane z wiekiem, ciąża) w stronę zdrowej średniej. To w porządku dla awatara, który ma wyglądać dobrze; jest to błędne dla pomiarów medycznych, ergonomicznych lub prawnych, gdzie właśnie odchylenie stanowi istotę sprawy.
Trzy kolejne ograniczenia, wokół których trzeba projektować. Pojedyncze zdjęcie nie może rozwiązać głębi ani prawdziwej skali, więc globalna pozycja i rzeczywiste wymiary są niedookreślonymi domysłami. Silne zasłonięcie, gdy większość ciała jest ukryta, wyraźnie pogarsza wynik. I działa to na pojedynczym zdjęciu, nie w czasie rzeczywistym: społeczność już ściga się, aby to naprawić za pomocą szybszych wariantów i środowisk uruchomieniowych C++, a wideo wymaga dodatkowej maszynerii dla stabilności czasowej. Zasada, która zapewnia bezpieczeństwo, jest prosta. Proszę dopasować przypadek użycia do tego, co wiarygodne (wizualizacja, przymierzanie, awatary), a nie do tego, co precyzyjne (pomiary, diagnoza, bezpieczeństwo). W tych granicach samodzielnie hostowany model 3D człowieka, chroniący prywatność, jest realną nową opcją w 2026 roku.

