Forschung · 3 MIN

SAM 3D Body: ein Bild hinein, ein riggbarer Mensch heraus, und wo es still bricht

Metas offenes SAM 3D Body baut ein volles Menschen-Mesh aus einem Foto, betreibbar in Ihrer eigenen Pipeline. Posen-plausibel, nicht metrisch-wahr.

SAM 3D Body: ein Bild hinein, ein riggbarer Mensch heraus, und wo es still bricht
STANDORT
Weltweit
AUTOR
Sayan Sinha
VERÖFFENTLICHT
25. Juni 2026
BILD
KI-GENERIERT

Das wirklich Neue an SAM 3D Body ist nicht, dass es 3D aus einem Foto macht. Akademische Menschen-Mesh-Rekonstruktion tut das seit Jahren. Das Neue ist, dass ein produktionsreifes, promptbares, kommerziell lizenziertes Einzelbild-Körpermodell nun als offene Gewichte existiert, die Sie auf Ihrer eigenen Infrastruktur betreiben können. Meta veröffentlichte es am 19. November 2025. Für ein B2B-Team ändert das Virtual Try-on, Avatare und Bewegungsanalytik von Kundenfotos an eine Anbieter-API senden zu auf Hardware betreiben, die Sie kontrollieren. Der Haken, den die Demos überspielen, ist, dass es posen-plausibel ist, nicht metrisch-wahr.

01. Was SAM 3D Body tatsächlich tut

SAM 3D Body rekonstruiert ein Ganzkörper-Menschen-Mesh, inklusive Hände und Füße, aus einem einzigen Bild und schätzt sowohl Pose als auch Form. Es führt ein neues parametrisches Körperformat ein, das Momentum Human Rig (MHR), das das Skelett von der Weichgewebe-Oberfläche entkoppelt, sodass Rig und Körperform getrennt betrachtet werden können. Wie der Rest der Segment-Anything-Familie ist es promptbar: Sie können 2D-Keypoints oder Segmentierungsmasken übergeben, um das Ergebnis zu steuern.

Die praktischen Details zählen für jeden, der es einsetzen will. Meta lieferte offene Gewichte in zwei Backbones, ein DINOv3-H+ mit rund 840M Parametern und ein ViT-H mit rund 631M, dazu Inferenzcode, Trainingsdaten und das MHR-Modell. Es meldet einen 3DPW-Mesh-Fehler (MPJPE) von 54,8 und treibt bereits ein Live-Verbraucher-Feature an, Facebook Marketplaces View in Room. Es wurde auf rund 8 Millionen Bildern trainiert. Das ist keine Forschungsdemo; es ging am ersten Tag in ein Produkt.

02. Der B2B-Gewinn ist die Pipeline, nicht die Pixel

Der strategische Punkt für ein deutsches oder EU-Unternehmen ist, wo die Berechnung läuft, nicht wie clever das Mesh aussieht. Ein menschliches Körperbild ist unter der DSGVO sensibles personenbezogenes Datum. In dem Moment, in dem Sie das Foto eines Kunden an eine Drittanbieter-Rekonstruktions-API senden, haben Sie einen Auftragsverarbeitungsvertrag, eine Übermittlungsfrage und einen Vertrauenspreis. Offene Gewichte entfernen diesen Schritt: Sie betreiben das Modell in Ihrem eigenen Netz, und das Körperbild verlässt es nie.

Das rahmt mehrere Anwendungsfälle von unbequem zu besitzbar um. Virtual Try-on und Passformvisualisierung, AR- und VR-Avatare, Fitness- und Bewegungsanalytik und Previz für Animation oder virtuelle Produktion können alle auf Infrastruktur laufen, die Sie kontrollieren, mit derselben UX, die eine gehostete API böte. Das ist dieselbe Eigene-Pipeline-Logik, die wir auf das Erzeugen von 3D-Assets aus einem einzigen Bild mit TRELLIS anwandten: der Wert ist nicht nur das Modell, es ist, die sensible Eingabe auf Ihrer Seite der Mauer zu halten. Die Lizenz ist das eine, das vor dem Bauen zu prüfen ist: das MHR-Rig ist als permissiv-kommerziell bestätigt, und die Körpergewichte erscheinen unter der SAM-Lizenz, lesen Sie also die tatsächlichen Bedingungen für Ihren Einsatz.

03. Wo es still bricht

Den Anwendungsfall richtig zuzuschneiden ist die ganze Kunst, denn Einzelbild-Rekonstruktion hat ehrliche Grenzen, die keine Modellqualität entfernt. Unabhängige Analyse fand, dass SAM 3D Body eine plausible Pose vor metrischer Genauigkeit priorisiert und atypische Körper (Skoliose, altersbedingte Veränderungen, Schwangerschaft) zu einem gesunden Durchschnitt schiebt. Das ist in Ordnung für einen Avatar, der richtig aussehen soll; es ist falsch für medizinische, ergonomische oder rechtliche Vermessung, wo die Abweichung der Punkt ist.

Drei weitere Grenzen, um die man designt. Ein einzelnes Bild kann Tiefe oder wahren Maßstab nicht auflösen, globale Position und reale Maße sind also unterbestimmte Vermutungen. Starke Verdeckung, bei der der Großteil des Körpers verborgen ist, verschlechtert es scharf. Und es ist pro Bild, nicht in Echtzeit: die Community wetteifert bereits, das mit schnelleren Varianten und C++-Runtimes zu beheben, und Video braucht zusätzliche Maschinerie für zeitliche Stabilität. Die Regel, die Sie sicher hält, ist einfach. Schneiden Sie den Anwendungsfall auf plausibel zu (Visualisierung, Try-on, Avatare), nicht auf präzise (Vermessung, Diagnose, Sicherheit). Innerhalb dieser Linie ist ein selbst betreibbares, datenschutzwahrendes menschliches 3D-Modell eine echte neue Option 2026.

Dazu arbeiten wir

← Signals

Wayne Dyer

“Wenn du die Art und Weise änderst, wie du die Dinge betrachtest, ändern sich die Dinge, die du betrachtest.”