SAM 3D Body: una sola imagen entra, un humano riggeable sale, y dónde se rompe en silencio
El SAM 3D Body abierto de Meta reconstruye una malla humana completa a partir de una foto, ejecutable en tu propio pipeline. Plausible en pose, no fiel en métrica.
Traducción generada automáticamente con IA. La versión alemana es el original revisado por la redacción.
Lo genuinamente nuevo de SAM 3D Body no es que haga 3D a partir de una foto. La recuperación académica de mallas humanas lleva años haciendo eso. Lo nuevo es que ahora existe como pesos abiertos, ejecutable en tu propia infraestructura, un modelo de cuerpo de una sola imagen de grado de producción, promptable y con licencia comercial. Meta lo publicó el 19 de noviembre de 2025. Para un equipo B2B eso cambia la prueba virtual, los avatares y la analítica de movimiento de enviar fotos de clientes a una API de proveedor a ejecutarlo en hardware que controlas. El pero, que las demos disimulan, es que es plausible en pose, no fiel en métrica.
01. Qué hace realmente SAM 3D Body
SAM 3D Body reconstruye una malla humana de cuerpo completo, incluidas manos y pies, a partir de una sola imagen, estimando tanto la pose como la forma. Introduce un nuevo formato de cuerpo paramétrico, el Momentum Human Rig (MHR), que desacopla el esqueleto de la superficie de tejido blando, de modo que el rig y la forma del cuerpo se pueden razonar por separado. Como el resto de la familia Segment Anything es promptable: puedes pasar keypoints 2D o máscaras de segmentación para guiar el resultado.
Los detalles prácticos importan para cualquiera que planee desplegarlo. Meta distribuyó pesos abiertos en dos backbones, un DINOv3-H+ de unos 840M de parámetros y un ViT-H de unos 631M, junto con código de inferencia, datos de entrenamiento y el modelo MHR. Reporta un error de malla en 3DPW (MPJPE) de 54,8, y ya alimenta una función de consumo en vivo, la de Facebook Marketplace View in Room. Se entrenó con unos 8 millones de imágenes. Esto no es una demo de investigación; entró en un producto el día uno.
02. La victoria B2B es el pipeline, no los píxeles
El punto estratégico para una empresa alemana o de la UE es dónde corre el cómputo, no qué tan ingeniosa se ve la malla. Una imagen de cuerpo humano es dato personal sensible bajo el RGPD. En el momento en que envías la foto de un cliente a una API de reconstrucción de terceros, tienes un contrato de encargo de tratamiento, una cuestión de transferencia y un coste de confianza. Los pesos abiertos eliminan ese paso: ejecutas el modelo dentro de tu propia red, y la imagen del cuerpo nunca sale.
Eso reencuadra varios casos de uso de incómodos a apropiables. La prueba virtual y la visualización de ajuste, los avatares de AR y VR, la analítica de fitness y movimiento, y el previz para animación o producción virtual pueden todos correr en infraestructura que controlas, con la misma UX que daría una API alojada. Esta es la misma lógica de pipeline propio que aplicamos a generar assets 3D a partir de una sola imagen con TRELLIS: el valor no es solo el modelo, es mantener la entrada sensible en tu propio lado del muro. La licencia es lo único que verificar antes de construir: el rig MHR está confirmado como comercial permisivo, y los pesos del cuerpo se distribuyen bajo la SAM Licence, así que lee los términos reales para tu uso.
03. Dónde se rompe en silencio
Dimensionar el caso de uso correctamente es toda la habilidad, porque la reconstrucción a partir de una sola imagen tiene límites honestos que ninguna cantidad de calidad de modelo elimina. El análisis independiente encontró que SAM 3D Body prioriza una pose plausible sobre la precisión métrica, y empujará cuerpos atípicos (escoliosis, cambios por edad, embarazo) hacia un promedio sano. Eso está bien para un avatar que debe verse bien; está mal para el dimensionamiento médico, ergonómico o legal, donde la desviación es el punto.
Tres límites más para los que diseñar. Una sola imagen no puede resolver profundidad ni escala verdadera, así que la posición global y las dimensiones del mundo real son conjeturas poco restringidas. La oclusión fuerte, donde la mayor parte del cuerpo está oculta, lo degrada de forma pronunciada. Y es por imagen, no en tiempo real: la comunidad ya corre por arreglarlo con variantes más rápidas y runtimes en C++, y el vídeo necesita maquinaria extra para la estabilidad temporal. La regla que te mantiene a salvo es simple. Dimensiona el caso de uso a lo plausible (visualización, prueba, avatares), no a lo preciso (medición, diagnóstico, seguridad). Dentro de esa línea, un modelo humano 3D propio y preservador de la privacidad es una opción nueva real en 2026.

