Investigadores de Google DeepMind desarrollaron GenCeption, un modelo que usa un generador de video preentrenado como base para tareas clasicas de vision artificial. Alcanza resultados de primer nivel en estimacion de profundidad, segmentacion y estimacion de pose 3D, pero necesitando muy pocos datos de entrenamiento.
Los modelos de lenguaje se volvieron sistemas de procesamiento versatiles casi como subproducto de aprender a predecir la siguiente palabra: esa tarea obliga al modelo a absorber gramatica, conocimiento del mundo y relaciones contextuales. La vision artificial, en cambio, todavia carece de un metodo de entrenamiento equivalente y sigue dominada por modelos especializados, cada uno con su propia arquitectura, como Segment Anything para segmentacion o Depth Anything para profundidad.
¿Como funciona exactamente GenCeption?

GenCeption se construye sobre Wan2.1, el modelo de generacion de video de codigo abierto de Alibaba. El cambio principal es una arquitectura mas simple: en lugar de generar video a partir de ruido en muchos pasos pequenos, como hacen los modelos de difusion, produce una prediccion en una sola pasada hacia adelante, lo que lo hace lo bastante rapido para uso practico.
Un prompt de texto le indica al modelo que tarea ejecutar, igual que una instruccion a un chatbot. GenCeption representa cada salida (mapa de profundidad, mapa de normales de superficie o mascara de segmentacion) como una imagen RGB estandar de tres canales, e incluso convierte el movimiento de camara en una representacion de imagen. Para tareas que no producen imagenes, como la prediccion de puntos clave 3D, el equipo agrega modulos entrenables y usa una unica funcion de perdida para todas las tareas.
¿Cuantos datos necesita para igualar a los especialistas?

La mayor parte del entrenamiento provino de un conjunto sintetico de apenas 7.500 videos, generado al combinar 800 modelos humanos digitales con 200 secuencias de captura de movimiento y renderizarlos en Blender con distintos fondos y angulos de camara. Solo se usaron videos reales para la segmentacion guiada por lenguaje.
Con esa dieta, GenCeption se acerca al estado del arte usando entre 7 y 500 veces menos datos que los modelos establecidos. Segun el estudio, iguala o supera a DepthAnything 3 en profundidad, vence a NormalCrafter y Lotus-2 en normales de superficie, y a Genmo y TRAM en reconocimiento de pose 3D. En segmentacion compleja guiada por lenguaje, empata con la combinacion de SAM 3 de Meta y Gemini 3.5 Flash. Modelos como D4RT y VGGT Omega se entrenaron con millones de videos; GenCeption llega a resultados similares con una fraccion de esos datos.
¿Que limites tiene?
El modelo entreno casi exclusivamente con videos sinteticos de una sola persona a la vez, pero generaliza a videos reales con varias personas en cuadro e incluso a categorias que nunca vio, como animales y robots humanoides. Algunas salidas conservan mas detalle que los renders de Blender de origen, al punto de preservar los bigotes de un gato o los bordes de mechones de pelo individuales.
No todo es perfecto. El entrenamiento conjunto de todas las tareas perjudica la estimacion de puntos clave 3D, y la velocidad todavia necesita trabajo: el modelo pequeno tarda unos seis segundos en procesar un video de 81 fotogramas, y el grande, de 14.000 millones de parametros, unos diez segundos.
Un debate abierto sobre los modelos del mundo
Los autores rechazan la idea de que los generadores de video sean solo herramientas de entretenimiento y sostienen que ya contienen un tipo de modelo del mundo universal que podria servir de base para la vision artificial, el mismo rol que los modelos de lenguaje cumplen en el texto. La afirmacion es discutida. Un equipo internacional propuso hace poco una definicion uniforme con OpenWorldLib y excluyo de forma explicita a los generadores de video por carecer de retroalimentacion del mundo real. El exjefe cientifico de IA de Meta, Yann LeCun, va mas lejos y considera que los modelos generativos de video son un callejon sin salida; su alternativa, V-JEPA 2, predice conceptos abstractos en lugar de pixeles. Un benchmark de la Universidad de Tsinghua refuerza la duda: Sora 2, Seedance 2.0 y Veo 3.1 fallaron repetidamente pruebas de fisica y logica basicas aunque su salida se viera convincente.
GenCeption usa la generacion de video para un fin mas acotado: no le pide a Wan2.1 que prediga como se comportara el mundo, sino que extrae rasgos utiles para tareas concretas donde esos rasgos aprendidos superan a los sistemas especializados. En paralelo, DeepMind explora otro camino con Genie 3, que construye entornos 3D interactivos para entrenar agentes de IA.




