Un equipo de investigadores desarrolló un nuevo algoritmo de visión que permite a los robots humanoides percibir la profundidad de manera más parecida a los humanos, usando dos ojos orientados hacia adelante.

En lugar de depender de cámaras estéreo convencionales, el sistema procesa las diferencias visuales entre la imagen izquierda y la derecha para construir una comprensión tridimensional más precisa de la escena.

El enfoque, desarrollado por un equipo liderado por investigadores de la Universidad de York, en Toronto, podría mejorar la forma en que los robots humanoides estiman distancias, reconocen la orientación de los objetos y navegan entornos complejos. Los investigadores señalan que el avance acerca la visión robótica a la percepción de profundidad humana de inspiración biológica, y sienta las bases para sistemas visuales humanoides más capaces.

¿Qué hace distinto al estéreo binocular convergente?

El nuevo algoritmo de visión estéreo permite a los robots humanoides calcular la profundidad usando una disposición de cámaras que imita más de cerca la visión humana. Se llama estéreo binocular convergente (convergent binocular stereo, o CBS) y está diseñado para cabezas robóticas cuyas dos cámaras pueden apuntar hacia el mismo punto en vez de permanecer paralelas.

A diferencia de los sistemas estéreo convencionales, que calculan principalmente diferencias horizontales entre imágenes de cámaras paralelas, CBS considera tanto las disparidades horizontales como las verticales que se generan cuando las cámaras convergen sobre un objetivo. Eso le permite al sistema usar el movimiento de la cámara como parte del proceso de percepción de profundidad.

Se marcan las áreas con distintas disparidades horizontales: las líneas sólidas muestran las vistas de las cámaras y las punteadas, los ejes
Se marcan las áreas con distintas disparidades horizontales: las líneas sólidas muestran las vistas de las cámaras y las punteadas, los ejes

El algoritmo primero fija ambas cámaras sobre un punto tridimensional y determina la relación geométrica entre las imágenes resultantes. Luego construye una pirámide gaussiana de cinco niveles para analizar las imágenes en múltiples resoluciones. En los niveles más gruesos, CBS detecta y empareja características SIFT mientras usa restricciones epipolares para estimar las disparidades horizontales y verticales. Después aplica filtros de Gabor para analizar la textura y la información de bordes en distintas orientaciones y escalas, lo que ayuda a identificar los píxeles correspondientes entre ambas imágenes.

El sistema refina progresivamente esas estimaciones de disparidad, desde las imágenes de menor resolución hasta la resolución original, acotando el área de búsqueda en cada etapa. Los mapas de disparidad horizontal y vertical resultantes pueden luego convertirse en información tridimensional y estimaciones de profundidad. Los investigadores indican que CBS también captura información sobre la inclinación de las superficies, la pose de los objetos y el escalado percibido de profundidad y tamaño, lo que entrega un enfoque más parecido al humano para el procesamiento visual robótico.

¿Cuánta precisión gana frente a los métodos actuales?

Para probar el algoritmo, los investigadores crearon el conjunto de datos CBS-BM, sigla de Convergent Binocular Stereo BenchMark. Contiene 49 escenas, que incluyen entornos corrientes de sobremesa además de patrones repetidos, superficies sin características distintivas y objetos con alto grado de autooclusión. Cada escena incluye imágenes paralelas junto con entre 5 y 12 pares de imágenes de fijación convergente.

CBS resultó ampliamente competitivo frente a métodos estéreo establecidos y a varios sistemas de aprendizaje profundo. A lo largo del conjunto de datos completo, logró errores medios de disparidad horizontal y de profundidad menores que los métodos paralelos evaluados. Su mayor ventaja apareció en escenas con patrones repetidos, donde los sistemas convencionales suelen tener problemas para determinar qué características visualmente similares se corresponden entre sí. En ese subconjunto, CBS produjo un error medio de profundidad cerca de 0,8 metros menor que el segundo mejor método, y un error de disparidad horizontal unos 100 píxeles menor.

MétricaResultado de CBS
Escenas del conjunto CBS-BM49
Pares de fijación convergente por escenaentre 5 y 12
Niveles de la pirámide gaussiana5
Ventaja en error de profundidad (patrones repetidos)0,8 metros
Ventaja en disparidad horizontalunos 100 píxeles
Tiempo de ejecucióncerca de 69 segundos en un Ryzen 7 7700X

Las limitaciones que reconocen los autores

Según una declaración del equipo, el enfoque sí tiene limitaciones. Su precisión disminuye para objetivos ubicados a mayor distancia, y depende de una calibración precisa de las cámaras y del posicionamiento de los motores. La implementación actual además demora alrededor de 69 segundos en ejecutarse sobre un procesador AMD Ryzen 7 7700X, lo que deja un margen considerable para optimización.

Los investigadores aclaran que CBS no busca reemplazar al estéreo paralelo en aplicaciones donde la visión de tipo humano es innecesaria. En cambio, entrega una base para robots humanoides que necesitan que sus movimientos oculares físicos y su procesamiento visual trabajen en conjunto, acercando la percepción de profundidad robótica a la visión activa y convergente que usan las personas.

Por qué el tiempo de ejecución es el dato clave

La cifra de 69 segundos por escena es la que separa este trabajo de una aplicación práctica, y conviene ponerla en perspectiva. Un robot humanoide caminando necesita actualizar su mapa de profundidad varias veces por segundo, así que la brecha entre lo demostrado y lo utilizable es de aproximadamente dos órdenes de magnitud. Ese es exactamente el tipo de distancia que suele cerrarse llevando el algoritmo de una implementación de investigación en procesador de propósito general a una en GPU o en acelerador dedicado, donde la pirámide gaussiana y los filtros de Gabor paralelizan bien.

Hay además una consecuencia de diseño que el trabajo deja implícita. CBS exige cámaras montadas sobre motores capaces de converger sobre un punto, lo que agrega dos grados de libertad a la cabeza del robot y, con ellos, calibración y desgaste mecánico. Un sistema estéreo de cámaras fijas y paralelas no tiene esas piezas móviles. La ganancia de precisión en escenas con patrones repetidos, esos 0,8 metros de diferencia, es el argumento que debe justificar ese costo mecánico adicional, y es un argumento fuerte precisamente en bodegas y líneas de producción, donde las estanterías y las cajas idénticas son el escenario habitual.