La detección de interacción humano-objeto identifica a las personas, los objetos y la acción que conecta a ambos, por ejemplo "persona, conduce, grúa horquilla". Y se puede construir hoy sin etiquetar una sola interacción: RF-DETR localiza a las personas y los equipos, y Gemini infiere el verbo sin entrenamiento previo.

Un tutorial de Roboflow arma dos versiones para bodega dentro de Roboflow Workflows: un resumen a nivel de escena con Gemini 2.5 Pro, y una verificación por persona de operación segura o insegura con Flash-Lite, que devuelve un informe de seguridad en JSON.

¿Qué es la detección de interacción humano-objeto?

Es una tarea de visión por computador que identifica a las personas, los objetos a su alrededor y la acción que une a los dos. Un detector de objetos estándar dice qué hay en una imagen. La detección de interacción dice quién está haciendo qué con cuál objeto. La salida se escribe como un triplete: humano, verbo, objeto.

El verbo es la parte difícil. Dos imágenes pueden contener a la misma persona y la misma grúa horquilla a la misma distancia y mostrar situaciones distintas: en una la persona la está operando, en la otra solo pasa caminando al lado. La evidencia visual que separa ambos casos es mínima, como la posición de las manos, la orientación del cuerpo o si la persona está sentada en la cabina.

Los sistemas de investigación aprenden el verbo a partir de datos de interacción etiquetados. Los dos benchmarks estándar son HICO-DET, que cubre 600 categorías de interacción sobre 80 clases de objetos, y V-COCO, más chico, construido sobre imágenes de COCO con 29 categorías de acción.

Este artículo toma otro camino. En vez de entrenar un clasificador de interacciones, entrena RF-DETR para detectar a las personas y los objetos, y después le pide a Gemini que infiera el verbo a partir de lo que encontró el detector.

Tabla de elaboración propia para ubicar las tres tareas:

TareaQué respondeEjemplo de salida
Detección de objetosQué hay en la imagen"persona", "grúa horquilla"
Reconocimiento de actividadQué hace la persona"levantando"
Interacción humano-objetoQuién hace qué con cuál objeto"levantando ese pallet"

La distinción importa para el monitoreo de bodegas, porque las reglas de seguridad se escriben sobre pares persona-equipo, es decir quién va arriba de la grúa horquilla y quién está parado cerca, no sobre movimientos corporales aislados.

¿Por qué un detector y un modelo visual en vez de un modelo de interacción?

El enfoque clásico es etiquetar los verbos: juntar imágenes de bodega, anotar cada par persona-objeto con una clase de interacción y entrenar un modelo dedicado. Funciona, pero las etiquetas de interacción son caras, y un modelo entrenado sobre una lista fija de verbos solo puede reconocer las interacciones que se etiquetaron.

La investigación reciente se movió hacia la detección sin entrenamiento previo con modelos de lenguaje visual. RF-DETR se hace cargo de la localización, que es donde estos modelos siguen siendo débiles. Gemini nombra la interacción y, como no está limitado a una lista fija de verbos, puede reportar que un trabajador parece estar inspeccionando una caja de fusibles o descargando un pallet sin una sola etiqueta de interacción en los datos de entrenamiento.

El costo del cambio es el determinismo. Un modelo de interacción entrenado devuelve una clase fija con un puntaje de confianza. Un modelo de lenguaje visual devuelve un juicio en texto. Por eso ambas instrucciones a Gemini en este tutorial lo limitan a la evidencia visible y a un lenguaje cauto, y por eso la salida debería revisarse en vez de tomarse como verdad.

¿Por qué importa en una bodega?

Los trabajadores de bodega interactúan de forma permanente con grúas horquilla, pallets, carros y cajas. La detección de objetos estándar puede identificar esos elementos, pero no puede explicar si un trabajador está operando la grúa, empujando un carro o simplemente parado al lado. Ese contexto es justamente lo que necesita el monitoreo operacional y de seguridad.

OSHA ha estimado históricamente que los incidentes con equipos industriales motorizados se asocian a cerca de 34.900 lesiones graves y 85 muertes al año en Estados Unidos. La cifra es estadounidense y el tutorial no entrega un equivalente local, pero da la escala del problema que se intenta tamizar.

El artículo construye dos sistemas en Roboflow Workflows, ambos con RF-DETR para la detección y Gemini para la interpretación, y cada uno responde una pregunta distinta:

FlujoModelo de lenguajeAlcanceSalida
Escena completaGemini 2.5 ProToda la imagen anotadaResumen de interacciones sobre la imagen
Por personaGemini 2.5 Flash-LiteRecorte dinámico de cada personaInforme de seguridad en JSON, seguro o inseguro

Cada flujo entrena su propio modelo RF-DETR sobre un conjunto de datos distinto de Universe: uno de bodega con cinco clases para el análisis de escena, y uno de dos clases, persona y grúa horquilla, para la verificación de seguridad.

¿Cómo se entrena el detector?

Se usa el conjunto de datos de bodega de Roboflow Universe, que contiene alrededor de 1.200 imágenes y 12 clases originales de detección de objetos. Para este flujo se usan cinco clases.

El conjunto sirve porque incluye personas junto a varios objetos con los que pueden interactuar: trabajadores cerca de grúas horquilla, pallets, carros y otros equipos.

Configuración de entrenamiento personalizado con RF-DETR
Configuración de entrenamiento personalizado con RF-DETR

Hay que bifurcar el conjunto al espacio de trabajo propio, abrir la pestaña Train, elegir Custom Training, seleccionar RF-DETR y fijar el tamaño de modelo en Small. Luego se genera una nueva versión del conjunto con una división 70/15/15 para entrenamiento, validación y prueba, con orientación automática y redimensionado a 512 × 512.

Pasos de preprocesamiento del conjunto de datos
Pasos de preprocesamiento del conjunto de datos

Durante el entrenamiento, RF-DETR aprende a ubicar y clasificar a cada trabajador y objeto usando las anotaciones de caja. El modelo devuelve una etiqueta de clase, un puntaje de confianza y una caja para cada persona, grúa horquilla, pallet, carro o caja de fusibles detectada.

¿Qué tan preciso quedó?

Resultados de validación del modelo RF-DETR Small
Resultados de validación del modelo RF-DETR Small

El modelo RF-DETR Small entrenado alcanzó 77,5% de mAP@50, 92,1% de precisión, 71,5% de exhaustividad y 80,5% de F1 sobre el conjunto de validación.

La precisión alta indica que la mayoría de las cajas predichas corresponde a objetos reales de la bodega. Eso importa porque una detección falsa puede llevar a Gemini a describir objetos o interacciones que no están ahí.

La exhaustividad es más baja que la precisión, lo que significa que el modelo puede perder trabajadores u objetos visibles. Una persona, un carro o un pallet no detectado reduce el contexto disponible para Gemini y deriva en un resumen incompleto de la interacción.

Antes de poner el sistema en producción conviene probarlo con imágenes de la bodega de destino. El ángulo de cámara, la iluminación, el tamaño de los objetos, la congestión de pasillos, la oclusión parcial, los uniformes y la disposición de la bodega pueden diferir de los datos de entrenamiento. Estas métricas evalúan solo la etapa de detección: no miden si Gemini identifica correctamente la interacción entre un trabajador y un objeto.

¿Cómo queda armado el flujo?

Tras la evaluación, el modelo se despliega en Roboflow Workflows para construir el análisis de interacción. El flujo recibe una imagen de bodega, ejecuta RF-DETR, dibuja las cajas y las etiquetas de clase, envía la imagen anotada a Gemini 2.5 Pro y superpone el resumen generado sobre la imagen final.

Despliegue del modelo entrenado desde Roboflow
Despliegue del modelo entrenado desde Roboflow
Estructura completa del flujo de trabajo
Estructura completa del flujo de trabajo

La entrada de imagen se conecta al modelo RF-DETR y al bloque de visualización de cajas. Las predicciones alimentan ambos bloques de visualización. La imagen etiquetada pasa después a Gemini y sirve de base para la superposición de texto final, que se devuelve como annotated_image.

Este flujo no usa seguimiento, cálculos de proximidad, zonas, recortes ni un bloque de Python personalizado. Gemini analiza la escena anotada completa y describe las interacciones aparentes.

Entre los dos flujos, el sistema puede reportar relaciones aparentes entre trabajadores, grúas horquilla, pallets y carros; interacciones posibles como operar una grúa, empujar un carro o trabajar cerca de un pallet; clasificaciones de operación segura o insegura por persona con informe en JSON; e interacciones que podrían requerir revisión humana, registradas a través de Vision Events.