El equipo Hunyuan Speech de Tencent, junto a investigadores de varias universidades, presentó Gander, un modelo pensado para seguir conversando mientras resuelve tareas complejas de fondo. Según el informe técnico, recibe voz, imágenes y texto al mismo tiempo.

Los asistentes de voz de hoy funcionan casi siempre por turnos, argumentan los investigadores. En una conversación real las personas se interrumpen, dan señales cortas de que están siguiendo el hilo y escuchan mientras hablan. Gander procesa video, voz y texto de forma continua, incluso mientras habla. El usuario puede meterse en cualquier momento, y el modelo puede hacer preguntas de vuelta o informar cómo va la tarea sin que nadie se lo pida.

¿Qué hace cada mitad del modelo?

Conversar exige respuestas rápidas, pero buscar archivos o escribir código toma tiempo de planificación. Un solo modelo tiene que equilibrar velocidad contra capacidad de razonamiento, y por eso Gander reparte el trabajo entre dos roles que los autores bautizaron con anatomía prestada, el cerebelo y el cerebro.

El cerebelo se hace cargo de la conversación en tiempo real. El cerebro resuelve el razonamiento y las tareas largas en segundo plano, y se puede cambiar por sistemas de agentes como Codex o Claude Code sin reentrenar el modelo que conversa. En las pruebas ese lugar lo ocupó un modelo no especificado de la familia GPT-5.6 de OpenAI. Cuando mejora el modelo de abajo, mejora el sistema completo.

Gander corta la conversación en segmentos de un segundo para que el cerebelo decida en cada uno si escucha, si habla o si se calla porque el usuario tomó la palabra. Toma esas decisiones sin un módulo aparte que detecte cuándo empieza y cuándo termina el habla, y usa como memoria aproximadamente los últimos dos minutos de conversación.

¿Cuánto interrumpe frente a sus rivales?

Como todavía no existe una prueba diseñada para modelos de este tipo, los investigadores recurrieron a evaluaciones ya establecidas. El informe dice que Gander obtuvo el mejor tiempo de respuesta en Full-Duplex-Bench v3, que mide asistentes de voz en distintos escenarios de tarea.

Gander empieza a hablar en el momento correcto en los 100 escenarios de la prueba e interrumpe al usuario en 8% de los casos. GPT-Realtime llega a 13,5% y el competidor más débil bordea el 48%. Según el informe, Gander usa un modelo relativamente pequeño para competir contra sistemas comerciales como GPT-Realtime, Gemini Live y Grok.

Donde no gana es en exactitud al resolver la tarea, que queda apenas por debajo de la del competidor más débil. Los investigadores explican que la prueba puntúa el sistema entero, así que los errores de reconocimiento de voz y de salida cuentan en contra, y que el cerebro puntúa bastante mejor cuando recibe el texto directo. La comprensión de video y audio también se resiente. En una de las pruebas Gander rindió peor que su propio modelo base, algo que los autores atribuyen a un entrenamiento que privilegió la fluidez de la conversación por sobre la precisión de la percepción, en tareas como contar objetos y ubicarlos dentro de una imagen.

Pesos y datos aún sin publicar

Gander se entrenó con cerca de 2,7 millones de ejemplos, según el informe. Algunos le enseñan a quedarse callado cuando hay ruido de fondo o cuando en un grupo nadie se está dirigiendo a él.

Los investigadores dicen que el trabajo está en una etapa temprana. Cómo escalar a Gander sigue siendo una pregunta abierta y no hay una forma estándar de evaluar sistemas como este. El equipo planea publicar los pesos y los datos de entrenamiento una vez que termine "el proceso de liberación de código abierto". El repositorio de GitHub con el código ya existe, con demostraciones en la página del proyecto.

Otros van por el mismo camino

Gander viene después de Hy3, el modelo de lenguaje abierto que Tencent liberó en julio y que, según se informó, acortó distancia con sus rivales sobre todo en tareas de agente. Hy3 ya corre dentro de WorkBuddy, Yuanbao y WeChat. La empresa además negocia quedarse con la mayor participación en Manus, la startup de agentes, después de que Beijing bloqueara su compra por parte de Meta.

Repartir el trabajo de agente entre varios modelos es una idea que están probando otros. GPT-Live, de OpenAI, separa la conversación del razonamiento y le pasa las búsquedas web y las tareas de agente a un modelo que trabaja atrás mientras el chat sigue. Fugu, de Sakana AI, es un modelo de lenguaje aparte que llama a otros desde un conjunto ampliable. OpenAI también está probando agentes proactivos que crean tareas de seguimiento y contactan al usuario sin que se lo pidan.

Manejar las interrupciones y evitar las demoras son problemas concretos de esta clase de sistemas. Un análisis de Anthropic encontró que los usuarios con experiencia interrumpen a Claude Code en cerca del 9% de los pasos de trabajo, contra alrededor de 5% entre quienes recién empiezan.