
Danijar Hafner entrena robots dentro de mundos imaginados
El investigador alemán de 31 años dejó Google DeepMind para fundar una startup en modo sigiloso que aplica sus modelos del mundo a humanoides importados desde China.
16 notas publicadas

Investigadores de la Universidad de Tohoku y del instituto VISTEC lograron que un hexápodo cinco veces mayor que el insecto aprendiera a desplazarse en menos de una hora.

El conjunto de datos WORLD 2026 incluye los fracasos y las correcciones humanas, no solo las demostraciones exitosas que dominan el entrenamiento de robots.

Investigadores de Hong Kong y Oxford entrenaron un control jerárquico que deja al robot decidir cuándo saltar, con 0,44 segundos en el aire y una carrera previa de hasta 2,5 metros por segundo.

Hugging Face y Pollen Robotics lanzan un pequeño bípedo pensado para experimentar con aprendizaje por refuerzo, con SDK abierto y primeras entregas antes de Navidad de 2026.

Pollen Robotics presentó un bípedo de 25 centímetros con cámara, LiDAR y todo el software abierto, pensado como banco de pruebas barato para entrenar comportamientos por refuerzo.

La capa programable envuelve entornos congelados sin tocar el simulador ni los verificadores humanos, y suma hasta 9 puntos en tareas que el agente nunca vio.

El sistema combina agentes de IA, simulación y aprendizaje por refuerzo para adaptar políticas de navegación sin reentrenar desde cero cada vez que cambia el robot o el entorno.

El sistema aprende de 2,5 horas de movimiento humano y combina esas habilidades para resolver tareas nuevas, sin funciones de recompensa distintas para cada maniobra.

Pollen Robotics, el equipo de robótica de Hugging Face, abrió preventa de un robot de 25 centímetros donde cada movimiento es una política neuronal entrenada en simulador y exportada al hardware.

Con solo tres o cuatro pasos de un insecto como referencia, el sistema dedujo el objetivo detrás del movimiento y el robot aprendió a caminar en una hora.

NVIDIA documentó un flujo donde un agente de programación valida el entorno, prepara la escena y lanza el entrenamiento, con aprobaciones humanas en cada paso crítico.

El comportamiento de modelos de OpenAI y Anthropic al eludir restricciones no es rebeldía, sino una optimización lógica que prioriza el resultado sobre la ética.

El CEO de Flexion sostiene que gran parte de los miles de millones que reciben los robots humanoides financia, en realidad, a personas operando robots a distancia.

Un agente de código puede montar el entorno, lanzar experimentos y afinar modelos por su cuenta. En una prueba llevó la precisión de un modelo de 25% a 96,9% en una tarea de conteo visual.

El ganador del Premio Turing 2024 y padre del aprendizaje por refuerzo moderno dice que el deep learning actual es "débil e ineficiente" y arranca su propia startup en Toronto.
Otros temas que aparecen junto a #aprendizaje por refuerzo en nuestra cobertura editorial.