Saltar al contenido
Etiqueta

#aprendizaje por refuerzo

16 notas publicadas

Un robot de seis patas aprende a caminar de un insecto palo
Robótica

Un robot de seis patas aprende a caminar de un insecto palo

Investigadores de la Universidad de Tohoku y del instituto VISTEC lograron que un hexápodo cinco veces mayor que el insecto aprendiera a desplazarse en menos de una hora.

New Atlas
AGIBOT libera 11.430 trayectorias reales de robots
Electrónica

AGIBOT libera 11.430 trayectorias reales de robots

El conjunto de datos WORLD 2026 incluye los fracasos y las correcciones humanas, no solo las demostraciones exitosas que dominan el entrenamiento de robots.

Interesting Engineering
ConsJump: un cuadrúpedo salta huecos de su propio tamaño
Electrónica

ConsJump: un cuadrúpedo salta huecos de su propio tamaño

Investigadores de Hong Kong y Oxford entrenaron un control jerárquico que deja al robot decidir cuándo saltar, con 0,44 segundos en el aire y una carrera previa de hasta 2,5 metros por segundo.

Interesting Engineering
Microduck: un robot bípedo de código abierto por 400 dólares
Educación

Microduck: un robot bípedo de código abierto por 400 dólares

Hugging Face y Pollen Robotics lanzan un pequeño bípedo pensado para experimentar con aprendizaje por refuerzo, con SDK abierto y primeras entregas antes de Navidad de 2026.

Make Magazine
Microduck: el robot pato de 399 dólares de Hugging Face
Electrónica

Microduck: el robot pato de 399 dólares de Hugging Face

Pollen Robotics presentó un bípedo de 25 centímetros con cámara, LiDAR y todo el software abierto, pensado como banco de pruebas barato para entrenar comportamientos por refuerzo.

The Register
EnvHarness: Google adapta el entorno al agente que lo entrena
IA

EnvHarness: Google adapta el entorno al agente que lo entrena

La capa programable envuelve entornos congelados sin tocar el simulador ni los verificadores humanos, y suma hasta 9 puntos en tareas que el agente nunca vio.

MarkTechPost
COMPASS, el marco de NVIDIA que enseña a navegar a los robots
Electrónica

COMPASS, el marco de NVIDIA que enseña a navegar a los robots

El sistema combina agentes de IA, simulación y aprendizaje por refuerzo para adaptar políticas de navegación sin reentrenar desde cero cada vez que cambia el robot o el entorno.

Interesting Engineering
BeyondMimic: humanoides que hacen volteretas sin reentrenarse
Electrónica

BeyondMimic: humanoides que hacen volteretas sin reentrenarse

El sistema aprende de 2,5 horas de movimiento humano y combina esas habilidades para resolver tareas nuevas, sin funciones de recompensa distintas para cada maniobra.

Interesting Engineering
Microduck: el bípedo de 399 dólares que se entrena con RL
IA

Microduck: el bípedo de 399 dólares que se entrena con RL

Pollen Robotics, el equipo de robótica de Hugging Face, abrió preventa de un robot de 25 centímetros donde cada movimiento es una política neuronal entrenada en simulador y exportada al hardware.

MarkTechPost
Un robot de seis patas aprende a caminar de un insecto palo
Electrónica

Un robot de seis patas aprende a caminar de un insecto palo

Con solo tres o cuatro pasos de un insecto como referencia, el sistema dedujo el objetivo detrás del movimiento y el robot aprendió a caminar en una hora.

Electronics For You
COMPASS entrena la navegación de un Spot con agentes de IA
IA

COMPASS entrena la navegación de un Spot con agentes de IA

NVIDIA documentó un flujo donde un agente de programación valida el entorno, prepara la escena y lanza el entrenamiento, con aprobaciones humanas en cada paso crítico.

NVIDIA Developer
Reward hacking: Por qué las IA mienten para cumplir objetivos
IA

Reward hacking: Por qué las IA mienten para cumplir objetivos

El comportamiento de modelos de OpenAI y Anthropic al eludir restricciones no es rebeldía, sino una optimización lógica que prioriza el resultado sobre la ética.

Xataka
Teleoperación: la trampa oculta en el auge de los humanoides
Robótica

Teleoperación: la trampa oculta en el auge de los humanoides

El CEO de Flexion sostiene que gran parte de los miles de millones que reciben los robots humanoides financia, en realidad, a personas operando robots a distancia.

The Robot Report
NVIDIA NeMo automatiza la investigación en RL con agentes
IA

NVIDIA NeMo automatiza la investigación en RL con agentes

Un agente de código puede montar el entorno, lanzar experimentos y afinar modelos por su cuenta. En una prueba llevó la precisión de un modelo de 25% a 96,9% en una tarea de conteo visual.

NVIDIA Developer
Rich Sutton funda Oak Lab para crear agentes que aprenden solos
IA

Rich Sutton funda Oak Lab para crear agentes que aprenden solos

El ganador del Premio Turing 2024 y padre del aprendizaje por refuerzo moderno dice que el deep learning actual es "débil e ineficiente" y arranca su propia startup en Toronto.

The Decoder

Etiquetas relacionadas

Otros temas que aparecen junto a #aprendizaje por refuerzo en nuestra cobertura editorial.