
Humanoid lleva su robot a 99% de éxito con RL en pocos días
KinetIQ Ascend usa aprendizaje por refuerzo en el mundo real para pasar del 78% al 99% en manipulación bimanual y elevar 42% el throughput de una línea de bearings.
4 notas publicadas

El framework open source compone SGLang, Megatron-LM y Ray sobre PyTorch para hacer manejable el post-training por refuerzo de modelos densos y MoE a escala de cluster.

Guía técnica para decidir entre prompting, SFT, RLHF y RLVR con verificadores. Nemotron 3 Super se entrenó con 21 verificadores NeMo Gym, 37 datasets y 1,2 millones de rollouts.

La startup suiza fundada por ex-NVIDIA combina simulación, reinforcement learning y video humano para que un Unitree modificado busque paquetes solo.
Otros temas que aparecen junto a #reinforcement learning en nuestra cobertura editorial.