Creo que uno de los detalles más interesantes se encuentra oculto en ese primer punto informativo:
7 de mayo: OpenAI inicia un nuevo ciclo de entrenamiento para un modelo experimental no lanzado. (¿Se refieren a un ciclo de evaluación? Mencionan 'ciclo de entrenamiento' en el video y luego aluden a una 'señal de recompensa para juzgar qué tan bien lo están haciendo', por lo que supongo que realmente se trataba de entrenar un modelo, no de evaluar uno ya entrenado).
Cuanto más reflexiono sobre esto, más sospecho que el hecho de que ocurriera mientras se entrenaba un nuevo modelo es clave para comprender qué salió mal.
En RLVR (Aprendizaje por Refuerzo con Recompensas Verificables), estableces una meta para el modelo y haces que tome todos los pasos necesarios para alcanzar dicho objetivo.
Claramente, un aspecto del entrenamiento de OpenAI aquí consiste en aplicar RLVR a sus modelos para tareas de ciberseguridad. Al igual que el pre-entrenamiento se beneficia de volcar vastas fuentes de conocimiento, cuantas más tareas puedas alimentar en el RLVR, más capaz y versátil resulta el modelo final.
Esto también ayuda a explicar por qué los modelos no tenían nada que los frenara. Esos comportamientos de seguridad se añaden mucho más tarde en el proceso.
Y explica (aunque no justifica) por qué la supervisión fue tan laxa. Si estás entrenando un nuevo modelo de esta manera, presumiblemente le asignas miles de tareas similares en paralelo. Puedo entender cómo podrías pasar por alto que un pequeño subconjunto de tus agentes de entrenamiento ha comenzado a dejarse mensajes entre sí en los nombres de archivos dentro de tu servidor de empaquetado.
Alguien me dijo una vez que no puedes simplemente omitir los materiales racistas de tus datos de entrenamiento si deseas un modelo no racista: debe haber visto ejemplos de racismo para que más tarde se le enseñe que el racismo es malo.
Puedo ver ecos de eso aquí. Si tu modelo no sabe cómo hackear cosas de manera agresiva, ¿cómo le enseñas después a no hacerlo?
(Tengo poco conocimiento sobre cómo funciona RLVR en la práctica, así que espero escuchar a personas que puedan ayudarme a entender si voy por el camino correcto aquí).
Vía Simon Willison.



