En los modelos de lenguaje de solo decoder, nada de lo que se calcula en la última capa del token t entra a la primera capa del token t+1. Las posiciones se comunican únicamente por atención sobre las claves y valores guardados en caché. Un informe técnico de Yifan Zhang, investigador de Princeton, propone cerrar ese circuito con el Recurrent Looped Transformer (RLT), que arrastra el estado final del decoder y su caché de atención por ventana deslizante hacia el token siguiente, tanto en el prompt como en la respuesta y sin reiniciar nada en el límite entre ambos.

El propio informe marca su alcance antes de que alguien lo saque de contexto. Es una especificación de diseño. Define la arquitectura, los esquemas de ejecución y el contrato de repetición para aprendizaje por refuerzo, y declara de forma explícita que no reporta resultados medidos de eficiencia, de calidad de razonamiento ni de escalamiento.

Cómo está construido

RLT combina un encoder causal con un decoder recurrente. El encoder procesa los tokens en paralelo bajo una máscara causal y produce representaciones, desde las cuales se proyecta una memoria de claves y valores. Esos grupos de memoria pueden compartirse entre todas las capas del decoder o mantenerse específicos capa por capa.

La recurrencia vive en el decoder. Su estado completo lo forman la salida final del paso anterior y las claves y valores retenidos en la ventana deslizante de cada capa del decoder. Para cada token, una fusión con compuertas combina la representación del encoder con la salida anterior. Después, cada bloque del decoder corre atención causal por ventana sobre las activaciones del decoder, atención cruzada a la memoria del encoder y una red feed-forward. La ventana incluye el token actual, así que por capa se retiene como máximo una entrada histórica menos que el tamaño de esa ventana. La distribución del token siguiente se lee desde la salida final, y la inicialización ocurre una sola vez antes del token de inicio, con un estado aprendido y la caché vacía.

Pieza de la configuración de referenciaValor
Capas del encoder48
Capas del decoder48
Bloques lógicos por token96
Profundidad del camino de estado tras t tokens48t bloques

Zhang aclara que los pesos de atención y de feed-forward se comparten entre encoder y decoder, y que eso es reutilización de parámetros, no copia de activaciones. Los bloques del decoder suman atención cruzada, así que el costo en operaciones no es igual bloque contra bloque.

¿Qué gana el modelo con arrastrar el estado?

El informe ordena la propuesta en tres principios. El primero es la profundidad temporal sin tope. Tras t tokens procesados, el camino del estado atraviesa 48t bloques del decoder en la configuración de referencia, mientras el trabajo por token se mantiene fijo. El mismo texto advierte que las compuertas y la contracción pueden apagar los caminos largos, y que la profundidad estructural no garantiza razonamiento.

El segundo es el co-diseño con el hardware. Las operaciones del encoder usan kernels paralelos por token. Las transiciones del decoder son secuenciales dentro de una secuencia, pero las actualizaciones de secuencias independientes que estén listas pueden compartir un mismo kernel por lotes. Acá el informe vuelve a ser explícito con lo que no promete. No supone un escaneo paralelo exacto para el decoder no lineal, no reclama aceleración en la etapa de prellenado y advierte que una pasada paralela estándar del decoder no equivale a la recurrencia. El agrupamiento, la fusión de kernels y el checkpointing quedan como objetivos de implementación, no como trabajo terminado.

El tercero es el co-diseño con el algoritmo de refuerzo. El preentrenamiento, el ajuste supervisado, el muestreo y la repetición comparten una misma transición de estado. Durante el refuerzo, el muestreador registra la probabilidad logarítmica de cada acción bajo la distribución con la que efectivamente se muestreó, con temperatura y truncamiento incluidos. El entrenador reconstruye la memoria del encoder, la salida recurrente y todas las cachés desde el inicio de la secuencia con los parámetros actuales antes de puntuar cada acción, y los estados viejos nunca se reutilizan. La proposición 3.1 del informe formaliza el beneficio. Mover el corte entre prompt y respuesta deja intacta la distribución condicional para un historial de tokens fijo.

Entrenamiento y servicio

El preentrenamiento es predicción del token siguiente sobre la secuencia completa, con retropropagación a través del tiempo. El ajuste supervisado enmascara la pérdida hacia los tokens del asistente, pero nunca enmascara las actualizaciones de estado, así que esas pérdidas se propagan hacia atrás por los tokens del usuario y de las herramientas.

El apéndice B explica por qué desconectar el gradiente a medias es riesgoso. El jacobiano entre estados tiene términos cruzados a través de las claves y valores del decoder, así que desconectar solo la salida final deja caminos de gradiente abiertos por la caché. Cualquier esquema de retropropagación truncada tiene que nombrar cada tensor que desconecta.

Para servir conversaciones de varios turnos, una instantánea exacta del prefijo incluye la caché y la memoria del encoder, el estado completo del decoder, los metadatos de posición, la convención de ventana y la versión del modelo. Con los pesos fijos, esa instantánea se puede reutilizar, porque el estado no depende de dónde se corte entre prompt y respuesta. Actualizar los pesos invalida los estados viejos, y editar un prefijo obliga a recalcular desde un punto anterior.

¿En qué trabajos previos se apoya?

La memoria derivada del encoder sigue a YOCO, que guarda las claves y valores una sola vez para un decoder cruzado, y a DeepSeek V4.1-Flash, que proyecta las claves y valores globales del decoder desde los estados finales del encoder. RLT conserva esa memoria y descarta el salto de capas del decoder a lo largo del prompt.

La realimentación temporal viene de Feedback Transformer y Recurrent Transformer, con una diferencia. RLT entrega la salida final anterior del decoder a la entrada del decoder siguiente y corre la recurrencia también sobre el prompt. La reutilización en profundidad conecta con Universal Transformers y con el razonamiento latente por profundidad recurrente, y el argumento de repetición extiende una nota previa de Zhang sobre el desajuste de kernels entre prellenado y decodificación.

Lo que todavía no está medido

La calidad de razonamiento, la eficiencia y el escalamiento con aprendizaje por refuerzo siguen como objetivos de validación abiertos, según la lista de conclusiones del propio documento. Están publicados el informe técnico completo y el sitio del proyecto.