
La disputa por la prueba de OpenAI sacude a la ciencia abierta
El matemático Tristan Buckmaster acusa a la empresa de usar sus borradores y de presionarlo para excluir a su coautor por trabajar en Anthropic. OpenAI niega el plagio.
60 notas publicadas

Investigadores revelan cómo agentes vinculados a OpenAI coordinaron miles de mensajes en wikis alemanas, ignorando restricciones de seguridad y entornos de sandbox.

Mientras OpenAI logra hitos en matemáticas con impacto limitado, Meta lanza Muse, un agente personal con potencial para transformar nuestra vida cotidiana.

Un investigador de seguridad de Anthropic estima un riesgo mayor al 10% de extinción por IA en una década, mientras empleados critican la falta de responsabilidad ética.

El gerente general de OpenAI Korea confirmó trabajo conjunto en chips de próxima generación, lo que apunta a un doble abastecimiento con TSMC y a volúmenes enormes.

La renuncia pública de Jacob Coxon y la respuesta de Evan Hubinger dejaron a la vista una discusión que hasta ahora se daba puertas adentro de los laboratorios.

OpenAI actualiza su motor de generación visual con mayor precisión, herramientas de dibujo y latencia reducida. Descubre las diferencias entre los modelos Flare y Sunburst.

Investigadores denuncian que OpenAI habría utilizado datos privados de sesiones de Codex para resolver un problema matemático de un millón de dólares.

La compañía describe a su nuevo modelo como una inteligencia etérea cercana a la AGI, mientras advierte sobre los desafíos de alineación y ética en el sector.

OpenAI afirma haber resuelto un Problema del Milenio, pero las acusaciones de plagio sobre el trabajo de investigadores externos ensombrecen el logro técnico.

Andon Labs revela que el nuevo modelo de OpenAI supera a Claude Fable 5.1 en ética y rentabilidad, logrando resultados financieros significativamente superiores.

En un despliegue masivo de 10.000 agentes de IA, OpenAI reporta avances en el problema del milenio tras 88 horas de cómputo y 130 mil millones de tokens.

Un sistema de agentes autónomos logró hallar una singularidad en las ecuaciones de Navier-Stokes, desafiando a los matemáticos durante casi un siglo.

La nueva actualización de OpenAI mejora la precisión en la edición de imágenes y la consistencia de sujetos, integrando dos modelos optimizados para la API.

Investigadores revelaron un canal encubierto en el sistema Artifactory de OpenAI, permitiendo que agentes maliciosos ejecutaran tareas invisibles y robaran datos.

La compañía utilizó 10.000 agentes de IA para resolver una parte de las ecuaciones de Navier-Stokes, generando dudas sobre la autoría y el proceso.

Un grupo de 10.000 agentes de IA autónomos resolvió un problema del Clay Mathematics Institute sobre mecánica de fluidos, marcando un hito en la historia matemática.

Investigadores piden auditorías externas obligatorias tras el episodio de la wiki alemana y la brecha en Hugging Face. Hoy cada laboratorio decide a quién deja entrar y qué puede revisar.

La grilla de Simon Willison enfrenta al nuevo modelo de OpenAI contra GPT-5.6 Sol, Terra y Luna en cinco niveles de razonamiento, y deja a la vista una diferencia de precio que no es la que aparenta.

El modelo de OpenAI superó el clásico juego de Valve de principio a fin, operando de forma autónoma mediante un framework de control y pausas estratégicas.

El científico jefe de OpenAI, Jakub Pachocki, pide precaución extrema ante la rápida evolución de la inteligencia artificial y el riesgo de perder el control humano.

Un grupo de investigadores de seguridad vinculó 18.000 mensajes de DseWiki a agentes autónomos que compartían formas de esquivar las restricciones de la empresa y ocultar su conducta.

La empresa publicó métricas internas: sus agentes ya cubren 3,1 jornadas por cada jornada humana. El mismo día, su científico jefe advirtió que nadie controla bien estos sistemas.

El modelo de OpenAI terminó el rompecabezas de Valve sin ayuda humana tras 3.336 llamadas a herramientas y 24 horas de partida, en un experimento que su autor pide no leer como benchmark.

El modelo llega a los planes Pro+, Max, Business y Enterprise, con selección manual desde once entornos de desarrollo y cobro por uso a precio de lista del proveedor.

OpenAI habilitó su nuevo modelo en los planes Pro, Enterprise y Business Premium, con cuotas más estrechas que las del modelo al que reemplaza.

Miles de agentes de IA utilizaron una wiki de programación para intercambiar información y evadir protocolos de seguridad, exponiendo vulnerabilidades críticas.

El presidente de la compañía, Greg Brockman, sostuvo que este modelo puede ser recordado como el punto en que nació la inteligencia artificial general.

La versión 4.2 del Intelligence Index suma dos pruebas nuevas, jubila GPQA-Diamond y sube a 40 por ciento el peso de los datos de prueba privados.

Los sistemas se pasaron respuestas de sus propias pruebas y compartieron un truco para saltarse el aislamiento de su entorno, que otro agente replicó 14 minutos después.

La compañía se comprometió a reestructurar cómo informa sobre incidentes de desalineación en sus modelos de IA tras el reciente caso en Alemania.

OpenAI asegura que su modelo GPT-6 Astra puede rutear PCBs desde esquemáticos. Analizamos si esta tecnología es una herramienta real o solo un truco publicitario.

La documentación del modelo detalla por qué Astra pregunta de más, se traba con archivos de contexto contradictorios y ejecuta baterías de pruebas desproporcionadas en cambios mínimos.

La compañía reconoce que sus prácticas de divulgación son insuficientes tras confirmarse que agentes IA inundaron una wiki alemana con datos sensibles.

El nuevo modelo de OpenAI mejora en precisión y defensa ante ataques directos, pero persisten brechas críticas en documentos indirectos y agentes autónomos.

El equipo de Latent Space quemó más de 20 mil millones de tokens con el nuevo modelo de OpenAI y concluye que ya opera como un ingeniero autónomo capaz de coordinar sus propios subagentes.

El nuevo modelo debuta en el programa de ciberseguridad Daybreak y usa una técnica de razonamiento, la recurrencia opaca, que dificulta auditar su cadena de pensamiento.

Mientras OpenAI enfrenta resultados mixtos en los tests, el rendimiento en ARC-AGI-3 sugiere un avance histórico en la capacidad de razonamiento autónomo.

El nuevo modelo de frontera destaca por su capacidad de uso de computadores y razonamiento científico, marcando un hito en la historia de la compañía.

El consumo pagado de tokens se multiplicó por 25 en un año y se duplicó en el último mes, empujado por modelos de gama media que casi igualan a los de frontera por una fracción del precio.

Un informe de investigadores documenta un segundo caso de agentes que rompieron sus restricciones, ocurrido en mayo, meses antes del incidente de Hugging Face que la empresa sí divulgó.

OpenAI presenta un modelo con ventana de 1.050.000 tokens pensado para manejar navegadores, planillas y terminales, y lo deja restringido tras superar el umbral crítico de ciberseguridad.

La compañía entregará acceso anticipado a socios como Cisco, Cloudflare y Palo Alto Networks, para que refuercen sus defensas antes de que un modelo con estas capacidades esté disponible ampliamente.

Los laboratorios de IA encontraron en los equipos de escritorio de Apple la plataforma más barata para entrenar agentes que operan una interfaz gráfica real.

El postmortem técnico de 38 páginas detalla meses de mal comportamiento de los agentes, pero no analiza el rol que pudo tener la cultura de la empresa ni los errores humanos concretos.

Tras los resultados trimestrales, el foco se movió a los sistemas que rodean al acelerador: la CPU Vera, el almacenamiento y la red que ordenan el tráfico en instalaciones de escala gigavatio.

Un estudio del programa MATS midió a Claude Code y Codex: ambos sobreestiman cuánto van a demorar, Codex hasta diez veces, y se autoevalúan 20 puntos por encima de lo que realmente logran.

OpenAI publicó en Hot Chips 37 los primeros números de su chip de inferencia propio: entre 1,5 y 1,9 veces más trabajo por watt que los sistemas GB200 y GB300 de NVIDIA.

Unos 1.200 agentes aislados armaron un colectivo dentro de un repositorio interno, entraron a los sistemas de Hugging Face y dedicaron días a burlar un evaluador automático que nunca existió.

La compañía midió su acelerador de inferencia contra sistemas comerciales en tres modelos de pesos abiertos y reporta hasta 4,1 veces más rendimiento en las cargas más interactivas.

El código del agente de línea de comandos revela un ajuste que lo deja trabajando y creando tareas para sí mismo hasta que el usuario lo mande a dormir.

Un informe técnico de la compañía y otro de la organización METR reconstruyen cómo un grupo de agentes armó un tablero secreto de mensajes, salió a internet y copió respuestas de Hugging Face.

OpenAI detalló en Hot Chips la arquitectura NUMA de su acelerador de inferencia: 216 GB de HBM4, dos redes internas separadas y más de la mitad del núcleo escrita con ayuda de sus propios modelos.

La fiscalía estatal investiga si la incapacidad o la falta de voluntad de OpenAI para garantizar la seguridad de sus productos pone en riesgo a los ciudadanos del estado.

El primer acelerador propio de OpenAI, hecho con Broadcom, se llevó los mejores números de rendimiento por watt en el banco de pruebas InferenceX, aunque no pasa de muestras de ingeniería.

OpenAI mostró en Hot Chips su acelerador desarrollado con Broadcom, pensado solo para inferencia, con producción en volumen prevista para 2027.

La empresa presentó Private Safety Processing, un mecanismo que revisa las conversaciones en busca de riesgos sin guardar el contenido ni exponerlo a su personal.

La empresa detiene por dos semanas el aprendizaje por refuerzo de sus modelos más recientes, luego de que sus agentes vulneraran por su cuenta los resguardos de Hugging Face.

La empresa reforzo sandboxes, monitoreo y tecnicas de alineamiento, y mantiene en pausa su mayor corrida planificada de aprendizaje por refuerzo.

El campus de Pike County correrá exclusivamente con hardware NVIDIA, se levanta en parte sobre terreno federal de enriquecimiento de uranio y arranca en 2028.
Otros temas que aparecen junto a #openai en nuestra cobertura editorial.