Saltar al contenido
Etiqueta

#benchmarks

37 notas publicadas

IFM libera seis modelos Apache 2.0, de 0,9B a 375B
IA

IFM libera seis modelos Apache 2.0, de 0,9B a 375B

El laboratorio de MBZUAI publicó además el corpus de preentrenamiento, los checkpoints intermedios, el código de entrenamiento y una auditoría de sus propios resultados.

MarkTechPost
Artificial Analysis rehace su índice tras las críticas por Astra
IA

Artificial Analysis rehace su índice tras las críticas por Astra

La versión 4.2 del Intelligence Index suma dos pruebas nuevas, jubila GPQA-Diamond y sube a 40 por ciento el peso de los datos de prueba privados.

The Decoder
Muse Spark 1.3 de Meta usa 20% menos llamadas a herramientas
IA

Muse Spark 1.3 de Meta usa 20% menos llamadas a herramientas

El cuarto modelo Spark en cinco meses apunta a tareas agénticas largas y programación, con menos idas y vueltas por tarea, pero con los pesos cerrados y su mejor modo de razonamiento bloqueado.

MarkTechPost
GPT-6 Astra: ¿Es la IA más eficiente que un humano?
IA

GPT-6 Astra: ¿Es la IA más eficiente que un humano?

Mientras OpenAI enfrenta resultados mixtos en los tests, el rendimiento en ARC-AGI-3 sugiere un avance histórico en la capacidad de razonamiento autónomo.

The Decoder
Muse Spark 1.3 de Meta: el modelo más barato de su clase
IA

Muse Spark 1.3 de Meta: el modelo más barato de su clase

La cuarta versión en cinco meses mejora en tareas de agentes, sigue detrás de Claude Fable 5.1 en casi todas las pruebas y cobra 0,55 dólares por tarea, cerca de la mitad que sus rivales.

The Decoder
Claude Fable 5.1: caché 75% más barato, tarea 20% más cara
IA

Claude Fable 5.1: caché 75% más barato, tarea 20% más cara

Anthropic lanzó Fable 5.1 y Mythos 5.1 como sus modelos tope para programación y trabajo de conocimiento, con el precio por token intacto y un recorte fuerte en la lectura de caché.

Latent Space
Claude Mythos, único modelo que completó la cadena de ataque
Electrónica

Claude Mythos, único modelo que completó la cadena de ataque

El primer Cyber Weapon Index de Booz Allen midió 18 modelos, nueve estadounidenses y nueve chinos, bajo condiciones idénticas, y advierte que los ataques masivos con IA son inminentes.

The Register
Claude Fable 5.1 dibuja su mejor pelícano por 3,30 dólares
IA

Claude Fable 5.1 dibuja su mejor pelícano por 3,30 dólares

Simon Willison corrió su prueba del pelícano en bicicleta en los cinco niveles de razonamiento del modelo de Anthropic: del más barato al más caro hay 33 veces de diferencia en costo.

Simon Willison
Claude Fable 5.1: hasta 45% más barato en tareas con agentes
IA

Claude Fable 5.1: hasta 45% más barato en tareas con agentes

Anthropic lanzó Fable 5.1 y Mythos 5.1, bajó la lectura de caché de 1 a 0,25 dólares por millón de tokens y duplicó su puntaje en investigación científica con agentes.

The Decoder
Gemini 3.8 Flash llega a 73,7% en DeepSWE, casi como Opus 5
IA

Gemini 3.8 Flash llega a 73,7% en DeepSWE, casi como Opus 5

Google publicó su tercer modelo económico en seis semanas, pero el nuevo Flash razona más y quema cerca de 30% más tokens de salida por tarea.

The Decoder
Gradium TTS acierta el 81% de los casos difíciles en 216
IA

Gradium TTS acierta el 81% de los casos difíciles en 216

El modelo de texto a voz quedó activo por defecto en la API y el estudio de la empresa, y apunta al punto donde fallan los agentes de voz: números de pedido, correos y códigos de referencia.

MarkTechPost
Agentes de voz: el presupuesto real de latencia es 700
IA

Agentes de voz: el presupuesto real de latencia es 700

El tiempo hasta el primer token es la métrica con la que los equipos eligen su API de inferencia, y también la que más los confunde: la síntesis no habla hasta recibir una cláusula completa.

MarkTechPost
EnvHarness: Google adapta el entorno al agente que lo entrena
IA

EnvHarness: Google adapta el entorno al agente que lo entrena

La capa programable envuelve entornos congelados sin tocar el simulador ni los verificadores humanos, y suma hasta 9 puntos en tareas que el agente nunca vio.

MarkTechPost
Los modelos de mundo fallan si ignoran lo que la gente cree
IA

Los modelos de mundo fallan si ignoran lo que la gente cree

Un nuevo marco llamado Mental World Modeling agrega creencias, intenciones y normas sociales al estado del mundo, y con eso un modelo débil supera a uno más potente que solo simula física.

The Decoder
NVIDIA AVO llega al 100% en ARC-AGI-3 con agentes autónomos
IA

NVIDIA AVO llega al 100% en ARC-AGI-3 con agentes autónomos

La arquitectura de NVIDIA resolvió los 183 niveles de la prueba pública con 12% menos acciones que VISTA, y llevó a un modelo que por sí solo rendía 30% hasta el puntaje perfecto.

NVIDIA Developer
Melanie Mitchell: aún no sabemos medir la cognición de la IA
IA

Melanie Mitchell: aún no sabemos medir la cognición de la IA

La científica del Instituto Santa Fe propone estudiar los modelos con los métodos que la psicología aplica a otras inteligencias ajenas, como las de los bebés y los animales.

Quanta Magazine
Nemotron 3.5 Lightning: 670 tokens/s y el nivel de gpt-oss-120b
IA

Nemotron 3.5 Lightning: 670 tokens/s y el nivel de gpt-oss-120b

Artificial Analysis midió el modelo abierto de NVIDIA: la mayor velocidad de su clase, un salto de nueve puntos en inteligencia y un Elo agéntico superior al de modelos cuatro veces más grandes.

The Decoder
AMX acelera la IA en el Xeon 678X sin castigo térmico
Open Source

AMX acelera la IA en el Xeon 678X sin castigo térmico

Phoronix midió las extensiones matriciales de Intel en un Granite Rapids WS montado en una HP Z4 G6i, con Ubuntu 26.04 y kernel Linux 7.0.

Phoronix Tests
Meta suma un segundo agente que hace de memoria del primero
IA

Meta suma un segundo agente que hace de memoria del primero

Un módulo separado vigila la ejecución, mantiene un banco de memoria estructurado y decide cuándo interrumpir al agente principal con un recordatorio y cuándo quedarse callado.

The Decoder
GPT-5.6 Sol: ¿supera a Claude Opus 5 en ARC-AGI-3?
IA

GPT-5.6 Sol: ¿supera a Claude Opus 5 en ARC-AGI-3?

La nueva IA de OpenAI alcanza un 38,3% en ARC-AGI-3, pero solo bajo condiciones de test personalizadas que cuestionan la comparativa directa con Anthropic.

The Decoder
METR mide cuándo un agente de IA sale más caro que un humano
IA

METR mide cuándo un agente de IA sale más caro que un humano

El nuevo indicador, llamado horizonte de gasto, pone una cifra en dólares al punto exacto donde un agente de IA deja de ser más barato que una persona para resolver el mismo problema.

The Decoder
Claude Opus 5 lidera benchmarks y cuesta menos que Fable 5
IA

Claude Opus 5 lidera benchmarks y cuesta menos que Fable 5

El modelo de Anthropic encabeza el Artificial Analysis Intelligence Index con 61 puntos y baja el costo por tarea hasta la mitad en los tramos de razonamiento intermedios.

The Decoder
Claude Opus 5 casi iguala a Fable 5 a mitad de precio
IA

Claude Opus 5 casi iguala a Fable 5 a mitad de precio

El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.

The Decoder
Kimi K3: el modelo abierto de 2,8 billones que reta a Opus 4.8
IA

Kimi K3: el modelo abierto de 2,8 billones que reta a Opus 4.8

Moonshot AI lanzó su modelo más capaz, con pesos abiertos prometidos para el 27 de julio; supera a GPT-5.5 y Opus 4.8 en sus propios benchmarks, pero cobra como la gama Claude Sonnet.

Simon Willison
RoboLab de NVIDIA evalúa robots generalistas en simulación
Robótica

RoboLab de NVIDIA evalúa robots generalistas en simulación

La plataforma mide no solo si un robot completa la tarea, sino cuándo falla, por qué falla y con cuánta confianza estadística se puede afirmar que una política es mejor que otra.

The Robot Report
NVIDIA presenta RoboLab para evaluar robots de forma justa
IA

NVIDIA presenta RoboLab para evaluar robots de forma justa

La plataforma de NVIDIA Research busca resolver uno de los problemas sin resolver de la robótica: cómo medir de verdad si una política de control funcionará fuera del laboratorio.

NVIDIA Developer
Muse Spark 1.1 de Meta supera a GLM-5.2 en programación
IA

Muse Spark 1.1 de Meta supera a GLM-5.2 en programación

El modelo empata en el Intelligence Index de Artificial Analysis, gana el duelo de programación y llega con un costo por tarea más bajo que sus rivales directos.

The Decoder
Grok 4.5 es tan barato que los benchmarks importan menos
IA

Grok 4.5 es tan barato que los benchmarks importan menos

El modelo de xAI queda detrás de Fable 5 y GPT-5.5 en varios benchmarks de programación, pero cuesta 2 dólares por millón de tokens de entrada y usa 4,2 veces menos tokens que Opus 4.8.

The Decoder
GPT-5.6 Sol casi iguala a Fable 5 a un tercio del costo
IA

GPT-5.6 Sol casi iguala a Fable 5 a un tercio del costo

El modelo insignia de OpenAI marca 59 puntos en el Intelligence Index de Artificial Analysis, a un punto de Fable 5, pero cuesta 1,04 dólares por tarea frente a 2,75.

The Decoder
OpenAI: casi 30% del test de código SWE-Bench Pro falla
IA

OpenAI: casi 30% del test de código SWE-Bench Pro falla

La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

The Decoder
OpenAI vence a todos los humanos en la final de AtCoder
IA

OpenAI vence a todos los humanos en la final de AtCoder

En la final del AtCoder World Tour 2026, un sistema de OpenAI resolvió los cinco problemas de la división de algoritmos y superó por amplio margen a los mejores programadores competitivos del mundo.

The Decoder
Databricks adopta GLM 5.2 como motor de código por defecto
IA

Databricks adopta GLM 5.2 como motor de código por defecto

El modelo abierto chino igualó a Opus 4.8 en un benchmark interno de Databricks a 1,28 dólares por tarea frente a 1,94, y pasa a ser el modelo de trabajo diario de sus desarrolladores.

The Decoder
Claude Fable 5 lidera los benchmarks de industria a un precio alto
IA

Claude Fable 5 lidera los benchmarks de industria a un precio alto

Los nuevos índices de Artificial Analysis colocan al modelo de Anthropic primero en finanzas, derecho y medicina, pero una sola tarea puede costar más de cien veces que una alternativa abierta.

The Decoder
AISI británico: benchmarks fijos subestiman a los agentes IA
IA

AISI británico: benchmarks fijos subestiman a los agentes IA

El AI Security Institute demostró que aumentar 10× el presupuesto de tokens sube el desempeño hasta 25 puntos en tareas de ingeniería de software y modifica la curva real de progreso del frontier.

The Decoder
Paper de OpenAI filtra tres variantes Pro para GPT-5.6
IA

Paper de OpenAI filtra tres variantes Pro para GPT-5.6

Un benchmark de genómica lista por primera vez Luna Pro, Terra Pro y Sol Pro; Sol Pro alcanza 31,5% de pass rate en la prueba.

The Decoder
Claude Sonnet 5 casi duplica el costo real por tarea
IA

Claude Sonnet 5 casi duplica el costo real por tarea

Consume 40% más tokens de salida que Sonnet 4.6 y triplica los ciclos de agente. El costo promedio salta de USD 1,20 a USD 2,29, aún más caro que el propio Opus 4.8.

The Decoder

Etiquetas relacionadas

Otros temas que aparecen junto a #benchmarks en nuestra cobertura editorial.