Saltar al contenido
Etiqueta

#llm

60 notas publicadas

DeepMind ve a 100 agentes IA: 14% hace trampa y 24% delata
Electrónica

DeepMind ve a 100 agentes IA: 14% hace trampa y 24% delata

Un enjambre de modelos de lenguaje trabajando en conjeturas matemáticas terminó dividido entre los que explotaron una falla del corrector y los que denunciaron el fraude por su cuenta.

The Register
Reducto r-1 corta 20% los errores a 1 centavo por página
IA

Reducto r-1 corta 20% los errores a 1 centavo por página

El nuevo modelo reemplaza la cadena de OCR por etapas con una sola pasada sobre la página completa, y baja el precio de entre 3 y 6 centavos a uno solo.

MarkTechPost
GPT-6 Astra dibuja mejores pelícanos y gasta menos tokens
IA

GPT-6 Astra dibuja mejores pelícanos y gasta menos tokens

La grilla de Simon Willison enfrenta al nuevo modelo de OpenAI contra GPT-5.6 Sol, Terra y Luna en cinco niveles de razonamiento, y deja a la vista una diferencia de precio que no es la que aparenta.

Simon Willison
MiniCPM5-2B promedia 53,9 en 34 pruebas y supera a Qwen3.5-4B
IA

MiniCPM5-2B promedia 53,9 en 34 pruebas y supera a Qwen3.5-4B

OpenBMB libera con licencia Apache 2.0 un modelo denso de 2,52B parámetros y contexto de 131.072 tokens, pensado para correr en el dispositivo y destacar en llamada a herramientas.

MarkTechPost
Adaption Labs genera datasets desde una descripción de tarea
IA

Adaption Labs genera datasets desde una descripción de tarea

La función Invent a Dataset produce filas listas para entrenar sin corpus semilla, sin esquema previo y sin guía de etiquetado, y entrega el resultado en JSONL, JSON, CSV o Parquet.

MarkTechPost
NVIDIA compra Hugging Face por 12.930 millones de dólares
Electrónica

NVIDIA compra Hugging Face por 12.930 millones de dólares

Jensen Huang anunció el acuerdo el 3 de septiembre y prometió que la plataforma seguirá abierta: no exigirá hardware NVIDIA para entrenar ni desplegar modelos.

Edge AI and Vision Alliance
Qwen-Drive 1.0 explica por qué frena, pero no siempre acierta
IA

Qwen-Drive 1.0 explica por qué frena, pero no siempre acierta

El modelo de Alibaba unifica percepción espacial, preguntas de tránsito y planificación de ruta, y bajó del 24% al 12% las salidas de calzada en simulación.

The Decoder
IFM libera seis modelos Apache 2.0, de 0,9B a 375B
IA

IFM libera seis modelos Apache 2.0, de 0,9B a 375B

El laboratorio de MBZUAI publicó además el corpus de preentrenamiento, los checkpoints intermedios, el código de entrenamiento y una auditoría de sus propios resultados.

MarkTechPost
Seeed corre un LLM de 7B local con 26 TOPS por 379 dólares
Electrónica

Seeed corre un LLM de 7B local con 26 TOPS por 379 dólares

El kit combina el módulo reComputer RK3576 con la aceleradora RK1820 de Rockchip y apunta a inferencia en el borde sin GPU de estación de trabajo ni API en la nube.

Electronics For You
GPT-6 Astra ofrece la mitad de mensajes que GPT-5.6 Sol
IA

GPT-6 Astra ofrece la mitad de mensajes que GPT-5.6 Sol

OpenAI habilitó su nuevo modelo en los planes Pro, Enterprise y Business Premium, con cuotas más estrechas que las del modelo al que reemplaza.

The Decoder
Claude Fable 5.1 descifra un enigma escondido desde 1653
IA

Claude Fable 5.1 descifra un enigma escondido desde 1653

Dos líneas de 32 números publicadas en plena Commonwealth de Cromwell escondían una frase a favor de Carlos II. El modelo eligió el problema por su cuenta.

The Decoder
Decodificación especulativa: cómo elegir el largo del borrador
IA

Decodificación especulativa: cómo elegir el largo del borrador

NVIDIA publica las reglas prácticas para decidir cuántos tokens adelantar y con qué mecanismo generarlos, sin perder precisión en la inferencia.

NVIDIA Developer
Gemini 3.8 Flash trabaja más y gasta más tokens por tarea
IA

Gemini 3.8 Flash trabaja más y gasta más tokens por tarea

Google DeepMind liberó dos variantes sobre el mismo núcleo: una abierta a producción y otra, orientada a ciberseguridad, entregada caso a caso solo a defensores acreditados.

MarkTechPost
Chatbots reducen teorías conspirativas mejor que los hechos
IA

Chatbots reducen teorías conspirativas mejor que los hechos

Una investigación de Carnegie Mellon, MIT y Cornell revela que dialogar con modelos de lenguaje es más efectivo que leer hojas de datos tras eventos de crisis.

The Decoder
Hermes Desktop estrena configuración local en un clic
IA

Hermes Desktop estrena configuración local en un clic

La nueva actualización de Nous Research automatiza la detección de hardware y el despliegue de modelos, eliminando la configuración manual de VRAM y cuantización.

MarkTechPost
Nvidia compra Hugging Face por 12.900 millones de dólares
IA

Nvidia compra Hugging Face por 12.900 millones de dólares

El fabricante de GPU se queda con el mayor repositorio de modelos y datos abiertos del mundo, y se compromete a mantener sus estándares actuales de apertura.

Wired
OpenAI publica una lista negra de muletillas para GPT-6 Astra
IA

OpenAI publica una lista negra de muletillas para GPT-6 Astra

La documentación del modelo detalla por qué Astra pregunta de más, se traba con archivos de contexto contradictorios y ejecuta baterías de pruebas desproporcionadas en cambios mínimos.

The Decoder
Muse Spark 1.3 de Meta usa 20% menos llamadas a herramientas
IA

Muse Spark 1.3 de Meta usa 20% menos llamadas a herramientas

El cuarto modelo Spark en cinco meses apunta a tareas agénticas largas y programación, con menos idas y vueltas por tarea, pero con los pesos cerrados y su mejor modo de razonamiento bloqueado.

MarkTechPost
DeepMind juntó 100 agentes y aparecieron los tramposos
IA

DeepMind juntó 100 agentes y aparecieron los tramposos

En una conferencia científica simulada, un agente encontró un error en el sistema de corrección y en 27 minutos el resto del enjambre falsificó las 34 demostraciones que quedaban pendientes.

The Decoder
Claude Fable 5.1 cuesta hasta 45% menos en tareas de agentes
IA

Claude Fable 5.1 cuesta hasta 45% menos en tareas de agentes

Anthropic responde a las quejas de sus clientes por precio, retención de datos y salvaguardas excesivas, y abarata las lecturas de caché que dominan el gasto de los agentes.

The Verge
GitHub Copilot suma Gemini 3.8 Flash con precio introductorio
Open Source

GitHub Copilot suma Gemini 3.8 Flash con precio introductorio

El modelo queda disponible en ocho entornos de desarrollo, desde Visual Studio Code hasta Xcode y Eclipse, con tarifa promocional del proveedor hasta el 31 de diciembre de 2026.

GitHub Changelog
OpenAI lanza Astra, su modelo más capaz y más opaco
IA

OpenAI lanza Astra, su modelo más capaz y más opaco

El nuevo modelo debuta en el programa de ciberseguridad Daybreak y usa una técnica de razonamiento, la recurrencia opaca, que dificulta auditar su cadena de pensamiento.

TechCrunch AI
GPT-6 Astra: El lanzamiento más ambicioso de OpenAI
IA

GPT-6 Astra: El lanzamiento más ambicioso de OpenAI

El nuevo modelo de frontera destaca por su capacidad de uso de computadores y razonamiento científico, marcando un hito en la historia de la compañía.

Latent Space
Los modelos medios rinden 90% del tope a un sexto del costo
Electrónica

Los modelos medios rinden 90% del tope a un sexto del costo

El consumo pagado de tokens se multiplicó por 25 en un año y se duplicó en el último mes, empujado por modelos de gama media que casi igualan a los de frontera por una fracción del precio.

Tom's Hardware
Muse Spark 1.3 de Meta: el modelo más barato de su clase
IA

Muse Spark 1.3 de Meta: el modelo más barato de su clase

La cuarta versión en cinco meses mejora en tareas de agentes, sigue detrás de Claude Fable 5.1 en casi todas las pruebas y cobra 0,55 dólares por tarea, cerca de la mitad que sus rivales.

The Decoder
Claude Fable 5.1: caché 75% más barato, tarea 20% más cara
IA

Claude Fable 5.1: caché 75% más barato, tarea 20% más cara

Anthropic lanzó Fable 5.1 y Mythos 5.1 como sus modelos tope para programación y trabajo de conocimiento, con el precio por token intacto y un recorte fuerte en la lectura de caché.

Latent Space
Gemini 3.8 Flash llega con una variante para ciberdefensa
IA

Gemini 3.8 Flash llega con una variante para ciberdefensa

Google presenta su tercer modelo Flash en seis semanas y suma Gemini 3.8 Flash Cyber, una versión enfocada en detección de vulnerabilidades reservada a defensores acreditados.

Google DeepMind
GPT-6 Astra: el modelo de OpenAI que opera el computador
IA

GPT-6 Astra: el modelo de OpenAI que opera el computador

OpenAI presenta un modelo con ventana de 1.050.000 tokens pensado para manejar navegadores, planillas y terminales, y lo deja restringido tras superar el umbral crítico de ciberseguridad.

MarkTechPost
Gemini analiza video como agente y gasta 88% menos tokens
IA

Gemini analiza video como agente y gasta 88% menos tokens

Google habilita el modo agéntico en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite: el modelo elige qué tramos del video revisar y a qué resolución, con una baja de 66% en el costo por consulta.

The Decoder
Meta lanza Muse Spark 1.3 y promete abrir los pesos pronto
Electrónica

Meta lanza Muse Spark 1.3 y promete abrir los pesos pronto

La versión nueva gasta menos tokens, pide ayuda al usuario cuando se traba y confirma antes de ejecutar acciones de consecuencia, según la propia empresa.

The Register
NVIDIA libera Switchyard, proxy en Rust para tráfico de LLM
IA

NVIDIA libera Switchyard, proxy en Rust para tráfico de LLM

El proxy traduce en ambos sentidos entre los formatos de OpenAI y Anthropic, así que Claude Code y Codex CLI pueden apuntar al mismo modelo sin tocar el agente.

MarkTechPost
Claude Fable 5.1 dibuja su mejor pelícano por 3,30 dólares
IA

Claude Fable 5.1 dibuja su mejor pelícano por 3,30 dólares

Simon Willison corrió su prueba del pelícano en bicicleta en los cinco niveles de razonamiento del modelo de Anthropic: del más barato al más caro hay 33 veces de diferencia en costo.

Simon Willison
Claude Fable 5.1: hasta 45% más barato en tareas con agentes
IA

Claude Fable 5.1: hasta 45% más barato en tareas con agentes

Anthropic lanzó Fable 5.1 y Mythos 5.1, bajó la lectura de caché de 1 a 0,25 dólares por millón de tokens y duplicó su puntaje en investigación científica con agentes.

The Decoder
Gemini 3.8 Flash llega a 73,7% en DeepSWE, casi como Opus 5
IA

Gemini 3.8 Flash llega a 73,7% en DeepSWE, casi como Opus 5

Google publicó su tercer modelo económico en seis semanas, pero el nuevo Flash razona más y quema cerca de 30% más tokens de salida por tarea.

The Decoder
Meta Muse Voice Transcribe: 3,1% de error en tiempo real
IA

Meta Muse Voice Transcribe: 3,1% de error en tiempo real

Un solo modelo autorregresivo reemplaza a los tres sistemas encadenados que hoy usan las aplicaciones de voz: transcripción, separación de hablantes y detección de fin de turno.

MarkTechPost
OpenAI Astra: el primer modelo con capacidad cíber crítica
IA

OpenAI Astra: el primer modelo con capacidad cíber crítica

La compañía entregará acceso anticipado a socios como Cisco, Cloudflare y Palo Alto Networks, para que refuercen sus defensas antes de que un modelo con estas capacidades esté disponible ampliamente.

Wired
Claude Fable 5.1 y Mythos 5.1: hasta 45% más barato
IA

Claude Fable 5.1 y Mythos 5.1: hasta 45% más barato

Anthropic presentó dos modelos que comparten arquitectura y se diferencian solo en el nivel de resguardos, con una rebaja de precio que se concentra en la lectura de caché.

Anthropic
Claude Code sube el límite un 25% y aun así queda 17% más abajo
IA

Claude Code sube el límite un 25% y aun así queda 17% más abajo

El alza permanente que Anthropic aplicará el 14 de septiembre reemplaza un impulso temporal del 50%, así que en la práctica los usuarios quedan con menos capacidad semanal que hoy.

The Decoder
Qwen3.8 corre en un Mac Studio y erosiona el foso de los LLM
Electrónica

Qwen3.8 corre en un Mac Studio y erosiona el foso de los LLM

Las versiones cuantizadas del modelo abierto de 27.000 millones de parámetros funcionan en equipos de 32 GB de RAM, y hasta en uno de 16 GB con calidad degradada.

Hackaday
GLM-5.3-Flash: 320.000 millones de parámetros con licencia MIT
IA

GLM-5.3-Flash: 320.000 millones de parámetros con licencia MIT

Z.ai liberó su primer modelo nativamente multimodal de la serie GLM-5, con un millón de tokens de contexto y precios diez veces menores que su antecesor.

MarkTechPost
Qwen3.8-Flash-Next rinde 16.000 tokens por segundo en la GB300
IA

Qwen3.8-Flash-Next rinde 16.000 tokens por segundo en la GB300

Alibaba liberó los pesos del modelo como anticipo de la arquitectura Qwen4, y NVIDIA publicó su validación sobre el rack GB300 NVL72 con soporte desde el día cero.

NVIDIA Developer
WikiSkill: Google le da a sus agentes una wiki de errores
IA

WikiSkill: Google le da a sus agentes una wiki de errores

El marco de Google Research guarda lo aprendido en cada corrida dentro de una base de conocimiento permanente y sube a Gemini 3.5 Flash de 49,5% a 68,1% de promedio.

The Decoder
Gemini 3.5 Transcribe: 2,6% de error en más de 85 idiomas
IA

Gemini 3.5 Transcribe: 2,6% de error en más de 85 idiomas

Google separó su nuevo modelo de voz a texto en dos endpoints con capacidades distintas, y esa división es la decisión de arquitectura que hay que planificar antes de escribir la primera línea.

MarkTechPost
Co-Scientist de DeepMind ya maneja equipos de laboratorio
IA

Co-Scientist de DeepMind ya maneja equipos de laboratorio

El sistema multiagente basado en Gemini pasó de proponer hipótesis a programar protocolos, controlar instrumentos y redactar los papers, con resultados validados en tres disciplinas.

The Decoder
Qwen3.8-Flash-Next: 125B con solo 6B activos por token
IA

Qwen3.8-Flash-Next: 125B con solo 6B activos por token

El nuevo modelo multimodal de peso abierto de Alibaba anticipa la arquitectura de Qwen4 y, según el equipo, se entrenó por cerca de un noveno de lo que costó Qwen3.7-Plus.

MarkTechPost
GitHub explica cómo evaluar un LLM antes de producción
Open Source

GitHub explica cómo evaluar un LLM antes de producción

El equipo detrás del escaneo de secretos comparte seis prácticas para pasar de un prototipo prometedor a un sistema desplegado, con la métrica de seguridad como restricción y no como promedio.

GitHub Blog
Gemini 3.5 Transcribe: 85 idiomas y 4% de error en vivo
IA

Gemini 3.5 Transcribe: 85 idiomas y 4% de error en vivo

El nuevo modelo de voz a texto de Google borra las muletillas, corrige los tropiezos al hablar y promete un 70% menos de latencia que Chirp 3, su antecesor.

The Decoder
Qwen3.8-Flash-Next: 16.000 tokens por segundo por GPU
IA

Qwen3.8-Flash-Next: 16.000 tokens por segundo por GPU

NVIDIA publicó la validación del modelo de Alibaba sobre el rack GB300 NVL72 y detalló la arquitectura híbrida que le permite sostener contextos de un millón de tokens sin inflar la caché KV.

NVIDIA Developer
IBM libera Granite 4.2 con pesos abiertos y Apache 2.0
IA

IBM libera Granite 4.2 con pesos abiertos y Apache 2.0

La familia llega en tamaños de 3.000, 8.000 y 30.000 millones de parámetros, con ventana de contexto de hasta 512.000 tokens y modos de razonamiento conmutables.

The Decoder
Qwen3.8-Flash-Next activa solo 6.000 millones de parámetros
IA

Qwen3.8-Flash-Next activa solo 6.000 millones de parámetros

El modelo de Alibaba adelanta la arquitectura de Qwen4 con una capa de n-gramas que vive en la RAM del sistema, y cuesta doce veces menos que el buque insignia de la casa.

The Decoder
Dynamo restaura la inferencia de un LLM en 7,3 segundos
IA

Dynamo restaura la inferencia de un LLM en 7,3 segundos

El motor sombra de NVIDIA mantiene una réplica ya inicializada en la misma GPU y comparte los pesos en memoria, con lo que el reinicio en frío de 283 segundos se vuelve innecesario.

NVIDIA Developer
Faraday reproduce estudios con 27 mil millones de parámetros
IA

Faraday reproduce estudios con 27 mil millones de parámetros

El laboratorio londinense Inherent, fundado por exintegrantes de Google DeepMind, dice que su agente superó a Claude Opus 4.8 y a GPT-5.5 replicando artículos científicos.

TechCrunch AI
Anthropic abre Mythos 5 al escaneo de código empresarial
IA

Anthropic abre Mythos 5 al escaneo de código empresarial

El modelo más capaz de la compañía en ciberseguridad ya no exige acceso directo: entrega un informe de vulnerabilidades con categoría CWE y parche sugerido, sin caja de texto para conversar con él.

MarkTechPost
Seguridad de agentes IA: el control va en el runtime, no en el prompt
IA

Seguridad de agentes IA: el control va en el runtime, no en el prompt

Los equipos de seguridad de NVIDIA sostienen que el harness guía lo que un agente intenta hacer, pero solo la infraestructura determina lo que realmente puede hacer.

NVIDIA Developer
NVIDIA AVO llega al 100% en ARC-AGI-3 con agentes autónomos
IA

NVIDIA AVO llega al 100% en ARC-AGI-3 con agentes autónomos

La arquitectura de NVIDIA resolvió los 183 niveles de la prueba pública con 12% menos acciones que VISTA, y llevó a un modelo que por sí solo rendía 30% hasta el puntaje perfecto.

NVIDIA Developer
Melanie Mitchell: aún no sabemos medir la cognición de la IA
IA

Melanie Mitchell: aún no sabemos medir la cognición de la IA

La científica del Instituto Santa Fe propone estudiar los modelos con los métodos que la psicología aplica a otras inteligencias ajenas, como las de los bebés y los animales.

Quanta Magazine
DPO sobre HH-RLHF: auditar el sesgo antes de entrenar
IA

DPO sobre HH-RLHF: auditar el sesgo antes de entrenar

Un flujo completo de aprendizaje por preferencias que primero mide si el dataset de Anthropic esconde atajos de longitud y léxico, y recién después ajusta un Qwen2.5 de 0,5B con TRL y LoRA.

MarkTechPost
Glean enruta modelos y dice costar 4 veces menos que Claude Code
IA

Glean enruta modelos y dice costar 4 veces menos que Claude Code

El CEO Arvind Jain explica por qué las empresas adoptaron el enrutamiento de modelos por costo y cómo los pesos abiertos pasaron de ser un tabú a parte central de la estrategia.

Latent Space
AMD ya genera con IA el 20% de su código y apunta al 50%
IA

AMD ya genera con IA el 20% de su código y apunta al 50%

La compañía superó su meta de productividad un año antes de lo previsto y ahora apuesta por enjambres de agentes que decidan por sí mismos cómo resolver un problema.

IEEE Spectrum AI

Etiquetas relacionadas

Otros temas que aparecen junto a #llm en nuestra cobertura editorial.