31 de julio de 2026 - Blog Link

El nuevo modelo deepseek-ai/DeepSeek-V4-Flash-0731 (vía) representa la última actualización en la familia V4 de DeepSeek, destacando por sus capacidades agenticas sustancialmente mejoradas. El modelo cuenta con 304 mil millones de parámetros (ocupando 167 GB en Hugging Face), pero logra un rendimiento que supera ampliamente a modelos de mayor escala.

Artificial Analysis lo posiciona por delante del modelo MiniMax M3, el cual posee 428 mil millones de parámetros. Su estructura de precios, establecida en USD 0.14 por millón de tokens de entrada y USD 0.27 por millón de salida, lo convierte probablemente en el modelo con mejor relación valor-inteligencia disponible actualmente. Su desempeño es notable en el gráfico de Índice de Inteligencia vs. Costo por Tarea.

El gráfico anterior demuestra cómo el modelo se sitúa en el cuadrante de alta eficiencia, siendo una opción atractiva para desarrolladores que buscan optimizar sus costos operativos sin sacrificar la capacidad de razonamiento lógico en tareas complejas.

Al realizar pruebas iniciales, el modelo generó un resultado deficiente con un pelícano utilizando el nivel de razonamiento predeterminado a través de OpenRouter:

Ilustración vectorial plana de un pelícano blanco con pico naranja sobre una bicicleta destrozada en una carretera gris con marcas viales blancas
Ilustración vectorial plana de un pelícano blanco con pico naranja sobre una bicicleta destrozada en una carretera gris con marcas viales blancas

No obstante, al ajustar el nivel de razonamiento a "high" (alto), el modelo entregó un resultado considerablemente más preciso y coherente según la instrucción dada:

llm -m openrouter/deepseek/deepseek-v4-flash-0731 -t pelican -o reasoning_effort high

Ilustración vectorial plana de un pelícano blanco montando una bicicleta hacia la derecha sobre un fondo rosa con un círculo más claro detrás
Ilustración vectorial plana de un pelícano blanco montando una bicicleta hacia la derecha sobre un fondo rosa con un círculo más claro detrás

Este comportamiento subraya la importancia de configurar correctamente los parámetros de razonamiento (reasoning_effort) al integrar este modelo en pipelines de producción, permitiendo ajustar la latencia versus la calidad del output generado. Vía Simon Willison.