DeepSeek V4 Flash: 304B parámetros a 0,14 dólares por millón
DeepSeek publica V4 Flash, un modelo de 304.000 millones de parámetros que Artificial Analysis sitúa por delante de MiniMax M3 a 0,14 dólares por millón de tokens de entrada.
304.000 millones de parámetros, 167 GB de pesos en Hugging Face y una tarifa de 0,14 dólares por millón de tokens de entrada y 0,27 por millón de salida. Esos son los números de DeepSeek V4 Flash 0731, la última entrega de la familia V4, que Simon Willison recogió en su weblog el 31 de julio.
Lo llamativo no es el tamaño, sino la posición relativa. Artificial Analysis lo sitúa por delante de MiniMax M3, un modelo de 428.000 millones de parámetros, o sea por delante de algo un 40 por ciento mayor. Willison lo resume sin rodeos: puede que sea ahora mismo la mejor relación inteligencia/precio del mercado.
Qué dice el fabricante y qué dice el índice
DeepSeek presenta la versión con “substantially enhanced agentic capabilities”, capacidades de agente sustancialmente mejoradas. La frase sale del propio fabricante y conviene tratarla como lo que es: una descripción comercial, no una medición. La comparación con MiniMax M3 viene de Artificial Analysis y se apoya en su Intelligence Index, un índice compuesto a partir de varios benchmarks.
Un índice compuesto sirve para ordenar una tabla. No sirve para saber si un modelo aguanta un bucle de agente de cuarenta pasos con llamadas a herramientas, reintentos y contexto acumulado. Son cosas distintas y en nuestra experiencia divergen bastante. En el gráfico de Intelligence Index frente a coste por tarea que enlaza Willison, V4 Flash cae en el cuadrante superior izquierdo, el de más capacidad por menos dinero, que es exactamente donde el resto de laboratorios preferiría no tener compañía.
El detalle de los 167 GB
167 GB para 304.000 millones de parámetros salen a algo más de cuatro bits por parámetro, así que los pesos publicados ya llegan cuantizados de forma agresiva. Eso abarata el hardware, pero no lo vuelve doméstico: no cabe en una GPU de consumo y ejecutarlo en local sigue implicando varias tarjetas o un servidor con mucha memoria. Para la mayoría de equipos la vía practicable es la API alojada, y ahí el precio pesa de verdad.
Con esas tarifas, procesar diez millones de tokens de entrada cuesta 1,40 dólares. Un pipeline de clasificación o extracción que mastique documentos a diario deja de ser una línea visible del presupuesto y pasa a ser una nota a pie de página.
Cómo encaja en un stack con Claude
El reparto que mejor nos funciona en proyectos reales es el de siempre: el modelo caro orquesta y decide, el barato hace el volumen. Claude Opus 4.8 o Sonnet 4.6 llevando el flujo desde Claude Code, con subagentes y herramientas expuestas vía MCP, y un modelo barato en el tramo repetitivo (clasificar, extraer campos, hacer un primer pase de resumen). Lo que vuelve viable ese reparto es que la infraestructura no está acoplada al modelo: un servidor MCP expone herramientas y el cliente que las consume se puede cambiar.
En la práctica, la frontera no la decide el benchmark sino la tolerancia al error de cada tramo. Un fallo extrayendo un campo lo caza un validador de esquema en el acto. Un fallo decidiendo qué herramienta llamar se propaga sin que nadie lo vea hasta el final del flujo, y ahí el ahorro por token deja de compensar.
Antes de mover carga hay dos peajes que medir. Uno es operativo: dos proveedores son dos latencias, dos formatos de error y dos prompts que mantener. El otro es de gobierno del dato, sobre todo con clientes europeos, porque conviene saber dónde se procesa lo que envías y qué política de retención aplica. Que los pesos estén publicados abre la puerta a alojarlo uno mismo, que no es gratis pero sí es una respuesta.
Nuestra lectura, con un día de vida del modelo: el dato interesante no es el puesto en el ranking, es la pendiente de la curva de precio. Cuando lo hayamos medido en cargas nuestras y no en un índice, lo contamos con datos.
Fuentes
Seguir leyendo
World Cup AI: qué modelo lidera el ranking de benchmarks de junio 2026
Un proyecto independiente clasifica los principales modelos de IA en un formato de copa del mundo. Te explicamos qué mide, qué limitaciones tiene y por qué importa.
Google mezcla A2UI y MCP para unificar interfaces de agentes
Google publica su propuesta para combinar interfaces declarativas y personalizadas en aplicaciones agénticas usando A2UI junto a MCP, el protocolo de Anthropic.
Mistral AI anuncia una familia de modelos más amplia
Arthur Mensch, CEO de Mistral AI, ha anunciado en Twitter la intención de escalar su catálogo de modelos. Lo que se sabe hasta ahora y qué puede implicar para el ecosistema.