DeepSeek V4.1 Flash es el nuevo modelo abierto de la empresa china DeepSeek: 552.000 millones de parámetros, un millón de tokens de contexto, comprensión de imágenes y licencia MIT, que permite usarlo, modificarlo y venderlo sin pagar nada. Y en su API cuesta una fracción de lo que piden OpenAI, Google o Anthropic. Ha sustituido al anterior V4 Flash y, según las pruebas de la propia DeepSeek, se acerca a los mejores modelos cerrados en programación y agentes. Pero hay matices: las pruebas independientes lo sitúan un escalón por debajo, y ejecutarlo en tu propio ordenador es mucho más difícil de lo que su nombre sugiere. Te explicamos qué es, qué tal funciona, cuánto cuesta y qué hardware necesitarías para usarlo en local.
En resumen: DeepSeek V4.1 Flash salió el 10 de septiembre de 2026 con pesos abiertos bajo licencia MIT. Es un modelo de mezcla de expertos con 552.000 millones de parámetros, de los que solo activa unos 16.000 millones al generar, un millón de tokens de contexto y entrada de imágenes. Su API cuesta 0,30 dólares por millón de tokens de entrada y 1,20 de salida (la mitad fuera de horas punta). En el índice independiente de Artificial Analysis saca 39 puntos, por debajo de los modelos cerrados punteros, pero es de los más rápidos. Ejecutarlo en local exige unos 300 GB de memoria incluso comprimido: no es un modelo para un PC doméstico.
Qué es DeepSeek V4.1 Flash
DeepSeek es la empresa china que sacudió el sector a principios de 2025 con modelos abiertos casi tan buenos como los de las grandes tecnológicas por una fracción del coste. Ya hablamos de su generación anterior en nuestro artículo sobre DeepSeek V4.
V4.1 Flash es el primer modelo de una nueva arquitectura, la familia V4.1, y el más pequeño de ella: DeepSeek ha adelantado que llegarán más variantes. Se anunció el 10 de septiembre con los pesos publicados en Hugging Face bajo licencia MIT, que permite el uso comercial, la redistribución y el ajuste fino sin límites de ingresos. Ha sustituido al anterior V4 Flash: desde el 14 de septiembre, las peticiones a los nombres antiguos de la API se redirigen al nuevo modelo.
Sus puntos fuertes son tres: precio muy bajo, contexto enorme y velocidad. Además, entiende imágenes de forma nativa, sin un módulo aparte.
Una arquitectura diferente
La parte técnica es lo más novedoso. V4.1 Flash es un modelo de mezcla de expertos (MoE): tiene muchos parámetros, pero en cada paso solo usa una pequeña parte, lo que lo hace rápido y barato de servir. Lo particular es que DeepSeek ha separado el modelo en dos mitades asimétricas, una arquitectura que llama codificador-decodificador causal:
- Un codificador de 20 capas que lee tu petición activando unos 8.000 millones de parámetros.
- Un decodificador de 20 capas que genera la respuesta activando unos 16.000 millones.
- Sobre una base total de 552.000 millones de parámetros, con 196.000 millones dedicados a un sistema de memoria condicional.
La consecuencia práctica más importante está en la memoria que ocupa el contexto: la caché de cada token pesa unos 890 bytes, aproximadamente la cuarta parte que en V4 Flash. Eso es lo que permite trabajar con un millón de tokens de contexto sin que el coste se dispare. A través de la API, la respuesta puede llegar hasta 384.000 tokens.
Benchmarks según DeepSeek
Estas son las cifras que ha publicado DeepSeek. Como siempre con los datos del fabricante, conviene contrastarlas con pruebas independientes:
| Prueba | Qué mide | V4.1 Flash | V4 Flash |
|---|---|---|---|
| Terminal-Bench 2.1 | Tareas de agente en terminal | 90,6 | 82,7 |
| DeepSWE v1.1 | Programación en proyectos reales | 74,2 | 54,4 |
| AutomationBench | Procesos de empresa de principio a fin | 54,8 | 37,7 |
| Codeforces | Programación competitiva (Elo) | 3.471 | 3.289 |
| GPQA Diamond | Preguntas científicas de nivel doctoral | 90,9 | — |
| Humanity's Last Exam | Preguntas de máxima dificultad | 36,8 | — |
| DocVQA | Entender documentos en imagen | 95,6 | — |
V4.1 Flash frente a V4 Flash
Resultados publicados por DeepSeek, en porcentaje. Más es mejor.
- V4.1 Flash
- V4 Flash
Ver los datos en tabla
| Dato | V4.1 Flash | V4 Flash |
|---|---|---|
| Terminal-Bench 2.1 | 90,6 % | 82,7 % |
| DeepSWE v1.1 | 74,2 % | 54,4 % |
| AutomationBench | 54,8 % | 37,7 % |
El salto respecto a V4 Flash es enorme en programación y agentes: en DeepSWE pasa del 54,4 al 74,2, una cifra cercana al 77,9 que Google atribuye a Gemini 4 Argon. En AutomationBench incluso lo supera sobre el papel (54,8 frente a 51,3). Hay un dato menos brillante que la propia DeepSeek publica: en Terminal-Bench 3.0, la versión más difícil de esa prueba, se queda en un 30,0. Es decir, sufre en las tareas de agente más complejas.
Lo que dicen las pruebas independientes
Artificial Analysis, uno de los evaluadores independientes más seguidos, le da 39 puntos en su índice de inteligencia. Muy por encima de la media de modelos comparables, pero claramente por debajo de los mejores modelos cerrados:
Índice de inteligencia de Artificial Analysis
Puntuación combinada de agentes, programación, conocimiento y ciencia. Más es mejor.
Ver los datos en tabla
| Dato | Índice |
|---|---|
| Claude Sonnet 5.5 | 56 |
| Gemini 4 Argon | 53 |
| GPT-6.1 Sol | 52 |
| DeepSeek V4.1 Flash | 39 |
Donde sí destaca es en velocidad: genera unos 227 tokens por segundo, de los más rápidos que mide Artificial Analysis, y empieza a responder en aproximadamente un segundo. También es muy barato por tarea, unos 0,27 dólares de media en su batería de pruebas, aunque es muy «hablador»: generó unos 250 millones de tokens para completar el índice, casi el doble que la mediana.
¿Cómo se explica la distancia entre las cifras de DeepSeek y las independientes? Las pruebas propias se centran en programación y agentes, justo donde el modelo es fuerte, mientras que índices como el de Artificial Analysis combinan también conocimiento general y razonamiento científico. La lectura razonable: es un modelo excelente para su precio, sobre todo en programación, pero no está al nivel de los modelos punteros de Anthropic, Google u OpenAI en todo.
Precio de la API
Aquí está su gran argumento. DeepSeek cobra distinto según la hora:
| Tipo de token | Hora punta | Fuera de hora punta |
|---|---|---|
| Entrada | 0,30 $ por millón | 0,15 $ por millón |
| Salida | 1,20 $ por millón | 0,60 $ por millón |
| Entrada en caché | 0,006 $ por millón | 0,003 $ por millón |
La hora punta es de lunes a viernes de 01:00 a 04:00 y de 06:00 a 10:00 UTC, que en España, con el horario de verano, son de 03:00 a 06:00 y de 08:00 a 12:00. Si puedes programar trabajos fuera de esas horas, pagas la mitad.
Precio por millón de tokens de salida
Dólares por millón de tokens generados. Menos es mejor.
Ver los datos en tabla
| Dato | Salida |
|---|---|
| GPT-6 Astra | 50,00 $ |
| Claude Sonnet 5.5 | 10,00 $ |
| GPT-6.1 Sol | 10,00 $ |
| Gemini 4 Argon (lanzamiento) | 10,00 $ |
| DeepSeek V4.1 Flash (hora punta) | 1,20 $ |
| DeepSeek V4.1 Flash (fuera de punta) | 0,60 $ |
Para ponerlo en perspectiva: Claude Sonnet 5.5 y GPT-6.1 Sol cuestan 2 dólares por millón de tokens de entrada y 10 de salida, y GPT-6 Astra, 10 y 50. Incluso en hora punta, DeepSeek V4.1 Flash es unas ocho veces más barato que los primeros en salida y más de 40 veces más barato que Astra.
Frente a Gemini, Claude y GPT
- En calidad general, los modelos cerrados punteros siguen por delante: Claude Sonnet 5.5 (56 en Artificial Analysis), Gemini 4 Argon (53) y GPT-6.1 Sol (52), frente a los 39 de V4.1 Flash.
- En precio y velocidad, V4.1 Flash no tiene rival entre los modelos de su capacidad.
- En libertad, es el único de la lista con pesos abiertos y licencia MIT: puedes descargarlo, modificarlo y alojarlo donde quieras.
Si quieres la comparación detallada entre los modelos cerrados, la tienes en Claude Sonnet 5.5 o GPT-6.1 Sol, y el panorama de modelos abiertos en nuestra guía de los mejores modelos de IA de código abierto.
Cómo usarlo
- API de DeepSeek: con el identificador de modelo
deepseek-flash. Es compatible con el formato de la API de OpenAI, así que la mayoría de herramientas funcionan cambiando la dirección y la clave. - Proveedores externos: plataformas como SiliconFlow lo sirven desde sus propios servidores, una opción si prefieres no enviar los datos a DeepSeek directamente.
- Pesos abiertos: se pueden descargar de Hugging Face para alojarlo uno mismo, con el hardware adecuado.
Si migras desde V4 Flash, DeepSeek recomienda fijar el identificador del modelo, volver a probar tus instrucciones y llamadas a herramientas, poner límites de gasto y validar el manejo de imágenes antes de pasarlo a producción.
¿Se puede ejecutar en local?
Técnicamente sí, porque los pesos son abiertos. En la práctica, no en un ordenador normal. El problema no es la potencia, sino la memoria: aunque solo active 16.000 millones de parámetros por token, hay que tener cargados en memoria los 552.000 millones. Haciendo la cuenta:
| Precisión | Memoria aproximada solo para los pesos |
|---|---|
| 8 bits (FP8) | Unos 550 GB |
| 4 bits (cuantizado) | Unos 280 GB |
| Más contexto y sistema | Suma decenas de GB más |
Es una estimación nuestra a partir del número de parámetros: cada parámetro ocupa un byte a 8 bits y medio byte a 4 bits. En la realidad, con la caché del contexto y el sistema, para usarlo con cuantización de 4 bits necesitas en torno a 300 GB de memoria. Una RTX 5090 tiene 32 GB.
La buena noticia de las mezclas de expertos es que, como cada token solo usa una parte pequeña del modelo, pueden funcionar a una velocidad aceptable cargadas en memoria RAM normal o en memoria unificada, sin necesidad de que todo quepa en la gráfica. Por eso los equipos que lo ejecutan en casa suelen ser servidores con mucha RAM o máquinas con mucha memoria unificada, no PC gaming.
Qué hardware necesitarías
Siendo realistas, estas son las opciones según lo que quieras hacer:
Para V4.1 Flash completo: un servidor o estación de trabajo con 384 GB o más de memoria RAM, o un equipo con mucha memoria unificada. También se pueden unir varios equipos de IA de escritorio, aunque dos NVIDIA DGX Spark suman 256 GB, todavía por debajo de lo necesario a 4 bits. El NVIDIA DGX Spark, del que hicimos un análisis completo, y su equivalente de ASUS son la referencia del sector para IA de escritorio con 128 GB:
Ver el NVIDIA DGX Spark con 128 GB en Amazon
Ver el ASUS Ascent GX10 con NVIDIA GB10 y 128 GB en Amazon
Para modelos abiertos más pequeños, que es lo que la mayoría usará en local con herramientas como Ollama, lo que importa es la memoria de la gráfica o la unificada. Un mini PC con el Ryzen AI Max+ 395 y 128 GB de memoria compartida es la forma más económica de mover modelos medianos y grandes:
Ver el MINISFORUM MS-S1 MAX con Ryzen AI Max+ 395 y 128 GB en Amazon
Si tienes un PC de sobremesa, la RTX 5090 con 32 GB es la gráfica de consumo más capaz para IA local:
Ver la ASUS TUF Gaming GeForce RTX 5090 de 32 GB en Amazon
Y ampliar la RAM del PC permite cargar en memoria las partes del modelo que no caben en la gráfica:
Ver el kit Kingston FURY Beast DDR5 de 128 GB (2 x 64 GB) en Amazon
Los pesos de estos modelos ocupan cientos de GB, así que un SSD grande y rápido no es un capricho:
Ver el WD_BLACK SN850X de 4 TB con disipador en Amazon
Para empezar con modelos ligeros de forma silenciosa y eficiente, un Mac mini con memoria unificada también es una opción muy razonable:
Ver el Mac mini con chip M4 y 24 GB en Amazon
Tienes más opciones en nuestras guías de las mejores GPU para IA local y de IA local con Ollama.
Casos de uso donde brilla
Con sus puntos fuertes y débiles claros, estos son los usos donde V4.1 Flash tiene más sentido:
- Asistentes de programación con mucho volumen: autocompletado, revisión de código o generación de pruebas, tareas en las que se hacen muchísimas peticiones y el precio por token decide la factura.
- Análisis de documentos largos: contratos, manuales, actas o bases de código completas dentro del millón de tokens de contexto, con la caché abaratando las consultas repetidas sobre el mismo material.
- Documentos escaneados e imágenes: su 95,6 en DocVQA indica que lee bien facturas, formularios o capturas, sin necesidad de un modelo de visión aparte.
- Procesos por lotes: clasificar, resumir o extraer datos de miles de textos durante la noche, aprovechando la tarifa fuera de hora punta.
- Prototipos y startups: permite probar ideas con un coste mínimo y, gracias a la licencia MIT, llevar el modelo a servidores propios si el proyecto crece.
Donde no lo elegiríamos es en agentes que trabajan solos durante horas en tareas complejas, justo donde su resultado en Terminal-Bench 3.0 muestra sus límites, ni en tareas donde un error sale caro. Ahí, los modelos punteros justifican lo que cuestan.
Privacidad y precauciones
Si usas la API oficial o la aplicación de DeepSeek, tus datos se procesan en los servidores de la empresa, que según su política de privacidad están en China. Para datos personales, de clientes o confidenciales, conviene usar un proveedor externo con servidores en Europa o, si tienes el hardware, alojarlo tú mismo: precisamente para eso sirve que los pesos sean abiertos.
También conviene tener presente que, como todos los modelos, puede equivocarse con seguridad, y que su tendencia a escribir mucho puede encarecer las tareas largas aunque el precio por token sea bajo. Pon límites de gasto en la API.
Para quién tiene sentido
- Desarrolladores y empresas con mucho volumen: para tareas de programación, análisis de documentos largos o agentes sencillos, la relación entre calidad y precio es difícil de batir.
- Quien necesita contexto largo barato: un millón de tokens a este precio permite meter bases de código o libros enteros en una sola petición.
- Quien quiere independencia: la licencia MIT permite alojarlo y adaptarlo sin depender de nadie.
- No es para quien busca el mejor modelo posible para tareas muy complejas, ni para ejecutarlo en un PC doméstico.
Preguntas frecuentes
¿Qué es DeepSeek V4.1 Flash?
Es un modelo de IA abierto de DeepSeek con 552.000 millones de parámetros en mezcla de expertos, un millón de tokens de contexto y entrada de imágenes, publicado el 10 de septiembre de 2026 con licencia MIT.
¿Cuánto cuesta la API de DeepSeek V4.1 Flash?
0,30 dólares por millón de tokens de entrada y 1,20 de salida en hora punta, y la mitad fuera de ella. La entrada en caché cuesta 0,006 dólares por millón.
¿Es mejor que GPT o Claude?
No en calidad general: en Artificial Analysis saca 39 puntos, frente a 52-56 de los modelos punteros. Sí es mucho más barato y rápido, y destaca en programación.
¿Puedo ejecutar DeepSeek V4.1 Flash en mi PC?
En un PC normal, no. Incluso cuantizado a 4 bits necesita unos 300 GB de memoria. Hace falta un servidor con mucha RAM o equipos con mucha memoria unificada.
¿Es de código abierto?
Los pesos son abiertos y tienen licencia MIT, que permite uso comercial, modificación y redistribución sin límites de ingresos.
¿Qué pasa con V4 Flash?
Ha sido sustituido. Desde el 14 de septiembre, las peticiones a sus nombres en la API se redirigen a V4.1 Flash.
¿Cuál es la hora punta de la API en España?
De lunes a viernes, de 03:00 a 06:00 y de 08:00 a 12:00 en horario de verano. Fuera de esas horas el precio es la mitad.
¿Es seguro usar DeepSeek?
Con la API oficial, los datos se procesan en servidores de la empresa en China. Para información sensible, mejor un proveedor europeo o alojarlo en tus propios equipos.
Lecturas relacionadas
- Gemini 4 Argon: novedades, precio y benchmarks
- DeepSeek V4: el modelo chino de un billón de parámetros
- Las mejores GPU para IA local
- Guía de IA local con Ollama
Este artículo contiene enlaces afiliados a Amazon con el tag arkaiacorp-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.
Comentarios
Inicia sesion para dejar un comentario
Acceder