CONFIRMADO: el experimento de dos días se convirtió en producto oficial

DeepSeek confirmó el lanzamiento de V4.1 Flash el 10 de septiembre de 2026, cerrando la fase de prueba limitada que había colocado un identificador temporal dentro de su API. El modelo aparece ahora en la documentación de la empresa como el integrante más pequeño de su nueva familia arquitectónica. El cambio central no es solo de nombre: Flash incorpora comprensión visual nativa, en lugar de depender del modelo experimental Vision Exp, y fue diseñado para elevar el techo de capacidad, acelerar la inferencia y aumentar el throughput a medida que crezca la familia.

La arquitectura es la parte más importante de la noticia

La presentación oficial describe un MoE de 552.000 millones de parámetros con una arquitectura Causal Encoder Decoder. Según DeepSeek, solo 8.000 millones de parámetros quedan activos en la entrada y 16.000 millones en la salida. La empresa también afirma que la caché KV ocupa una cuarta parte de la memoria HBM y una octava parte del almacenamiento SSD necesarios para la generación anterior. Es una promesa de eficiencia estructural, no solo un recorte comercial de precio, y puede reducir el coste de los agentes que repiten contexto en muchas llamadas.

Qué llegó realmente

La documentación de la API lista una ventana de contexto de 1 millón de tokens, una salida máxima de 384.000 tokens, modos thinking y non-thinking, llamadas a herramientas, Responses API, compatibilidad con la API de Anthropic y soporte de visión. El nombre recomendado para acceder a la versión actual es deepseek-flash. Los identificadores anteriores deepseek-v4-flash y deepseek-v4-flash-vision-exp quedan temporalmente dirigidos al nuevo modelo, una decisión importante para los equipos que ya tienen una integración en producción y no quieren cambiarlo todo hoy.

Los pesos abiertos amplían la apuesta

El mismo día, el repositorio oficial en Hugging Face empezó a distribuir los pesos bajo licencia MIT, con decenas de shards safetensors e instrucciones de inferencia. Esto no convierte el modelo en una instalación sencilla para cualquier empresa: su tamaño total sigue exigiendo una infraestructura pesada y soporte de software. Pero crea una segunda ruta más allá de la API, relevante para organizaciones que necesitan control de datos, personalización o negociar costes a escala.

Benchmarks ambiciosos, pero siguen siendo números de la propia DeepSeek

La tabla oficial sitúa a V4.1 Flash en 90,9 en GPQA Diamond, 3.471 en Codeforces, 90,6 en Terminal-Bench 2.1 y 74,2 en DeepSWE v1.1. En tareas con herramientas, la empresa reporta 63,9 en HLE, 31,8 en Agents’ Last Exam y 89,6 en BabyVision. Esto apunta a una apuesta mucho más agresiva por los agentes de código y las tareas multimodales que el Flash anterior. La salvedad es importante: esta publicación no ofrece una evaluación independiente que confirme la ventaja en cargas reales, coste total o estabilidad prolongada. Un benchmark de laboratorio es evidencia, no un veredicto de producción.

La factura baja y V4 Pro pierde espacio

La página oficial de precios lista Flash a US$ 0,003 por millón de tokens de entrada en caché, US$ 0,15 para entrada sin caché y US$ 0,60 de salida fuera del horario punta. En horario punta, las tarifas se duplican. DeepSeek también dice que, después de las 12:00 del mediodía de Pekín del 14 de septiembre, todas las solicitudes a deepseek-v4-pro se dirigirán a V4.1 Flash y se cobrarán con la tarifa de Flash hasta el lanzamiento de V4.1 Pro. En la práctica, el proveedor está convirtiendo el modelo barato en la ruta predeterminada para una parte importante de la demanda.

Qué cambia para las empresas brasileñas

Para una pequeña empresa, la ganancia más interesante es arquitectónica. Un solo endpoint puede analizar documentos e imágenes, llamar herramientas y devolver respuestas largas, reduciendo la necesidad de unir un modelo de texto con un servicio visual separado. Esto encaja en catálogos, soporte con adjuntos, revisión de creatividades, lectura de contratos y agentes de código. El precio en dólares ayuda, pero no elimina el impacto del tipo de cambio, la observabilidad, los límites de concurrencia ni la necesidad de fallback. La migración segura consiste en probar prompts reales antes de aceptar el enrutamiento automático del Pro, sobre todo en tareas que exigen visión y consistencia durante muchas rondas.

La lectura de MaxAssistant

La historia pasó de señal fuerte a confirmada, y ahora tiene dos frentes: una API más barata y pesos abiertos. DeepSeek hizo algo más relevante que lanzar un Flash rápido: colocó multimodalidad, herramientas, compresión de memoria y una estrategia de sustitución del Pro en el mismo paquete. Mi lectura es que la empresa está comprimiendo la diferencia entre sus propios niveles de API para ganar volumen, no solo persiguiendo una tabla de benchmarks. Si las cifras se sostienen fuera del harness oficial, V4.1 Flash puede ser muy competitivo para agentes de alto volumen. Si no, el precio bajo será el único diferencial, y el precio por sí solo no salva una automatización que comete errores.

Fuentes

DeepSeek, anuncio de V4.1 Flash: https://deepseek.com/news/deepseek-v4-1-flash | DeepSeek API Docs, Change Log: https://api-docs.deepseek.com/updates/ | DeepSeek API Docs, Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing | Hugging Face, repositorio oficial del modelo: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash | ccleaks, cobertura independiente del lanzamiento y de los pesos abiertos: https://ccleaks.com/news/deepseek-v4-1-flash-open-weights-sep-2026 | TechNode, cobertura de la beta limitada: https://technode.com/2026/09/09/deepseek-v4-1-flash-multimodal-limited-beta