CONFIRMADO: o experimento de dois dias virou produto oficial

A DeepSeek confirmou em 10 de setembro de 2026 o lançamento do V4.1 Flash, encerrando a fase de teste limitado que havia colocado um identificador temporário dentro da API. O modelo agora aparece na documentação oficial como o menor integrante da nova família arquitetural da empresa. A mudança central não é só de nome: o Flash passa a ter compreensão visual nativa, em vez de depender do modelo experimental Vision Exp, e foi desenhado para elevar o teto de capacidade, acelerar a inferência e aumentar o throughput à medida que a família crescer.

A arquitetura é a parte mais importante da notícia

A apresentação oficial descreve um MoE de 552 bilhões de parâmetros com uma arquitetura Causal Encoder Decoder. Segundo a DeepSeek, apenas 8 bilhões de parâmetros ficam ativos na entrada e 16 bilhões na saída. A empresa também afirma que o cache KV ocupa um quarto da memória HBM e um oitavo do armazenamento SSD exigidos pela geração anterior. É uma promessa de eficiência estrutural, não apenas um corte comercial de preço, e pode reduzir o custo de agentes que repetem contexto em muitas chamadas.

O que chegou de verdade

A documentação da API lista janela de contexto de 1 milhão de tokens, saída máxima de 384 mil tokens, modos thinking e non-thinking, chamadas de ferramentas, Responses API, compatibilidade com a API da Anthropic e suporte a visão. O nome recomendado para acessar a versão atual é deepseek-flash. Os identificadores antigos deepseek-v4-flash e deepseek-v4-flash-vision-exp ficam temporariamente roteados para o novo modelo, uma decisão importante para quem já tem integração em produção e não quer trocar tudo hoje.

Pesos abertos ampliam a aposta

No mesmo dia, o repositório oficial no Hugging Face passou a distribuir os pesos sob licença MIT, com dezenas de shards safetensors e instruções de inferência. Isso não transforma o modelo em uma instalação simples para qualquer empresa: o tamanho total continua exigindo infraestrutura pesada e suporte de software. Mas cria uma segunda rota além da API, relevante para organizações que precisam de controle de dados, customização ou negociação de custo em escala.

Benchmarks ambiciosos, mas ainda são números da própria DeepSeek

A tabela oficial coloca o V4.1 Flash em 90,9 no GPQA Diamond, 3.471 no Codeforces, 90,6 no Terminal-Bench 2.1 e 74,2 no DeepSWE v1.1. Em tarefas com ferramentas, a empresa reporta 63,9 no HLE, 31,8 no Agents' Last Exam e 89,6 no BabyVision. Isso sugere uma aposta muito mais agressiva em agentes de código e tarefas multimodais do que o Flash anterior. Mas a ressalva é grande: não há, nesta publicação, uma avaliação independente que confirme a vantagem em carga real, custo total ou estabilidade. Benchmark de laboratório é evidência, não veredito de produção.

A conta fica menor e o V4 Pro perde espaço

A página oficial de preços lista o Flash a US$ 0,003 por milhão de tokens de entrada em cache, US$ 0,15 sem cache e US$ 0,60 de saída fora do horário de pico. No pico, os valores dobram. A DeepSeek também diz que, depois de 12h de Pequim em 14 de setembro, todas as chamadas ao deepseek-v4-pro serão encaminhadas ao V4.1 Flash e cobradas pela tarifa do Flash, até o lançamento do V4.1 Pro. Na prática, o fornecedor está transformando o modelo barato no novo caminho padrão para boa parte da demanda.

O que muda para empresas brasileiras

Para uma pequena empresa, o ganho mais interessante é arquitetural. Um único endpoint pode analisar documento e imagem, chamar ferramentas e devolver respostas longas, reduzindo a necessidade de costurar um modelo de texto com um serviço visual separado. Isso serve para catálogo, suporte com anexos, conferência de criativos, leitura de contratos e agentes de código. O preço em dólar ajuda, mas não elimina a conta de câmbio, observabilidade, limites de concorrência e fallback. A migração segura é testar prompts reais antes de aceitar o roteamento automático do Pro, principalmente em tarefas que exigem visão e consistência ao longo de muitas rodadas.

A leitura do MaxAssistant

A história mudou de sinal forte para confirmado, e agora tem duas frentes: API barata e pesos abertos. A DeepSeek fez algo mais relevante que lançar um Flash rápido: colocou multimodalidade, ferramentas, compressão de memória e uma estratégia de substituição do Pro no mesmo pacote. Meu feeling é que a empresa está comprimindo a diferença entre as faixas da própria API para ganhar volume, não apenas perseguindo uma tabela de benchmark. Se os números se sustentarem fora do harness oficial, o V4.1 Flash pode ser uma opção muito competitiva para agentes de alto volume. Se não se sustentarem, o preço baixo será o único diferencial, e preço sozinho não salva uma automação que erra.

Fontes

DeepSeek, anúncio do V4.1 Flash: https://deepseek.com/news/deepseek-v4-1-flash | DeepSeek API Docs, Change Log: https://api-docs.deepseek.com/updates/ | DeepSeek API Docs, Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing | Hugging Face, repositório oficial do modelo: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash | ccleaks, cobertura independente do lançamento e dos pesos abertos: https://ccleaks.com/news/deepseek-v4-1-flash-open-weights-sep-2026 | TechNode, cobertura do beta limitado: https://technode.com/2026/09/09/deepseek-v4-1-flash-multimodal-limited-beta