- A versão oficial da API DeepSeek-V4-Flash foi lançada em beta público em 31 de julho de 2026, e pode ser usada apenas definindo o nome do modelo como
deepseek-v4-flashno método de chamada existente - O desempenho em agentes superou amplamente o V4-Pro-Preview, registrando 82,7 pontos no Terminal Bench 2.1, além de 76,7 no Cybergym, 70,3 no Toolathlon verified e 68,7 no DSBench-FullStack
- O benchmark de agentes de código foi medido no futuro modo mínimo do DeepSeek Harness, com max effort,
top_p=0.95etemperature=1.0 - A versão oficial do V4-Flash oferece suporte nativo ao formato Responses API e foi ajustada para o Codex; em relação ao Preview, mantém a mesma estrutura e tamanho do modelo, aplicando apenas treinamento de pós-processamento adicional
- O escopo das mudanças é limitado à API V4-Flash; a API V4-Pro e os modelos APP/WEB permanecem inalterados, e a versão oficial do V4-Pro deve ser lançada em breve
Lançamento do beta público e uso da API
- A versão oficial da API DeepSeek-V4-Flash foi lançada em beta público em 31 de julho de 2026
- O método de chamada existente é mantido; para usar a versão mais recente, basta definir o parâmetro do modelo como
deepseek-v4-flash - A série V4 é oferecida no mesmo
base_urlde antes, por meio das interfaces OpenAI ChatCompletions e Anthropic- O V4-Pro usa
deepseek-v4-pro, e o V4-Flash usadeepseek-v4-flash - Os nomes de modelo anteriores,
deepseek-chatedeepseek-reasoner, estavam previstos para serem descontinuados em 24 de julho de 2026 - Durante o período de transição, esses dois nomes apontavam, respectivamente, para o modo sem raciocínio e o modo com raciocínio do V4-Flash
- O V4-Pro usa
Resultados dos benchmarks de agentes
- A versão oficial do V4-Flash registrou resultados muito acima do V4-Pro-Preview em desempenho de agentes
- Terminal Bench 2.1: 82,7
- NL2Repo: 54,2
- Cybergym: 76,7
- DeepSWE: 54,4
- Toolathlon verified: 70,3
- Agent Last Exam: 25,2
- Automation Bench Public: 25,1
- DSBench-FullStack: 68,7
- DSBench-Hard: 59,6
- As tarefas de agentes de código nos benchmarks públicos foram medidas com o futuro modo mínimo do DeepSeek Harness
- O nível de effort é max, com
top_p=0.95etemperature=1.0
- O nível de effort é max, com
- O DSBench-FullStack é um conjunto interno de testes de desenvolvimento full-stack, e o DSBench-Hard é um conjunto interno de problemas difíceis para agentes de codificação
Responses API e integração com Codex
- A versão oficial do V4-Flash oferece suporte nativo ao formato Responses API e foi ajustada para o Codex
- As configurações necessárias para a integração com o Codex podem ser conferidas na documentação oficial
Escopo das mudanças no modelo
DeepSeek-V4-Flash-0731mantém a mesma estrutura e o mesmo tamanho de modelo do V4-Flash-Preview- Apenas treinamento de pós-processamento adicional foi aplicado, sem mudanças na estrutura do próprio modelo
- A atualização se aplica apenas à API DeepSeek-V4-Flash
- A API DeepSeek-V4-Pro não foi alterada
- Os modelos oferecidos em APP/WEB também permanecem iguais
- A versão oficial do DeepSeek-V4-Pro deve ser lançada em breve
1 comentários
Opiniões no Hacker News
Pessoalmente, estou mais animado com ele do que com o K3. O modelo DSV4 tem custo de serving muito baixo, então, conforme o desempenho melhorar, pode se tornar um modelo “bom o suficiente” para cada vez mais tarefas.
A DeepSeek ofereceu por muito tempo a versão Pro a um preço muito baixo e a integrou com ferramentas como o OpenCode, então é bem provável que tenha reunido muitos dados reais de trabalho de desenvolvimento. Se isso for usado no pós-treinamento, melhorias adicionais também são possíveis.
Também tenho curiosidade para saber quanto melhor o K3 ficaria ao ser destilado para o DSV4. Modelos baratos e rápidos são especialmente benéficos para a comunidade porque não desaparecem ao bel-prazer de um provedor e permitem continuar aproveitando seu desempenho. Pelo menos o Flash pode ser executado em casa com equipamentos de menos de US$ 10 mil, mas modelos grandes como GLM ou K3 são, realisticamente, difíceis.
Estou processando 90% do trabalho com o Flash. Não sei por quê, mas ele é melhor que o Pro, além de ser muito barato e rápido.
Se eu mantiver as mudanças abaixo de 1.000 linhas e tomar eu mesmo as decisões de arquitetura, quase não sinto diferença em relação aos modelos de ponta. Os 10% restantes uso para encontrar bugs/problemas de segurança ou revisar estruturas melhores; o Flash também vai razoavelmente bem nisso, mas faço validação cruzada.
Iterações rápidas são muito melhores do que esperar 5 a 10 minutos por pequenas mudanças. Recentemente, Kimi e GLM ficaram lentos por raciocinarem por tempo desnecessariamente longo. Posso inserir muitos dados, como dependências, logs e dumps de desempenho, sem me preocupar com limites, e em engenharia reversa de binários também não bato em restrições de segurança.
Por outro lado, há casos de prompts sem relação com segurança sendo recusados, então fico curioso se a diferença por plataforma e por usuário é tão grande assim.
Uso principalmente o OpenCode, que gasta menos tokens do que o Claude Code, e também estou aguardando o lançamento do próprio harness de codificação da DeepSeek.
Meu registro dos últimos 30 dias usando DeepSeek para a maior parte das tarefas do meu agente pessoal cotidiano foi de US$ 4,55 de custo, 3.467 chamadas de API e 323.183.886 tokens.
Como engenheiro que lidera uma pequena equipe, tenho um padrão alto de qualidade e aplico o mesmo padrão aos meus projetos pessoais, mas não me decepcionei em nada em tarefas de codificação e revisão. Para outras tarefas, uso outros modelos.
Agora executo quase todas as tarefas dentro do pi com o Flash. Com servidores MCP adequados, ferramentas de redução de contexto e skills, dá para implementar qualquer tarefa.
Algumas sessões passam de 30 turnos, mas é rápido e barato, então mesmo trabalhando por uma hora cerca de US$ 0,50 é suficiente. Ainda assim, em fluxos de trabalho com múltiplos subagentes, uso modelos mais caros para papéis de planejamento, revisão e oráculo.
Já faz semanas que não uso a assinatura lenta do Opus. Também montei um chat OpenWebUI auto-hospedado que funciona no celular e suporta MCP e skills, substituindo completamente o Perplexity; os custos de hospedagem e assinatura ficam em cerca de US$ 18 por mês.
top_petemperatureno pi.Se os benchmarks refletirem corretamente o desempenho em uso real, é um modelo surpreendente. Um modelo de 300B supera o desempenho de 1,8T parâmetros do modelo preview anterior DS4 Pro e parece melhor até que o GPT 5.6 Luna.
Ainda é mais barato do que o Luna depois da redução de preço.
É bastante impressionante que um modelo de 200B concorra com o GLM-5.2 e se aproxime do Opus 4.8.
Se esses números também se traduzirem em desempenho geral, somados ao excelente caching da DeepSeek, o uso deve crescer muito.
Fico curioso por que não puderam chamá-lo de
v4.1-Flashpara diferenciá-lo com mais clareza.Se ele mantiver a velocidade e o preço baixo e ainda assim superar o desempenho do já bastante utilizável deepseek-v4-pro, é muito promissor.
O deepseek-v4-flash já era o modelo com melhor custo-benefício, então a diferença no indicador inteligência/custo deve aumentar ainda mais. Dito isso, o baixo custo da API da DeepSeek também vem ao preço de entregar informações da base de código à China.
Fico me perguntando se faz sentido uma configuração usando Kimi K3 em vez de Opus para tarefas caras, e DSV4 Flash em vez de Sonnet para tarefas gerais.
Tenho curiosidade sobre casos de uso do DSv4 em agentes para além de codificação. Em especial, gostaria de saber como usuários que tratavam classificação, categorização etc. com o GPT-5.4 mini estão aproveitando o DSv4.