- A configuração máxima de raciocínio registrou 50 pontos no AAII, ficando em 3º lugar, atrás de Kimi K3 (max) e GLM-5.2 (max)
- É um modelo MoE em que apenas 13 bilhões de parâmetros são ativados por token, de um total de 284 bilhões, com suporte a entrada e saída de texto e contexto de 1 milhão de tokens
- O preço da API é de $0.14 por 1 milhão de tokens de entrada, $0.28 de saída e $0.003 para cache hit; o custo total da avaliação no Intelligence Index foi de $72.02
- Durante a avaliação, usou 210 milhões de tokens de saída, sendo muito mais verboso que a mediana de 100 milhões dos modelos equivalentes; a velocidade de saída ainda não foi divulgada
- Os pesos do modelo são públicos sob licença MIT, permitindo hospedagem própria e uso comercial; atualmente há 1 provedor de API
Estrutura do modelo e forma de disponibilização
- DeepSeek V4 Flash 0731 é um modelo de raciocínio com pesos abertos, lançado em 31 de julho de 2026
- Tem 284 bilhões de parâmetros no total e usa uma arquitetura Mixture of Experts (MoE), na qual 13 bilhões são ativados por token durante a inferência
- Os pesos do modelo podem ser baixados para hospedagem própria
- Está sob licença MIT, permitindo uso comercial
- É uma versão de raciocínio com esforço máximo de inferência (Max Effort), e pode existir uma versão separada sem raciocínio
Avaliação de inteligência
- Registrou 50 pontos no Artificial Analysis Intelligence Index v4.1
- 3º lugar, atrás de Kimi K3 (max) e GLM-5.2 (max). Depois vêm Kimi K3 (low) e MiniMax-M3 em 4º e 5º
- A mediana dos grandes modelos equivalentes com pesos abertos é de 25 pontos
- A Artificial Analysis o classifica como parte do grupo líder em inteligência
- O Intelligence Index v4.1 combina as 9 avaliações abaixo
- GDPval-AA v2: trabalho real em estilo agente
- 𝜏³-Banking: uso de ferramentas em estilo agente
- Terminal-Bench v2.1: coding/uso de terminal em estilo agente
- SciCode: coding
- Humanity's Last Exam: raciocínio/conhecimento
- GPQA Diamond: raciocínio científico
- CritPt: raciocínio em física
- AA-Omniscience: precisão do conhecimento e supressão de alucinações
- AA-LCR: raciocínio em contexto longo
Escopo de benchmarks adicionais
- Também são fornecidos os resultados das avaliações abaixo para comparar casos de uso mais específicos entre modelos
- AA-Briefcase: trabalho de conhecimento em estilo agente
- AutomationBench-AA: automação de tarefas SaaS
- Harvey LAB-AA: trabalho jurídico em estilo agente
- EnterpriseOps-Gym-AA: operações empresariais
- IFBench: seguimento de instruções
- APEX-Agents-AA: tarefas longas de agentes
- ITBench-AA: análise de causa raiz de falhas em Kubernetes
- MMMU-Pro: raciocínio visual
- Como o DeepSeek V4 Flash 0731 não suporta entrada de imagem, é um modelo somente de texto e não multimodal
Avaliação de confiabilidade do conhecimento e alucinações
- O AA-Omniscience Index dá pontos para respostas corretas, penaliza alucinações e não penaliza recusas de resposta
- A pontuação vai de -100 a 100
- 0 ponto significa a mesma quantidade de respostas corretas e incorretas
- Pontuação negativa significa mais respostas incorretas do que corretas
Uso de tokens e características de resposta
- Gerou 210 milhões de tokens de saída em toda a avaliação do Intelligence Index
- A mediana dos modelos equivalentes com pesos abertos é de 100 milhões de tokens
- A Artificial Analysis classifica isso como um nível muito verboso
- O número de tokens de saída por tarefa é calculado aplicando o peso do Intelligence Index ao volume de saída de cada benchmark e dividindo pelo número de tarefas, excluindo execuções repetidas
- A velocidade de saída ainda não foi medida, então o número de tokens gerados por segundo não foi divulgado
Preço da API e custo de avaliação
- Os preços de referência da DeepSeek API são os seguintes
- Entrada: $0.14 por 1 milhão de tokens
- Saída: $0.28 por 1 milhão de tokens
- Cache hit: $0.003 por 1 milhão de tokens
- Misturando cache hit/entrada/saída na proporção 7:2:1, o preço por 1 milhão de tokens é de $0.06
- O custo total da avaliação do Intelligence Index foi de $72.02
- A área de resumo mostra a mediana dos modelos comparados como entrada $0.43/saída $1.20, e a área de FAQ mostra entrada $0.58/saída $2.20
- O custo por tarefa é calculado dividindo os custos de tokens de entrada, cache hit, gravação em cache, raciocínio e resposta final pelo número de tarefas, e depois aplicando o peso do Index de cada benchmark
- Custos de gravação e armazenamento em cache podem ser cobrados separadamente, dependendo do provedor da API
Contexto e escopo de oferta
- A janela de contexto é de 1 milhão de tokens, o equivalente a cerca de 1.500 páginas A4 em Arial 12 pt
- Pode ser usado em fluxos de trabalho de RAG que exigem busca e raciocínio sobre grandes volumes de documentos
- Suporta apenas entrada e saída de texto
- Atualmente há 1 empresa fornecendo a API, e os preços podem variar conforme o provedor
1 comentários
Opiniões no Hacker News
Os pesos do modelo acabaram de ser publicados: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
llama-server, colocando o máximo possível em GPUs de 32 GB, 48 GB ou 96 GB e o restante na DRAM do sistemahttps://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
Novos modelos da DeepSeek são como presentes de Natal. Em modelos de API baratos, a DeepSeek é a melhor, e esse é o melhor caminho até que o preço da VRAM caia o suficiente para viabilizar execução local
Modelos de assinatura que dependem de subsídios dificilmente duram muito; a cobrança por API parece mais próxima de um modelo de negócio sustentável
O endereço antigo dá 404, e a URL correta parece ser esta: https://artificialanalysis.ai/models/deepseek-v4-flash
Adicionei o ponto de dados do DeepSeek V4 Flash 0731 ao gráfico da OpenAI publicado ontem, e ele fica na fronteira de preço/desempenho
https://files.parasmittal.com/openai_aa_luna_dsflash.svg
Original: https://openai.com/index/advancing-the-price-performance-fro...
Dizem que, nas tarefas de agente de código dos benchmarks públicos, foi usado o modo mínimo do DeepSeek Harness, que ainda não foi lançado; fico curioso se também planejam anunciar um harness otimizado para agentes de programação
Usando o DSv4 Flash com reasonix ou pi, dá para programar o dia todo por alguns centavos sem se preocupar com tokens. Por outro lado, usando o mesmo modelo na Fireworks ou OpenRouter com ZDR, o custo continua subindo sem motivo. Parece que estão subsidiando o preço para coletar dados de uso, e estou esperando o dia em que dê para rodar localmente
temperature = 1.0etop_p = 0.95; o harness será lançado posteriormentePara usuários com uma RTX PRO 6000 de 96 GB ou um DGX Spark de 128 GB, o pouco conhecido vllm-moet é um engine muito bom. Ele gera automaticamente planos simétricos de 2 bits para inferência, também cria um cache delta de 4 bits para restaurar precisão e oferece suporte a streaming por SSD de pesos maiores que a RAM
É possível definir quanta VRAM alocar a cada área para equilibrar velocidade e precisão, e foram demonstrados 170 tokens por segundo no DS V4 Flash. Ele usa o modelo original sem precisar de um modelo convertido separadamente
No DGX Spark, é necessário um pequeno contorno para ignorar a diferença entre
sm120esm121, mas ele também roda emsm121, então vale investir algumas horasOferece inteligência no nível de GLM 5.2 e Gemini 3.6 por US$ 0,28 por 1 milhão de tokens de saída, e um modelo Pro atualizado também deve sair em breve
O Q8 sem perdas da Unsloth tem 162 GB, então é um tamanho que, na prática, dá para rodar em casa
Se o DeepSeek V4 Flash supera o V4 Pro, fico curioso se podemos esperar um V4 Pro no nível do Opus 5 nas próximas semanas. Seria ainda melhor se superasse o Opus
https://trysojourn.app
O realmente interessante é que houve um grande ganho de desempenho apenas com fine-tuning adicional, sem mudanças estruturais. Foi resultado de investir mais dados, computação e tempo
Como o DS V4 Flash é relativamente pequeno em comparação com as famílias de modelos concorrentes, parece bem provável que aplicar dados de alta qualidade e um pipeline de treinamento semelhante a outros modelos pequenos gere melhorias parecidas
No preço por tarefa, ele já está à frente do Luna por cerca de 2 vezes: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...
Portanto, é mais justo dizer que o Luna é 2 a 3 vezes mais caro que o DeepSeek Flash, mas tem inferência 2 a 5 vezes mais rápida. O modelo mais barato da OpenAI que supera o DeepSeek é o Luna em inferência máxima, que tem desempenho parecido e custa cerca de 3 vezes mais antes do arredondamento, mas também é quase 3 vezes mais rápido
A Artificial Analysis usar azul-escuro tanto para DeepSeek quanto para OpenAI foi uma escolha de cor muito inadequada, especialmente em um dia como hoje