1 pontos por GN⁺ 1 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • A configuração máxima de raciocínio registrou 50 pontos no AAII, ficando em 3º lugar, atrás de Kimi K3 (max) e GLM-5.2 (max)
  • É um modelo MoE em que apenas 13 bilhões de parâmetros são ativados por token, de um total de 284 bilhões, com suporte a entrada e saída de texto e contexto de 1 milhão de tokens
  • O preço da API é de $0.14 por 1 milhão de tokens de entrada, $0.28 de saída e $0.003 para cache hit; o custo total da avaliação no Intelligence Index foi de $72.02
  • Durante a avaliação, usou 210 milhões de tokens de saída, sendo muito mais verboso que a mediana de 100 milhões dos modelos equivalentes; a velocidade de saída ainda não foi divulgada
  • Os pesos do modelo são públicos sob licença MIT, permitindo hospedagem própria e uso comercial; atualmente há 1 provedor de API

Estrutura do modelo e forma de disponibilização

  • DeepSeek V4 Flash 0731 é um modelo de raciocínio com pesos abertos, lançado em 31 de julho de 2026
  • Tem 284 bilhões de parâmetros no total e usa uma arquitetura Mixture of Experts (MoE), na qual 13 bilhões são ativados por token durante a inferência
  • Os pesos do modelo podem ser baixados para hospedagem própria
  • Está sob licença MIT, permitindo uso comercial
  • É uma versão de raciocínio com esforço máximo de inferência (Max Effort), e pode existir uma versão separada sem raciocínio

Avaliação de inteligência

  • Registrou 50 pontos no Artificial Analysis Intelligence Index v4.1
    • 3º lugar, atrás de Kimi K3 (max) e GLM-5.2 (max). Depois vêm Kimi K3 (low) e MiniMax-M3 em 4º e 5º
    • A mediana dos grandes modelos equivalentes com pesos abertos é de 25 pontos
    • A Artificial Analysis o classifica como parte do grupo líder em inteligência
  • O Intelligence Index v4.1 combina as 9 avaliações abaixo
    • GDPval-AA v2: trabalho real em estilo agente
    • 𝜏³-Banking: uso de ferramentas em estilo agente
    • Terminal-Bench v2.1: coding/uso de terminal em estilo agente
    • SciCode: coding
    • Humanity's Last Exam: raciocínio/conhecimento
    • GPQA Diamond: raciocínio científico
    • CritPt: raciocínio em física
    • AA-Omniscience: precisão do conhecimento e supressão de alucinações
    • AA-LCR: raciocínio em contexto longo

Escopo de benchmarks adicionais

  • Também são fornecidos os resultados das avaliações abaixo para comparar casos de uso mais específicos entre modelos
    • AA-Briefcase: trabalho de conhecimento em estilo agente
    • AutomationBench-AA: automação de tarefas SaaS
    • Harvey LAB-AA: trabalho jurídico em estilo agente
    • EnterpriseOps-Gym-AA: operações empresariais
    • IFBench: seguimento de instruções
    • APEX-Agents-AA: tarefas longas de agentes
    • ITBench-AA: análise de causa raiz de falhas em Kubernetes
    • MMMU-Pro: raciocínio visual
  • Como o DeepSeek V4 Flash 0731 não suporta entrada de imagem, é um modelo somente de texto e não multimodal

Avaliação de confiabilidade do conhecimento e alucinações

  • O AA-Omniscience Index dá pontos para respostas corretas, penaliza alucinações e não penaliza recusas de resposta
  • A pontuação vai de -100 a 100
    • 0 ponto significa a mesma quantidade de respostas corretas e incorretas
    • Pontuação negativa significa mais respostas incorretas do que corretas

Uso de tokens e características de resposta

  • Gerou 210 milhões de tokens de saída em toda a avaliação do Intelligence Index
    • A mediana dos modelos equivalentes com pesos abertos é de 100 milhões de tokens
    • A Artificial Analysis classifica isso como um nível muito verboso
  • O número de tokens de saída por tarefa é calculado aplicando o peso do Intelligence Index ao volume de saída de cada benchmark e dividindo pelo número de tarefas, excluindo execuções repetidas
  • A velocidade de saída ainda não foi medida, então o número de tokens gerados por segundo não foi divulgado

Preço da API e custo de avaliação

  • Os preços de referência da DeepSeek API são os seguintes
    • Entrada: $0.14 por 1 milhão de tokens
    • Saída: $0.28 por 1 milhão de tokens
    • Cache hit: $0.003 por 1 milhão de tokens
  • Misturando cache hit/entrada/saída na proporção 7:2:1, o preço por 1 milhão de tokens é de $0.06
  • O custo total da avaliação do Intelligence Index foi de $72.02
  • A área de resumo mostra a mediana dos modelos comparados como entrada $0.43/saída $1.20, e a área de FAQ mostra entrada $0.58/saída $2.20
  • O custo por tarefa é calculado dividindo os custos de tokens de entrada, cache hit, gravação em cache, raciocínio e resposta final pelo número de tarefas, e depois aplicando o peso do Index de cada benchmark
  • Custos de gravação e armazenamento em cache podem ser cobrados separadamente, dependendo do provedor da API

Contexto e escopo de oferta

  • A janela de contexto é de 1 milhão de tokens, o equivalente a cerca de 1.500 páginas A4 em Arial 12 pt
  • Pode ser usado em fluxos de trabalho de RAG que exigem busca e raciocínio sobre grandes volumes de documentos
  • Suporta apenas entrada e saída de texto
  • Atualmente há 1 empresa fornecendo a API, e os preços podem variar conforme o provedor

1 comentários

 
GN⁺ 1 시간 전
Opiniões no Hacker News
  • Os pesos do modelo acabaram de ser publicados: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • Estou ansioso pela versão quantizada do DwarfStar. Usei o preview do DeepSeek V4 Flash por alguns meses como meu principal agente de programação em um MacBook Pro de 128 GB e ele parece superar o GLM 5.2 em quase todos os indicadores
    • Ele mira aceleradores de hardware com uma primitiva de multiplicação de matrizes 128×128; fico curioso se isso se refere ao Warp Group Matrix Multiply Accumulate do H100
    • Se for um Unsloth GGUF com menos de 165 GB, deve rodar na maioria dos sistemas apenas com CPU que tenham 256 GB de RAM. Também é possível fazer uma configuração híbrida com llama-server, colocando o máximo possível em GPUs de 32 GB, 48 GB ou 96 GB e o restante na DRAM do sistema
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • Novos modelos da DeepSeek são como presentes de Natal. Em modelos de API baratos, a DeepSeek é a melhor, e esse é o melhor caminho até que o preço da VRAM caia o suficiente para viabilizar execução local
    Modelos de assinatura que dependem de subsídios dificilmente duram muito; a cobrança por API parece mais próxima de um modelo de negócio sustentável

    • Uso DeepSeek em um projeto, e é impressionante poder usar dezenas de milhões de tokens por alguns centavos. Não serve para todas as tarefas, mas executa certas tarefas muito bem por um custo praticamente gratuito
    • Estou ansioso pelo dia em que a China alcançar os EUA em memória e hardware de computação e superar as empresas americanas tanto em preço quanto em desempenho
    • Meus colegas desenvolvedores reclamam que esgotam os tokens do Claude em uma hora, mas eu uso o DS Flash o dia todo. Se às vezes ele errar, aí eu pego um modelo como Claude apenas para as tarefas difíceis
    • Mesmo por token, a API da DeepSeek provavelmente é mais econômica do que assinaturas. Testando diretamente, vi que o Flash melhorou muito em seguir instruções e ficou mais proativo; hoje há poucos modelos comparáveis em custo-benefício
    • Olhando os preços diretamente, para obter resultados como os do GPT 5.6 Luna são necessários 5 vezes mais tokens, e o número de tokens por segundo também é muito menor. Ainda assim, é claro que a pressão da DeepSeek força os incumbentes a continuar otimizando
  • O endereço antigo dá 404, e a URL correta parece ser esta: https://artificialanalysis.ai/models/deepseek-v4-flash

  • Adicionei o ponto de dados do DeepSeek V4 Flash 0731 ao gráfico da OpenAI publicado ontem, e ele fica na fronteira de preço/desempenho
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    Original: https://openai.com/index/advancing-the-price-performance-fro...

  • Dizem que, nas tarefas de agente de código dos benchmarks públicos, foi usado o modo mínimo do DeepSeek Harness, que ainda não foi lançado; fico curioso se também planejam anunciar um harness otimizado para agentes de programação
    Usando o DSv4 Flash com reasonix ou pi, dá para programar o dia todo por alguns centavos sem se preocupar com tokens. Por outro lado, usando o mesmo modelo na Fireworks ou OpenRouter com ZDR, o custo continua subindo sem motivo. Parece que estão subsidiando o preço para coletar dados de uso, e estou esperando o dia em que dê para rodar localmente

    • Se não for via OpenRouter, fico curioso para saber de qual provedor você compra. Eu entendia que, se o provedor está listado no OpenRouter, o preço é o mesmo comprando diretamente
    • O relatório técnico já havia antecipado o DeepSeek Harness. As tarefas de agente de código foram avaliadas em modo mínimo, com esforço máximo de inferência, temperature = 1.0 e top_p = 0.95; o harness será lançado posteriormente
  • Para usuários com uma RTX PRO 6000 de 96 GB ou um DGX Spark de 128 GB, o pouco conhecido vllm-moet é um engine muito bom. Ele gera automaticamente planos simétricos de 2 bits para inferência, também cria um cache delta de 4 bits para restaurar precisão e oferece suporte a streaming por SSD de pesos maiores que a RAM
    É possível definir quanta VRAM alocar a cada área para equilibrar velocidade e precisão, e foram demonstrados 170 tokens por segundo no DS V4 Flash. Ele usa o modelo original sem precisar de um modelo convertido separadamente
    No DGX Spark, é necessário um pequeno contorno para ignorar a diferença entre sm120 e sm121, mas ele também roda em sm121, então vale investir algumas horas

  • Oferece inteligência no nível de GLM 5.2 e Gemini 3.6 por US$ 0,28 por 1 milhão de tokens de saída, e um modelo Pro atualizado também deve sair em breve
    O Q8 sem perdas da Unsloth tem 162 GB, então é um tamanho que, na prática, dá para rodar em casa

    • Queria ver que tipo de casa é essa onde dá para rodar algo assim
    • O tamanho do Q8 é cerca de 151 GB
  • Se o DeepSeek V4 Flash supera o V4 Pro, fico curioso se podemos esperar um V4 Pro no nível do Opus 5 nas próximas semanas. Seria ainda melhor se superasse o Opus

    • Estou usando o V4 Flash em um app que estou criando, e depois de usar só GPT, Opus e Sonnet, o custo-benefício e o desempenho são surpreendentes. Como o custo é muito baixo, dá até para oferecer um nível gratuito generoso em apps que não têm lucro como objetivo
      https://trysojourn.app
    • Desempenho do Opus 5 pelo preço do V4 Pro seria bom demais para acreditar, mas provavelmente é mais sonho do que realidade
    • Já foi dito que a versão final atualizada do V4 Pro será lançada em breve
  • O realmente interessante é que houve um grande ganho de desempenho apenas com fine-tuning adicional, sem mudanças estruturais. Foi resultado de investir mais dados, computação e tempo
    Como o DS V4 Flash é relativamente pequeno em comparação com as famílias de modelos concorrentes, parece bem provável que aplicar dados de alta qualidade e um pipeline de treinamento semelhante a outros modelos pequenos gere melhorias parecidas

  • No preço por tarefa, ele já está à frente do Luna por cerca de 2 vezes: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • Também gostaria de ver como ele se compara ao Luna por tipos específicos de tarefa
    • Como o custo é o eixo X, mais precisamente o DeepSeek V4 Flash 0731 em inferência máxima custa cerca de US$ 0,03 por tarefa e tem índice 50. O OpenAI Luna em alta inferência custa US$ 0,03 e tem índice 46; em inferência ultra-alta custa US$ 0,04 e tem índice 49; em inferência máxima custa US$ 0,07 e tem índice 51
      Portanto, é mais justo dizer que o Luna é 2 a 3 vezes mais caro que o DeepSeek Flash, mas tem inferência 2 a 5 vezes mais rápida. O modelo mais barato da OpenAI que supera o DeepSeek é o Luna em inferência máxima, que tem desempenho parecido e custa cerca de 3 vezes mais antes do arredondamento, mas também é quase 3 vezes mais rápido
      A Artificial Analysis usar azul-escuro tanto para DeepSeek quanto para OpenAI foi uma escolha de cor muito inadequada, especialmente em um dia como hoje