1 pontos por GN⁺ 2 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • A versão oficial da API DeepSeek-V4-Flash foi lançada em beta público em 31 de julho de 2026, e pode ser usada apenas definindo o nome do modelo como deepseek-v4-flash no método de chamada existente
  • O desempenho em agentes superou amplamente o V4-Pro-Preview, registrando 82,7 pontos no Terminal Bench 2.1, além de 76,7 no Cybergym, 70,3 no Toolathlon verified e 68,7 no DSBench-FullStack
  • O benchmark de agentes de código foi medido no futuro modo mínimo do DeepSeek Harness, com max effort, top_p=0.95 e temperature=1.0
  • A versão oficial do V4-Flash oferece suporte nativo ao formato Responses API e foi ajustada para o Codex; em relação ao Preview, mantém a mesma estrutura e tamanho do modelo, aplicando apenas treinamento de pós-processamento adicional
  • O escopo das mudanças é limitado à API V4-Flash; a API V4-Pro e os modelos APP/WEB permanecem inalterados, e a versão oficial do V4-Pro deve ser lançada em breve

Lançamento do beta público e uso da API

  • A versão oficial da API DeepSeek-V4-Flash foi lançada em beta público em 31 de julho de 2026
  • O método de chamada existente é mantido; para usar a versão mais recente, basta definir o parâmetro do modelo como deepseek-v4-flash
  • A série V4 é oferecida no mesmo base_url de antes, por meio das interfaces OpenAI ChatCompletions e Anthropic
    • O V4-Pro usa deepseek-v4-pro, e o V4-Flash usa deepseek-v4-flash
    • Os nomes de modelo anteriores, deepseek-chat e deepseek-reasoner, estavam previstos para serem descontinuados em 24 de julho de 2026
    • Durante o período de transição, esses dois nomes apontavam, respectivamente, para o modo sem raciocínio e o modo com raciocínio do V4-Flash

Resultados dos benchmarks de agentes

  • A versão oficial do V4-Flash registrou resultados muito acima do V4-Pro-Preview em desempenho de agentes
    • Terminal Bench 2.1: 82,7
    • NL2Repo: 54,2
    • Cybergym: 76,7
    • DeepSWE: 54,4
    • Toolathlon verified: 70,3
    • Agent Last Exam: 25,2
    • Automation Bench Public: 25,1
    • DSBench-FullStack: 68,7
    • DSBench-Hard: 59,6
  • As tarefas de agentes de código nos benchmarks públicos foram medidas com o futuro modo mínimo do DeepSeek Harness
    • O nível de effort é max, com top_p=0.95 e temperature=1.0
  • O DSBench-FullStack é um conjunto interno de testes de desenvolvimento full-stack, e o DSBench-Hard é um conjunto interno de problemas difíceis para agentes de codificação

Responses API e integração com Codex

  • A versão oficial do V4-Flash oferece suporte nativo ao formato Responses API e foi ajustada para o Codex
  • As configurações necessárias para a integração com o Codex podem ser conferidas na documentação oficial

Escopo das mudanças no modelo

  • DeepSeek-V4-Flash-0731 mantém a mesma estrutura e o mesmo tamanho de modelo do V4-Flash-Preview
  • Apenas treinamento de pós-processamento adicional foi aplicado, sem mudanças na estrutura do próprio modelo
  • A atualização se aplica apenas à API DeepSeek-V4-Flash
    • A API DeepSeek-V4-Pro não foi alterada
    • Os modelos oferecidos em APP/WEB também permanecem iguais
  • A versão oficial do DeepSeek-V4-Pro deve ser lançada em breve

1 comentários

 
GN⁺ 2 시간 전
Opiniões no Hacker News
  • Pessoalmente, estou mais animado com ele do que com o K3. O modelo DSV4 tem custo de serving muito baixo, então, conforme o desempenho melhorar, pode se tornar um modelo “bom o suficiente” para cada vez mais tarefas.
    A DeepSeek ofereceu por muito tempo a versão Pro a um preço muito baixo e a integrou com ferramentas como o OpenCode, então é bem provável que tenha reunido muitos dados reais de trabalho de desenvolvimento. Se isso for usado no pós-treinamento, melhorias adicionais também são possíveis.
    Também tenho curiosidade para saber quanto melhor o K3 ficaria ao ser destilado para o DSV4. Modelos baratos e rápidos são especialmente benéficos para a comunidade porque não desaparecem ao bel-prazer de um provedor e permitem continuar aproveitando seu desempenho. Pelo menos o Flash pode ser executado em casa com equipamentos de menos de US$ 10 mil, mas modelos grandes como GLM ou K3 são, realisticamente, difíceis.

    • Os únicos provedores aos quais eu aceitaria fornecer dados de treinamento são DeepSeek e Moonshot.
    • Espero que, combinado com o DwarfStar, seja possível ter uma IA local utilizável.
  • Estou processando 90% do trabalho com o Flash. Não sei por quê, mas ele é melhor que o Pro, além de ser muito barato e rápido.
    Se eu mantiver as mudanças abaixo de 1.000 linhas e tomar eu mesmo as decisões de arquitetura, quase não sinto diferença em relação aos modelos de ponta. Os 10% restantes uso para encontrar bugs/problemas de segurança ou revisar estruturas melhores; o Flash também vai razoavelmente bem nisso, mas faço validação cruzada.
    Iterações rápidas são muito melhores do que esperar 5 a 10 minutos por pequenas mudanças. Recentemente, Kimi e GLM ficaram lentos por raciocinarem por tempo desnecessariamente longo. Posso inserir muitos dados, como dependências, logs e dumps de desempenho, sem me preocupar com limites, e em engenharia reversa de binários também não bato em restrições de segurança.

    • Talvez por meus prompts serem fracos, mas os modelos da OpenAI que usei via Codex nunca se recusaram a fazer engenharia reversa de binários. Ainda estou analisando firmware de terceiros com o Codex e nunca encontrei uma limitação.
      Por outro lado, há casos de prompts sem relação com segurança sendo recusados, então fico curioso se a diferença por plataforma e por usuário é tão grande assim.
    • O DeepSeek V4 Flash é suficiente para a maioria das tarefas e responde rápido. Compro tokens principalmente da FireWorks.ai, dos EUA, mas também deixei um grande valor pré-pago na DeepSeek.
      Uso principalmente o OpenCode, que gasta menos tokens do que o Claude Code, e também estou aguardando o lançamento do próprio harness de codificação da DeepSeek.
    • No geral é bom, mas no OpenRouter o limite de tokens de saída é rígido demais. Se ele cai numa armadilha de raciocínio, não consegue sair sozinho dentro do limite, mas ainda assim substituiu os modelos Kimi.
  • Meu registro dos últimos 30 dias usando DeepSeek para a maior parte das tarefas do meu agente pessoal cotidiano foi de US$ 4,55 de custo, 3.467 chamadas de API e 323.183.886 tokens.
    Como engenheiro que lidera uma pequena equipe, tenho um padrão alto de qualidade e aplico o mesmo padrão aos meus projetos pessoais, mas não me decepcionei em nada em tarefas de codificação e revisão. Para outras tarefas, uso outros modelos.

    • Tenho curiosidade sobre qual método e quais prompts você usa para revisão de código com LLM. A qualidade das respostas foi bem baixa; queria saber se o problema é meu modo de usar.
    • Fico curioso sobre qual harness você usa para alcançar esse nível de cache de tokens.
    • Gostaria de saber se há muitas alucinações e, se houver, como elas afetam seu fluxo de trabalho.
    • A qualidade não é excepcional; e isso vale para a maioria dos LLMs.
  • Agora executo quase todas as tarefas dentro do pi com o Flash. Com servidores MCP adequados, ferramentas de redução de contexto e skills, dá para implementar qualquer tarefa.
    Algumas sessões passam de 30 turnos, mas é rápido e barato, então mesmo trabalhando por uma hora cerca de US$ 0,50 é suficiente. Ainda assim, em fluxos de trabalho com múltiplos subagentes, uso modelos mais caros para papéis de planejamento, revisão e oráculo.
    Já faz semanas que não uso a assinatura lenta do Opus. Também montei um chat OpenWebUI auto-hospedado que funciona no celular e suporta MCP e skills, substituindo completamente o Perplexity; os custos de hospedagem e assinatura ficam em cerca de US$ 18 por mês.

    • Eu também conectei várias ferramentas personalizadas ao conjunto pi + DeepSeek para rastreamento de tarefas e economia de tokens, e uso modelos de ponta apenas para tarefas muito difíceis. Essa configuração atende a tudo de que preciso.
    • Gostaria de receber recomendações de extensões úteis para o pi.
    • Tenho curiosidade se há melhorias perceptíveis nesta atualização.
    • Gostaria de saber como configurar top_p e temperature no pi.
  • Se os benchmarks refletirem corretamente o desempenho em uso real, é um modelo surpreendente. Um modelo de 300B supera o desempenho de 1,8T parâmetros do modelo preview anterior DS4 Pro e parece melhor até que o GPT 5.6 Luna.
    Ainda é mais barato do que o Luna depois da redução de preço.

    • No DeepSWE, a DeepSeek tem 54,4%, e o Luna, 67%.
  • É bastante impressionante que um modelo de 200B concorra com o GLM-5.2 e se aproxime do Opus 4.8.
    Se esses números também se traduzirem em desempenho geral, somados ao excelente caching da DeepSeek, o uso deve crescer muito.

    • Não é apenas um modelo de 200B; ele também tem só 160GiB de tamanho.
  • Fico curioso por que não puderam chamá-lo de v4.1-Flash para diferenciá-lo com mais clareza.

  • Se ele mantiver a velocidade e o preço baixo e ainda assim superar o desempenho do já bastante utilizável deepseek-v4-pro, é muito promissor.
    O deepseek-v4-flash já era o modelo com melhor custo-benefício, então a diferença no indicador inteligência/custo deve aumentar ainda mais. Dito isso, o baixo custo da API da DeepSeek também vem ao preço de entregar informações da base de código à China.

    • Pelo menos em um benchmark, dizem que ele é superior ao GLM 5.2.
  • Fico me perguntando se faz sentido uma configuração usando Kimi K3 em vez de Opus para tarefas caras, e DSV4 Flash em vez de Sonnet para tarefas gerais.

    • Parece que uma versão atualizada do deepseek-v4-pro deve sair em breve e, considerando o grande salto do DSV4 Flash, há boa chance de ele superar o Kimi K3 tanto em inteligência quanto em custo.
    • Faz bastante sentido. Mesmo fazendo codificação ou verificações de servidor por uma hora com o DSV4 Flash, o custo puro de API fica em cerca de US$ 0,30, o que me surpreende toda vez.
    • Você pode usar meu roteador de modelos para alternar entre os dois modelos em segundo plano.
  • Tenho curiosidade sobre casos de uso do DSv4 em agentes para além de codificação. Em especial, gostaria de saber como usuários que tratavam classificação, categorização etc. com o GPT-5.4 mini estão aproveitando o DSv4.