1 pontos por GN⁺ 2 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Entre os 170 modelos avaliados, o Claude Opus 5 Adaptive Reasoning·Max Effort ficou em 1º lugar com 61 pontos no Intelligence Index, seguido por Xhigh Effort e Claude Fable 5, ambos com 60 pontos
  • O Intelligence Index v4.1 combina 9 avaliações que cobrem trabalho com agentes, coding, raciocínio científico, confiabilidade do conhecimento e raciocínio de longo contexto, e também reflete na medição de desempenho o tempo de pensamento expandido dos modelos de raciocínio
  • Em velocidade de saída, o Mercury 2 foi o mais rápido com 901.6 tokens/s; na latência até o primeiro token, o Gemini 2.5 Flash-Lite foi o mais curto com 0.34 s; e o Llama 4 Scout oferece uma janela de contexto máxima de 10M tokens
  • O preço é comparado não só pelo custo unitário por token, mas também pelo custo por tarefa, ponderando tokens de entrada, cache hit, gravação em cache, raciocínio e resposta; os custos de gravação e armazenamento em cache variam conforme o provedor
  • Entre os modelos com pesos abertos, o GLM-5.2 (max) foi o mais alto com 51 pontos, mas ainda 10 pontos abaixo do líder geral, então a escolha do modelo deve considerar, além da inteligência, custo, velocidade, latência e janela de contexto

Ranking de inteligência do Claude Opus 5

  • O Claude Opus 5 (Adaptive Reasoning, Max Effort) ficou em 1º lugar entre os 170 modelos avaliados, com 61 pontos no Intelligence Index
  • Os 5 modelos mais bem colocados são os seguintes
    • Claude Opus 5 (Adaptive Reasoning, Max Effort): 61 pontos
    • Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60 pontos
    • Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60 pontos
    • GPT-5.6 Sol (max): 59 pontos
    • Claude Opus 5 (Adaptive Reasoning, High Effort): 59 pontos
  • A configuração Max Effort também ficou em 1º lugar entre os 126 modelos de raciocínio; esses modelos fazem pensamento expandido para lidar com problemas complexos antes de responder

Composição da avaliação do Intelligence Index v4.1

  • O Intelligence Index v4.1 combina as 9 avaliações a seguir
    • GDPval-AA v2: trabalho real baseado em agentes
    • 𝜏³-Banking: uso de ferramentas por agentes
    • Terminal-Bench v2.1: coding com agentes e uso de terminal
    • SciCode: coding
    • Humanity's Last Exam: raciocínio e conhecimento
    • GPQA Diamond: raciocínio científico
    • CritPt: raciocínio em física
    • AA-Omniscience: precisão do conhecimento e taxa de não alucinação
    • AA-LCR: raciocínio de longo contexto
  • Dependendo do uso, resultados de avaliações específicas podem ser mais importantes do que uma pontuação composta de inteligência
  • Os itens de avaliação separados também incluem os benchmarks a seguir
    • AA-Briefcase: trabalho de conhecimento com agentes
    • AutomationBench-AA: workflow SaaS com agentes
    • Harvey LAB-AA: trabalho jurídico com agentes
    • EnterpriseOps-Gym-AA: operações de negócios com agentes
    • IFBench: seguimento de instruções
    • APEX-Agents-AA: tarefas de agentes de longo prazo
    • ITBench-AA: análise de causa raiz de incidentes em Kubernetes
    • MMMU-Pro: raciocínio visual

Métricas de trabalho de conhecimento, confiabilidade e abertura

  • O AA-Briefcase Elo combina Elo de qualidade analítica, Elo de apresentação e taxa de aprovação nos critérios de avaliação
    • A taxa de aprovação é convertida em Elo por meio de confrontos sintéticos um a um
    • O Elo e os limites do intervalo de confiança de 95% são limitados para não ficarem abaixo de 0
  • O AA-Omniscience Index mede confiabilidade do conhecimento e alucinação em uma faixa de -100 a 100 pontos
    • Respostas corretas recebem recompensa e alucinações recebem penalidade, mas não há penalidade por recusar responder
    • 0 ponto significa que o número de respostas corretas e incorretas é igual, e valores negativos significam que há mais respostas incorretas do que corretas
  • O Openness Index avalia a abertura do modelo com uma pontuação normalizada de 0 a 100; quanto maior, mais aberto ele é
  • Há distinção sobre se os pesos são públicos, e modelos com pesos públicos mas que exigem licença paga para uso comercial e similares são marcados como Commercial Use Restricted

Ranking de modelos com pesos abertos

  • Dos 170 modelos avaliados, 94 são modelos com pesos abertos
  • Os mais bem colocados no Intelligence Index entre os modelos com pesos abertos são os seguintes
    • GLM-5.2 (max): 51 pontos
    • MiniMax-M3: 44 pontos
    • DeepSeek V4 Pro (Reasoning, Max Effort): 44 pontos
  • O GLM-5.2 (max) registrou a maior pontuação entre os modelos com pesos abertos

Velocidade de saída e tempo de processamento por tarefa

  • O Mercury 2 tem a maior velocidade de saída, com 901.6 tokens/s
    • Gemini 3.5 Flash-Lite: 435.1 tokens/s
    • HyperNova 60B 2605: 427.6 tokens/s
    • Granite 4.0 H Small também está entre os mais rápidos
  • A velocidade de saída é o número de tokens por segundo recebido enquanto o modelo gera tokens, após o recebimento do primeiro chunk em modelos com streaming
  • O tempo por tarefa do Intelligence Index é calculado dividindo o número de tokens de saída por tarefa pela velocidade de saída e aplicando o peso relativo de cada benchmark
    • O tempo até o primeiro token (TTFT) e outros overheads são excluídos
  • Se houver API própria, usa-se o desempenho dessa API; se não houver, como no Meta Llama, usa-se a mediana de vários provedores

Latência e tempo de resposta ponta a ponta

  • O modelo com menor tempo até a chegada do primeiro token de resposta é o Gemini 2.5 Flash-Lite (Non-reasoning), com 0.34 s
    • Command A+: 0.42 s
    • North Mini Code: 0.49 s
    • Gemini 2.5 Flash também está entre os modelos de baixa latência
  • A latência até o primeiro token é o tempo entre a requisição da API e o recebimento do primeiro token de resposta
    • Em modelos de raciocínio, isso também inclui o tempo de pensamento antes da resposta
    • Para modelos sem suporte a streaming, aplica-se o tempo até receber a resposta completa
  • O tempo de resposta ponta a ponta para 500 tokens soma os seguintes elementos
    • tempo de entrada até receber o primeiro token de resposta
    • tempo de pensamento usado por modelos de raciocínio antes de responder
    • tempo para gerar 500 tokens de resposta com base na velocidade de saída
  • O número de tokens de pensamento usa a média medida em 60 prompts diferentes

Preço e custo por tarefa

  • Na comparação de preços, são usados os preços em dólares por 1 milhão de tokens para cache hit, entrada e saída
  • Na lista, Devstral 2 e North Mini Code aparecem com $0.00 por 1 milhão de tokens, seguidos por Gemma 3 4B e Gemma 3 27B
  • Os modelos mais baratos com base no preço misto são os seguintes
    • Nova Micro: $0.03/1M tokens
    • Sarvam 30B (high): $0.03/1M tokens
    • Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
  • O custo por tarefa do Intelligence Index divide pelos números de tarefas os preços de tokens de entrada, cache hit, gravação em cache, raciocínio e resposta de cada avaliação, e aplica os pesos das avaliações dentro do índice
  • O custo de execução do índice completo é calculado pelo uso de tokens por avaliação, excluindo execuções repetidas, e pelo preço de cada tipo de token
  • O preço misto de cache exibido usa apenas o custo de cache hit; outros custos de cache variam por provedor
    • A Anthropic cobra separadamente pela gravação em cache, com tarifas diferentes para TTL de 5 minutos e 1 hora; 1 hora é mais caro
    • Google Vertex/Gemini cobra custo de armazenamento por hora além do preço de cache hit
    • Alguns provedores aplicam preços por faixas para prompts acima de 200K tokens
    • OpenAI e DeepSeek, entre outros, em geral cobram apenas o preço de cache hit, sem custos de gravação ou armazenamento

Uso de tokens e janela de contexto

  • O número de tokens de saída por tarefa é calculado multiplicando os tokens de saída de cada avaliação pelo peso relativo dentro do Intelligence Index e depois dividindo pelo número de tarefas, excluindo repetições
  • Os principais modelos em janela de contexto são os seguintes
    • Llama 4 Scout: 10M tokens
    • Grok 4.20 0309: 2M tokens
    • Gemini 1.5 Pro (May)
    • Grok 4.1 Fast
  • A janela de contexto é o limite máximo combinado de tokens de entrada e saída; o limite de tokens de saída geralmente é muito menor e varia de modelo para modelo
  • Janelas de contexto grandes estão relacionadas a workflows de RAG para buscar e raciocinar sobre informações em grandes volumes de dados

Tamanho de modelos com pesos abertos

  • O tamanho do modelo é dividido entre os parâmetros totais, que somam pesos e vieses treináveis, e os parâmetros ativos realmente executados na inferência
  • Em modelos Mixture of Experts, o mecanismo de roteamento seleciona apenas alguns especialistas por token, então os parâmetros ativos são menores que os totais
  • Em modelos dense, todos os parâmetros são usados, então os parâmetros ativos e os totais são iguais

Escopo da comparação e como usar

  • Os modelos são comparados em várias dimensões, como inteligência, preço, velocidade de saída, latência até o primeiro token, tempo de resposta ponta a ponta e tamanho da janela de contexto
  • As métricas de desempenho são medidas diretamente em 586 modelos com prompts padronizados
  • Na página detalhada de cada modelo, é possível ver métricas detalhadas e comparações diretas com modelos similares, e no seletor de modelos é possível ajustar quais modelos serão exibidos no gráfico

1 comentários

 
GN⁺ 2 시간 전
Opiniões no Hacker News
  • Este ranking se tornou, na prática, inútil para usuários finais decidirem qual modelo usar e quando
    Como cada modelo tem pontos fortes e fracos em áreas e tarefas específicas, um ranking de métrica única não serve para muita coisa; hoje já não existe um único “melhor modelo”, e dependendo da complexidade da tarefa talvez você nem precise do melhor modelo
    Por exemplo, dá para usar Fable para design de UI, Sol para arquitetura de sistemas de backend e Kimi K3 para desenvolvimento de vulnerabilidades; no fim, essas métricas ficam mais próximas de números para ostentação das empresas de modelos

    • Um ano atrás, saiu um novo “melhor modelo” e, cheio de expectativa, pedi a ele uma tarefa simples de programação: pequenas alterações em 3 arquivos. Ele fez bem
      Mas um modelo mais antigo e menor da mesma família também fez bem, sendo 3 vezes mais rápido e custando um nono, e foi aí que caiu a ficha
    • Seria bom ter benchmarks por stack tecnológica
      Mesmo que seja algo um pouco subjetivo, como qual modelo em 2026 lida melhor com um projeto Elixir/Phoenix da forma mais idiomática, isso pode ser útil numa situação em que é difícil comparar todos os modelos o tempo todo e as diferenças de desempenho são grandes
    • Expressões como “totalmente inútil” ou “único propósito” são exageradas
      Toda estatística tem distorções, mas é melhor do que não saber nada; o fato de um benchmark mostrar a média de várias tarefas significa justamente que estatísticas existem para resumir
    • Ao abrir o link, vê-se que não há apenas uma métrica única; todos os indicadores necessários para julgar estão de fato disponíveis
    • Gráficos como custo por tarefa ou frequência de alucinações da Artificial Analysis têm valor
      Mas, quando tudo isso é combinado em um único resultado, todas as nuances desaparecem e sobra só um ranking para ostentação
  • Se eu fosse executivo do Google, acho que dormiria no escritório não só por ter muito trabalho, mas também por vergonha de aparecer em público

    • Como é o único fornecedor que não está queimando subsídios e tomando prejuízo, na verdade pode dormir tranquilo
    • O Google parece valorizar mais a velocidade com que consegue monetizar em todos os produtos do que ter a IA mais inteligente
      Há muito tempo a empresa diz que sua prioridade máxima é fornecer respostas precisas às perguntas o mais rápido possível
    • Também me pergunto se o Google sequer quer competir com modelos maximizados para inteligência como OpenAI ou Anthropic
      Entre as três, parece ser a única empresa que não cultua a AGI nem pratica ascetismo por ela
    • No benchmark GPQA Diamond, está empatado em 1º lugar: https://artificialanalysis.ai/evaluations/gpqa-diamond
      Talvez esse seja o único objetivo
    • Os modelos Gemini também lideram ou estão entre os líderes em várias áreas, então a conclusão de que estariam vergonhosamente atrasados não parece correta
  • No topo do índice de inteligência estão Claude Opus 5 Max com 61 pontos, Opus 5 Xhigh com 60, a combinação de Claude Fable 5 Max e modelos substitutos do Opus 4.8 com 60, GPT-5.6 Sol Max com 59 e Opus 5 High com 59
    Portanto, Opus 5 Xhigh fica acima do Sol Max, e Opus 5 High empata com Sol Max; fico curioso sobre as diferenças de preço e velocidade entre os dois modelos

    • Nos gráficos da Artificial Analysis de custo e tempo por tarefa em relação à inteligência, o custo e o tempo de Opus 5 High e Sol Max são aproximadamente parecidos
      No DeepSwe, Opus 5 vence Fable, mas perde para Sol; no FrontierCode, domina todos, mas quando o esforço de inferência passa de Medium despenca para o nível do Sonnet
    • Opus 5 não é tão inteligente quanto Sol Max e, em algumas tarefas, parece até pior que Opus 4.8
      Em especial, aborda as coisas de forma superficial, precisa que lhe ensinem o app ou framework inteiro e começa por tarefas bobas, como adicionar de novo uma funcionalidade que já existe em outra forma
  • Entre os componentes, o AA-Omniscience Index é interessante
    Ele mede confiabilidade do conhecimento e alucinação, recompensa respostas corretas e penaliza alucinações, mas não penaliza recusas de resposta; parece um indicador que mostra, de forma aproximada, a escala ou a densidade de parâmetros
    A ordem é combinação de modelos substitutos do Claude Fable 5, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash e GPT-5.6 Sol Max; desde há bastante tempo, o Gemini 3.x já dava uma sensação típica de modelo grande

    • Gemini 3.1 Pro é excelente em tarefas de conhecimento, e o Google acertou bem nisso
      A análise de imagens do Gemini 3.6 Flash também é sólida, mas ele fica devendo em codificação ou tarefas de agente
    • Vendo que o 3.6 Flash marca 24 pontos, acima dos 22 do Sol, fica difícil ter certeza de que seja um indicador substituto de escala de parâmetros
      Dizem que o 3.x Flash cabe em um único TPU 8i, e sua velocidade de processamento também é esmagadoramente maior, com 234,7 tokens/s, contra 64,4 do Sol e 56,3 do Opus; o 3.1 Pro também é bem mais rápido, com 113,9 tokens/s
      A AA-Omniscience Accuracy corresponde melhor ao esperado: o enorme Fable lidera com 61%, seguido por grandes modelos de fronteira como Sol, GPT-5.5 e Opus
      O Gemini parece ter se concentrado mais em conhecimento geral e eficiência de custo operacional do que na pontuação máxima em codificação; nas pontuações normalizadas por área, só fica menos competitivo em software
    • Se recusas de resposta não são penalizadas, isso não é tão útil
    • O efeito do grounding pode ser igual ou maior que o do tamanho do modelo, e o Google é muito bom nisso por motivos óbvios
  • Antes de criar expectativas, é preciso olhar a matriz de inteligência versus custo: https://artificialanalysis.ai/models?intelligence-index-toke...

    • Considerando até a qualidade do resultado, é surpreendente que GPT-5.6 Sol Max seja mais barato que todos
    • Max usa uma quantidade enorme de raciocínio adicional, então fico curioso para saber quanto cai o número de tarefas resolvidas no High
      O custo deve cair bastante
  • Passei a ver o Meta Muse Spark com outros olhos
    Ele não é o melhor em nada específico, mas fica em bons pontos ao longo do ranking e tem um bom equilíbrio entre custo e desempenho
    Também fico curioso sobre onde ficaria o Poolside Laguna S, que não aparece na lista; pessoalmente, tenho muito interesse em modelos que funcionem bem e sejam custo-eficientes

  • Mesmo que fique em primeiro por uma margem apertada, se for preciso tomar cuidado para que as “salvaguardas” que significam censura não recusem respostas ou rebaixem para outro modelo, a utilidade cai muito
    Por isso, tirando algumas partes do fluxo de trabalho existente, praticamente parei de usar o Claude, e confiabilidade é mais importante do que a diferença entre 61 e 57 pontos
    Considerando a censura e até a verificação de identidade que eu mesmo não cheguei a enfrentar, o Claude é o modelo mais comprometido e instável, e a pequena otimização de benchmark da versão mais recente não vale a pena

    • Fico curioso para saber que tipo de pergunta você faz para cair em censura com tanta frequência
    • Pelo que usei diretamente, não é nem de longe um modelo feito só para benchmark
      Aplico um teste de criação de jogos a todos os modelos, e o Opus 5 pareceu um salto de geração; benchmarks não mostram a imagem correta, então é preciso testar por conta própria
    • Toda vez que vejo comentários online dizendo que os limites ou o modelo melhoraram e reconsidero meu princípio de nunca pagar à Anthropic, verifico o model card e acabo ficando ainda mais convicto
      Não sei por que a Anthropic é tão obcecada por rebaixamento automático e silencioso, e me pergunto se existe sequer um usuário que prefira que o desempenho seja reduzido automaticamente em vez de receber uma recusa de resposta
    • Pedi ao Claude Opus 5.0 para implantar uma aplicação web em um PaaS de ambiente de teste usando uma chave de API global e buscar dados, e ele recusou alegando um problema de segurança por as permissões serem amplas
      A mesma tarefa foi tratada sem problemas pelo Opus 4.5~4.8 e por Fable, Codex 5.4·5.5 e Sol 5.6
      O Opus 5 é cauteloso demais, o que dificulta usá-lo de forma produtiva, e precisa de ajustes adicionais
    • Talvez seja porque você não esteja fazendo algo significativo; Terence Tao não reclama por causa de “modelos de IA woke”
  • Gosto do fato de o Opus 5 não reexplicar tudo como o 4.8
    Enquanto o GPT-5.6 Sol raciocina fundo demais até em coisas triviais, o Opus 5 é um ótimo modelo, e a Anthropic mandou bem

    • Quando dei uma especificação de implementação ao Sol, ele lidou muito bem com ela, então eu não tinha percebido essa diferença
      Quando mandei ele se virar sem especificação, gastou 30% do uso semanal durante 2 horas e 30 minutos; com especificação, usou só 2% em 30 minutos, e o resultado também foi melhor em estrutura, tamanho, validação, escopo e custo
      Se você deixa o Sol solto, ele sai de controle, então agora faço o Sol escrever a especificação e o Terra implementar; esse método funciona bem e também reduziu o uso total
  • O resultado mais interessante é que o Opus 5 é, depois do Fable 5, um modelo disparado caro
    GPT-5.6 e Kimi K3 têm pontuações semelhantes, com diferença de 1% a 2%, pela metade do custo

    • O gráfico se baseia no esforço de inferência Max, usado principalmente por clientes corporativos que não são sensíveis a preço
      No Medium, o custo cai para quase metade do K3, e há uma grande chance de ser suficiente para 95% das tarefas de codificação
  • Não estou tomando partido, mas, neste resultado, o GPT-5.6 Sol Max parece melhor
    Oferece desempenho quase igual por cerca de metade do custo, e o fato de o Opus 5 também ser tão mais caro que o GPT-5.6 mostra como o preço do Fable é alto

    • Para comparar corretamente, é preciso comparar Opus High e Sol Max