- Entre os 170 modelos avaliados, o Claude Opus 5 Adaptive Reasoning·Max Effort ficou em 1º lugar com 61 pontos no Intelligence Index, seguido por Xhigh Effort e Claude Fable 5, ambos com 60 pontos
- O Intelligence Index v4.1 combina 9 avaliações que cobrem trabalho com agentes, coding, raciocínio científico, confiabilidade do conhecimento e raciocínio de longo contexto, e também reflete na medição de desempenho o tempo de pensamento expandido dos modelos de raciocínio
- Em velocidade de saída, o Mercury 2 foi o mais rápido com 901.6 tokens/s; na latência até o primeiro token, o Gemini 2.5 Flash-Lite foi o mais curto com 0.34 s; e o Llama 4 Scout oferece uma janela de contexto máxima de 10M tokens
- O preço é comparado não só pelo custo unitário por token, mas também pelo custo por tarefa, ponderando tokens de entrada, cache hit, gravação em cache, raciocínio e resposta; os custos de gravação e armazenamento em cache variam conforme o provedor
- Entre os modelos com pesos abertos, o GLM-5.2 (max) foi o mais alto com 51 pontos, mas ainda 10 pontos abaixo do líder geral, então a escolha do modelo deve considerar, além da inteligência, custo, velocidade, latência e janela de contexto
Ranking de inteligência do Claude Opus 5
- O Claude Opus 5 (Adaptive Reasoning, Max Effort) ficou em 1º lugar entre os 170 modelos avaliados, com 61 pontos no Intelligence Index
- Os 5 modelos mais bem colocados são os seguintes
- Claude Opus 5 (Adaptive Reasoning, Max Effort): 61 pontos
- Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60 pontos
- Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60 pontos
- GPT-5.6 Sol (max): 59 pontos
- Claude Opus 5 (Adaptive Reasoning, High Effort): 59 pontos
- A configuração Max Effort também ficou em 1º lugar entre os 126 modelos de raciocínio; esses modelos fazem pensamento expandido para lidar com problemas complexos antes de responder
Composição da avaliação do Intelligence Index v4.1
- O Intelligence Index v4.1 combina as 9 avaliações a seguir
- GDPval-AA v2: trabalho real baseado em agentes
- 𝜏³-Banking: uso de ferramentas por agentes
- Terminal-Bench v2.1: coding com agentes e uso de terminal
- SciCode: coding
- Humanity's Last Exam: raciocínio e conhecimento
- GPQA Diamond: raciocínio científico
- CritPt: raciocínio em física
- AA-Omniscience: precisão do conhecimento e taxa de não alucinação
- AA-LCR: raciocínio de longo contexto
- Dependendo do uso, resultados de avaliações específicas podem ser mais importantes do que uma pontuação composta de inteligência
- Os itens de avaliação separados também incluem os benchmarks a seguir
- AA-Briefcase: trabalho de conhecimento com agentes
- AutomationBench-AA: workflow SaaS com agentes
- Harvey LAB-AA: trabalho jurídico com agentes
- EnterpriseOps-Gym-AA: operações de negócios com agentes
- IFBench: seguimento de instruções
- APEX-Agents-AA: tarefas de agentes de longo prazo
- ITBench-AA: análise de causa raiz de incidentes em Kubernetes
- MMMU-Pro: raciocínio visual
Métricas de trabalho de conhecimento, confiabilidade e abertura
- O AA-Briefcase Elo combina Elo de qualidade analítica, Elo de apresentação e taxa de aprovação nos critérios de avaliação
- A taxa de aprovação é convertida em Elo por meio de confrontos sintéticos um a um
- O Elo e os limites do intervalo de confiança de 95% são limitados para não ficarem abaixo de 0
- O AA-Omniscience Index mede confiabilidade do conhecimento e alucinação em uma faixa de -100 a 100 pontos
- Respostas corretas recebem recompensa e alucinações recebem penalidade, mas não há penalidade por recusar responder
- 0 ponto significa que o número de respostas corretas e incorretas é igual, e valores negativos significam que há mais respostas incorretas do que corretas
- O Openness Index avalia a abertura do modelo com uma pontuação normalizada de 0 a 100; quanto maior, mais aberto ele é
- Há distinção sobre se os pesos são públicos, e modelos com pesos públicos mas que exigem licença paga para uso comercial e similares são marcados como
Commercial Use Restricted
Ranking de modelos com pesos abertos
- Dos 170 modelos avaliados, 94 são modelos com pesos abertos
- Os mais bem colocados no Intelligence Index entre os modelos com pesos abertos são os seguintes
- GLM-5.2 (max): 51 pontos
- MiniMax-M3: 44 pontos
- DeepSeek V4 Pro (Reasoning, Max Effort): 44 pontos
- O GLM-5.2 (max) registrou a maior pontuação entre os modelos com pesos abertos
Velocidade de saída e tempo de processamento por tarefa
- O Mercury 2 tem a maior velocidade de saída, com 901.6 tokens/s
- Gemini 3.5 Flash-Lite: 435.1 tokens/s
- HyperNova 60B 2605: 427.6 tokens/s
- Granite 4.0 H Small também está entre os mais rápidos
- A velocidade de saída é o número de tokens por segundo recebido enquanto o modelo gera tokens, após o recebimento do primeiro chunk em modelos com streaming
- O tempo por tarefa do Intelligence Index é calculado dividindo o número de tokens de saída por tarefa pela velocidade de saída e aplicando o peso relativo de cada benchmark
- O tempo até o primeiro token (TTFT) e outros overheads são excluídos
- Se houver API própria, usa-se o desempenho dessa API; se não houver, como no Meta Llama, usa-se a mediana de vários provedores
Latência e tempo de resposta ponta a ponta
- O modelo com menor tempo até a chegada do primeiro token de resposta é o Gemini 2.5 Flash-Lite (Non-reasoning), com 0.34 s
- Command A+: 0.42 s
- North Mini Code: 0.49 s
- Gemini 2.5 Flash também está entre os modelos de baixa latência
- A latência até o primeiro token é o tempo entre a requisição da API e o recebimento do primeiro token de resposta
- Em modelos de raciocínio, isso também inclui o tempo de pensamento antes da resposta
- Para modelos sem suporte a streaming, aplica-se o tempo até receber a resposta completa
- O tempo de resposta ponta a ponta para 500 tokens soma os seguintes elementos
- tempo de entrada até receber o primeiro token de resposta
- tempo de pensamento usado por modelos de raciocínio antes de responder
- tempo para gerar 500 tokens de resposta com base na velocidade de saída
- O número de tokens de pensamento usa a média medida em 60 prompts diferentes
Preço e custo por tarefa
- Na comparação de preços, são usados os preços em dólares por 1 milhão de tokens para cache hit, entrada e saída
- Na lista, Devstral 2 e North Mini Code aparecem com $0.00 por 1 milhão de tokens, seguidos por Gemma 3 4B e Gemma 3 27B
- Os modelos mais baratos com base no preço misto são os seguintes
- Nova Micro: $0.03/1M tokens
- Sarvam 30B (high): $0.03/1M tokens
- Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
- O custo por tarefa do Intelligence Index divide pelos números de tarefas os preços de tokens de entrada, cache hit, gravação em cache, raciocínio e resposta de cada avaliação, e aplica os pesos das avaliações dentro do índice
- O custo de execução do índice completo é calculado pelo uso de tokens por avaliação, excluindo execuções repetidas, e pelo preço de cada tipo de token
- O preço misto de cache exibido usa apenas o custo de cache hit; outros custos de cache variam por provedor
- A Anthropic cobra separadamente pela gravação em cache, com tarifas diferentes para TTL de 5 minutos e 1 hora; 1 hora é mais caro
- Google Vertex/Gemini cobra custo de armazenamento por hora além do preço de cache hit
- Alguns provedores aplicam preços por faixas para prompts acima de 200K tokens
- OpenAI e DeepSeek, entre outros, em geral cobram apenas o preço de cache hit, sem custos de gravação ou armazenamento
Uso de tokens e janela de contexto
- O número de tokens de saída por tarefa é calculado multiplicando os tokens de saída de cada avaliação pelo peso relativo dentro do Intelligence Index e depois dividindo pelo número de tarefas, excluindo repetições
- Os principais modelos em janela de contexto são os seguintes
- Llama 4 Scout: 10M tokens
- Grok 4.20 0309: 2M tokens
- Gemini 1.5 Pro (May)
- Grok 4.1 Fast
- A janela de contexto é o limite máximo combinado de tokens de entrada e saída; o limite de tokens de saída geralmente é muito menor e varia de modelo para modelo
- Janelas de contexto grandes estão relacionadas a workflows de RAG para buscar e raciocinar sobre informações em grandes volumes de dados
Tamanho de modelos com pesos abertos
- O tamanho do modelo é dividido entre os parâmetros totais, que somam pesos e vieses treináveis, e os parâmetros ativos realmente executados na inferência
- Em modelos Mixture of Experts, o mecanismo de roteamento seleciona apenas alguns especialistas por token, então os parâmetros ativos são menores que os totais
- Em modelos dense, todos os parâmetros são usados, então os parâmetros ativos e os totais são iguais
Escopo da comparação e como usar
- Os modelos são comparados em várias dimensões, como inteligência, preço, velocidade de saída, latência até o primeiro token, tempo de resposta ponta a ponta e tamanho da janela de contexto
- As métricas de desempenho são medidas diretamente em 586 modelos com prompts padronizados
- Na página detalhada de cada modelo, é possível ver métricas detalhadas e comparações diretas com modelos similares, e no seletor de modelos é possível ajustar quais modelos serão exibidos no gráfico
1 comentários
Opiniões no Hacker News
Este ranking se tornou, na prática, inútil para usuários finais decidirem qual modelo usar e quando
Como cada modelo tem pontos fortes e fracos em áreas e tarefas específicas, um ranking de métrica única não serve para muita coisa; hoje já não existe um único “melhor modelo”, e dependendo da complexidade da tarefa talvez você nem precise do melhor modelo
Por exemplo, dá para usar Fable para design de UI, Sol para arquitetura de sistemas de backend e Kimi K3 para desenvolvimento de vulnerabilidades; no fim, essas métricas ficam mais próximas de números para ostentação das empresas de modelos
Mas um modelo mais antigo e menor da mesma família também fez bem, sendo 3 vezes mais rápido e custando um nono, e foi aí que caiu a ficha
Mesmo que seja algo um pouco subjetivo, como qual modelo em 2026 lida melhor com um projeto Elixir/Phoenix da forma mais idiomática, isso pode ser útil numa situação em que é difícil comparar todos os modelos o tempo todo e as diferenças de desempenho são grandes
Toda estatística tem distorções, mas é melhor do que não saber nada; o fato de um benchmark mostrar a média de várias tarefas significa justamente que estatísticas existem para resumir
Mas, quando tudo isso é combinado em um único resultado, todas as nuances desaparecem e sobra só um ranking para ostentação
Se eu fosse executivo do Google, acho que dormiria no escritório não só por ter muito trabalho, mas também por vergonha de aparecer em público
Há muito tempo a empresa diz que sua prioridade máxima é fornecer respostas precisas às perguntas o mais rápido possível
Entre as três, parece ser a única empresa que não cultua a AGI nem pratica ascetismo por ela
Talvez esse seja o único objetivo
No topo do índice de inteligência estão Claude Opus 5 Max com 61 pontos, Opus 5 Xhigh com 60, a combinação de Claude Fable 5 Max e modelos substitutos do Opus 4.8 com 60, GPT-5.6 Sol Max com 59 e Opus 5 High com 59
Portanto, Opus 5 Xhigh fica acima do Sol Max, e Opus 5 High empata com Sol Max; fico curioso sobre as diferenças de preço e velocidade entre os dois modelos
No DeepSwe, Opus 5 vence Fable, mas perde para Sol; no FrontierCode, domina todos, mas quando o esforço de inferência passa de Medium despenca para o nível do Sonnet
Em especial, aborda as coisas de forma superficial, precisa que lhe ensinem o app ou framework inteiro e começa por tarefas bobas, como adicionar de novo uma funcionalidade que já existe em outra forma
Entre os componentes, o AA-Omniscience Index é interessante
Ele mede confiabilidade do conhecimento e alucinação, recompensa respostas corretas e penaliza alucinações, mas não penaliza recusas de resposta; parece um indicador que mostra, de forma aproximada, a escala ou a densidade de parâmetros
A ordem é combinação de modelos substitutos do Claude Fable 5, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash e GPT-5.6 Sol Max; desde há bastante tempo, o Gemini 3.x já dava uma sensação típica de modelo grande
A análise de imagens do Gemini 3.6 Flash também é sólida, mas ele fica devendo em codificação ou tarefas de agente
Dizem que o 3.x Flash cabe em um único TPU 8i, e sua velocidade de processamento também é esmagadoramente maior, com 234,7 tokens/s, contra 64,4 do Sol e 56,3 do Opus; o 3.1 Pro também é bem mais rápido, com 113,9 tokens/s
A AA-Omniscience Accuracy corresponde melhor ao esperado: o enorme Fable lidera com 61%, seguido por grandes modelos de fronteira como Sol, GPT-5.5 e Opus
O Gemini parece ter se concentrado mais em conhecimento geral e eficiência de custo operacional do que na pontuação máxima em codificação; nas pontuações normalizadas por área, só fica menos competitivo em software
Antes de criar expectativas, é preciso olhar a matriz de inteligência versus custo: https://artificialanalysis.ai/models?intelligence-index-toke...
O custo deve cair bastante
Passei a ver o Meta Muse Spark com outros olhos
Ele não é o melhor em nada específico, mas fica em bons pontos ao longo do ranking e tem um bom equilíbrio entre custo e desempenho
Também fico curioso sobre onde ficaria o Poolside Laguna S, que não aparece na lista; pessoalmente, tenho muito interesse em modelos que funcionem bem e sejam custo-eficientes
Mesmo que fique em primeiro por uma margem apertada, se for preciso tomar cuidado para que as “salvaguardas” que significam censura não recusem respostas ou rebaixem para outro modelo, a utilidade cai muito
Por isso, tirando algumas partes do fluxo de trabalho existente, praticamente parei de usar o Claude, e confiabilidade é mais importante do que a diferença entre 61 e 57 pontos
Considerando a censura e até a verificação de identidade que eu mesmo não cheguei a enfrentar, o Claude é o modelo mais comprometido e instável, e a pequena otimização de benchmark da versão mais recente não vale a pena
Aplico um teste de criação de jogos a todos os modelos, e o Opus 5 pareceu um salto de geração; benchmarks não mostram a imagem correta, então é preciso testar por conta própria
Não sei por que a Anthropic é tão obcecada por rebaixamento automático e silencioso, e me pergunto se existe sequer um usuário que prefira que o desempenho seja reduzido automaticamente em vez de receber uma recusa de resposta
A mesma tarefa foi tratada sem problemas pelo Opus 4.5~4.8 e por Fable, Codex 5.4·5.5 e Sol 5.6
O Opus 5 é cauteloso demais, o que dificulta usá-lo de forma produtiva, e precisa de ajustes adicionais
Gosto do fato de o Opus 5 não reexplicar tudo como o 4.8
Enquanto o GPT-5.6 Sol raciocina fundo demais até em coisas triviais, o Opus 5 é um ótimo modelo, e a Anthropic mandou bem
Quando mandei ele se virar sem especificação, gastou 30% do uso semanal durante 2 horas e 30 minutos; com especificação, usou só 2% em 30 minutos, e o resultado também foi melhor em estrutura, tamanho, validação, escopo e custo
Se você deixa o Sol solto, ele sai de controle, então agora faço o Sol escrever a especificação e o Terra implementar; esse método funciona bem e também reduziu o uso total
O resultado mais interessante é que o Opus 5 é, depois do Fable 5, um modelo disparado caro
GPT-5.6 e Kimi K3 têm pontuações semelhantes, com diferença de 1% a 2%, pela metade do custo
No Medium, o custo cai para quase metade do K3, e há uma grande chance de ser suficiente para 95% das tarefas de codificação
Não estou tomando partido, mas, neste resultado, o GPT-5.6 Sol Max parece melhor
Oferece desempenho quase igual por cerca de metade do custo, e o fato de o Opus 5 também ser tão mais caro que o GPT-5.6 mostra como o preço do Fable é alto