Claude Opus 5, com um desempenho adaptativo e esforço máximo, atualmente ocupa a primeira posição no Artificial Analysis Intelligence Index, alcançando uma pontuação de 61 em um total de 170 modelos analisados, conforme relatado por artificialanalysis.ai.

Este modelo se destaca em uma gama de métricas que inclui inteligência, preço, velocidade de resposta (tokens por segundo), latência (tempo para o primeiro token), tempo de resposta total e tamanho da janela de contexto. Entre os modelos de topo, Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) e Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) compartilham da segunda e terceira posições com 60 pontos cada.

No que tange à velocidade, Mercury 2 lidera com 901,6 tokens por segundo, seguido por HyperNova 60B 2605 (439,5 t/s) e Gemini 3.5 Flash-Lite (436,5 t/s). Em termos de acessibilidade financeira, Nova Micro é a mais barata, com um preço de $0,03 por 1M de tokens, seguida por Sarvam 30B (alto) e Gemma 4 E4B (Sem-raciocínio), ambas também com $0,03.

Em relação à latência, Gemini 2.5 Flash-Lite (Sem-raciocínio) possui o menor tempo para o primeiro token, com apenas 0,33s, seguido por Command A+ (0,42s) e North Mini Code (0,49s).

Dentre os modelos de pesos abertos, GLM-5.2 (máx) é o mais bem avaliado com uma pontuação de 51, em um total de 94 modelos abertos em 170 avaliados. Os modelos de topo com pesos abertos, segundo a pontuação do Índice de Inteligência, são GLM-5.2 (máx), MiniMax-M3 e DeepSeek V4 Pro (Raciocínio, Esforço Máximo), com pontuações de 51, 44 e 44 respectivamente.

Claude Opus 5 (Raciocínio Adaptativo, Esforço Máximo) lidera também entre os 126 modelos de raciocínio, que utilizam o pensamento estendido para resolver problemas complexos antes de fornecer respostas, com uma pontuação de 61.

Essas comparações abrangem várias dimensões, incluindo qualidade de inteligência, preços, velocidade de produção de tokens, latência, tempo de resposta total e tamanho da janela de contexto. As métricas de desempenho são mensuradas diretamente usando prompts padronizados em 586 modelos.

Ao clicar em qualquer nome de modelo ou linha nos gráficos, é possível visualizar sua página dedicada com métricas detalhadas e comparações diretas com modelos semelhantes. Também é possível utilizar o seletor de modelos para personalizar quais modelos aparecem em cada gráfico e visualizar o ranking.