Compare desempenho, custo e velocidade. Escolha a fonte e o parâmetro do ranking.
Cada coluna compara só estes 10 modelos: mais claro é melhor na categoria. O contorno marca o líder.
| Modelo | Visão geral | Raciocínio | Código | Agentes de código | Matemática | Análise de dados | Linguagem | Instruções |
|---|---|---|---|---|---|---|---|---|
| 01Claude Fable 5.1 Max Effort | 83,4 | 91,7 | 86,4 | 66,1 | 97,0 | 80,3 | 89,5 | 73,0 |
| 02Claude 5.5 Opus Thinking Max Effort | 83,2 | 92,2 | 89,3 | 71,7 | 97,1 | 80,3 | 86,3 | 65,7 |
| 03Claude Fable 5 Max Effort | 83,0 | 89,7 | 86,0 | 62,2 | 96,0 | 80,5 | 90,7 | 75,8 |
| 04GPT-6 Astra Max Effort | 82,2 | 92,7 | 80,4 | 57,3 | 96,8 | 83,0 | 89,4 | 75,6 |
| 05Claude 5.5 Opus Thinking xHigh Effort | 82,1 | 90,7 | 89,3 | 65,4 | 96,8 | 79,8 | 85,5 | 67,0 |
| 06GPT-6.1 Sol Max Effort | 81,6 | 92,6 | 80,4 | 54,5 | 96,8 | 82,7 | 90,1 | 74,2 |
| 07Muse Spark 1.3 xHigh Effort | 81,6 | 89,7 | 81,1 | 64,1 | 95,9 | 79,6 | 82,8 | 78,0 |
| 08GPT-6.1 Sol xHigh Effort | 81,1 | 91,6 | 80,7 | 56,8 | 96,5 | 82,2 | 88,6 | 71,3 |
| 09DeepSeek V4.1 Flash Max Effort | 81,1 | 86,7 | 80,0 | 77,3 | 93,3 | 79,3 | 81,2 | 70,0 |
| 10GPT-5.6 Sol Max Effort | 81,1 | 91,7 | 83,9 | 56,2 | 96,2 | 79,8 | 87,7 | 71,8 |
105 modelos da Artificial Analysis. A linha liga os modelos que ninguém supera pelo mesmo custo ou menos. Passe o mouse sobre os pontos para ver cada modelo.
| Modelo | Organização | Inteligência | Custo por tarefa |
|---|---|---|---|
| Claude Opus 5.5 (max with fallback) | Anthropic | 58 | US$ 5,98 |
| Claude Opus 5.5 (xhigh with fallback) | Anthropic | 56 | US$ 3,46 |
| Claude Opus 5.5 (high with fallback) | Anthropic | 54 | US$ 1,82 |
| GPT-6.1 Sol (max) | OpenAI | 52 | US$ 0,72 |
| GPT-6.1 Sol (xhigh) | OpenAI | 51 | US$ 0,39 |
| GPT-6.1 Sol (high) | OpenAI | 50 | US$ 0,32 |
| GPT-6.1 Sol (medium) | OpenAI | 48 | US$ 0,21 |
| MiMo-V2.6-Pro | Xiaomi | 46 | US$ 0,13 |
| MiMo-V2.6-Flash | Xiaomi | 38 | US$ 0,06 |
| GPT-6 Luna (xhigh) | OpenAI | 34 | US$ 0,04 |
| GPT-6 Luna (high) | OpenAI | 32 | US$ 0,03 |
| GPT-6 Luna (medium) | OpenAI | 29 | US$ 0,02 |
| GPT-6 Luna (low) | OpenAI | 21 | US$ 0,0045 |
Busque, filtre por organização e ordene por qualquer métrica.
Média das categorias, com o mesmo peso para cada uma. Escala de 0 a 100.
64 de 64 modelos com resultado neste parâmetro.
O LiveBench usa tarefas com respostas verificáveis. Cada categoria é a média das suas subtarefas; a pontuação geral atribui o mesmo peso às categorias. As configurações de esforço permanecem no nome de cada modelo.
O custo por acerto é uma estimativa do benchmark, em dólares, e não o preço de uma assinatura. Benchmarks medem tarefas específicas: valide os candidatos no seu próprio fluxo de trabalho.
A Artificial Analysis oferece inteligência, custo por tarefa, velocidade, latência, tempo total de resposta e contexto a partir da sua tabela pública. As medidas de custo dependem dos testes de cada fonte. Os índices têm metodologias próprias e não são combinados com os do LiveBench. Os resultados públicos mantêm o arredondamento da fonte; um empate não significa necessariamente desempenho idêntico nos dados completos.
Dados e metodologia do LiveBench ↗