AI Benchmark Leaderboard
Every score, every source.
Official-source benchmark data for frontier AI models. The current view hides superseded models and old benchmark versions. The archive keeps historical rows traceable.
Last updated2026-08-17
Models shown26
Benchmarks shown19
| Model | Provider | Input $/M | Output $/M | SWE-bench Pro | Terminal-Bench 2.1 | Terminal-Bench 3.0 | DeepSWE 1.1 | MCP-Atlas | Toolathlon | AutomationBench | OSWorld-Verified | BrowseComp | GPQA Diamond | AA Intelligence Index | Humanity's Last Exam | Humanity's Last Exam with tools | FrontierMath T1-3 (v2) | ARC-AGI-2 | ARC-AGI-3 | Finance Agent v2 | GDPval-AA v2 | CyberGym |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
Claude Fable 5 | Anthropic | $10.00 | $50.00 | - | - | - | - | - | - | |||||||||||||
Claude Opus 5 | Anthropic | $5.00 | $25.00 | - | - | - | - | - | - | - | - | - | - | |||||||||
Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | - | - | - | - | - | - | - | - | - | - | |||||||||
GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | - | - | - | - | - | - | - | ||||||||||||
GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | - | - | - | - | - | - | - | - | - | - | |||||||||
GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | - | - | - | - | - | - | - | - | - | - | |||||||||
Kimi K3 | Moonshot AI | $3.00 | $15.00 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |||
Grok 4.6 | xAI | $2.00 | $6.00 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | ||||
GLM-5.3 Available through GLM Coding Plan; public API and API pricing are coming soon. | Z.ai | — | — | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | ||||
Gemini 3.7 Flash | $0.75 | $3.75 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
Gemini 3.5 Flash | $1.50 | $9.00 | - | - | - | - | - | - | - | - | - | |||||||||||
Muse Spark 1.1 | Meta | $1.25 | $4.25 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
Qwen3.7-Max | Alibaba | $2.50 | $7.50 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
Gemini 3.5 Flash-Lite | $0.30 | $2.50 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |||||
GPT-5.5 Pro | OpenAI | $30.00 | $180.00 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | - | - | - | - | - | ||||||||||||||
GPT-5.4 | OpenAI | $2.50 | $15.00 | - | - | - | - | - | - | - | - | - | - | - | ||||||||
Gemini 3.1 Pro | $2.00 | $12.00 | - | - | - | - | ||||||||||||||||
Gemini 3.1 Flash-Lite | $0.25 | $1.50 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
DeepSeek V4 Flash 0731 | DeepSeek | $0.44 | $1.32 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
DeepSeek V4 Pro 0813 | DeepSeek | $1.32 | $3.96 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
Grok 4.3 | xAI | $1.25 | $2.50 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
GPT-OSS 120B | OpenAI via Groq | $0.15 | $0.60 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
Kimi K2.6 | Moonshot AI | $0.95 | $4.00 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
Kimi K2.7-Code | Moonshot AI | $0.95 | $4.00 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
MiniMax M3 | MiniMax | $0.30 | $1.20 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
Official source URL
Comparative official source
Empty cells mean no official source was found. We do not estimate.
The Dispatch · Weekly
New scores, in your inbox.
Benchmark refreshes, model launches, and source-checked analysis. One email a week, no noise.
Related deep dives
Full comparison posts built on this data.