The leaders, at a glance
UnifyBench ranking
Compare AI models and measured effort settings across published benchmarks.
Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.
Value leaders
Experimental comparison score · 0–100No supported leaders match this profile and filters. Try another profile, clear filters, or explore the results below.
For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected
Explore all 109 sources Independent evaluations and lab reports
Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.
- ai.meta.com
- Amazon Nova 2 technical report
- anthropic.com
- ARC Prize: ARC-AGI-2
- ARC Prize: ARC-AGI-3 · provider-adapter
- arcprize.org
- Artificial Analysis: AA-AnalystAgent
- Artificial Analysis: AA-Briefcase Elo
- Artificial Analysis: AA-LCR v1.1
- Artificial Analysis: AA-Omniscience Index
- Artificial Analysis: AIME 2025
- Artificial Analysis: APEX-Agents-AA
- Artificial Analysis: AutomationBench-AA
- Artificial Analysis: CritPt
- Artificial Analysis: EnterpriseOps-Gym-AA
- Artificial Analysis: GDP.pdf: All-pass
- Artificial Analysis: Global-MMLU-Lite
- Artificial Analysis: Harvey LAB-AA: Criterion Pass Rate
- Artificial Analysis: Humanity's Last Exam
- Artificial Analysis: IFBench
- Artificial Analysis: ITBench-AA
- Artificial Analysis: LiveCodeBench
- Artificial Analysis: MATH-500
- Artificial Analysis: MLCR-AA
- Artificial Analysis: MMLU-Pro
- Artificial Analysis: MMMU-Pro
- Artificial Analysis: SciCode
- Artificial Analysis: Terminal-Bench Hard
- Artificial Analysis: Terminal-Bench v2.1
- Artificial Analysis: Terminal-Bench v4.0
- Artificial Analysis: 𝜏²-Bench Telecom
- Artificial Analysis: 𝜏³-Banking
- artificialanalysis.ai
- artificialanalysis.ai
- artificialanalysis.ai
- artificialanalysis.ai
- artificialanalysis.ai
- artificialanalysis.ai
- Claude Fable 5.1 and Claude Mythos 5.1 System Card
- Cognition: FrontierCode 1.1 · extended-chisel
- Command A+ launch benchmarks
- Datacurve: DeepSWE v1.1
- deepmind.google
- deepseek-ai/DeepSeek-V4-Pro-0813
- deepswe.datacurve.ai
- Epoch AI: Epoch · Chess Puzzles · v1.0.0
- Epoch AI: Epoch · FrontierMath Tier 4 · v2.0.0
- Epoch AI: Epoch · FrontierMath Tiers 1–3 · v2.0.0
- Epoch AI: Epoch · GPQA diamond · v1.0.0
- Epoch AI: Epoch · Mystery Game Puzzles · v1.0.4 · Tool submission
- Epoch AI: Epoch · OTIS Mock AIME 2024-2025 · v1.0.0
- Epoch AI: Epoch · SimpleQA Verified · v1.0.0
- Gemini 3.8 Flash launch performance
- Gemini3.8Flash Model Card
- GPT-5.6: Frontier intelligence that scales with your ambition
- GPT-6 Astra System Card
- GPT-6 Astra: A new generation of intelligence
- Grok 4.6 launch evaluations
- huggingface.co
- huggingface.co
- huggingface.co
- Kimi K2.6 official model card
- kimi.ai
- LiveBench: LiveBench · AMPS Hard · 2026-06-25
- LiveCodeBench: LiveCodeBench
- livecodebench.github.io
- lmarena.ai
- MAI-Thinking-1 technical report
- MiniMax M3 model card benchmark figure
- Mistral Medium 3.5 model card performance charts
- moonshotai/Kimi-K3
- Muse Spark 1.1 evaluation report Figure44
- Muse Spark1.3 evaluation methodology
- nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16
- os-world.github.io
- qwen.ai
- Qwen/Qwen3.8-2.4T-A95B
- Scale: EnigmaEval · Scale official evaluation
- Scale: HLE · full · Scale official evaluation
- Scale: HLE · text only · Scale official evaluation
- Scale: SWE Atlas · QnA · claude code
- Scale: SWE Atlas · Refactoring · claude code
- Scale: SWE Atlas · Test Writing · claude code
- Scale: SWE-bench Pro public
- scale.com
- scale.com
- SWE-rebench: SWE-rebench · 2025-08 · tools
- swebench.com
- tbench.ai
- Terminal-Bench: Terminal-Bench 4.0 · claudecode
- Vals AI: Vals AI · Code Migration v1
- Vals AI: Vals AI · Excel Modeling Benchmark v1
- Vals AI: Vals AI · Finance Agent v2
- Vals AI: Vals AI · Harvey Legal Agent Benchmark v1
- Vals AI: Vals AI · Legal Research Bench v1
- Vals AI: Vals AI · MMLU-Pro v1
- Vals AI: Vals AI · Terminal-Bench 2.1
- Vals AI: Vals AI · Vibe Code Bench v1.1
- vals.ai
- vulcanbench.com
- vulcanbench.com
- vulcanbench.com
- vulcanbench.com
- vulcanbench.com
- vulcanbench.com
- vulcanbench.com
- vulcanbench.com
- x.com
- zai-org/GLM-5.3
Customize ranking
Full ranking
215 entriesNo capabilities are weighted. Increase a weight to compare model performance.
| Rank | Model | Capability | USD / AA task | Evidence breadth | analyst-agent | briefcase | aime | apex-agents | aa-lcr | automationbench | critpt | enterprise-ops | gdp-pdf | gdpval | gmmlu | gpqa | harvey | hle | ifbench | itbench | livecodebench | math500 | mmlu-pro | mmmu-pro | omniscience | scicode | tau-bench | terminal-bench | arc-agi | deepswe | swe-bench-pro | arc-agi-3 | frontiercode | enigma-eval | swe-atlas-qna | swe-atlas-refactoring | swe-atlas-test-writing | livebench-math | livebench-coding | livebench-language | livebench-data | multi-swe-bench | livebench-reasoning | livebench-instructions | swe-rebench | epoch-game-puzzles | frontiermath | simpleqa | vals-finance-agent | vals-code-migration | vals-legal-research | vals-excel-modeling | vibe-code | chartography | osworld | charxiv | swe-bench-multilingual | deepsearchqa | officeqa | mcp-atlas | toolathlon | mrcr | browsecomp |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 · MaxAnthropic | 85.8 | $7.62971On the cost frontierPrice source ↗ | Independent corroboration63 published · 35 families · 6 task areas25% weight: Anthropic (reported)Why this score? | 96.928/28 peersIndependent evidence | 100.087/87 peersIndependent evidence | 98.448/48 peersIndependent evidence | — | 99.9198/198 peersIndependent evidence | 99.589/89 peersIndependent evidence | 98.6200/200 peersIndependent evidence | — | 97.188/88 peersIndependent evidence | 100.0123/123 peersIndependent evidence | — | 98.4212/212 peersIndependent evidence | 66.550/50 peersIndependent evidence | 100.0208/208 peersIndependent evidence | — | — | — | — | 100.031/31 peersIndependent evidence | — | 100.0198/198 peersIndependent evidence | 100.091/91 peersIndependent evidence | 94.2112/112 peersIndependent evidence | 100.0125/125 peersIndependent evidence | 97.738/38 peersIndependent evidence | — | — | — | 87.47/7 peersIndependent evidence | — | — | — | — | 91.626/26 peersIndependent evidence | 91.126/26 peersIndependent evidence | 79.526/26 peersIndependent evidence | 64.226/26 peersIndependent evidence | 87.826/26 peersIndependent evidence | 77.226/26 peersIndependent evidence | 66.426/26 peersIndependent evidence | — | 93.960/60 peersIndependent evidence | 95.739/39 peersIndependent evidence | 97.025/25 peersIndependent evidence | 87.030/30 peersIndependent evidence | 90.733/33 peersIndependent evidence | 98.332/32 peersIndependent evidence | 100.032/32 peersIndependent evidence | 96.732/32 peersIndependent evidence | 100.02/2 peersPublisher reports | 100.02/2 peersPublisher reports | — | — | — | — | — | — | — | — |
| 2 | GPT-6 Astra · XHighOpenAI | 83.1 | $2.3088On the cost frontierPrice source ↗ | Independent corroboration26 published · 20 families · 6 task areas25% weight: CognitionWhy this score? | — | 95.787/87 peersIndependent evidence | — | — | 93.7197/197 peersIndependent evidence | 100.089/89 peersIndependent evidence | 99.9200/200 peersIndependent evidence | — | 100.088/88 peersIndependent evidence | 92.7123/123 peersIndependent evidence | — | 100.0212/212 peersIndependent evidence | — | 99.6208/208 peersIndependent evidence | — | — | — | — | — | 100.0114/114 peersIndependent evidence | 99.5198/198 peersIndependent evidence | 91.191/91 peersIndependent evidence | 88.4112/112 peersIndependent evidence | 99.8125/125 peersIndependent evidence | 100.038/38 peersIndependent evidence | 100.025/25 peersIndependent evidence | — | 100.06/6 peersIndependent evidence | 100.05/5 peersIndependent evidence | — | — | 100.02/2 peersIndependent evidence | 100.02/2 peersIndependent evidence | — | — | — | — | — | — | — | — | — | 100.029/29 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 3 | Claude Opus 5 · MediumAnthropic | 75.7 | $2.18948Within budgetPrice source ↗ | Independent corroboration20 published · 15 families · 6 task areas46% weight: CognitionWhy this score? | — | 90.387/87 peersIndependent evidence | — | — | 97.7198/198 peersIndependent evidence | 85.889/89 peersIndependent evidence | 97.4200/200 peersIndependent evidence | — | 88.188/88 peersIndependent evidence | 92.9123/123 peersIndependent evidence | — | 95.0212/212 peersIndependent evidence | — | 99.3208/208 peersIndependent evidence | — | — | — | — | — | 95.6114/114 peersIndependent evidence | 98.6198/198 peersIndependent evidence | 78.691/91 peersIndependent evidence | 83.0112/112 peersIndependent evidence | 96.1125/125 peersIndependent evidence | — | 83.325/25 peersIndependent evidence | — | — | 96.97/7 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 4 | GPT-5.6 Sol · XHighOpenAI | 72.0 | $1.18436On the cost frontierPrice source ↗ | Independent corroboration25 published · 18 families · 6 task areas27% weight: CognitionWhy this score? | — | 87.987/87 peersIndependent evidence | — | — | 88.4198/198 peersIndependent evidence | 87.389/89 peersIndependent evidence | 98.0200/200 peersIndependent evidence | — | 98.488/88 peersIndependent evidence | 93.0123/123 peersIndependent evidence | — | 97.2212/212 peersIndependent evidence | — | 98.1208/208 peersIndependent evidence | 83.9178/178 peersIndependent evidence | — | — | — | — | 97.0114/114 peersIndependent evidence | 98.7198/198 peersIndependent evidence | 94.991/91 peersIndependent evidence | 80.2202/202 peersIndependent evidence | 96.8201/201 peersIndependent evidence | 98.138/38 peersIndependent evidence | 87.125/25 peersIndependent evidence | — | — | 85.75/5 peersIndependent evidence | — | 100.02/2 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 5 | Muse Spark 1.3 · XHighMeta | 70.3 | $1.36779Within budgetPrice source ↗ | Independent corroboration49 published · 27 families · 6 task areas33% weight: Artificial AnalysisWhy this score? | — | 93.887/87 peersIndependent evidence | — | — | 98.3197/197 peersIndependent evidence | 98.389/89 peersIndependent evidence | 97.0200/200 peersIndependent evidence | — | 96.088/88 peersIndependent evidence | 98.8123/123 peersIndependent evidence | — | 99.1212/212 peersIndependent evidence | 98.250/50 peersIndependent evidence | 98.1208/208 peersIndependent evidence | — | — | — | — | — | 93.7114/114 peersIndependent evidence | 90.0198/198 peersIndependent evidence | 98.891/91 peersIndependent evidence | 95.3112/112 peersIndependent evidence | 76.7126/126 peersIndependent evidence | — | — | — | — | — | — | — | — | — | 82.626/26 peersIndependent evidence | 76.526/26 peersIndependent evidence | 56.626/26 peersIndependent evidence | 75.926/26 peersIndependent evidence | 89.726/26 peersIndependent evidence | 74.726/26 peersIndependent evidence | 90.526/26 peersIndependent evidence | — | — | — | — | 92.730/30 peersIndependent evidence | — | 70.632/32 peersIndependent evidence | 57.632/32 peersIndependent evidence | 93.232/32 peersIndependent evidence | — | — | — | — | 100.01/1 peersPublisher reports | — | — | — | 100.01/1 peersPublisher reports | — |
| 6 | Gemini 3.8 Flash · MediumGoogle | 70.0 | $0.93104On the cost frontierPrice source ↗ | Independent corroboration18 published · 15 families · 6 task areas38% weight: Artificial AnalysisWhy this score? | — | 76.787/87 peersIndependent evidence | — | — | 99.7197/197 peersIndependent evidence | 97.589/89 peersIndependent evidence | 90.8200/200 peersIndependent evidence | — | 93.388/88 peersIndependent evidence | 89.0123/123 peersIndependent evidence | — | 98.2212/212 peersIndependent evidence | — | 94.7208/208 peersIndependent evidence | — | — | — | — | — | 98.3114/114 peersIndependent evidence | 96.6198/198 peersIndependent evidence | 90.091/91 peersIndependent evidence | 91.1112/112 peersIndependent evidence | 89.8125/125 peersIndependent evidence | — | 90.025/25 peersIndependent evidence | — | — | 85.66/6 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 7 | Claude Fable 5 · MaxAnthropic | 69.0 | $8.74596Within budgetPrice source ↗ | Independent corroboration67 published · 37 families · 6 task areas20% weight: Anthropic (reported)Why this score? | 83.828/28 peersIndependent evidence | 95.687/87 peersIndependent evidence | 100.01/1 peersIndependent evidence | — | 97.5198/198 peersIndependent evidence | 84.489/89 peersIndependent evidence | 97.9200/200 peersIndependent evidence | 100.041/41 peersIndependent evidence | 95.288/88 peersIndependent evidence | 95.3123/123 peersIndependent evidence | — | 68.3213/213 peersIndependent evidence | 94.537/37 peersIndependent evidence | 99.7208/208 peersIndependent evidence | 73.6178/178 peersIndependent evidence | — | — | — | 93.231/31 peersIndependent evidence | — | 99.8198/198 peersIndependent evidence | 99.891/91 peersIndependent evidence | 92.0202/202 peersIndependent evidence | 39.3201/201 peersIndependent evidence | 96.138/38 peersIndependent evidence | 84.025/25 peersIndependent evidence | — | — | 97.97/7 peersIndependent evidence | — | — | — | — | 78.126/26 peersIndependent evidence | 82.926/26 peersIndependent evidence | 80.226/26 peersIndependent evidence | 64.726/26 peersIndependent evidence | 83.926/26 peersIndependent evidence | 63.626/26 peersIndependent evidence | 74.026/26 peersIndependent evidence | — | 93.940/40 peersIndependent evidence | 93.739/39 peersIndependent evidence | — | 73.230/30 peersIndependent evidence | 94.033/33 peersIndependent evidence | 93.432/32 peersIndependent evidence | 96.732/32 peersIndependent evidence | 100.032/32 peersIndependent evidence | 49.62/2 peersPublisher reports | 0.02/2 peersPublisher reports | — | — | — | — | — | — | — | — |
| 8 | Grok 4.6 · HighxAI | 62.4 | $1.85894Within budgetPrice source ↗ | Independent corroboration35 published · 27 families · 5 task areas16% weight: Vals AIWhy this score? | 63.528/28 peersIndependent evidence | 96.187/87 peersIndependent evidence | 87.148/48 peersIndependent evidence | — | 71.4198/198 peersIndependent evidence | 99.589/89 peersIndependent evidence | 92.7200/200 peersIndependent evidence | 91.041/41 peersIndependent evidence | 83.388/88 peersIndependent evidence | 96.1123/123 peersIndependent evidence | — | 96.2213/213 peersIndependent evidence | 90.432/32 peersIndependent evidence | 95.4208/208 peersIndependent evidence | — | — | — | — | 70.731/31 peersIndependent evidence | — | 93.6198/198 peersIndependent evidence | 92.391/91 peersIndependent evidence | 98.8112/112 peersIndependent evidence | 97.8126/126 peersIndependent evidence | 74.238/38 peersIndependent evidence | 65.025/25 peersIndependent evidence | — | — | 100.01/1 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | 89.250/50 peersIndependent evidence | — | 54.425/25 peersIndependent evidence | 46.730/30 peersIndependent evidence | 76.233/33 peersIndependent evidence | 85.832/32 peersIndependent evidence | 50.732/32 peersIndependent evidence | 62.532/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 9 | Kimi K3 · MaxMoonshot | 62.0 | $2.00013Within budgetPrice source ↗ | Independent corroboration49 published · 33 families · 6 task areas25% weight: Moonshot AI (reported)Why this score? | 59.028/28 peersIndependent evidence | 93.987/87 peersIndependent evidence | 86.048/48 peersIndependent evidence | 97.226/26 peersIndependent evidence | 93.2198/198 peersIndependent evidence | 98.289/89 peersIndependent evidence | 96.1200/200 peersIndependent evidence | 80.541/41 peersIndependent evidence | 91.888/88 peersIndependent evidence | 92.7123/123 peersIndependent evidence | — | 82.3213/213 peersIndependent evidence | 97.037/37 peersIndependent evidence | 52.8208/208 peersIndependent evidence | — | 95.228/28 peersIndependent evidence | — | — | 59.231/31 peersIndependent evidence | 74.4115/115 peersIndependent evidence | 92.5198/198 peersIndependent evidence | 98.191/91 peersIndependent evidence | 94.5112/112 peersIndependent evidence | 89.0125/125 peersIndependent evidence | 66.938/38 peersIndependent evidence | 79.025/25 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.860/60 peersIndependent evidence | 70.539/39 peersIndependent evidence | 54.525/25 peersIndependent evidence | — | 29.733/33 peersIndependent evidence | — | 80.732/32 peersIndependent evidence | — | — | 83.33/3 peersPublisher reports | 100.03/3 peersPublisher reports | — | 100.01/1 peersPublisher reports | 75.04/4 peersPublisher reports | 100.04/4 peersPublisher reports | 100.04/4 peersPublisher reports | — | — |
| 10 | Gemini 3.7 Flash · HighGoogle | 57.6 | $0.92534Within budgetPrice source ↗ | Independent corroboration61 published · 35 families · 6 task areas13% weight: Terminal-BenchWhy this score? | 100.028/28 peersIndependent evidence | 73.487/87 peersIndependent evidence | 78.848/48 peersIndependent evidence | — | 75.9198/198 peersIndependent evidence | 97.189/89 peersIndependent evidence | 89.3200/200 peersIndependent evidence | — | 93.788/88 peersIndependent evidence | 87.3123/123 peersIndependent evidence | — | 96.6213/213 peersIndependent evidence | 78.150/50 peersIndependent evidence | 97.9208/208 peersIndependent evidence | — | — | — | — | 83.831/31 peersIndependent evidence | 99.2114/114 peersIndependent evidence | 97.5198/198 peersIndependent evidence | 93.391/91 peersIndependent evidence | 82.8112/112 peersIndependent evidence | 12.9126/126 peersIndependent evidence | 89.838/38 peersIndependent evidence | 67.225/25 peersIndependent evidence | — | — | 100.06/6 peersIndependent evidence | — | — | — | — | 59.626/26 peersIndependent evidence | 48.326/26 peersIndependent evidence | 73.326/26 peersIndependent evidence | 27.126/26 peersIndependent evidence | 75.526/26 peersIndependent evidence | 56.026/26 peersIndependent evidence | 91.326/26 peersIndependent evidence | — | 85.560/60 peersIndependent evidence | 64.839/39 peersIndependent evidence | 88.025/25 peersIndependent evidence | 93.330/30 peersIndependent evidence | 39.533/33 peersIndependent evidence | 34.532/32 peersIndependent evidence | 81.232/32 peersIndependent evidence | 46.732/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 11 | GLM-5.3 · MaxZ.ai | 57.5 | $2.00564Within budgetPrice source ↗ | Independent corroboration36 published · 26 families · 5 task areas17% weight: CognitionWhy this score? | — | 94.887/87 peersIndependent evidence | 61.948/48 peersIndependent evidence | — | 90.8198/198 peersIndependent evidence | 98.289/89 peersIndependent evidence | 93.5200/200 peersIndependent evidence | 39.741/41 peersIndependent evidence | 62.788/88 peersIndependent evidence | 98.9123/123 peersIndependent evidence | — | 80.5213/213 peersIndependent evidence | 74.132/32 peersIndependent evidence | 92.2208/208 peersIndependent evidence | — | — | — | — | 30.131/31 peersIndependent evidence | — | 80.4198/198 peersIndependent evidence | 97.491/91 peersIndependent evidence | 98.4112/112 peersIndependent evidence | 50.2126/126 peersIndependent evidence | — | 85.325/25 peersIndependent evidence | — | — | 80.66/6 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | 63.060/60 peersIndependent evidence | 56.939/39 peersIndependent evidence | 29.225/25 peersIndependent evidence | 66.630/30 peersIndependent evidence | 68.433/33 peersIndependent evidence | 90.032/32 peersIndependent evidence | 32.732/32 peersIndependent evidence | 68.332/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 12 | GPT-5.6 Terra · MaxOpenAI | 54.7 | $1.39872Within budgetPrice source ↗ | Independent corroboration67 published · 38 families · 6 task areas14% weight: LiveBenchWhy this score? | — | 85.287/87 peersIndependent evidence | 96.148/48 peersIndependent evidence | 92.226/26 peersIndependent evidence | 93.5198/198 peersIndependent evidence | 94.889/89 peersIndependent evidence | 98.7200/200 peersIndependent evidence | 39.041/41 peersIndependent evidence | 94.888/88 peersIndependent evidence | 90.1123/123 peersIndependent evidence | — | 92.4213/213 peersIndependent evidence | 35.750/50 peersIndependent evidence | 95.3208/208 peersIndependent evidence | 84.2178/178 peersIndependent evidence | 96.428/28 peersIndependent evidence | — | — | — | 92.6114/114 peersIndependent evidence | 93.0198/198 peersIndependent evidence | 87.791/91 peersIndependent evidence | 84.1202/202 peersIndependent evidence | 42.6201/201 peersIndependent evidence | 85.938/38 peersIndependent evidence | 81.525/25 peersIndependent evidence | — | 45.06/6 peersIndependent evidence | 64.25/5 peersIndependent evidence | — | — | — | — | 56.326/26 peersIndependent evidence | 47.526/26 peersIndependent evidence | 49.126/26 peersIndependent evidence | 69.626/26 peersIndependent evidence | 59.626/26 peersIndependent evidence | 77.426/26 peersIndependent evidence | 26.926/26 peersIndependent evidence | — | 91.360/60 peersIndependent evidence | 81.539/39 peersIndependent evidence | 33.36/6 peersIndependent evidence | 59.930/30 peersIndependent evidence | 84.933/33 peersIndependent evidence | 68.532/32 peersIndependent evidence | 66.132/32 peersIndependent evidence | 56.132/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 13 | Muse Spark 1.2 · XHighMeta | 45.6 | $0.97469Within budgetPrice source ↗ | Independent corroboration54 published · 31 families · 5 task areas22% weight: Meta (reported)Why this score? | — | 86.287/87 peersIndependent evidence | — | — | 85.5198/198 peersIndependent evidence | 12.989/89 peersIndependent evidence | 92.1200/200 peersIndependent evidence | 85.541/41 peersIndependent evidence | 82.888/88 peersIndependent evidence | 91.4123/123 peersIndependent evidence | — | 88.3212/212 peersIndependent evidence | 100.032/32 peersIndependent evidence | 95.7208/208 peersIndependent evidence | — | — | — | — | 55.231/31 peersIndependent evidence | — | 90.1198/198 peersIndependent evidence | 93.191/91 peersIndependent evidence | 83.9112/112 peersIndependent evidence | 62.9126/126 peersIndependent evidence | — | 51.825/25 peersIndependent evidence | — | — | — | — | — | — | — | 43.926/26 peersIndependent evidence | 43.626/26 peersIndependent evidence | 49.826/26 peersIndependent evidence | 56.326/26 peersIndependent evidence | 69.026/26 peersIndependent evidence | 55.526/26 peersIndependent evidence | 68.726/26 peersIndependent evidence | — | — | — | 82.525/25 peersIndependent evidence | 97.230/30 peersIndependent evidence | 33.733/33 peersIndependent evidence | 77.232/32 peersIndependent evidence | 45.032/32 peersIndependent evidence | 75.732/32 peersIndependent evidence | — | — | — | — | 0.01/1 peersPublisher reports | — | — | — | 0.01/1 peersPublisher reports | — |
| 14 | Qwen 3.8-Max · ReasoningQwen | 45.2 | $2.66998Within budgetPrice source ↗ | Single independent source16 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score? | — | 87.087/87 peersIndependent evidence | — | — | 83.7198/198 peersIndependent evidence | 81.989/89 peersIndependent evidence | 95.4200/200 peersIndependent evidence | — | 90.088/88 peersIndependent evidence | 95.2123/123 peersIndependent evidence | — | 96.2212/212 peersIndependent evidence | — | 96.7208/208 peersIndependent evidence | — | — | — | — | — | 95.7114/114 peersIndependent evidence | 82.1198/198 peersIndependent evidence | 84.491/91 peersIndependent evidence | 100.0112/112 peersIndependent evidence | 87.6125/125 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 15 | DeepSeek V4-Pro 0813 · MaxDeepSeek | 44.8 | $0.67402Within budgetPrice source ↗ | Independent corroboration33 published · 25 families · 5 task areas28% weight: Artificial AnalysisWhy this score? | — | 82.387/87 peersIndependent evidence | 89.148/48 peersIndependent evidence | — | 82.9198/198 peersIndependent evidence | 90.289/89 peersIndependent evidence | 93.1200/200 peersIndependent evidence | 94.641/41 peersIndependent evidence | 66.588/88 peersIndependent evidence | 90.4123/123 peersIndependent evidence | — | 86.8213/213 peersIndependent evidence | 70.932/32 peersIndependent evidence | 91.4208/208 peersIndependent evidence | — | — | — | — | 38.131/31 peersIndependent evidence | — | 93.7198/198 peersIndependent evidence | 74.291/91 peersIndependent evidence | 88.8112/112 peersIndependent evidence | 50.2126/126 peersIndependent evidence | 73.138/38 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 91.160/60 peersIndependent evidence | 48.839/39 peersIndependent evidence | 65.625/25 peersIndependent evidence | 36.430/30 peersIndependent evidence | 66.833/33 peersIndependent evidence | 66.432/32 peersIndependent evidence | 27.432/32 peersIndependent evidence | 85.332/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 16 | Qwen3.8-2.4T-A95B · ReasoningQwen | 43.5 | $2.15516Within budgetPrice source ↗ | Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score? | — | 89.687/87 peersIndependent evidence | — | — | 58.6198/198 peersIndependent evidence | 92.789/89 peersIndependent evidence | 95.4200/200 peersIndependent evidence | 95.041/41 peersIndependent evidence | 80.588/88 peersIndependent evidence | 94.0123/123 peersIndependent evidence | — | 98.3212/212 peersIndependent evidence | — | 95.6208/208 peersIndependent evidence | — | — | — | — | — | — | 81.6198/198 peersIndependent evidence | 86.891/91 peersIndependent evidence | 96.8112/112 peersIndependent evidence | 84.8125/125 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 17 | GLM-5.3-Flash · ReasoningZ.ai | 42.1 | $0.25326On the cost frontierPrice source ↗ | Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score? | — | 91.687/87 peersIndependent evidence | — | — | 94.3198/198 peersIndependent evidence | 97.089/89 peersIndependent evidence | 92.5200/200 peersIndependent evidence | 39.441/41 peersIndependent evidence | 77.988/88 peersIndependent evidence | 98.0123/123 peersIndependent evidence | — | 93.1212/212 peersIndependent evidence | — | 93.1208/208 peersIndependent evidence | — | — | — | — | — | — | 75.6198/198 peersIndependent evidence | 80.891/91 peersIndependent evidence | 93.7112/112 peersIndependent evidence | 93.2125/125 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 18 | GPT-5.6 Luna · MaxOpenAI | 40.7 | $0.1783On the cost frontierPrice source ↗ | Independent corroboration65 published · 38 families · 6 task areas14% weight: Vals AIWhy this score? | — | 85.487/87 peersIndependent evidence | 88.448/48 peersIndependent evidence | 85.726/26 peersIndependent evidence | 89.1198/198 peersIndependent evidence | 82.789/89 peersIndependent evidence | 95.4200/200 peersIndependent evidence | 54.941/41 peersIndependent evidence | 94.588/88 peersIndependent evidence | 90.5123/123 peersIndependent evidence | — | 85.2213/213 peersIndependent evidence | 41.550/50 peersIndependent evidence | 91.1208/208 peersIndependent evidence | — | 72.528/28 peersIndependent evidence | — | — | 16.231/31 peersIndependent evidence | 85.9114/114 peersIndependent evidence | 89.9198/198 peersIndependent evidence | 83.791/91 peersIndependent evidence | 80.0112/112 peersIndependent evidence | 13.1126/126 peersIndependent evidence | 62.538/38 peersIndependent evidence | 71.125/25 peersIndependent evidence | — | 10.46/6 peersIndependent evidence | 55.55/5 peersIndependent evidence | — | — | — | — | 24.526/26 peersIndependent evidence | 73.326/26 peersIndependent evidence | 14.926/26 peersIndependent evidence | 61.926/26 peersIndependent evidence | 29.626/26 peersIndependent evidence | 32.326/26 peersIndependent evidence | 16.526/26 peersIndependent evidence | — | 71.360/60 peersIndependent evidence | 78.339/39 peersIndependent evidence | 16.76/6 peersIndependent evidence | 63.230/30 peersIndependent evidence | 72.933/33 peersIndependent evidence | 37.632/32 peersIndependent evidence | 74.932/32 peersIndependent evidence | 65.532/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 19 | Qwen3.8-Flash-Next · ReasoningQwen | 40.7 | $0.37218Within budgetPrice source ↗ | Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score? | — | 98.187/87 peersIndependent evidence | — | — | 93.5197/197 peersIndependent evidence | 88.889/89 peersIndependent evidence | 90.2200/200 peersIndependent evidence | — | 80.588/88 peersIndependent evidence | 96.8123/123 peersIndependent evidence | — | 95.2212/212 peersIndependent evidence | — | 91.6208/208 peersIndependent evidence | — | — | — | — | — | 91.2114/114 peersIndependent evidence | 67.3198/198 peersIndependent evidence | 75.091/91 peersIndependent evidence | 90.3112/112 peersIndependent evidence | 93.7125/125 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 20 | Gemini 3.6 Flash · HighGoogle | 39.1 | $0.92884Within budgetPrice source ↗ | Independent corroboration59 published · 34 families · 6 task areas15% weight: DatacurveWhy this score? | — | 65.387/87 peersIndependent evidence | 75.548/48 peersIndependent evidence | — | 72.8198/198 peersIndependent evidence | 81.989/89 peersIndependent evidence | 84.9200/200 peersIndependent evidence | — | 81.688/88 peersIndependent evidence | 81.3123/123 peersIndependent evidence | — | 96.1213/213 peersIndependent evidence | 46.050/50 peersIndependent evidence | 90.1208/208 peersIndependent evidence | — | — | — | — | 67.431/31 peersIndependent evidence | 96.3114/114 peersIndependent evidence | 93.6198/198 peersIndependent evidence | 80.291/91 peersIndependent evidence | 77.0112/112 peersIndependent evidence | 68.3126/126 peersIndependent evidence | 66.538/38 peersIndependent evidence | 25.525/25 peersIndependent evidence | — | — | 52.06/6 peersIndependent evidence | — | — | — | — | 28.326/26 peersIndependent evidence | 40.826/26 peersIndependent evidence | 69.026/26 peersIndependent evidence | 29.026/26 peersIndependent evidence | 20.426/26 peersIndependent evidence | 45.426/26 peersIndependent evidence | 76.826/26 peersIndependent evidence | — | 72.560/60 peersIndependent evidence | 33.639/39 peersIndependent evidence | 78.725/25 peersIndependent evidence | 69.730/30 peersIndependent evidence | 34.133/33 peersIndependent evidence | 22.432/32 peersIndependent evidence | 62.932/32 peersIndependent evidence | 35.132/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 21 | Claude Sonnet 5 · MaxAnthropic | 38.0 | $5.09116Within budgetPrice source ↗ | Independent corroboration38 published · 28 families · 6 task areas19% weight: CognitionWhy this score? | 79.828/28 peersIndependent evidence | 86.287/87 peersIndependent evidence | 49.448/48 peersIndependent evidence | — | 95.8198/198 peersIndependent evidence | 75.989/89 peersIndependent evidence | 92.8200/200 peersIndependent evidence | 78.541/41 peersIndependent evidence | 73.788/88 peersIndependent evidence | 91.4123/123 peersIndependent evidence | — | 49.2213/213 peersIndependent evidence | 55.150/50 peersIndependent evidence | 93.7208/208 peersIndependent evidence | — | — | — | — | 43.831/31 peersIndependent evidence | 80.3114/114 peersIndependent evidence | 89.2198/198 peersIndependent evidence | 87.791/91 peersIndependent evidence | 85.6112/112 peersIndependent evidence | 12.3126/126 peersIndependent evidence | — | 37.325/25 peersIndependent evidence | — | — | 50.87/7 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | 67.760/60 peersIndependent evidence | 51.639/39 peersIndependent evidence | 24.725/25 peersIndependent evidence | 53.630/30 peersIndependent evidence | 71.633/33 peersIndependent evidence | 71.232/32 peersIndependent evidence | 70.032/32 peersIndependent evidence | 80.432/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 22 | Grok-4.5 · HighxAI | 37.3 | $1.03646Within budgetPrice source ↗ | Independent corroboration42 published · 31 families · 6 task areas13% weight: DatacurveWhy this score? | 52.128/28 peersIndependent evidence | 82.887/87 peersIndependent evidence | 82.848/48 peersIndependent evidence | — | 71.9198/198 peersIndependent evidence | 92.789/89 peersIndependent evidence | 89.2200/200 peersIndependent evidence | 55.041/41 peersIndependent evidence | 85.188/88 peersIndependent evidence | 85.4123/123 peersIndependent evidence | — | 89.9213/213 peersIndependent evidence | 87.250/50 peersIndependent evidence | 93.6208/208 peersIndependent evidence | — | — | — | — | 64.431/31 peersIndependent evidence | 90.0114/114 peersIndependent evidence | 94.4198/198 peersIndependent evidence | 85.991/91 peersIndependent evidence | 91.0112/112 peersIndependent evidence | 7.8126/126 peersIndependent evidence | 54.638/38 peersIndependent evidence | 46.525/25 peersIndependent evidence | — | 28.86/6 peersIndependent evidence | 33.31/1 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | 57.17/7 peersIndependent evidence | 79.950/50 peersIndependent evidence | 33.939/39 peersIndependent evidence | 44.025/25 peersIndependent evidence | 23.430/30 peersIndependent evidence | 48.633/33 peersIndependent evidence | 42.332/32 peersIndependent evidence | 25.132/32 peersIndependent evidence | 40.732/32 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — |
| 23 | DeepSeek-V4-Flash-0731 · MaxDeepSeek | 37.1 | $0.21964Within budgetPrice source ↗ | Independent corroboration24 published · 18 families · 5 task areas27% weight: Artificial AnalysisWhy this score? | — | 81.387/87 peersIndependent evidence | 74.048/48 peersIndependent evidence | — | 74.9198/198 peersIndependent evidence | 84.889/89 peersIndependent evidence | 90.8200/200 peersIndependent evidence | — | 61.888/88 peersIndependent evidence | 88.0123/123 peersIndependent evidence | — | 83.2213/213 peersIndependent evidence | — | 88.7208/208 peersIndependent evidence | — | — | — | — | — | — | 87.2198/198 peersIndependent evidence | 69.591/91 peersIndependent evidence | 87.7112/112 peersIndependent evidence | 83.5125/125 peersIndependent evidence | 74.338/38 peersIndependent evidence | 36.925/25 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 75.860/60 peersIndependent evidence | 39.739/39 peersIndependent evidence | 21.225/25 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 24 | DeepSeek V4-Pro 0424 · MaxDeepSeek | 34.9 | $0.12152Within budgetPrice source ↗ | Single independent source23 published · 18 families · 5 task areas100% weight: Artificial AnalysisWhy this score? | 58.528/28 peersIndependent evidence | 67.587/87 peersIndependent evidence | — | 65.726/26 peersIndependent evidence | 82.6198/198 peersIndependent evidence | 90.589/89 peersIndependent evidence | 92.0200/200 peersIndependent evidence | 61.841/41 peersIndependent evidence | 75.488/88 peersIndependent evidence | 81.9123/123 peersIndependent evidence | — | 89.6212/212 peersIndependent evidence | 70.737/37 peersIndependent evidence | 92.8208/208 peersIndependent evidence | 95.5178/178 peersIndependent evidence | 80.728/28 peersIndependent evidence | — | — | — | — | 91.5198/198 peersIndependent evidence | 77.491/91 peersIndependent evidence | 87.7202/202 peersIndependent evidence | 86.3201/201 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| 25 | Qwen3.8-27B · XHighQwen | 34.2 | $0.82019Within budgetPrice source ↗ | Single independent source18 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score? | — | 87.187/87 peersIndependent evidence | — | — | 90.7198/198 peersIndependent evidence | 79.689/89 peersIndependent evidence | 85.3200/200 peersIndependent evidence | 83.441/41 peersIndependent evidence | 80.688/88 peersIndependent evidence | 90.7123/123 peersIndependent evidence | — | 93.6212/212 peersIndependent evidence | — | 90.2208/208 peersIndependent evidence | — | — | — | — | — | 85.1114/114 peersIndependent evidence | 29.2198/198 peersIndependent evidence | 59.391/91 peersIndependent evidence | 94.6112/112 peersIndependent evidence | 79.9125/125 peersIndependent evidence | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
No models match these filters. Try another name or adjust the filters above.
Behind the ranking
273 entries with published results · 55 ranked · 167 unranked in Value.
Explore seven capabilities, the original results, and gaps in the evidence.
Cite this ranking
Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.
UnifyBench ranking Data updated: 12 Sept 2026 Mode: value; evidence: documented; configurations: best Pricing collected: 11 Sept 2026 Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000 https://unifybench.ai/?evidence=documented&mode=value&view=shortlist
Catalog data · Effort measurements · Configuration scoring rules · Methodology
What does the score mean?
The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.
Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.
Read the full methodology →