The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.

Token counts for price scenarios

Output includes reasoning. Fixed token counts compare prices; they do not measure task efficiency.

89 of 398 supported configurations have comparable costs. Unknown costs and over-budget entries remain visible without a Value rank. Prices collected 2026-09-11; comparisons expire after 30 days.

USD per weighted AA v4.3 task, including reasoning, cache treatment and reviewed fallback routing. This workload does not represent every task. Cost evidence currently comes from Artificial Analysis only. Cost frontier, components and gaps ↗ · Value methodology

Value leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

451 entries

Value ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelCapabilityUSD / AA taskEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
1Claude Fable 5.1 · MaxAnthropic85.8$7.62971On the cost frontierPrice source ↗Independent corroboration63 published · 35 families · 6 task areas25% weight: Anthropic (reported)Why this score?96.928/28 peersIndependent evidence100.087/87 peersIndependent evidence98.448/48 peersIndependent evidence99.9198/198 peersIndependent evidence99.589/89 peersIndependent evidence98.6200/200 peersIndependent evidence97.188/88 peersIndependent evidence100.0123/123 peersIndependent evidence98.4212/212 peersIndependent evidence66.550/50 peersIndependent evidence100.0208/208 peersIndependent evidence100.031/31 peersIndependent evidence100.0198/198 peersIndependent evidence100.091/91 peersIndependent evidence94.2112/112 peersIndependent evidence100.0125/125 peersIndependent evidence97.738/38 peersIndependent evidence87.47/7 peersIndependent evidence91.626/26 peersIndependent evidence91.126/26 peersIndependent evidence79.526/26 peersIndependent evidence64.226/26 peersIndependent evidence87.826/26 peersIndependent evidence77.226/26 peersIndependent evidence66.426/26 peersIndependent evidence93.960/60 peersIndependent evidence95.739/39 peersIndependent evidence97.025/25 peersIndependent evidence87.030/30 peersIndependent evidence90.733/33 peersIndependent evidence98.332/32 peersIndependent evidence100.032/32 peersIndependent evidence96.732/32 peersIndependent evidence100.02/2 peersPublisher reports100.02/2 peersPublisher reports
2GPT-6 Astra · XHighOpenAI83.1$2.3088On the cost frontierPrice source ↗Independent corroboration26 published · 20 families · 6 task areas25% weight: CognitionWhy this score?95.787/87 peersIndependent evidence93.7197/197 peersIndependent evidence100.089/89 peersIndependent evidence99.9200/200 peersIndependent evidence100.088/88 peersIndependent evidence92.7123/123 peersIndependent evidence100.0212/212 peersIndependent evidence99.6208/208 peersIndependent evidence100.0114/114 peersIndependent evidence99.5198/198 peersIndependent evidence91.191/91 peersIndependent evidence88.4112/112 peersIndependent evidence99.8125/125 peersIndependent evidence100.038/38 peersIndependent evidence100.025/25 peersIndependent evidence100.06/6 peersIndependent evidence100.05/5 peersIndependent evidence100.02/2 peersIndependent evidence100.02/2 peersIndependent evidence100.029/29 peersIndependent evidence
3Claude Opus 5 · MediumAnthropic75.7$2.18948Within budgetPrice source ↗Independent corroboration20 published · 15 families · 6 task areas46% weight: CognitionWhy this score?90.387/87 peersIndependent evidence97.7198/198 peersIndependent evidence85.889/89 peersIndependent evidence97.4200/200 peersIndependent evidence88.188/88 peersIndependent evidence92.9123/123 peersIndependent evidence95.0212/212 peersIndependent evidence99.3208/208 peersIndependent evidence95.6114/114 peersIndependent evidence98.6198/198 peersIndependent evidence78.691/91 peersIndependent evidence83.0112/112 peersIndependent evidence96.1125/125 peersIndependent evidence83.325/25 peersIndependent evidence96.97/7 peersIndependent evidence
4GPT-5.6 Sol · XHighOpenAI72.0$1.18436On the cost frontierPrice source ↗Independent corroboration25 published · 18 families · 6 task areas27% weight: CognitionWhy this score?87.987/87 peersIndependent evidence88.4198/198 peersIndependent evidence87.389/89 peersIndependent evidence98.0200/200 peersIndependent evidence98.488/88 peersIndependent evidence93.0123/123 peersIndependent evidence97.2212/212 peersIndependent evidence98.1208/208 peersIndependent evidence83.9178/178 peersIndependent evidence97.0114/114 peersIndependent evidence98.7198/198 peersIndependent evidence94.991/91 peersIndependent evidence80.2202/202 peersIndependent evidence96.8201/201 peersIndependent evidence98.138/38 peersIndependent evidence87.125/25 peersIndependent evidence85.75/5 peersIndependent evidence100.02/2 peersIndependent evidence
5Muse Spark 1.3 · XHighMeta70.3$1.36779Within budgetPrice source ↗Independent corroboration49 published · 27 families · 6 task areas33% weight: Artificial AnalysisWhy this score?93.887/87 peersIndependent evidence98.3197/197 peersIndependent evidence98.389/89 peersIndependent evidence97.0200/200 peersIndependent evidence96.088/88 peersIndependent evidence98.8123/123 peersIndependent evidence99.1212/212 peersIndependent evidence98.250/50 peersIndependent evidence98.1208/208 peersIndependent evidence93.7114/114 peersIndependent evidence90.0198/198 peersIndependent evidence98.891/91 peersIndependent evidence95.3112/112 peersIndependent evidence76.7126/126 peersIndependent evidence82.626/26 peersIndependent evidence76.526/26 peersIndependent evidence56.626/26 peersIndependent evidence75.926/26 peersIndependent evidence89.726/26 peersIndependent evidence74.726/26 peersIndependent evidence90.526/26 peersIndependent evidence92.730/30 peersIndependent evidence70.632/32 peersIndependent evidence57.632/32 peersIndependent evidence93.232/32 peersIndependent evidence100.01/1 peersPublisher reports100.01/1 peersPublisher reports
6Gemini 3.8 Flash · MediumGoogle70.0$0.93104On the cost frontierPrice source ↗Independent corroboration18 published · 15 families · 6 task areas38% weight: Artificial AnalysisWhy this score?76.787/87 peersIndependent evidence99.7197/197 peersIndependent evidence97.589/89 peersIndependent evidence90.8200/200 peersIndependent evidence93.388/88 peersIndependent evidence89.0123/123 peersIndependent evidence98.2212/212 peersIndependent evidence94.7208/208 peersIndependent evidence98.3114/114 peersIndependent evidence96.6198/198 peersIndependent evidence90.091/91 peersIndependent evidence91.1112/112 peersIndependent evidence89.8125/125 peersIndependent evidence90.025/25 peersIndependent evidence85.66/6 peersIndependent evidence
7Claude Fable 5 · MaxAnthropic69.0$8.74596Within budgetPrice source ↗Independent corroboration67 published · 37 families · 6 task areas20% weight: Anthropic (reported)Why this score?83.828/28 peersIndependent evidence95.687/87 peersIndependent evidence100.01/1 peersIndependent evidence97.5198/198 peersIndependent evidence84.489/89 peersIndependent evidence97.9200/200 peersIndependent evidence100.041/41 peersIndependent evidence95.288/88 peersIndependent evidence95.3123/123 peersIndependent evidence68.3213/213 peersIndependent evidence94.537/37 peersIndependent evidence99.7208/208 peersIndependent evidence73.6178/178 peersIndependent evidence93.231/31 peersIndependent evidence99.8198/198 peersIndependent evidence99.891/91 peersIndependent evidence92.0202/202 peersIndependent evidence39.3201/201 peersIndependent evidence96.138/38 peersIndependent evidence84.025/25 peersIndependent evidence97.97/7 peersIndependent evidence78.126/26 peersIndependent evidence82.926/26 peersIndependent evidence80.226/26 peersIndependent evidence64.726/26 peersIndependent evidence83.926/26 peersIndependent evidence63.626/26 peersIndependent evidence74.026/26 peersIndependent evidence93.940/40 peersIndependent evidence93.739/39 peersIndependent evidence73.230/30 peersIndependent evidence94.033/33 peersIndependent evidence93.432/32 peersIndependent evidence96.732/32 peersIndependent evidence100.032/32 peersIndependent evidence49.62/2 peersPublisher reports0.02/2 peersPublisher reports
8Grok 4.6 · HighxAI62.4$1.85894Within budgetPrice source ↗Independent corroboration35 published · 27 families · 5 task areas16% weight: Vals AIWhy this score?63.528/28 peersIndependent evidence96.187/87 peersIndependent evidence87.148/48 peersIndependent evidence71.4198/198 peersIndependent evidence99.589/89 peersIndependent evidence92.7200/200 peersIndependent evidence91.041/41 peersIndependent evidence83.388/88 peersIndependent evidence96.1123/123 peersIndependent evidence96.2213/213 peersIndependent evidence90.432/32 peersIndependent evidence95.4208/208 peersIndependent evidence70.731/31 peersIndependent evidence93.6198/198 peersIndependent evidence92.391/91 peersIndependent evidence98.8112/112 peersIndependent evidence97.8126/126 peersIndependent evidence74.238/38 peersIndependent evidence65.025/25 peersIndependent evidence100.01/1 peersIndependent evidence89.250/50 peersIndependent evidence54.425/25 peersIndependent evidence46.730/30 peersIndependent evidence76.233/33 peersIndependent evidence85.832/32 peersIndependent evidence50.732/32 peersIndependent evidence62.532/32 peersIndependent evidence
9Kimi K3 · MaxMoonshot62.0$2.00013Within budgetPrice source ↗Independent corroboration49 published · 33 families · 6 task areas25% weight: Moonshot AI (reported)Why this score?59.028/28 peersIndependent evidence93.987/87 peersIndependent evidence86.048/48 peersIndependent evidence97.226/26 peersIndependent evidence93.2198/198 peersIndependent evidence98.289/89 peersIndependent evidence96.1200/200 peersIndependent evidence80.541/41 peersIndependent evidence91.888/88 peersIndependent evidence92.7123/123 peersIndependent evidence82.3213/213 peersIndependent evidence97.037/37 peersIndependent evidence52.8208/208 peersIndependent evidence95.228/28 peersIndependent evidence59.231/31 peersIndependent evidence74.4115/115 peersIndependent evidence92.5198/198 peersIndependent evidence98.191/91 peersIndependent evidence94.5112/112 peersIndependent evidence89.0125/125 peersIndependent evidence66.938/38 peersIndependent evidence79.025/25 peersIndependent evidence74.860/60 peersIndependent evidence70.539/39 peersIndependent evidence54.525/25 peersIndependent evidence29.733/33 peersIndependent evidence80.732/32 peersIndependent evidence83.33/3 peersPublisher reports100.03/3 peersPublisher reports100.01/1 peersPublisher reports75.04/4 peersPublisher reports100.04/4 peersPublisher reports100.04/4 peersPublisher reports
10Gemini 3.7 Flash · HighGoogle57.6$0.92534Within budgetPrice source ↗Independent corroboration61 published · 35 families · 6 task areas13% weight: Terminal-BenchWhy this score?100.028/28 peersIndependent evidence73.487/87 peersIndependent evidence78.848/48 peersIndependent evidence75.9198/198 peersIndependent evidence97.189/89 peersIndependent evidence89.3200/200 peersIndependent evidence93.788/88 peersIndependent evidence87.3123/123 peersIndependent evidence96.6213/213 peersIndependent evidence78.150/50 peersIndependent evidence97.9208/208 peersIndependent evidence83.831/31 peersIndependent evidence99.2114/114 peersIndependent evidence97.5198/198 peersIndependent evidence93.391/91 peersIndependent evidence82.8112/112 peersIndependent evidence12.9126/126 peersIndependent evidence89.838/38 peersIndependent evidence67.225/25 peersIndependent evidence100.06/6 peersIndependent evidence59.626/26 peersIndependent evidence48.326/26 peersIndependent evidence73.326/26 peersIndependent evidence27.126/26 peersIndependent evidence75.526/26 peersIndependent evidence56.026/26 peersIndependent evidence91.326/26 peersIndependent evidence85.560/60 peersIndependent evidence64.839/39 peersIndependent evidence88.025/25 peersIndependent evidence93.330/30 peersIndependent evidence39.533/33 peersIndependent evidence34.532/32 peersIndependent evidence81.232/32 peersIndependent evidence46.732/32 peersIndependent evidence
11GLM-5.3 · MaxZ.ai57.5$2.00564Within budgetPrice source ↗Independent corroboration36 published · 26 families · 5 task areas17% weight: CognitionWhy this score?94.887/87 peersIndependent evidence61.948/48 peersIndependent evidence90.8198/198 peersIndependent evidence98.289/89 peersIndependent evidence93.5200/200 peersIndependent evidence39.741/41 peersIndependent evidence62.788/88 peersIndependent evidence98.9123/123 peersIndependent evidence80.5213/213 peersIndependent evidence74.132/32 peersIndependent evidence92.2208/208 peersIndependent evidence30.131/31 peersIndependent evidence80.4198/198 peersIndependent evidence97.491/91 peersIndependent evidence98.4112/112 peersIndependent evidence50.2126/126 peersIndependent evidence85.325/25 peersIndependent evidence80.66/6 peersIndependent evidence63.060/60 peersIndependent evidence56.939/39 peersIndependent evidence29.225/25 peersIndependent evidence66.630/30 peersIndependent evidence68.433/33 peersIndependent evidence90.032/32 peersIndependent evidence32.732/32 peersIndependent evidence68.332/32 peersIndependent evidence
12GPT-5.6 Terra · MaxOpenAI54.7$1.39872Within budgetPrice source ↗Independent corroboration67 published · 38 families · 6 task areas14% weight: LiveBenchWhy this score?85.287/87 peersIndependent evidence96.148/48 peersIndependent evidence92.226/26 peersIndependent evidence93.5198/198 peersIndependent evidence94.889/89 peersIndependent evidence98.7200/200 peersIndependent evidence39.041/41 peersIndependent evidence94.888/88 peersIndependent evidence90.1123/123 peersIndependent evidence92.4213/213 peersIndependent evidence35.750/50 peersIndependent evidence95.3208/208 peersIndependent evidence84.2178/178 peersIndependent evidence96.428/28 peersIndependent evidence92.6114/114 peersIndependent evidence93.0198/198 peersIndependent evidence87.791/91 peersIndependent evidence84.1202/202 peersIndependent evidence42.6201/201 peersIndependent evidence85.938/38 peersIndependent evidence81.525/25 peersIndependent evidence45.06/6 peersIndependent evidence64.25/5 peersIndependent evidence56.326/26 peersIndependent evidence47.526/26 peersIndependent evidence49.126/26 peersIndependent evidence69.626/26 peersIndependent evidence59.626/26 peersIndependent evidence77.426/26 peersIndependent evidence26.926/26 peersIndependent evidence91.360/60 peersIndependent evidence81.539/39 peersIndependent evidence33.36/6 peersIndependent evidence59.930/30 peersIndependent evidence84.933/33 peersIndependent evidence68.532/32 peersIndependent evidence66.132/32 peersIndependent evidence56.132/32 peersIndependent evidence
13Muse Spark 1.2 · XHighMeta45.6$0.97469Within budgetPrice source ↗Independent corroboration54 published · 31 families · 5 task areas22% weight: Meta (reported)Why this score?86.287/87 peersIndependent evidence85.5198/198 peersIndependent evidence12.989/89 peersIndependent evidence92.1200/200 peersIndependent evidence85.541/41 peersIndependent evidence82.888/88 peersIndependent evidence91.4123/123 peersIndependent evidence88.3212/212 peersIndependent evidence100.032/32 peersIndependent evidence95.7208/208 peersIndependent evidence55.231/31 peersIndependent evidence90.1198/198 peersIndependent evidence93.191/91 peersIndependent evidence83.9112/112 peersIndependent evidence62.9126/126 peersIndependent evidence51.825/25 peersIndependent evidence43.926/26 peersIndependent evidence43.626/26 peersIndependent evidence49.826/26 peersIndependent evidence56.326/26 peersIndependent evidence69.026/26 peersIndependent evidence55.526/26 peersIndependent evidence68.726/26 peersIndependent evidence82.525/25 peersIndependent evidence97.230/30 peersIndependent evidence33.733/33 peersIndependent evidence77.232/32 peersIndependent evidence45.032/32 peersIndependent evidence75.732/32 peersIndependent evidence0.01/1 peersPublisher reports0.01/1 peersPublisher reports
14Qwen 3.8-Max · ReasoningQwen45.2$2.66998Within budgetPrice source ↗Single independent source16 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?87.087/87 peersIndependent evidence83.7198/198 peersIndependent evidence81.989/89 peersIndependent evidence95.4200/200 peersIndependent evidence90.088/88 peersIndependent evidence95.2123/123 peersIndependent evidence96.2212/212 peersIndependent evidence96.7208/208 peersIndependent evidence95.7114/114 peersIndependent evidence82.1198/198 peersIndependent evidence84.491/91 peersIndependent evidence100.0112/112 peersIndependent evidence87.6125/125 peersIndependent evidence
15DeepSeek V4-Pro 0813 · MaxDeepSeek44.8$0.67402Within budgetPrice source ↗Independent corroboration33 published · 25 families · 5 task areas28% weight: Artificial AnalysisWhy this score?82.387/87 peersIndependent evidence89.148/48 peersIndependent evidence82.9198/198 peersIndependent evidence90.289/89 peersIndependent evidence93.1200/200 peersIndependent evidence94.641/41 peersIndependent evidence66.588/88 peersIndependent evidence90.4123/123 peersIndependent evidence86.8213/213 peersIndependent evidence70.932/32 peersIndependent evidence91.4208/208 peersIndependent evidence38.131/31 peersIndependent evidence93.7198/198 peersIndependent evidence74.291/91 peersIndependent evidence88.8112/112 peersIndependent evidence50.2126/126 peersIndependent evidence73.138/38 peersIndependent evidence91.160/60 peersIndependent evidence48.839/39 peersIndependent evidence65.625/25 peersIndependent evidence36.430/30 peersIndependent evidence66.833/33 peersIndependent evidence66.432/32 peersIndependent evidence27.432/32 peersIndependent evidence85.332/32 peersIndependent evidence
16Qwen3.8-2.4T-A95B · ReasoningQwen43.5$2.15516Within budgetPrice source ↗Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?89.687/87 peersIndependent evidence58.6198/198 peersIndependent evidence92.789/89 peersIndependent evidence95.4200/200 peersIndependent evidence95.041/41 peersIndependent evidence80.588/88 peersIndependent evidence94.0123/123 peersIndependent evidence98.3212/212 peersIndependent evidence95.6208/208 peersIndependent evidence81.6198/198 peersIndependent evidence86.891/91 peersIndependent evidence96.8112/112 peersIndependent evidence84.8125/125 peersIndependent evidence
17GLM-5.3-Flash · ReasoningZ.ai42.1$0.25326On the cost frontierPrice source ↗Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?91.687/87 peersIndependent evidence94.3198/198 peersIndependent evidence97.089/89 peersIndependent evidence92.5200/200 peersIndependent evidence39.441/41 peersIndependent evidence77.988/88 peersIndependent evidence98.0123/123 peersIndependent evidence93.1212/212 peersIndependent evidence93.1208/208 peersIndependent evidence75.6198/198 peersIndependent evidence80.891/91 peersIndependent evidence93.7112/112 peersIndependent evidence93.2125/125 peersIndependent evidence
18GPT-5.6 Luna · MaxOpenAI40.7$0.1783On the cost frontierPrice source ↗Independent corroboration65 published · 38 families · 6 task areas14% weight: Vals AIWhy this score?85.487/87 peersIndependent evidence88.448/48 peersIndependent evidence85.726/26 peersIndependent evidence89.1198/198 peersIndependent evidence82.789/89 peersIndependent evidence95.4200/200 peersIndependent evidence54.941/41 peersIndependent evidence94.588/88 peersIndependent evidence90.5123/123 peersIndependent evidence85.2213/213 peersIndependent evidence41.550/50 peersIndependent evidence91.1208/208 peersIndependent evidence72.528/28 peersIndependent evidence16.231/31 peersIndependent evidence85.9114/114 peersIndependent evidence89.9198/198 peersIndependent evidence83.791/91 peersIndependent evidence80.0112/112 peersIndependent evidence13.1126/126 peersIndependent evidence62.538/38 peersIndependent evidence71.125/25 peersIndependent evidence10.46/6 peersIndependent evidence55.55/5 peersIndependent evidence24.526/26 peersIndependent evidence73.326/26 peersIndependent evidence14.926/26 peersIndependent evidence61.926/26 peersIndependent evidence29.626/26 peersIndependent evidence32.326/26 peersIndependent evidence16.526/26 peersIndependent evidence71.360/60 peersIndependent evidence78.339/39 peersIndependent evidence16.76/6 peersIndependent evidence63.230/30 peersIndependent evidence72.933/33 peersIndependent evidence37.632/32 peersIndependent evidence74.932/32 peersIndependent evidence65.532/32 peersIndependent evidence
19Qwen3.8-Flash-Next · ReasoningQwen40.7$0.37218Within budgetPrice source ↗Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?98.187/87 peersIndependent evidence93.5197/197 peersIndependent evidence88.889/89 peersIndependent evidence90.2200/200 peersIndependent evidence80.588/88 peersIndependent evidence96.8123/123 peersIndependent evidence95.2212/212 peersIndependent evidence91.6208/208 peersIndependent evidence91.2114/114 peersIndependent evidence67.3198/198 peersIndependent evidence75.091/91 peersIndependent evidence90.3112/112 peersIndependent evidence93.7125/125 peersIndependent evidence
20Gemini 3.6 Flash · HighGoogle39.1$0.92884Within budgetPrice source ↗Independent corroboration59 published · 34 families · 6 task areas15% weight: DatacurveWhy this score?65.387/87 peersIndependent evidence75.548/48 peersIndependent evidence72.8198/198 peersIndependent evidence81.989/89 peersIndependent evidence84.9200/200 peersIndependent evidence81.688/88 peersIndependent evidence81.3123/123 peersIndependent evidence96.1213/213 peersIndependent evidence46.050/50 peersIndependent evidence90.1208/208 peersIndependent evidence67.431/31 peersIndependent evidence96.3114/114 peersIndependent evidence93.6198/198 peersIndependent evidence80.291/91 peersIndependent evidence77.0112/112 peersIndependent evidence68.3126/126 peersIndependent evidence66.538/38 peersIndependent evidence25.525/25 peersIndependent evidence52.06/6 peersIndependent evidence28.326/26 peersIndependent evidence40.826/26 peersIndependent evidence69.026/26 peersIndependent evidence29.026/26 peersIndependent evidence20.426/26 peersIndependent evidence45.426/26 peersIndependent evidence76.826/26 peersIndependent evidence72.560/60 peersIndependent evidence33.639/39 peersIndependent evidence78.725/25 peersIndependent evidence69.730/30 peersIndependent evidence34.133/33 peersIndependent evidence22.432/32 peersIndependent evidence62.932/32 peersIndependent evidence35.132/32 peersIndependent evidence
21Claude Sonnet 5 · MaxAnthropic38.0$5.09116Within budgetPrice source ↗Independent corroboration38 published · 28 families · 6 task areas19% weight: CognitionWhy this score?79.828/28 peersIndependent evidence86.287/87 peersIndependent evidence49.448/48 peersIndependent evidence95.8198/198 peersIndependent evidence75.989/89 peersIndependent evidence92.8200/200 peersIndependent evidence78.541/41 peersIndependent evidence73.788/88 peersIndependent evidence91.4123/123 peersIndependent evidence49.2213/213 peersIndependent evidence55.150/50 peersIndependent evidence93.7208/208 peersIndependent evidence43.831/31 peersIndependent evidence80.3114/114 peersIndependent evidence89.2198/198 peersIndependent evidence87.791/91 peersIndependent evidence85.6112/112 peersIndependent evidence12.3126/126 peersIndependent evidence37.325/25 peersIndependent evidence50.87/7 peersIndependent evidence67.760/60 peersIndependent evidence51.639/39 peersIndependent evidence24.725/25 peersIndependent evidence53.630/30 peersIndependent evidence71.633/33 peersIndependent evidence71.232/32 peersIndependent evidence70.032/32 peersIndependent evidence80.432/32 peersIndependent evidence
22Grok-4.5 · HighxAI37.3$1.03646Within budgetPrice source ↗Independent corroboration42 published · 31 families · 6 task areas13% weight: DatacurveWhy this score?52.128/28 peersIndependent evidence82.887/87 peersIndependent evidence82.848/48 peersIndependent evidence71.9198/198 peersIndependent evidence92.789/89 peersIndependent evidence89.2200/200 peersIndependent evidence55.041/41 peersIndependent evidence85.188/88 peersIndependent evidence85.4123/123 peersIndependent evidence89.9213/213 peersIndependent evidence87.250/50 peersIndependent evidence93.6208/208 peersIndependent evidence64.431/31 peersIndependent evidence90.0114/114 peersIndependent evidence94.4198/198 peersIndependent evidence85.991/91 peersIndependent evidence91.0112/112 peersIndependent evidence7.8126/126 peersIndependent evidence54.638/38 peersIndependent evidence46.525/25 peersIndependent evidence28.86/6 peersIndependent evidence33.31/1 peersIndependent evidence57.17/7 peersIndependent evidence79.950/50 peersIndependent evidence33.939/39 peersIndependent evidence44.025/25 peersIndependent evidence23.430/30 peersIndependent evidence48.633/33 peersIndependent evidence42.332/32 peersIndependent evidence25.132/32 peersIndependent evidence40.732/32 peersIndependent evidence
23DeepSeek-V4-Flash-0731 · MaxDeepSeek37.1$0.21964Within budgetPrice source ↗Independent corroboration24 published · 18 families · 5 task areas27% weight: Artificial AnalysisWhy this score?81.387/87 peersIndependent evidence74.048/48 peersIndependent evidence74.9198/198 peersIndependent evidence84.889/89 peersIndependent evidence90.8200/200 peersIndependent evidence61.888/88 peersIndependent evidence88.0123/123 peersIndependent evidence83.2213/213 peersIndependent evidence88.7208/208 peersIndependent evidence87.2198/198 peersIndependent evidence69.591/91 peersIndependent evidence87.7112/112 peersIndependent evidence83.5125/125 peersIndependent evidence74.338/38 peersIndependent evidence36.925/25 peersIndependent evidence75.860/60 peersIndependent evidence39.739/39 peersIndependent evidence21.225/25 peersIndependent evidence
24DeepSeek V4-Pro 0424 · MaxDeepSeek34.9$0.12152Within budgetPrice source ↗Single independent source23 published · 18 families · 5 task areas100% weight: Artificial AnalysisWhy this score?58.528/28 peersIndependent evidence67.587/87 peersIndependent evidence65.726/26 peersIndependent evidence82.6198/198 peersIndependent evidence90.589/89 peersIndependent evidence92.0200/200 peersIndependent evidence61.841/41 peersIndependent evidence75.488/88 peersIndependent evidence81.9123/123 peersIndependent evidence89.6212/212 peersIndependent evidence70.737/37 peersIndependent evidence92.8208/208 peersIndependent evidence95.5178/178 peersIndependent evidence80.728/28 peersIndependent evidence91.5198/198 peersIndependent evidence77.491/91 peersIndependent evidence87.7202/202 peersIndependent evidence86.3201/201 peersIndependent evidence
25Qwen3.8-27B · XHighQwen34.2$0.82019Within budgetPrice source ↗Single independent source18 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?87.187/87 peersIndependent evidence90.7198/198 peersIndependent evidence79.689/89 peersIndependent evidence85.3200/200 peersIndependent evidence83.441/41 peersIndependent evidence80.688/88 peersIndependent evidence90.7123/123 peersIndependent evidence93.6212/212 peersIndependent evidence90.2208/208 peersIndependent evidence85.1114/114 peersIndependent evidence29.2198/198 peersIndependent evidence59.391/91 peersIndependent evidence94.6112/112 peersIndependent evidence79.9125/125 peersIndependent evidence

Behind the ranking

273 entries with published results · 55 ranked · 167 unranked in Value.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: value; evidence: documented; configurations: best
Pricing collected: 11 Sept 2026
Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000
https://unifybench.ai/?evidence=documented&mode=value&view=overview

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →