The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.

Token counts for price scenarios

Output includes reasoning. Fixed token counts compare prices; they do not measure task efficiency.

89 of 398 supported configurations have comparable costs. Unknown costs and over-budget entries remain visible without a Value rank. Prices collected 2026-09-11; comparisons expire after 30 days.

USD per weighted AA v4.3 task, including reasoning, cache treatment and reviewed fallback routing. This workload does not represent every task. Cost evidence currently comes from Artificial Analysis only. Cost frontier, components and gaps ↗ · Value methodology

Value leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Value ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelCapabilityUSD / AA taskEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
GPT-5.1 · HighOpenAI21.7UnknownNo current, exact configuration price mapping in this collection.Independent corroboration18 published · 15 families · 6 task areas59% weight: Artificial AnalysisWhy this score?96.5108/108 peersIndependent evidence94.2197/197 peersIndependent evidence82.4200/200 peersIndependent evidence57.6123/123 peersIndependent evidence92.963/63 peersIndependent evidence84.7212/212 peersIndependent evidence82.2208/208 peersIndependent evidence88.9178/178 peersIndependent evidence96.6112/112 peersIndependent evidence96.3114/114 peersIndependent evidence80.3114/114 peersIndependent evidence86.7198/198 peersIndependent evidence66.5202/202 peersIndependent evidence78.1201/201 peersIndependent evidence56.138/38 peersIndependent evidence
GLM-5 · ReasoningZ.ai20.2UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?31.026/26 peersIndependent evidence87.3197/197 peersIndependent evidence76.6200/200 peersIndependent evidence72.3212/212 peersIndependent evidence86.3208/208 peersIndependent evidence87.6178/178 peersIndependent evidence73.5198/198 peersIndependent evidence97.4171/171 peersIndependent evidence94.6169/169 peersIndependent evidence
GLM-4.7 · ReasoningZ.ai19.3UnknownNo current, exact configuration price mapping in this collection.Single independent source15 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?97.2108/108 peersIndependent evidence77.2197/197 peersIndependent evidence76.1200/200 peersIndependent evidence72.1123/123 peersIndependent evidence83.8212/212 peersIndependent evidence81.3208/208 peersIndependent evidence81.9178/178 peersIndependent evidence98.5112/112 peersIndependent evidence92.2114/114 peersIndependent evidence78.8198/198 peersIndependent evidence72.9202/202 peersIndependent evidence67.9201/201 peersIndependent evidence
Qwen3.5-27B · ReasoningQwen19.1UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 11 families · 6 task areas100% weight: Artificial AnalysisWhy this score?90.7197/197 peersIndependent evidence64.9200/200 peersIndependent evidence79.963/63 peersIndependent evidence83.5212/212 peersIndependent evidence79.3208/208 peersIndependent evidence93.5178/178 peersIndependent evidence67.028/28 peersIndependent evidence81.0114/114 peersIndependent evidence56.5198/198 peersIndependent evidence89.6171/171 peersIndependent evidence80.0169/169 peersIndependent evidence
Solar Pro 4 · ReasoningUpstage19.1UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source13 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?82.9197/197 peersIndependent evidence49.489/89 peersIndependent evidence84.6200/200 peersIndependent evidence43.988/88 peersIndependent evidence80.5123/123 peersIndependent evidence88.7212/212 peersIndependent evidence84.9208/208 peersIndependent evidence49.7198/198 peersIndependent evidence51.891/91 peersIndependent evidence69.7112/112 peersIndependent evidence58.7125/125 peersIndependent evidence
Claude Sonnet 4.5 · Thinking 32KAnthropic18.9UnknownNo current, exact configuration price mapping in this collection.Independent corroboration5 published · 4 families · 1 task areas53% weight: ARC PrizeWhy this score?100.01/1 peersIndependent evidence55.038/38 peersIndependent evidence50.01/1 peersIndependent evidence15.739/39 peersIndependent evidence
GLM-5-Turbo · ReasoningZ.ai18.6UnknownNo current, exact configuration price mapping in this collection.Single independent source9 published · 8 families · 5 task areas100% weight: Artificial AnalysisWhy this score?78.0197/197 peersIndependent evidence55.8200/200 peersIndependent evidence80.2212/212 peersIndependent evidence81.7208/208 peersIndependent evidence90.0178/178 peersIndependent evidence77.8198/198 peersIndependent evidence98.9171/171 peersIndependent evidence82.2169/169 peersIndependent evidence
Hy3-preview · ReasoningTencent18.4UnknownNo current, exact configuration price mapping in this collection.Single independent source9 published · 8 families · 5 task areas100% weight: Artificial AnalysisWhy this score?68.5197/197 peersIndependent evidence82.6200/200 peersIndependent evidence86.0212/212 peersIndependent evidence82.4208/208 peersIndependent evidence74.9178/178 peersIndependent evidence76.8198/198 peersIndependent evidence87.6171/171 peersIndependent evidence82.8169/169 peersIndependent evidence
Solar Open2 250B · ReasoningUpstage18.1UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?77.7197/197 peersIndependent evidence85.9200/200 peersIndependent evidence63.7123/123 peersIndependent evidence82.0212/212 peersIndependent evidence83.9208/208 peersIndependent evidence49.2198/198 peersIndependent evidence65.391/91 peersIndependent evidence65.0112/112 peersIndependent evidence55.7125/125 peersIndependent evidence
GPT-5.4 Mini · XHighOpenAI18.0UnknownNo current, exact configuration price mapping in this collection.Independent corroboration58 published · 35 families · 6 task areas22% weight: Artificial AnalysisWhy this score?30.228/28 peersIndependent evidence46.587/87 peersIndependent evidence64.826/26 peersIndependent evidence52.6198/198 peersIndependent evidence64.289/89 peersIndependent evidence86.1200/200 peersIndependent evidence35.741/41 peersIndependent evidence70.288/88 peersIndependent evidence68.4123/123 peersIndependent evidence86.263/63 peersIndependent evidence83.0212/212 peersIndependent evidence10.850/50 peersIndependent evidence79.1208/208 peersIndependent evidence88.9178/178 peersIndependent evidence55.228/28 peersIndependent evidence8.031/31 peersIndependent evidence69.8114/114 peersIndependent evidence84.4198/198 peersIndependent evidence76.791/91 peersIndependent evidence72.1202/202 peersIndependent evidence73.9201/201 peersIndependent evidence47.638/38 peersIndependent evidence12.95/5 peersIndependent evidence12.326/26 peersIndependent evidence4.026/26 peersIndependent evidence16.626/26 peersIndependent evidence56.926/26 peersIndependent evidence24.326/26 peersIndependent evidence6.526/26 peersIndependent evidence6.926/26 peersIndependent evidence20.230/30 peersIndependent evidence15.233/33 peersIndependent evidence7.932/32 peersIndependent evidence19.832/32 peersIndependent evidence26.532/32 peersIndependent evidence
GPT-5 · HighOpenAI18.0UnknownNo current, exact configuration price mapping in this collection.Independent corroboration23 published · 17 families · 6 task areas46% weight: Artificial AnalysisWhy this score?96.6108/108 peersIndependent evidence88.3197/197 peersIndependent evidence85.2200/200 peersIndependent evidence59.6123/123 peersIndependent evidence95.363/63 peersIndependent evidence81.1212/212 peersIndependent evidence83.2208/208 peersIndependent evidence89.3178/178 peersIndependent evidence94.9112/112 peersIndependent evidence100.060/60 peersIndependent evidence96.1114/114 peersIndependent evidence75.8114/114 peersIndependent evidence89.9198/198 peersIndependent evidence72.7202/202 peersIndependent evidence60.5201/201 peersIndependent evidence47.038/38 peersIndependent evidence58.82/2 peersIndependent evidence
o4-mini · HighOpenAI17.7UnknownNo current, exact configuration price mapping in this collection.Independent corroboration16 published · 14 families · 6 task areas42% weight: Artificial AnalysisWhy this score?93.1108/108 peersIndependent evidence56.6197/197 peersIndependent evidence61.0200/200 peersIndependent evidence61.0212/212 peersIndependent evidence66.2208/208 peersIndependent evidence80.2178/178 peersIndependent evidence99.4112/112 peersIndependent evidence97.560/60 peersIndependent evidence85.4114/114 peersIndependent evidence59.8114/114 peersIndependent evidence66.1198/198 peersIndependent evidence59.3171/171 peersIndependent evidence53.7169/169 peersIndependent evidence36.638/38 peersIndependent evidence
MiniMax-M2.5 · ReasoningMiniMax17.7UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?81.7197/197 peersIndependent evidence70.7200/200 peersIndependent evidence67.063/63 peersIndependent evidence80.6212/212 peersIndependent evidence74.9208/208 peersIndependent evidence87.3178/178 peersIndependent evidence73.2198/198 peersIndependent evidence93.5171/171 peersIndependent evidence85.2169/169 peersIndependent evidence
o3 · ReasoningOpenAI17.1UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?91.5108/108 peersIndependent evidence83.8197/197 peersIndependent evidence70.1200/200 peersIndependent evidence72.2212/212 peersIndependent evidence73.5208/208 peersIndependent evidence86.0178/178 peersIndependent evidence91.9112/112 peersIndependent evidence99.660/60 peersIndependent evidence91.3114/114 peersIndependent evidence65.0114/114 peersIndependent evidence88.4198/198 peersIndependent evidence73.3171/171 peersIndependent evidence89.2169/169 peersIndependent evidence
DeepSeek-V3.2 · ReasoningDeepSeek17.0UnknownNo current, exact configuration price mapping in this collection.Single independent source16 published · 14 families · 5 task areas100% weight: Artificial AnalysisWhy this score?95.5108/108 peersIndependent evidence38.826/26 peersIndependent evidence82.1197/197 peersIndependent evidence78.2200/200 peersIndependent evidence49.5123/123 peersIndependent evidence78.363/63 peersIndependent evidence76.1212/212 peersIndependent evidence79.4208/208 peersIndependent evidence72.6178/178 peersIndependent evidence95.5112/112 peersIndependent evidence94.4114/114 peersIndependent evidence84.1198/198 peersIndependent evidence85.3171/171 peersIndependent evidence72.2201/201 peersIndependent evidence
MiMo-V2-Flash · ReasoningXiaomi16.9UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?98.0108/108 peersIndependent evidence76.5197/197 peersIndependent evidence81.9200/200 peersIndependent evidence67.663/63 peersIndependent evidence80.3212/212 peersIndependent evidence77.8208/208 peersIndependent evidence76.7178/178 peersIndependent evidence96.4112/112 peersIndependent evidence89.5114/114 peersIndependent evidence68.9198/198 peersIndependent evidence92.5171/171 peersIndependent evidence72.3169/169 peersIndependent evidence
GPT-5.4 Nano · XHighOpenAI16.5UnknownNo current, exact configuration price mapping in this collection.Independent corroboration47 published · 26 families · 6 task areas41% weight: Artificial AnalysisWhy this score?43.587/87 peersIndependent evidence59.326/26 peersIndependent evidence57.6198/198 peersIndependent evidence43.989/89 peersIndependent evidence87.0200/200 peersIndependent evidence28.941/41 peersIndependent evidence48.788/88 peersIndependent evidence62.4123/123 peersIndependent evidence68.8212/212 peersIndependent evidence9.937/37 peersIndependent evidence80.7208/208 peersIndependent evidence93.8178/178 peersIndependent evidence19.728/28 peersIndependent evidence52.7114/114 peersIndependent evidence70.7198/198 peersIndependent evidence59.891/91 peersIndependent evidence71.3202/202 peersIndependent evidence68.9201/201 peersIndependent evidence37.738/38 peersIndependent evidence39.926/26 peersIndependent evidence3.426/26 peersIndependent evidence6.926/26 peersIndependent evidence45.326/26 peersIndependent evidence36.126/26 peersIndependent evidence30.226/26 peersIndependent evidence46.026/26 peersIndependent evidence
Gemini 3.1 Flash-Lite · HighGoogle16.2UnknownNo current, exact configuration price mapping in this collection.Single independent source4 published · 4 families · 1 task areas100% weight: Epoch AIWhy this score?63.848/48 peersIndependent evidence55.347/47 peersIndependent evidence75.450/50 peersIndependent evidence44.039/39 peersIndependent evidence
DeepSeek-V3.2-Speciale · ReasoningDeepSeek16.2UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?99.0108/108 peersIndependent evidence73.2197/197 peersIndependent evidence86.3200/200 peersIndependent evidence85.863/63 peersIndependent evidence84.8212/212 peersIndependent evidence83.7208/208 peersIndependent evidence76.3178/178 peersIndependent evidence99.5112/112 peersIndependent evidence95.6114/114 peersIndependent evidence87.6198/198 peersIndependent evidence2.3171/171 peersIndependent evidence85.1169/169 peersIndependent evidence
MiniMax-M2.7 · ReasoningMiniMax15.9UnknownNo current, exact configuration price mapping in this collection.Single independent source21 published · 16 families · 5 task areas100% weight: Artificial AnalysisWhy this score?35.028/28 peersIndependent evidence49.287/87 peersIndependent evidence18.526/26 peersIndependent evidence62.1198/198 peersIndependent evidence41.589/89 peersIndependent evidence62.8200/200 peersIndependent evidence48.688/88 peersIndependent evidence69.3123/123 peersIndependent evidence84.7212/212 peersIndependent evidence84.4208/208 peersIndependent evidence93.6178/178 peersIndependent evidence26.328/28 peersIndependent evidence74.2198/198 peersIndependent evidence72.291/91 peersIndependent evidence59.7202/202 peersIndependent evidence60.9201/201 peersIndependent evidence
Step 3.7 Flash · ReasoningStepFun15.8UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source18 published · 15 families · 6 task areas100% weight: Artificial AnalysisWhy this score?46.126/26 peersIndependent evidence80.6197/197 peersIndependent evidence75.4200/200 peersIndependent evidence23.141/41 peersIndependent evidence59.7123/123 peersIndependent evidence67.0212/212 peersIndependent evidence31.037/37 peersIndependent evidence74.7208/208 peersIndependent evidence79.9178/178 peersIndependent evidence36.828/28 peersIndependent evidence78.2114/114 peersIndependent evidence71.5198/198 peersIndependent evidence50.691/91 peersIndependent evidence75.7202/202 peersIndependent evidence68.4201/201 peersIndependent evidence
GLM-5V-Turbo · ReasoningZ.ai15.3UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?74.9197/197 peersIndependent evidence63.1200/200 peersIndependent evidence67.9212/212 peersIndependent evidence70.1208/208 peersIndependent evidence74.0178/178 peersIndependent evidence73.5114/114 peersIndependent evidence79.0198/198 peersIndependent evidence98.9171/171 peersIndependent evidence80.5169/169 peersIndependent evidence
Qwen3.5-35B-A3B · ReasoningQwen13.4UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 11 families · 6 task areas100% weight: Artificial AnalysisWhy this score?80.4197/197 peersIndependent evidence67.1200/200 peersIndependent evidence74.463/63 peersIndependent evidence79.4212/212 peersIndependent evidence76.4208/208 peersIndependent evidence88.9178/178 peersIndependent evidence14.428/28 peersIndependent evidence73.5114/114 peersIndependent evidence54.1198/198 peersIndependent evidence83.6171/171 peersIndependent evidence70.1169/169 peersIndependent evidence
MiniMax-M2.1 · ReasoningMiniMax13.4UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?82.6108/108 peersIndependent evidence70.3197/197 peersIndependent evidence56.4200/200 peersIndependent evidence66.163/63 peersIndependent evidence74.1212/212 peersIndependent evidence77.4208/208 peersIndependent evidence83.1178/178 peersIndependent evidence92.8112/112 peersIndependent evidence98.1114/114 peersIndependent evidence59.1198/198 peersIndependent evidence79.7171/171 peersIndependent evidence75.6169/169 peersIndependent evidence
Gemma 4 31B IT · ReasoningGoogle13.2UnknownZero-price workload is not a verified sustainable cost.Price source ↗Single independent source21 published · 17 families · 6 task areas100% weight: Artificial AnalysisWhy this score?27.887/87 peersIndependent evidence72.8197/197 peersIndependent evidence43.289/89 peersIndependent evidence73.8200/200 peersIndependent evidence14.641/41 peersIndependent evidence48.988/88 peersIndependent evidence46.3123/123 peersIndependent evidence82.0212/212 peersIndependent evidence5.937/37 peersIndependent evidence78.2208/208 peersIndependent evidence93.4178/178 peersIndependent evidence69.828/28 peersIndependent evidence74.6114/114 peersIndependent evidence53.5198/198 peersIndependent evidence57.591/91 peersIndependent evidence57.8202/202 peersIndependent evidence55.1201/201 peersIndependent evidence

Behind the ranking

273 entries with published results · 55 ranked · 167 unranked in Value.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: value; evidence: documented; configurations: best
Pricing collected: 11 Sept 2026
Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000
https://unifybench.ai/?mode=value&page=4

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →