The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.

Token counts for price scenarios

Output includes reasoning. Fixed token counts compare prices; they do not measure task efficiency.

89 of 398 supported configurations have comparable costs. Unknown costs and over-budget entries remain visible without a Value rank. Prices collected 2026-09-11; comparisons expire after 30 days.

USD per weighted AA v4.3 task, including reasoning, cache treatment and reviewed fallback routing. This workload does not represent every task. Cost evidence currently comes from Artificial Analysis only. Cost frontier, components and gaps ↗ · Value methodology

Value leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Value ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelCapabilityUSD / AA taskEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
Gemini 2.5 Pro · ReasoningGoogle12.9UnknownNo current, exact configuration price mapping in this collection.Single independent source23 published · 19 families · 6 task areas100% weight: Artificial AnalysisWhy this score?25.387/87 peersIndependent evidence89.7108/108 peersIndependent evidence69.3197/197 peersIndependent evidence32.789/89 peersIndependent evidence75.3200/200 peersIndependent evidence60.688/88 peersIndependent evidence37.0123/123 peersIndependent evidence90.963/63 peersIndependent evidence76.3212/212 peersIndependent evidence75.1208/208 peersIndependent evidence58.9178/178 peersIndependent evidence91.0112/112 peersIndependent evidence77.060/60 peersIndependent evidence94.5114/114 peersIndependent evidence75.1114/114 peersIndependent evidence87.9198/198 peersIndependent evidence61.591/91 peersIndependent evidence49.1202/202 peersIndependent evidence45.8201/201 peersIndependent evidence
MiniMax-M2 · ReasoningMiniMax11.1UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?75.3108/108 peersIndependent evidence66.1197/197 peersIndependent evidence66.8200/200 peersIndependent evidence48.263/63 peersIndependent evidence61.9212/212 peersIndependent evidence63.2208/208 peersIndependent evidence88.1178/178 peersIndependent evidence94.7112/112 peersIndependent evidence78.8114/114 peersIndependent evidence64.9198/198 peersIndependent evidence82.2171/171 peersIndependent evidence71.1169/169 peersIndependent evidence
GPT-5 Mini · HighOpenAI10.9UnknownNo current, exact configuration price mapping in this collection.Independent corroboration25 published · 20 families · 6 task areas40% weight: Artificial AnalysisWhy this score?30.187/87 peersIndependent evidence93.1108/108 peersIndependent evidence77.0197/197 peersIndependent evidence46.389/89 peersIndependent evidence25.3200/200 peersIndependent evidence51.188/88 peersIndependent evidence50.8123/123 peersIndependent evidence81.063/63 peersIndependent evidence71.7212/212 peersIndependent evidence74.4208/208 peersIndependent evidence92.0178/178 peersIndependent evidence94.9112/112 peersIndependent evidence87.0114/114 peersIndependent evidence63.7114/114 peersIndependent evidence69.5198/198 peersIndependent evidence31.591/91 peersIndependent evidence60.6202/202 peersIndependent evidence37.3201/201 peersIndependent evidence33.338/38 peersIndependent evidence37.23/3 peersIndependent evidence
GLM-4.6 · ReasoningZ.ai10.6UnknownNo current, exact configuration price mapping in this collection.Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?88.6108/108 peersIndependent evidence56.0197/197 peersIndependent evidence70.8200/200 peersIndependent evidence52.6123/123 peersIndependent evidence73.163/63 peersIndependent evidence63.1212/212 peersIndependent evidence66.3208/208 peersIndependent evidence50.3178/178 peersIndependent evidence72.8112/112 peersIndependent evidence83.0114/114 peersIndependent evidence75.1198/198 peersIndependent evidence60.2202/202 peersIndependent evidence64.6201/201 peersIndependent evidence
ERNIE-5.0-thinking-preview · ReasoningBaidu10.5UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?88.2108/108 peersIndependent evidence73.5200/200 peersIndependent evidence78.563/63 peersIndependent evidence61.9212/212 peersIndependent evidence62.4208/208 peersIndependent evidence45.9178/178 peersIndependent evidence93.7112/112 peersIndependent evidence84.6114/114 peersIndependent evidence50.1114/114 peersIndependent evidence61.4198/198 peersIndependent evidence75.3171/171 peersIndependent evidence69.5169/169 peersIndependent evidence
Qwen3.5-omni-plus · Non-reasoningQwen10.0UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source10 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?64.5197/197 peersIndependent evidence61.3200/200 peersIndependent evidence72.0212/212 peersIndependent evidence66.7208/208 peersIndependent evidence63.1178/178 peersIndependent evidence67.6114/114 peersIndependent evidence43.1198/198 peersIndependent evidence83.2171/171 peersIndependent evidence64.2169/169 peersIndependent evidence
DeepSeek-R1-0528 · ReasoningDeepSeek10.0UnknownNo current, exact configuration price mapping in this collection.Single independent source14 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?74.2108/108 peersIndependent evidence57.0197/197 peersIndependent evidence73.2200/200 peersIndependent evidence75.963/63 peersIndependent evidence69.4212/212 peersIndependent evidence67.7208/208 peersIndependent evidence41.1178/178 peersIndependent evidence87.5112/112 peersIndependent evidence94.660/60 peersIndependent evidence90.4114/114 peersIndependent evidence79.9198/198 peersIndependent evidence47.8171/171 peersIndependent evidence57.8169/169 peersIndependent evidence
Doubao Seed Code · ReasoningByteDance9.7UnknownNo current, exact configuration price mapping in this collection.Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?76.4108/108 peersIndependent evidence76.4197/197 peersIndependent evidence56.3200/200 peersIndependent evidence41.663/63 peersIndependent evidence59.7212/212 peersIndependent evidence64.9208/208 peersIndependent evidence64.3178/178 peersIndependent evidence85.6112/112 peersIndependent evidence92.2114/114 peersIndependent evidence59.4114/114 peersIndependent evidence69.1198/198 peersIndependent evidence61.7171/171 peersIndependent evidence72.6169/169 peersIndependent evidence
Amazon Nova 2 Pro Preview · MediumAmazon9.3UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source16 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?91.2108/108 peersIndependent evidence49.8198/198 peersIndependent evidence24.9200/200 peersIndependent evidence37.3123/123 peersIndependent evidence64.8212/212 peersIndependent evidence50.8208/208 peersIndependent evidence97.7178/178 peersIndependent evidence80.9112/112 peersIndependent evidence84.0114/114 peersIndependent evidence48.6114/114 peersIndependent evidence60.9198/198 peersIndependent evidence87.5171/171 peersIndependent evidence58.8201/201 peersIndependent evidence
K EXAONE 2.0 750B A37B · ReasoningLG AI Research9.2UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?60.1197/197 peersIndependent evidence66.8200/200 peersIndependent evidence56.3123/123 peersIndependent evidence73.8212/212 peersIndependent evidence71.7208/208 peersIndependent evidence17.9198/198 peersIndependent evidence41.591/91 peersIndependent evidence38.0112/112 peersIndependent evidence51.1125/125 peersIndependent evidence
Qwen3.5-9B · ReasoningQwen9.0UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source13 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?74.8197/197 peersIndependent evidence56.1200/200 peersIndependent evidence33.4123/123 peersIndependent evidence68.3212/212 peersIndependent evidence68.3208/208 peersIndependent evidence79.9178/178 peersIndependent evidence62.6114/114 peersIndependent evidence36.5198/198 peersIndependent evidence54.8202/202 peersIndependent evidence58.7201/201 peersIndependent evidence
o1 · ReasoningOpenAI8.9UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?67.8197/197 peersIndependent evidence56.2200/200 peersIndependent evidence55.1212/212 peersIndependent evidence42.3208/208 peersIndependent evidence83.8178/178 peersIndependent evidence68.9112/112 peersIndependent evidence80.360/60 peersIndependent evidence88.4114/114 peersIndependent evidence85.1198/198 peersIndependent evidence63.7171/171 peersIndependent evidence52.3169/169 peersIndependent evidence
Gemini 2.5 Flash · ReasoningGoogle8.9UnknownNo current, exact configuration price mapping in this collection.Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?72.3108/108 peersIndependent evidence61.6198/198 peersIndependent evidence71.2200/200 peersIndependent evidence65.5212/212 peersIndependent evidence60.8208/208 peersIndependent evidence61.9178/178 peersIndependent evidence72.8112/112 peersIndependent evidence94.060/60 peersIndependent evidence84.9114/114 peersIndependent evidence61.0114/114 peersIndependent evidence72.3198/198 peersIndependent evidence39.4171/171 peersIndependent evidence52.5169/169 peersIndependent evidence
K EXAONE 236B A23B · ReasoningLG AI Research8.9UnknownNo current, exact configuration price mapping in this collection.Single independent source15 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?92.2108/108 peersIndependent evidence62.4197/197 peersIndependent evidence68.8200/200 peersIndependent evidence30.9123/123 peersIndependent evidence32.563/63 peersIndependent evidence64.0212/212 peersIndependent evidence65.0208/208 peersIndependent evidence78.1178/178 peersIndependent evidence86.6112/112 peersIndependent evidence87.4114/114 peersIndependent evidence35.2198/198 peersIndependent evidence68.7171/171 peersIndependent evidence55.4201/201 peersIndependent evidence
Qwen3-235B-A22B-Thinking-2507 · ReasoningQwen8.8UnknownNo current, exact configuration price mapping in this collection.Single independent source22 published · 18 families · 5 task areas100% weight: Artificial AnalysisWhy this score?19.787/87 peersIndependent evidence94.5108/108 peersIndependent evidence76.3197/197 peersIndependent evidence31.389/89 peersIndependent evidence25.2200/200 peersIndependent evidence42.288/88 peersIndependent evidence26.8123/123 peersIndependent evidence71.663/63 peersIndependent evidence63.7212/212 peersIndependent evidence67.0208/208 peersIndependent evidence63.0178/178 peersIndependent evidence89.4112/112 peersIndependent evidence95.660/60 peersIndependent evidence89.2114/114 peersIndependent evidence62.5198/198 peersIndependent evidence42.091/91 peersIndependent evidence44.8202/202 peersIndependent evidence34.8201/201 peersIndependent evidence
Qwen3.7-flash · Non-reasoningQwen8.7UnknownNo current, exact configuration price mapping in this collection.Single independent source5 published · 4 families · 1 task areas100% weight: Epoch AIWhy this score?55.348/48 peersIndependent evidence46.347/47 peersIndependent evidence38.760/60 peersIndependent evidence7.939/39 peersIndependent evidence
Gemma 4 26B-A4B IT · MinimalGoogle8.7UnknownNo current, exact configuration price mapping in this collection.Single independent source3 published · 3 families · 1 task areas100% weight: Epoch AIWhy this score?71.048/48 peersIndependent evidence23.547/47 peersIndependent evidence41.850/50 peersIndependent evidence
Amazon Nova 2 Lite · HighAmazon7.9UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?96.4108/108 peersIndependent evidence61.0197/197 peersIndependent evidence54.6200/200 peersIndependent evidence29.0123/123 peersIndependent evidence69.9212/212 peersIndependent evidence59.9208/208 peersIndependent evidence83.8178/178 peersIndependent evidence76.9112/112 peersIndependent evidence77.4114/114 peersIndependent evidence45.7114/114 peersIndependent evidence49.8198/198 peersIndependent evidence67.1171/171 peersIndependent evidence42.2201/201 peersIndependent evidence
EXAONE 4.5 33B · ReasoningLG AI Research7.7UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?56.0197/197 peersIndependent evidence56.0200/200 peersIndependent evidence37.7123/123 peersIndependent evidence65.7212/212 peersIndependent evidence61.1208/208 peersIndependent evidence69.4178/178 peersIndependent evidence57.6114/114 peersIndependent evidence34.0198/198 peersIndependent evidence71.0171/171 peersIndependent evidence50.9201/201 peersIndependent evidence
GLM-4.5 · ReasoningZ.ai7.5UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?72.8108/108 peersIndependent evidence52.4197/197 peersIndependent evidence25.5200/200 peersIndependent evidence63.0212/212 peersIndependent evidence61.5208/208 peersIndependent evidence52.4178/178 peersIndependent evidence81.0112/112 peersIndependent evidence88.560/60 peersIndependent evidence86.3114/114 peersIndependent evidence70.8198/198 peersIndependent evidence51.7171/171 peersIndependent evidence66.0169/169 peersIndependent evidence
Qwen3-Next-80B-A3B-Thinking · ReasoningQwen6.9UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?85.1108/108 peersIndependent evidence63.7197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.5123/123 peersIndependent evidence57.063/63 peersIndependent evidence57.7212/212 peersIndependent evidence60.2208/208 peersIndependent evidence72.5178/178 peersIndependent evidence88.8112/112 peersIndependent evidence81.1114/114 peersIndependent evidence49.9198/198 peersIndependent evidence37.9202/202 peersIndependent evidence34.5201/201 peersIndependent evidence
Gemma 4 12B IT · ReasoningGoogle6.9UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source12 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?65.2197/197 peersIndependent evidence25.1200/200 peersIndependent evidence34.7123/123 peersIndependent evidence57.3212/212 peersIndependent evidence69.3208/208 peersIndependent evidence90.9178/178 peersIndependent evidence63.9114/114 peersIndependent evidence29.9198/198 peersIndependent evidence45.8171/171 peersIndependent evidence50.5201/201 peersIndependent evidence
GLM-4.7-Flash · ReasoningZ.ai6.5UnknownNo current, exact configuration price mapping in this collection.Single independent source9 published · 8 families · 5 task areas100% weight: Artificial AnalysisWhy this score?43.0197/197 peersIndependent evidence55.3200/200 peersIndependent evidence27.8212/212 peersIndependent evidence44.7208/208 peersIndependent evidence73.1178/178 peersIndependent evidence32.6198/198 peersIndependent evidence100.0171/171 peersIndependent evidence62.5169/169 peersIndependent evidence
Qwen3.5-4B · ReasoningQwen6.4UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source12 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?64.1197/197 peersIndependent evidence25.0200/200 peersIndependent evidence62.4212/212 peersIndependent evidence53.0208/208 peersIndependent evidence64.6178/178 peersIndependent evidence53.1114/114 peersIndependent evidence26.9198/198 peersIndependent evidence63.5202/202 peersIndependent evidence52.7201/201 peersIndependent evidence
Command A Plus 05 2026 · ReasoningCohere6.4UnknownZero-price workload is not a verified sustainable cost.Price source ↗Single independent source19 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?24.887/87 peersIndependent evidence34.0198/198 peersIndependent evidence29.189/89 peersIndependent evidence56.1200/200 peersIndependent evidence12.088/88 peersIndependent evidence39.9123/123 peersIndependent evidence58.1212/212 peersIndependent evidence58.9208/208 peersIndependent evidence91.0178/178 peersIndependent evidence45.4114/114 peersIndependent evidence8.0198/198 peersIndependent evidence29.991/91 peersIndependent evidence49.2202/202 peersIndependent evidence52.6201/201 peersIndependent evidence

Behind the ranking

273 entries with published results · 55 ranked · 167 unranked in Value.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: value; evidence: documented; configurations: best
Pricing collected: 11 Sept 2026
Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000
https://unifybench.ai/?mode=value&page=5

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →