The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.

Token counts for price scenarios

Output includes reasoning. Fixed token counts compare prices; they do not measure task efficiency.

89 of 398 supported configurations have comparable costs. Unknown costs and over-budget entries remain visible without a Value rank. Prices collected 2026-09-11; comparisons expire after 30 days.

USD per weighted AA v4.3 task, including reasoning, cache treatment and reviewed fallback routing. This workload does not represent every task. Cost evidence currently comes from Artificial Analysis only. Cost frontier, components and gaps ↗ · Value methodology

Value leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Value ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelCapabilityUSD / AA taskEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
Qwen3-VL-32B-Thinking · ReasoningQwen6.3UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?86.6108/108 peersIndependent evidence56.4197/197 peersIndependent evidence25.5200/200 peersIndependent evidence51.4212/212 peersIndependent evidence52.1208/208 peersIndependent evidence71.2178/178 peersIndependent evidence81.0112/112 peersIndependent evidence76.7114/114 peersIndependent evidence46.2114/114 peersIndependent evidence40.6198/198 peersIndependent evidence55.0171/171 peersIndependent evidence43.1169/169 peersIndependent evidence
Magistral Medium 1.2 · ReasoningMistral6.2UnknownNo current, exact configuration price mapping in this collection.Single independent source17 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?79.9108/108 peersIndependent evidence53.0197/197 peersIndependent evidence56.1200/200 peersIndependent evidence19.6123/123 peersIndependent evidence51.763/63 peersIndependent evidence52.9212/212 peersIndependent evidence52.8208/208 peersIndependent evidence50.0178/178 peersIndependent evidence83.2112/112 peersIndependent evidence73.6114/114 peersIndependent evidence37.5114/114 peersIndependent evidence56.7198/198 peersIndependent evidence39.8202/202 peersIndependent evidence40.5201/201 peersIndependent evidence
GPT-5 Nano · HighOpenAI6.0UnknownNo current, exact configuration price mapping in this collection.Independent corroboration15 published · 14 families · 6 task areas54% weight: Artificial AnalysisWhy this score?83.8108/108 peersIndependent evidence46.5197/197 peersIndependent evidence25.2200/200 peersIndependent evidence50.163/63 peersIndependent evidence41.5212/212 peersIndependent evidence50.0208/208 peersIndependent evidence81.1178/178 peersIndependent evidence90.1112/112 peersIndependent evidence56.9114/114 peersIndependent evidence37.6114/114 peersIndependent evidence51.2198/198 peersIndependent evidence47.5171/171 peersIndependent evidence50.6169/169 peersIndependent evidence26.038/38 peersIndependent evidence
o3-mini · HighOpenAI5.8UnknownNo current, exact configuration price mapping in this collection.Independent corroboration22 published · 17 families · 5 task areas42% weight: Artificial AnalysisWhy this score?18.287/87 peersIndependent evidence41.0197/197 peersIndependent evidence14.289/89 peersIndependent evidence53.6200/200 peersIndependent evidence25.188/88 peersIndependent evidence21.2123/123 peersIndependent evidence59.4212/212 peersIndependent evidence6.2208/208 peersIndependent evidence77.9178/178 peersIndependent evidence78.9112/112 peersIndependent evidence96.060/60 peersIndependent evidence64.9114/114 peersIndependent evidence56.5198/198 peersIndependent evidence43.291/91 peersIndependent evidence26.0202/202 peersIndependent evidence23.2201/201 peersIndependent evidence25.438/38 peersIndependent evidence
Seed OSS 36B Instruct · ReasoningByteDance5.6UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?86.6108/108 peersIndependent evidence61.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence31.863/63 peersIndependent evidence50.1212/212 peersIndependent evidence50.9208/208 peersIndependent evidence47.5178/178 peersIndependent evidence85.0112/112 peersIndependent evidence74.3114/114 peersIndependent evidence44.8198/198 peersIndependent evidence59.0171/171 peersIndependent evidence39.1169/169 peersIndependent evidence
Qwen3-235B-A22B-Instruct-2507 · Non-reasoningQwen5.5UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?68.7108/108 peersIndependent evidence37.1197/197 peersIndependent evidence25.5200/200 peersIndependent evidence57.2212/212 peersIndependent evidence57.1208/208 peersIndependent evidence57.1178/178 peersIndependent evidence57.5112/112 peersIndependent evidence91.260/60 peersIndependent evidence82.4114/114 peersIndependent evidence48.0198/198 peersIndependent evidence43.3171/171 peersIndependent evidence56.6169/169 peersIndependent evidence
MiniCPM5-2B · ReasoningOpenBMB5.3UnknownNo current, exact configuration price mapping in this collection.Single independent source14 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?28.487/87 peersIndependent evidence58.9197/197 peersIndependent evidence27.089/89 peersIndependent evidence56.4200/200 peersIndependent evidence20.688/88 peersIndependent evidence50.3123/123 peersIndependent evidence46.3212/212 peersIndependent evidence48.6208/208 peersIndependent evidence6.8198/198 peersIndependent evidence8.391/91 peersIndependent evidence62.0112/112 peersIndependent evidence21.5125/125 peersIndependent evidence
DiffusionGemma 26B A4B · ReasoningGoogle5.2UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?23.7197/197 peersIndependent evidence55.8200/200 peersIndependent evidence27.2123/123 peersIndependent evidence39.5212/212 peersIndependent evidence56.0208/208 peersIndependent evidence72.0178/178 peersIndependent evidence55.2114/114 peersIndependent evidence37.1198/198 peersIndependent evidence26.2125/125 peersIndependent evidence
MiniMax-M1-80k · ReasoningMiniMax5.1UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?58.5108/108 peersIndependent evidence58.0197/197 peersIndependent evidence25.5200/200 peersIndependent evidence45.3212/212 peersIndependent evidence47.8208/208 peersIndependent evidence46.9178/178 peersIndependent evidence76.4112/112 peersIndependent evidence91.260/60 peersIndependent evidence75.2114/114 peersIndependent evidence62.3198/198 peersIndependent evidence44.0171/171 peersIndependent evidence20.9169/169 peersIndependent evidence
GLM-4.5-Air · ReasoningZ.ai5.0UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?78.7108/108 peersIndependent evidence48.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence51.4212/212 peersIndependent evidence42.9208/208 peersIndependent evidence34.5178/178 peersIndependent evidence70.2112/112 peersIndependent evidence76.260/60 peersIndependent evidence72.5114/114 peersIndependent evidence34.5198/198 peersIndependent evidence56.1171/171 peersIndependent evidence63.7169/169 peersIndependent evidence
Qwen3-VL-235B-A22B-Instruct · Non-reasoningQwen4.8UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?67.7108/108 peersIndependent evidence35.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence47.4212/212 peersIndependent evidence40.0208/208 peersIndependent evidence48.6178/178 peersIndependent evidence63.0112/112 peersIndependent evidence80.2114/114 peersIndependent evidence58.7114/114 peersIndependent evidence54.3198/198 peersIndependent evidence46.0171/171 peersIndependent evidence39.1169/169 peersIndependent evidence
Qwen3-30B-A3B-Thinking-2507 · ReasoningQwen4.6UnknownNo current, exact configuration price mapping in this collection.Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?12.087/87 peersIndependent evidence56.9108/108 peersIndependent evidence60.3197/197 peersIndependent evidence17.589/89 peersIndependent evidence55.7200/200 peersIndependent evidence6.788/88 peersIndependent evidence18.0123/123 peersIndependent evidence46.1212/212 peersIndependent evidence52.3208/208 peersIndependent evidence61.6178/178 peersIndependent evidence74.8112/112 peersIndependent evidence85.560/60 peersIndependent evidence65.9114/114 peersIndependent evidence34.5198/198 peersIndependent evidence22.191/91 peersIndependent evidence26.1202/202 peersIndependent evidence20.3201/201 peersIndependent evidence
Qwen3.5-omni-flash · Non-reasoningQwen4.5UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source10 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?51.9197/197 peersIndependent evidence25.2200/200 peersIndependent evidence54.1212/212 peersIndependent evidence44.1208/208 peersIndependent evidence35.2178/178 peersIndependent evidence50.6114/114 peersIndependent evidence24.8198/198 peersIndependent evidence76.6171/171 peersIndependent evidence45.3169/169 peersIndependent evidence
Solar Open 100B · ReasoningUpstage4.4UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?42.4197/197 peersIndependent evidence25.2200/200 peersIndependent evidence50.663/63 peersIndependent evidence35.4212/212 peersIndependent evidence54.6208/208 peersIndependent evidence68.3178/178 peersIndependent evidence47.2198/198 peersIndependent evidence57.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
Qwen3-VL-30B-A3B-Thinking · ReasoningQwen4.4UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?81.1108/108 peersIndependent evidence25.4200/200 peersIndependent evidence49.1212/212 peersIndependent evidence48.7208/208 peersIndependent evidence54.7178/178 peersIndependent evidence73.7112/112 peersIndependent evidence68.5114/114 peersIndependent evidence39.8114/114 peersIndependent evidence40.1198/198 peersIndependent evidence19.8171/171 peersIndependent evidence30.7169/169 peersIndependent evidence
Qwen3-Next-80B-A3B-Instruct · Non-reasoningQwen4.4UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?63.7108/108 peersIndependent evidence52.5197/197 peersIndependent evidence25.4200/200 peersIndependent evidence52.7212/212 peersIndependent evidence45.0208/208 peersIndependent evidence41.7178/178 peersIndependent evidence70.4112/112 peersIndependent evidence77.9114/114 peersIndependent evidence41.6198/198 peersIndependent evidence22.8171/171 peersIndependent evidence42.9169/169 peersIndependent evidence
GPT-4.1 · Non-reasoningOpenAI4.0UnknownNo current, exact configuration price mapping in this collection.Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?36.1108/108 peersIndependent evidence70.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence37.9212/212 peersIndependent evidence15.1208/208 peersIndependent evidence50.2178/178 peersIndependent evidence45.8112/112 peersIndependent evidence55.060/60 peersIndependent evidence66.7114/114 peersIndependent evidence39.2114/114 peersIndependent evidence76.2198/198 peersIndependent evidence56.9171/171 peersIndependent evidence53.6169/169 peersIndependent evidence
EXAONE 4.0 32B · ReasoningLG AI Research3.9UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 4 task areas100% weight: Artificial AnalysisWhy this score?77.3108/108 peersIndependent evidence25.2200/200 peersIndependent evidence22.763/63 peersIndependent evidence53.7212/212 peersIndependent evidence59.1208/208 peersIndependent evidence31.0178/178 peersIndependent evidence84.2112/112 peersIndependent evidence88.560/60 peersIndependent evidence76.0114/114 peersIndependent evidence21.4198/198 peersIndependent evidence12.7171/171 peersIndependent evidence23.2169/169 peersIndependent evidence
Qwen3-235B-A22B · ReasoningQwen3.8UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?79.8108/108 peersIndependent evidence5.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence46.6212/212 peersIndependent evidence57.0208/208 peersIndependent evidence36.8178/178 peersIndependent evidence64.9112/112 peersIndependent evidence58.360/60 peersIndependent evidence82.4114/114 peersIndependent evidence47.6198/198 peersIndependent evidence28.1171/171 peersIndependent evidence33.2169/169 peersIndependent evidence
Qwen3-32B · ReasoningQwen3.7UnknownNo current, exact configuration price mapping in this collection.Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?9.287/87 peersIndependent evidence71.3108/108 peersIndependent evidence5.8197/197 peersIndependent evidence22.489/89 peersIndependent evidence55.7200/200 peersIndependent evidence25.388/88 peersIndependent evidence17.0123/123 peersIndependent evidence39.0212/212 peersIndependent evidence43.4208/208 peersIndependent evidence31.4178/178 peersIndependent evidence58.3112/112 peersIndependent evidence74.460/60 peersIndependent evidence63.8114/114 peersIndependent evidence42.3198/198 peersIndependent evidence23.891/91 peersIndependent evidence27.6202/202 peersIndependent evidence19.9201/201 peersIndependent evidence
Qwen3-VL-32B-Instruct · Non-reasoningQwen3.6UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?66.2108/108 peersIndependent evidence25.4200/200 peersIndependent evidence40.2212/212 peersIndependent evidence40.8208/208 peersIndependent evidence39.2178/178 peersIndependent evidence54.5112/112 peersIndependent evidence60.9114/114 peersIndependent evidence48.4114/114 peersIndependent evidence25.5198/198 peersIndependent evidence37.0171/171 peersIndependent evidence46.0169/169 peersIndependent evidence
Gemini 2.5 Flash-Lite · ReasoningGoogle3.5UnknownNo current, exact configuration price mapping in this collection.Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?51.5108/108 peersIndependent evidence42.5198/198 peersIndependent evidence25.2200/200 peersIndependent evidence33.1212/212 peersIndependent evidence41.1208/208 peersIndependent evidence60.8178/178 peersIndependent evidence61.9112/112 peersIndependent evidence79.760/60 peersIndependent evidence46.6114/114 peersIndependent evidence34.0114/114 peersIndependent evidence43.9198/198 peersIndependent evidence15.1171/171 peersIndependent evidence26.8169/169 peersIndependent evidence
Devstral 2 · Non-reasoningMistral3.5UnknownZero-price workload is not a verified sustainable cost.Price source ↗Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?33.887/87 peersIndependent evidence39.0108/108 peersIndependent evidence34.0197/197 peersIndependent evidence36.589/89 peersIndependent evidence25.2200/200 peersIndependent evidence28.688/88 peersIndependent evidence43.4123/123 peersIndependent evidence32.163/63 peersIndependent evidence29.2212/212 peersIndependent evidence6.0208/208 peersIndependent evidence36.1178/178 peersIndependent evidence45.5112/112 peersIndependent evidence49.9114/114 peersIndependent evidence56.6198/198 peersIndependent evidence20.891/91 peersIndependent evidence35.3202/202 peersIndependent evidence43.5201/201 peersIndependent evidence
Qwen3-Coder-480B-A35B-Instruct · Non-reasoningQwen3.5UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?43.5108/108 peersIndependent evidence46.8197/197 peersIndependent evidence25.5200/200 peersIndependent evidence32.3212/212 peersIndependent evidence21.2208/208 peersIndependent evidence43.9178/178 peersIndependent evidence60.6112/112 peersIndependent evidence69.860/60 peersIndependent evidence59.1114/114 peersIndependent evidence30.9198/198 peersIndependent evidence53.0171/171 peersIndependent evidence62.4169/169 peersIndependent evidence
GPT-4.1 Mini · Non-reasoningOpenAI3.4UnknownNo current, exact configuration price mapping in this collection.Single independent source17 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?48.3108/108 peersIndependent evidence45.1197/197 peersIndependent evidence25.4200/200 peersIndependent evidence25.5123/123 peersIndependent evidence37.0212/212 peersIndependent evidence30.1208/208 peersIndependent evidence37.2178/178 peersIndependent evidence51.3112/112 peersIndependent evidence56.860/60 peersIndependent evidence57.7114/114 peersIndependent evidence36.2114/114 peersIndependent evidence54.3198/198 peersIndependent evidence38.7202/202 peersIndependent evidence33.6201/201 peersIndependent evidence

Behind the ranking

273 entries with published results · 55 ranked · 167 unranked in Value.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: value; evidence: documented; configurations: best
Pricing collected: 11 Sept 2026
Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000
https://unifybench.ai/?mode=value&page=6

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →