The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.

Token counts for price scenarios

Output includes reasoning. Fixed token counts compare prices; they do not measure task efficiency.

89 of 398 supported configurations have comparable costs. Unknown costs and over-budget entries remain visible without a Value rank. Prices collected 2026-09-11; comparisons expire after 30 days.

USD per weighted AA v4.3 task, including reasoning, cache treatment and reviewed fallback routing. This workload does not represent every task. Cost evidence currently comes from Artificial Analysis only. Cost frontier, components and gaps ↗ · Value methodology

Value leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Value ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelCapabilityUSD / AA taskEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
Magistral Small 1.2 · ReasoningMistral3.4UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source18 published · 15 families · 6 task areas100% weight: Artificial AnalysisWhy this score?77.8108/108 peersIndependent evidence22.4197/197 peersIndependent evidence2.889/89 peersIndependent evidence55.9200/200 peersIndependent evidence15.1123/123 peersIndependent evidence28.363/63 peersIndependent evidence36.2212/212 peersIndependent evidence39.2208/208 peersIndependent evidence53.2178/178 peersIndependent evidence78.0112/112 peersIndependent evidence52.5114/114 peersIndependent evidence29.7114/114 peersIndependent evidence19.5198/198 peersIndependent evidence22.3202/202 peersIndependent evidence21.2201/201 peersIndependent evidence
GLM-4.6V · ReasoningZ.ai3.4UnknownNo current, exact configuration price mapping in this collection.Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?87.9108/108 peersIndependent evidence50.9197/197 peersIndependent evidence25.2200/200 peersIndependent evidence42.763/63 peersIndependent evidence49.4212/212 peersIndependent evidence50.9208/208 peersIndependent evidence15.4178/178 peersIndependent evidence10.5112/112 peersIndependent evidence64.3114/114 peersIndependent evidence17.6114/114 peersIndependent evidence33.7198/198 peersIndependent evidence39.4171/171 peersIndependent evidence54.0169/169 peersIndependent evidence
Mistral Medium 3.1 · Non-reasoningMistral3.3UnknownNo current, exact configuration price mapping in this collection.Single independent source20 published · 16 families · 5 task areas100% weight: Artificial AnalysisWhy this score?40.487/87 peersIndependent evidence42.5108/108 peersIndependent evidence40.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.088/88 peersIndependent evidence32.1123/123 peersIndependent evidence28.4212/212 peersIndependent evidence25.2208/208 peersIndependent evidence42.1178/178 peersIndependent evidence42.9112/112 peersIndependent evidence27.1114/114 peersIndependent evidence27.9114/114 peersIndependent evidence55.7198/198 peersIndependent evidence18.591/91 peersIndependent evidence40.1202/202 peersIndependent evidence34.2201/201 peersIndependent evidence
MiniMax-M1-40k · ReasoningMiniMax3.3UnknownNo current, exact configuration price mapping in this collection.Single independent source9 published · 9 families · 4 task areas100% weight: Artificial AnalysisWhy this score?10.7108/108 peersIndependent evidence42.4212/212 peersIndependent evidence46.0208/208 peersIndependent evidence44.7178/178 peersIndependent evidence67.6112/112 peersIndependent evidence82.960/60 peersIndependent evidence70.0114/114 peersIndependent evidence39.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
Qwen3-4B-Thinking-2507 · ReasoningQwen3.2UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?82.6108/108 peersIndependent evidence39.9197/197 peersIndependent evidence25.4200/200 peersIndependent evidence38.5212/212 peersIndependent evidence37.5208/208 peersIndependent evidence60.6178/178 peersIndependent evidence65.8112/112 peersIndependent evidence42.9114/114 peersIndependent evidence16.5198/198 peersIndependent evidence30.6171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 · ReasoningNVIDIA3.2UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source12 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?41.1197/197 peersIndependent evidence25.3200/200 peersIndependent evidence21.9123/123 peersIndependent evidence15.5212/212 peersIndependent evidence26.3208/208 peersIndependent evidence75.7178/178 peersIndependent evidence25.9114/114 peersIndependent evidence27.9198/198 peersIndependent evidence53.9171/171 peersIndependent evidence34.4201/201 peersIndependent evidence
GLM-4.5V · ReasoningZ.ai3.0UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?71.3108/108 peersIndependent evidence5.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence43.5212/212 peersIndependent evidence38.5208/208 peersIndependent evidence28.3178/178 peersIndependent evidence63.8112/112 peersIndependent evidence59.7114/114 peersIndependent evidence19.4114/114 peersIndependent evidence57.9198/198 peersIndependent evidence24.9171/171 peersIndependent evidence30.1169/169 peersIndependent evidence
Qwen3-VL-30B-A3B-Instruct · Non-reasoningQwen2.9UnknownNo current, exact configuration price mapping in this collection.Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?70.0108/108 peersIndependent evidence25.4200/200 peersIndependent evidence44.7212/212 peersIndependent evidence38.2208/208 peersIndependent evidence24.8178/178 peersIndependent evidence49.8112/112 peersIndependent evidence50.8114/114 peersIndependent evidence42.5114/114 peersIndependent evidence29.8198/198 peersIndependent evidence17.7171/171 peersIndependent evidence34.3169/169 peersIndependent evidence
GPT-4o · Non-reasoningOpenAI2.9UnknownNo current, exact configuration price mapping in this collection.Single independent source41 published · 3 families · 3 task areas100% weight: Artificial AnalysisWhy this score?24.3200/200 peersIndependent evidence30.6114/114 peersIndependent evidence42.9169/169 peersIndependent evidence
Step 3 VL 10B · ReasoningStepFun2.9UnknownNo current, exact configuration price mapping in this collection.Single independent source10 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?5.7197/197 peersIndependent evidence25.2200/200 peersIndependent evidence44.4212/212 peersIndependent evidence56.0208/208 peersIndependent evidence61.3178/178 peersIndependent evidence46.9114/114 peersIndependent evidence19.0198/198 peersIndependent evidence12.3171/171 peersIndependent evidence30.4169/169 peersIndependent evidence
Qwen3-30B-A3B · ReasoningQwen2.8UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?70.0108/108 peersIndependent evidence5.9197/197 peersIndependent evidence25.3200/200 peersIndependent evidence32.1212/212 peersIndependent evidence37.6208/208 peersIndependent evidence45.1178/178 peersIndependent evidence51.6112/112 peersIndependent evidence74.360/60 peersIndependent evidence55.7114/114 peersIndependent evidence33.5198/198 peersIndependent evidence31.7171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
Qwen3-30B-A3B-Instruct-2507 · Non-reasoningQwen2.8UnknownNo current, exact configuration price mapping in this collection.Single independent source14 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?63.9108/108 peersIndependent evidence29.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.963/63 peersIndependent evidence35.7212/212 peersIndependent evidence41.4208/208 peersIndependent evidence24.3178/178 peersIndependent evidence55.8112/112 peersIndependent evidence84.460/60 peersIndependent evidence56.4114/114 peersIndependent evidence26.4198/198 peersIndependent evidence7.9171/171 peersIndependent evidence34.2169/169 peersIndependent evidence
NVIDIA-Nemotron-Nano-12B-v2-VL-BF16 · ReasoningNVIDIA2.7UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?73.9108/108 peersIndependent evidence42.3197/197 peersIndependent evidence25.2200/200 peersIndependent evidence25.6212/212 peersIndependent evidence34.2208/208 peersIndependent evidence19.8178/178 peersIndependent evidence71.9112/112 peersIndependent evidence47.3114/114 peersIndependent evidence23.9114/114 peersIndependent evidence24.1198/198 peersIndependent evidence21.2171/171 peersIndependent evidence26.7169/169 peersIndependent evidence
ERNIE-4.5-300B-A47B-PT · Non-reasoningBaidu2.7UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source12 published · 11 families · 4 task areas100% weight: Artificial AnalysisWhy this score?45.0108/108 peersIndependent evidence25.4200/200 peersIndependent evidence68.8212/212 peersIndependent evidence5.1208/208 peersIndependent evidence38.6178/178 peersIndependent evidence47.3112/112 peersIndependent evidence59.760/60 peersIndependent evidence55.0114/114 peersIndependent evidence50.9198/198 peersIndependent evidence2.3171/171 peersIndependent evidence34.3169/169 peersIndependent evidence
Qwen3-14B · ReasoningQwen2.5UnknownNo current, exact configuration price mapping in this collection.Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?3.987/87 peersIndependent evidence54.8108/108 peersIndependent evidence5.8197/197 peersIndependent evidence3.089/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.388/88 peersIndependent evidence12.4123/123 peersIndependent evidence29.7212/212 peersIndependent evidence20.1208/208 peersIndependent evidence43.7178/178 peersIndependent evidence56.3112/112 peersIndependent evidence75.660/60 peersIndependent evidence53.4114/114 peersIndependent evidence28.2198/198 peersIndependent evidence14.291/91 peersIndependent evidence31.9202/202 peersIndependent evidence21.2201/201 peersIndependent evidence
Qwen3-VL-8B-Thinking · ReasoningQwen2.5UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?32.8108/108 peersIndependent evidence36.5197/197 peersIndependent evidence56.4200/200 peersIndependent evidence27.6212/212 peersIndependent evidence10.4208/208 peersIndependent evidence43.0178/178 peersIndependent evidence34.5112/112 peersIndependent evidence45.0114/114 peersIndependent evidence32.7114/114 peersIndependent evidence55.4198/198 peersIndependent evidence25.7171/171 peersIndependent evidence24.2169/169 peersIndependent evidence
Gemma 4 E4B IT · Non-reasoningGoogle2.5UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source10 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?28.3197/197 peersIndependent evidence56.0200/200 peersIndependent evidence23.0212/212 peersIndependent evidence25.7208/208 peersIndependent evidence42.8178/178 peersIndependent evidence22.0114/114 peersIndependent evidence7.4198/198 peersIndependent evidence30.8171/171 peersIndependent evidence40.7169/169 peersIndependent evidence
NVIDIA-Nemotron-3-Nano-4B-BF16 · ReasoningNVIDIA2.4UnknownNo current, exact configuration price mapping in this collection.Single independent source11 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?27.6197/197 peersIndependent evidence25.2200/200 peersIndependent evidence8.9123/123 peersIndependent evidence20.4212/212 peersIndependent evidence27.1208/208 peersIndependent evidence70.2178/178 peersIndependent evidence9.6198/198 peersIndependent evidence34.9171/171 peersIndependent evidence27.5201/201 peersIndependent evidence
Devstral Small 2 · Non-reasoningMistral2.3UnknownZero-price workload is not a verified sustainable cost.Price source ↗Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?35.487/87 peersIndependent evidence35.9108/108 peersIndependent evidence30.7197/197 peersIndependent evidence35.489/89 peersIndependent evidence25.2200/200 peersIndependent evidence13.088/88 peersIndependent evidence42.1123/123 peersIndependent evidence15.663/63 peersIndependent evidence22.3212/212 peersIndependent evidence5.3208/208 peersIndependent evidence16.3178/178 peersIndependent evidence33.0112/112 peersIndependent evidence24.7114/114 peersIndependent evidence14.1114/114 peersIndependent evidence31.3198/198 peersIndependent evidence19.091/91 peersIndependent evidence34.3202/202 peersIndependent evidence41.6201/201 peersIndependent evidence
NVIDIA-Nemotron-Nano-9B-v2 · ReasoningNVIDIA2.2UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?67.2108/108 peersIndependent evidence28.1197/197 peersIndependent evidence25.2200/200 peersIndependent evidence24.7212/212 peersIndependent evidence26.6208/208 peersIndependent evidence11.2178/178 peersIndependent evidence80.1112/112 peersIndependent evidence40.9114/114 peersIndependent evidence14.4198/198 peersIndependent evidence23.4171/171 peersIndependent evidence11.8169/169 peersIndependent evidence
Mistral Medium 3 · Non-reasoningMistral2.2UnknownNo current, exact configuration price mapping in this collection.Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?31.9108/108 peersIndependent evidence33.0197/197 peersIndependent evidence25.5200/200 peersIndependent evidence27.0212/212 peersIndependent evidence11.9208/208 peersIndependent evidence39.9178/178 peersIndependent evidence39.9112/112 peersIndependent evidence53.260/60 peersIndependent evidence48.4114/114 peersIndependent evidence25.4114/114 peersIndependent evidence45.4198/198 peersIndependent evidence28.5171/171 peersIndependent evidence24.1169/169 peersIndependent evidence
Amazon Nova Premier · Non-reasoningAmazon2.1UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Single independent source14 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?15.3108/108 peersIndependent evidence37.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence39.763/63 peersIndependent evidence24.3212/212 peersIndependent evidence14.2208/208 peersIndependent evidence30.8178/178 peersIndependent evidence27.5112/112 peersIndependent evidence33.560/60 peersIndependent evidence38.0114/114 peersIndependent evidence59.4198/198 peersIndependent evidence49.1171/171 peersIndependent evidence38.9169/169 peersIndependent evidence
Qwen3-Coder-30B-A3B-Instruct · Non-reasoningQwen2.1UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?30.0108/108 peersIndependent evidence35.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence21.4212/212 peersIndependent evidence10.4208/208 peersIndependent evidence23.2178/178 peersIndependent evidence41.3112/112 peersIndependent evidence48.660/60 peersIndependent evidence33.2114/114 peersIndependent evidence35.8198/198 peersIndependent evidence44.9171/171 peersIndependent evidence56.6169/169 peersIndependent evidence
DeepSeek-R1-Distill-Llama-70B · ReasoningDeepSeek2.0UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?53.3108/108 peersIndependent evidence15.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence10.2212/212 peersIndependent evidence31.1208/208 peersIndependent evidence10.6178/178 peersIndependent evidence18.8112/112 peersIndependent evidence65.360/60 peersIndependent evidence62.9114/114 peersIndependent evidence52.2198/198 peersIndependent evidence23.8171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
DeepSeek-R1-0528-Qwen3-8B · ReasoningDeepSeek1.9UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?62.3108/108 peersIndependent evidence19.4197/197 peersIndependent evidence25.5200/200 peersIndependent evidence30.7212/212 peersIndependent evidence36.4208/208 peersIndependent evidence1.9178/178 peersIndependent evidence53.7112/112 peersIndependent evidence62.160/60 peersIndependent evidence38.8114/114 peersIndependent evidence15.4198/198 peersIndependent evidence2.3171/171 peersIndependent evidence12.4169/169 peersIndependent evidence

Behind the ranking

273 entries with published results · 55 ranked · 167 unranked in Value.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: value; evidence: documented; configurations: best
Pricing collected: 11 Sept 2026
Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000
https://unifybench.ai/?mode=value&page=7

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →