The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.

Token counts for price scenarios

Output includes reasoning. Fixed token counts compare prices; they do not measure task efficiency.

89 of 398 supported configurations have comparable costs. Unknown costs and over-budget entries remain visible without a Value rank. Prices collected 2026-09-11; comparisons expire after 30 days.

USD per weighted AA v4.3 task, including reasoning, cache treatment and reviewed fallback routing. This workload does not represent every task. Cost evidence currently comes from Artificial Analysis only. Cost frontier, components and gaps ↗ · Value methodology

Value leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Value ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelCapabilityUSD / AA taskEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
26Gemini 3.1 Pro · ReasoningGoogle32.4$0.67473Within budgetPrice source ↗Single independent source25 published · 20 families · 6 task areas100% weight: Artificial AnalysisWhy this score?85.928/28 peersIndependent evidence32.687/87 peersIndependent evidence88.526/26 peersIndependent evidence84.0198/198 peersIndependent evidence74.889/89 peersIndependent evidence93.5200/200 peersIndependent evidence70.141/41 peersIndependent evidence86.488/88 peersIndependent evidence55.5123/123 peersIndependent evidence100.063/63 peersIndependent evidence99.3212/212 peersIndependent evidence12.337/37 peersIndependent evidence97.6208/208 peersIndependent evidence95.2178/178 peersIndependent evidence40.328/28 peersIndependent evidence96.2114/114 peersIndependent evidence97.5198/198 peersIndependent evidence96.491/91 peersIndependent evidence83.0202/202 peersIndependent evidence85.3201/201 peersIndependent evidence
27Kimi-K2.7-Code · ReasoningMoonshot26.9$0.54119Within budgetPrice source ↗Single independent source20 published · 15 families · 5 task areas100% weight: Artificial AnalysisWhy this score?57.087/87 peersIndependent evidence82.2198/198 peersIndependent evidence67.889/89 peersIndependent evidence88.4200/200 peersIndependent evidence57.941/41 peersIndependent evidence66.888/88 peersIndependent evidence73.5123/123 peersIndependent evidence88.9212/212 peersIndependent evidence78.037/37 peersIndependent evidence88.2208/208 peersIndependent evidence74.0178/178 peersIndependent evidence89.2198/198 peersIndependent evidence65.091/91 peersIndependent evidence76.1202/202 peersIndependent evidence79.4201/201 peersIndependent evidence
28Hy3 · ReasoningTencent26.4$0.07175Within budgetPrice source ↗Single independent source14 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?66.487/87 peersIndependent evidence91.7197/197 peersIndependent evidence58.189/89 peersIndependent evidence82.9200/200 peersIndependent evidence65.788/88 peersIndependent evidence75.6123/123 peersIndependent evidence90.3212/212 peersIndependent evidence87.6208/208 peersIndependent evidence82.8198/198 peersIndependent evidence67.691/91 peersIndependent evidence67.6112/112 peersIndependent evidence63.2125/125 peersIndependent evidence
29MiniMax-M3 · ReasoningMiniMax25.1$0.50761Within budgetPrice source ↗Single independent source22 published · 17 families · 6 task areas100% weight: Artificial AnalysisWhy this score?27.028/28 peersIndependent evidence77.387/87 peersIndependent evidence87.9198/198 peersIndependent evidence65.689/89 peersIndependent evidence79.4200/200 peersIndependent evidence35.341/41 peersIndependent evidence59.588/88 peersIndependent evidence84.0123/123 peersIndependent evidence96.6212/212 peersIndependent evidence86.837/37 peersIndependent evidence91.6208/208 peersIndependent evidence99.9178/178 peersIndependent evidence86.8114/114 peersIndependent evidence37.2198/198 peersIndependent evidence63.691/91 peersIndependent evidence72.3202/202 peersIndependent evidence78.9201/201 peersIndependent evidence
30Qwen3.7-plus · ReasoningQwen24.2$0.32527Within budgetPrice source ↗Single independent source22 published · 17 families · 6 task areas100% weight: Artificial AnalysisWhy this score?64.587/87 peersIndependent evidence59.926/26 peersIndependent evidence64.6198/198 peersIndependent evidence59.489/89 peersIndependent evidence87.0200/200 peersIndependent evidence66.041/41 peersIndependent evidence70.988/88 peersIndependent evidence54.9123/123 peersIndependent evidence90.1212/212 peersIndependent evidence51.237/37 peersIndependent evidence88.6208/208 peersIndependent evidence96.5178/178 peersIndependent evidence92.8114/114 peersIndependent evidence61.6198/198 peersIndependent evidence60.291/91 peersIndependent evidence77.0202/202 peersIndependent evidence76.3201/201 peersIndependent evidence
31MiMo-V2.5-Pro · ReasoningXiaomi20.8$0.05407Within budgetPrice source ↗Single independent source22 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?70.228/28 peersIndependent evidence63.087/87 peersIndependent evidence9.926/26 peersIndependent evidence74.0198/198 peersIndependent evidence56.789/89 peersIndependent evidence81.2200/200 peersIndependent evidence39.988/88 peersIndependent evidence78.8123/123 peersIndependent evidence84.0212/212 peersIndependent evidence36.637/37 peersIndependent evidence90.8208/208 peersIndependent evidence98.4178/178 peersIndependent evidence75.428/28 peersIndependent evidence62.3198/198 peersIndependent evidence75.691/91 peersIndependent evidence65.4202/202 peersIndependent evidence65.4201/201 peersIndependent evidence
32Qwen3.5-397B-A17B · ReasoningQwen19.4$0.47458Within budgetPrice source ↗Single independent source23 published · 19 families · 6 task areas100% weight: Artificial AnalysisWhy this score?42.487/87 peersIndependent evidence50.326/26 peersIndependent evidence88.5197/197 peersIndependent evidence51.189/89 peersIndependent evidence75.3200/200 peersIndependent evidence29.941/41 peersIndependent evidence70.788/88 peersIndependent evidence56.6123/123 peersIndependent evidence89.663/63 peersIndependent evidence89.5212/212 peersIndependent evidence27.937/37 peersIndependent evidence84.6208/208 peersIndependent evidence97.3178/178 peersIndependent evidence58.028/28 peersIndependent evidence84.5114/114 peersIndependent evidence80.7198/198 peersIndependent evidence54.791/91 peersIndependent evidence74.0202/202 peersIndependent evidence58.8201/201 peersIndependent evidence
33Gemini 3.5 Flash-Lite · ReasoningGoogle17.3$0.12353Within budgetPrice source ↗Single independent source17 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?43.187/87 peersIndependent evidence66.4198/198 peersIndependent evidence68.789/89 peersIndependent evidence25.4200/200 peersIndependent evidence74.341/41 peersIndependent evidence75.888/88 peersIndependent evidence65.1123/123 peersIndependent evidence74.5212/212 peersIndependent evidence71.2208/208 peersIndependent evidence88.9114/114 peersIndependent evidence78.9198/198 peersIndependent evidence40.091/91 peersIndependent evidence57.9112/112 peersIndependent evidence60.4125/125 peersIndependent evidence
34Qwen3.6-27B · ReasoningQwen17.2$0.62124Within budgetPrice source ↗Single independent source19 published · 15 families · 6 task areas100% weight: Artificial AnalysisWhy this score?53.487/87 peersIndependent evidence89.1197/197 peersIndependent evidence52.989/89 peersIndependent evidence70.7200/200 peersIndependent evidence64.188/88 peersIndependent evidence66.8123/123 peersIndependent evidence77.3212/212 peersIndependent evidence56.237/37 peersIndependent evidence77.6208/208 peersIndependent evidence81.2178/178 peersIndependent evidence78.0114/114 peersIndependent evidence52.8198/198 peersIndependent evidence45.691/91 peersIndependent evidence76.9202/202 peersIndependent evidence58.5201/201 peersIndependent evidence
35NVIDIA Nemotron 3 Ultra · ReasoningNVIDIA16.2$0.58481Within budgetPrice source ↗Single independent source21 published · 16 families · 5 task areas100% weight: Artificial AnalysisWhy this score?7.628/28 peersIndependent evidence61.387/87 peersIndependent evidence75.9198/198 peersIndependent evidence33.589/89 peersIndependent evidence78.0200/200 peersIndependent evidence18.941/41 peersIndependent evidence43.388/88 peersIndependent evidence71.2123/123 peersIndependent evidence82.7212/212 peersIndependent evidence46.037/37 peersIndependent evidence81.4208/208 peersIndependent evidence99.3178/178 peersIndependent evidence62.3198/198 peersIndependent evidence39.291/91 peersIndependent evidence65.4202/202 peersIndependent evidence68.6201/201 peersIndependent evidence
36MiMo-V2.5 · ReasoningXiaomi15.4$0.01907On the cost frontierPrice source ↗Single independent source18 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?50.987/87 peersIndependent evidence79.1197/197 peersIndependent evidence60.789/89 peersIndependent evidence79.9200/200 peersIndependent evidence38.888/88 peersIndependent evidence67.8123/123 peersIndependent evidence79.8212/212 peersIndependent evidence79.2208/208 peersIndependent evidence79.4178/178 peersIndependent evidence79.6114/114 peersIndependent evidence38.5198/198 peersIndependent evidence50.491/91 peersIndependent evidence61.2202/202 peersIndependent evidence64.9201/201 peersIndependent evidence
37Qwen3.5-122B-A10B · ReasoningQwen14.4$0.32475Within budgetPrice source ↗Single independent source19 published · 15 families · 6 task areas100% weight: Artificial AnalysisWhy this score?35.687/87 peersIndependent evidence87.7197/197 peersIndependent evidence45.389/89 peersIndependent evidence63.2200/200 peersIndependent evidence35.888/88 peersIndependent evidence56.9123/123 peersIndependent evidence86.263/63 peersIndependent evidence82.2212/212 peersIndependent evidence79.8208/208 peersIndependent evidence94.2178/178 peersIndependent evidence79.2114/114 peersIndependent evidence67.3198/198 peersIndependent evidence35.191/91 peersIndependent evidence74.5202/202 peersIndependent evidence53.2201/201 peersIndependent evidence
38Qwen3.6-35B-A3B · ReasoningQwen12.4$0.47505Within budgetPrice source ↗Single independent source18 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?45.487/87 peersIndependent evidence78.1197/197 peersIndependent evidence43.389/89 peersIndependent evidence55.7200/200 peersIndependent evidence49.888/88 peersIndependent evidence60.1123/123 peersIndependent evidence76.6212/212 peersIndependent evidence76.8208/208 peersIndependent evidence77.1178/178 peersIndependent evidence80.4114/114 peersIndependent evidence48.6198/198 peersIndependent evidence27.891/91 peersIndependent evidence69.0202/202 peersIndependent evidence55.0201/201 peersIndependent evidence
39Mistral Medium 3.5 · ReasoningMistral10.3$0.43697Within budgetPrice source ↗Single independent source22 published · 17 families · 6 task areas100% weight: Artificial AnalysisWhy this score?41.528/28 peersIndependent evidence39.487/87 peersIndependent evidence46.9198/198 peersIndependent evidence47.989/89 peersIndependent evidence25.2200/200 peersIndependent evidence43.641/41 peersIndependent evidence33.388/88 peersIndependent evidence53.6123/123 peersIndependent evidence55.1212/212 peersIndependent evidence22.537/37 peersIndependent evidence62.5208/208 peersIndependent evidence81.2178/178 peersIndependent evidence51.8114/114 peersIndependent evidence67.4198/198 peersIndependent evidence37.791/91 peersIndependent evidence75.6202/202 peersIndependent evidence55.6201/201 peersIndependent evidence
40NVIDIA-Nemotron-3-Super-120B-A12B-BF16 · ReasoningNVIDIA8.4$1.05999Within budgetPrice source ↗Single independent source21 published · 16 families · 5 task areas100% weight: Artificial AnalysisWhy this score?3.887/87 peersIndependent evidence3.126/26 peersIndependent evidence49.0198/198 peersIndependent evidence38.789/89 peersIndependent evidence78.0200/200 peersIndependent evidence4.341/41 peersIndependent evidence30.488/88 peersIndependent evidence39.1123/123 peersIndependent evidence65.5212/212 peersIndependent evidence73.7208/208 peersIndependent evidence85.9178/178 peersIndependent evidence0.028/28 peersIndependent evidence65.8198/198 peersIndependent evidence25.791/91 peersIndependent evidence53.7202/202 peersIndependent evidence49.5201/201 peersIndependent evidence
41Claude Haiku 4.5 · ReasoningAnthropic7.5$0.20771Within budgetPrice source ↗Single independent source27 published · 22 families · 6 task areas100% weight: Artificial AnalysisWhy this score?46.228/28 peersIndependent evidence43.387/87 peersIndependent evidence84.0108/108 peersIndependent evidence64.1198/198 peersIndependent evidence37.789/89 peersIndependent evidence25.4200/200 peersIndependent evidence25.841/41 peersIndependent evidence37.288/88 peersIndependent evidence51.3123/123 peersIndependent evidence64.063/63 peersIndependent evidence40.8212/212 peersIndependent evidence17.837/37 peersIndependent evidence54.0208/208 peersIndependent evidence66.3178/178 peersIndependent evidence29.928/28 peersIndependent evidence64.0112/112 peersIndependent evidence49.2114/114 peersIndependent evidence34.9114/114 peersIndependent evidence44.2198/198 peersIndependent evidence43.991/91 peersIndependent evidence47.6202/202 peersIndependent evidence50.2201/201 peersIndependent evidence
42Grok-4.3 · Non-reasoningxAI6.4$0.13744Within budgetPrice source ↗Single independent source18 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?45.387/87 peersIndependent evidence34.6197/197 peersIndependent evidence18.089/89 peersIndependent evidence25.0200/200 peersIndependent evidence30.188/88 peersIndependent evidence61.8123/123 peersIndependent evidence36.3212/212 peersIndependent evidence40.9208/208 peersIndependent evidence58.3178/178 peersIndependent evidence52.0114/114 peersIndependent evidence66.1198/198 peersIndependent evidence32.091/91 peersIndependent evidence45.4202/202 peersIndependent evidence45.5201/201 peersIndependent evidence
43NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 · ReasoningNVIDIA5.9$0.01675Within budgetPrice source ↗Single independent source20 published · 16 families · 5 task areas100% weight: Artificial AnalysisWhy this score?14.587/87 peersIndependent evidence93.8108/108 peersIndependent evidence40.3197/197 peersIndependent evidence23.589/89 peersIndependent evidence66.6200/200 peersIndependent evidence12.588/88 peersIndependent evidence23.4123/123 peersIndependent evidence57.7212/212 peersIndependent evidence58.2208/208 peersIndependent evidence84.6178/178 peersIndependent evidence83.1112/112 peersIndependent evidence61.9114/114 peersIndependent evidence41.7198/198 peersIndependent evidence12.691/91 peersIndependent evidence36.2202/202 peersIndependent evidence32.4201/201 peersIndependent evidence
44NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 · ReasoningNVIDIA5.2$0.0931Within budgetPrice source ↗Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?36.087/87 peersIndependent evidence41.0198/198 peersIndependent evidence17.689/89 peersIndependent evidence25.5200/200 peersIndependent evidence0.041/41 peersIndependent evidence33.688/88 peersIndependent evidence47.3123/123 peersIndependent evidence54.3212/212 peersIndependent evidence54.8208/208 peersIndependent evidence23.7198/198 peersIndependent evidence15.991/91 peersIndependent evidence28.9112/112 peersIndependent evidence41.7125/125 peersIndependent evidence
45Mistral Small 4 · ReasoningMistral5.1$0.04507Within budgetPrice source ↗Single independent source19 published · 15 families · 6 task areas100% weight: Artificial AnalysisWhy this score?0.028/28 peersIndependent evidence22.687/87 peersIndependent evidence51.1197/197 peersIndependent evidence20.589/89 peersIndependent evidence55.8200/200 peersIndependent evidence1.888/88 peersIndependent evidence30.1123/123 peersIndependent evidence61.1212/212 peersIndependent evidence51.4208/208 peersIndependent evidence58.8178/178 peersIndependent evidence32.6114/114 peersIndependent evidence60.4198/198 peersIndependent evidence31.691/91 peersIndependent evidence31.6202/202 peersIndependent evidence38.9201/201 peersIndependent evidence
46Solar Pro 3 · ReasoningUpstage4.9$0.07943Within budgetPrice source ↗Single independent source18 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?14.887/87 peersIndependent evidence24.2198/198 peersIndependent evidence10.789/89 peersIndependent evidence25.5200/200 peersIndependent evidence23.888/88 peersIndependent evidence24.4123/123 peersIndependent evidence49.4212/212 peersIndependent evidence53.0208/208 peersIndependent evidence85.2178/178 peersIndependent evidence46.1198/198 peersIndependent evidence6.891/91 peersIndependent evidence58.2202/202 peersIndependent evidence30.7201/201 peersIndependent evidence
47Qwen3-Coder-Next · Non-reasoningQwen4.7$0.55171Within budgetPrice source ↗Single independent source18 published · 14 families · 5 task areas100% weight: Artificial AnalysisWhy this score?27.887/87 peersIndependent evidence48.8197/197 peersIndependent evidence24.389/89 peersIndependent evidence25.4200/200 peersIndependent evidence29.588/88 peersIndependent evidence40.9123/123 peersIndependent evidence38.363/63 peersIndependent evidence51.8212/212 peersIndependent evidence51.5208/208 peersIndependent evidence29.7178/178 peersIndependent evidence32.4198/198 peersIndependent evidence24.991/91 peersIndependent evidence45.5202/202 peersIndependent evidence44.0201/201 peersIndependent evidence
48gpt-oss-120b · HighOpenAI4.5$0.10742Within budgetPrice source ↗Independent corroboration28 published · 23 families · 5 task areas48% weight: Artificial AnalysisWhy this score?4.287/87 peersIndependent evidence96.2108/108 peersIndependent evidence13.326/26 peersIndependent evidence30.5198/198 peersIndependent evidence7.089/89 peersIndependent evidence67.9200/200 peersIndependent evidence5.641/41 peersIndependent evidence36.288/88 peersIndependent evidence44.9123/123 peersIndependent evidence60.463/63 peersIndependent evidence60.5212/212 peersIndependent evidence0.037/37 peersIndependent evidence70.4208/208 peersIndependent evidence81.1178/178 peersIndependent evidence4.128/28 peersIndependent evidence97.6112/112 peersIndependent evidence68.9114/114 peersIndependent evidence58.1198/198 peersIndependent evidence20.591/91 peersIndependent evidence56.8202/202 peersIndependent evidence41.3201/201 peersIndependent evidence0.02/2 peersIndependent evidence0.040/40 peersIndependent evidence
49gpt-oss-20b · HighOpenAI4.1$0.01133Within budgetPrice source ↗Independent corroboration26 published · 19 families · 5 task areas73% weight: Artificial AnalysisWhy this score?4.287/87 peersIndependent evidence44.2150/150 peersIndependent evidence0.026/26 peersIndependent evidence23.5198/198 peersIndependent evidence3.189/89 peersIndependent evidence72.2200/200 peersIndependent evidence25.988/88 peersIndependent evidence27.5123/123 peersIndependent evidence27.363/63 peersIndependent evidence17.9213/213 peersIndependent evidence55.5208/208 peersIndependent evidence76.8178/178 peersIndependent evidence87.6112/112 peersIndependent evidence44.3114/114 peersIndependent evidence31.5198/198 peersIndependent evidence31.491/91 peersIndependent evidence44.6202/202 peersIndependent evidence33.2201/201 peersIndependent evidence7.850/50 peersIndependent evidence
50Mistral Large 3 · Non-reasoningMistral3.6$0.10437Within budgetPrice source ↗Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?22.587/87 peersIndependent evidence41.8108/108 peersIndependent evidence38.3197/197 peersIndependent evidence27.289/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.688/88 peersIndependent evidence33.1123/123 peersIndependent evidence46.863/63 peersIndependent evidence41.2212/212 peersIndependent evidence13.9208/208 peersIndependent evidence30.4178/178 peersIndependent evidence47.6112/112 peersIndependent evidence67.9114/114 peersIndependent evidence31.3114/114 peersIndependent evidence69.3198/198 peersIndependent evidence29.091/91 peersIndependent evidence24.5202/202 peersIndependent evidence36.3201/201 peersIndependent evidence

Behind the ranking

273 entries with published results · 55 ranked · 167 unranked in Value.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: value; evidence: documented; configurations: best
Pricing collected: 11 Sept 2026
Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000
https://unifybench.ai/?mode=value&page=2

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →