The leaders, at a glance

AI reasoning model ranking

Compare AI reasoning models and measured effort settings across published reasoning benchmarks.

Reasoning leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

217 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
201Kimi-Linear-48B-A3B-Instruct · Non-reasoningMoonshot1.2Eligible · 100%9 published · 3 families · 1 selected capabilities36.4108/108 peersIndependent evidence31.5197/197 peersIndependent evidence11.0212/212 peersIndependent evidence0.6208/208 peersIndependent evidence12.6178/178 peersIndependent evidence37.6112/112 peersIndependent evidence15.2114/114 peersIndependent evidence2.2171/171 peersIndependent evidence49.2169/169 peersIndependent evidence
202Gemma 3n E4B IT · Non-reasoningGoogle1.2Eligible · 100%16 published · 5 families · 1 selected capabilities12.8108/108 peersIndependent evidence5.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence3.9212/212 peersIndependent evidence20.1208/208 peersIndependent evidence11.6178/178 peersIndependent evidence10.3112/112 peersIndependent evidence25.560/60 peersIndependent evidence8.7114/114 peersIndependent evidence2.0114/114 peersIndependent evidence5.3198/198 peersIndependent evidence2.8202/202 peersIndependent evidence12.1201/201 peersIndependent evidence
203Amazon Nova Lite · Non-reasoningAmazon1.1Eligible · 100%15 published · 5 families · 1 selected capabilities6.4108/108 peersIndependent evidence13.7198/198 peersIndependent evidence25.5200/200 peersIndependent evidence13.5212/212 peersIndependent evidence17.8208/208 peersIndependent evidence28.4178/178 peersIndependent evidence11.7112/112 peersIndependent evidence22.160/60 peersIndependent evidence16.7114/114 peersIndependent evidence5.0114/114 peersIndependent evidence10.1198/198 peersIndependent evidence15.6171/171 peersIndependent evidence8.2169/169 peersIndependent evidence
204Amazon Nova Pro · Non-reasoningAmazon1.1Eligible · 100%14 published · 5 families · 1 selected capabilities6.4108/108 peersIndependent evidence25.8197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.4212/212 peersIndependent evidence4.1208/208 peersIndependent evidence36.5178/178 peersIndependent evidence14.7112/112 peersIndependent evidence27.360/60 peersIndependent evidence28.5114/114 peersIndependent evidence12.4114/114 peersIndependent evidence39.2198/198 peersIndependent evidence10.2171/171 peersIndependent evidence34.2169/169 peersIndependent evidence
205GPT-4o Mini · Non-reasoningOpenAI1.1Eligible · 100%12 published · 4 families · 1 selected capabilities13.6108/108 peersIndependent evidence2.657/57 peersIndependent evidence13.1123/123 peersIndependent evidence11.8212/212 peersIndependent evidence16.0208/208 peersIndependent evidence15.9178/178 peersIndependent evidence16.2112/112 peersIndependent evidence29.060/60 peersIndependent evidence20.2114/114 peersIndependent evidence7.4114/114 peersIndependent evidence3.4112/112 peersIndependent evidence17.1125/125 peersIndependent evidence
206Phi-4-multimodal-instruct · Non-reasoningMicrosoft1.0Eligible · 100%6 published · 3 families · 1 selected capabilities6.3212/212 peersIndependent evidence29.0208/208 peersIndependent evidence6.6112/112 peersIndependent evidence12.160/60 peersIndependent evidence7.8114/114 peersIndependent evidence0.0114/114 peersIndependent evidence
207Amazon Nova Micro · Non-reasoningAmazon1.0Eligible · 100%13 published · 5 families · 1 selected capabilities3.9108/108 peersIndependent evidence17.8197/197 peersIndependent evidence25.5200/200 peersIndependent evidence8.4212/212 peersIndependent evidence24.1208/208 peersIndependent evidence15.0178/178 peersIndependent evidence9.2112/112 peersIndependent evidence13.460/60 peersIndependent evidence10.7114/114 peersIndependent evidence10.9198/198 peersIndependent evidence10.2171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
208Phi-4-mini-instruct · Non-reasoningMicrosoft0.9Eligible · 100%15 published · 5 families · 1 selected capabilities4.9108/108 peersIndependent evidence19.7197/197 peersIndependent evidence25.5200/200 peersIndependent evidence0.0123/123 peersIndependent evidence6.5212/212 peersIndependent evidence19.3208/208 peersIndependent evidence3.8178/178 peersIndependent evidence5.8112/112 peersIndependent evidence11.560/60 peersIndependent evidence6.9114/114 peersIndependent evidence9.0198/198 peersIndependent evidence6.4171/171 peersIndependent evidence3.4201/201 peersIndependent evidence
209Gemma 3 1B IT · Non-reasoningGoogle0.9Eligible · 100%14 published · 5 families · 1 selected capabilities2.9108/108 peersIndependent evidence5.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence0.063/63 peersIndependent evidence2.4212/212 peersIndependent evidence33.6208/208 peersIndependent evidence2.4178/178 peersIndependent evidence0.9112/112 peersIndependent evidence1.860/60 peersIndependent evidence0.9114/114 peersIndependent evidence0.6198/198 peersIndependent evidence8.7171/171 peersIndependent evidence3.3169/169 peersIndependent evidence
210Gemma 3 270M IT · Non-reasoningGoogle0.9Eligible · 100%12 published · 4 families · 1 selected capabilities1.6108/108 peersIndependent evidence5.6197/197 peersIndependent evidence25.4200/200 peersIndependent evidence0.8212/212 peersIndependent evidence6.9208/208 peersIndependent evidence0.0178/178 peersIndependent evidence0.0112/112 peersIndependent evidence0.0114/114 peersIndependent evidence0.0198/198 peersIndependent evidence7.1171/171 peersIndependent evidence3.3169/169 peersIndependent evidence
211Gemma 3n E2B IT · Non-reasoningGoogle0.8Eligible · 100%13 published · 5 families · 1 selected capabilities8.4108/108 peersIndependent evidence5.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence1.3212/212 peersIndependent evidence14.2208/208 peersIndependent evidence5.5178/178 peersIndependent evidence3.3112/112 peersIndependent evidence8.060/60 peersIndependent evidence3.7114/114 peersIndependent evidence3.6198/198 peersIndependent evidence2.3171/171 peersIndependent evidence8.2169/169 peersIndependent evidence
212GPT-4-turbo · Non-reasoningOpenAI0.7Eligible · 100%4 published · 2 families · 1 selected capabilities3.9208/208 peersIndependent evidence22.5112/112 peersIndependent evidence22.960/60 peersIndependent evidence29.3114/114 peersIndependent evidence
213Pixtral Large · Non-reasoningMistral0.7Eligible · 100%9 published · 4 families · 1 selected capabilities1.7108/108 peersIndependent evidence19.2212/212 peersIndependent evidence2.0208/208 peersIndependent evidence29.2178/178 peersIndependent evidence17.3112/112 peersIndependent evidence17.060/60 peersIndependent evidence32.0114/114 peersIndependent evidence20.1114/114 peersIndependent evidence47.8171/171 peersIndependent evidence
214Mistral Large 2 (July 2024) · Non-reasoningMistral0.7Eligible · 100%9 published · 4 families · 1 selected capabilities0.0108/108 peersIndependent evidence12.9197/197 peersIndependent evidence16.7212/212 peersIndependent evidence2.8208/208 peersIndependent evidence18.5178/178 peersIndependent evidence19.3112/112 peersIndependent evidence17.060/60 peersIndependent evidence25.6114/114 peersIndependent evidence42.4171/171 peersIndependent evidence
215DeepSeek-R1-Distill-Qwen-1.5B · ReasoningDeepSeek0.6Eligible · 100%8 published · 4 families · 1 selected capabilities20.3108/108 peersIndependent evidence12.3197/197 peersIndependent evidence0.0212/212 peersIndependent evidence3.3208/208 peersIndependent evidence0.6178/178 peersIndependent evidence1.6112/112 peersIndependent evidence7.260/60 peersIndependent evidence2.2114/114 peersIndependent evidence
216GPT-4 · Non-reasoningOpenAI0.5Eligible · 100%7 published · 2 families · 1 selected capabilities14.8123/123 peersIndependent evidence7.6212/212 peersIndependent evidence25.1178/178 peersIndependent evidence5.660/60 peersIndependent evidence13.4114/114 peersIndependent evidence58.7198/198 peersIndependent evidence
217GPT-3.5-turbo · Non-reasoningOpenAI0.4Eligible · 100%3 published · 2 families · 1 selected capabilities4.1212/212 peersIndependent evidence0.060/60 peersIndependent evidence5.4114/114 peersIndependent evidence

About this ranking

This profile gives hard reasoning all the weight. It compares identified configurations using their own measured results, rather than borrowing results from another effort setting. Rankings require support in this capability. Matching effort labels across providers do not imply equal compute budgets.

View the Capability ranking →

Behind the ranking

273 entries with published results · 217 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:0,hard_reasoning:100,coding:0,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/rankings/reasoning?page=9

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →