The leaders, at a glance

AI reasoning model ranking

Compare AI reasoning models and measured effort settings across published reasoning benchmarks.

Reasoning leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

217 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
151Gemini 2.5 Flash-Lite · ReasoningGoogle4.1Eligible · 100%15 published · 5 families · 1 selected capabilities51.5108/108 peersIndependent evidence42.5198/198 peersIndependent evidence25.2200/200 peersIndependent evidence33.1212/212 peersIndependent evidence41.1208/208 peersIndependent evidence60.8178/178 peersIndependent evidence61.9112/112 peersIndependent evidence79.760/60 peersIndependent evidence46.6114/114 peersIndependent evidence34.0114/114 peersIndependent evidence43.9198/198 peersIndependent evidence15.1171/171 peersIndependent evidence26.8169/169 peersIndependent evidence
152NVIDIA-Nemotron-Nano-12B-v2-VL-BF16 · ReasoningNVIDIA3.9Eligible · 100%13 published · 4 families · 1 selected capabilities73.9108/108 peersIndependent evidence42.3197/197 peersIndependent evidence25.2200/200 peersIndependent evidence25.6212/212 peersIndependent evidence34.2208/208 peersIndependent evidence19.8178/178 peersIndependent evidence71.9112/112 peersIndependent evidence47.3114/114 peersIndependent evidence23.9114/114 peersIndependent evidence24.1198/198 peersIndependent evidence21.2171/171 peersIndependent evidence26.7169/169 peersIndependent evidence
153Gemma 4 E4B IT · Non-reasoningGoogle3.8Eligible · 100%10 published · 3 families · 1 selected capabilities28.3197/197 peersIndependent evidence56.0200/200 peersIndependent evidence23.0212/212 peersIndependent evidence25.7208/208 peersIndependent evidence42.8178/178 peersIndependent evidence22.0114/114 peersIndependent evidence7.4198/198 peersIndependent evidence30.8171/171 peersIndependent evidence40.7169/169 peersIndependent evidence
154DeepSeek-R1-0528-Qwen3-8B · ReasoningDeepSeek3.8Eligible · 100%13 published · 5 families · 1 selected capabilities62.3108/108 peersIndependent evidence19.4197/197 peersIndependent evidence25.5200/200 peersIndependent evidence30.7212/212 peersIndependent evidence36.4208/208 peersIndependent evidence1.9178/178 peersIndependent evidence53.7112/112 peersIndependent evidence62.160/60 peersIndependent evidence38.8114/114 peersIndependent evidence15.4198/198 peersIndependent evidence2.3171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
155DeepSeek-R1-Distill-Qwen-32B · ReasoningDeepSeek3.7Eligible · 100%8 published · 4 families · 1 selected capabilities61.3108/108 peersIndependent evidence15.3197/197 peersIndependent evidence31.5212/212 peersIndependent evidence21.1208/208 peersIndependent evidence6.9178/178 peersIndependent evidence20.2112/112 peersIndependent evidence68.560/60 peersIndependent evidence39.2114/114 peersIndependent evidence
156MiniMax-M1-40k · ReasoningMiniMax3.5Eligible · 100%9 published · 4 families · 1 selected capabilities10.7108/108 peersIndependent evidence42.4212/212 peersIndependent evidence46.0208/208 peersIndependent evidence44.7178/178 peersIndependent evidence67.6112/112 peersIndependent evidence82.960/60 peersIndependent evidence70.0114/114 peersIndependent evidence39.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
157ERNIE-4.5-300B-A47B-PT · Non-reasoningBaidu3.4Eligible · 100%12 published · 5 families · 1 selected capabilities45.0108/108 peersIndependent evidence25.4200/200 peersIndependent evidence68.8212/212 peersIndependent evidence5.1208/208 peersIndependent evidence38.6178/178 peersIndependent evidence47.3112/112 peersIndependent evidence59.760/60 peersIndependent evidence55.0114/114 peersIndependent evidence50.9198/198 peersIndependent evidence2.3171/171 peersIndependent evidence34.3169/169 peersIndependent evidence
158Qwen3-14B · ReasoningQwen3.4Eligible · 100%21 published · 5 families · 1 selected capabilities3.987/87 peersIndependent evidence54.8108/108 peersIndependent evidence5.8197/197 peersIndependent evidence3.089/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.388/88 peersIndependent evidence12.4123/123 peersIndependent evidence29.7212/212 peersIndependent evidence20.1208/208 peersIndependent evidence43.7178/178 peersIndependent evidence56.3112/112 peersIndependent evidence75.660/60 peersIndependent evidence53.4114/114 peersIndependent evidence28.2198/198 peersIndependent evidence14.291/91 peersIndependent evidence31.9202/202 peersIndependent evidence21.2201/201 peersIndependent evidence
159NVIDIA-Nemotron-Nano-9B-v2 · ReasoningNVIDIA3.3Eligible · 100%12 published · 4 families · 1 selected capabilities67.2108/108 peersIndependent evidence28.1197/197 peersIndependent evidence25.2200/200 peersIndependent evidence24.7212/212 peersIndependent evidence26.6208/208 peersIndependent evidence11.2178/178 peersIndependent evidence80.1112/112 peersIndependent evidence40.9114/114 peersIndependent evidence14.4198/198 peersIndependent evidence23.4171/171 peersIndependent evidence11.8169/169 peersIndependent evidence
160GPT-4.1 Mini · Non-reasoningOpenAI3.2Eligible · 100%17 published · 5 families · 1 selected capabilities48.3108/108 peersIndependent evidence45.1197/197 peersIndependent evidence25.4200/200 peersIndependent evidence25.5123/123 peersIndependent evidence37.0212/212 peersIndependent evidence30.1208/208 peersIndependent evidence37.2178/178 peersIndependent evidence51.3112/112 peersIndependent evidence56.860/60 peersIndependent evidence57.7114/114 peersIndependent evidence36.2114/114 peersIndependent evidence54.3198/198 peersIndependent evidence38.7202/202 peersIndependent evidence33.6201/201 peersIndependent evidence
161Qwen3-Coder-480B-A35B-Instruct · Non-reasoningQwen3.1Eligible · 100%13 published · 5 families · 1 selected capabilities43.5108/108 peersIndependent evidence46.8197/197 peersIndependent evidence25.5200/200 peersIndependent evidence32.3212/212 peersIndependent evidence21.2208/208 peersIndependent evidence43.9178/178 peersIndependent evidence60.6112/112 peersIndependent evidence69.860/60 peersIndependent evidence59.1114/114 peersIndependent evidence30.9198/198 peersIndependent evidence53.0171/171 peersIndependent evidence62.4169/169 peersIndependent evidence
162Qwen3-Omni-30B-A3B-Instruct · Non-reasoningQwen3.0Eligible · 100%13 published · 4 families · 1 selected capabilities51.3108/108 peersIndependent evidence5.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence32.8212/212 peersIndependent evidence24.1208/208 peersIndependent evidence16.8178/178 peersIndependent evidence44.0112/112 peersIndependent evidence36.5114/114 peersIndependent evidence29.5114/114 peersIndependent evidence23.1198/198 peersIndependent evidence14.0171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
163EXAONE 4.0 1.2B · ReasoningLG AI Research3.0Eligible · 100%12 published · 4 families · 1 selected capabilities48.7108/108 peersIndependent evidence5.7197/197 peersIndependent evidence25.2200/200 peersIndependent evidence20.5212/212 peersIndependent evidence37.0208/208 peersIndependent evidence7.4178/178 peersIndependent evidence55.0112/112 peersIndependent evidence17.2114/114 peersIndependent evidence4.0198/198 peersIndependent evidence12.2171/171 peersIndependent evidence3.3169/169 peersIndependent evidence
164DeepSeek-R1-Distill-Llama-70B · ReasoningDeepSeek3.0Eligible · 100%13 published · 5 families · 1 selected capabilities53.3108/108 peersIndependent evidence15.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence10.2212/212 peersIndependent evidence31.1208/208 peersIndependent evidence10.6178/178 peersIndependent evidence18.8112/112 peersIndependent evidence65.360/60 peersIndependent evidence62.9114/114 peersIndependent evidence52.2198/198 peersIndependent evidence23.8171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
165DeepSeek-R1-Distill-Qwen-14B · ReasoningDeepSeek2.8Eligible · 100%8 published · 4 families · 1 selected capabilities54.5108/108 peersIndependent evidence17.0197/197 peersIndependent evidence17.7212/212 peersIndependent evidence13.2208/208 peersIndependent evidence6.2178/178 peersIndependent evidence35.5112/112 peersIndependent evidence72.360/60 peersIndependent evidence40.7114/114 peersIndependent evidence
166Qwen3-VL-8B-Thinking · ReasoningQwen2.8Eligible · 100%13 published · 4 families · 1 selected capabilities32.8108/108 peersIndependent evidence36.5197/197 peersIndependent evidence56.4200/200 peersIndependent evidence27.6212/212 peersIndependent evidence10.4208/208 peersIndependent evidence43.0178/178 peersIndependent evidence34.5112/112 peersIndependent evidence45.0114/114 peersIndependent evidence32.7114/114 peersIndependent evidence55.4198/198 peersIndependent evidence25.7171/171 peersIndependent evidence24.2169/169 peersIndependent evidence
167Mistral Large 3 · Non-reasoningMistral2.7Eligible · 100%22 published · 4 families · 1 selected capabilities22.587/87 peersIndependent evidence41.8108/108 peersIndependent evidence38.3197/197 peersIndependent evidence27.289/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.688/88 peersIndependent evidence33.1123/123 peersIndependent evidence46.863/63 peersIndependent evidence41.2212/212 peersIndependent evidence13.9208/208 peersIndependent evidence30.4178/178 peersIndependent evidence47.6112/112 peersIndependent evidence67.9114/114 peersIndependent evidence31.3114/114 peersIndependent evidence69.3198/198 peersIndependent evidence29.091/91 peersIndependent evidence24.5202/202 peersIndependent evidence36.3201/201 peersIndependent evidence
168Mistral Medium 3.1 · Non-reasoningMistral2.6Eligible · 100%20 published · 4 families · 1 selected capabilities40.487/87 peersIndependent evidence42.5108/108 peersIndependent evidence40.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.088/88 peersIndependent evidence32.1123/123 peersIndependent evidence28.4212/212 peersIndependent evidence25.2208/208 peersIndependent evidence42.1178/178 peersIndependent evidence42.9112/112 peersIndependent evidence27.1114/114 peersIndependent evidence27.9114/114 peersIndependent evidence55.7198/198 peersIndependent evidence18.591/91 peersIndependent evidence40.1202/202 peersIndependent evidence34.2201/201 peersIndependent evidence
169Qwen3-4B-Instruct-2507 · Non-reasoningQwen2.6Eligible · 100%13 published · 4 families · 1 selected capabilities51.3108/108 peersIndependent evidence17.2197/197 peersIndependent evidence25.5200/200 peersIndependent evidence11.863/63 peersIndependent evidence22.0212/212 peersIndependent evidence20.1208/208 peersIndependent evidence27.6178/178 peersIndependent evidence36.9112/112 peersIndependent evidence23.1114/114 peersIndependent evidence12.8198/198 peersIndependent evidence33.2171/171 peersIndependent evidence28.0169/169 peersIndependent evidence
170GPT-4.1 · Non-reasoningOpenAI2.6Eligible · 100%14 published · 5 families · 1 selected capabilities36.1108/108 peersIndependent evidence70.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence37.9212/212 peersIndependent evidence15.1208/208 peersIndependent evidence50.2178/178 peersIndependent evidence45.8112/112 peersIndependent evidence55.060/60 peersIndependent evidence66.7114/114 peersIndependent evidence39.2114/114 peersIndependent evidence76.2198/198 peersIndependent evidence56.9171/171 peersIndependent evidence53.6169/169 peersIndependent evidence
171NVIDIA-Nemotron-3-Nano-4B-BF16 · ReasoningNVIDIA2.4Eligible · 100%11 published · 3 families · 1 selected capabilities27.6197/197 peersIndependent evidence25.2200/200 peersIndependent evidence8.9123/123 peersIndependent evidence20.4212/212 peersIndependent evidence27.1208/208 peersIndependent evidence70.2178/178 peersIndependent evidence9.6198/198 peersIndependent evidence34.9171/171 peersIndependent evidence27.5201/201 peersIndependent evidence
172Llama 4 Maverick · Non-reasoningMeta2.3Eligible · 100%24 published · 5 families · 1 selected capabilities4.187/87 peersIndependent evidence18.6108/108 peersIndependent evidence36.3198/198 peersIndependent evidence7.989/89 peersIndependent evidence25.1200/200 peersIndependent evidence9.088/88 peersIndependent evidence4.6123/123 peersIndependent evidence59.763/63 peersIndependent evidence39.6212/212 peersIndependent evidence28.1208/208 peersIndependent evidence49.6178/178 peersIndependent evidence39.3112/112 peersIndependent evidence47.660/60 peersIndependent evidence70.7114/114 peersIndependent evidence42.6114/114 peersIndependent evidence68.7198/198 peersIndependent evidence15.791/91 peersIndependent evidence11.9202/202 peersIndependent evidence28.0201/201 peersIndependent evidence
173Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 · ReasoningNVIDIA2.2Eligible · 100%12 published · 3 families · 1 selected capabilities41.1197/197 peersIndependent evidence25.3200/200 peersIndependent evidence21.9123/123 peersIndependent evidence15.5212/212 peersIndependent evidence26.3208/208 peersIndependent evidence75.7178/178 peersIndependent evidence25.9114/114 peersIndependent evidence27.9198/198 peersIndependent evidence53.9171/171 peersIndependent evidence34.4201/201 peersIndependent evidence
174Ministral 3 14B · Non-reasoningMistral2.2Eligible · 100%22 published · 4 families · 1 selected capabilities17.887/87 peersIndependent evidence31.5108/108 peersIndependent evidence28.9197/197 peersIndependent evidence15.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.688/88 peersIndependent evidence23.5123/123 peersIndependent evidence13.963/63 peersIndependent evidence25.1212/212 peersIndependent evidence24.1208/208 peersIndependent evidence20.6178/178 peersIndependent evidence33.9112/112 peersIndependent evidence29.9114/114 peersIndependent evidence19.8114/114 peersIndependent evidence19.9198/198 peersIndependent evidence6.691/91 peersIndependent evidence29.8202/202 peersIndependent evidence24.9201/201 peersIndependent evidence
175Mistral Medium 3 · Non-reasoningMistral2.1Eligible · 100%14 published · 5 families · 1 selected capabilities31.9108/108 peersIndependent evidence33.0197/197 peersIndependent evidence25.5200/200 peersIndependent evidence27.0212/212 peersIndependent evidence11.9208/208 peersIndependent evidence39.9178/178 peersIndependent evidence39.9112/112 peersIndependent evidence53.260/60 peersIndependent evidence48.4114/114 peersIndependent evidence25.4114/114 peersIndependent evidence45.4198/198 peersIndependent evidence28.5171/171 peersIndependent evidence24.1169/169 peersIndependent evidence

About this ranking

This profile gives hard reasoning all the weight. It compares identified configurations using their own measured results, rather than borrowing results from another effort setting. Rankings require support in this capability. Matching effort labels across providers do not imply equal compute budgets.

View the Capability ranking →

Behind the ranking

273 entries with published results · 217 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:0,hard_reasoning:100,coding:0,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/rankings/reasoning?page=7

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →