The leaders, at a glance

AI reasoning model ranking

Compare AI reasoning models and measured effort settings across published reasoning benchmarks.

Reasoning leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

217 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
126GPT-5 Nano · HighOpenAI6.8Eligible · 100%15 published · 5 families · 1 selected capabilities83.8108/108 peersIndependent evidence46.5197/197 peersIndependent evidence25.2200/200 peersIndependent evidence50.163/63 peersIndependent evidence41.5212/212 peersIndependent evidence50.0208/208 peersIndependent evidence81.1178/178 peersIndependent evidence90.1112/112 peersIndependent evidence56.9114/114 peersIndependent evidence37.6114/114 peersIndependent evidence51.2198/198 peersIndependent evidence47.5171/171 peersIndependent evidence50.6169/169 peersIndependent evidence26.038/38 peersIndependent evidence
127Mistral Medium 3.5 · ReasoningMistral6.7Eligible · 100%22 published · 3 families · 1 selected capabilities41.528/28 peersIndependent evidence39.487/87 peersIndependent evidence46.9198/198 peersIndependent evidence47.989/89 peersIndependent evidence25.2200/200 peersIndependent evidence43.641/41 peersIndependent evidence33.388/88 peersIndependent evidence53.6123/123 peersIndependent evidence55.1212/212 peersIndependent evidence22.537/37 peersIndependent evidence62.5208/208 peersIndependent evidence81.2178/178 peersIndependent evidence51.8114/114 peersIndependent evidence67.4198/198 peersIndependent evidence37.791/91 peersIndependent evidence75.6202/202 peersIndependent evidence55.6201/201 peersIndependent evidence
128GLM-4.6V · ReasoningZ.ai6.6Eligible · 100%14 published · 4 families · 1 selected capabilities87.9108/108 peersIndependent evidence50.9197/197 peersIndependent evidence25.2200/200 peersIndependent evidence42.763/63 peersIndependent evidence49.4212/212 peersIndependent evidence50.9208/208 peersIndependent evidence15.4178/178 peersIndependent evidence10.5112/112 peersIndependent evidence64.3114/114 peersIndependent evidence17.6114/114 peersIndependent evidence33.7198/198 peersIndependent evidence39.4171/171 peersIndependent evidence54.0169/169 peersIndependent evidence
129Magistral Small 1.2 · ReasoningMistral6.5Eligible · 100%18 published · 4 families · 1 selected capabilities77.8108/108 peersIndependent evidence22.4197/197 peersIndependent evidence2.889/89 peersIndependent evidence55.9200/200 peersIndependent evidence15.1123/123 peersIndependent evidence28.363/63 peersIndependent evidence36.2212/212 peersIndependent evidence39.2208/208 peersIndependent evidence53.2178/178 peersIndependent evidence78.0112/112 peersIndependent evidence52.5114/114 peersIndependent evidence29.7114/114 peersIndependent evidence19.5198/198 peersIndependent evidence22.3202/202 peersIndependent evidence21.2201/201 peersIndependent evidence
130Qwen3-32B · ReasoningQwen6.5Eligible · 100%21 published · 5 families · 1 selected capabilities9.287/87 peersIndependent evidence71.3108/108 peersIndependent evidence5.8197/197 peersIndependent evidence22.489/89 peersIndependent evidence55.7200/200 peersIndependent evidence25.388/88 peersIndependent evidence17.0123/123 peersIndependent evidence39.0212/212 peersIndependent evidence43.4208/208 peersIndependent evidence31.4178/178 peersIndependent evidence58.3112/112 peersIndependent evidence74.460/60 peersIndependent evidence63.8114/114 peersIndependent evidence42.3198/198 peersIndependent evidence23.891/91 peersIndependent evidence27.6202/202 peersIndependent evidence19.9201/201 peersIndependent evidence
131Qwen3-VL-30B-A3B-Thinking · ReasoningQwen6.2Eligible · 100%12 published · 4 families · 1 selected capabilities81.1108/108 peersIndependent evidence25.4200/200 peersIndependent evidence49.1212/212 peersIndependent evidence48.7208/208 peersIndependent evidence54.7178/178 peersIndependent evidence73.7112/112 peersIndependent evidence68.5114/114 peersIndependent evidence39.8114/114 peersIndependent evidence40.1198/198 peersIndependent evidence19.8171/171 peersIndependent evidence30.7169/169 peersIndependent evidence
132Qwen3.5-4B · ReasoningQwen6.1Eligible · 100%12 published · 3 families · 1 selected capabilities64.1197/197 peersIndependent evidence25.0200/200 peersIndependent evidence62.4212/212 peersIndependent evidence53.0208/208 peersIndependent evidence64.6178/178 peersIndependent evidence53.1114/114 peersIndependent evidence26.9198/198 peersIndependent evidence63.5202/202 peersIndependent evidence52.7201/201 peersIndependent evidence
133GLM-4.5-Air · ReasoningZ.ai6.0Eligible · 100%13 published · 5 families · 1 selected capabilities78.7108/108 peersIndependent evidence48.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence51.4212/212 peersIndependent evidence42.9208/208 peersIndependent evidence34.5178/178 peersIndependent evidence70.2112/112 peersIndependent evidence76.260/60 peersIndependent evidence72.5114/114 peersIndependent evidence34.5198/198 peersIndependent evidence56.1171/171 peersIndependent evidence63.7169/169 peersIndependent evidence
134NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 · ReasoningNVIDIA5.8Eligible · 100%16 published · 3 families · 1 selected capabilities36.087/87 peersIndependent evidence41.0198/198 peersIndependent evidence17.689/89 peersIndependent evidence25.5200/200 peersIndependent evidence0.041/41 peersIndependent evidence33.688/88 peersIndependent evidence47.3123/123 peersIndependent evidence54.3212/212 peersIndependent evidence54.8208/208 peersIndependent evidence23.7198/198 peersIndependent evidence15.991/91 peersIndependent evidence28.9112/112 peersIndependent evidence41.7125/125 peersIndependent evidence
135MiniMax-M1-80k · ReasoningMiniMax5.7Eligible · 100%13 published · 5 families · 1 selected capabilities58.5108/108 peersIndependent evidence58.0197/197 peersIndependent evidence25.5200/200 peersIndependent evidence45.3212/212 peersIndependent evidence47.8208/208 peersIndependent evidence46.9178/178 peersIndependent evidence76.4112/112 peersIndependent evidence91.260/60 peersIndependent evidence75.2114/114 peersIndependent evidence62.3198/198 peersIndependent evidence44.0171/171 peersIndependent evidence20.9169/169 peersIndependent evidence
136Qwen3-235B-A22B · ReasoningQwen5.6Eligible · 100%13 published · 5 families · 1 selected capabilities79.8108/108 peersIndependent evidence5.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence46.6212/212 peersIndependent evidence57.0208/208 peersIndependent evidence36.8178/178 peersIndependent evidence64.9112/112 peersIndependent evidence58.360/60 peersIndependent evidence82.4114/114 peersIndependent evidence47.6198/198 peersIndependent evidence28.1171/171 peersIndependent evidence33.2169/169 peersIndependent evidence
137Qwen3-Coder-Next · Non-reasoningQwen5.4Eligible · 100%18 published · 3 families · 1 selected capabilities27.887/87 peersIndependent evidence48.8197/197 peersIndependent evidence24.389/89 peersIndependent evidence25.4200/200 peersIndependent evidence29.588/88 peersIndependent evidence40.9123/123 peersIndependent evidence38.363/63 peersIndependent evidence51.8212/212 peersIndependent evidence51.5208/208 peersIndependent evidence29.7178/178 peersIndependent evidence32.4198/198 peersIndependent evidence24.991/91 peersIndependent evidence45.5202/202 peersIndependent evidence44.0201/201 peersIndependent evidence
138Solar Pro 3 · ReasoningUpstage5.3Eligible · 100%18 published · 3 families · 1 selected capabilities14.887/87 peersIndependent evidence24.2198/198 peersIndependent evidence10.789/89 peersIndependent evidence25.5200/200 peersIndependent evidence23.888/88 peersIndependent evidence24.4123/123 peersIndependent evidence49.4212/212 peersIndependent evidence53.0208/208 peersIndependent evidence85.2178/178 peersIndependent evidence46.1198/198 peersIndependent evidence6.891/91 peersIndependent evidence58.2202/202 peersIndependent evidence30.7201/201 peersIndependent evidence
139Qwen3-Next-80B-A3B-Instruct · Non-reasoningQwen5.2Eligible · 100%12 published · 4 families · 1 selected capabilities63.7108/108 peersIndependent evidence52.5197/197 peersIndependent evidence25.4200/200 peersIndependent evidence52.7212/212 peersIndependent evidence45.0208/208 peersIndependent evidence41.7178/178 peersIndependent evidence70.4112/112 peersIndependent evidence77.9114/114 peersIndependent evidence41.6198/198 peersIndependent evidence22.8171/171 peersIndependent evidence42.9169/169 peersIndependent evidence
140GLM-4.7-Flash · ReasoningZ.ai5.2Eligible · 100%9 published · 3 families · 1 selected capabilities43.0197/197 peersIndependent evidence55.3200/200 peersIndependent evidence27.8212/212 peersIndependent evidence44.7208/208 peersIndependent evidence73.1178/178 peersIndependent evidence32.6198/198 peersIndependent evidence100.0171/171 peersIndependent evidence62.5169/169 peersIndependent evidence
141Step 3 VL 10B · ReasoningStepFun5.1Eligible · 100%10 published · 3 families · 1 selected capabilities5.7197/197 peersIndependent evidence25.2200/200 peersIndependent evidence44.4212/212 peersIndependent evidence56.0208/208 peersIndependent evidence61.3178/178 peersIndependent evidence46.9114/114 peersIndependent evidence19.0198/198 peersIndependent evidence12.3171/171 peersIndependent evidence30.4169/169 peersIndependent evidence
142Qwen3-4B-Thinking-2507 · ReasoningQwen5.1Eligible · 100%12 published · 4 families · 1 selected capabilities82.6108/108 peersIndependent evidence39.9197/197 peersIndependent evidence25.4200/200 peersIndependent evidence38.5212/212 peersIndependent evidence37.5208/208 peersIndependent evidence60.6178/178 peersIndependent evidence65.8112/112 peersIndependent evidence42.9114/114 peersIndependent evidence16.5198/198 peersIndependent evidence30.6171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
143Qwen3-30B-A3B-Instruct-2507 · Non-reasoningQwen5.0Eligible · 100%14 published · 5 families · 1 selected capabilities63.9108/108 peersIndependent evidence29.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.963/63 peersIndependent evidence35.7212/212 peersIndependent evidence41.4208/208 peersIndependent evidence24.3178/178 peersIndependent evidence55.8112/112 peersIndependent evidence84.460/60 peersIndependent evidence56.4114/114 peersIndependent evidence26.4198/198 peersIndependent evidence7.9171/171 peersIndependent evidence34.2169/169 peersIndependent evidence
144Qwen3.5-omni-flash · Non-reasoningQwen4.9Eligible · 100%10 published · 3 families · 1 selected capabilities51.9197/197 peersIndependent evidence25.2200/200 peersIndependent evidence54.1212/212 peersIndependent evidence44.1208/208 peersIndependent evidence35.2178/178 peersIndependent evidence50.6114/114 peersIndependent evidence24.8198/198 peersIndependent evidence76.6171/171 peersIndependent evidence45.3169/169 peersIndependent evidence
145Qwen3-VL-235B-A22B-Instruct · Non-reasoningQwen4.9Eligible · 100%13 published · 4 families · 1 selected capabilities67.7108/108 peersIndependent evidence35.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence47.4212/212 peersIndependent evidence40.0208/208 peersIndependent evidence48.6178/178 peersIndependent evidence63.0112/112 peersIndependent evidence80.2114/114 peersIndependent evidence58.7114/114 peersIndependent evidence54.3198/198 peersIndependent evidence46.0171/171 peersIndependent evidence39.1169/169 peersIndependent evidence
146Qwen3-VL-30B-A3B-Instruct · Non-reasoningQwen4.8Eligible · 100%12 published · 4 families · 1 selected capabilities70.0108/108 peersIndependent evidence25.4200/200 peersIndependent evidence44.7212/212 peersIndependent evidence38.2208/208 peersIndependent evidence24.8178/178 peersIndependent evidence49.8112/112 peersIndependent evidence50.8114/114 peersIndependent evidence42.5114/114 peersIndependent evidence29.8198/198 peersIndependent evidence17.7171/171 peersIndependent evidence34.3169/169 peersIndependent evidence
147GLM-4.5V · ReasoningZ.ai4.7Eligible · 100%13 published · 4 families · 1 selected capabilities71.3108/108 peersIndependent evidence5.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence43.5212/212 peersIndependent evidence38.5208/208 peersIndependent evidence28.3178/178 peersIndependent evidence63.8112/112 peersIndependent evidence59.7114/114 peersIndependent evidence19.4114/114 peersIndependent evidence57.9198/198 peersIndependent evidence24.9171/171 peersIndependent evidence30.1169/169 peersIndependent evidence
148Qwen3-VL-32B-Instruct · Non-reasoningQwen4.5Eligible · 100%12 published · 4 families · 1 selected capabilities66.2108/108 peersIndependent evidence25.4200/200 peersIndependent evidence40.2212/212 peersIndependent evidence40.8208/208 peersIndependent evidence39.2178/178 peersIndependent evidence54.5112/112 peersIndependent evidence60.9114/114 peersIndependent evidence48.4114/114 peersIndependent evidence25.5198/198 peersIndependent evidence37.0171/171 peersIndependent evidence46.0169/169 peersIndependent evidence
149Solar Open 100B · ReasoningUpstage4.4Eligible · 100%10 published · 3 families · 1 selected capabilities42.4197/197 peersIndependent evidence25.2200/200 peersIndependent evidence50.663/63 peersIndependent evidence35.4212/212 peersIndependent evidence54.6208/208 peersIndependent evidence68.3178/178 peersIndependent evidence47.2198/198 peersIndependent evidence57.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
150Qwen3-30B-A3B · ReasoningQwen4.3Eligible · 100%13 published · 5 families · 1 selected capabilities70.0108/108 peersIndependent evidence5.9197/197 peersIndependent evidence25.3200/200 peersIndependent evidence32.1212/212 peersIndependent evidence37.6208/208 peersIndependent evidence45.1178/178 peersIndependent evidence51.6112/112 peersIndependent evidence74.360/60 peersIndependent evidence55.7114/114 peersIndependent evidence33.5198/198 peersIndependent evidence31.7171/171 peersIndependent evidence17.4169/169 peersIndependent evidence

About this ranking

This profile gives hard reasoning all the weight. It compares identified configurations using their own measured results, rather than borrowing results from another effort setting. Rankings require support in this capability. Matching effort labels across providers do not imply equal compute budgets.

View the Capability ranking →

Behind the ranking

273 entries with published results · 217 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:0,hard_reasoning:100,coding:0,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/rankings/reasoning?page=6

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →