The leaders, at a glance

AI reasoning model ranking

Compare AI reasoning models and measured effort settings across published reasoning benchmarks.

Reasoning leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

217 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
76Qwen3.6-27B · ReasoningQwen18.7Eligible · 100%19 published · 3 families · 1 selected capabilities53.487/87 peersIndependent evidence89.1197/197 peersIndependent evidence52.989/89 peersIndependent evidence70.7200/200 peersIndependent evidence64.188/88 peersIndependent evidence66.8123/123 peersIndependent evidence77.3212/212 peersIndependent evidence56.237/37 peersIndependent evidence77.6208/208 peersIndependent evidence81.2178/178 peersIndependent evidence78.0114/114 peersIndependent evidence52.8198/198 peersIndependent evidence45.691/91 peersIndependent evidence76.9202/202 peersIndependent evidence58.5201/201 peersIndependent evidence
77o3 · ReasoningOpenAI18.2Eligible · 100%14 published · 5 families · 1 selected capabilities91.5108/108 peersIndependent evidence83.8197/197 peersIndependent evidence70.1200/200 peersIndependent evidence72.2212/212 peersIndependent evidence73.5208/208 peersIndependent evidence86.0178/178 peersIndependent evidence91.9112/112 peersIndependent evidence99.660/60 peersIndependent evidence91.3114/114 peersIndependent evidence65.0114/114 peersIndependent evidence88.4198/198 peersIndependent evidence73.3171/171 peersIndependent evidence89.2169/169 peersIndependent evidence
78NVIDIA-Nemotron-3-Super-120B-A12B-BF16 · ReasoningNVIDIA17.9Eligible · 100%21 published · 3 families · 1 selected capabilities3.887/87 peersIndependent evidence3.126/26 peersIndependent evidence49.0198/198 peersIndependent evidence38.789/89 peersIndependent evidence78.0200/200 peersIndependent evidence4.341/41 peersIndependent evidence30.488/88 peersIndependent evidence39.1123/123 peersIndependent evidence65.5212/212 peersIndependent evidence73.7208/208 peersIndependent evidence85.9178/178 peersIndependent evidence0.028/28 peersIndependent evidence65.8198/198 peersIndependent evidence25.791/91 peersIndependent evidence53.7202/202 peersIndependent evidence49.5201/201 peersIndependent evidence
79Step 3.7 Flash · ReasoningStepFun17.8Eligible · 100%18 published · 3 families · 1 selected capabilities46.126/26 peersIndependent evidence80.6197/197 peersIndependent evidence75.4200/200 peersIndependent evidence23.141/41 peersIndependent evidence59.7123/123 peersIndependent evidence67.0212/212 peersIndependent evidence31.037/37 peersIndependent evidence74.7208/208 peersIndependent evidence79.9178/178 peersIndependent evidence36.828/28 peersIndependent evidence78.2114/114 peersIndependent evidence71.5198/198 peersIndependent evidence50.691/91 peersIndependent evidence75.7202/202 peersIndependent evidence68.4201/201 peersIndependent evidence
80Qwen3.5-35B-A3B · ReasoningQwen17.7Eligible · 100%12 published · 3 families · 1 selected capabilities80.4197/197 peersIndependent evidence67.1200/200 peersIndependent evidence74.463/63 peersIndependent evidence79.4212/212 peersIndependent evidence76.4208/208 peersIndependent evidence88.9178/178 peersIndependent evidence14.428/28 peersIndependent evidence73.5114/114 peersIndependent evidence54.1198/198 peersIndependent evidence83.6171/171 peersIndependent evidence70.1169/169 peersIndependent evidence
81GLM-5-Turbo · ReasoningZ.ai17.2Eligible · 100%9 published · 3 families · 1 selected capabilities78.0197/197 peersIndependent evidence55.8200/200 peersIndependent evidence80.2212/212 peersIndependent evidence81.7208/208 peersIndependent evidence90.0178/178 peersIndependent evidence77.8198/198 peersIndependent evidence98.9171/171 peersIndependent evidence82.2169/169 peersIndependent evidence
82Gemini 3.5 Flash-Lite · HighGoogle16.8Eligible · 100%37 published · 7 families · 1 selected capabilities45.948/48 peersIndependent evidence59.547/47 peersIndependent evidence9.432/32 peersIndependent evidence12.231/31 peersIndependent evidence13.329/29 peersIndependent evidence44.638/38 peersIndependent evidence3.926/26 peersIndependent evidence26.026/26 peersIndependent evidence11.426/26 peersIndependent evidence14.926/26 peersIndependent evidence25.726/26 peersIndependent evidence6.026/26 peersIndependent evidence41.226/26 peersIndependent evidence76.150/50 peersIndependent evidence11.739/39 peersIndependent evidence25.230/30 peersIndependent evidence4.033/33 peersIndependent evidence12.132/32 peersIndependent evidence12.532/32 peersIndependent evidence23.432/32 peersIndependent evidence
83Gemini 2.5 Pro · ReasoningGoogle16.5Eligible · 100%23 published · 5 families · 1 selected capabilities25.387/87 peersIndependent evidence89.7108/108 peersIndependent evidence69.3197/197 peersIndependent evidence32.789/89 peersIndependent evidence75.3200/200 peersIndependent evidence60.688/88 peersIndependent evidence37.0123/123 peersIndependent evidence90.963/63 peersIndependent evidence76.3212/212 peersIndependent evidence75.1208/208 peersIndependent evidence58.9178/178 peersIndependent evidence91.0112/112 peersIndependent evidence77.060/60 peersIndependent evidence94.5114/114 peersIndependent evidence75.1114/114 peersIndependent evidence87.9198/198 peersIndependent evidence61.591/91 peersIndependent evidence49.1202/202 peersIndependent evidence45.8201/201 peersIndependent evidence
84Qwen3.6-flash · Non-reasoningQwen16.3Eligible · 100%2 published · 2 families · 1 selected capabilities64.940/40 peersIndependent evidence25.839/39 peersIndependent evidence
85K EXAONE 2.0 750B A37B · ReasoningLG AI Research15.9Eligible · 100%10 published · 3 families · 1 selected capabilities60.1197/197 peersIndependent evidence66.8200/200 peersIndependent evidence56.3123/123 peersIndependent evidence73.8212/212 peersIndependent evidence71.7208/208 peersIndependent evidence17.9198/198 peersIndependent evidence41.591/91 peersIndependent evidence38.0112/112 peersIndependent evidence51.1125/125 peersIndependent evidence
86o4-mini · HighOpenAI15.1Eligible · 100%16 published · 6 families · 1 selected capabilities93.1108/108 peersIndependent evidence56.6197/197 peersIndependent evidence61.0200/200 peersIndependent evidence61.0212/212 peersIndependent evidence66.2208/208 peersIndependent evidence80.2178/178 peersIndependent evidence99.4112/112 peersIndependent evidence97.560/60 peersIndependent evidence85.4114/114 peersIndependent evidence59.8114/114 peersIndependent evidence66.1198/198 peersIndependent evidence59.3171/171 peersIndependent evidence53.7169/169 peersIndependent evidence36.638/38 peersIndependent evidence
87Qwen3.6-35B-A3B · ReasoningQwen15.0Eligible · 100%18 published · 3 families · 1 selected capabilities45.487/87 peersIndependent evidence78.1197/197 peersIndependent evidence43.389/89 peersIndependent evidence55.7200/200 peersIndependent evidence49.888/88 peersIndependent evidence60.1123/123 peersIndependent evidence76.6212/212 peersIndependent evidence76.8208/208 peersIndependent evidence77.1178/178 peersIndependent evidence80.4114/114 peersIndependent evidence48.6198/198 peersIndependent evidence27.891/91 peersIndependent evidence69.0202/202 peersIndependent evidence55.0201/201 peersIndependent evidence
88MiniMax-M2.1 · ReasoningMiniMax14.7Eligible · 100%13 published · 4 families · 1 selected capabilities82.6108/108 peersIndependent evidence70.3197/197 peersIndependent evidence56.4200/200 peersIndependent evidence66.163/63 peersIndependent evidence74.1212/212 peersIndependent evidence77.4208/208 peersIndependent evidence83.1178/178 peersIndependent evidence92.8112/112 peersIndependent evidence98.1114/114 peersIndependent evidence59.1198/198 peersIndependent evidence79.7171/171 peersIndependent evidence75.6169/169 peersIndependent evidence
89DeepSeek-R1-0528 · ReasoningDeepSeek14.1Eligible · 100%14 published · 5 families · 1 selected capabilities74.2108/108 peersIndependent evidence57.0197/197 peersIndependent evidence73.2200/200 peersIndependent evidence75.963/63 peersIndependent evidence69.4212/212 peersIndependent evidence67.7208/208 peersIndependent evidence41.1178/178 peersIndependent evidence87.5112/112 peersIndependent evidence94.660/60 peersIndependent evidence90.4114/114 peersIndependent evidence79.9198/198 peersIndependent evidence47.8171/171 peersIndependent evidence57.8169/169 peersIndependent evidence
90K EXAONE 236B A23B · ReasoningLG AI Research14.1Eligible · 100%15 published · 4 families · 1 selected capabilities92.2108/108 peersIndependent evidence62.4197/197 peersIndependent evidence68.8200/200 peersIndependent evidence30.9123/123 peersIndependent evidence32.563/63 peersIndependent evidence64.0212/212 peersIndependent evidence65.0208/208 peersIndependent evidence78.1178/178 peersIndependent evidence86.6112/112 peersIndependent evidence87.4114/114 peersIndependent evidence35.2198/198 peersIndependent evidence68.7171/171 peersIndependent evidence55.4201/201 peersIndependent evidence
91ERNIE-5.0-thinking-preview · ReasoningBaidu13.9Eligible · 100%13 published · 4 families · 1 selected capabilities88.2108/108 peersIndependent evidence73.5200/200 peersIndependent evidence78.563/63 peersIndependent evidence61.9212/212 peersIndependent evidence62.4208/208 peersIndependent evidence45.9178/178 peersIndependent evidence93.7112/112 peersIndependent evidence84.6114/114 peersIndependent evidence50.1114/114 peersIndependent evidence61.4198/198 peersIndependent evidence75.3171/171 peersIndependent evidence69.5169/169 peersIndependent evidence
92GLM-4.6 · ReasoningZ.ai13.9Eligible · 100%16 published · 4 families · 1 selected capabilities88.6108/108 peersIndependent evidence56.0197/197 peersIndependent evidence70.8200/200 peersIndependent evidence52.6123/123 peersIndependent evidence73.163/63 peersIndependent evidence63.1212/212 peersIndependent evidence66.3208/208 peersIndependent evidence50.3178/178 peersIndependent evidence72.8112/112 peersIndependent evidence83.0114/114 peersIndependent evidence75.1198/198 peersIndependent evidence60.2202/202 peersIndependent evidence64.6201/201 peersIndependent evidence
93GLM-5V-Turbo · ReasoningZ.ai13.8Eligible · 100%10 published · 3 families · 1 selected capabilities74.9197/197 peersIndependent evidence63.1200/200 peersIndependent evidence67.9212/212 peersIndependent evidence70.1208/208 peersIndependent evidence74.0178/178 peersIndependent evidence73.5114/114 peersIndependent evidence79.0198/198 peersIndependent evidence98.9171/171 peersIndependent evidence80.5169/169 peersIndependent evidence
94Qwen3.5-omni-plus · Non-reasoningQwen13.6Eligible · 100%10 published · 3 families · 1 selected capabilities64.5197/197 peersIndependent evidence61.3200/200 peersIndependent evidence72.0212/212 peersIndependent evidence66.7208/208 peersIndependent evidence63.1178/178 peersIndependent evidence67.6114/114 peersIndependent evidence43.1198/198 peersIndependent evidence83.2171/171 peersIndependent evidence64.2169/169 peersIndependent evidence
95GPT-5 Mini · MediumOpenAI13.3Eligible · 100%20 published · 5 families · 1 selected capabilities88.1108/108 peersIndependent evidence79.0197/197 peersIndependent evidence73.3200/200 peersIndependent evidence66.7212/212 peersIndependent evidence68.9208/208 peersIndependent evidence84.9178/178 peersIndependent evidence71.3112/112 peersIndependent evidence81.7114/114 peersIndependent evidence60.7114/114 peersIndependent evidence64.2198/198 peersIndependent evidence67.4171/171 peersIndependent evidence75.4169/169 peersIndependent evidence32.038/38 peersIndependent evidence34.64/4 peersIndependent evidence
96Amazon Nova 2 Lite · HighAmazon12.7Eligible · 100%15 published · 4 families · 1 selected capabilities96.4108/108 peersIndependent evidence61.0197/197 peersIndependent evidence54.6200/200 peersIndependent evidence29.0123/123 peersIndependent evidence69.9212/212 peersIndependent evidence59.9208/208 peersIndependent evidence83.8178/178 peersIndependent evidence76.9112/112 peersIndependent evidence77.4114/114 peersIndependent evidence45.7114/114 peersIndependent evidence49.8198/198 peersIndependent evidence67.1171/171 peersIndependent evidence42.2201/201 peersIndependent evidence
97NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 · ReasoningNVIDIA12.4Eligible · 100%20 published · 4 families · 1 selected capabilities14.587/87 peersIndependent evidence93.8108/108 peersIndependent evidence40.3197/197 peersIndependent evidence23.589/89 peersIndependent evidence66.6200/200 peersIndependent evidence12.588/88 peersIndependent evidence23.4123/123 peersIndependent evidence57.7212/212 peersIndependent evidence58.2208/208 peersIndependent evidence84.6178/178 peersIndependent evidence83.1112/112 peersIndependent evidence61.9114/114 peersIndependent evidence41.7198/198 peersIndependent evidence12.691/91 peersIndependent evidence36.2202/202 peersIndependent evidence32.4201/201 peersIndependent evidence
98Gemini 2.5 Flash · ReasoningGoogle11.9Eligible · 100%15 published · 5 families · 1 selected capabilities72.3108/108 peersIndependent evidence61.6198/198 peersIndependent evidence71.2200/200 peersIndependent evidence65.5212/212 peersIndependent evidence60.8208/208 peersIndependent evidence61.9178/178 peersIndependent evidence72.8112/112 peersIndependent evidence94.060/60 peersIndependent evidence84.9114/114 peersIndependent evidence61.0114/114 peersIndependent evidence72.3198/198 peersIndependent evidence39.4171/171 peersIndependent evidence52.5169/169 peersIndependent evidence
99Qwen3.5-9B · ReasoningQwen11.8Eligible · 100%13 published · 3 families · 1 selected capabilities74.8197/197 peersIndependent evidence56.1200/200 peersIndependent evidence33.4123/123 peersIndependent evidence68.3212/212 peersIndependent evidence68.3208/208 peersIndependent evidence79.9178/178 peersIndependent evidence62.6114/114 peersIndependent evidence36.5198/198 peersIndependent evidence54.8202/202 peersIndependent evidence58.7201/201 peersIndependent evidence
100gpt-oss-120b · HighOpenAI11.6Eligible · 100%28 published · 5 families · 1 selected capabilities4.287/87 peersIndependent evidence96.2108/108 peersIndependent evidence13.326/26 peersIndependent evidence30.5198/198 peersIndependent evidence7.089/89 peersIndependent evidence67.9200/200 peersIndependent evidence5.641/41 peersIndependent evidence36.288/88 peersIndependent evidence44.9123/123 peersIndependent evidence60.463/63 peersIndependent evidence60.5212/212 peersIndependent evidence0.037/37 peersIndependent evidence70.4208/208 peersIndependent evidence81.1178/178 peersIndependent evidence4.128/28 peersIndependent evidence97.6112/112 peersIndependent evidence68.9114/114 peersIndependent evidence58.1198/198 peersIndependent evidence20.591/91 peersIndependent evidence56.8202/202 peersIndependent evidence41.3201/201 peersIndependent evidence0.02/2 peersIndependent evidence0.040/40 peersIndependent evidence

About this ranking

This profile gives hard reasoning all the weight. It compares identified configurations using their own measured results, rather than borrowing results from another effort setting. Rankings require support in this capability. Matching effort labels across providers do not imply equal compute budgets.

View the Capability ranking →

Behind the ranking

273 entries with published results · 217 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:0,hard_reasoning:100,coding:0,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/rankings/reasoning?page=4

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →