The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Core work leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

451 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
GPT-5.2 · HighOpenAINot scoredProvisional · 66%24 published · 6 families · 3 selected capabilities66.038/38 peersIndependent evidence43.026/26 peersIndependent evidence24.726/26 peersIndependent evidence42.626/26 peersIndependent evidence58.226/26 peersIndependent evidence47.626/26 peersIndependent evidence31.326/26 peersIndependent evidence11.926/26 peersIndependent evidence
Hy3-preview · Non-reasoningTencentNot scoredProvisional · 33%9 published · 5 families · 3 selected capabilities44.7197/197 peersIndependent evidence55.8200/200 peersIndependent evidence51.6212/212 peersIndependent evidence42.6208/208 peersIndependent evidence58.8178/178 peersIndependent evidence64.6198/198 peersIndependent evidence63.5171/171 peersIndependent evidence77.7169/169 peersIndependent evidence
Kimi-Linear-48B-A3B-Instruct · Non-reasoningMoonshotNot scoredProvisional · 66%9 published · 6 families · 3 selected capabilities36.4108/108 peersIndependent evidence31.5197/197 peersIndependent evidence11.0212/212 peersIndependent evidence0.6208/208 peersIndependent evidence12.6178/178 peersIndependent evidence37.6112/112 peersIndependent evidence15.2114/114 peersIndependent evidence2.2171/171 peersIndependent evidence49.2169/169 peersIndependent evidence
MiniMax-M1-40k · ReasoningMiniMaxNot scoredProvisional · 66%9 published · 7 families · 3 selected capabilities10.7108/108 peersIndependent evidence42.4212/212 peersIndependent evidence46.0208/208 peersIndependent evidence44.7178/178 peersIndependent evidence67.6112/112 peersIndependent evidence82.960/60 peersIndependent evidence70.0114/114 peersIndependent evidence39.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
MiniMax-M1-80k · ReasoningMiniMaxNot scoredProvisional · 66%13 published · 8 families · 3 selected capabilities58.5108/108 peersIndependent evidence58.0197/197 peersIndependent evidence25.5200/200 peersIndependent evidence45.3212/212 peersIndependent evidence47.8208/208 peersIndependent evidence46.9178/178 peersIndependent evidence76.4112/112 peersIndependent evidence91.260/60 peersIndependent evidence75.2114/114 peersIndependent evidence62.3198/198 peersIndependent evidence44.0171/171 peersIndependent evidence20.9169/169 peersIndependent evidence
MiniMax-M2 · ReasoningMiniMaxNot scoredProvisional · 66%13 published · 7 families · 3 selected capabilities75.3108/108 peersIndependent evidence66.1197/197 peersIndependent evidence66.8200/200 peersIndependent evidence48.263/63 peersIndependent evidence61.9212/212 peersIndependent evidence63.2208/208 peersIndependent evidence88.1178/178 peersIndependent evidence94.7112/112 peersIndependent evidence78.8114/114 peersIndependent evidence64.9198/198 peersIndependent evidence82.2171/171 peersIndependent evidence71.1169/169 peersIndependent evidence
MiniMax-M2.1 · ReasoningMiniMaxNot scoredProvisional · 66%13 published · 7 families · 3 selected capabilities82.6108/108 peersIndependent evidence70.3197/197 peersIndependent evidence56.4200/200 peersIndependent evidence66.163/63 peersIndependent evidence74.1212/212 peersIndependent evidence77.4208/208 peersIndependent evidence83.1178/178 peersIndependent evidence92.8112/112 peersIndependent evidence98.1114/114 peersIndependent evidence59.1198/198 peersIndependent evidence79.7171/171 peersIndependent evidence75.6169/169 peersIndependent evidence
MiniMax-M2.5 · ReasoningMiniMaxNot scoredProvisional · 33%10 published · 5 families · 3 selected capabilities81.7197/197 peersIndependent evidence70.7200/200 peersIndependent evidence67.063/63 peersIndependent evidence80.6212/212 peersIndependent evidence74.9208/208 peersIndependent evidence87.3178/178 peersIndependent evidence73.2198/198 peersIndependent evidence93.5171/171 peersIndependent evidence85.2169/169 peersIndependent evidence
Mistral Large 2 (July 2024) · Non-reasoningMistralNot scoredProvisional · 33%9 published · 6 families · 3 selected capabilities0.0108/108 peersIndependent evidence12.9197/197 peersIndependent evidence16.7212/212 peersIndependent evidence2.8208/208 peersIndependent evidence18.5178/178 peersIndependent evidence19.3112/112 peersIndependent evidence17.060/60 peersIndependent evidence25.6114/114 peersIndependent evidence42.4171/171 peersIndependent evidence
Mistral Medium 3 · Non-reasoningMistralNot scoredProvisional · 66%14 published · 8 families · 3 selected capabilities31.9108/108 peersIndependent evidence33.0197/197 peersIndependent evidence25.5200/200 peersIndependent evidence27.0212/212 peersIndependent evidence11.9208/208 peersIndependent evidence39.9178/178 peersIndependent evidence39.9112/112 peersIndependent evidence53.260/60 peersIndependent evidence48.4114/114 peersIndependent evidence25.4114/114 peersIndependent evidence45.4198/198 peersIndependent evidence28.5171/171 peersIndependent evidence24.1169/169 peersIndependent evidence
Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 · ReasoningNVIDIANot scoredProvisional · 67%12 published · 6 families · 3 selected capabilities41.1197/197 peersIndependent evidence25.3200/200 peersIndependent evidence21.9123/123 peersIndependent evidence15.5212/212 peersIndependent evidence26.3208/208 peersIndependent evidence75.7178/178 peersIndependent evidence25.9114/114 peersIndependent evidence27.9198/198 peersIndependent evidence53.9171/171 peersIndependent evidence34.4201/201 peersIndependent evidence
NVIDIA-Nemotron-3-Nano-4B-BF16 · ReasoningNVIDIANot scoredProvisional · 67%11 published · 6 families · 3 selected capabilities27.6197/197 peersIndependent evidence25.2200/200 peersIndependent evidence8.9123/123 peersIndependent evidence20.4212/212 peersIndependent evidence27.1208/208 peersIndependent evidence70.2178/178 peersIndependent evidence9.6198/198 peersIndependent evidence34.9171/171 peersIndependent evidence27.5201/201 peersIndependent evidence
NVIDIA-Nemotron-Nano-12B-v2-VL-BF16 · Non-reasoningNVIDIANot scoredProvisional · 66%13 published · 7 families · 3 selected capabilities26.0108/108 peersIndependent evidence25.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence14.8212/212 peersIndependent evidence17.1208/208 peersIndependent evidence9.5178/178 peersIndependent evidence30.9112/112 peersIndependent evidence22.1114/114 peersIndependent evidence13.4114/114 peersIndependent evidence15.5198/198 peersIndependent evidence17.7171/171 peersIndependent evidence3.7169/169 peersIndependent evidence
NVIDIA-Nemotron-Nano-9B-v2 · Non-reasoningNVIDIANot scoredProvisional · 66%12 published · 7 families · 3 selected capabilities59.9108/108 peersIndependent evidence28.4197/197 peersIndependent evidence25.2200/200 peersIndependent evidence23.7212/212 peersIndependent evidence21.8208/208 peersIndependent evidence10.8178/178 peersIndependent evidence75.7112/112 peersIndependent evidence39.2114/114 peersIndependent evidence11.4198/198 peersIndependent evidence26.3171/171 peersIndependent evidence8.7169/169 peersIndependent evidence
o1 · ReasoningOpenAINot scoredProvisional · 66%12 published · 7 families · 3 selected capabilities67.8197/197 peersIndependent evidence56.2200/200 peersIndependent evidence55.1212/212 peersIndependent evidence42.3208/208 peersIndependent evidence83.8178/178 peersIndependent evidence68.9112/112 peersIndependent evidence80.360/60 peersIndependent evidence88.4114/114 peersIndependent evidence85.1198/198 peersIndependent evidence63.7171/171 peersIndependent evidence52.3169/169 peersIndependent evidence
o3 · ReasoningOpenAINot scoredProvisional · 66%14 published · 8 families · 3 selected capabilities91.5108/108 peersIndependent evidence83.8197/197 peersIndependent evidence70.1200/200 peersIndependent evidence72.2212/212 peersIndependent evidence73.5208/208 peersIndependent evidence86.0178/178 peersIndependent evidence91.9112/112 peersIndependent evidence99.660/60 peersIndependent evidence91.3114/114 peersIndependent evidence65.0114/114 peersIndependent evidence88.4198/198 peersIndependent evidence73.3171/171 peersIndependent evidence89.2169/169 peersIndependent evidence
o4-mini · HighOpenAINot scoredProvisional · 66%16 published · 9 families · 3 selected capabilities93.1108/108 peersIndependent evidence56.6197/197 peersIndependent evidence61.0200/200 peersIndependent evidence61.0212/212 peersIndependent evidence66.2208/208 peersIndependent evidence80.2178/178 peersIndependent evidence99.4112/112 peersIndependent evidence97.560/60 peersIndependent evidence85.4114/114 peersIndependent evidence59.8114/114 peersIndependent evidence66.1198/198 peersIndependent evidence59.3171/171 peersIndependent evidence53.7169/169 peersIndependent evidence36.638/38 peersIndependent evidence
phi-4 · Non-reasoningMicrosoftNot scoredProvisional · 66%13 published · 8 families · 3 selected capabilities16.3108/108 peersIndependent evidence5.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence26.3212/212 peersIndependent evidence9.0208/208 peersIndependent evidence8.0178/178 peersIndependent evidence12.9112/112 peersIndependent evidence30.860/60 peersIndependent evidence34.6114/114 peersIndependent evidence22.5198/198 peersIndependent evidence2.3171/171 peersIndependent evidence24.2169/169 peersIndependent evidence
Pixtral Large · Non-reasoningMistralNot scoredProvisional · 33%9 published · 6 families · 3 selected capabilities1.7108/108 peersIndependent evidence19.2212/212 peersIndependent evidence2.0208/208 peersIndependent evidence29.2178/178 peersIndependent evidence17.3112/112 peersIndependent evidence17.060/60 peersIndependent evidence32.0114/114 peersIndependent evidence20.1114/114 peersIndependent evidence47.8171/171 peersIndependent evidence
Qwen3-0.6B · Non-reasoningQwenNot scoredProvisional · 66%13 published · 8 families · 3 selected capabilities7.4108/108 peersIndependent evidence5.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence1.8212/212 peersIndependent evidence28.0208/208 peersIndependent evidence5.1178/178 peersIndependent evidence2.6112/112 peersIndependent evidence4.260/60 peersIndependent evidence1.5114/114 peersIndependent evidence1.3198/198 peersIndependent evidence9.4171/171 peersIndependent evidence3.3169/169 peersIndependent evidence
Qwen3-1.7B · Non-reasoningQwenNot scoredProvisional · 66%17 published · 9 families · 3 selected capabilities1.8150/150 peersIndependent evidence5.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence1.663/63 peersIndependent evidence0.7213/213 peersIndependent evidence33.1208/208 peersIndependent evidence4.0178/178 peersIndependent evidence6.1112/112 peersIndependent evidence18.660/60 peersIndependent evidence4.6114/114 peersIndependent evidence4.3198/198 peersIndependent evidence22.8171/171 peersIndependent evidence3.3169/169 peersIndependent evidence6.950/50 peersIndependent evidence
Qwen3-235B-A22B · Non-reasoningQwenNot scoredProvisional · 66%13 published · 8 families · 3 selected capabilities21.9108/108 peersIndependent evidence5.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence31.4212/212 peersIndependent evidence15.4208/208 peersIndependent evidence32.3178/178 peersIndependent evidence30.2112/112 peersIndependent evidence52.160/60 peersIndependent evidence50.3114/114 peersIndependent evidence47.8198/198 peersIndependent evidence33.5171/171 peersIndependent evidence33.2169/169 peersIndependent evidence
Qwen3-235B-A22B-Instruct-2507 · Non-reasoningQwenNot scoredProvisional · 66%13 published · 8 families · 3 selected capabilities68.7108/108 peersIndependent evidence37.1197/197 peersIndependent evidence25.5200/200 peersIndependent evidence57.2212/212 peersIndependent evidence57.1208/208 peersIndependent evidence57.1178/178 peersIndependent evidence57.5112/112 peersIndependent evidence91.260/60 peersIndependent evidence82.4114/114 peersIndependent evidence48.0198/198 peersIndependent evidence43.3171/171 peersIndependent evidence56.6169/169 peersIndependent evidence
Qwen3-30B-A3B · Non-reasoningQwenNot scoredProvisional · 66%16 published · 9 families · 3 selected capabilities13.9150/150 peersIndependent evidence5.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence14.7213/213 peersIndependent evidence23.3208/208 peersIndependent evidence20.4178/178 peersIndependent evidence29.3112/112 peersIndependent evidence42.360/60 peersIndependent evidence34.1114/114 peersIndependent evidence15.1198/198 peersIndependent evidence25.0171/171 peersIndependent evidence38.9169/169 peersIndependent evidence20.150/50 peersIndependent evidence
Qwen3-30B-A3B-Instruct-2507 · Non-reasoningQwenNot scoredProvisional · 66%14 published · 8 families · 3 selected capabilities63.9108/108 peersIndependent evidence29.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.963/63 peersIndependent evidence35.7212/212 peersIndependent evidence41.4208/208 peersIndependent evidence24.3178/178 peersIndependent evidence55.8112/112 peersIndependent evidence84.460/60 peersIndependent evidence56.4114/114 peersIndependent evidence26.4198/198 peersIndependent evidence7.9171/171 peersIndependent evidence34.2169/169 peersIndependent evidence

Behind the ranking

273 entries with published results · 112 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:34,hard_reasoning:33,coding:33,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/?mode=custom&page=7&w=v3

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →