The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Capability leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
126Solar Pro 3 · ReasoningUpstage4.9Single independent source18 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?14.887/87 peersIndependent evidence24.2198/198 peersIndependent evidence10.789/89 peersIndependent evidence25.5200/200 peersIndependent evidence23.888/88 peersIndependent evidence24.4123/123 peersIndependent evidence49.4212/212 peersIndependent evidence53.0208/208 peersIndependent evidence85.2178/178 peersIndependent evidence46.1198/198 peersIndependent evidence6.891/91 peersIndependent evidence58.2202/202 peersIndependent evidence30.7201/201 peersIndependent evidence
127Qwen3-VL-235B-A22B-Instruct · Non-reasoningQwen4.8Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?67.7108/108 peersIndependent evidence35.5197/197 peersIndependent evidence25.5200/200 peersIndependent evidence47.4212/212 peersIndependent evidence40.0208/208 peersIndependent evidence48.6178/178 peersIndependent evidence63.0112/112 peersIndependent evidence80.2114/114 peersIndependent evidence58.7114/114 peersIndependent evidence54.3198/198 peersIndependent evidence46.0171/171 peersIndependent evidence39.1169/169 peersIndependent evidence
128Qwen3-Coder-Next · Non-reasoningQwen4.7Single independent source18 published · 14 families · 5 task areas100% weight: Artificial AnalysisWhy this score?27.887/87 peersIndependent evidence48.8197/197 peersIndependent evidence24.389/89 peersIndependent evidence25.4200/200 peersIndependent evidence29.588/88 peersIndependent evidence40.9123/123 peersIndependent evidence38.363/63 peersIndependent evidence51.8212/212 peersIndependent evidence51.5208/208 peersIndependent evidence29.7178/178 peersIndependent evidence32.4198/198 peersIndependent evidence24.991/91 peersIndependent evidence45.5202/202 peersIndependent evidence44.0201/201 peersIndependent evidence
129Qwen3-30B-A3B-Thinking-2507 · ReasoningQwen4.6Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?12.087/87 peersIndependent evidence56.9108/108 peersIndependent evidence60.3197/197 peersIndependent evidence17.589/89 peersIndependent evidence55.7200/200 peersIndependent evidence6.788/88 peersIndependent evidence18.0123/123 peersIndependent evidence46.1212/212 peersIndependent evidence52.3208/208 peersIndependent evidence61.6178/178 peersIndependent evidence74.8112/112 peersIndependent evidence85.560/60 peersIndependent evidence65.9114/114 peersIndependent evidence34.5198/198 peersIndependent evidence22.191/91 peersIndependent evidence26.1202/202 peersIndependent evidence20.3201/201 peersIndependent evidence
130Qwen3.5-omni-flash · Non-reasoningQwen4.5Single independent source10 published · 9 families · 6 task areas100% weight: Artificial AnalysisWhy this score?51.9197/197 peersIndependent evidence25.2200/200 peersIndependent evidence54.1212/212 peersIndependent evidence44.1208/208 peersIndependent evidence35.2178/178 peersIndependent evidence50.6114/114 peersIndependent evidence24.8198/198 peersIndependent evidence76.6171/171 peersIndependent evidence45.3169/169 peersIndependent evidence
131gpt-oss-120b · HighOpenAI4.5Independent corroboration28 published · 23 families · 5 task areas48% weight: Artificial AnalysisWhy this score?4.287/87 peersIndependent evidence96.2108/108 peersIndependent evidence13.326/26 peersIndependent evidence30.5198/198 peersIndependent evidence7.089/89 peersIndependent evidence67.9200/200 peersIndependent evidence5.641/41 peersIndependent evidence36.288/88 peersIndependent evidence44.9123/123 peersIndependent evidence60.463/63 peersIndependent evidence60.5212/212 peersIndependent evidence0.037/37 peersIndependent evidence70.4208/208 peersIndependent evidence81.1178/178 peersIndependent evidence4.128/28 peersIndependent evidence97.6112/112 peersIndependent evidence68.9114/114 peersIndependent evidence58.1198/198 peersIndependent evidence20.591/91 peersIndependent evidence56.8202/202 peersIndependent evidence41.3201/201 peersIndependent evidence0.02/2 peersIndependent evidence0.040/40 peersIndependent evidence
132Solar Open 100B · ReasoningUpstage4.4Single independent source10 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?42.4197/197 peersIndependent evidence25.2200/200 peersIndependent evidence50.663/63 peersIndependent evidence35.4212/212 peersIndependent evidence54.6208/208 peersIndependent evidence68.3178/178 peersIndependent evidence47.2198/198 peersIndependent evidence57.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
133Qwen3-VL-30B-A3B-Thinking · ReasoningQwen4.4Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?81.1108/108 peersIndependent evidence25.4200/200 peersIndependent evidence49.1212/212 peersIndependent evidence48.7208/208 peersIndependent evidence54.7178/178 peersIndependent evidence73.7112/112 peersIndependent evidence68.5114/114 peersIndependent evidence39.8114/114 peersIndependent evidence40.1198/198 peersIndependent evidence19.8171/171 peersIndependent evidence30.7169/169 peersIndependent evidence
134Qwen3-Next-80B-A3B-Instruct · Non-reasoningQwen4.4Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?63.7108/108 peersIndependent evidence52.5197/197 peersIndependent evidence25.4200/200 peersIndependent evidence52.7212/212 peersIndependent evidence45.0208/208 peersIndependent evidence41.7178/178 peersIndependent evidence70.4112/112 peersIndependent evidence77.9114/114 peersIndependent evidence41.6198/198 peersIndependent evidence22.8171/171 peersIndependent evidence42.9169/169 peersIndependent evidence
135gpt-oss-20b · MediumOpenAI4.2Single independent source3 published · 3 families · 1 task areas100% weight: Epoch AIWhy this score?39.848/48 peersIndependent evidence13.347/47 peersIndependent evidence25.350/50 peersIndependent evidence
136GPT-4.1 · Non-reasoningOpenAI4.0Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?36.1108/108 peersIndependent evidence70.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence37.9212/212 peersIndependent evidence15.1208/208 peersIndependent evidence50.2178/178 peersIndependent evidence45.8112/112 peersIndependent evidence55.060/60 peersIndependent evidence66.7114/114 peersIndependent evidence39.2114/114 peersIndependent evidence76.2198/198 peersIndependent evidence56.9171/171 peersIndependent evidence53.6169/169 peersIndependent evidence
137EXAONE 4.0 32B · ReasoningLG AI Research3.9Single independent source13 published · 12 families · 4 task areas100% weight: Artificial AnalysisWhy this score?77.3108/108 peersIndependent evidence25.2200/200 peersIndependent evidence22.763/63 peersIndependent evidence53.7212/212 peersIndependent evidence59.1208/208 peersIndependent evidence31.0178/178 peersIndependent evidence84.2112/112 peersIndependent evidence88.560/60 peersIndependent evidence76.0114/114 peersIndependent evidence21.4198/198 peersIndependent evidence12.7171/171 peersIndependent evidence23.2169/169 peersIndependent evidence
138Qwen3-235B-A22B · ReasoningQwen3.8Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?79.8108/108 peersIndependent evidence5.8197/197 peersIndependent evidence25.2200/200 peersIndependent evidence46.6212/212 peersIndependent evidence57.0208/208 peersIndependent evidence36.8178/178 peersIndependent evidence64.9112/112 peersIndependent evidence58.360/60 peersIndependent evidence82.4114/114 peersIndependent evidence47.6198/198 peersIndependent evidence28.1171/171 peersIndependent evidence33.2169/169 peersIndependent evidence
139Qwen3-32B · ReasoningQwen3.7Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?9.287/87 peersIndependent evidence71.3108/108 peersIndependent evidence5.8197/197 peersIndependent evidence22.489/89 peersIndependent evidence55.7200/200 peersIndependent evidence25.388/88 peersIndependent evidence17.0123/123 peersIndependent evidence39.0212/212 peersIndependent evidence43.4208/208 peersIndependent evidence31.4178/178 peersIndependent evidence58.3112/112 peersIndependent evidence74.460/60 peersIndependent evidence63.8114/114 peersIndependent evidence42.3198/198 peersIndependent evidence23.891/91 peersIndependent evidence27.6202/202 peersIndependent evidence19.9201/201 peersIndependent evidence
140Mistral Large 3 · Non-reasoningMistral3.6Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?22.587/87 peersIndependent evidence41.8108/108 peersIndependent evidence38.3197/197 peersIndependent evidence27.289/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.688/88 peersIndependent evidence33.1123/123 peersIndependent evidence46.863/63 peersIndependent evidence41.2212/212 peersIndependent evidence13.9208/208 peersIndependent evidence30.4178/178 peersIndependent evidence47.6112/112 peersIndependent evidence67.9114/114 peersIndependent evidence31.3114/114 peersIndependent evidence69.3198/198 peersIndependent evidence29.091/91 peersIndependent evidence24.5202/202 peersIndependent evidence36.3201/201 peersIndependent evidence
141Qwen3-VL-32B-Instruct · Non-reasoningQwen3.6Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?66.2108/108 peersIndependent evidence25.4200/200 peersIndependent evidence40.2212/212 peersIndependent evidence40.8208/208 peersIndependent evidence39.2178/178 peersIndependent evidence54.5112/112 peersIndependent evidence60.9114/114 peersIndependent evidence48.4114/114 peersIndependent evidence25.5198/198 peersIndependent evidence37.0171/171 peersIndependent evidence46.0169/169 peersIndependent evidence
142Gemini 2.5 Flash-Lite · ReasoningGoogle3.5Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?51.5108/108 peersIndependent evidence42.5198/198 peersIndependent evidence25.2200/200 peersIndependent evidence33.1212/212 peersIndependent evidence41.1208/208 peersIndependent evidence60.8178/178 peersIndependent evidence61.9112/112 peersIndependent evidence79.760/60 peersIndependent evidence46.6114/114 peersIndependent evidence34.0114/114 peersIndependent evidence43.9198/198 peersIndependent evidence15.1171/171 peersIndependent evidence26.8169/169 peersIndependent evidence
143Devstral 2 · Non-reasoningMistral3.5Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?33.887/87 peersIndependent evidence39.0108/108 peersIndependent evidence34.0197/197 peersIndependent evidence36.589/89 peersIndependent evidence25.2200/200 peersIndependent evidence28.688/88 peersIndependent evidence43.4123/123 peersIndependent evidence32.163/63 peersIndependent evidence29.2212/212 peersIndependent evidence6.0208/208 peersIndependent evidence36.1178/178 peersIndependent evidence45.5112/112 peersIndependent evidence49.9114/114 peersIndependent evidence56.6198/198 peersIndependent evidence20.891/91 peersIndependent evidence35.3202/202 peersIndependent evidence43.5201/201 peersIndependent evidence
144Qwen3-Coder-480B-A35B-Instruct · Non-reasoningQwen3.5Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?43.5108/108 peersIndependent evidence46.8197/197 peersIndependent evidence25.5200/200 peersIndependent evidence32.3212/212 peersIndependent evidence21.2208/208 peersIndependent evidence43.9178/178 peersIndependent evidence60.6112/112 peersIndependent evidence69.860/60 peersIndependent evidence59.1114/114 peersIndependent evidence30.9198/198 peersIndependent evidence53.0171/171 peersIndependent evidence62.4169/169 peersIndependent evidence
145GPT-4.1 Mini · Non-reasoningOpenAI3.4Single independent source17 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?48.3108/108 peersIndependent evidence45.1197/197 peersIndependent evidence25.4200/200 peersIndependent evidence25.5123/123 peersIndependent evidence37.0212/212 peersIndependent evidence30.1208/208 peersIndependent evidence37.2178/178 peersIndependent evidence51.3112/112 peersIndependent evidence56.860/60 peersIndependent evidence57.7114/114 peersIndependent evidence36.2114/114 peersIndependent evidence54.3198/198 peersIndependent evidence38.7202/202 peersIndependent evidence33.6201/201 peersIndependent evidence
146Magistral Small 1.2 · ReasoningMistral3.4Single independent source18 published · 15 families · 6 task areas100% weight: Artificial AnalysisWhy this score?77.8108/108 peersIndependent evidence22.4197/197 peersIndependent evidence2.889/89 peersIndependent evidence55.9200/200 peersIndependent evidence15.1123/123 peersIndependent evidence28.363/63 peersIndependent evidence36.2212/212 peersIndependent evidence39.2208/208 peersIndependent evidence53.2178/178 peersIndependent evidence78.0112/112 peersIndependent evidence52.5114/114 peersIndependent evidence29.7114/114 peersIndependent evidence19.5198/198 peersIndependent evidence22.3202/202 peersIndependent evidence21.2201/201 peersIndependent evidence
147GLM-4.6V · ReasoningZ.ai3.4Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?87.9108/108 peersIndependent evidence50.9197/197 peersIndependent evidence25.2200/200 peersIndependent evidence42.763/63 peersIndependent evidence49.4212/212 peersIndependent evidence50.9208/208 peersIndependent evidence15.4178/178 peersIndependent evidence10.5112/112 peersIndependent evidence64.3114/114 peersIndependent evidence17.6114/114 peersIndependent evidence33.7198/198 peersIndependent evidence39.4171/171 peersIndependent evidence54.0169/169 peersIndependent evidence
148Mistral Medium 3.1 · Non-reasoningMistral3.3Single independent source20 published · 16 families · 5 task areas100% weight: Artificial AnalysisWhy this score?40.487/87 peersIndependent evidence42.5108/108 peersIndependent evidence40.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.088/88 peersIndependent evidence32.1123/123 peersIndependent evidence28.4212/212 peersIndependent evidence25.2208/208 peersIndependent evidence42.1178/178 peersIndependent evidence42.9112/112 peersIndependent evidence27.1114/114 peersIndependent evidence27.9114/114 peersIndependent evidence55.7198/198 peersIndependent evidence18.591/91 peersIndependent evidence40.1202/202 peersIndependent evidence34.2201/201 peersIndependent evidence
149MiniMax-M1-40k · ReasoningMiniMax3.3Single independent source9 published · 9 families · 4 task areas100% weight: Artificial AnalysisWhy this score?10.7108/108 peersIndependent evidence42.4212/212 peersIndependent evidence46.0208/208 peersIndependent evidence44.7178/178 peersIndependent evidence67.6112/112 peersIndependent evidence82.960/60 peersIndependent evidence70.0114/114 peersIndependent evidence39.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
150Qwen3-4B-Thinking-2507 · ReasoningQwen3.2Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?82.6108/108 peersIndependent evidence39.9197/197 peersIndependent evidence25.4200/200 peersIndependent evidence38.5212/212 peersIndependent evidence37.5208/208 peersIndependent evidence60.6178/178 peersIndependent evidence65.8112/112 peersIndependent evidence42.9114/114 peersIndependent evidence16.5198/198 peersIndependent evidence30.6171/171 peersIndependent evidence12.4169/169 peersIndependent evidence

Behind the ranking

273 entries with published results · 215 ranked · 7 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: overall; evidence: documented; configurations: best
https://unifybench.ai/?page=6

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →