The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Capability leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
176Qwen3-Omni-30B-A3B-Instruct · Non-reasoningQwen1.7Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?51.3108/108 peersIndependent evidence5.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence32.8212/212 peersIndependent evidence24.1208/208 peersIndependent evidence16.8178/178 peersIndependent evidence44.0112/112 peersIndependent evidence36.5114/114 peersIndependent evidence29.5114/114 peersIndependent evidence23.1198/198 peersIndependent evidence14.0171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
177Qwen3-4B-Instruct-2507 · Non-reasoningQwen1.7Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?51.3108/108 peersIndependent evidence17.2197/197 peersIndependent evidence25.5200/200 peersIndependent evidence11.863/63 peersIndependent evidence22.0212/212 peersIndependent evidence20.1208/208 peersIndependent evidence27.6178/178 peersIndependent evidence36.9112/112 peersIndependent evidence23.1114/114 peersIndependent evidence12.8198/198 peersIndependent evidence33.2171/171 peersIndependent evidence28.0169/169 peersIndependent evidence
178Mistral Small 3.2 · Non-reasoningMistral1.6Single independent source23 published · 19 families · 6 task areas100% weight: Artificial AnalysisWhy this score?4.187/87 peersIndependent evidence28.4108/108 peersIndependent evidence23.6197/197 peersIndependent evidence9.389/89 peersIndependent evidence25.1200/200 peersIndependent evidence2.188/88 peersIndependent evidence6.5123/123 peersIndependent evidence21.463/63 peersIndependent evidence18.8212/212 peersIndependent evidence18.2208/208 peersIndependent evidence26.2178/178 peersIndependent evidence21.6112/112 peersIndependent evidence45.060/60 peersIndependent evidence25.5114/114 peersIndependent evidence17.2114/114 peersIndependent evidence25.0198/198 peersIndependent evidence11.891/91 peersIndependent evidence31.3202/202 peersIndependent evidence26.7201/201 peersIndependent evidence
179Llama-4-Scout-17B-16E-Instruct · Non-reasoningMeta1.6Single independent source23 published · 19 families · 6 task areas100% weight: Artificial AnalysisWhy this score?4.187/87 peersIndependent evidence11.7108/108 peersIndependent evidence29.7197/197 peersIndependent evidence3.189/89 peersIndependent evidence25.1200/200 peersIndependent evidence2.188/88 peersIndependent evidence8.3123/123 peersIndependent evidence25.663/63 peersIndependent evidence27.9212/212 peersIndependent evidence9.2208/208 peersIndependent evidence40.0178/178 peersIndependent evidence25.6112/112 peersIndependent evidence34.560/60 peersIndependent evidence46.9114/114 peersIndependent evidence24.8114/114 peersIndependent evidence27.1198/198 peersIndependent evidence3.991/91 peersIndependent evidence8.7202/202 peersIndependent evidence15.4201/201 peersIndependent evidence
180Qwen3-VL-8B-Instruct · Non-reasoningQwen1.6Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?28.8108/108 peersIndependent evidence21.2197/197 peersIndependent evidence25.5200/200 peersIndependent evidence12.3212/212 peersIndependent evidence1.4208/208 peersIndependent evidence21.8178/178 peersIndependent evidence30.6112/112 peersIndependent evidence27.4114/114 peersIndependent evidence16.2114/114 peersIndependent evidence56.0198/198 peersIndependent evidence37.0171/171 peersIndependent evidence17.7169/169 peersIndependent evidence
181Ministral 3 8B · Non-reasoningMistral1.5Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?13.587/87 peersIndependent evidence34.7108/108 peersIndependent evidence27.9197/197 peersIndependent evidence13.289/89 peersIndependent evidence25.2200/200 peersIndependent evidence8.988/88 peersIndependent evidence21.3123/123 peersIndependent evidence10.563/63 peersIndependent evidence15.9212/212 peersIndependent evidence17.1208/208 peersIndependent evidence13.8178/178 peersIndependent evidence26.5112/112 peersIndependent evidence18.9114/114 peersIndependent evidence15.0114/114 peersIndependent evidence17.0198/198 peersIndependent evidence2.791/91 peersIndependent evidence20.2202/202 peersIndependent evidence21.3201/201 peersIndependent evidence
182Qwen3.5-2B · ReasoningQwen1.5Single independent source12 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?25.7197/197 peersIndependent evidence25.1200/200 peersIndependent evidence10.7123/123 peersIndependent evidence15.4212/212 peersIndependent evidence1.2208/208 peersIndependent evidence17.3178/178 peersIndependent evidence10.2114/114 peersIndependent evidence6.1198/198 peersIndependent evidence64.7171/171 peersIndependent evidence19.2201/201 peersIndependent evidence
183Qwen3-VL-4B-Thinking · ReasoningQwen1.5Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?26.0108/108 peersIndependent evidence26.7197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.0212/212 peersIndependent evidence22.5208/208 peersIndependent evidence32.6178/178 peersIndependent evidence28.3112/112 peersIndependent evidence31.3114/114 peersIndependent evidence22.6114/114 peersIndependent evidence16.0198/198 peersIndependent evidence12.1171/171 peersIndependent evidence12.4169/169 peersIndependent evidence
184Gemma 4 E2B IT · ReasoningGoogle1.4Single independent source12 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?20.4197/197 peersIndependent evidence25.1200/200 peersIndependent evidence7.0123/123 peersIndependent evidence13.4212/212 peersIndependent evidence25.0208/208 peersIndependent evidence34.7178/178 peersIndependent evidence13.4114/114 peersIndependent evidence3.8198/198 peersIndependent evidence20.0171/171 peersIndependent evidence12.8201/201 peersIndependent evidence
185EXAONE 4.0 1.2B · ReasoningLG AI Research1.4Single independent source12 published · 11 families · 5 task areas100% weight: Artificial AnalysisWhy this score?48.7108/108 peersIndependent evidence5.7197/197 peersIndependent evidence25.2200/200 peersIndependent evidence20.5212/212 peersIndependent evidence37.0208/208 peersIndependent evidence7.4178/178 peersIndependent evidence55.0112/112 peersIndependent evidence17.2114/114 peersIndependent evidence4.0198/198 peersIndependent evidence12.2171/171 peersIndependent evidence3.3169/169 peersIndependent evidence
186Qwen3-4B · ReasoningQwen1.4Single independent source9 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?22.2108/108 peersIndependent evidence5.7197/197 peersIndependent evidence21.5212/212 peersIndependent evidence18.1208/208 peersIndependent evidence22.3178/178 peersIndependent evidence44.3112/112 peersIndependent evidence64.460/60 peersIndependent evidence30.2114/114 peersIndependent evidence17.2171/171 peersIndependent evidence
187Amazon Nova Pro · Non-reasoningAmazon1.3Single independent source14 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?6.4108/108 peersIndependent evidence25.8197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.4212/212 peersIndependent evidence4.1208/208 peersIndependent evidence36.5178/178 peersIndependent evidence14.7112/112 peersIndependent evidence27.360/60 peersIndependent evidence28.5114/114 peersIndependent evidence12.4114/114 peersIndependent evidence39.2198/198 peersIndependent evidence10.2171/171 peersIndependent evidence34.2169/169 peersIndependent evidence
188GPT-4.1-nano · Non-reasoningOpenAI1.3Single independent source17 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?24.7108/108 peersIndependent evidence24.3197/197 peersIndependent evidence25.4200/200 peersIndependent evidence5.4123/123 peersIndependent evidence19.7212/212 peersIndependent evidence8.2208/208 peersIndependent evidence20.8178/178 peersIndependent evidence29.9112/112 peersIndependent evidence37.160/60 peersIndependent evidence21.7114/114 peersIndependent evidence6.7114/114 peersIndependent evidence21.2198/198 peersIndependent evidence10.7202/202 peersIndependent evidence17.8201/201 peersIndependent evidence
189Gemma 3 27B IT · Non-reasoningGoogle1.2Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?20.0108/108 peersIndependent evidence12.6197/197 peersIndependent evidence3.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence5.488/88 peersIndependent evidence0.9123/123 peersIndependent evidence30.763/63 peersIndependent evidence12.5212/212 peersIndependent evidence18.7208/208 peersIndependent evidence19.2178/178 peersIndependent evidence8.1112/112 peersIndependent evidence45.160/60 peersIndependent evidence22.4114/114 peersIndependent evidence18.2114/114 peersIndependent evidence16.5198/198 peersIndependent evidence5.291/91 peersIndependent evidence5.4202/202 peersIndependent evidence20.3201/201 peersIndependent evidence
190Kimi-Linear-48B-A3B-Instruct · Non-reasoningMoonshot1.2Single independent source9 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?36.4108/108 peersIndependent evidence31.5197/197 peersIndependent evidence11.0212/212 peersIndependent evidence0.6208/208 peersIndependent evidence12.6178/178 peersIndependent evidence37.6112/112 peersIndependent evidence15.2114/114 peersIndependent evidence2.2171/171 peersIndependent evidence49.2169/169 peersIndependent evidence
191GPT-4 · Non-reasoningOpenAI1.2Single independent source7 published · 6 families · 3 task areas100% weight: Artificial AnalysisWhy this score?14.8123/123 peersIndependent evidence7.6212/212 peersIndependent evidence25.1178/178 peersIndependent evidence5.660/60 peersIndependent evidence13.4114/114 peersIndependent evidence58.7198/198 peersIndependent evidence
192Ministral 3 3B · Non-reasoningMistral1.2Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?10.787/87 peersIndependent evidence21.9108/108 peersIndependent evidence20.7197/197 peersIndependent evidence16.589/89 peersIndependent evidence25.2200/200 peersIndependent evidence2.088/88 peersIndependent evidence16.2123/123 peersIndependent evidence6.363/63 peersIndependent evidence8.2212/212 peersIndependent evidence34.0208/208 peersIndependent evidence9.0178/178 peersIndependent evidence17.1112/112 peersIndependent evidence9.7114/114 peersIndependent evidence5.9114/114 peersIndependent evidence8.2198/198 peersIndependent evidence0.091/91 peersIndependent evidence20.1202/202 peersIndependent evidence9.0201/201 peersIndependent evidence
193Qwen3-1.7B · ReasoningQwen1.2Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?39.5108/108 peersIndependent evidence5.9197/197 peersIndependent evidence25.3200/200 peersIndependent evidence8.3212/212 peersIndependent evidence23.9208/208 peersIndependent evidence10.1178/178 peersIndependent evidence25.8112/112 peersIndependent evidence49.660/60 peersIndependent evidence14.5114/114 peersIndependent evidence8.5198/198 peersIndependent evidence31.7171/171 peersIndependent evidence3.5169/169 peersIndependent evidence
194Qwen3.5-0.8B · Non-reasoningQwen1.2Single independent source12 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?14.2197/197 peersIndependent evidence25.1200/200 peersIndependent evidence2.1123/123 peersIndependent evidence1.8212/212 peersIndependent evidence30.3208/208 peersIndependent evidence4.0178/178 peersIndependent evidence1.5114/114 peersIndependent evidence1.3198/198 peersIndependent evidence61.9171/171 peersIndependent evidence3.2201/201 peersIndependent evidence
195Qwen3-VL-4B-Instruct · Non-reasoningQwen1.1Single independent source13 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?39.1108/108 peersIndependent evidence18.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence9.1212/212 peersIndependent evidence6.9208/208 peersIndependent evidence19.2178/178 peersIndependent evidence23.3112/112 peersIndependent evidence18.2114/114 peersIndependent evidence11.4114/114 peersIndependent evidence12.2198/198 peersIndependent evidence27.1171/171 peersIndependent evidence3.3169/169 peersIndependent evidence
196Gemma 3 12B IT · Non-reasoningGoogle1.1Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?17.2108/108 peersIndependent evidence13.4197/197 peersIndependent evidence3.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence13.088/88 peersIndependent evidence1.9123/123 peersIndependent evidence17.363/63 peersIndependent evidence7.0212/212 peersIndependent evidence16.2208/208 peersIndependent evidence33.1178/178 peersIndependent evidence8.1112/112 peersIndependent evidence39.760/60 peersIndependent evidence17.1114/114 peersIndependent evidence4.0114/114 peersIndependent evidence11.1198/198 peersIndependent evidence1.391/91 peersIndependent evidence5.9202/202 peersIndependent evidence10.7201/201 peersIndependent evidence
197Pixtral Large · Non-reasoningMistral1.1Single independent source9 published · 9 families · 5 task areas100% weight: Artificial AnalysisWhy this score?1.7108/108 peersIndependent evidence19.2212/212 peersIndependent evidence2.0208/208 peersIndependent evidence29.2178/178 peersIndependent evidence17.3112/112 peersIndependent evidence17.060/60 peersIndependent evidence32.0114/114 peersIndependent evidence20.1114/114 peersIndependent evidence47.8171/171 peersIndependent evidence
198phi-4 · Non-reasoningMicrosoft1.0Single independent source13 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?16.3108/108 peersIndependent evidence5.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence26.3212/212 peersIndependent evidence9.0208/208 peersIndependent evidence8.0178/178 peersIndependent evidence12.9112/112 peersIndependent evidence30.860/60 peersIndependent evidence34.6114/114 peersIndependent evidence22.5198/198 peersIndependent evidence2.3171/171 peersIndependent evidence24.2169/169 peersIndependent evidence
199GPT-4o Mini · Non-reasoningOpenAI0.9Single independent source12 published · 12 families · 6 task areas100% weight: Artificial AnalysisWhy this score?13.6108/108 peersIndependent evidence2.657/57 peersIndependent evidence13.1123/123 peersIndependent evidence11.8212/212 peersIndependent evidence16.0208/208 peersIndependent evidence15.9178/178 peersIndependent evidence16.2112/112 peersIndependent evidence29.060/60 peersIndependent evidence20.2114/114 peersIndependent evidence7.4114/114 peersIndependent evidence3.4112/112 peersIndependent evidence17.1125/125 peersIndependent evidence
200Amazon Nova Lite · Non-reasoningAmazon0.9Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?6.4108/108 peersIndependent evidence13.7198/198 peersIndependent evidence25.5200/200 peersIndependent evidence13.5212/212 peersIndependent evidence17.8208/208 peersIndependent evidence28.4178/178 peersIndependent evidence11.7112/112 peersIndependent evidence22.160/60 peersIndependent evidence16.7114/114 peersIndependent evidence5.0114/114 peersIndependent evidence10.1198/198 peersIndependent evidence15.6171/171 peersIndependent evidence8.2169/169 peersIndependent evidence

Behind the ranking

273 entries with published results · 215 ranked · 7 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: overall; evidence: documented; configurations: best
https://unifybench.ai/?page=8

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →