The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Core work leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

451 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
Seed OSS 36B Instruct · ReasoningByteDanceNot scoredProvisional · 66%13 published · 7 families · 3 selected capabilities86.6108/108 peersIndependent evidence61.6197/197 peersIndependent evidence25.5200/200 peersIndependent evidence31.863/63 peersIndependent evidence50.1212/212 peersIndependent evidence50.9208/208 peersIndependent evidence47.5178/178 peersIndependent evidence85.0112/112 peersIndependent evidence74.3114/114 peersIndependent evidence44.8198/198 peersIndependent evidence59.0171/171 peersIndependent evidence39.1169/169 peersIndependent evidence
Solar Open 100B · ReasoningUpstageNot scoredProvisional · 33%10 published · 5 families · 3 selected capabilities42.4197/197 peersIndependent evidence25.2200/200 peersIndependent evidence50.663/63 peersIndependent evidence35.4212/212 peersIndependent evidence54.6208/208 peersIndependent evidence68.3178/178 peersIndependent evidence47.2198/198 peersIndependent evidence57.6171/171 peersIndependent evidence17.4169/169 peersIndependent evidence
Step 3 VL 10B · ReasoningStepFunNot scoredProvisional · 33%10 published · 5 families · 3 selected capabilities5.7197/197 peersIndependent evidence25.2200/200 peersIndependent evidence44.4212/212 peersIndependent evidence56.0208/208 peersIndependent evidence61.3178/178 peersIndependent evidence46.9114/114 peersIndependent evidence19.0198/198 peersIndependent evidence12.3171/171 peersIndependent evidence30.4169/169 peersIndependent evidence
Tiny Aya Global · Non-reasoningCohereNot scoredProvisional · 33%10 published · 5 families · 3 selected capabilities5.7197/197 peersIndependent evidence25.2200/200 peersIndependent evidence4.063/63 peersIndependent evidence5.5212/212 peersIndependent evidence31.7208/208 peersIndependent evidence3.1178/178 peersIndependent evidence2.4198/198 peersIndependent evidence2.2171/171 peersIndependent evidence3.3169/169 peersIndependent evidence
DeepSeek-R1-Distill-Llama-8B · ReasoningDeepSeekNot scoredProvisional · 33%7 published · 4 families · 2 selected capabilities43.8108/108 peersIndependent evidence5.8197/197 peersIndependent evidence5.0212/212 peersIndependent evidence1.3178/178 peersIndependent evidence13.8112/112 peersIndependent evidence39.460/60 peersIndependent evidence11.6114/114 peersIndependent evidence
DeepSeek-R1-Distill-Qwen-1.5B · ReasoningDeepSeekNot scoredProvisional · 33%8 published · 5 families · 2 selected capabilities20.3108/108 peersIndependent evidence12.3197/197 peersIndependent evidence0.0212/212 peersIndependent evidence3.3208/208 peersIndependent evidence0.6178/178 peersIndependent evidence1.6112/112 peersIndependent evidence7.260/60 peersIndependent evidence2.2114/114 peersIndependent evidence
DeepSeek-R1-Distill-Qwen-14B · ReasoningDeepSeekNot scoredProvisional · 33%8 published · 5 families · 2 selected capabilities54.5108/108 peersIndependent evidence17.0197/197 peersIndependent evidence17.7212/212 peersIndependent evidence13.2208/208 peersIndependent evidence6.2178/178 peersIndependent evidence35.5112/112 peersIndependent evidence72.360/60 peersIndependent evidence40.7114/114 peersIndependent evidence
DeepSeek-R1-Distill-Qwen-32B · ReasoningDeepSeekNot scoredProvisional · 33%8 published · 5 families · 2 selected capabilities61.3108/108 peersIndependent evidence15.3197/197 peersIndependent evidence31.5212/212 peersIndependent evidence21.1208/208 peersIndependent evidence6.9178/178 peersIndependent evidence20.2112/112 peersIndependent evidence68.560/60 peersIndependent evidence39.2114/114 peersIndependent evidence
GPT-4 · Non-reasoningOpenAINot scoredProvisional · 33%7 published · 3 families · 2 selected capabilities14.8123/123 peersIndependent evidence7.6212/212 peersIndependent evidence25.1178/178 peersIndependent evidence5.660/60 peersIndependent evidence13.4114/114 peersIndependent evidence58.7198/198 peersIndependent evidence
GPT-4-turbo · Non-reasoningOpenAINot scoredProvisional · 33%4 published · 3 families · 2 selected capabilities3.9208/208 peersIndependent evidence22.5112/112 peersIndependent evidence22.960/60 peersIndependent evidence29.3114/114 peersIndependent evidence
GPT-4o · Non-reasoningOpenAINot scoredProvisional · 0%41 published · 2 families · 2 selected capabilities24.3200/200 peersIndependent evidence30.6114/114 peersIndependent evidence42.9169/169 peersIndependent evidence
Phi-4-multimodal-instruct · Non-reasoningMicrosoftNot scoredProvisional · 33%6 published · 4 families · 2 selected capabilities6.3212/212 peersIndependent evidence29.0208/208 peersIndependent evidence6.6112/112 peersIndependent evidence12.160/60 peersIndependent evidence7.8114/114 peersIndependent evidence0.0114/114 peersIndependent evidence
GPT-3.5-turbo · Non-reasoningOpenAINot scoredProvisional · 33%3 published · 2 families · 1 selected capabilities4.1212/212 peersIndependent evidence0.060/60 peersIndependent evidence5.4114/114 peersIndependent evidence
GPT-5.2 Pro · HighOpenAINot scoredProvisional · 0%1 published · 1 families · 1 selected capabilities71.638/38 peersIndependent evidence
GPT-5.4 Pro · XHighOpenAINot scoredProvisional · 33%2 published · 2 families · 1 selected capabilities98.1200/200 peersIndependent evidence86.738/38 peersIndependent evidence
GPT-5.5 Pro · HighOpenAINot scoredProvisional · 0%1 published · 1 families · 1 selected capabilities94.638/38 peersIndependent evidence
o3-pro · HighOpenAINot scoredProvisional · 0%1 published · 1 families · 1 selected capabilities42.538/38 peersIndependent evidence
Qwen3-max · Non-reasoningQwenNot scoredProvisional · 0%25 published · 1 families · 1 selected capabilities58.763/63 peersIndependent evidence60.1212/212 peersIndependent evidence
Qwen3.5-flash · Non-reasoningQwenNot scoredProvisional · 33%2 published · 2 families · 1 selected capabilities33.140/40 peersIndependent evidence0.039/39 peersIndependent evidence
Qwen3.5-plus · Non-reasoningQwenNot scoredProvisional · 0%1 published · 1 families · 1 selected capabilities45.240/40 peersIndependent evidence
Qwen3.6-flash · Non-reasoningQwenNot scoredProvisional · 33%2 published · 2 families · 1 selected capabilities64.940/40 peersIndependent evidence25.839/39 peersIndependent evidence
Qwen3.7-flash · Non-reasoningQwenNot scoredProvisional · 33%5 published · 4 families · 1 selected capabilities55.348/48 peersIndependent evidence46.347/47 peersIndependent evidence38.760/60 peersIndependent evidence7.939/39 peersIndependent evidence
AutoGLM-Phone-9B · Effort unspecifiedZ.aiNot scoredNo evidence0 published · 0 families · 0 selected capabilities
AutoGLM-Phone-9B-Multilingual · Effort unspecifiedZ.aiNot scoredNo evidence0 published · 0 families · 0 selected capabilities
aya-101 · Effort unspecifiedCohereNot scoredNo evidence0 published · 0 families · 0 selected capabilities

Behind the ranking

273 entries with published results · 112 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:34,hard_reasoning:33,coding:33,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/?mode=custom&page=9&w=v3

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →