The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Capability leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

451 entries

Capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
1Claude Fable 5.1 · MaxAnthropic85.8Independent corroboration63 published · 35 families · 6 task areas25% weight: Anthropic (reported)Why this score?96.928/28 peersIndependent evidence100.087/87 peersIndependent evidence98.448/48 peersIndependent evidence99.9198/198 peersIndependent evidence99.589/89 peersIndependent evidence98.6200/200 peersIndependent evidence97.188/88 peersIndependent evidence100.0123/123 peersIndependent evidence98.4212/212 peersIndependent evidence66.550/50 peersIndependent evidence100.0208/208 peersIndependent evidence100.031/31 peersIndependent evidence100.0198/198 peersIndependent evidence100.091/91 peersIndependent evidence94.2112/112 peersIndependent evidence100.0125/125 peersIndependent evidence97.738/38 peersIndependent evidence87.47/7 peersIndependent evidence91.626/26 peersIndependent evidence91.126/26 peersIndependent evidence79.526/26 peersIndependent evidence64.226/26 peersIndependent evidence87.826/26 peersIndependent evidence77.226/26 peersIndependent evidence66.426/26 peersIndependent evidence93.960/60 peersIndependent evidence95.739/39 peersIndependent evidence97.025/25 peersIndependent evidence87.030/30 peersIndependent evidence90.733/33 peersIndependent evidence98.332/32 peersIndependent evidence100.032/32 peersIndependent evidence96.732/32 peersIndependent evidence100.02/2 peersPublisher reports100.02/2 peersPublisher reports
2GPT-6 Astra · XHighOpenAI83.1Independent corroboration26 published · 20 families · 6 task areas25% weight: CognitionWhy this score?95.787/87 peersIndependent evidence93.7197/197 peersIndependent evidence100.089/89 peersIndependent evidence99.9200/200 peersIndependent evidence100.088/88 peersIndependent evidence92.7123/123 peersIndependent evidence100.0212/212 peersIndependent evidence99.6208/208 peersIndependent evidence100.0114/114 peersIndependent evidence99.5198/198 peersIndependent evidence91.191/91 peersIndependent evidence88.4112/112 peersIndependent evidence99.8125/125 peersIndependent evidence100.038/38 peersIndependent evidence100.025/25 peersIndependent evidence100.06/6 peersIndependent evidence100.05/5 peersIndependent evidence100.02/2 peersIndependent evidence100.02/2 peersIndependent evidence100.029/29 peersIndependent evidence
3Claude Opus 5 · MediumAnthropic75.7Independent corroboration20 published · 15 families · 6 task areas46% weight: CognitionWhy this score?90.387/87 peersIndependent evidence97.7198/198 peersIndependent evidence85.889/89 peersIndependent evidence97.4200/200 peersIndependent evidence88.188/88 peersIndependent evidence92.9123/123 peersIndependent evidence95.0212/212 peersIndependent evidence99.3208/208 peersIndependent evidence95.6114/114 peersIndependent evidence98.6198/198 peersIndependent evidence78.691/91 peersIndependent evidence83.0112/112 peersIndependent evidence96.1125/125 peersIndependent evidence83.325/25 peersIndependent evidence96.97/7 peersIndependent evidence
4Claude Fable 5 · HighAnthropic74.0Independent corroboration10 published · 9 families · 2 task areas18% weight: CognitionWhy this score?98.948/48 peersIndependent evidence57.247/47 peersIndependent evidence100.03/3 peersIndependent evidence95.338/38 peersIndependent evidence78.625/25 peersIndependent evidence98.67/7 peersIndependent evidence100.04/4 peersIndependent evidence71.77/7 peersIndependent evidence92.450/50 peersIndependent evidence
5GPT-5.6 Sol · XHighOpenAI72.0Independent corroboration25 published · 18 families · 6 task areas27% weight: CognitionWhy this score?87.987/87 peersIndependent evidence88.4198/198 peersIndependent evidence87.389/89 peersIndependent evidence98.0200/200 peersIndependent evidence98.488/88 peersIndependent evidence93.0123/123 peersIndependent evidence97.2212/212 peersIndependent evidence98.1208/208 peersIndependent evidence83.9178/178 peersIndependent evidence97.0114/114 peersIndependent evidence98.7198/198 peersIndependent evidence94.991/91 peersIndependent evidence80.2202/202 peersIndependent evidence96.8201/201 peersIndependent evidence98.138/38 peersIndependent evidence87.125/25 peersIndependent evidence85.75/5 peersIndependent evidence100.02/2 peersIndependent evidence
6Muse Spark 1.3 · XHighMeta70.3Independent corroboration49 published · 27 families · 6 task areas33% weight: Artificial AnalysisWhy this score?93.887/87 peersIndependent evidence98.3197/197 peersIndependent evidence98.389/89 peersIndependent evidence97.0200/200 peersIndependent evidence96.088/88 peersIndependent evidence98.8123/123 peersIndependent evidence99.1212/212 peersIndependent evidence98.250/50 peersIndependent evidence98.1208/208 peersIndependent evidence93.7114/114 peersIndependent evidence90.0198/198 peersIndependent evidence98.891/91 peersIndependent evidence95.3112/112 peersIndependent evidence76.7126/126 peersIndependent evidence82.626/26 peersIndependent evidence76.526/26 peersIndependent evidence56.626/26 peersIndependent evidence75.926/26 peersIndependent evidence89.726/26 peersIndependent evidence74.726/26 peersIndependent evidence90.526/26 peersIndependent evidence92.730/30 peersIndependent evidence70.632/32 peersIndependent evidence57.632/32 peersIndependent evidence93.232/32 peersIndependent evidence100.01/1 peersPublisher reports100.01/1 peersPublisher reports
7Gemini 3.8 Flash · MediumGoogle70.0Independent corroboration18 published · 15 families · 6 task areas38% weight: Artificial AnalysisWhy this score?76.787/87 peersIndependent evidence99.7197/197 peersIndependent evidence97.589/89 peersIndependent evidence90.8200/200 peersIndependent evidence93.388/88 peersIndependent evidence89.0123/123 peersIndependent evidence98.2212/212 peersIndependent evidence94.7208/208 peersIndependent evidence98.3114/114 peersIndependent evidence96.6198/198 peersIndependent evidence90.091/91 peersIndependent evidence91.1112/112 peersIndependent evidence89.8125/125 peersIndependent evidence90.025/25 peersIndependent evidence85.66/6 peersIndependent evidence
8GPT-5.5 Pro · XHighOpenAI65.5Independent corroboration4 published · 3 families · 1 task areas60% weight: ARC PrizeWhy this score?99.8200/200 peersIndependent evidence91.138/38 peersIndependent evidence92.239/39 peersIndependent evidence
9Grok 4.6 · HighxAI62.4Independent corroboration35 published · 27 families · 5 task areas16% weight: Vals AIWhy this score?63.528/28 peersIndependent evidence96.187/87 peersIndependent evidence87.148/48 peersIndependent evidence71.4198/198 peersIndependent evidence99.589/89 peersIndependent evidence92.7200/200 peersIndependent evidence91.041/41 peersIndependent evidence83.388/88 peersIndependent evidence96.1123/123 peersIndependent evidence96.2213/213 peersIndependent evidence90.432/32 peersIndependent evidence95.4208/208 peersIndependent evidence70.731/31 peersIndependent evidence93.6198/198 peersIndependent evidence92.391/91 peersIndependent evidence98.8112/112 peersIndependent evidence97.8126/126 peersIndependent evidence74.238/38 peersIndependent evidence65.025/25 peersIndependent evidence100.01/1 peersIndependent evidence89.250/50 peersIndependent evidence54.425/25 peersIndependent evidence46.730/30 peersIndependent evidence76.233/33 peersIndependent evidence85.832/32 peersIndependent evidence50.732/32 peersIndependent evidence62.532/32 peersIndependent evidence
10Kimi K3 · MaxMoonshot62.0Independent corroboration49 published · 33 families · 6 task areas25% weight: Moonshot AI (reported)Why this score?59.028/28 peersIndependent evidence93.987/87 peersIndependent evidence86.048/48 peersIndependent evidence97.226/26 peersIndependent evidence93.2198/198 peersIndependent evidence98.289/89 peersIndependent evidence96.1200/200 peersIndependent evidence80.541/41 peersIndependent evidence91.888/88 peersIndependent evidence92.7123/123 peersIndependent evidence82.3213/213 peersIndependent evidence97.037/37 peersIndependent evidence52.8208/208 peersIndependent evidence95.228/28 peersIndependent evidence59.231/31 peersIndependent evidence74.4115/115 peersIndependent evidence92.5198/198 peersIndependent evidence98.191/91 peersIndependent evidence94.5112/112 peersIndependent evidence89.0125/125 peersIndependent evidence66.938/38 peersIndependent evidence79.025/25 peersIndependent evidence74.860/60 peersIndependent evidence70.539/39 peersIndependent evidence54.525/25 peersIndependent evidence29.733/33 peersIndependent evidence80.732/32 peersIndependent evidence83.33/3 peersPublisher reports100.03/3 peersPublisher reports100.01/1 peersPublisher reports75.04/4 peersPublisher reports100.04/4 peersPublisher reports100.04/4 peersPublisher reports
11Gemini 3.7 Flash · MediumGoogle60.1Independent corroboration16 published · 14 families · 6 task areas32% weight: ARC PrizeWhy this score?98.3197/197 peersIndependent evidence87.8200/200 peersIndependent evidence98.941/41 peersIndependent evidence87.8123/123 peersIndependent evidence94.1212/212 peersIndependent evidence91.9208/208 peersIndependent evidence99.1114/114 peersIndependent evidence97.2198/198 peersIndependent evidence99.391/91 peersIndependent evidence81.4112/112 peersIndependent evidence86.5125/125 peersIndependent evidence74.538/38 peersIndependent evidence66.525/25 peersIndependent evidence100.06/6 peersIndependent evidence
12GLM-5.3 · MaxZ.ai57.5Independent corroboration36 published · 26 families · 5 task areas17% weight: CognitionWhy this score?94.887/87 peersIndependent evidence61.948/48 peersIndependent evidence90.8198/198 peersIndependent evidence98.289/89 peersIndependent evidence93.5200/200 peersIndependent evidence39.741/41 peersIndependent evidence62.788/88 peersIndependent evidence98.9123/123 peersIndependent evidence80.5213/213 peersIndependent evidence74.132/32 peersIndependent evidence92.2208/208 peersIndependent evidence30.131/31 peersIndependent evidence80.4198/198 peersIndependent evidence97.491/91 peersIndependent evidence98.4112/112 peersIndependent evidence50.2126/126 peersIndependent evidence85.325/25 peersIndependent evidence80.66/6 peersIndependent evidence63.060/60 peersIndependent evidence56.939/39 peersIndependent evidence29.225/25 peersIndependent evidence66.630/30 peersIndependent evidence68.433/33 peersIndependent evidence90.032/32 peersIndependent evidence32.732/32 peersIndependent evidence68.332/32 peersIndependent evidence
13GPT-5.5 · XHighOpenAI54.9Independent corroboration83 published · 47 families · 6 task areas23% weight: Moonshot AI (reported)Why this score?87.228/28 peersIndependent evidence74.687/87 peersIndependent evidence88.526/26 peersIndependent evidence84.9198/198 peersIndependent evidence36.089/89 peersIndependent evidence97.3200/200 peersIndependent evidence81.641/41 peersIndependent evidence91.188/88 peersIndependent evidence85.1123/123 peersIndependent evidence68.4212/212 peersIndependent evidence47.250/50 peersIndependent evidence15.1208/208 peersIndependent evidence93.6178/178 peersIndependent evidence85.728/28 peersIndependent evidence48.431/31 peersIndependent evidence42.5115/115 peersIndependent evidence98.2198/198 peersIndependent evidence89.091/91 peersIndependent evidence87.6202/202 peersIndependent evidence67.9201/201 peersIndependent evidence90.738/38 peersIndependent evidence66.025/25 peersIndependent evidence68.05/5 peersIndependent evidence50.02/2 peersIndependent evidence50.02/2 peersIndependent evidence0.02/2 peersIndependent evidence56.326/26 peersIndependent evidence80.826/26 peersIndependent evidence79.526/26 peersIndependent evidence79.526/26 peersIndependent evidence55.126/26 peersIndependent evidence65.926/26 peersIndependent evidence55.826/26 peersIndependent evidence100.06/6 peersIndependent evidence98.140/40 peersIndependent evidence82.039/39 peersIndependent evidence74.125/25 peersIndependent evidence40.030/30 peersIndependent evidence78.833/33 peersIndependent evidence59.432/32 peersIndependent evidence59.432/32 peersIndependent evidence43.832/32 peersIndependent evidence0.03/3 peersPublisher reports16.83/3 peersPublisher reports28.54/4 peersPublisher reports28.54/4 peersPublisher reports28.54/4 peersPublisher reports
14GPT-5.6 Terra · MaxOpenAI54.7Independent corroboration67 published · 38 families · 6 task areas14% weight: LiveBenchWhy this score?85.287/87 peersIndependent evidence96.148/48 peersIndependent evidence92.226/26 peersIndependent evidence93.5198/198 peersIndependent evidence94.889/89 peersIndependent evidence98.7200/200 peersIndependent evidence39.041/41 peersIndependent evidence94.888/88 peersIndependent evidence90.1123/123 peersIndependent evidence92.4213/213 peersIndependent evidence35.750/50 peersIndependent evidence95.3208/208 peersIndependent evidence84.2178/178 peersIndependent evidence96.428/28 peersIndependent evidence92.6114/114 peersIndependent evidence93.0198/198 peersIndependent evidence87.791/91 peersIndependent evidence84.1202/202 peersIndependent evidence42.6201/201 peersIndependent evidence85.938/38 peersIndependent evidence81.525/25 peersIndependent evidence45.06/6 peersIndependent evidence64.25/5 peersIndependent evidence56.326/26 peersIndependent evidence47.526/26 peersIndependent evidence49.126/26 peersIndependent evidence69.626/26 peersIndependent evidence59.626/26 peersIndependent evidence77.426/26 peersIndependent evidence26.926/26 peersIndependent evidence91.360/60 peersIndependent evidence81.539/39 peersIndependent evidence33.36/6 peersIndependent evidence59.930/30 peersIndependent evidence84.933/33 peersIndependent evidence68.532/32 peersIndependent evidence66.132/32 peersIndependent evidence56.132/32 peersIndependent evidence
15Claude Opus 4.8 · MaxAnthropic51.5Independent corroboration78 published · 42 families · 6 task areas24% weight: Moonshot AI (reported)Why this score?74.628/28 peersIndependent evidence84.487/87 peersIndependent evidence0.01/1 peersIndependent evidence85.4198/198 peersIndependent evidence58.789/89 peersIndependent evidence95.3200/200 peersIndependent evidence70.041/41 peersIndependent evidence92.788/88 peersIndependent evidence89.0123/123 peersIndependent evidence25.5212/212 peersIndependent evidence82.750/50 peersIndependent evidence87.1208/208 peersIndependent evidence71.8178/178 peersIndependent evidence77.431/31 peersIndependent evidence0.03/3 peersPublisher reports92.3198/198 peersIndependent evidence84.691/91 peersIndependent evidence85.5202/202 peersIndependent evidence31.1201/201 peersIndependent evidence25.84/4 peersPublisher reports66.67/7 peersIndependent evidence74.826/26 peersIndependent evidence71.926/26 peersIndependent evidence40.326/26 peersIndependent evidence32.026/26 peersIndependent evidence46.226/26 peersIndependent evidence62.826/26 peersIndependent evidence61.726/26 peersIndependent evidence37.240/40 peersIndependent evidence77.739/39 peersIndependent evidence68.025/25 peersIndependent evidence57.230/30 peersIndependent evidence82.333/33 peersIndependent evidence76.232/32 peersIndependent evidence79.232/32 peersIndependent evidence87.132/32 peersIndependent evidence52.03/3 peersPublisher reports34.63/3 peersPublisher reports0.01/1 peersPublisher reports100.04/4 peersPublisher reports64.44/4 peersPublisher reports77.14/4 peersPublisher reports
16Qwen 3.8-Max · XHighQwen49.9Independent corroboration9 published · 6 families · 3 task areas51% weight: Epoch AIWhy this score?96.048/48 peersIndependent evidence90.647/47 peersIndependent evidence52.225/25 peersIndependent evidence83.560/60 peersIndependent evidence77.739/39 peersIndependent evidence44.225/25 peersIndependent evidence
17Muse Spark 1.2 · XHighMeta45.6Independent corroboration54 published · 31 families · 5 task areas22% weight: Meta (reported)Why this score?86.287/87 peersIndependent evidence85.5198/198 peersIndependent evidence12.989/89 peersIndependent evidence92.1200/200 peersIndependent evidence85.541/41 peersIndependent evidence82.888/88 peersIndependent evidence91.4123/123 peersIndependent evidence88.3212/212 peersIndependent evidence100.032/32 peersIndependent evidence95.7208/208 peersIndependent evidence55.231/31 peersIndependent evidence90.1198/198 peersIndependent evidence93.191/91 peersIndependent evidence83.9112/112 peersIndependent evidence62.9126/126 peersIndependent evidence51.825/25 peersIndependent evidence43.926/26 peersIndependent evidence43.626/26 peersIndependent evidence49.826/26 peersIndependent evidence56.326/26 peersIndependent evidence69.026/26 peersIndependent evidence55.526/26 peersIndependent evidence68.726/26 peersIndependent evidence82.525/25 peersIndependent evidence97.230/30 peersIndependent evidence33.733/33 peersIndependent evidence77.232/32 peersIndependent evidence45.032/32 peersIndependent evidence75.732/32 peersIndependent evidence0.01/1 peersPublisher reports0.01/1 peersPublisher reports
18DeepSeek V4-Pro 0813 · MaxDeepSeek44.8Independent corroboration33 published · 25 families · 5 task areas28% weight: Artificial AnalysisWhy this score?82.387/87 peersIndependent evidence89.148/48 peersIndependent evidence82.9198/198 peersIndependent evidence90.289/89 peersIndependent evidence93.1200/200 peersIndependent evidence94.641/41 peersIndependent evidence66.588/88 peersIndependent evidence90.4123/123 peersIndependent evidence86.8213/213 peersIndependent evidence70.932/32 peersIndependent evidence91.4208/208 peersIndependent evidence38.131/31 peersIndependent evidence93.7198/198 peersIndependent evidence74.291/91 peersIndependent evidence88.8112/112 peersIndependent evidence50.2126/126 peersIndependent evidence73.138/38 peersIndependent evidence91.160/60 peersIndependent evidence48.839/39 peersIndependent evidence65.625/25 peersIndependent evidence36.430/30 peersIndependent evidence66.833/33 peersIndependent evidence66.432/32 peersIndependent evidence27.432/32 peersIndependent evidence85.332/32 peersIndependent evidence
19Qwen3.8-2.4T-A95B · ReasoningQwen43.5Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?89.687/87 peersIndependent evidence58.6198/198 peersIndependent evidence92.789/89 peersIndependent evidence95.4200/200 peersIndependent evidence95.041/41 peersIndependent evidence80.588/88 peersIndependent evidence94.0123/123 peersIndependent evidence98.3212/212 peersIndependent evidence95.6208/208 peersIndependent evidence81.6198/198 peersIndependent evidence86.891/91 peersIndependent evidence96.8112/112 peersIndependent evidence84.8125/125 peersIndependent evidence
20GLM-5.3-Flash · ReasoningZ.ai42.1Single independent source16 published · 13 families · 5 task areas100% weight: Artificial AnalysisWhy this score?91.687/87 peersIndependent evidence94.3198/198 peersIndependent evidence97.089/89 peersIndependent evidence92.5200/200 peersIndependent evidence39.441/41 peersIndependent evidence77.988/88 peersIndependent evidence98.0123/123 peersIndependent evidence93.1212/212 peersIndependent evidence93.1208/208 peersIndependent evidence75.6198/198 peersIndependent evidence80.891/91 peersIndependent evidence93.7112/112 peersIndependent evidence93.2125/125 peersIndependent evidence
21Claude Opus 4.6 · MaxAnthropic42.0Independent corroboration22 published · 16 families · 6 task areas27% weight: Artificial AnalysisWhy this score?64.048/48 peersIndependent evidence85.226/26 peersIndependent evidence86.3197/197 peersIndependent evidence89.6200/200 peersIndependent evidence97.563/63 peersIndependent evidence73.1213/213 peersIndependent evidence89.5208/208 peersIndependent evidence64.6178/178 peersIndependent evidence77.8114/114 peersIndependent evidence93.4198/198 peersIndependent evidence87.1171/171 peersIndependent evidence95.7169/169 peersIndependent evidence81.538/38 peersIndependent evidence52.360/60 peersIndependent evidence52.239/39 peersIndependent evidence45.425/25 peersIndependent evidence
22Muse Spark 1.1 · XHighMeta41.1Independent corroboration49 published · 28 families · 5 task areas26% weight: Artificial AnalysisWhy this score?55.687/87 peersIndependent evidence83.3197/197 peersIndependent evidence73.989/89 peersIndependent evidence89.1200/200 peersIndependent evidence75.288/88 peersIndependent evidence78.6123/123 peersIndependent evidence86.9212/212 peersIndependent evidence92.732/32 peersIndependent evidence96.4208/208 peersIndependent evidence62.731/31 peersIndependent evidence95.1198/198 peersIndependent evidence96.391/91 peersIndependent evidence80.3112/112 peersIndependent evidence59.8126/126 peersIndependent evidence37.625/25 peersIndependent evidence100.01/1 peersIndependent evidence31.426/26 peersIndependent evidence37.726/26 peersIndependent evidence26.226/26 peersIndependent evidence49.126/26 peersIndependent evidence76.326/26 peersIndependent evidence53.026/26 peersIndependent evidence55.026/26 peersIndependent evidence76.830/30 peersIndependent evidence39.733/33 peersIndependent evidence43.232/32 peersIndependent evidence37.632/32 peersIndependent evidence55.232/32 peersIndependent evidence
23GPT-5.6 Luna · MaxOpenAI40.7Independent corroboration65 published · 38 families · 6 task areas14% weight: Vals AIWhy this score?85.487/87 peersIndependent evidence88.448/48 peersIndependent evidence85.726/26 peersIndependent evidence89.1198/198 peersIndependent evidence82.789/89 peersIndependent evidence95.4200/200 peersIndependent evidence54.941/41 peersIndependent evidence94.588/88 peersIndependent evidence90.5123/123 peersIndependent evidence85.2213/213 peersIndependent evidence41.550/50 peersIndependent evidence91.1208/208 peersIndependent evidence72.528/28 peersIndependent evidence16.231/31 peersIndependent evidence85.9114/114 peersIndependent evidence89.9198/198 peersIndependent evidence83.791/91 peersIndependent evidence80.0112/112 peersIndependent evidence13.1126/126 peersIndependent evidence62.538/38 peersIndependent evidence71.125/25 peersIndependent evidence10.46/6 peersIndependent evidence55.55/5 peersIndependent evidence24.526/26 peersIndependent evidence73.326/26 peersIndependent evidence14.926/26 peersIndependent evidence61.926/26 peersIndependent evidence29.626/26 peersIndependent evidence32.326/26 peersIndependent evidence16.526/26 peersIndependent evidence71.360/60 peersIndependent evidence78.339/39 peersIndependent evidence16.76/6 peersIndependent evidence63.230/30 peersIndependent evidence72.933/33 peersIndependent evidence37.632/32 peersIndependent evidence74.932/32 peersIndependent evidence65.532/32 peersIndependent evidence
24Qwen3.8-Flash-Next · ReasoningQwen40.7Single independent source15 published · 13 families · 6 task areas100% weight: Artificial AnalysisWhy this score?98.187/87 peersIndependent evidence93.5197/197 peersIndependent evidence88.889/89 peersIndependent evidence90.2200/200 peersIndependent evidence80.588/88 peersIndependent evidence96.8123/123 peersIndependent evidence95.2212/212 peersIndependent evidence91.6208/208 peersIndependent evidence91.2114/114 peersIndependent evidence67.3198/198 peersIndependent evidence75.091/91 peersIndependent evidence90.3112/112 peersIndependent evidence93.7125/125 peersIndependent evidence
25Claude Sonnet 5 · XHighAnthropic39.9Independent corroboration42 published · 24 families · 5 task areas26% weight: CognitionWhy this score?81.787/87 peersIndependent evidence79.448/48 peersIndependent evidence87.7197/197 peersIndependent evidence72.089/89 peersIndependent evidence92.8200/200 peersIndependent evidence76.341/41 peersIndependent evidence70.188/88 peersIndependent evidence87.2123/123 peersIndependent evidence82.347/47 peersIndependent evidence93.4208/208 peersIndependent evidence88.8198/198 peersIndependent evidence86.691/91 peersIndependent evidence72.987/87 peersIndependent evidence28.825/25 peersIndependent evidence56.17/7 peersIndependent evidence49.126/26 peersIndependent evidence65.726/26 peersIndependent evidence23.426/26 peersIndependent evidence28.926/26 peersIndependent evidence80.326/26 peersIndependent evidence63.426/26 peersIndependent evidence21.426/26 peersIndependent evidence86.750/50 peersIndependent evidence17.225/25 peersIndependent evidence

Behind the ranking

273 entries with published results · 215 ranked · 7 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: overall; evidence: documented; configurations: best
https://unifybench.ai/?evidence=documented&mode=overall&view=overview

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →