The leaders, at a glance

Agentic AI model ranking

Compare AI models and effort settings for agentic work using sourced task evaluations and visible evidence coverage.

Agentic leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

127 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
51Solar Open2 250B · ReasoningUpstage27.2Eligible · 100%10 published · 2 families · 1 selected capabilities77.7197/197 peersIndependent evidence85.9200/200 peersIndependent evidence63.7123/123 peersIndependent evidence82.0212/212 peersIndependent evidence83.9208/208 peersIndependent evidence49.2198/198 peersIndependent evidence65.391/91 peersIndependent evidence65.0112/112 peersIndependent evidence55.7125/125 peersIndependent evidence
52Solar Pro 4 · ReasoningUpstage26.3Eligible · 100%13 published · 4 families · 1 selected capabilities82.9197/197 peersIndependent evidence49.489/89 peersIndependent evidence84.6200/200 peersIndependent evidence43.988/88 peersIndependent evidence80.5123/123 peersIndependent evidence88.7212/212 peersIndependent evidence84.9208/208 peersIndependent evidence49.7198/198 peersIndependent evidence51.891/91 peersIndependent evidence69.7112/112 peersIndependent evidence58.7125/125 peersIndependent evidence
53Qwen3.6-27B · ReasoningQwen25.8Eligible · 100%19 published · 6 families · 1 selected capabilities53.487/87 peersIndependent evidence89.1197/197 peersIndependent evidence52.989/89 peersIndependent evidence70.7200/200 peersIndependent evidence64.188/88 peersIndependent evidence66.8123/123 peersIndependent evidence77.3212/212 peersIndependent evidence56.237/37 peersIndependent evidence77.6208/208 peersIndependent evidence81.2178/178 peersIndependent evidence78.0114/114 peersIndependent evidence52.8198/198 peersIndependent evidence45.691/91 peersIndependent evidence76.9202/202 peersIndependent evidence58.5201/201 peersIndependent evidence
54Gemini 3 Flash Preview · ReasoningGoogle24.7Eligible · 100%17 published · 2 families · 1 selected capabilities99.7108/108 peersIndependent evidence76.226/26 peersIndependent evidence79.2198/198 peersIndependent evidence88.5200/200 peersIndependent evidence98.563/63 peersIndependent evidence92.0212/212 peersIndependent evidence91.6208/208 peersIndependent evidence96.7178/178 peersIndependent evidence100.0112/112 peersIndependent evidence99.4114/114 peersIndependent evidence93.3114/114 peersIndependent evidence97.3198/198 peersIndependent evidence70.2202/202 peersIndependent evidence90.9169/169 peersIndependent evidence
55GPT-5 · HighOpenAI23.6Eligible · 100%23 published · 2 families · 1 selected capabilities96.6108/108 peersIndependent evidence88.3197/197 peersIndependent evidence85.2200/200 peersIndependent evidence59.6123/123 peersIndependent evidence95.363/63 peersIndependent evidence81.1212/212 peersIndependent evidence83.2208/208 peersIndependent evidence89.3178/178 peersIndependent evidence94.9112/112 peersIndependent evidence100.060/60 peersIndependent evidence96.1114/114 peersIndependent evidence75.8114/114 peersIndependent evidence89.9198/198 peersIndependent evidence72.7202/202 peersIndependent evidence60.5201/201 peersIndependent evidence47.038/38 peersIndependent evidence58.82/2 peersIndependent evidence
56GLM-5 · ReasoningZ.ai23.6Eligible · 100%10 published · 2 families · 1 selected capabilities31.026/26 peersIndependent evidence87.3197/197 peersIndependent evidence76.6200/200 peersIndependent evidence72.3212/212 peersIndependent evidence86.3208/208 peersIndependent evidence87.6178/178 peersIndependent evidence73.5198/198 peersIndependent evidence97.4171/171 peersIndependent evidence94.6169/169 peersIndependent evidence
57MiMo-V2.5-Pro · ReasoningXiaomi21.9Eligible · 100%22 published · 9 families · 1 selected capabilities70.228/28 peersIndependent evidence63.087/87 peersIndependent evidence9.926/26 peersIndependent evidence74.0198/198 peersIndependent evidence56.789/89 peersIndependent evidence81.2200/200 peersIndependent evidence39.988/88 peersIndependent evidence78.8123/123 peersIndependent evidence84.0212/212 peersIndependent evidence36.637/37 peersIndependent evidence90.8208/208 peersIndependent evidence98.4178/178 peersIndependent evidence75.428/28 peersIndependent evidence62.3198/198 peersIndependent evidence75.691/91 peersIndependent evidence65.4202/202 peersIndependent evidence65.4201/201 peersIndependent evidence
58GPT-5.3 Codex · XHighOpenAI20.9Eligible · 100%12 published · 2 families · 1 selected capabilities59.587/87 peersIndependent evidence99.2197/197 peersIndependent evidence92.6200/200 peersIndependent evidence92.6212/212 peersIndependent evidence95.2208/208 peersIndependent evidence91.7178/178 peersIndependent evidence85.0114/114 peersIndependent evidence96.0198/198 peersIndependent evidence79.2171/171 peersIndependent evidence98.5169/169 peersIndependent evidence0.03/3 peersIndependent evidence
59Qwen3.5-397B-A17B · ReasoningQwen20.4Eligible · 100%23 published · 9 families · 1 selected capabilities42.487/87 peersIndependent evidence50.326/26 peersIndependent evidence88.5197/197 peersIndependent evidence51.189/89 peersIndependent evidence75.3200/200 peersIndependent evidence29.941/41 peersIndependent evidence70.788/88 peersIndependent evidence56.6123/123 peersIndependent evidence89.663/63 peersIndependent evidence89.5212/212 peersIndependent evidence27.937/37 peersIndependent evidence84.6208/208 peersIndependent evidence97.3178/178 peersIndependent evidence58.028/28 peersIndependent evidence84.5114/114 peersIndependent evidence80.7198/198 peersIndependent evidence54.791/91 peersIndependent evidence74.0202/202 peersIndependent evidence58.8201/201 peersIndependent evidence
60Claude Sonnet 4.5 · ReasoningAnthropic19.8Eligible · 100%22 published · 5 families · 1 selected capabilities48.587/87 peersIndependent evidence90.2108/108 peersIndependent evidence80.0197/197 peersIndependent evidence58.289/89 peersIndependent evidence70.5200/200 peersIndependent evidence45.088/88 peersIndependent evidence60.9123/123 peersIndependent evidence87.463/63 peersIndependent evidence74.7212/212 peersIndependent evidence70.8208/208 peersIndependent evidence67.5178/178 peersIndependent evidence77.6112/112 peersIndependent evidence96.9114/114 peersIndependent evidence60.0114/114 peersIndependent evidence83.7198/198 peersIndependent evidence58.891/91 peersIndependent evidence72.9202/202 peersIndependent evidence58.9201/201 peersIndependent evidence
61MiMo-V2.5 · ReasoningXiaomi19.6Eligible · 100%18 published · 5 families · 1 selected capabilities50.987/87 peersIndependent evidence79.1197/197 peersIndependent evidence60.789/89 peersIndependent evidence79.9200/200 peersIndependent evidence38.888/88 peersIndependent evidence67.8123/123 peersIndependent evidence79.8212/212 peersIndependent evidence79.2208/208 peersIndependent evidence79.4178/178 peersIndependent evidence79.6114/114 peersIndependent evidence38.5198/198 peersIndependent evidence50.491/91 peersIndependent evidence61.2202/202 peersIndependent evidence64.9201/201 peersIndependent evidence
62Amazon Nova 2 Pro Preview · MediumAmazon18.9Eligible · 100%16 published · 2 families · 1 selected capabilities91.2108/108 peersIndependent evidence49.8198/198 peersIndependent evidence24.9200/200 peersIndependent evidence37.3123/123 peersIndependent evidence64.8212/212 peersIndependent evidence50.8208/208 peersIndependent evidence97.7178/178 peersIndependent evidence80.9112/112 peersIndependent evidence84.0114/114 peersIndependent evidence48.6114/114 peersIndependent evidence60.9198/198 peersIndependent evidence87.5171/171 peersIndependent evidence58.8201/201 peersIndependent evidence
63GPT-5.1 · HighOpenAI18.5Eligible · 100%18 published · 2 families · 1 selected capabilities96.5108/108 peersIndependent evidence94.2197/197 peersIndependent evidence82.4200/200 peersIndependent evidence57.6123/123 peersIndependent evidence92.963/63 peersIndependent evidence84.7212/212 peersIndependent evidence82.2208/208 peersIndependent evidence88.9178/178 peersIndependent evidence96.6112/112 peersIndependent evidence96.3114/114 peersIndependent evidence80.3114/114 peersIndependent evidence86.7198/198 peersIndependent evidence66.5202/202 peersIndependent evidence78.1201/201 peersIndependent evidence56.138/38 peersIndependent evidence
64Step 3.7 Flash · ReasoningStepFun18.1Eligible · 100%18 published · 6 families · 1 selected capabilities46.126/26 peersIndependent evidence80.6197/197 peersIndependent evidence75.4200/200 peersIndependent evidence23.141/41 peersIndependent evidence59.7123/123 peersIndependent evidence67.0212/212 peersIndependent evidence31.037/37 peersIndependent evidence74.7208/208 peersIndependent evidence79.9178/178 peersIndependent evidence36.828/28 peersIndependent evidence78.2114/114 peersIndependent evidence71.5198/198 peersIndependent evidence50.691/91 peersIndependent evidence75.7202/202 peersIndependent evidence68.4201/201 peersIndependent evidence
65Qwen3.6-35B-A3B · ReasoningQwen17.9Eligible · 100%18 published · 5 families · 1 selected capabilities45.487/87 peersIndependent evidence78.1197/197 peersIndependent evidence43.389/89 peersIndependent evidence55.7200/200 peersIndependent evidence49.888/88 peersIndependent evidence60.1123/123 peersIndependent evidence76.6212/212 peersIndependent evidence76.8208/208 peersIndependent evidence77.1178/178 peersIndependent evidence80.4114/114 peersIndependent evidence48.6198/198 peersIndependent evidence27.891/91 peersIndependent evidence69.0202/202 peersIndependent evidence55.0201/201 peersIndependent evidence
66DeepSeek-V3.2 · ReasoningDeepSeek17.6Eligible · 100%16 published · 3 families · 1 selected capabilities95.5108/108 peersIndependent evidence38.826/26 peersIndependent evidence82.1197/197 peersIndependent evidence78.2200/200 peersIndependent evidence49.5123/123 peersIndependent evidence78.363/63 peersIndependent evidence76.1212/212 peersIndependent evidence79.4208/208 peersIndependent evidence72.6178/178 peersIndependent evidence95.5112/112 peersIndependent evidence94.4114/114 peersIndependent evidence84.1198/198 peersIndependent evidence85.3171/171 peersIndependent evidence72.2201/201 peersIndependent evidence
67NVIDIA Nemotron 3 Ultra · ReasoningNVIDIA16.4Eligible · 100%21 published · 8 families · 1 selected capabilities7.628/28 peersIndependent evidence61.387/87 peersIndependent evidence75.9198/198 peersIndependent evidence33.589/89 peersIndependent evidence78.0200/200 peersIndependent evidence18.941/41 peersIndependent evidence43.388/88 peersIndependent evidence71.2123/123 peersIndependent evidence82.7212/212 peersIndependent evidence46.037/37 peersIndependent evidence81.4208/208 peersIndependent evidence99.3178/178 peersIndependent evidence62.3198/198 peersIndependent evidence39.291/91 peersIndependent evidence65.4202/202 peersIndependent evidence68.6201/201 peersIndependent evidence
68K EXAONE 2.0 750B A37B · ReasoningLG AI Research16.2Eligible · 100%10 published · 2 families · 1 selected capabilities60.1197/197 peersIndependent evidence66.8200/200 peersIndependent evidence56.3123/123 peersIndependent evidence73.8212/212 peersIndependent evidence71.7208/208 peersIndependent evidence17.9198/198 peersIndependent evidence41.591/91 peersIndependent evidence38.0112/112 peersIndependent evidence51.1125/125 peersIndependent evidence
69Mistral Medium 3.5 · ReasoningMistral16.1Eligible · 100%22 published · 8 families · 1 selected capabilities41.528/28 peersIndependent evidence39.487/87 peersIndependent evidence46.9198/198 peersIndependent evidence47.989/89 peersIndependent evidence25.2200/200 peersIndependent evidence43.641/41 peersIndependent evidence33.388/88 peersIndependent evidence53.6123/123 peersIndependent evidence55.1212/212 peersIndependent evidence22.537/37 peersIndependent evidence62.5208/208 peersIndependent evidence81.2178/178 peersIndependent evidence51.8114/114 peersIndependent evidence67.4198/198 peersIndependent evidence37.791/91 peersIndependent evidence75.6202/202 peersIndependent evidence55.6201/201 peersIndependent evidence
70Qwen3.5-35B-A3B · ReasoningQwen15.9Eligible · 100%12 published · 2 families · 1 selected capabilities80.4197/197 peersIndependent evidence67.1200/200 peersIndependent evidence74.463/63 peersIndependent evidence79.4212/212 peersIndependent evidence76.4208/208 peersIndependent evidence88.9178/178 peersIndependent evidence14.428/28 peersIndependent evidence73.5114/114 peersIndependent evidence54.1198/198 peersIndependent evidence83.6171/171 peersIndependent evidence70.1169/169 peersIndependent evidence
71GPT-5 Mini · HighOpenAI15.6Eligible · 100%25 published · 5 families · 1 selected capabilities30.187/87 peersIndependent evidence93.1108/108 peersIndependent evidence77.0197/197 peersIndependent evidence46.389/89 peersIndependent evidence25.3200/200 peersIndependent evidence51.188/88 peersIndependent evidence50.8123/123 peersIndependent evidence81.063/63 peersIndependent evidence71.7212/212 peersIndependent evidence74.4208/208 peersIndependent evidence92.0178/178 peersIndependent evidence94.9112/112 peersIndependent evidence87.0114/114 peersIndependent evidence63.7114/114 peersIndependent evidence69.5198/198 peersIndependent evidence31.591/91 peersIndependent evidence60.6202/202 peersIndependent evidence37.3201/201 peersIndependent evidence33.338/38 peersIndependent evidence37.23/3 peersIndependent evidence
72Qwen3.5-122B-A10B · ReasoningQwen15.5Eligible · 100%19 published · 5 families · 1 selected capabilities35.687/87 peersIndependent evidence87.7197/197 peersIndependent evidence45.389/89 peersIndependent evidence63.2200/200 peersIndependent evidence35.888/88 peersIndependent evidence56.9123/123 peersIndependent evidence86.263/63 peersIndependent evidence82.2212/212 peersIndependent evidence79.8208/208 peersIndependent evidence94.2178/178 peersIndependent evidence79.2114/114 peersIndependent evidence67.3198/198 peersIndependent evidence35.191/91 peersIndependent evidence74.5202/202 peersIndependent evidence53.2201/201 peersIndependent evidence
73Grok-4.3 · HighxAI15.3Eligible · 100%38 published · 13 families · 1 selected capabilities14.328/28 peersIndependent evidence52.187/87 peersIndependent evidence69.948/48 peersIndependent evidence45.126/26 peersIndependent evidence61.8198/198 peersIndependent evidence25.689/89 peersIndependent evidence86.4200/200 peersIndependent evidence8.441/41 peersIndependent evidence45.688/88 peersIndependent evidence61.8123/123 peersIndependent evidence75.5213/213 peersIndependent evidence25.350/50 peersIndependent evidence90.2208/208 peersIndependent evidence99.0178/178 peersIndependent evidence47.928/28 peersIndependent evidence17.531/31 peersIndependent evidence84.8114/114 peersIndependent evidence84.8198/198 peersIndependent evidence65.391/91 peersIndependent evidence73.7202/202 peersIndependent evidence26.4201/201 peersIndependent evidence73.550/50 peersIndependent evidence32.739/39 peersIndependent evidence17.925/25 peersIndependent evidence5.530/30 peersIndependent evidence13.433/33 peersIndependent evidence17.632/32 peersIndependent evidence5.132/32 peersIndependent evidence5.032/32 peersIndependent evidence
74MiniMax-M2.7 · ReasoningMiniMax15.0Eligible · 100%21 published · 8 families · 1 selected capabilities35.028/28 peersIndependent evidence49.287/87 peersIndependent evidence18.526/26 peersIndependent evidence62.1198/198 peersIndependent evidence41.589/89 peersIndependent evidence62.8200/200 peersIndependent evidence48.688/88 peersIndependent evidence69.3123/123 peersIndependent evidence84.7212/212 peersIndependent evidence84.4208/208 peersIndependent evidence93.6178/178 peersIndependent evidence26.328/28 peersIndependent evidence74.2198/198 peersIndependent evidence72.291/91 peersIndependent evidence59.7202/202 peersIndependent evidence60.9201/201 peersIndependent evidence
75MiMo-V2-Flash · Non-reasoningXiaomi14.4Eligible · 100%15 published · 2 families · 1 selected capabilities66.2108/108 peersIndependent evidence39.5197/197 peersIndependent evidence25.4200/200 peersIndependent evidence48.4123/123 peersIndependent evidence8.563/63 peersIndependent evidence35.8212/212 peersIndependent evidence48.4208/208 peersIndependent evidence42.5178/178 peersIndependent evidence40.0112/112 peersIndependent evidence43.8114/114 peersIndependent evidence30.7198/198 peersIndependent evidence75.7171/171 peersIndependent evidence71.6201/201 peersIndependent evidence

About this ranking

This profile gives agentic work all the weight. Published agent-task evaluations contribute through matched benchmark families. Harnesses and reported settings remain attached to the evidence. These results describe the evaluated configurations; they do not establish how a model will perform in every workflow.

View the Capability ranking →

Behind the ranking

273 entries with published results · 127 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:100,hard_reasoning:0,coding:0,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/rankings/agentic?page=3

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →