The leaders, at a glance

Agentic AI model ranking

Compare AI models and effort settings for agentic work using sourced task evaluations and visible evidence coverage.

Agentic leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

127 entries

Custom capability ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelScoreCapability coverageanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
101Qwen3.5-0.8B · Non-reasoningQwen5.2Eligible · 100%12 published · 2 families · 1 selected capabilities14.2197/197 peersIndependent evidence25.1200/200 peersIndependent evidence2.1123/123 peersIndependent evidence1.8212/212 peersIndependent evidence30.3208/208 peersIndependent evidence4.0178/178 peersIndependent evidence1.5114/114 peersIndependent evidence1.3198/198 peersIndependent evidence61.9171/171 peersIndependent evidence3.2201/201 peersIndependent evidence
102Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 · ReasoningNVIDIA5.0Eligible · 100%12 published · 2 families · 1 selected capabilities41.1197/197 peersIndependent evidence25.3200/200 peersIndependent evidence21.9123/123 peersIndependent evidence15.5212/212 peersIndependent evidence26.3208/208 peersIndependent evidence75.7178/178 peersIndependent evidence25.9114/114 peersIndependent evidence27.9198/198 peersIndependent evidence53.9171/171 peersIndependent evidence34.4201/201 peersIndependent evidence
103Magistral Medium 1.2 · ReasoningMistral5.0Eligible · 100%17 published · 2 families · 1 selected capabilities79.9108/108 peersIndependent evidence53.0197/197 peersIndependent evidence56.1200/200 peersIndependent evidence19.6123/123 peersIndependent evidence51.763/63 peersIndependent evidence52.9212/212 peersIndependent evidence52.8208/208 peersIndependent evidence50.0178/178 peersIndependent evidence83.2112/112 peersIndependent evidence73.6114/114 peersIndependent evidence37.5114/114 peersIndependent evidence56.7198/198 peersIndependent evidence39.8202/202 peersIndependent evidence40.5201/201 peersIndependent evidence
104NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 · ReasoningNVIDIA4.6Eligible · 100%20 published · 5 families · 1 selected capabilities14.587/87 peersIndependent evidence93.8108/108 peersIndependent evidence40.3197/197 peersIndependent evidence23.589/89 peersIndependent evidence66.6200/200 peersIndependent evidence12.588/88 peersIndependent evidence23.4123/123 peersIndependent evidence57.7212/212 peersIndependent evidence58.2208/208 peersIndependent evidence84.6178/178 peersIndependent evidence83.1112/112 peersIndependent evidence61.9114/114 peersIndependent evidence41.7198/198 peersIndependent evidence12.691/91 peersIndependent evidence36.2202/202 peersIndependent evidence32.4201/201 peersIndependent evidence
105o3-mini · HighOpenAI4.5Eligible · 100%22 published · 5 families · 1 selected capabilities18.287/87 peersIndependent evidence41.0197/197 peersIndependent evidence14.289/89 peersIndependent evidence53.6200/200 peersIndependent evidence25.188/88 peersIndependent evidence21.2123/123 peersIndependent evidence59.4212/212 peersIndependent evidence6.2208/208 peersIndependent evidence77.9178/178 peersIndependent evidence78.9112/112 peersIndependent evidence96.060/60 peersIndependent evidence64.9114/114 peersIndependent evidence56.5198/198 peersIndependent evidence43.291/91 peersIndependent evidence26.0202/202 peersIndependent evidence23.2201/201 peersIndependent evidence25.438/38 peersIndependent evidence
106Mistral Small 4 · ReasoningMistral4.4Eligible · 100%19 published · 6 families · 1 selected capabilities0.028/28 peersIndependent evidence22.687/87 peersIndependent evidence51.1197/197 peersIndependent evidence20.589/89 peersIndependent evidence55.8200/200 peersIndependent evidence1.888/88 peersIndependent evidence30.1123/123 peersIndependent evidence61.1212/212 peersIndependent evidence51.4208/208 peersIndependent evidence58.8178/178 peersIndependent evidence32.6114/114 peersIndependent evidence60.4198/198 peersIndependent evidence31.691/91 peersIndependent evidence31.6202/202 peersIndependent evidence38.9201/201 peersIndependent evidence
107Qwen3-Next-80B-A3B-Thinking · ReasoningQwen4.4Eligible · 100%16 published · 2 families · 1 selected capabilities85.1108/108 peersIndependent evidence63.7197/197 peersIndependent evidence25.5200/200 peersIndependent evidence18.5123/123 peersIndependent evidence57.063/63 peersIndependent evidence57.7212/212 peersIndependent evidence60.2208/208 peersIndependent evidence72.5178/178 peersIndependent evidence88.8112/112 peersIndependent evidence81.1114/114 peersIndependent evidence49.9198/198 peersIndependent evidence37.9202/202 peersIndependent evidence34.5201/201 peersIndependent evidence
108Ministral 3 14B · Non-reasoningMistral4.3Eligible · 100%22 published · 5 families · 1 selected capabilities17.887/87 peersIndependent evidence31.5108/108 peersIndependent evidence28.9197/197 peersIndependent evidence15.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.688/88 peersIndependent evidence23.5123/123 peersIndependent evidence13.963/63 peersIndependent evidence25.1212/212 peersIndependent evidence24.1208/208 peersIndependent evidence20.6178/178 peersIndependent evidence33.9112/112 peersIndependent evidence29.9114/114 peersIndependent evidence19.8114/114 peersIndependent evidence19.9198/198 peersIndependent evidence6.691/91 peersIndependent evidence29.8202/202 peersIndependent evidence24.9201/201 peersIndependent evidence
109gpt-oss-20b · HighOpenAI4.3Eligible · 100%26 published · 6 families · 1 selected capabilities4.287/87 peersIndependent evidence44.2150/150 peersIndependent evidence0.026/26 peersIndependent evidence23.5198/198 peersIndependent evidence3.189/89 peersIndependent evidence72.2200/200 peersIndependent evidence25.988/88 peersIndependent evidence27.5123/123 peersIndependent evidence27.363/63 peersIndependent evidence17.9213/213 peersIndependent evidence55.5208/208 peersIndependent evidence76.8178/178 peersIndependent evidence87.6112/112 peersIndependent evidence44.3114/114 peersIndependent evidence31.5198/198 peersIndependent evidence31.491/91 peersIndependent evidence44.6202/202 peersIndependent evidence33.2201/201 peersIndependent evidence7.850/50 peersIndependent evidence
110Qwen3-32B · ReasoningQwen4.1Eligible · 100%21 published · 5 families · 1 selected capabilities9.287/87 peersIndependent evidence71.3108/108 peersIndependent evidence5.8197/197 peersIndependent evidence22.489/89 peersIndependent evidence55.7200/200 peersIndependent evidence25.388/88 peersIndependent evidence17.0123/123 peersIndependent evidence39.0212/212 peersIndependent evidence43.4208/208 peersIndependent evidence31.4178/178 peersIndependent evidence58.3112/112 peersIndependent evidence74.460/60 peersIndependent evidence63.8114/114 peersIndependent evidence42.3198/198 peersIndependent evidence23.891/91 peersIndependent evidence27.6202/202 peersIndependent evidence19.9201/201 peersIndependent evidence
111Qwen3-30B-A3B-Thinking-2507 · ReasoningQwen3.2Eligible · 100%21 published · 5 families · 1 selected capabilities12.087/87 peersIndependent evidence56.9108/108 peersIndependent evidence60.3197/197 peersIndependent evidence17.589/89 peersIndependent evidence55.7200/200 peersIndependent evidence6.788/88 peersIndependent evidence18.0123/123 peersIndependent evidence46.1212/212 peersIndependent evidence52.3208/208 peersIndependent evidence61.6178/178 peersIndependent evidence74.8112/112 peersIndependent evidence85.560/60 peersIndependent evidence65.9114/114 peersIndependent evidence34.5198/198 peersIndependent evidence22.191/91 peersIndependent evidence26.1202/202 peersIndependent evidence20.3201/201 peersIndependent evidence
112Ministral 3 8B · Non-reasoningMistral3.0Eligible · 100%22 published · 5 families · 1 selected capabilities13.587/87 peersIndependent evidence34.7108/108 peersIndependent evidence27.9197/197 peersIndependent evidence13.289/89 peersIndependent evidence25.2200/200 peersIndependent evidence8.988/88 peersIndependent evidence21.3123/123 peersIndependent evidence10.563/63 peersIndependent evidence15.9212/212 peersIndependent evidence17.1208/208 peersIndependent evidence13.8178/178 peersIndependent evidence26.5112/112 peersIndependent evidence18.9114/114 peersIndependent evidence15.0114/114 peersIndependent evidence17.0198/198 peersIndependent evidence2.791/91 peersIndependent evidence20.2202/202 peersIndependent evidence21.3201/201 peersIndependent evidence
113Qwen3-14B · ReasoningQwen2.8Eligible · 100%21 published · 5 families · 1 selected capabilities3.987/87 peersIndependent evidence54.8108/108 peersIndependent evidence5.8197/197 peersIndependent evidence3.089/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.388/88 peersIndependent evidence12.4123/123 peersIndependent evidence29.7212/212 peersIndependent evidence20.1208/208 peersIndependent evidence43.7178/178 peersIndependent evidence56.3112/112 peersIndependent evidence75.660/60 peersIndependent evidence53.4114/114 peersIndependent evidence28.2198/198 peersIndependent evidence14.291/91 peersIndependent evidence31.9202/202 peersIndependent evidence21.2201/201 peersIndependent evidence
114Qwen3-8B · ReasoningQwen2.8Eligible · 100%21 published · 5 families · 1 selected capabilities3.987/87 peersIndependent evidence17.4108/108 peersIndependent evidence5.8197/197 peersIndependent evidence10.389/89 peersIndependent evidence25.2200/200 peersIndependent evidence22.588/88 peersIndependent evidence10.0123/123 peersIndependent evidence28.9212/212 peersIndependent evidence11.0208/208 peersIndependent evidence26.5178/178 peersIndependent evidence41.8112/112 peersIndependent evidence51.560/60 peersIndependent evidence42.0114/114 peersIndependent evidence20.4198/198 peersIndependent evidence10.391/91 peersIndependent evidence22.4202/202 peersIndependent evidence16.4201/201 peersIndependent evidence
115Ministral 3 3B · Non-reasoningMistral2.7Eligible · 100%22 published · 5 families · 1 selected capabilities10.787/87 peersIndependent evidence21.9108/108 peersIndependent evidence20.7197/197 peersIndependent evidence16.589/89 peersIndependent evidence25.2200/200 peersIndependent evidence2.088/88 peersIndependent evidence16.2123/123 peersIndependent evidence6.363/63 peersIndependent evidence8.2212/212 peersIndependent evidence34.0208/208 peersIndependent evidence9.0178/178 peersIndependent evidence17.1112/112 peersIndependent evidence9.7114/114 peersIndependent evidence5.9114/114 peersIndependent evidence8.2198/198 peersIndependent evidence0.091/91 peersIndependent evidence20.1202/202 peersIndependent evidence9.0201/201 peersIndependent evidence
116Magistral Small 1.2 · ReasoningMistral2.4Eligible · 100%18 published · 3 families · 1 selected capabilities77.8108/108 peersIndependent evidence22.4197/197 peersIndependent evidence2.889/89 peersIndependent evidence55.9200/200 peersIndependent evidence15.1123/123 peersIndependent evidence28.363/63 peersIndependent evidence36.2212/212 peersIndependent evidence39.2208/208 peersIndependent evidence53.2178/178 peersIndependent evidence78.0112/112 peersIndependent evidence52.5114/114 peersIndependent evidence29.7114/114 peersIndependent evidence19.5198/198 peersIndependent evidence22.3202/202 peersIndependent evidence21.2201/201 peersIndependent evidence
117GPT-4o Mini · Non-reasoningOpenAI2.4Eligible · 100%12 published · 2 families · 1 selected capabilities13.6108/108 peersIndependent evidence2.657/57 peersIndependent evidence13.1123/123 peersIndependent evidence11.8212/212 peersIndependent evidence16.0208/208 peersIndependent evidence15.9178/178 peersIndependent evidence16.2112/112 peersIndependent evidence29.060/60 peersIndependent evidence20.2114/114 peersIndependent evidence7.4114/114 peersIndependent evidence3.4112/112 peersIndependent evidence17.1125/125 peersIndependent evidence
118Mistral Small 3.2 · Non-reasoningMistral2.3Eligible · 100%23 published · 5 families · 1 selected capabilities4.187/87 peersIndependent evidence28.4108/108 peersIndependent evidence23.6197/197 peersIndependent evidence9.389/89 peersIndependent evidence25.1200/200 peersIndependent evidence2.188/88 peersIndependent evidence6.5123/123 peersIndependent evidence21.463/63 peersIndependent evidence18.8212/212 peersIndependent evidence18.2208/208 peersIndependent evidence26.2178/178 peersIndependent evidence21.6112/112 peersIndependent evidence45.060/60 peersIndependent evidence25.5114/114 peersIndependent evidence17.2114/114 peersIndependent evidence25.0198/198 peersIndependent evidence11.891/91 peersIndependent evidence31.3202/202 peersIndependent evidence26.7201/201 peersIndependent evidence
119NVIDIA-Nemotron-3-Nano-4B-BF16 · ReasoningNVIDIA2.2Eligible · 100%11 published · 2 families · 1 selected capabilities27.6197/197 peersIndependent evidence25.2200/200 peersIndependent evidence8.9123/123 peersIndependent evidence20.4212/212 peersIndependent evidence27.1208/208 peersIndependent evidence70.2178/178 peersIndependent evidence9.6198/198 peersIndependent evidence34.9171/171 peersIndependent evidence27.5201/201 peersIndependent evidence
120Llama 4 Maverick · Non-reasoningMeta1.8Eligible · 100%24 published · 5 families · 1 selected capabilities4.187/87 peersIndependent evidence18.6108/108 peersIndependent evidence36.3198/198 peersIndependent evidence7.989/89 peersIndependent evidence25.1200/200 peersIndependent evidence9.088/88 peersIndependent evidence4.6123/123 peersIndependent evidence59.763/63 peersIndependent evidence39.6212/212 peersIndependent evidence28.1208/208 peersIndependent evidence49.6178/178 peersIndependent evidence39.3112/112 peersIndependent evidence47.660/60 peersIndependent evidence70.7114/114 peersIndependent evidence42.6114/114 peersIndependent evidence68.7198/198 peersIndependent evidence15.791/91 peersIndependent evidence11.9202/202 peersIndependent evidence28.0201/201 peersIndependent evidence
121Gemma 4 E4B IT · ReasoningGoogle1.5Eligible · 100%12 published · 2 families · 1 selected capabilities33.8197/197 peersIndependent evidence63.1200/200 peersIndependent evidence11.5123/123 peersIndependent evidence26.9212/212 peersIndependent evidence8.9208/208 peersIndependent evidence51.1178/178 peersIndependent evidence22.1114/114 peersIndependent evidence8.0198/198 peersIndependent evidence20.0171/171 peersIndependent evidence28.2201/201 peersIndependent evidence
122Llama-4-Scout-17B-16E-Instruct · Non-reasoningMeta1.5Eligible · 100%23 published · 5 families · 1 selected capabilities4.187/87 peersIndependent evidence11.7108/108 peersIndependent evidence29.7197/197 peersIndependent evidence3.189/89 peersIndependent evidence25.1200/200 peersIndependent evidence2.188/88 peersIndependent evidence8.3123/123 peersIndependent evidence25.663/63 peersIndependent evidence27.9212/212 peersIndependent evidence9.2208/208 peersIndependent evidence40.0178/178 peersIndependent evidence25.6112/112 peersIndependent evidence34.560/60 peersIndependent evidence46.9114/114 peersIndependent evidence24.8114/114 peersIndependent evidence27.1198/198 peersIndependent evidence3.991/91 peersIndependent evidence8.7202/202 peersIndependent evidence15.4201/201 peersIndependent evidence
123Gemma 3 12B IT · Non-reasoningGoogle1.4Eligible · 100%22 published · 4 families · 1 selected capabilities17.2108/108 peersIndependent evidence13.4197/197 peersIndependent evidence3.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence13.088/88 peersIndependent evidence1.9123/123 peersIndependent evidence17.363/63 peersIndependent evidence7.0212/212 peersIndependent evidence16.2208/208 peersIndependent evidence33.1178/178 peersIndependent evidence8.1112/112 peersIndependent evidence39.760/60 peersIndependent evidence17.1114/114 peersIndependent evidence4.0114/114 peersIndependent evidence11.1198/198 peersIndependent evidence1.391/91 peersIndependent evidence5.9202/202 peersIndependent evidence10.7201/201 peersIndependent evidence
124Gemma 4 E2B IT · ReasoningGoogle1.3Eligible · 100%12 published · 2 families · 1 selected capabilities20.4197/197 peersIndependent evidence25.1200/200 peersIndependent evidence7.0123/123 peersIndependent evidence13.4212/212 peersIndependent evidence25.0208/208 peersIndependent evidence34.7178/178 peersIndependent evidence13.4114/114 peersIndependent evidence3.8198/198 peersIndependent evidence20.0171/171 peersIndependent evidence12.8201/201 peersIndependent evidence
125GPT-4.1-nano · Non-reasoningOpenAI1.3Eligible · 100%17 published · 2 families · 1 selected capabilities24.7108/108 peersIndependent evidence24.3197/197 peersIndependent evidence25.4200/200 peersIndependent evidence5.4123/123 peersIndependent evidence19.7212/212 peersIndependent evidence8.2208/208 peersIndependent evidence20.8178/178 peersIndependent evidence29.9112/112 peersIndependent evidence37.160/60 peersIndependent evidence21.7114/114 peersIndependent evidence6.7114/114 peersIndependent evidence21.2198/198 peersIndependent evidence10.7202/202 peersIndependent evidence17.8201/201 peersIndependent evidence

About this ranking

This profile gives agentic work all the weight. Published agent-task evaluations contribute through matched benchmark families. Harnesses and reported settings remain attached to the evidence. These results describe the evaluated configurations; they do not establish how a model will perform in every workflow.

View the Capability ranking →

Behind the ranking

273 entries with published results · 127 ranked · 0 provisional estimates.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: custom; evidence: documented; configurations: best
Weights: v3;agentic:100,hard_reasoning:0,coding:0,human_pref:0,knowledge:0,multimodal:0,long_context:0
https://unifybench.ai/rankings/agentic?page=5

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →