The leaders, at a glance

UnifyBench ranking

Compare AI models and measured effort settings across published benchmarks.

Strongest within your budget. Capability scores stay unchanged. A lower cost breaks exact score ties; no score-to-price ratio is used. Small score gaps do not establish superiority.

Token counts for price scenarios

Output includes reasoning. Fixed token counts compare prices; they do not measure task efficiency.

89 of 398 supported configurations have comparable costs. Unknown costs and over-budget entries remain visible without a Value rank. Prices collected 2026-09-11; comparisons expire after 30 days.

USD per weighted AA v4.3 task, including reasoning, cache treatment and reviewed fallback routing. This workload does not represent every task. Cost evidence currently comes from Artificial Analysis only. Cost frontier, components and gaps ↗ · Value methodology

Value leaders

Experimental comparison score · 0–100

For the selected profile and sources. Scores are experimental; small gaps may not be meaningful. How scoring works · Effort evidence collected

Explore all 109 sources Independent evaluations and lab reports

Distinct source pages with published results in the catalog. Multiple results and page sections count as one source.

Every ranked row is a measured configuration. The default view shows the highest-scoring supported configuration per model. In Value, the budget is applied first. Select All efforts for the full comparison. How effort ranking works.

Customize ranking
Adjust weights

Full ranking

215 entries

Value ranking of measured model configurations. Scores are experimental; missing results remain unknown.
RankModelCapabilityUSD / AA taskEvidence breadthanalyst-agentbriefcaseaimeapex-agentsaa-lcrautomationbenchcritptenterprise-opsgdp-pdfgdpvalgmmlugpqaharveyhleifbenchitbenchlivecodebenchmath500mmlu-prommmu-proomnisciencescicodetau-benchterminal-bencharc-agideepsweswe-bench-proarc-agi-3frontiercodeenigma-evalswe-atlas-qnaswe-atlas-refactoringswe-atlas-test-writinglivebench-mathlivebench-codinglivebench-languagelivebench-datamulti-swe-benchlivebench-reasoninglivebench-instructionsswe-rebenchepoch-game-puzzlesfrontiermathsimpleqavals-finance-agentvals-code-migrationvals-legal-researchvals-excel-modelingvibe-codechartographyosworldcharxivswe-bench-multilingualdeepsearchqaofficeqamcp-atlastoolathlonmrcrbrowsecomp
51Llama 4 Maverick · Non-reasoningMeta3.0$0.03974Within budgetPrice source ↗Single independent source24 published · 19 families · 6 task areas100% weight: Artificial AnalysisWhy this score?4.187/87 peersIndependent evidence18.6108/108 peersIndependent evidence36.3198/198 peersIndependent evidence7.989/89 peersIndependent evidence25.1200/200 peersIndependent evidence9.088/88 peersIndependent evidence4.6123/123 peersIndependent evidence59.763/63 peersIndependent evidence39.6212/212 peersIndependent evidence28.1208/208 peersIndependent evidence49.6178/178 peersIndependent evidence39.3112/112 peersIndependent evidence47.660/60 peersIndependent evidence70.7114/114 peersIndependent evidence42.6114/114 peersIndependent evidence68.7198/198 peersIndependent evidence15.791/91 peersIndependent evidence11.9202/202 peersIndependent evidence28.0201/201 peersIndependent evidence
52Ministral 3 14B · Non-reasoningMistral2.0$0.13923Within budgetPrice source ↗Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?17.887/87 peersIndependent evidence31.5108/108 peersIndependent evidence28.9197/197 peersIndependent evidence15.189/89 peersIndependent evidence25.2200/200 peersIndependent evidence18.688/88 peersIndependent evidence23.5123/123 peersIndependent evidence13.963/63 peersIndependent evidence25.1212/212 peersIndependent evidence24.1208/208 peersIndependent evidence20.6178/178 peersIndependent evidence33.9112/112 peersIndependent evidence29.9114/114 peersIndependent evidence19.8114/114 peersIndependent evidence19.9198/198 peersIndependent evidence6.691/91 peersIndependent evidence29.8202/202 peersIndependent evidence24.9201/201 peersIndependent evidence
53Llama-4-Scout-17B-16E-Instruct · Non-reasoningMeta1.6$0.11838Within budgetPrice source ↗Single independent source23 published · 19 families · 6 task areas100% weight: Artificial AnalysisWhy this score?4.187/87 peersIndependent evidence11.7108/108 peersIndependent evidence29.7197/197 peersIndependent evidence3.189/89 peersIndependent evidence25.1200/200 peersIndependent evidence2.188/88 peersIndependent evidence8.3123/123 peersIndependent evidence25.663/63 peersIndependent evidence27.9212/212 peersIndependent evidence9.2208/208 peersIndependent evidence40.0178/178 peersIndependent evidence25.6112/112 peersIndependent evidence34.560/60 peersIndependent evidence46.9114/114 peersIndependent evidence24.8114/114 peersIndependent evidence27.1198/198 peersIndependent evidence3.991/91 peersIndependent evidence8.7202/202 peersIndependent evidence15.4201/201 peersIndependent evidence
54Ministral 3 8B · Non-reasoningMistral1.5$0.06552Within budgetPrice source ↗Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?13.587/87 peersIndependent evidence34.7108/108 peersIndependent evidence27.9197/197 peersIndependent evidence13.289/89 peersIndependent evidence25.2200/200 peersIndependent evidence8.988/88 peersIndependent evidence21.3123/123 peersIndependent evidence10.563/63 peersIndependent evidence15.9212/212 peersIndependent evidence17.1208/208 peersIndependent evidence13.8178/178 peersIndependent evidence26.5112/112 peersIndependent evidence18.9114/114 peersIndependent evidence15.0114/114 peersIndependent evidence17.0198/198 peersIndependent evidence2.791/91 peersIndependent evidence20.2202/202 peersIndependent evidence21.3201/201 peersIndependent evidence
55Ministral 3 3B · Non-reasoningMistral1.2$0.04229Within budgetPrice source ↗Single independent source22 published · 18 families · 6 task areas100% weight: Artificial AnalysisWhy this score?10.787/87 peersIndependent evidence21.9108/108 peersIndependent evidence20.7197/197 peersIndependent evidence16.589/89 peersIndependent evidence25.2200/200 peersIndependent evidence2.088/88 peersIndependent evidence16.2123/123 peersIndependent evidence6.363/63 peersIndependent evidence8.2212/212 peersIndependent evidence34.0208/208 peersIndependent evidence9.0178/178 peersIndependent evidence17.1112/112 peersIndependent evidence9.7114/114 peersIndependent evidence5.9114/114 peersIndependent evidence8.2198/198 peersIndependent evidence0.091/91 peersIndependent evidence20.1202/202 peersIndependent evidence9.0201/201 peersIndependent evidence
GPT-5.5 Pro · XHighOpenAI65.5UnknownNo current, exact configuration price mapping in this collection.Independent corroboration4 published · 3 families · 1 task areas60% weight: ARC PrizeWhy this score?99.8200/200 peersIndependent evidence91.138/38 peersIndependent evidence92.239/39 peersIndependent evidence
GPT-5.5 · XHighOpenAI54.9UnknownNo current, exact configuration price mapping in this collection.Independent corroboration83 published · 47 families · 6 task areas23% weight: Moonshot AI (reported)Why this score?87.228/28 peersIndependent evidence74.687/87 peersIndependent evidence88.526/26 peersIndependent evidence84.9198/198 peersIndependent evidence36.089/89 peersIndependent evidence97.3200/200 peersIndependent evidence81.641/41 peersIndependent evidence91.188/88 peersIndependent evidence85.1123/123 peersIndependent evidence68.4212/212 peersIndependent evidence47.250/50 peersIndependent evidence15.1208/208 peersIndependent evidence93.6178/178 peersIndependent evidence85.728/28 peersIndependent evidence48.431/31 peersIndependent evidence42.5115/115 peersIndependent evidence98.2198/198 peersIndependent evidence89.091/91 peersIndependent evidence87.6202/202 peersIndependent evidence67.9201/201 peersIndependent evidence90.738/38 peersIndependent evidence66.025/25 peersIndependent evidence68.05/5 peersIndependent evidence50.02/2 peersIndependent evidence50.02/2 peersIndependent evidence0.02/2 peersIndependent evidence56.326/26 peersIndependent evidence80.826/26 peersIndependent evidence79.526/26 peersIndependent evidence79.526/26 peersIndependent evidence55.126/26 peersIndependent evidence65.926/26 peersIndependent evidence55.826/26 peersIndependent evidence100.06/6 peersIndependent evidence98.140/40 peersIndependent evidence82.039/39 peersIndependent evidence74.125/25 peersIndependent evidence40.030/30 peersIndependent evidence78.833/33 peersIndependent evidence59.432/32 peersIndependent evidence59.432/32 peersIndependent evidence43.832/32 peersIndependent evidence0.03/3 peersPublisher reports16.83/3 peersPublisher reports28.54/4 peersPublisher reports28.54/4 peersPublisher reports28.54/4 peersPublisher reports
Claude Opus 4.8 · MaxAnthropic51.5UnknownNo current, exact configuration price mapping in this collection.Independent corroboration78 published · 42 families · 6 task areas24% weight: Moonshot AI (reported)Why this score?74.628/28 peersIndependent evidence84.487/87 peersIndependent evidence0.01/1 peersIndependent evidence85.4198/198 peersIndependent evidence58.789/89 peersIndependent evidence95.3200/200 peersIndependent evidence70.041/41 peersIndependent evidence92.788/88 peersIndependent evidence89.0123/123 peersIndependent evidence25.5212/212 peersIndependent evidence82.750/50 peersIndependent evidence87.1208/208 peersIndependent evidence71.8178/178 peersIndependent evidence77.431/31 peersIndependent evidence0.03/3 peersPublisher reports92.3198/198 peersIndependent evidence84.691/91 peersIndependent evidence85.5202/202 peersIndependent evidence31.1201/201 peersIndependent evidence25.84/4 peersPublisher reports66.67/7 peersIndependent evidence74.826/26 peersIndependent evidence71.926/26 peersIndependent evidence40.326/26 peersIndependent evidence32.026/26 peersIndependent evidence46.226/26 peersIndependent evidence62.826/26 peersIndependent evidence61.726/26 peersIndependent evidence37.240/40 peersIndependent evidence77.739/39 peersIndependent evidence68.025/25 peersIndependent evidence57.230/30 peersIndependent evidence82.333/33 peersIndependent evidence76.232/32 peersIndependent evidence79.232/32 peersIndependent evidence87.132/32 peersIndependent evidence52.03/3 peersPublisher reports34.63/3 peersPublisher reports0.01/1 peersPublisher reports100.04/4 peersPublisher reports64.44/4 peersPublisher reports77.14/4 peersPublisher reports
Claude Opus 4.6 · MaxAnthropic42.0UnknownNo current, exact configuration price mapping in this collection.Independent corroboration22 published · 16 families · 6 task areas27% weight: Artificial AnalysisWhy this score?64.048/48 peersIndependent evidence85.226/26 peersIndependent evidence86.3197/197 peersIndependent evidence89.6200/200 peersIndependent evidence97.563/63 peersIndependent evidence73.1213/213 peersIndependent evidence89.5208/208 peersIndependent evidence64.6178/178 peersIndependent evidence77.8114/114 peersIndependent evidence93.4198/198 peersIndependent evidence87.1171/171 peersIndependent evidence95.7169/169 peersIndependent evidence81.538/38 peersIndependent evidence52.360/60 peersIndependent evidence52.239/39 peersIndependent evidence45.425/25 peersIndependent evidence
Muse Spark 1.1 · XHighMeta41.1UnknownNo current, exact configuration price mapping in this collection.Independent corroboration49 published · 28 families · 5 task areas26% weight: Artificial AnalysisWhy this score?55.687/87 peersIndependent evidence83.3197/197 peersIndependent evidence73.989/89 peersIndependent evidence89.1200/200 peersIndependent evidence75.288/88 peersIndependent evidence78.6123/123 peersIndependent evidence86.9212/212 peersIndependent evidence92.732/32 peersIndependent evidence96.4208/208 peersIndependent evidence62.731/31 peersIndependent evidence95.1198/198 peersIndependent evidence96.391/91 peersIndependent evidence80.3112/112 peersIndependent evidence59.8126/126 peersIndependent evidence37.625/25 peersIndependent evidence100.01/1 peersIndependent evidence31.426/26 peersIndependent evidence37.726/26 peersIndependent evidence26.226/26 peersIndependent evidence49.126/26 peersIndependent evidence76.326/26 peersIndependent evidence53.026/26 peersIndependent evidence55.026/26 peersIndependent evidence76.830/30 peersIndependent evidence39.733/33 peersIndependent evidence43.232/32 peersIndependent evidence37.632/32 peersIndependent evidence55.232/32 peersIndependent evidence
Gemini 3.5 Flash · HighGoogle39.8UnknownNo current, exact configuration price mapping in this collection.Independent corroboration65 published · 38 families · 6 task areas15% weight: DatacurveWhy this score?71.628/28 peersIndependent evidence57.687/87 peersIndependent evidence100.026/26 peersIndependent evidence71.4198/198 peersIndependent evidence75.089/89 peersIndependent evidence88.4200/200 peersIndependent evidence95.141/41 peersIndependent evidence86.488/88 peersIndependent evidence75.9123/123 peersIndependent evidence92.9212/212 peersIndependent evidence35.450/50 peersIndependent evidence94.4208/208 peersIndependent evidence94.6178/178 peersIndependent evidence76.228/28 peersIndependent evidence74.031/31 peersIndependent evidence97.4114/114 peersIndependent evidence94.5198/198 peersIndependent evidence80.991/91 peersIndependent evidence85.7202/202 peersIndependent evidence70.7201/201 peersIndependent evidence78.738/38 peersIndependent evidence13.125/25 peersIndependent evidence15.34/4 peersIndependent evidence45.026/26 peersIndependent evidence41.426/26 peersIndependent evidence72.526/26 peersIndependent evidence32.626/26 peersIndependent evidence35.526/26 peersIndependent evidence29.826/26 peersIndependent evidence72.126/26 peersIndependent evidence83.140/40 peersIndependent evidence46.839/39 peersIndependent evidence82.925/25 peersIndependent evidence83.430/30 peersIndependent evidence27.933/33 peersIndependent evidence28.832/32 peersIndependent evidence53.932/32 peersIndependent evidence25.632/32 peersIndependent evidence
GPT-5.4 · XHighOpenAI38.3UnknownNo current, exact configuration price mapping in this collection.Independent corroboration50 published · 29 families · 6 task areas16% weight: DatacurveWhy this score?84.726/26 peersIndependent evidence96.6197/197 peersIndependent evidence96.3200/200 peersIndependent evidence81.0123/123 peersIndependent evidence93.0212/212 peersIndependent evidence9.832/32 peersIndependent evidence96.2208/208 peersIndependent evidence90.1178/178 peersIndependent evidence47.831/31 peersIndependent evidence83.6114/114 peersIndependent evidence94.7198/198 peersIndependent evidence84.9202/202 peersIndependent evidence16.9201/201 peersIndependent evidence82.838/38 peersIndependent evidence32.025/25 peersIndependent evidence100.02/2 peersIndependent evidence0.02/2 peersIndependent evidence0.02/2 peersIndependent evidence25.03/3 peersIndependent evidence49.026/26 peersIndependent evidence42.526/26 peersIndependent evidence62.026/26 peersIndependent evidence73.926/26 peersIndependent evidence55.626/26 peersIndependent evidence55.926/26 peersIndependent evidence53.026/26 peersIndependent evidence49.333/33 peersIndependent evidence45.932/32 peersIndependent evidence100.02/2 peersPublisher reports
Claude Opus 4.7 · XHighAnthropic38.2UnknownNo current, exact configuration price mapping in this collection.Independent corroboration29 published · 9 families · 4 task areas46% weight: CognitionWhy this score?35.57/7 peersIndependent evidence63.926/26 peersIndependent evidence70.326/26 peersIndependent evidence29.026/26 peersIndependent evidence54.326/26 peersIndependent evidence40.626/26 peersIndependent evidence59.426/26 peersIndependent evidence46.626/26 peersIndependent evidence70.425/25 peersIndependent evidence
Qwen3.7-max · ReasoningQwen31.4UnknownNo current, exact configuration price mapping in this collection.Single independent source21 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?59.028/28 peersIndependent evidence65.987/87 peersIndependent evidence90.4197/197 peersIndependent evidence67.089/89 peersIndependent evidence91.0200/200 peersIndependent evidence88.341/41 peersIndependent evidence56.188/88 peersIndependent evidence79.7123/123 peersIndependent evidence94.7212/212 peersIndependent evidence61.537/37 peersIndependent evidence93.1208/208 peersIndependent evidence98.4178/178 peersIndependent evidence94.328/28 peersIndependent evidence80.5198/198 peersIndependent evidence70.491/91 peersIndependent evidence71.3202/202 peersIndependent evidence82.4201/201 peersIndependent evidence
GPT-5.2 · XHighOpenAI31.2UnknownNo current, exact configuration price mapping in this collection.Independent corroboration15 published · 13 families · 5 task areas37% weight: Artificial AnalysisWhy this score?100.0108/108 peersIndependent evidence97.9197/197 peersIndependent evidence90.7200/200 peersIndependent evidence91.8212/212 peersIndependent evidence91.6208/208 peersIndependent evidence92.9178/178 peersIndependent evidence98.1112/112 peersIndependent evidence96.6114/114 peersIndependent evidence92.5198/198 peersIndependent evidence77.9171/171 peersIndependent evidence97.0169/169 peersIndependent evidence65.638/38 peersIndependent evidence92.63/3 peersIndependent evidence
Gemini 3 Flash Preview · ReasoningGoogle30.5UnknownNo current, exact configuration price mapping in this collection.Single independent source17 published · 14 families · 6 task areas100% weight: Artificial AnalysisWhy this score?99.7108/108 peersIndependent evidence76.226/26 peersIndependent evidence79.2198/198 peersIndependent evidence88.5200/200 peersIndependent evidence98.563/63 peersIndependent evidence92.0212/212 peersIndependent evidence91.6208/208 peersIndependent evidence96.7178/178 peersIndependent evidence100.0112/112 peersIndependent evidence99.4114/114 peersIndependent evidence93.3114/114 peersIndependent evidence97.3198/198 peersIndependent evidence70.2202/202 peersIndependent evidence90.9169/169 peersIndependent evidence
Claude Opus 4.5 · Thinking 64KAnthropic29.3UnknownNo current, exact configuration price mapping in this collection.Single independent source23 published · 7 families · 4 task areas100% weight: LiveBenchWhy this score?49.926/26 peersIndependent evidence62.126/26 peersIndependent evidence53.926/26 peersIndependent evidence38.026/26 peersIndependent evidence7.526/26 peersIndependent evidence20.826/26 peersIndependent evidence22.726/26 peersIndependent evidence
GLM-5.2 · MaxZ.ai29.1UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Independent corroboration40 published · 28 families · 5 task areas26% weight: Artificial AnalysisWhy this score?78.487/87 peersIndependent evidence71.148/48 peersIndependent evidence88.726/26 peersIndependent evidence61.5198/198 peersIndependent evidence22.189/89 peersIndependent evidence95.5200/200 peersIndependent evidence66.641/41 peersIndependent evidence57.688/88 peersIndependent evidence86.2123/123 peersIndependent evidence65.7213/213 peersIndependent evidence72.150/50 peersIndependent evidence92.3208/208 peersIndependent evidence89.2178/178 peersIndependent evidence87.728/28 peersIndependent evidence64.3198/198 peersIndependent evidence74.191/91 peersIndependent evidence91.6202/202 peersIndependent evidence54.0201/201 peersIndependent evidence15.325/25 peersIndependent evidence73.050/50 peersIndependent evidence57.539/39 peersIndependent evidence28.225/25 peersIndependent evidence58.833/33 peersIndependent evidence41.132/32 peersIndependent evidence39.232/32 peersIndependent evidence0.04/4 peersPublisher reports0.04/4 peersPublisher reports0.04/4 peersPublisher reports
Kimi-K2.6 · ReasoningMoonshot28.8UnknownNo current, exact configuration price mapping in this collection.Single independent source25 published · 20 families · 6 task areas75% weight: Artificial AnalysisWhy this score?55.787/87 peersIndependent evidence83.426/26 peersIndependent evidence96.7197/197 peersIndependent evidence55.589/89 peersIndependent evidence87.7200/200 peersIndependent evidence49.641/41 peersIndependent evidence73.788/88 peersIndependent evidence74.4123/123 peersIndependent evidence93.5212/212 peersIndependent evidence66.037/37 peersIndependent evidence91.8208/208 peersIndependent evidence94.9178/178 peersIndependent evidence45.528/28 peersIndependent evidence40.6114/114 peersIndependent evidence83.3198/198 peersIndependent evidence79.791/91 peersIndependent evidence84.8202/202 peersIndependent evidence94.5201/201 peersIndependent evidence50.02/2 peersPublisher reports0.01/1 peersPublisher reports
DeepSeek V4 Flash 0424 · MaxDeepSeek25.7UnknownNo current, exact configuration price mapping in this collection.Single independent source22 published · 17 families · 5 task areas100% weight: Artificial AnalysisWhy this score?78.128/28 peersIndependent evidence52.587/87 peersIndependent evidence77.1198/198 peersIndependent evidence68.589/89 peersIndependent evidence86.9200/200 peersIndependent evidence53.841/41 peersIndependent evidence60.388/88 peersIndependent evidence74.5123/123 peersIndependent evidence90.8212/212 peersIndependent evidence41.437/37 peersIndependent evidence90.1208/208 peersIndependent evidence97.8178/178 peersIndependent evidence51.128/28 peersIndependent evidence86.6198/198 peersIndependent evidence54.891/91 peersIndependent evidence86.4202/202 peersIndependent evidence75.7201/201 peersIndependent evidence
Agnes 2.5 Pro Alpha · ReasoningAgnes AI25.2UnknownCacheable input present without a measured cache-hit rate.Price source ↗Single independent source14 published · 12 families · 5 task areas100% weight: Artificial AnalysisWhy this score?78.187/87 peersIndependent evidence85.4197/197 peersIndependent evidence76.089/89 peersIndependent evidence89.8200/200 peersIndependent evidence55.488/88 peersIndependent evidence70.0123/123 peersIndependent evidence86.3212/212 peersIndependent evidence88.2208/208 peersIndependent evidence84.3198/198 peersIndependent evidence46.491/91 peersIndependent evidence44.5112/112 peersIndependent evidence74.6125/125 peersIndependent evidence
GLM-5.1 · ReasoningZ.ai24.3UnknownNo current, exact configuration price mapping in this collection.Single independent source18 published · 14 families · 5 task areas100% weight: Artificial AnalysisWhy this score?69.887/87 peersIndependent evidence83.1197/197 peersIndependent evidence62.989/89 peersIndependent evidence82.6200/200 peersIndependent evidence53.388/88 peersIndependent evidence77.5123/123 peersIndependent evidence85.9212/212 peersIndependent evidence86.9208/208 peersIndependent evidence95.2178/178 peersIndependent evidence88.028/28 peersIndependent evidence65.9198/198 peersIndependent evidence54.691/91 peersIndependent evidence76.3202/202 peersIndependent evidence77.4201/201 peersIndependent evidence
Qwen3.6-plus · ReasoningQwen24.0UnknownNo current, exact configuration price mapping in this collection.Single independent source13 published · 10 families · 6 task areas100% weight: Artificial AnalysisWhy this score?90.8197/197 peersIndependent evidence78.0200/200 peersIndependent evidence66.2123/123 peersIndependent evidence87.6212/212 peersIndependent evidence81.9208/208 peersIndependent evidence92.2178/178 peersIndependent evidence85.9114/114 peersIndependent evidence74.1198/198 peersIndependent evidence83.6202/202 peersIndependent evidence84.6201/201 peersIndependent evidence
Claude Sonnet 4.6 · MaxAnthropic23.2UnknownNo current, exact configuration price mapping in this collection.Independent corroboration39 published · 30 families · 6 task areas22% weight: CognitionWhy this score?45.828/28 peersIndependent evidence70.687/87 peersIndependent evidence47.348/48 peersIndependent evidence61.226/26 peersIndependent evidence85.0198/198 peersIndependent evidence57.389/89 peersIndependent evidence75.5200/200 peersIndependent evidence78.488/88 peersIndependent evidence78.1123/123 peersIndependent evidence91.563/63 peersIndependent evidence47.9213/213 peersIndependent evidence51.950/50 peersIndependent evidence83.2208/208 peersIndependent evidence64.9178/178 peersIndependent evidence68.628/28 peersIndependent evidence38.931/31 peersIndependent evidence68.9114/114 peersIndependent evidence86.6198/198 peersIndependent evidence65.191/91 peersIndependent evidence73.8202/202 peersIndependent evidence44.9201/201 peersIndependent evidence64.138/38 peersIndependent evidence9.77/7 peersIndependent evidence27.750/50 peersIndependent evidence9.425/25 peersIndependent evidence37.330/30 peersIndependent evidence60.833/33 peersIndependent evidence49.932/32 peersIndependent evidence48.632/32 peersIndependent evidence31.332/32 peersIndependent evidence
GPT-5.3 Codex · XHighOpenAI23.0UnknownIncomplete AA v4.3 workload usage; missing families are not imputed.Price source ↗Independent corroboration12 published · 11 families · 6 task areas81% weight: Artificial AnalysisWhy this score?59.587/87 peersIndependent evidence99.2197/197 peersIndependent evidence92.6200/200 peersIndependent evidence92.6212/212 peersIndependent evidence95.2208/208 peersIndependent evidence91.7178/178 peersIndependent evidence85.0114/114 peersIndependent evidence96.0198/198 peersIndependent evidence79.2171/171 peersIndependent evidence98.5169/169 peersIndependent evidence0.03/3 peersIndependent evidence

Behind the ranking

273 entries with published results · 55 ranked · 167 unranked in Value.

Explore seven capabilities, the original results, and gaps in the evidence.

Cite this ranking

Include the model and effort setting, the selected profile, and the dated data downloads. A shared link uses the latest data; it does not freeze a ranking in time.

UnifyBench ranking
Data updated: 12 Sept 2026
Mode: value; evidence: documented; configurations: best
Pricing collected: 11 Sept 2026
Cost basis: measured; budget: unlimited USD; input: 1000; output: 1000
https://unifybench.ai/?mode=value&page=3

Catalog data · Effort measurements · Configuration scoring rules · Methodology

Catalog dated 12 Sept 2026. Effort evidence collected 12 Sept 2026. Collection dates are not evaluation dates.

What does the score mean?

The adjusted comparison score estimates performance against the same reference panel from matched published comparisons. Capability pools matched comparisons across families and checks aggregate breadth and independent corroboration. Custom profiles require support in every selected capability. Missing results never count as losses.

Family details show observed win shares against available reference peers. Those descriptive values are supporting evidence, not adjusted capability scores. Provider reports and independent results remain labeled. Matching reported settings do not establish equal inference effort, and score differences do not establish statistical significance.

Read the full methodology →