RankingTerminal-Bench 4.0

Terminal-Bench 4.0

Data updated 23 Sept 2026

Bucket
Coding
Unit
percent
Direction
Higher is better
Version
4.0
Display harness
Terminal-Bench 4.0 reported
Board
https://www.tbench.ai/

Compare published benchmark results with category weights →

Models

Results are ordered by score in the display harness, followed by models with no result. Other harnesses are listed separately below. Missing results remain unknown.

176–200 of 455 entries

ModelScoreEvidenceSource-recorded date
GLM-Z1-32B-0414Z.ai
GLM-Z1-9B-0414Z.ai
GLM-Z1-Rumination-32B-0414Z.ai
GPT-3.5-turboOpenAI
GPT-3.5-turbo-1106OpenAI
GPT-3.5-turbo-instructOpenAI
GPT-4OpenAI
GPT-4-turboOpenAI
GPT-4.1OpenAI
GPT-4.1 MiniOpenAI
GPT-4.1-nanoOpenAI
GPT-4oOpenAI
GPT-4o MiniOpenAI
GPT-5OpenAI
GPT-5 MiniOpenAI
GPT-5 NanoOpenAI
GPT-5 ProOpenAI
GPT-5.1OpenAI
GPT-5.2OpenAI
GPT-5.2 ProOpenAI
GPT-5.3 CodexOpenAI
GPT-5.3 Codex SparkOpenAI
GPT-5.4OpenAI
GPT-5.4 MiniOpenAI
GPT-5.4 NanoOpenAI