RankingTerminal-Bench 2.1
Terminal-Bench 2.1
- Bucket
- Coding
- Unit
- percent
- Direction
- Higher is better
- Version
- 2.1
- Display harness
- Terminal-Bench 2.1 reported
- Board
- https://www.tbench.ai/?version=2.1
Compare published benchmark results with category weights →
Models
Other harnesses
These runs use other harnesses. Capability scoring matches configurations separately; model details identify which source records contribute.
| Model | Score | Harness | Evidence | Source-recorded date |
|---|---|---|---|---|
| GPT-5.6 SolOpenAI | 91.9% | Codex ultra | lab self-report | 2026-07-09 |