RankingAutomationBench-AA
AutomationBench-AA
- Bucket
- Supporting evidence
- Unit
- percent
- Direction
- Higher is better
- Version
- aa-score
- Display harness
- Artificial Analysis AutomationBench-AA
- Board
- https://artificialanalysis.ai/evaluations/automationbench-aa
AutomationBench-AA score: share of task objectives completed with no guardrail violation, on Artificial Analysis's private 657-task holdout. This is not Zapier's tasks-completed rate. The effort dataset already includes this evaluation in the agentic family under the existing equal-family budget. These rows are the board, not a second weight.
Compare published benchmark results with category weights →
Models
201–225 of 455 entries
| Model | Score | Evidence | Source-recorded date |
|---|---|---|---|
| glm-edge-v-5bZ.ai | — | — | — |
| GLM-Z1-32B-0414Z.ai | — | — | — |
| GLM-Z1-9B-0414Z.ai | — | — | — |
| GLM-Z1-Rumination-32B-0414Z.ai | — | — | — |
| GPT-3.5-turboOpenAI | — | — | — |
| GPT-3.5-turbo-1106OpenAI | — | — | — |
| GPT-3.5-turbo-instructOpenAI | — | — | — |
| GPT-4OpenAI | — | — | — |
| GPT-4-turboOpenAI | — | — | — |
| GPT-4.1OpenAI | — | — | — |
| GPT-4.1 MiniOpenAI | — | — | — |
| GPT-4.1-nanoOpenAI | — | — | — |
| GPT-4oOpenAI | — | — | — |
| GPT-4o MiniOpenAI | — | — | — |
| GPT-5OpenAI | — | — | — |
| GPT-5 NanoOpenAI | — | — | — |
| GPT-5 ProOpenAI | — | — | — |
| GPT-5.1OpenAI | — | — | — |
| GPT-5.2OpenAI | — | — | — |
| GPT-5.2 ProOpenAI | — | — | — |
| GPT-5.3 CodexOpenAI | — | — | — |
| GPT-5.3 Codex SparkOpenAI | — | — | — |
| GPT-5.4OpenAI | — | — | — |
| GPT-5.4 MiniOpenAI | — | — | — |
| GPT-5.4 NanoOpenAI | — | — | — |