RankingAutoResearchExam

AutoResearchExam

Data updated 23 Sept 2026

Bucket
Supporting evidence
Unit
index
Direction
Higher is better
Version
2026-09-09
Display harness
AutoResearchExam Terminus 2
Board
https://benchmarks.bespokelabs.ai/autoresearchexam/

The available records have no admitted matched comparison in the capability core. Raw results remain available below.

Compare published benchmark results with category weights →

Models

Results are ordered by score in the display harness, followed by models with no result. Other harnesses are listed separately below. Missing results remain unknown.

376–400 of 455 entries

ModelScoreEvidenceSource-recorded date
Qwen3-VL-235B-A22B-InstructQwen
Qwen3-VL-235B-A22B-ThinkingQwen
Qwen3-VL-2B-InstructQwen
Qwen3-VL-2B-ThinkingQwen
Qwen3-VL-30B-A3B-InstructQwen
Qwen3-VL-30B-A3B-ThinkingQwen
Qwen3-VL-32B-InstructQwen
Qwen3-VL-32B-ThinkingQwen
Qwen3-VL-4B-InstructQwen
Qwen3-VL-4B-ThinkingQwen
Qwen3-VL-8B-InstructQwen
Qwen3-VL-8B-ThinkingQwen
Qwen3-vl-flashQwen
Qwen3-vl-plusQwen
Qwen3.5-0.8BQwen
Qwen3.5-122B-A10BQwen
Qwen3.5-27BQwen
Qwen3.5-2BQwen
Qwen3.5-35B-A3BQwen
Qwen3.5-397B-A17BQwen
Qwen3.5-4BQwen
Qwen3.5-9BQwen
Qwen3.5-flashQwen
Qwen3.5-omni-flashQwen
Qwen3.5-omni-plusQwen