RankingPaperBench · source release snapshot; version not specified
PaperBench · source release snapshot; version not specified
- Bucket
- Supporting evidence
- Unit
- percent
- Direction
- Higher is better
- Version
- source release snapshot; version not specified
- Display harness
- Qwen/Qwen3.8-2.4T-A95B
- Board
- https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
The available records have no admitted matched comparison in the capability core. Raw results remain available below.
Compare published benchmark results with category weights →
Models
| Model | Score | Harness | Evidence | Source-recorded date |
|---|---|---|---|---|
| Qwen 3.8-MaxQwen | 93%Reported settings & sourceSource benchmark-specific methodology; Qwen benchmark effort unspecified, GPT-5.6 Sol max per table header. Max in Qwen model names is not a reported effort setting. Comparator settings and source citations as documented in the model card. BasicAgent Code-Dev; Opus4.6 judge,3runs,12h each. First-party reported result. Qwen/Qwen3.8-2.4T-A95B · Performance table: PaperBench · reviewed 2026-09-12 | Qwen/Qwen3.8-2.4T-A95B | lab self-report | 2026-09-12 |
| GPT-5.6 SolOpenAI | 90.5%Reported settings & sourceSource benchmark-specific methodology; Qwen benchmark effort unspecified, GPT-5.6 Sol max per table header. Max in Qwen model names is not a reported effort setting. Comparator settings and source citations as documented in the model card. BasicAgent Code-Dev; Opus4.6 judge,3runs,12h each. First-party reported result. Qwen/Qwen3.8-2.4T-A95B · Performance table: PaperBench · reviewed 2026-09-12 | Qwen/Qwen3.8-2.4T-A95B | lab self-report | 2026-09-12 |
| Claude Fable 5Anthropic | 88.8%Reported settings & sourceSource benchmark-specific methodology; Qwen benchmark effort unspecified, GPT-5.6 Sol max per table header. Max in Qwen model names is not a reported effort setting. Comparator settings and source citations as documented in the model card. BasicAgent Code-Dev; Opus4.6 judge,3runs,12h each. First-party reported result. Comparison limit: The source states that Fable 5 results may involve fallback execution; an exact configuration is not established. Qwen/Qwen3.8-2.4T-A95B · Performance table: PaperBench · reviewed 2026-09-12 | Qwen/Qwen3.8-2.4T-A95B | lab self-report | 2026-09-12 |
| Claude Opus 4.8Anthropic | 80.3%Reported settings & sourceSource benchmark-specific methodology; Qwen benchmark effort unspecified, GPT-5.6 Sol max per table header. Max in Qwen model names is not a reported effort setting. Comparator settings and source citations as documented in the model card. BasicAgent Code-Dev; Opus4.6 judge,3runs,12h each. First-party reported result. Qwen/Qwen3.8-2.4T-A95B · Performance table: PaperBench · reviewed 2026-09-12 | Qwen/Qwen3.8-2.4T-A95B | lab self-report | 2026-09-12 |
| Qwen3.7-maxQwen | 64.8%Reported settings & sourceSource benchmark-specific methodology; Qwen benchmark effort unspecified, GPT-5.6 Sol max per table header. Max in Qwen model names is not a reported effort setting. Comparator settings and source citations as documented in the model card. BasicAgent Code-Dev; Opus4.6 judge,3runs,12h each. First-party reported result. Qwen/Qwen3.8-2.4T-A95B · Performance table: PaperBench · reviewed 2026-09-12 | Qwen/Qwen3.8-2.4T-A95B | lab self-report | 2026-09-12 |
| Claude Opus 4.7Anthropic | 58.5%Reported settings & sourceMiniMax launch figure methodology. SWE internal ClaudeCode 4 runs; Terminal 8CPU16GB2h128k Terminus2; Paper/PostTrain Ralph-loop12h; GDPval internal rubric grader; BrowseComp discard64k; OSWorld361tasks. Comparator provider/leaderboard scores where footnoted. First-party reported result; comparator results retain the source evaluation setup. MiniMax M3 model card benchmark figure · figures/benchmark.jpeg · reviewed 2026-09-06 | MiniMax M3 model card benchmark figure | lab self-report | 2026-09-06 |
| Gemini 3.1 ProGoogle | 46.7%Reported settings & sourceMiniMax launch figure methodology. SWE internal ClaudeCode 4 runs; Terminal 8CPU16GB2h128k Terminus2; Paper/PostTrain Ralph-loop12h; GDPval internal rubric grader; BrowseComp discard64k; OSWorld361tasks. Comparator provider/leaderboard scores where footnoted. First-party reported result; comparator results retain the source evaluation setup. MiniMax M3 model card benchmark figure · figures/benchmark.jpeg · reviewed 2026-09-06 | MiniMax M3 model card benchmark figure | lab self-report | 2026-09-06 |
| GPT-5.5OpenAI | 57.5%Reported settings & sourceMiniMax launch figure methodology. SWE internal ClaudeCode 4 runs; Terminal 8CPU16GB2h128k Terminus2; Paper/PostTrain Ralph-loop12h; GDPval internal rubric grader; BrowseComp discard64k; OSWorld361tasks. Comparator provider/leaderboard scores where footnoted. First-party reported result; comparator results retain the source evaluation setup. MiniMax M3 model card benchmark figure · figures/benchmark.jpeg · reviewed 2026-09-06 | MiniMax M3 model card benchmark figure | lab self-report | 2026-09-06 |
| MiniMax-M2.7MiniMax | 30.6%Reported settings & sourceMiniMax launch figure methodology. SWE internal ClaudeCode 4 runs; Terminal 8CPU16GB2h128k Terminus2; Paper/PostTrain Ralph-loop12h; GDPval internal rubric grader; BrowseComp discard64k; OSWorld361tasks. Comparator provider/leaderboard scores where footnoted. First-party reported result; comparator results retain the source evaluation setup. MiniMax M3 model card benchmark figure · figures/benchmark.jpeg · reviewed 2026-09-06 | MiniMax M3 model card benchmark figure | lab self-report | 2026-09-06 |
| MiniMax-M3MiniMax | 52.6%Reported settings & sourceMiniMax launch figure methodology. SWE internal ClaudeCode 4 runs; Terminal 8CPU16GB2h128k Terminus2; Paper/PostTrain Ralph-loop12h; GDPval internal rubric grader; BrowseComp discard64k; OSWorld361tasks. Comparator provider/leaderboard scores where footnoted. First-party reported result; comparator results retain the source evaluation setup. MiniMax M3 model card benchmark figure · figures/benchmark.jpeg · reviewed 2026-09-06 | MiniMax M3 model card benchmark figure | lab self-report | 2026-09-06 |