RankingReal-SWE

Real-SWE

Data updated 23 Sept 2026

Bucket
Supporting evidence
Unit
percent
Direction
Higher is better
Version
2026-09
Display harness
Real-SWE · Fable 5.1 · Claude Code
Board
https://realswe.withspecific.com/

Real-SWE ranks each model with its native harness. These rows are display only. They do not enter the weighted Overall or capability scores.

Compare published benchmark results with category weights →

Models

Results are ordered by score in the display harness, followed by models with no result. Other harnesses are listed separately below. Missing results remain unknown.

351–375 of 455 entries

ModelScoreEvidenceSource-recorded date
Qwen3-0.6BQwen
Qwen3-1.7BQwen
Qwen3-14BQwen
Qwen3-235B-A22BQwen
Qwen3-235B-A22B-Instruct-2507Qwen
Qwen3-235B-A22B-Thinking-2507Qwen
Qwen3-30B-A3BQwen
Qwen3-30B-A3B-Instruct-2507Qwen
Qwen3-30B-A3B-Thinking-2507Qwen
Qwen3-32BQwen
Qwen3-4BQwen
Qwen3-4B-Instruct-2507Qwen
Qwen3-4B-Thinking-2507Qwen
Qwen3-8BQwen
Qwen3-Coder-30B-A3B-InstructQwen
Qwen3-Coder-480B-A35B-InstructQwen
Qwen3-coder-flashQwen
Qwen3-Coder-NextQwen
Qwen3-coder-plusQwen
Qwen3-maxQwen
Qwen3-Next-80B-A3B-InstructQwen
Qwen3-Next-80B-A3B-ThinkingQwen
Qwen3-Omni-30B-A3B-InstructQwen
Qwen3-Omni-30B-A3B-ThinkingQwen
Qwen3-omni-flashQwen

Other harnesses

These runs use other harnesses. Capability scoring matches configurations separately; model details identify which source records contribute.

ModelScoreHarnessEvidenceSource-recorded date
Gemini 3.8 FlashGoogle31.2%Real-SWE · Gemini 3.8 Flash · Gemini CLIofficial board2026-09-23
GLM-5.3Z.ai28.8%Real-SWE · GLM 5.3 · Claude Codeofficial board2026-09-23
GPT-5.6 SolOpenAI16.2%Real-SWE · GPT-5.6 Sol · Codex CLIofficial board2026-09-23
GPT-6 AstraOpenAI33.8%Real-SWE · GPT-6 Astra · Codex CLIofficial board2026-09-23
Grok 4.6xAI32.5%Real-SWE · Grok 4.6 · Grok Buildofficial board2026-09-23
Kimi K3Moonshot18.8%Real-SWE · Kimi K3 · Kimi Codeofficial board2026-09-23
Muse Spark 1.3Meta23.8%Real-SWE · Muse Spark 1.3 · Muse Codeofficial board2026-09-23