RankingCharXiv Reasoning

CharXiv Reasoning

Data updated 12 Sept 2026

Bucket
Multimodal
Unit
percent
Direction
Higher is better
Version
Display harness
Gemini3.8Flash Model Card
Board
https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-8-Flash-Model-Card.pdf

Compare published benchmark results with category weights →

Models

ModelScoreHarnessEvidenceSource-recorded date
Gemini 3.8 FlashGoogle86.2%
Reported settings & source

No tools; Gemini/GPT/Opus selfcomputed; Sonnet selfreported

Gemini3.8Flash Model Card · Model card page5 Results table · reviewed 2026-09-06

Gemini3.8Flash Model Cardlab self-report2026-09-06
GPT-5.6 TerraOpenAI85.9%
Reported settings & source

No tools; Gemini/GPT/Opus selfcomputed; Sonnet selfreported

Gemini3.8Flash Model Card · Model card page5 Results table · reviewed 2026-09-06

Gemini3.8Flash Model Cardlab self-report2026-09-06
GPT-5.6 SolOpenAI85.8%
Reported settings & source

No tools; Gemini/GPT/Opus selfcomputed; Sonnet selfreported

Gemini3.8Flash Model Card · Model card page5 Results table · reviewed 2026-09-06

Gemini3.8Flash Model Cardlab self-report2026-09-06
Gemini 3.7 FlashGoogle84.5%
Reported settings & source

No tools; Gemini/GPT/Opus selfcomputed; Sonnet selfreported

Gemini3.8Flash Model Card · Model card page5 Results table · reviewed 2026-09-06

Gemini3.8Flash Model Cardlab self-report2026-09-06
Claude Opus 5Anthropic83.7%
Reported settings & source

No tools; Gemini/GPT/Opus selfcomputed; Sonnet selfreported

Gemini3.8Flash Model Card · Model card page5 Results table · reviewed 2026-09-06

Gemini3.8Flash Model Cardlab self-report2026-09-06
Claude Sonnet 5Anthropic70.1%
Reported settings & source

No tools; Gemini/GPT/Opus selfcomputed; Sonnet selfreported

Gemini3.8Flash Model Card · Model card page5 Results table · reviewed 2026-09-06

Gemini3.8Flash Model Cardlab self-report2026-09-06