RankingGDPval-AA v2 Elo · source release snapshot; version not specified

GDPval-AA v2 Elo · source release snapshot; version not specified

Data updated 12 Sept 2026

Bucket
Agentic
Unit
elo
Direction
Higher is better
Version
source release snapshot; version not specified
Display harness
Muse Spark 1.1 evaluation report Figure44
Board
https://research.meta.ai/static/muse-spark-1-1-evaluation-report

Compare published benchmark results with category weights →

Models

ModelScoreHarnessEvidenceSource-recorded date
Claude Opus 4.8Anthropic1600
Reported settings & source

Meta Model API xhigh; Gemini high; Opus max; GPT xhigh. Best of self-reported or Meta reproduction unless specified. OSWorld GUI only; Terminal bash only5attempts89tasks6CPU8GB; DeepSWE no internet5attempts.

First-party reported result; comparator results retain the source evaluation setup.

Muse Spark 1.1 evaluation report Figure44 · Figure44 physical page101; methodology pages101–105 · reviewed 2026-09-06

Muse Spark 1.1 evaluation report Figure44lab self-report2026-09-06
GPT-5.5OpenAI1494
Reported settings & source

Meta Model API xhigh; Gemini high; Opus max; GPT xhigh. Best of self-reported or Meta reproduction unless specified. OSWorld GUI only; Terminal bash only5attempts89tasks6CPU8GB; DeepSWE no internet5attempts.

First-party reported result; comparator results retain the source evaluation setup.

Muse Spark 1.1 evaluation report Figure44 · Figure44 physical page101; methodology pages101–105 · reviewed 2026-09-06

Muse Spark 1.1 evaluation report Figure44lab self-report2026-09-06
Muse Spark 1.1Meta1381
Reported settings & source

Meta Model API xhigh; Gemini high; Opus max; GPT xhigh. Best of self-reported or Meta reproduction unless specified. OSWorld GUI only; Terminal bash only5attempts89tasks6CPU8GB; DeepSWE no internet5attempts.

First-party reported result; comparator results retain the source evaluation setup.

Muse Spark 1.1 evaluation report Figure44 · Figure44 physical page101; methodology pages101–105 · reviewed 2026-09-06

Muse Spark 1.1 evaluation report Figure44lab self-report2026-09-06
Gemini 3.1 ProGoogle963
Reported settings & source

Meta Model API xhigh; Gemini high; Opus max; GPT xhigh. Best of self-reported or Meta reproduction unless specified. OSWorld GUI only; Terminal bash only5attempts89tasks6CPU8GB; DeepSWE no internet5attempts.

First-party reported result; comparator results retain the source evaluation setup.

Muse Spark 1.1 evaluation report Figure44 · Figure44 physical page101; methodology pages101–105 · reviewed 2026-09-06

Muse Spark 1.1 evaluation report Figure44lab self-report2026-09-06