{"version":"configuration-source-6","evidencePolicy":"documented","snapshotId":"sha256-c4d5b67b1e1a60ef314523cbb3fbe44b06fde3a55f714385b8fb1a0db5291c0c","effortDatasetId":"sha256-f0563cf1c78be0f3bf27cf77e3a1300440bd5d253a3cbd7616a94c9b3d62133c+sha256-15ba631518c576c495104485510c5a32932cfc46cf3c8d26cf23c08067462a93+sha256-a64f8fddfa426be712c0faea67985ae67c3c39be4dfca6cf9ad11c4fa3c58bcc+sha256-6390b33ad243c40ef5f592e9e7b2df0061ed33f459d6038cb6f6aa31b1203a0f+sha256-81679b15ba83a7848fd115f457e04edf5e2d906b78dcd32e66cc9e629a0395e4+sha256-39abeb27d2f933f3c9f00199a97be2e223490737dc4d3bee10d559390fc65cb1+sha256-dc15922aea6f086a955a18e324406648f5119c442c98c1151f1f4b73519bddbe+sha256-263d96d7f6baf346071cc8607f01aa60ffb2d3337b9f9d6e36e3ba1b11cac3d3","scope":"All collected observations, not a claim that every public result has been collected. Contributing means positive graph weight, not sufficient evidence for a rank.","models":[{"id":"step-5-preview","collected":23,"contributing":17,"admittedWithoutWeight":0,"excluded":6}],"observations":[{"id":"4a88975d662760cd583f9e27","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/aa-analyst-agent","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"f579fc0dca9935f219df509b","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/aa-briefcase","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"ab9a28e0a53cdcab0dd1cd27","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/apex-agents-aa","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"d6bca134ef08712b9e071ad1","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/artificial-analysis-long-context-reasoning","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"d147a3085be14474ad98b1ff","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/automationbench-aa","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"4adc2d2f72d7512bcefe05d2","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/critpt","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"17a82096430134a4793bf474","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/enterprise-ops-gym-aa","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"e013a02b996a95ebc2ae00cd","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/gdp-pdf","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"db6eb5d94c4c639175bc3e9f","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/gdpval-aa","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"79a4f8a1e92ab1d2ba0c232e","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/harvey-lab-aa","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"7504c5bd6e9ce1b8e5c7f5e1","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/humanitys-last-exam","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"f6fdac01ebdf5e190792fdb1","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/itbench-aa","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"f47637d5f7cb6e09d0e5407d","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/mlcr-aa","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"ff932e1d93554b38481e904e","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/mmmu-pro","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"c6a5ec26e84ae07fde8aefcc","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/omniscience","status":"excluded","reason":"Benchmark family or source protocol has not been reviewed"},{"id":"334ad755e623e4b6693136a6","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/omniscience","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"6142b034e5ac95d3051558ab","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/scicode","status":"excluded","reason":"Original SciCode grading defects are under review; retained as supporting evidence, excluded from aggregate and capability scores. Corrected SciCode-Verified requires a separate protocol review. Sources: https://arxiv.org/abs/2608.04975 and https://artificialanalysis.ai/evaluations/scicode"},{"id":"017170de05d86d07588c3548","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/terminal-bench-science","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"a329497b5012d24b53ad472e","modelId":"step-5-preview","configurationId":"step-5-preview--effort-reasoning","sourceUrl":"https://artificialanalysis.ai/evaluations/terminalbench-v4-0","status":"contributing","reason":"Positive comparison weight in the overall connected graph"},{"id":"s-automationbench-step-5-preview-b150ea70b31e","modelId":"step-5-preview","configurationId":null,"sourceUrl":"https://artificialanalysis.ai/evaluations/automationbench-aa","status":"excluded","reason":"Supporting evidence outside the reviewed capability core"},{"id":"s-gdpval-step-5-preview-a4a4781446fd","modelId":"step-5-preview","configurationId":null,"sourceUrl":"https://artificialanalysis.ai/evaluations/gdpval-aa","status":"excluded","reason":"No reviewed effort for this catalog observation; any separately collected effort measurement is counted separately"},{"id":"s-lmarena-agent-step-5-preview-unspecified-3feb782f9fd5","modelId":"step-5-preview","configurationId":null,"sourceUrl":"https://arena.ai/leaderboard/agent","status":"excluded","reason":"Supporting evidence outside the reviewed capability core"},{"id":"s-lmarena-step-5-preview-27d5b9722782","modelId":"step-5-preview","configurationId":null,"sourceUrl":"https://lmarena.ai/leaderboard","status":"excluded","reason":"No reviewed effort for this catalog observation; any separately collected effort measurement is counted separately"}]}