THE SCOREBOARD FOR WHAT'S NEXTAI + QUANTUM, SCORED. COMPARED. EXPLAINED.
AIQUANTUMSCORE.

THE EVIDENCE / MATH

Math
benchmarks.

Mathematical problem solving. Results are grouped by benchmark and unit. Different tests are never merged into a raw leaderboard.

01 / RESULTS

Published results

BenchmarkVersionMethodConfigurationModelResultTest dateVerifiedSource typeSource
FrontierMath Tier 4 v2FrontierMath Tier 4 v2Publisher-reported configuration; see source—gpt-6-astra98 %2026-09-032026-09-29provider first partySource ↗
ProofBench v1.1 Vals 100 proof tasks1.1Vals 100 proof tasks; ceiling effect at top scores—claude-opus-5-5100 %2026-09-292026-09-29independent labSource ↗
ProofBench v1.1 Vals 100 proof tasks1.1Vals 100 proof tasks; ceiling effect at top scores—claude-fable-5-1100 %2026-09-292026-09-29independent labSource ↗
ProofBench v1.1 Vals 100 proof tasks1.1Vals 100 proof tasks; ceiling effect at top scores—gpt-6-astra99 %2026-09-292026-09-29independent labSource ↗
ProofBench v1.1 Vals 100 proof tasks1.1Vals 100 proof tasks; ceiling effect at top scores—gpt-5.6-sol83 %2026-09-292026-09-29independent labSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgemini-3.1-pro-preview-highgemini-3-1-pro-preview98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgemini-3.1-pro-preview-highgemini-3-1-pro-preview92.102 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgemini-3.5-flash-highgemini-3-5-flash98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgemini-3.5-flash-highgemini-3-5-flash91.877 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgrok-4.5grok-4-599 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgrok-4.5grok-4-589.239 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgpt-5.6-sol-maxgpt-5.6-sol98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgpt-5.6-sol-maxgpt-5.6-sol91.693 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgpt-5.6-terra-maxgpt-5.6-terra98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgpt-5.6-terra-maxgpt-5.6-terra91.535 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgpt-5.6-luna-maxgpt-5.6-luna98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgpt-5.6-luna-maxgpt-5.6-luna88.646 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgemini-3.5-flash-lite-highgemini-3-5-flash-lite95 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgemini-3.5-flash-lite-highgemini-3-5-flash-lite81.801 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgemini-3.6-flash-highgemini-3-6-flash98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgemini-3.6-flash-highgemini-3-6-flash90.492 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantdeepseek-v4-pro-0813deepseek-v4-pro98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantdeepseek-v4-pro-0813deepseek-v4-pro91.286 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgrok-4.6grok-4-697 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgrok-4.6grok-4-691.213 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgemini-3.7-flash-highgemini-3-7-flash98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgemini-3.7-flash-highgemini-3-7-flash91.794 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantclaude-fable-5-1-max-effortclaude-fable-5-199 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantclaude-fable-5-1-max-effortclaude-fable-5-192.968 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgemini-3.8-flash-highgemini-3-8-flash99 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgemini-3.8-flash-highgemini-3-8-flash92.159 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgpt-6-astra-maxgpt-6-astra98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgpt-6-astra-maxgpt-6-astra92.166 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantdeepseek-v4.1-flash-maxdeepseek-v4-1-flash98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantdeepseek-v4.1-flash-maxdeepseek-v4-1-flash89.081 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantclaude-opus-5-5-max-effortclaude-opus-5-598 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantclaude-opus-5-5-max-effortclaude-opus-5-593.251 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgpt-6-sol-maxgpt-6-sol98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgpt-6-sol-maxgpt-6-sol91.365 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantgpt-6-luna-maxgpt-6-luna98 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantgpt-6-luna-maxgpt-6-luna90.376 %not published2026-09-30benchmark maintainerSource ↗
LiveBench AMPS_Hard2026-06-25Public table; published model effort variantclaude-sonnet-5-5-max-effortclaude-sonnet-5-598 %not published2026-09-30benchmark maintainerSource ↗
LiveBench olympiad2026-06-25Public table; published model effort variantclaude-sonnet-5-5-max-effortclaude-sonnet-5-592.468 %not published2026-09-30benchmark maintainerSource ↗

Limitations: Exact answer grading may miss valid alternative reasoning. Publication methods, prompts, sampling and model versions may differ. Check each cited source before interpreting a result.