THE EVIDENCE / MATH
Math
benchmarks.
Mathematical problem solving. Results are grouped by benchmark and unit. Different tests are never merged into a raw leaderboard.
01 / RESULTS
Published results
| Benchmark | Version | Method | Configuration | Model | Result | Test date | Verified | Source type | Source |
|---|---|---|---|---|---|---|---|---|---|
| FrontierMath Tier 4 v2 | FrontierMath Tier 4 v2 | Publisher-reported configuration; see source | — | gpt-6-astra | 98 % | 2026-09-03 | 2026-09-29 | provider first party | Source ↗ |
| ProofBench v1.1 Vals 100 proof tasks | 1.1 | Vals 100 proof tasks; ceiling effect at top scores | — | claude-opus-5-5 | 100 % | 2026-09-29 | 2026-09-29 | independent lab | Source ↗ |
| ProofBench v1.1 Vals 100 proof tasks | 1.1 | Vals 100 proof tasks; ceiling effect at top scores | — | claude-fable-5-1 | 100 % | 2026-09-29 | 2026-09-29 | independent lab | Source ↗ |
| ProofBench v1.1 Vals 100 proof tasks | 1.1 | Vals 100 proof tasks; ceiling effect at top scores | — | gpt-6-astra | 99 % | 2026-09-29 | 2026-09-29 | independent lab | Source ↗ |
| ProofBench v1.1 Vals 100 proof tasks | 1.1 | Vals 100 proof tasks; ceiling effect at top scores | — | gpt-5.6-sol | 83 % | 2026-09-29 | 2026-09-29 | independent lab | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gemini-3.1-pro-preview-high | gemini-3-1-pro-preview | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gemini-3.1-pro-preview-high | gemini-3-1-pro-preview | 92.102 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gemini-3.5-flash-high | gemini-3-5-flash | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gemini-3.5-flash-high | gemini-3-5-flash | 91.877 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | grok-4.5 | grok-4-5 | 99 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | grok-4.5 | grok-4-5 | 89.239 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gpt-5.6-sol-max | gpt-5.6-sol | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gpt-5.6-sol-max | gpt-5.6-sol | 91.693 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gpt-5.6-terra-max | gpt-5.6-terra | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gpt-5.6-terra-max | gpt-5.6-terra | 91.535 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gpt-5.6-luna-max | gpt-5.6-luna | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gpt-5.6-luna-max | gpt-5.6-luna | 88.646 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gemini-3.5-flash-lite-high | gemini-3-5-flash-lite | 95 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gemini-3.5-flash-lite-high | gemini-3-5-flash-lite | 81.801 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gemini-3.6-flash-high | gemini-3-6-flash | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gemini-3.6-flash-high | gemini-3-6-flash | 90.492 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | deepseek-v4-pro-0813 | deepseek-v4-pro | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | deepseek-v4-pro-0813 | deepseek-v4-pro | 91.286 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | grok-4.6 | grok-4-6 | 97 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | grok-4.6 | grok-4-6 | 91.213 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gemini-3.7-flash-high | gemini-3-7-flash | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gemini-3.7-flash-high | gemini-3-7-flash | 91.794 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | claude-fable-5-1-max-effort | claude-fable-5-1 | 99 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | claude-fable-5-1-max-effort | claude-fable-5-1 | 92.968 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gemini-3.8-flash-high | gemini-3-8-flash | 99 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gemini-3.8-flash-high | gemini-3-8-flash | 92.159 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gpt-6-astra-max | gpt-6-astra | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gpt-6-astra-max | gpt-6-astra | 92.166 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | deepseek-v4.1-flash-max | deepseek-v4-1-flash | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | deepseek-v4.1-flash-max | deepseek-v4-1-flash | 89.081 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | claude-opus-5-5-max-effort | claude-opus-5-5 | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | claude-opus-5-5-max-effort | claude-opus-5-5 | 93.251 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gpt-6-sol-max | gpt-6-sol | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gpt-6-sol-max | gpt-6-sol | 91.365 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | gpt-6-luna-max | gpt-6-luna | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | gpt-6-luna-max | gpt-6-luna | 90.376 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench AMPS_Hard | 2026-06-25 | Public table; published model effort variant | claude-sonnet-5-5-max-effort | claude-sonnet-5-5 | 98 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench olympiad | 2026-06-25 | Public table; published model effort variant | claude-sonnet-5-5-max-effort | claude-sonnet-5-5 | 92.468 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
Limitations: Exact answer grading may miss valid alternative reasoning. Publication methods, prompts, sampling and model versions may differ. Check each cited source before interpreting a result.