THE EVIDENCE / AGENTS
Agents
benchmarks.
Completion of multi-step tool-using tasks. Results are grouped by benchmark and unit. Different tests are never merged into a raw leaderboard.
01 / RESULTS
Published results
| Benchmark | Version | Method | Configuration | Model | Result | Test date | Verified | Source type | Source |
|---|---|---|---|---|---|---|---|---|---|
| APEX-Agents | APEX-Agents | Publisher-reported configuration; see source | — | grok-4-6 | 57.5 % | 2026-08-12 | 2026-09-29 | provider first party | Source ↗ |
| APEX-Agents | APEX-Agents | Publisher-reported configuration; see source | — | grok-4-5 | 47.1 % | 2026-08-12 | 2026-09-29 | provider first party | Source ↗ |
| Terminal-Bench v3.0 | Terminal-Bench v3.0 | Publisher-reported configuration; see source | — | grok-4-6 | 26 % | 2026-08-12 | 2026-09-29 | provider first party | Source ↗ |
| Terminal-Bench v3.0 | Terminal-Bench v3.0 | Publisher-reported configuration; see source | — | grok-4-5 | 15.7 % | 2026-08-12 | 2026-09-29 | provider first party | Source ↗ |
| GDPVal-AA v2 | GDPVal-AA v2 | Publisher-reported configuration; see source | — | grok-4-6 | 1753 Elo | 2026-08-12 | 2026-09-29 | provider first party | Source ↗ |
| GDPVal-AA v2 | GDPVal-AA v2 | Publisher-reported configuration; see source | — | grok-4-5 | 1526 Elo | 2026-08-12 | 2026-09-29 | provider first party | Source ↗ |
| GDPval-AA v2.1 (reported best effort) | GDPval-AA v2.1 (reported best effort) | Publisher-reported configuration; see source | — | claude-sonnet-5-5 | 1844 Elo | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| GDPval-AA v2.1 (reported best effort) | GDPval-AA v2.1 (reported best effort) | Publisher-reported configuration; see source | — | claude-opus-5-5 | 1846 Elo | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| GDPval-AA v2.1 (reported best effort) | GDPval-AA v2.1 (reported best effort) | Publisher-reported configuration; see source | — | gpt-6-sol | 1487 Elo | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| AA-Briefcase v1.1 (reported best effort) | AA-Briefcase v1.1 (reported best effort) | Publisher-reported configuration; see source | — | claude-sonnet-5-5 | 1811 Elo | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| AA-Briefcase v1.1 (reported best effort) | AA-Briefcase v1.1 (reported best effort) | Publisher-reported configuration; see source | — | claude-opus-5-5 | 1822 Elo | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| AA-Briefcase v1.1 (reported best effort) | AA-Briefcase v1.1 (reported best effort) | Publisher-reported configuration; see source | — | gpt-6-sol | 1483 Elo | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| OSWorld 2.1 (partial; reported best effort) | OSWorld 2.1 (partial; reported best effort) | Publisher-reported configuration; see source | — | claude-sonnet-5-5 | 80.1 % | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| OSWorld 2.1 (partial; reported best effort) | OSWorld 2.1 (partial; reported best effort) | Publisher-reported configuration; see source | — | claude-opus-5-5 | 81.8 % | 2026-09-28 | 2026-09-29 | provider first party | Source ↗ |
| SkillsBench Vals OpenHands with skills | Vals 2026-09-27 | Vals OpenHands harness with skills | — | deepseek-v4-1-flash | 69.8 % | 2026-09-27 | 2026-09-29 | independent lab | Source ↗ |
| SkillsBench Vals OpenHands with skills | Vals 2026-09-27 | Vals OpenHands harness with skills | — | grok-4-5 | 66.03 % | 2026-09-27 | 2026-09-29 | independent lab | Source ↗ |
| SkillsBench Vals OpenHands with skills | Vals 2026-09-27 | Vals OpenHands harness with skills | — | gemini-3-7-flash | 65.89 % | 2026-09-27 | 2026-09-29 | independent lab | Source ↗ |
| AutomationBench-AA Index v4.3.2 (Opus Max fallback, Astra Max, Gemini High) | AA Index 4.3.2 | Opus Max with default fallback; Astra Max | — | claude-opus-5-5 | 70 % | 2026-09-29 | 2026-09-29 | independent lab | Source ↗ |
| AutomationBench-AA Index v4.3.2 (Opus Max fallback, Astra Max, Gemini High) | AA Index 4.3.2 | Opus Max with default fallback; Astra Max | — | gpt-6-astra | 68 % | 2026-09-29 | 2026-09-29 | independent lab | Source ↗ |
| AutomationBench-AA Index v4.3.2 (Opus Max fallback, Astra Max, Gemini High) | AA Index 4.3.2 | Gemini High | — | gemini-3-8-flash | 60 % | 2026-09-29 | 2026-09-29 | independent lab | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gemini-3.1-pro-preview-high | gemini-3-1-pro-preview | 59.091 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gemini-3.5-flash-high | gemini-3-5-flash | 63.636 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | grok-4.5 | grok-4-5 | 72.727 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gpt-5.6-sol-max | gpt-5.6-sol | 63.636 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gpt-5.6-terra-max | gpt-5.6-terra | 68.182 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gpt-5.6-luna-max | gpt-5.6-luna | 63.636 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gemini-3.5-flash-lite-high | gemini-3-5-flash-lite | 59.091 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gemini-3.6-flash-high | gemini-3-6-flash | 63.636 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | deepseek-v4-pro-0813 | deepseek-v4-pro | 68.182 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | grok-4.6 | grok-4-6 | 72.727 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gemini-3.7-flash-high | gemini-3-7-flash | 68.182 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | claude-fable-5-1-max-effort | claude-fable-5-1 | 68.182 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gemini-3.8-flash-high | gemini-3-8-flash | 72.727 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gpt-6-astra-max | gpt-6-astra | 63.636 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | deepseek-v4.1-flash-max | deepseek-v4-1-flash | 81.818 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | claude-opus-5-5-max-effort | claude-opus-5-5 | 81.818 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gpt-6-sol-max | gpt-6-sol | 63.636 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | gpt-6-luna-max | gpt-6-luna | 63.636 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
| LiveBench javascript | 2026-06-25 | Public table; published model effort variant | claude-sonnet-5-5-max-effort | claude-sonnet-5-5 | 77.273 % | not published | 2026-09-30 | benchmark maintainer | Source ↗ |
Limitations: Tool sets and time budgets differ across evaluations. Publication methods, prompts, sampling and model versions may differ. Check each cited source before interpreting a result.