THE SCOREBOARD FOR WHAT'S NEXTAI + QUANTUM, SCORED. COMPARED. EXPLAINED.
AIQUANTUMSCORE.

THE EVIDENCE / CODING

Coding
benchmarks.

Software engineering and code generation tasks. Results are grouped by benchmark and unit. Different tests are never merged into a raw leaderboard.

01 / RESULTS

Published results

BenchmarkVersionMethodConfigurationModelResultTest dateVerifiedSource typeSource
CursorBench v3.2CursorBench v3.2Publisher-reported configuration; see source—grok-4-669.9 %2026-08-122026-09-29provider first partySource ↗
CursorBench v3.2CursorBench v3.2Publisher-reported configuration; see source—grok-4-566.7 %2026-08-122026-09-29provider first partySource ↗
DeepSWE v1.1DeepSWE v1.1Publisher-reported configuration; see source—grok-4-665.9 %2026-08-122026-09-29provider first partySource ↗
DeepSWE v1.1DeepSWE v1.1Publisher-reported configuration; see source—grok-4-554 %2026-08-122026-09-29provider first partySource ↗
FrontierCode v1.1 ExtendedFrontierCode v1.1 ExtendedPublisher-reported configuration; see source—grok-4-661.3 %2026-08-122026-09-29provider first partySource ↗
FrontierCode v1.1 ExtendedFrontierCode v1.1 ExtendedPublisher-reported configuration; see source—grok-4-556.6 %2026-08-122026-09-29provider first partySource ↗
Terminal-Bench 4.0 (reported best effort)Terminal-Bench 4.0 (reported best effort)Publisher-reported configuration; see source—claude-sonnet-5-570.6 %2026-09-282026-09-29provider first partySource ↗
Terminal-Bench 4.0 (reported best effort)Terminal-Bench 4.0 (reported best effort)Publisher-reported configuration; see source—claude-opus-5-566.4 %2026-09-282026-09-29provider first partySource ↗
CursorBench 4.0 (reported best effort)CursorBench 4.0 (reported best effort)Publisher-reported configuration; see source—claude-sonnet-5-555.5 %2026-09-282026-09-29provider first partySource ↗
CursorBench 4.0 (reported best effort)CursorBench 4.0 (reported best effort)Publisher-reported configuration; see source—claude-opus-5-557.8 %2026-09-282026-09-29provider first partySource ↗
FrontierCode 1.1 Main (reported best effort)FrontierCode 1.1 Main (reported best effort)Publisher-reported configuration; see source—claude-sonnet-5-546.2 %2026-09-282026-09-29provider first partySource ↗
FrontierCode 1.1 Main (reported best effort)FrontierCode 1.1 Main (reported best effort)Publisher-reported configuration; see source—claude-opus-5-554.4 %2026-09-282026-09-29provider first partySource ↗
Terminal-Bench 4.0 Vals mini-SWE-agent avg@3 fallbacks failed4.0Vals mini-SWE-agent avg@3; Anthropic fallbacks treated as failures—claude-opus-5-558.08 %2026-09-292026-09-29independent labSource ↗
Terminal-Bench 4.0 Vals mini-SWE-agent avg@3 fallbacks failed4.0Vals mini-SWE-agent avg@3; Anthropic fallbacks treated as failures—claude-sonnet-5-562.63 %2026-09-292026-09-29independent labSource ↗
Terminal-Bench 4.0 Vals mini-SWE-agent avg@3 fallbacks failed4.0Vals mini-SWE-agent avg@3; Anthropic fallbacks treated as failures—claude-fable-5-150 %2026-09-292026-09-29independent labSource ↗
Terminal-Bench 4.0 Vals mini-SWE-agent avg@3 fallbacks failed4.0Vals mini-SWE-agent avg@3; Anthropic fallbacks treated as failures—gpt-6-astra59.6 %2026-09-292026-09-29independent labSource ↗
ProgramBench Vals 200 public tasks raw pass rateVals 2026-09-27Vals 200 public tasks; raw pass rate; mini-SWE-agent—claude-opus-5-587 %2026-09-272026-09-29independent labSource ↗
ProgramBench Vals 200 public tasks raw pass rateVals 2026-09-27Vals 200 public tasks; raw pass rate; mini-SWE-agent—gpt-6-astra85.4 %2026-09-272026-09-29independent labSource ↗
ProgramBench Vals 200 public tasks raw pass rateVals 2026-09-27Vals 200 public tasks; raw pass rate; mini-SWE-agent—claude-fable-5-182.7 %2026-09-272026-09-29independent labSource ↗
ProgramBench Vals 200 public tasks raw pass rateVals 2026-09-27Vals 200 public tasks; raw pass rate; mini-SWE-agent—gpt-6-sol81.9 %2026-09-272026-09-29independent labSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgemini-3.1-pro-preview-highgemini-3-1-pro-preview78.261 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgemini-3.1-pro-preview-highgemini-3-1-pro-preview74.648 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgemini-3.5-flash-highgemini-3-5-flash76.087 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgemini-3.5-flash-highgemini-3-5-flash80.282 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgrok-4.5grok-4-569.565 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgrok-4.5grok-4-567.606 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgpt-5.6-sol-maxgpt-5.6-sol84.783 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgpt-5.6-sol-maxgpt-5.6-sol83.099 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgpt-5.6-terra-maxgpt-5.6-terra80.435 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgpt-5.6-terra-maxgpt-5.6-terra76.056 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgpt-5.6-luna-maxgpt-5.6-luna86.957 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgpt-5.6-luna-maxgpt-5.6-luna78.873 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgemini-3.5-flash-lite-highgemini-3-5-flash-lite76.087 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgemini-3.5-flash-lite-highgemini-3-5-flash-lite76.056 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgemini-3.6-flash-highgemini-3-6-flash78.261 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgemini-3.6-flash-highgemini-3-6-flash77.465 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantdeepseek-v4-pro-0813deepseek-v4-pro78.261 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantdeepseek-v4-pro-0813deepseek-v4-pro76.056 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgrok-4.6grok-4-676.087 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgrok-4.6grok-4-677.465 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgemini-3.7-flash-highgemini-3-7-flash76.087 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgemini-3.7-flash-highgemini-3-7-flash81.69 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantclaude-fable-5-1-max-effortclaude-fable-5-182.609 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantclaude-fable-5-1-max-effortclaude-fable-5-190.141 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgemini-3.8-flash-highgemini-3-8-flash71.739 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgemini-3.8-flash-highgemini-3-8-flash73.239 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgpt-6-astra-maxgpt-6-astra80.435 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgpt-6-astra-maxgpt-6-astra80.282 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantdeepseek-v4.1-flash-maxdeepseek-v4-1-flash82.609 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantdeepseek-v4.1-flash-maxdeepseek-v4-1-flash77.465 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantclaude-opus-5-5-max-effortclaude-opus-5-586.957 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantclaude-opus-5-5-max-effortclaude-opus-5-591.549 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgpt-6-sol-maxgpt-6-sol80.435 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgpt-6-sol-maxgpt-6-sol83.099 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantgpt-6-luna-maxgpt-6-luna80.435 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantgpt-6-luna-maxgpt-6-luna77.465 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_completion2026-06-25Public table; published model effort variantclaude-sonnet-5-5-max-effortclaude-sonnet-5-586.957 %not published2026-09-30benchmark maintainerSource ↗
LiveBench code_generation2026-06-25Public table; published model effort variantclaude-sonnet-5-5-max-effortclaude-sonnet-5-595.775 %not published2026-09-30benchmark maintainerSource ↗

Limitations: Repository context, tool access and pass criteria vary across tests. Publication methods, prompts, sampling and model versions may differ. Check each cited source before interpreting a result.