THE SCOREBOARD FOR WHAT'S NEXTAI + QUANTUM, SCORED. COMPARED. EXPLAINED.
AIQUANTUMSCORE.

EVIDENCE COVERAGE

What has been
tested together?

Strong means independent evidence in a shared, method-compatible cohort of at least three models. Partial means sourced observations exist without that overlap.

ModelcodingreasoningmathagentsresearchmultimodalspeedOverall
GPT-6 AstraStrongStrongStrongStrongNoneNoneNone60
GPT-6 SolStrongStrongStrongStrongNonePartialNone48
GPT-6 LunaStrongStrongStrongStrongNoneNoneNoneWithheld
GPT-6.1 SolNoneNoneNoneNoneNoneNoneNoneWithheld
GPT-5.6 SolStrongStrongStrongStrongNoneNoneNone53
GPT-5.6 TerraStrongStrongStrongStrongNoneNoneNoneWithheld
GPT-5.6 LunaStrongStrongStrongStrongNoneNoneNoneWithheld
Claude Fable 5.1StrongStrongStrongStrongNoneNoneNoneWithheld
Claude Opus 5.5StrongStrongStrongStrongNonePartialNone86
Claude Sonnet 5.5StrongStrongStrongStrongNonePartialNone88
Claude Haiku 4.5NoneNoneNoneNoneNoneNoneNoneWithheld
Gemini 3.8 FlashStrongStrongStrongStrongNoneNoneNone51
Gemini 3.7 FlashStrongStrongStrongStrongNoneNoneNoneWithheld
Gemini 3.6 FlashStrongStrongStrongStrongNoneNoneNoneWithheld
Gemini 3.5 FlashStrongStrongStrongStrongNoneNoneNoneWithheld
Gemini 3.5 Flash-LiteStrongStrongStrongStrongNoneNoneNoneWithheld
Gemini 3.1 Pro PreviewStrongStrongStrongStrongNoneNoneNoneWithheld
Grok 4.6StrongStrongStrongStrongNoneNoneNone52
Grok 4.5StrongStrongStrongStrongNoneNoneNone44
DeepSeek V4.1 FlashStrongStrongStrongStrongNoneNoneNoneWithheld
DeepSeek V4 ProStrongStrongStrongStrongNoneNoneNoneWithheld
Mistral Medium 3.5NoneNoneNoneNoneNoneNoneNoneWithheld
Mistral Small 4NoneNoneNoneNoneNoneNoneNoneWithheld
Mistral Large 3NoneNoneNoneNoneNoneNoneNoneWithheld
Llama 4 ScoutNoneNoneNoneNoneNoneNoneNoneWithheld
Llama 4 MaverickNoneNoneNoneNoneNoneNoneNoneWithheld
Qwen3.5-397B-A17BNoneNoneNoneNoneNoneNoneNoneWithheld
Qwen3.5-122B-A10BNoneNoneNoneNoneNoneNoneNoneWithheld

How scores qualify →