Atlas

Benchmarks

← All benchmarks

CritPt

Science · 2025-09-30

70 research-level physics challenges evaluated by Artificial Analysis.

Top models (higher is better)

ModelScore
GPT-5.5 Pro30.6
GPT-5.4 Pro30.0
GPT-5.6 Terra30.0
Claude Opus 529.1
Claude Fable 528.6
GPT-5.527.1
Gemini 3 Deep Think25.7
GPT-5.6 Sol25.7
GPT-5.423.4
Opus 4.820.9
GLM-5.220.9
GPT-5.6 Luna20.6
Gemini 3.1 Pro Preview17.7
Sonnet 516.9
GPT-5.3-Codex16.9
DeepSeek-V4-Flash-073116.6
Grok 4.515.4
Muse Spark 1.115.1
Qwen3.7-Max13.4
Gemini 3.5 Flash13.1
DeepSeek-V4-Pro12.9
Opus 4.612.6
Opus 4.712.0
GPT-5.211.6
Muse Spark11.3
Agnes 2.5 Pro Alpha10.9
Gemini 3.6 Flash10.6
GPT-5.4 Mini10.0
Kimi K2.7 Code10.0
GPT-5.4 Nano9.3
Gemini 3 Pro Preview9.1
Grok Build 0.19.1
Qwen3.7-Plus9.1
GPT-5.2-Codex8.7
Gemini 3 Flash Preview8.6
Nex-N2-Pro8.6
Grok 4.38.0
Kimi K2.68.0
DeepSeek-V3.2-Speciale7.4
DeepSeek-V4-Flash7.1
Loading Atlas data…