Atlas

Benchmarks

← All benchmarks

WeirdML (v2)

Science · 2025-06-27

Machine-learning engineering benchmark covering unusual or nonstandard ML tasks across a range of domains and implementation settings.

Top models (higher is better)

ModelScore
Claude Fable 591.9
Claude Opus 591.8
GPT-5.6 Sol Pro89.4
GPT-5.6 Sol88.8
GPT-5.584.9
Opus 4.882.9
Kimi K382.6
GPT-5.3-Codex79.3
GPT-5.6 Terra78.3
Opus 4.678.0
GPT-5.477.7
Opus 4.776.4
GPT-5.272.2
Gemini 3.1 Pro Preview72.1
GLM-5.270.1
Gemini 3 Pro Preview69.9
Sonnet 568.8
Sonnet 4.666.1
Opus 4.563.7
Gemini 3.5 Flash62.6
Gemini 3 Flash Preview61.6
GPT-5.6 Luna60.9
GPT-5.160.8
GPT-560.7
GPT-5 Pro60.4
GPT-5.4 Mini60.3
o3-pro58.2
GLM-5.157.1
Gemini 3.6 Flash56.1
Kimi K2.655.9
GPT-5-Codex54.5
Kimi K2.7 Code54.1
Gemini 2.5 Pro54.0
GPT-5 Mini52.7
O4 Mini52.6
o352.4
Gemma 4 31B IT52.3
Grok 4.2052.3
Gemini 3.1 Flash-Lite52.2
Grok 4.349.9
Loading Atlas data…