Atlas

Benchmarks

← All benchmarks

OTIS Mock AIME 2024-2025

Math · 2025-03-07

45 competition-style math problems from OTIS, harder than MATH Level 5 but easier than FrontierMath.

Top models (higher is better)

ModelScore
GPT-5.5 Pro100.0
GPT-5.5100.0
GPT-5.6 Sol100.0
Claude Fable 599.7
GPT-5.6 Terra99.7
Claude Opus 598.9
Opus 4.898.3
GPT-5.6 Luna98.3
Opus 4.797.8
GPT-5.497.8
Grok 4.597.8
Kimi K397.2
DeepSeek-V4-Pro96.7
Kimi K2.7 Code96.4
GPT-5.296.1
Kimi K2.696.1
Gemini 3.1 Pro Preview95.6
Gemini 3.5 Flash95.6
Qwen3.7-Max95.0
Sonnet 594.7
Opus 4.694.4
Gemini 3.6 Flash94.2
Grok 4.393.3
Gemini 3 Flash Preview92.8
GLM-5.192.2
Grok 4.2092.2
Kimi K2.592.2
Gemini 3 Pro Preview91.4
GPT-591.4
Qwen3.6-Max-Preview91.1
Qwen3.6 Plus (2026-04-02)90.6
Muse Spark88.9
gpt-oss-120b88.9
GPT-5.188.6
DeepSeek-V3.287.8
GPT-5.4 Nano87.8
GPT-5.4 Mini87.2
GPT-5 Mini86.7
Qwen3 235B A22B Thinking 250786.7
GLM-5.286.4
Loading Atlas data…