Atlas

Benchmarks

← All benchmarks

SAGE - Automata

Math · 2025-10-08

The Automata split of SAGE. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Qwen3-VL-Plus-2025-09-2345.6
Gemini 2.5 Flash44.0
Kimi K344.0
Gemini 2.5 Pro43.7
Opus 4.743.6
Gemini 3 Flash Preview43.3
Kimi K2.642.9
Gemini 3.1 Flash-Lite Preview42.1
Opus 4.841.7
Gemma 4 31B IT41.7
GPT-5.4 Mini41.3
GPT-5.540.5
Grok 4.2040.5
Claude Fable 539.7
GPT-5.6 Sol39.7
GPT-5.6 Terra38.9
Gemini 3.5 Flash38.5
Opus 4.538.1
Opus 4.638.1
MiniMax M337.3
O4 Mini37.3
o336.9
Qwen3.6 Plus (2026-04-02)36.5
Qwen3.6 27B35.7
Sonnet 4.635.3
Gemini 2.5 Flash Preview (09-2025)35.3
Grok 4.335.3
Qwen3.5-Flash34.9
Sonnet 534.9
Gemini 3.6 Flash34.9
Kimi K2.534.1
Sonnet 433.3
Gemini 2.5 Flash-Lite33.3
Claude Opus 532.5
Grok 4.532.5
Qwen3.7-Plus32.5
Gemini 3.1 Pro Preview32.1
GPT-5.232.1
GPT-5.6 Luna31.4
Gemini 2.5 Flash-Lite Preview (09-2025)31.0
Loading Atlas data…