Atlas

Benchmarks

← All benchmarks

SAGE

Math · 2025-10-08

Student Assessment with Generative Evaluation benchmark for evaluating or grading student responses with generative models.

Top models (higher is better)

ModelScore
Opus 4.756.1
Gemma 4 31B IT55.0
Opus 4.854.8
Kimi K354.3
GPT-5.6 Sol52.6
Opus 4.552.1
Claude Fable 551.9
Gemini 3 Flash Preview51.8
Opus 4.651.6
GPT-5.551.5
GPT-5.4 Mini50.8
MiniMax M350.6
Kimi K2.650.2
Gemini 3.5 Flash49.9
Kimi K2.549.9
Gemini 3.1 Flash-Lite Preview49.5
Claude Opus 549.4
GPT-5.249.3
Sonnet 548.9
Gemini 3.6 Flash48.7
Gemini 3.1 Pro Preview48.7
Gemini 3 Pro Preview47.6
Gemini 3.5 Flash-Lite47.3
GPT-5.6 Terra47.0
Sonnet 4.646.6
Muse Spark 1.145.6
Qwen3.6 27B45.6
Qwen3.6 Plus (2026-04-02)44.9
Gemini 2.5 Flash44.8
GPT-5.6 Luna44.2
Gemini 2.5 Flash Preview (09-2025)44.1
GPT-543.7
GPT-5.443.3
MiMo-V2.543.3
GPT-5.143.2
GPT-5 Mini43.0
Qwen3.5-Flash42.5
Qwen3-VL-Plus-2025-09-2342.1
Gemini 2.5 Pro41.9
o341.8
Loading Atlas data…