Atlas

Benchmarks

← All benchmarks

SAGE - Calculus

Math · 2025-10-08

The Calculus split of SAGE. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview78.4
Claude Opus 577.2
Opus 4.775.9
Kimi K375.6
Gemini 3.6 Flash75.3
Muse Spark 1.174.7
Opus 4.573.5
Opus 4.672.5
GPT-5.572.2
Gemini 3 Flash Preview71.0
GPT-5.471.0
Gemini 2.5 Pro70.7
GPT-5.169.8
Gemini 3 Pro Preview69.4
GPT-5.6 Sol67.3
GPT-5.6 Luna64.5
GPT-563.0
GPT-5.262.0
Sonnet 4.560.8
Sonnet 4.660.5
Gemini 3.5 Flash-Lite60.5
Grok 4.559.6
Gemma 4 31B IT59.3
GPT-5.4 Mini59.3
GPT-5.6 Terra59.3
Gemini 3.1 Flash-Lite Preview58.3
Gemini 2.5 Flash55.9
Gemini 2.5 Flash Preview (09-2025)55.6
o355.6
Haiku 4.549.4
Grok 4.348.1
Sonnet 446.6
Qwen3.6 Plus (2026-04-02)46.6
Opus 4.146.3
Qwen3.5-Flash44.4
Grok 4.2040.1
GPT-5 Mini39.8
Gemini 2.5 Flash-Lite Preview (09-2025)36.4
Grok 4.1 Fast33.3
O4 Mini33.3
Loading Atlas data…