Atlas

Benchmarks

← All benchmarks

ForecastBench Baseline Market Brier Index

Forecasting · 2024-09-30

Difficulty-adjusted Brier Index on baseline market questions.

Top models (higher is better)

ModelScore
GPT-5.564.6
o363.9
Opus 4.163.0
GPT-4.562.7
Sonnet 4.562.5
Grok 4.2062.4
Grok Beta62.3
Claude 3.7 Sonnet62.2
O4 Mini62.0
Haiku 4.561.9
GLM-561.9
Claude 3.5 Sonnet (Oct 2024)61.8
GPT-4.161.5
Llama 3.3 70B Instruct61.2
Llama 3 8B Instruct61.2
Sonnet 461.1
Gemini 3 Pro Preview61.1
Llama 3.1 405B Instruct61.0
Kimi K2 Instruct60.9
Gemini 2.5 Pro Preview 03-2560.8
GPT-5 Mini60.8
Grok 4.1 Fast60.8
Grok 460.7
Opus 460.6
Opus 4.560.6
GPT-560.6
Llama 4 Scout Instruct60.6
Gemini 2.5 Flash Preview 04-1760.4
GPT-5 Nano60.4
Gemini 2.5 Pro60.3
GLM 4.5 Air60.3
Grok 4.360.2
DeepSeek-R160.0
GPT-4 Turbo60.0
Qwen3-235B-A22B59.9
GPT-5.259.8
Grok 4 Fast59.8
Opus 4.659.6
Gemini 1.5 Pro59.6
Opus 4.759.5
Loading Atlas data…