Atlas

Benchmarks

← All benchmarks

Judgemark v2.1

Chat & Writing · 2025-01-31

Earlier meta-evaluation benchmark for LLM judging ability.

Top models (higher is better)

ModelScore
Sonnet 4.694.1
Opus 4.692.9
Gemini 3 Pro Preview86.6
GLM-585.6
Qwen3.5 397B A17B85.5
Gemini 3 Flash Preview85.4
GPT-5.485.0
Sonnet 4.584.6
Qwen3.5-27B84.3
GPT-5.282.0
Sonnet 482.0
Qwen3.5-Flash81.8
Qwen3.5 35B A3B81.4
GPT-5 (2025-08-07)81.2
GPT-5.4 Mini81.1
Qwen3.5 122B A10B81.0
Gemini 3.1 Flash-Lite Preview80.9
Haiku 4.579.7
GLM-4.777.5
GPT-4.176.3
Grok 4.1 Fast75.8
o375.1
Qwen3.5-9B75.0
GPT-5 Mini (2025-08-07)74.5
Kimi K2 Instruct73.1
Gemini 2.5 Pro72.1
Mistral Large 3 675B Instruct 251268.2
DeepSeek-V3.266.3
GLM 4.7 Flash66.2
GPT-5.4 Nano64.5
MiniMax M2.564.5
GLM-4.563.4
Gemini 2.5 Flash63.0
GPT-5 Nano61.1
Qwen3 235B A22B Instruct 250759.7
Mistral Medium 358.5
GPT-4.1 Mini57.3
Qwen3-235B-A22B56.2
O4 Mini56.1
Gemini 2.5 Flash-Lite56.0
Loading Atlas data…