Atlas

Benchmarks

← All benchmarks

TaxEval v2 - Correctness

Professional Work · 2025-04-18

The Correctness split of TaxEval v2. This child benchmark separates a source-reported subtask or subtrack from the parent aggregate so scores at different grains do not share one benchmark_slug.

Top models (higher is better)

ModelScore
Grok 4 Fast68.2
Muse Spark 1.166.9
GPT-5.6 Luna66.6
GPT-5.266.3
Claude Fable 565.8
Sonnet 4.665.8
GPT-5.6 Terra65.8
Muse Spark65.6
GPT-5.565.5
Kimi K365.3
GPT-5.6 Sol65.0
GPT-5.464.9
GPT-4o (2024-11-20)64.8
GPT-5.164.8
Opus 4.664.8
GPT-5 Mini64.8
Opus 4.864.5
O164.4
O4 Mini64.4
Qwen3.6 Plus (2026-04-02)64.2
Sonnet 564.0
o364.0
Opus 4.563.9
GPT-4.163.9
Grok 363.9
Opus 4.763.8
Gemini 3.6 Flash63.5
Inkling63.5
Qwen3.7-Max63.5
Grok 4.2063.4
Claude 3.7 Sonnet63.3
MiMo-V2.5-Pro63.1
GPT-5.4 Mini63.0
Opus 4.163.0
GPT-562.8
Kimi K2.662.7
Grok 4.562.6
Qwen3 Max Preview62.4
Gemini 3 Flash Preview62.3
GLM-5.262.1
Loading Atlas data…