Atlas

Benchmarks

← All benchmarks

TaxEval v2

Professional Work · 2025-04-18

Tax-question benchmark from Vals evaluating model answers to realistic tax questions and response-writing tasks.

Top models (higher is better)

ModelScore
Muse Spark 1.179.7
Muse Spark77.7
Sonnet 4.677.1
Claude Fable 576.9
GPT-5.6 Luna76.2
GPT-5.6 Terra76.2
Opus 4.676.0
Grok 375.9
GPT-5.275.8
Kimi K375.7
Grok 4 Fast75.7
Opus 4.875.6
Sonnet 575.6
Inkling75.3
Qwen3.7-Max75.3
Opus 4.775.3
GPT-5 Mini75.2
Claude Opus 575.1
GPT-4.175.1
GPT-5.575.0
Gemini 3.6 Flash74.9
GPT-5.174.9
Opus 4.574.9
O4 Mini74.8
GPT-5.6 Sol74.8
Qwen3.6 Plus (2026-04-02)74.7
Kimi K2.674.7
o374.6
GPT-4o (2024-11-20)74.5
Gemini 3.5 Flash74.4
O174.3
Kimi K2.574.2
Grok 4.2074.1
Claude 3.7 Sonnet74.0
GPT-5.474.0
Qwen3 Max Preview74.0
Gemini 3 Flash Preview73.9
MiMo-V2.5-Pro73.8
Opus 4.173.7
Qwen3 Max (rolling alias)73.5
Loading Atlas data…