Atlas

Benchmarks

← All benchmarks

MortgageTax

Professional Work · 2025-03-05

Document-understanding benchmark evaluating whether models can read and reason over tax-certificate images used in mortgage workflows.

Top models (higher is better)

ModelScore
Claude Opus 572.1
Opus 4.770.3
Sonnet 570.0
Opus 4.869.9
Gemini 3.1 Pro Preview69.4
Gemini 3 Pro Preview69.1
Claude Fable 568.9
Gemini 2.5 Pro68.9
GPT-5.568.8
Gemini 3 Flash Preview68.7
Claude 3.7 Sonnet68.7
Opus 4.568.7
Gemini 3.5 Flash-Lite68.7
Opus 4.668.5
MiniMax M368.4
GPT-5.468.3
Qwen3.6 27B68.3
Gemini 3.5 Flash68.1
Gemini 3.1 Flash-Lite Preview68.0
Qwen3.6 Plus (2026-04-02)68.0
Sonnet 4.667.7
Gemini 3.6 Flash67.6
Qwen3.5-Flash67.4
GPT-5.6 Terra67.3
GPT-5.6 Luna67.3
GPT-5.6 Sol67.3
Gemini 2.5 Pro Experimental 03-2567.2
GPT-5.267.1
GPT-5 Mini66.9
Kimi K2.566.5
Kimi K366.3
Qwen3.7-Plus66.2
Muse Spark 1.166.1
GPT-4.165.9
Kimi K2.665.8
o365.7
GPT-4.1 Mini65.5
GPT-565.5
O4 Mini64.8
Claude 3.5 Sonnet (Oct 2024)64.1
Loading Atlas data…