Atlas

Benchmarks

← All benchmarks

OfficeQA Pro

Professional Work · 2026-03-09

Harder 133-question OfficeQA subset recommended for frontier models; default OfficeQA Pro split.

Top models (higher is better)

ModelScore
Opus 4.780.6
Claude Fable 569.9
Claude Mythos 567.1
Claude Opus 566.9
Opus 4.866.2
Kimi K363.3
GPT-5.6 Sol63.2
GPT-5.560.9
Sonnet 559.4
GLM-5.241.4
Gemini 3.1 Pro Preview18.1
Loading Atlas data…