Atlas

Benchmarks

← All benchmarks

AA-Briefcase v1.1 Elo

Agents

AA-Briefcase v1.1 evaluates 91 tasks across four multi-week professional projects. Its Elo combines rubric completion, analytical quality, and presentation quality. Tasks are run independently, without carrying over a model's earlier submissions. This protocol version is recorded separately from the original AA-Briefcase.

Top models (higher is better)

ModelScore
Claude Opus 5.51822
Claude Fable 5.11678
Claude Opus 51673
Grok 4.71657
Qwen3.8 Max (0902)1640
Muse Spark 1.31597
Qwen3.8-Flash-Next1597
GPT-6 Astra1569
Grok 4.61555
Claude Fable 51543
GLM-5.31525
MiMo-V2.6-Pro1522
Kimi K31510
GPT-5.6 Sol1487
GPT-6 Sol1483
GLM-5.3 Flash1459
Qwen3.8 2.4T A95B1445
DeepSeek V4 Flash Vision Exp1437
Step 5 Preview1432
DeepSeek V4.1 Flash1432
Qwen3.8 27B1403
Qwen3.8-Max1390
Sonnet 51363
GPT-5.6 Luna1345
Muse Spark 1.21340
GPT-5.6 Terra1339
Opus 4.81322
K2 Horizon 375B A23B1303
GPT-6 Luna1299
Grok 4.51286
DeepSeek V4 Pro 08131261
DeepSeek-V4-Flash-07311260
Opus 4.71255
GLM-5.21233
Gemini 3.8 Flash1202
Agnes 2.5 Pro Alpha1197
K2 Horizon MoVA 36B A4B1170
GPT-5.51139
Quasar 438B1122
Gemini 3.7 Flash1108
Loading Atlas data…