Atlas

Benchmarks

← All benchmarks

Public Benefits Bench v1.1

Professional Work · 2026-06-09

Social-services benchmark testing whether models can help people navigate SNAP benefits, eligibility, and application workflows.

Top models (higher is better)

ModelScore
Claude Opus 576.9
Claude Fable 570.4
Kimi K368.3
Opus 4.868.1
GPT-5.6 Sol66.5
Sonnet 566.0
MiniMax M364.1
DeepSeek-V4-Pro62.9
Sonnet 4.662.4
GPT-5.6 Terra62.4
GLM-5.161.8
Muse Spark 1.161.3
GPT-5.6 Luna61.2
GPT-5.560.9
Gemini 3.5 Flash59.5
Inkling-Small59.4
Inkling58.5
Kimi K2.656.6
Gemini 3.6 Flash56.6
Haiku 4.554.3
Gemini 3.1 Pro Preview53.8
Gemini 3.5 Flash-Lite51.8
Grok 4.351.7
Grok 4.1 Fast44.8
Laguna M.143.8
Laguna XS.241.4
Loading Atlas data…