Atlas

Benchmarks

← All benchmarks

FrontierFinance v3.1 — Coverage and Catalyst Monitoring

Professional Work · 2026-07-06

Coverage and Catalyst Monitoring use-case slice of Samaya AI's FrontierFinance v3.1, containing 27 of the 220 public queries. It reports rubric qualification rate macro-averaged across queries in the slice.

Top models (higher is better)

ModelScore
Claude Fable 549.0
GPT-5.6 Sol46.7
GLM-5.246.4
Opus 4.843.2
GPT-5.541.5
DeepSeek-V4-Pro38.5
Gemini 3.1 Pro Preview32.1
Kimi K2.628.4
Loading Atlas data…