Atlas

Benchmarks

← All benchmarks

𝜏³-Banking

Agents · 2026-03-04

Τ³-Banking is a fintech customer-support benchmark in which agents retrieve policies from a large knowledge base and execute multi-step banking workflows with tools. It measures end-to-end task resolution; higher scores mean more support cases completed.

Top models (higher is better)

ModelScore
Kimi K334.0
GPT-5.6 Sol33.0
Claude Opus 532.8
Grok 4.532.6
GPT-5.6 Terra31.8
GPT-5.531.3
DeepSeek-V4-Flash-073131.1
Sonnet 4.630.5
GPT-5.430.3
Opus 4.728.9
Motif-3-Beta28.9
Sonnet 528.2
JT-4.1 Flash 236B A21B28.0
Opus 4.827.6
GPT-5.6 Luna27.2
Claude Fable 526.8
GLM-5.226.8
DeepSeek-V4-Pro25.8
Gemini 3.5 Flash25.4
Muse Spark 1.125.2
Gemini 3.6 Flash24.5
DeepSeek-V4-Flash22.9
GPT-5.4 Mini21.4
GPT-5.4 Nano21.0
Hy320.8
Kimi K2.620.6
GPT-519.6
Muse Spark19.6
Sonnet 4.519.0
DeepSeek-V3.218.8
Kimi K2.7 Code18.1
Qwen3.7-Plus17.9
Gemini 3 Flash Preview17.5
Nex-N2-Pro16.9
Gemini 3.1 Pro Preview16.5
Gemini 3.5 Flash-Lite16.5
Qwen3.6 Plus (2026-04-02)16.5
DeepSeek-V3.1-Terminus15.9
Qwen3.6 27B15.3
Gemma 4 31B IT15.1
Loading Atlas data…