Atlas

Benchmarks

← All benchmarks

BFCL v4 Overall Accuracy

Agents · 2025-07-17

Overall accuracy on the BFCL v4 function-calling benchmark.

Top models (higher is better)

ModelScore
Opus 4.577.5
Sonnet 4.573.2
Gemini 3 Pro Preview72.5
GLM 4.672.4
Grok 4.1 Fast69.6
Haiku 4.568.7
O3 (2025-04-16)63.0
Grok 463.0
Kimi K2 Instruct59.1
DeepSeek-V3.2-Exp56.7
Gemini 2.5 Flash56.2
GPT-5.2 (2025-12-11)55.9
GPT-5 Mini (2025-08-07)55.5
GPT-4.1 (2025-04-14)54.0
O4 Mini (2025-04-16)53.2
Qwen3 235B A22B Instruct 250752.1
GPT-5 Nano (2025-08-07)51.5
Nanbeige4-3B-Thinking-251151.4
GPT-4.1 Mini (2025-04-14)50.5
Qwen3 32B48.7
Command A46.5
Qwen3 8B42.6
Qwen3 30B A3B Instruct 250741.4
Qwen3 14B41.0
Mistral Large 2.1 (Instruct 2411)38.4
Mistral Medium 337.7
Llama 4 Maverick Instruct FP837.3
Mistral Small 3.2 24B Instruct 250637.1
Gemini 2.5 Flash-Lite36.9
Qwen3 4B Instruct 250735.7
GPT-4.1 Nano (2025-04-14)33.0
Command R7B (Dec 2024)32.1
Llama 3.3 70B Instruct31.9
Gemma 3 12B IT30.4
Gemma 3 27B IT29.5
Phi-428.8
Qwen3 1.7B28.4
Llama 4 Scout Instruct28.1
Mistral NeMo Instruct 240727.6
Nova 2 Lite27.1
Loading Atlas data…