Atlas

Benchmarks

← All benchmarks

Aider Polyglot

Code · 2024-12-21

Aider's Polyglot benchmark contains 225 difficult Exercism tasks across C++, Go, Java, JavaScript, Python, and Rust. Edit format is a run-level harness setting recorded in ModelConfig.

Top models (higher is better)

ModelScore
GPT-588.0
o3-pro84.9
Gemini 2.5 Pro Preview 06-0583.1
Gemini 2.5 Pro82.2
o381.3
Grok 479.6
Gemini 2.5 Pro Preview 05-0676.9
DeepSeek-V3.2-Exp74.2
Gemini 2.5 Pro Preview 03-2572.9
Opus 472.0
O4 Mini72.0
DeepSeek-R1-052871.6
Gemini 2.5 Pro Experimental 03-2568.6
Claude 3.7 Sonnet64.9
O161.7
Sonnet 461.3
o3-mini60.4
Qwen3-235B-A22B59.6
Kimi K2 Instruct59.1
DeepSeek-R156.9
Gemini 2.5 Flash56.7
DeepSeek-V3-032455.1
Gemini 2.5 Flash Preview 05-2055.1
Grok 353.3
GPT-4.152.4
Claude 3.5 Sonnet (Oct 2024)51.6
Grok 3 Mini49.3
Gemini 2.5 Flash Preview 04-1747.1
GPT-4.544.9
gpt-oss-120b41.8
Qwen3 32B40.0
Gemini Exp-120638.2
Gemini 2.0 Pro Experimental 02-0535.6
o1-mini32.9
GPT-4.1 Mini32.4
Haiku 3.528.0
Gemini 2.5 Flash-Lite27.1
GPT-4o (2024-08-06)23.1
Gemini 2.0 Flash Experimental22.2
Qwen2.5-Max21.8
Loading Atlas data…