Atlas

Benchmarks

← All benchmarks

Surface Evolver Bench Pass Rate

Agents · 2026-06-04

Strict task pass rate on Surface Evolver Bench, where a task passes only when static checks and all hidden dynamic checks pass. Models write complete Surface Evolver .fe simulation datafiles using the benchmark's documentation, execution-feedback, and structured-submission tool environment.

Top models (higher is better)

ModelScore
Claude Fable 587.5
GPT-5.6 Sol87.5
GPT-5.575.0
Opus 4.868.8
GPT-5.6 Terra68.8
Grok 4.550.0
Gemini 3.5 Flash37.5
Muse Spark 1.137.5
Kimi K2.7 Code37.5
GLM-5.231.3
DeepSeek-V4-Pro25.0
Sonnet 518.8
GPT-5.6 Luna18.8
MiniMax M312.5
Qwen3.6 35B A3B12.5
Gemma 4 31B IT6.3
gpt-oss-120b6.3
Mistral Medium 3.56.3
Laguna M.16.3
Trinity Large Thinking6.3
Loading Atlas data…