Atlas

Benchmarks

← All benchmarks

MetagenomicsBench V1

Science

MetagenomicsBench component of benchmarks.bio's current V1 clean-rerun export, on 100 evaluations. Published macro-mean pass rates distinguish model and agent harness; missing scores remain missing.

Top models (higher is better)

ModelScore
Claude Opus 554.0
Opus 4.850.0
GPT-6 Astra49.7
Grok 4.748.7
Claude Opus 5.543.7
Sonnet 542.3
GPT-6 Sol42.0
Grok 4.642.0
Opus 4.735.3
Gemini 3.7 Flash31.7
GPT-5.6 Sol31.3
GPT-6 Luna30.7
Sonnet 4.628.3
Gemini 3.8 Flash26.7
GPT-5.6 Luna24.3
Loading Atlas data…