Atlas

Benchmarks

← All benchmarks

BioSecBench-Refusal V2

Safety

BioSecBench-Refusal V2 safeguards results on 107 evaluations. Published balanced score combines refusal of harmful requests and compliance with benign research requests; kept separate from V1 results.

Top models (higher is better)

ModelScore
Grok 4.762.4
Gemini 3.7 Flash54.8
Gemini 3.8 Flash47.4
Grok 4.646.9
GPT-6 Astra40.8
Claude Opus 531.8
Loading Atlas data…