BioSecBench-Refusal V2
Safety
BioSecBench-Refusal V2 safeguards results on 107 evaluations. Published balanced score combines refusal of harmful requests and compliance with benign research requests; kept separate from V1 results.
Top models (higher is better)
| Model | Score |
|---|---|
| Grok 4.7 | 62.4 |
| Gemini 3.7 Flash | 54.8 |
| Gemini 3.8 Flash | 47.4 |
| Grok 4.6 | 46.9 |
| GPT-6 Astra | 40.8 |
| Claude Opus 5 | 31.8 |