Atlas

Benchmarks

← All benchmarks

LLM Position Bias Order Flip Rate

Chat & Writing · 2026-04-21

Position-bias diagnostic metric: LLM Position Bias Order Flip Rate. The benchmark uses paired story comparisons under order swaps.

Top models (lower is better)

ModelScore
MiMo-V2-Pro19.8
Claude Fable 527.3
Opus 4.827.4
Doubao Seed 2.0 Pro28.0
Gemini 3.5 Flash29.8
Opus 4.630.2
DeepSeek-V3.230.3
GLM-5.131.5
Qwen3.6 Plus (2026-04-02)33.8
Qwen3.7-Max34.8
MiniMax M334.9
Gemini 3.1 Pro Preview35.4
MiniMax M2.736.5
Trinity Large Thinking36.6
Sonnet 4.637.4
Opus 4.737.7
Grok 4.2039.0
DeepSeek-V4-Pro43.6
GPT-5.544.4
ERNIE 5.045.0
Gemini 3.1 Flash-Lite Preview45.3
Kimi K2.647.3
Qwen3.5 397B A17B48.5
Gemma 4 31B IT50.8
Kimi K2.551.6
Qwen3.5 122B A10B51.7
GPT-5.4 Mini54.7
GPT-5.457.4
Mistral Medium 3.157.9
Mistral Large 3 675B Instruct 251258.7
Mistral Medium 3.572.5
Loading Atlas data…