Judgemark v4
Chat & Writing · 2026-05-04
Judgemark v4 tests how well an LLM judge separates stronger from weaker fixed creative-writing samples. Its 0–100 score combines writing-score separability metrics.
Top models (higher is better)
| Model | Score |
|---|---|
| Opus 4.6 | 90.7 |
| GPT-5.5 | 87.8 |
| Opus 4.7 | 84.0 |
| Sonnet 4.6 | 82.1 |
| Claude Opus 5 | 78.8 |
| Gemini 3.1 Pro Preview | 78.7 |
| Opus 4.8 | 78.0 |
| Grok 4.5 | 77.1 |
| GLM-5.2 | 73.2 |
| Gemma 4 31B IT | 72.3 |
| GPT-5.4 | 72.1 |
| Sonnet 5 | 70.9 |
| Gemini 3.5 Flash | 68.8 |
| GLM-5.1 | 67.2 |
| Qwen3.5-27B | 60.5 |
| Gemini 3.1 Flash-Lite Preview | 58.8 |
| MiMo-V2.5-Pro | 57.9 |
| Kimi K2.6 | 57.3 |
| Qwen3.5 397B A17B | 54.2 |
| Qwen3.6 27B | 53.4 |
| Gemma 4 26B A4B IT | 53.0 |
| Grok 4.3 | 49.6 |
| DeepSeek-V4-Pro | 47.1 |
| Gemini 3 Flash Preview | 46.1 |
| Qwen3.6-Max-Preview | 45.1 |
| Qwen3.5 35B A3B | 40.5 |
| DeepSeek-V4-Flash | 36.8 |
| Qwen3.6 35B A3B | 32.7 |
| Qwen3.5-9B | 32.4 |
| Qwen3.6-Flash-2026-04-16 | 31.2 |
| Step 3.7 Flash | 28.0 |
| GPT-5.4 Nano | 27.5 |
| GPT-5.4 Mini | 27.3 |
| Mistral Small 4 | 16.5 |
| gpt-oss-120b | 15.5 |