LiveBench Language Average
Classic NLP · 2024-06-12
LiveBench leaderboard aggregate for livebench language average. LiveBench is refreshed over time to reduce contamination and covers reasoning, coding, mathematics, language, data analysis, instruction following, and agentic coding.
Top models (higher is better)
| Model | Score |
|---|---|
| Claude Fable 5 | 89.5 |
| GPT-5.5 | 87.8 |
| Gemini 3.1 Pro Preview | 85.4 |
| Gemini 3.5 Flash | 84.6 |
| Opus 4.6 | 83.3 |
| GPT-5.4 | 82.6 |
| Opus 4.8 | 81.4 |
| Opus 4.5 | 81.3 |
| GPT-5.2 | 79.8 |
| Qwen3.7-Max | 79.7 |
| DeepSeek-V4-Pro | 78.1 |
| Opus 4.7 | 77.9 |
| Kimi K2.7 Code | 77.9 |
| MiniMax M3 | 76.8 |
| GLM-5.2 | 76.2 |
| Sonnet 4.6 | 76.1 |
| Kimi K2.6 | 75.1 |
| Qwen3.6 Plus (2026-04-02) | 75.0 |
| Sonnet 5 | 75.0 |
| GPT-5.2-Codex | 73.7 |
| Grok 4.3 | 73.6 |
| Grok Build 0.1 | 72.5 |
| GPT-5.4 Mini | 71.0 |
| DeepSeek-V4-Flash | 70.1 |
| Qwen3.6 27B | 63.3 |
| GPT-5.4 Nano | 62.5 |