Atlas

Models

← All models

Qwen3 4B Thinking 2507

Alibaba · 2025-08-06 · 4B parameters

Qwen3-4B-Thinking-2507 is Alibaba's August 2025 reasoning-tuned update to the dense 4B Qwen3 model. It supports a 262,144-token context window and is a separate checkpoint from the Instruct variant.

Benchmark scores

BenchmarkScore
AA-LCR37.7
AA-Omniscience Index-60.8
AIME 202582.7
AIME 202682.5
Apex (MathArena)2.1
Apex Shortlist16.5
Artificial Analysis Intelligence Index12.0
Artificial Analysis Omniscience Accuracy12.7
Artificial Analysis Omniscience Hallucination Rate84.1
Artificial Analysis Openness Index44.4
ArXivMath 01/202623.9
ArXivMath 02/202618.0
ArXivMath 12/202532.4
Capability136.9
CritPt0.0
Final-Answer Comps — Overall38.5
GPQA Diamond66.7
HMMT Feb 202653.0
Humanity's Last Exam (Text-Only)5.9
IFBench (Artificial Analysis)49.8
LiveCodeBench (Artificial Analysis)64.1
SciCode (Artificial Analysis)25.6
Terminal-Bench Hard1.5
τ²-bench (Telecom)25.4
Loading Atlas data…