Atlas

Benchmarks

← All benchmarks

Audio MultiChallenge (Text Output)

Multimodal · 2025-12-17

Audio MultiChallenge evaluates multi-turn conversational intelligence for audio-language models using 452 natural spoken conversations. This text-output track measures the percentage of conversations whose final text response satisfies every atomic rubric.

Top models (higher is better)

ModelScore
Gemini 3.1 Pro Preview66.8
Gemini 3 Pro Preview54.6
Inkling-Small Preview49.6
Gemini 2.5 Pro46.9
Gemini 2.5 Flash40.0
Qwen3.5-Omni-Plus37.6
Gemini 3.5 Flash-Lite33.6
MiMo-V2.530.4
Qwen3 Omni 30B A3B Thinking24.3
Nemotron 3 Nano Omni 30B A3B23.2
Gemma 3n E4B Instruct15.5
Phi-4-multimodal-instruct15.5
Loading Atlas data…