#ModelAccuracyPaper
1GPT-5 (high)95.67β€”
2Grok 494.33β€”
3o4-mini (high)94.00β€”
4Qwen3 235B A22B 2507 (Reasoning)94.00β€”
5Grok 3 mini Reasoning (high)93.33β€”
6GPT-5 (medium)91.67β€”
7Qwen3 30B A3B 2507 (Reasoning)90.67β€”
8o390.33β€”
9DeepSeek R1 0528 (May '25)89.33β€”
10Gemini 2.5 Pro88.67β€”
11GLM-4.5 (Reasoning)87.33β€”
12Gemini 2.5 Pro Preview (Mar' 25)87.00β€”
13Llama Nemotron Super 49B v1.5 (Reasoning)86.00β€”
14o3-mini (high)86.00β€”
15MiniMax M1 80k84.67β€”
16EXAONE 4.0 32B (Reasoning)84.33β€”
17Gemini 2.5 Flash Preview (Reasoning)84.33β€”
18Gemini 2.5 Pro Preview (May' 25)84.33β€”
19Qwen3 235B A22B (Reasoning)84.00β€”
20GPT-5 (low)83.00β€”
21Gemini 2.5 Flash (Reasoning)82.33β€”
22MiniMax M1 40k81.33β€”
23Qwen3 32B (Reasoning)80.67β€”
24Sonar Reasoning Pro79.00β€”
25QwQ 32B78.00β€”
26Claude 4 Sonnet (Reasoning)77.33β€”
27o3-mini77.00β€”
28Sonar Reasoning77.00β€”
29Qwen3 14B (Reasoning)76.33β€”
30Claude 4 Opus (Reasoning)75.67β€”
31AutoTrainess: Teaching Language Models to Improve Language Models Autonomously26.67link
AIME aime Leaderboard