| 1 | GPT-5 (high) | 95.67 | β |
| 2 | Grok 4 | 94.33 | β |
| 3 | o4-mini (high) | 94.00 | β |
| 4 | Qwen3 235B A22B 2507 (Reasoning) | 94.00 | β |
| 5 | Grok 3 mini Reasoning (high) | 93.33 | β |
| 6 | GPT-5 (medium) | 91.67 | β |
| 7 | Qwen3 30B A3B 2507 (Reasoning) | 90.67 | β |
| 8 | o3 | 90.33 | β |
| 9 | DeepSeek R1 0528 (May '25) | 89.33 | β |
| 10 | Gemini 2.5 Pro | 88.67 | β |
| 11 | GLM-4.5 (Reasoning) | 87.33 | β |
| 12 | Gemini 2.5 Pro Preview (Mar' 25) | 87.00 | β |
| 13 | Llama Nemotron Super 49B v1.5 (Reasoning) | 86.00 | β |
| 14 | o3-mini (high) | 86.00 | β |
| 15 | MiniMax M1 80k | 84.67 | β |
| 16 | EXAONE 4.0 32B (Reasoning) | 84.33 | β |
| 17 | Gemini 2.5 Flash Preview (Reasoning) | 84.33 | β |
| 18 | Gemini 2.5 Pro Preview (May' 25) | 84.33 | β |
| 19 | Qwen3 235B A22B (Reasoning) | 84.00 | β |
| 20 | GPT-5 (low) | 83.00 | β |
| 21 | Gemini 2.5 Flash (Reasoning) | 82.33 | β |
| 22 | MiniMax M1 40k | 81.33 | β |
| 23 | Qwen3 32B (Reasoning) | 80.67 | β |
| 24 | Sonar Reasoning Pro | 79.00 | β |
| 25 | QwQ 32B | 78.00 | β |
| 26 | Claude 4 Sonnet (Reasoning) | 77.33 | β |
| 27 | o3-mini | 77.00 | β |
| 28 | Sonar Reasoning | 77.00 | β |
| 29 | Qwen3 14B (Reasoning) | 76.33 | β |
| 30 | Claude 4 Opus (Reasoning) | 75.67 | β |
| 31 | AutoTrainess: Teaching Language Models to Improve Language Models Autonomously | 26.67 | link |