ARC-AGI-3
An interactive benchmark for studying agentic intelligence through novel, abstract, turn-based environments in which agents must explore, infer goals, build internal models of environment dynamics, and plan effective action sequences without explicit instructions. A 100% score means AI agents can beat every game as efficiently as humans.
Best results
Frontier over time
All results
| # | Model | Score | Conditions | Eval date | Source | Flags |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol (Max) | 7.80% | — | 09 Jul 2026 | Official leaderboard | Primary |
| 2 | GPT-5.6 Sol (Extra High) | 7.00% | — | 09 Jul 2026 | Official leaderboard | |
| 3 | GPT-5.6 Sol (High) | 2.10% | — | 09 Jul 2026 | Official leaderboard | |
| 4 | GPT-5.6 Sol (Medium) | 1.10% | — | 09 Jul 2026 | Official leaderboard | |
| 5 | GPT-5.6 Terra (Max) | 0.80% | — | 09 Jul 2026 | Official leaderboard | Primary |
| 6 | GPT-5.6 Terra (Extra High) | 0.70% | — | 09 Jul 2026 | Official leaderboard | |
| 7 | GPT-5.6 Terra (High) | 0.50% | — | 09 Jul 2026 | Official leaderboard | |
| 8 | GPT-5.6 Sol (Low) | 0.30% | — | 09 Jul 2026 | Official leaderboard | |
| 9 | GPT-5.6 Luna (Max) | 0.20% | — | 09 Jul 2026 | Official leaderboard | Primary |
| 10 | GPT-5.6 Luna (Medium) | 0.20% | — | 09 Jul 2026 | Official leaderboard | |
| 11 | GPT-5.6 Luna (Low) | 0.20% | — | 09 Jul 2026 | Official leaderboard | |
| 12 | GPT-5.6 Terra (Medium) | 0.10% | — | 09 Jul 2026 | Official leaderboard | |
| 13 | GPT-5.6 Luna (High) | 0.10% | — | 09 Jul 2026 | Official leaderboard | |
| 14 | GPT-5.6 Terra (Low) | 0.00% | — | 09 Jul 2026 | Official leaderboard | |
| 15 | GPT-5.6 Luna (Extra High) | 0.00% | — | 09 Jul 2026 | Official leaderboard |
