Post by Deedy on X
Deedy@deedydas
XSummary of all the CRAZY benchmark results from OpenAI's most advanced model, o3!
SWE-Bench Verified: 71.7%
Codeforces rating: 2727
Competition Math: 96.7%
PhD level science (GPQA): 87.7%
Frontier Math: 25.2% (previous best was 2%)
ARC-AGI: 87.5%
TRULY SUPERHUMAN.

1.2K likes27 repliesPosted Dec 20, 2024