AIME 2024 in italiano: matematica da competizione
30 domande · scoring numeric · contaminazione public
Cosa misura
AIME 2024 (American Invitational Mathematics Examination, esami I e II) tradotto in italiano: 30 problemi di matematica da competizione, ognuno con risposta un intero da 0 a 999. È matematica olimpica di livello liceale avanzato — algebra, teoria dei numeri, combinatoria, geometria — dove non basta ricordare una formula: serve ragionamento multi-step.
La matematica è invariata; è tradotta solo la parte in prosa (i numeri, le formule e le variabili restano identici all'originale). La ground truth è eseguibile: la risposta o è quel numero o non lo è, confronto esatto, nessun giudice LLM.
Com'è andata
Spread enorme, come previsto. Fable 5 è il primo a fare 30/30 (100%) — ma a $2.21 a run, 4× il costo di Opus. Poi Opus 4.8 (96.7%), Sonnet 5 (90%), Sonnet 4.6 (80%), gpt-5.4 (76.7%); e sotto crollano i piccoli: gpt-5.4-nano (43%), Haiku 4.5 (40%), gpt-5.4-mini (33%). I ragionatori grandi volano, i modelli senza vero ragionamento restano indietro.
Il rapporto qualità/prezzo racconta la storia. Il salto da Opus (96.7% a $0.54) a Fable (100% a $2.21) costa 4× per +3.3 punti: sull'AIME il "modello più capace" non ripaga il prezzo, se non ti serve l'ultima domanda. Sonnet 5 (90% a $0.47) è il miglior rapporto tra i forti.
Curiosità: gpt-5.4-nano (43%) batte gpt-5.4-mini (33%) — il nano spende più token di ragionamento e ci arriva più spesso. E i modelli OpenRouter (glm ~96%, qwen, deepseek) sono lenti e a tratti instabili sull'AIME (errori di rete, troncamenti): li recuperiamo a parte.
Perché è difficile (e discrimina)
L'AIME è pensato per selezionare i migliori studenti verso le olimpiadi: anche per un umano bravo è impegnativo. Per i modelli lo spread atteso è ampio — i modelli di ragionamento se la giocano, i piccoli e i locali crollano. È l'eval che mostra quanto un modello sa davvero ragionare su un problema nuovo, non recuperare un fatto.
Note di metodo
- Prompt che consente il ragionamento: a differenza di math-it (che chiede «solo il numero»), qui il modello può — e deve — ragionare passo per passo, e conclude con «Risposta: N». Si estrae l'ultimo numero del testo. Forzare una risposta secca penalizzerebbe la capacità di calcolo invece di misurarla.
- Scoring esatto (
numeric): la risposta AIME è un intero 0–999; nessuna tolleranza, o è esatta o è errata. - Contaminazione:
public. L'AIME 2024 è pubblico e con ogni probabilità nei dati di addestramento: parte del punteggio dei frontier può essere recall. La versione italiana e la natura di ragionamento riducono, non azzerano, il recall puro — da tenere presente nel leggere i risultati. - Figure: i pochi problemi con diagramma (
[asy]) restano risolvibili dal testo; il diagramma originale è solo illustrativo. - Fonte: problemi ufficiali AIME 2024 (MAA), recuperati dal dataset pubblico
Maxwell-Jia/AIME_2024; risposte intere verificate.
Aggiornare con la lettura dei risultati appena arrivano i run.