evals/stream Benchmark LLMs in italiano
← tutti gli eval

AIME 2024 in italiano: matematica da competizione

30 domande · scoring numeric · contaminazione public

Caso d'uso: Ragionamento matematico spinto in italiano (ingegneria, ricerca, didattica avanzata): problemi da competizione dove non basta ricordare la formula, va costruita la soluzione.

Cosa misura

AIME 2024 (American Invitational Mathematics Examination, esami I e II) tradotto in italiano: 30 problemi di matematica da competizione, ognuno con risposta un intero da 0 a 999. È matematica olimpica di livello liceale avanzato — algebra, teoria dei numeri, combinatoria, geometria — dove non basta ricordare una formula: serve ragionamento multi-step.

La matematica è invariata; è tradotta solo la parte in prosa (i numeri, le formule e le variabili restano identici all'originale). La ground truth è eseguibile: la risposta o è quel numero o non lo è, confronto esatto, nessun giudice LLM.

Com'è andata

Spread enorme, come previsto. Fable 5 è il primo a fare 30/30 (100%) — ma a $2.21 a run, 4× il costo di Opus. Poi Opus 4.8 (96.7%), Sonnet 5 (90%), Sonnet 4.6 (80%), gpt-5.4 (76.7%); e sotto crollano i piccoli: gpt-5.4-nano (43%), Haiku 4.5 (40%), gpt-5.4-mini (33%). I ragionatori grandi volano, i modelli senza vero ragionamento restano indietro.

Il rapporto qualità/prezzo racconta la storia. Il salto da Opus (96.7% a $0.54) a Fable (100% a $2.21) costa per +3.3 punti: sull'AIME il "modello più capace" non ripaga il prezzo, se non ti serve l'ultima domanda. Sonnet 5 (90% a $0.47) è il miglior rapporto tra i forti.

Curiosità: gpt-5.4-nano (43%) batte gpt-5.4-mini (33%) — il nano spende più token di ragionamento e ci arriva più spesso. E i modelli OpenRouter (glm ~96%, qwen, deepseek) sono lenti e a tratti instabili sull'AIME (errori di rete, troncamenti): li recuperiamo a parte.

Perché è difficile (e discrimina)

L'AIME è pensato per selezionare i migliori studenti verso le olimpiadi: anche per un umano bravo è impegnativo. Per i modelli lo spread atteso è ampio — i modelli di ragionamento se la giocano, i piccoli e i locali crollano. È l'eval che mostra quanto un modello sa davvero ragionare su un problema nuovo, non recuperare un fatto.

Note di metodo

Aggiornare con la lettura dei risultati appena arrivano i run.