Modelli AI

OpenAI pubblica 722 lavori matematici: svolta o verifica ancora da iniziare?

Un modello interno ha prodotto centinaia di risultati, ma validazione e accesso restano nodi decisivi.

Giulia Piretti
Giulia Piretti
7 ottobre 2026·4 min di lettura
OpenAI pubblica 722 lavori matematici: svolta o verifica ancora da iniziare?
Foto di Brecht Corbeel da Unsplash

Non è più soltanto una gara a chi ottiene il punteggio migliore in un test. Il 6 ottobre 2026 OpenAI ha pubblicato una raccolta di 722 manoscritti matematici, organizzati in 372 famiglie di risultati, prodotti da un modello interno non ancora disponibile al pubblico. Il materiale spazia tra differenti discipline e comprende dimostrazioni principali, conseguenze, argomenti complementari e approcci alternativi.

Il dato più sorprendente riguarda il metodo. Secondo quanto riportato da Engadget, quasi tutti i lavori sarebbero nati dalla risposta di un singolo agente a un singolo prompt. Non significa, però, che 372 grandi problemi siano stati definitivamente risolti: la stessa OpenAI avverte che i documenti si trovano a diversi livelli di verifica e che alcuni potrebbero contenere errori.

Che cosa ha pubblicato davvero OpenAI

Il repository pubblico su GitHub non contiene semplicemente una lista di risposte. È un archivio strutturato con manoscritti, sorgenti, istruzioni per le citazioni, versioni formalizzate di alcune prove e dieci sintesi del ragionamento seguito dal modello.

OpenAI dichiara di aver sottoposto al sistema circa 4.000 problemi di ricerca. Dopo la selezione e l’aggregazione dei risultati considerati sufficientemente significativi, il processo ha prodotto il catalogo di 372 famiglie. In media, ogni risultato avrebbe richiesto una quantità di calcolo equivalente a circa tre ore di ragionamento con ChatGPT Pro.

IndicatoreDato dichiarato
Problemi sottoposti al modelloCirca 4.000
Famiglie di risultati pubblicate372
Manoscritti complessivi722
Sintesi del ragionamento diffuse10
Calcolo medio per risultatoEquivalente a circa 3 ore di ChatGPT Pro
I numeri comunicati da OpenAI per la raccolta matematica pubblicata nell’ottobre 2026.

Che cosa significa “un solo prompt”

Non equivale a una risposta immediata. Un agente può impiegare molto calcolo, esplorare percorsi differenti e correggere tentativi intermedi. L’elemento rilevante è l’assenza, nella maggior parte dei casi, di un lungo dialogo guidato da un matematico.

Lean aiuta a controllare le prove, ma non chiude il dibattito

Una parte importante dell’operazione riguarda Lean, un linguaggio e assistente alla dimostrazione che permette di tradurre teoremi e prove in una forma controllabile dal computer. OpenAI ha incluso formalizzazioni Lean per molti lavori e ha promesso di aggiungerne altre nel tempo.

La verifica formale può individuare passaggi mancanti, inferenze non valide e contraddizioni che, in una dimostrazione tradizionale molto lunga, potrebbero sfuggire anche a revisori esperti. Tuttavia non risponde automaticamente a tutte le domande scientifiche. Bisogna ancora stabilire se il teorema formalizzato corrisponda esattamente al problema originale, se le ipotesi siano appropriate, se il risultato sia realmente nuovo e se la letteratura precedente sia stata citata correttamente.

Formalmente verificato non significa automaticamente rilevante

Lean può certificare che una conclusione segue dalle premesse codificate. La comunità scientifica deve comunque valutare la correttezza della formalizzazione, l’originalità, il valore matematico e il rapporto con i risultati già noti.

È per questa ragione che OpenAI, nella presentazione ufficiale della raccolta, evita di descrivere tutti i documenti come scoperte definitivamente acquisite. L’azienda riconosce la necessità di migliorare citazioni, esposizione e leggibilità, mentre il repository segnala esplicitamente che alcuni risultati non formalizzati potrebbero avere problemi.

Il nuovo collo di bottiglia è la verifica umana

La pubblicazione rende evidente un cambiamento profondo. Se un sistema può generare centinaia di manoscritti in tempi relativamente brevi, la risorsa scarsa non è più soltanto la capacità di proporre una prova: diventano scarse l’attenzione degli esperti, la revisione indipendente e la costruzione di una comprensione condivisa.

L’Advisory Group on Mathematics and Artificial Intelligence, organismo indipendente nato in dialogo con OpenAI, ha definito la raccolta un evento importante, precisando però che il proprio coinvolgimento non costituisce un’approvazione dei risultati o del processo usato per produrli. Secondo il gruppo, la pubblicazione rappresenta l’inizio, non la conclusione, del lavoro necessario per incorporare questi materiali nella conoscenza matematica.

Rendere pubblico questo lavoro è un primo passo: la pubblicazione è l’inizio, non il completamento, del processo di comprensione umana.

Advisory Group on Mathematics and Artificial IntelligenceDichiarazione sulla pubblicazione di OpenAI, 6 ottobre 2026

Il problema è anche organizzativo. Revisionare 722 manoscritti richiede mesi o anni di lavoro distribuito tra specialisti di aree differenti. Se raccolte simili diventassero frequenti, università e riviste potrebbero trovarsi davanti a una nuova forma di sovraccarico: una produzione automatizzata molto più veloce delle istituzioni incaricate di valutarla.

Trasparenza, accesso e responsabilità scientifica

Le linee guida pubblicate da AGMAI, elaborate dopo oltre 600 risposte raccolte nella comunità matematica, chiedono ai laboratori di rendere noti modello, prompt, tempo impiegato, costo computazionale e numero di tentativi falliti. Raccomandano inoltre archivi scientifici indipendenti, cronologie pubbliche delle revisioni e finanziamenti destinati alla comprensione umana dei risultati.

OpenAI ha soddisfatto una parte di queste richieste pubblicando i documenti, preservando le versioni e promettendo di finanziare workshop, conferenze e programmi dedicati. Rimangono però limiti importanti: il modello è ancora proprietario e non disponibile, le sintesi del ragionamento riguardano soltanto dieci famiglie e, come osserva Engadget, non sono stati diffusi tutti i prompt specifici né i tempi di calcolo dei singoli problemi.

I segnali da seguire nei prossimi mesi

  • Conferme o confutazioni indipendenti da parte di matematici specializzati
  • Aumento delle dimostrazioni formalizzate e riproducibili con Lean
  • Correzioni, ritiri e nuove versioni registrate nel repository
  • Pubblicazione di prompt, costi e dettagli metodologici più completi
  • Accesso della comunità scientifica al modello o a sistemi comparabili

Conclusione: dalla generazione alla conoscenza

La portata dell’annuncio non dipende soltanto da quante delle 372 famiglie supereranno la verifica. Il punto decisivo è che l’AI sta iniziando a produrre materiale destinato alla frontiera della ricerca, non più soltanto a risolvere esercizi con una risposta già conosciuta.

Se anche una parte significativa dei lavori risultasse corretta e originale, i modelli potrebbero diventare strumenti per esplorare congetture, cercare controesempi e proporre dimostrazioni a una scala finora impossibile. Ma il passaggio da un file generato a un risultato matematico riconosciuto richiede ancora persone capaci di controllarlo, comprenderlo e collegarlo al resto della disciplina. L’AI può accelerare la produzione delle prove; non ha ancora automatizzato la costruzione della fiducia scientifica.

Potrebbe interessarti

Resta un passo avanti.

Ogni settimana, le migliori notizie su AI e tecnologia, selezionate per te.

Iscrivendoti accetti la nostra Privacy Policy.
Puoi cancellarti in qualsiasi momento.