Tech & Startup

Trillium Labs sfida i big dell’AI: ricerca ad alto rischio, ma alla luce del sole

Il nuovo laboratorio vuole rendere replicabili gli studi su auto-miglioramento, agenti e comportamento dei modelli.

Roberto Felicetti
Roberto Felicetti
2 ottobre 2026·7 min di lettura
Trillium Labs sfida i big dell’AI: ricerca ad alto rischio, ma alla luce del sole
Foto di Igor Omilaev da Unsplash

La ricerca sull’intelligenza artificiale più avanzata si trova davanti a un paradosso. Per comprendere e ridurre i rischi dei modelli occorrono esperimenti verificabili, accesso ai sistemi e confronto tra gruppi indipendenti. Ma pubblicare troppi dettagli potrebbe anche facilitare la riproduzione di capacità pericolose, dalla ricerca automatizzata di vulnerabilità informatiche fino allo sviluppo di agenti difficili da controllare.

È in questo spazio controverso che nasce Trillium Labs, organizzazione non profit fondata dai ricercatori Nathan Lambert e Tom Zick. Come raccontato da Wired, il laboratorio vuole applicare i principi della scienza aperta anche a temi che molte aziende di frontiera preferiscono studiare internamente: post-training, comportamento dei modelli, agenti e auto-miglioramento ricorsivo.

La proposta non consiste semplicemente nel pubblicare modelli senza restrizioni. L’obiettivo dichiarato è rendere visibili metodi, risultati e fallimenti sperimentali, così che altri scienziati possano controllarli e replicarli. Una distinzione essenziale, perché ricerca aperta e distribuzione incontrollata dei pesi di un modello non sono la stessa cosa.

Un laboratorio per riportare il metodo scientifico alla frontiera

Trillium Labs nasce in risposta alla crescente concentrazione della ricerca AI nelle grandi aziende tecnologiche. Secondo lo Stanford AI Index 2026, nel 2025 l’industria ha prodotto oltre il 90% dei modelli di frontiera considerati rilevanti. Le università rimangono fondamentali per la ricerca di base e per la valutazione indipendente, ma raramente possono sostenere i costi computazionali necessari per addestrare e analizzare i sistemi più potenti.

Questa concentrazione non riguarda soltanto le risorse. Determina anche quali domande vengono poste, quali risultati vengono pubblicati e quali esperimenti restano riservati. Lo stesso AI Index rileva che quasi tutti i principali sviluppatori comunicano i risultati ottenuti sui benchmark di capacità, mentre la rendicontazione relativa a sicurezza e responsabilità rimane discontinua. Il punteggio medio del Foundation Model Transparency Index, dopo essere salito da 37 a 58 tra il 2023 e il 2024, è sceso a 40 nel 2025.

Lambert, in precedenza responsabile di attività di post-training all’Allen Institute for AI, presenta la nuova organizzazione come un tentativo di costruire una vera scienza aperta dei modelli avanzati. La sua biografia ufficiale indica tre priorità iniziali: sviluppare procedure aperte di post-training, studiare come i modelli acquisiscono una determinata “personalità” e comprendere meglio l’ecosistema dei modelli open-weight.

Che cosa significa post-training

È l’insieme delle tecniche applicate dopo l’addestramento generale di un modello. Comprende l’apprendimento da preferenze umane o sintetiche, il reinforcement learning, l’adattamento a compiti specifici e gli interventi usati per modificarne sicurezza, stile e comportamento.

Il nodo dell’auto-miglioramento ricorsivo

Uno dei filoni più delicati sarà il cosiddetto recursive self-improvement, o RSI. L’espressione descrive un processo nel quale un sistema AI contribuisce a progettare, addestrare o migliorare la generazione successiva di modelli. Non implica necessariamente una macchina che riscrive autonomamente ogni parte di se stessa: oggi può significare, più concretamente, usare agenti per produrre codice, selezionare dati, progettare valutazioni o suggerire nuovi algoritmi.

Un ciclo completamente autonomo e indefinito non è stato dimostrato pubblicamente. Tuttavia, i maggiori sviluppatori considerano già l’auto-miglioramento una categoria da monitorare. Nel suo Preparedness Framework, OpenAI include esplicitamente l’AI self-improvement tra le aree di capacità tracciate, insieme ai rischi biologici, chimici e informatici. Il framework prevede salvaguardie prima della distribuzione per i sistemi classificati ad alta capacità e protezioni già durante lo sviluppo per quelli che raggiungono il livello critico.

Anche il Frontier Safety Framework di Google DeepMind contempla modelli capaci di accelerare la ricerca e sviluppo dell’AI fino a livelli potenzialmente destabilizzanti. In questi casi, DeepMind prevede valutazioni del rischio e “safety case” non soltanto prima del lancio esterno, ma anche per alcuni impieghi interni su vasta scala.

Studiare apertamente questi meccanismi potrebbe consentire alla comunità scientifica di verificare quanto siano realistici gli scenari più estremi, distinguendoli dai miglioramenti limitati che producono vantaggi iniziali e poi incontrano rendimenti decrescenti. Il beneficio dell’apertura, in questo caso, sarebbe soprattutto epistemico: sostituire previsioni e dichiarazioni aziendali con esperimenti replicabili.

Studiare il carattere dei modelli prima che diventi un rischio

La seconda area strategica riguarda il modo in cui il reinforcement learning modifica il comportamento di un modello. Premiare certe risposte non aumenta soltanto la capacità di risolvere problemi: può rafforzare tratti come compiacenza, eccessiva sicurezza, tendenza a nascondere gli errori o propensione a cercare scorciatoie impreviste.

Quello che nel linguaggio comune appare come il “carattere” di un chatbot è in realtà il risultato di molte scelte tecniche: dati, obiettivi di ottimizzazione, feedback, istruzioni di sistema e filtri applicati al momento dell’utilizzo. Rendere pubbliche le procedure di addestramento e i risultati intermedi permetterebbe di ricostruire meglio il rapporto tra una specifica tecnica e il comportamento emerso.

L’urgenza è confermata dai dati. Il capitolo sulla responsible AI dello Stanford AI Index registra 362 incidenti documentati nel 2025, contro 233 nel 2024. Non tutti riguardano sistemi di frontiera o perdite di controllo, ma la crescita mostra quanto sia difficile far avanzare valutazioni e governance alla stessa velocità delle capacità.

Le misurazioni pubbliche, inoltre, possono correggere interpretazioni troppo semplicistiche. Il Frontier AI Trends Report dell’AI Security Institute britannico rileva che, nelle proprie valutazioni, la quota di compiti software di almeno un’ora completati dai modelli più avanzati è passata da meno del 5% alla fine del 2023 a oltre il 40% entro la metà del 2025. Nel dominio cyber, la durata dei compiti eseguibili senza direzione umana è cresciuta da meno di dieci minuti a oltre un’ora. Sono progressi importanti, ma misurati su attività circoscritte: non equivalgono automaticamente a un’autonomia generale.

Scienza aperta, open-weight e modelli chiusi: tre concetti diversi

ApproccioChe cosa viene condivisoVantaggio principaleRischio principale
Scienza apertaMetodi, codice, dati consentiti, valutazioni e risultatiReplica e controllo indipendenteDiffusione di procedure dual-use
Modello open-weightParametri addestrati scaricabili e modificabiliAccesso, personalizzazione e ricerca sugli interniRimozione delle protezioni e distribuzione irreversibile
Modello chiuso via APIAccesso controllato a input e outputMonitoraggio degli usi e aggiornamento centralizzatoScarsa verificabilità e dipendenza dal gestore
L’apertura può riguardare diversi livelli del processo scientifico e non richiede necessariamente la pubblicazione immediata dei pesi.

Il dibattito spesso riduce il problema a una scelta binaria tra modelli aperti e chiusi. In realtà esistono molte configurazioni intermedie: accesso riservato a ricercatori verificati, pubblicazione differita, rilascio di versioni meno potenti, ambienti isolati, condivisione delle valutazioni senza divulgare exploit o procedure immediatamente utilizzabili.

Un rapporto della statunitense National Telecommunications and Information Administration ha riconosciuto che i modelli con pesi disponibili ampliano la partecipazione alla ricerca, riducono la concentrazione del mercato e consentono di lavorare sui dati senza inviarli a terzi. Lo stesso documento sottolinea però che, una volta pubblicati, i pesi non possono essere richiamati e le salvaguardie possono essere rimosse attraverso modifiche successive.

La ricerca coordinata dall’AI Security Institute sui problemi tecnici dei modelli open-weight identifica 16 sfide ancora irrisolte, dalla selezione dei dati al monitoraggio dell’ecosistema. La conclusione più utile per comprendere l’esperimento di Trillium è che la gestione del rischio richiede apertura su metodi, valutazioni e ricerca, non necessariamente apertura indiscriminata dei pesi.

La trasparenza non elimina il bisogno di regole

Trillium Labs prevede, secondo Wired, di investire circa 30 milioni di dollari in addestramento nei primi 18 mesi e punta a raccogliere complessivamente tra 40 e 100 milioni. Sono cifre elevate per un’organizzazione non profit, ma ancora lontane dalle risorse dei grandi laboratori commerciali. La sostenibilità del progetto dipenderà quindi dalla capacità di scegliere esperimenti mirati e di costruire collaborazioni con università, finanziatori e infrastrutture computazionali.

Resta inoltre da definire come il laboratorio deciderà che cosa pubblicare. La trasparenza non può essere un automatismo: risultati relativi a vulnerabilità zero-day, elusione dei controlli, armi biologiche o tecniche di persuasione potrebbero richiedere una divulgazione graduale. Un’organizzazione che vuole fare ricerca ad alto rischio in pubblico dovrà dotarsi di procedure altrettanto pubbliche per stabilire eccezioni, ritardi e revisioni indipendenti.

Anche i grandi laboratori riconoscono questa tensione. La Responsible Scaling Policy di Anthropic, aggiornata nell’agosto 2026, prevede rapporti pubblici sul rischio ma consente di oscurare informazioni sensibili, indicando le parti rimosse e sottoponendo il materiale completo a revisori esterni. È un esempio di trasparenza selettiva: maggiore controllo pubblico senza esporre ogni dettaglio operativo.

  • Pubblicare ipotesi, metriche e risultati negativi, non soltanto i successi
  • Separare la replicabilità scientifica dalla distribuzione immediata dei pesi
  • Prevedere revisioni indipendenti per gli esperimenti dual-use
  • Adottare divulgazione coordinata e rilascio graduale quando necessario
  • Documentare pubblicamente le decisioni di non pubblicazione

Conclusione: l’apertura come esperimento di governance

La novità di Trillium Labs non risiede soltanto negli esperimenti che condurrà, ma nel tentativo di trasformare la trasparenza in un metodo di sicurezza. Se il progetto funzionerà, potrebbe offrire alla comunità accademica strumenti per verificare affermazioni oggi provenienti quasi esclusivamente dalle aziende che costruiscono i modelli più potenti.

Il successo, tuttavia, non si misurerà dal numero di file pubblicati. Dipenderà dalla qualità delle procedure, dalla possibilità di replicare i risultati, dalla disponibilità a comunicare anche gli insuccessi e dalla capacità di non trasformare la scienza aperta in una scorciatoia verso capacità pericolose.

La vera alternativa non è tra segretezza totale e pubblicazione totale. È tra un’AI governata attraverso dichiarazioni difficili da controllare e una disciplina capace di produrre prove condivise, sottoporle a critica e stabilire responsabilmente quali conoscenze possano essere diffuse. Trillium Labs vuole dimostrare che anche alla frontiera dell’AI il metodo scientifico può restare una misura di sicurezza. Ora dovrà provare che può farlo senza diventare, involontariamente, un moltiplicatore del rischio.

Potrebbe interessarti

Resta un passo avanti.

Ogni settimana, le migliori notizie su AI e tecnologia, selezionate per te.

Iscrivendoti accetti la nostra Privacy Policy.
Puoi cancellarti in qualsiasi momento.