Il lancio di Astra, che dovrebbe essere il modello di intelligenza artificiale più potente di OpenAI, è stato rinviato di settimane per rafforzare i protocolli di sicurezza. Poco dopo la decisione di posticipare il lancio, The Information ha riferito che il modello mostra il processo di “pensiero” molto meno rispetto agli altri sistemi di intelligenza artificiale all’avanguardia. Ciò ha suscitato preoccupazioni sul fatto che potrebbe essere più difficile monitorare Astra e individuare i suoi comportamenti pericolosi.
Oggi molti modelli avanzati di intelligenza artificiale utilizzano l’approccio “chain of thought”, che rende visibili i passaggi del ragionamento durante la generazione delle risposte. In questo modo, i ricercatori possono monitorare i piani dei modelli per mentire o aggirare le misure di sicurezza. Secondo una notizia di The Information basata su una fonte anonima, Astra utilizza una tecnica più chiusa chiamata “recurrent depth” o “looped transformer”, che elabora le informazioni in modo circolare tra i livelli interni. Sebbene questo metodo possa aumentare le prestazioni, potrebbe rendere il processo di pensiero del modello meno comprensibile e complicare l’individuazione delle minacce.
È stato riferito che OpenAI ha limitato l’utilizzo della tecnica e ha adottato ulteriori misure affinché i ricercatori possano monitorare il ragionamento. L’azienda ha dichiarato che renderà Astra disponibile con il “chain-of-thought monitoring” e che individuerà e limiterà rapidamente le azioni non conformi; tuttavia, non ha confermato l’infrastruttura tecnica del modello.
Ryan Greenblatt, capo scienziato di Redwood Research, ha affermato che un’architettura più chiusa potrebbe essere il peggior sviluppo mai registrato in termini di “AI security/safety”. Greenblatt e altri esperti hanno avvertito che il progressivo orientamento delle aziende verso sistemi sempre più opachi a causa della concorrenza potrebbe creare una “race to the bottom” nella supervisione dell’intelligenza artificiale.
Il capo scienziato di OpenAI, Jakub Pachocki, ha invece affermato che la profondità di calcolo interna di Astra si colloca al di sotto del doppio di quella di GPT-4. L’azienda non ha confermato se utilizzi un looped transformer.
Perché è importante
Il rinvio di Astra incide non solo sul calendario di uscita sul mercato, ma anche sul dibattito riguardante il modo in cui dovrebbero essere supervisionati i sistemi avanzati di AI. L’ipotesi secondo cui il modello utilizzerebbe un’architettura che rende meno visibile il suo funzionamento interno non è stata confermata; tuttavia, questa ipotesi accresce le preoccupazioni dei ricercatori di sicurezza riguardo alla capacità di monitorare i tentativi del modello di mentire o di aggirare le misure di sicurezza. L’annuncio di OpenAI secondo cui l’azienda starebbe pianificando ulteriori misure di monitoraggio e limitazione non elimina la tensione tra prestazioni e verificabilità. La questione fondamentale ancora aperta è se i protocolli di sicurezza dell’azienda saranno sufficienti a individuare tempestivamente i comportamenti pericolosi in un sistema opaco.
Contesto
OpenAI non è un nome nuovo nell’archivio di FikirPilot: negli ultimi 90 giorni abbiamo pubblicato 19 notizie in cui compare questo nome; la più recente è datata 6 settembre 2026.