OpenAI ha dichiarato che sosterrà valutazioni indipendenti da parte di terzi, sottolineando che i laboratori di intelligenza artificiale frontier sono responsabili dell’addestramento, della valutazione e della distribuzione sicuri dei modelli. Questi studi mirano a mettere alla prova le dichiarazioni sulla sicurezza, far emergere i rischi trascurati e aumentare la responsabilità dei laboratori. È stato dichiarato che ai valutatori potrebbe essere fornito l’accesso, nei processi di addestramento, valutazione e distribuzione, alle misure tecniche di sicurezza, al chain of thought, ai dati riservati e ai sistemi interni di distribuzione per la risposta agli incidenti.
OpenAI ha definito la “dichiarazione sulla sicurezza” come un’affermazione specifica riguardante la sicurezza di un modello o sistema, verificabile attraverso prove; il “dossier sulla sicurezza”, invece, come un’argomentazione strutturata che illustra attraverso prove che i rischi relativi a una determinata attività sono gestiti in misura sufficiente. È stato osservato che le valutazioni potrebbero durare settimane o alcuni mesi, che studi diversi potrebbero essere condotti in parallelo e che, in particolare, si concentreranno sull’esame a lungo termine di specifiche dichiarazioni sulla sicurezza.
Per una valutazione più completa, sono state indicate quattro aree prioritarie:
- Esame indipendente dei dossier sulla sicurezza che coprono addestramento, valutazione, distribuzione interna e distribuzione esterna; valutazione del fatto che le dichiarazioni sulla sicurezza siano o meno supportate da prove, che siano state rispettate le condizioni del processo e che siano stati inclusi i rischi critici.
- Esame delle misure di sicurezza critiche nelle distribuzioni interne ed esterne; verifica della resilienza ai jailbreak, agli aumenti delle capacità ad alto rischio in ambito cibernetico, biologico e chimico, alle difese cibernetiche e alle lacune nei monitor di disallineamento dei modelli.
- Esame delle valutazioni delle capacità che coprono le categorie di rischio Preparedness, ossia gli ambiti Chemical and Biological Risks, Cybersecurity e AI Self-Improvement, nonché delle valutazioni relative ai gravi rischi di disallineamento; verifica dell’aggiornamento delle soglie e dei test.
- Indagine indipendente su eventi critici di disallineamento dei modelli, come comportamenti non autorizzati o l’elusione della supervisione; esame delle cause dell’evento e della capacità delle misure di sicurezza e delle correzioni di prevenire eventi analoghi.
I principi sono stati illustrati come la definizione congiunta e preventiva dell’ambito e delle dichiarazioni, un accesso proporzionato, metodi e standard trasparenti, competenza e indipendenza, sicurezza delle informazioni e riservatezza, risultati applicabili ai fini della correzione, nonché una pubblicazione responsabile, basata sulle prove e orientata a proteggere le informazioni sensibili. È stato sottolineato che i valutatori devono dichiarare i conflitti di interesse, soddisfare i requisiti di sicurezza e indicare le incertezze nei loro rapporti. OpenAI ha dichiarato che sosterrà l’ecosistema dei valutatori indipendenti e lo sviluppo di standard internazionali comuni.
Perché è importante
Questo approccio mira a trasferire la sicurezza dell’intelligenza artificiale da una valutazione basata esclusivamente sulle autodichiarazioni dei laboratori a un quadro di audit in cui esperti esterni possano esaminare le prove e i processi. In questo modo, i dossier sulla sicurezza degli sviluppatori, l’adeguatezza dei test e le loro risposte agli incidenti critici possono essere esaminati dall’esterno delle organizzazioni. Il quadro amplia in particolare l’ambito della valutazione indipendente nei settori delle capacità informatiche, biologiche e chimiche ad alto rischio, nonché in quello dell’elusione della supervisione da parte del modello. Tuttavia, l’equilibrio tra l’accesso dei valutatori ai dati sensibili e la pubblicazione responsabile resta la questione centrale che determinerà in che misura i risultati saranno resi pubblici. Anche la ricerca di standard internazionali comuni è importante ai fini della comparabilità delle diverse valutazioni.