OpenAI kündigte an, unabhängige Bewertungen durch Dritte zu unterstützen, und erklärte, dass Frontier-KI-Labore für die sichere Schulung, Bewertung und Bereitstellung ihrer Modelle verantwortlich seien. Ziel dieser Arbeiten sei es, Sicherheitsbehauptungen zu überprüfen, übersehene Risiken aufzudecken und die Rechenschaftspflicht der Labore zu stärken. Den Evaluatoren könne während der Schulungs-, Bewertungs- und Bereitstellungsprozesse Zugriff auf technische Sicherheitsmaßnahmen, den Chain-of-Thought-Zugriff, vertrauliche Daten und interne Bereitstellungssysteme für die Reaktion auf Vorfälle gewährt werden.
OpenAI definierte eine „Sicherheitsbehauptung“ als eine bestimmte Aussage zur Sicherheit eines Modells oder Systems, die anhand von Belegen überprüft werden kann, und ein „Sicherheitsdossier“ als eine strukturierte Argumentation, die anhand von Belegen darlegt, dass die Risiken für eine bestimmte Tätigkeit ausreichend gesteuert werden. Es wurde festgehalten, dass die Bewertungen Wochen oder einige Monate dauern könnten, verschiedene Studien parallel durchgeführt werden könnten und der Schwerpunkt insbesondere langfristig auf der Untersuchung bestimmter Sicherheitsbehauptungen liegen werde.
Für eine umfassendere Bewertung wurden vier Schwerpunktbereiche aufgeführt:
- Unabhängige Prüfung der Sicherheitsdossiers, die Ausbildung, Evaluierung, interne und externe Verteilung abdecken; Bewertung, ob die Sicherheitsbehauptungen durch Belege gestützt werden, ob die Prozessbedingungen eingehalten wurden und ob kritische Risiken abgedeckt sind.
- Prüfung kritischer Sicherheitsmaßnahmen bei internen und externen Verteilungen; Test der Widerstandsfähigkeit gegen Jailbreaks, hochriskante Steigerungen der cyberbezogenen, biologischen und chemischen Fähigkeiten, Cyberabwehr sowie Lücken bei den Überwachungsmechanismen für Modellfehlanpassungen.
- Prüfung von Fähigkeitsevaluierungen, die die Preparedness risk categories, also Chemical and Biological Risks, Cybersecurity und AI Self-Improvement, abdecken, sowie von Evaluierungen schwerwiegender Fehlanpassungsrisiken; Überprüfung, ob die Schwellenwerte und Tests aktuell sind.
- Unabhängige Untersuchung kritischer Vorfälle der Modellfehlanpassung, etwa unbefugtes Verhalten oder das Umgehen von Überwachung; Untersuchung der Ursachen des Vorfalls sowie der Frage, ob Sicherheitsmaßnahmen und Korrekturmaßnahmen ähnliche Vorfälle verhindern können.
Als Grundsätze wurden die vorherige gemeinsame Festlegung von Umfang und Behauptungen, ein verhältnismäßiger Zugang, transparente Methoden und Standards, Fachkompetenz und Unabhängigkeit, Informationssicherheit und Vertraulichkeit, umsetzbare Erkenntnisse für Korrekturmaßnahmen sowie eine verantwortungsvolle Veröffentlichung erläutert, die auf Belegen basiert und sensible Informationen schützt. Es wurde betont, dass die Evaluierenden Interessenkonflikte offenlegen, die Sicherheitsanforderungen erfüllen und in ihren Berichten auf Unsicherheiten hinweisen müssen. OpenAI teilte mit, das Ökosystem unabhängiger Evaluierender und die Entwicklung gemeinsamer internationaler Standards unterstützen zu wollen.
Warum wichtig
Dieser Ansatz zielt darauf ab, die Bewertung der Sicherheit künstlicher Intelligenz von den Eigenerklärungen der Labore in einen Prüfrahmen zu überführen, in dem externe Fachleute Belege und Prozesse überprüfen können. Dadurch können die Sicherheitsdossiers der Entwickler, die Angemessenheit der Tests und ihre Reaktionen auf kritische Vorfälle von unabhängigen Stellen untersucht werden. Der Rahmen weitet den Umfang unabhängiger Prüfungen insbesondere auf Bereiche wie Hochrisikofähigkeiten im Cyber-, biologischen und chemischen Bereich sowie das Entziehen des Modells der Überwachung aus. Offen bleibt jedoch die zentrale Frage, wie das Gleichgewicht zwischen dem Zugang der Evaluierenden zu sensiblen Daten und einer verantwortungsvollen Veröffentlichung gestaltet wird – denn davon hängt ab, in welchem Umfang die Ergebnisse an die Öffentlichkeit gelangen. Auch die Suche nach gemeinsamen internationalen Standards ist für die Vergleichbarkeit unterschiedlicher Bewertungen von Bedeutung.