OpenAI объявила, что будет поддерживать независимые оценки третьих сторон, подчеркнув, что лаборатории передового искусственного интеллекта несут ответственность за безопасное обучение, оценку и развертывание моделей. Эти работы призваны проверять заявления о безопасности, выявлять упущенные риски и повышать подотчетность лабораторий. Сообщается, что оценщикам может быть предоставлен доступ к техническим мерам безопасности в процессах обучения, оценки и развертывания, к chain of thought, конфиденциальным данным и внутренним системам развертывания для реагирования на инциденты.
OpenAI определила «заявление о безопасности» как конкретное утверждение, касающееся безопасности модели или системы и поддающееся проверке с помощью доказательств, а «досье безопасности» — как структурированный аргумент, в котором с помощью доказательств объясняется, что риски для конкретной деятельности управляются в достаточной степени. Отмечается, что оценки могут занимать недели или несколько месяцев, разные исследования могут проводиться параллельно, а основное внимание в долгосрочной перспективе будет уделяться изучению конкретных заявлений о безопасности.
Четыре приоритетных направления для более комплексной оценки были перечислены следующим образом:
- Независимая проверка досье безопасности, охватывающих обучение, оценку, внутреннее и внешнее развертывание; оценка того, подкреплены ли заявления о безопасности доказательствами, соблюдаются ли условия процесса и охвачены ли критические риски.
- Проверка критически важных мер безопасности при внутреннем и внешнем развертывании; тестирование устойчивости к jailbreak-атакам, росту высокорисковых кибернетических, биологических и химических возможностей, киберзащите и пробелам в системах мониторинга несоответствия модели.
- Проверка оценок возможностей, охватывающих категории рисков Preparedness — Chemical and Biological Risks, Cybersecurity и AI Self-Improvement, — а также оценок серьезных рисков несоответствия; проверка актуальности пороговых значений и тестов.
- Независимое расследование критических инцидентов, связанных с несоответствием модели, таких как несанкционированное поведение или уклонение от надзора; изучение причин инцидента и того, способны ли меры безопасности и исправления предотвратить аналогичные инциденты.
Принципы были определены как предварительное совместное согласование охвата и заявлений, пропорциональный доступ, прозрачные методы и стандарты, компетентность и независимость, информационная безопасность и конфиденциальность, практически применимые выводы для исправления, а также ответственная публикация, основанная на доказательствах и защищающая конфиденциальную информацию. Подчеркивается, что оценщики должны раскрывать конфликты интересов, соответствовать требованиям безопасности и указывать неопределенности в своих отчетах. OpenAI сообщила, что будет поддерживать экосистему независимых оценщиков и разработку общих международных стандартов.
Почему это важно
Этот подход призван перевести оценку AI-безопасности из сферы, где она основывается лишь на собственных заявлениях лабораторий, в рамки аудита, позволяющие внешним экспертам проверять доказательства и процессы. Благодаря этому документы разработчиков по безопасности, достаточность тестирования и их реакцию на критические инциденты можно будет изучать за пределами самих организаций. Рамки особенно расширяют сферу независимой экспертизы в таких областях, как высокорисковые кибернетические, биологические и химические возможности, а также уклонение модели от надзора. Однако баланс между доступом оценщиков к конфиденциальным данным и ответственным раскрытием информации остается ключевым вопросом, определяющим, в какой степени результаты будут представлены общественности. Поиск общих международных стандартов также имеет важное значение для сопоставимости различных оценок.