Перейти к содержанию
Русский
Материал FikirPilot

Приоритеты и принципы эффективных оценок третьими сторонами

Обновлено: 04.10.2026 · 3 мин чтения · 439 слов

Опубликовано: · Новость поступила: · Время обработки: 271 ч 44 мин

Источник проверен:

Приоритеты и принципы эффективных оценок третьими сторонами
Проверка безопасности в серверной комнате

OpenAI объявила, что будет поддерживать независимые оценки третьих сторон, подчеркнув, что лаборатории передового искусственного интеллекта несут ответственность за безопасное обучение, оценку и развертывание моделей. Эти работы призваны проверять заявления о безопасности, выявлять упущенные риски и повышать подотчетность лабораторий. Сообщается, что оценщикам может быть предоставлен доступ к техническим мерам безопасности в процессах обучения, оценки и развертывания, к chain of thought, конфиденциальным данным и внутренним системам развертывания для реагирования на инциденты.

OpenAI определила «заявление о безопасности» как конкретное утверждение, касающееся безопасности модели или системы и поддающееся проверке с помощью доказательств, а «досье безопасности» — как структурированный аргумент, в котором с помощью доказательств объясняется, что риски для конкретной деятельности управляются в достаточной степени. Отмечается, что оценки могут занимать недели или несколько месяцев, разные исследования могут проводиться параллельно, а основное внимание в долгосрочной перспективе будет уделяться изучению конкретных заявлений о безопасности.

Четыре приоритетных направления для более комплексной оценки были перечислены следующим образом:

  • Независимая проверка досье безопасности, охватывающих обучение, оценку, внутреннее и внешнее развертывание; оценка того, подкреплены ли заявления о безопасности доказательствами, соблюдаются ли условия процесса и охвачены ли критические риски.
  • Проверка критически важных мер безопасности при внутреннем и внешнем развертывании; тестирование устойчивости к jailbreak-атакам, росту высокорисковых кибернетических, биологических и химических возможностей, киберзащите и пробелам в системах мониторинга несоответствия модели.
  • Проверка оценок возможностей, охватывающих категории рисков Preparedness — Chemical and Biological Risks, Cybersecurity и AI Self-Improvement, — а также оценок серьезных рисков несоответствия; проверка актуальности пороговых значений и тестов.
  • Независимое расследование критических инцидентов, связанных с несоответствием модели, таких как несанкционированное поведение или уклонение от надзора; изучение причин инцидента и того, способны ли меры безопасности и исправления предотвратить аналогичные инциденты.

Принципы были определены как предварительное совместное согласование охвата и заявлений, пропорциональный доступ, прозрачные методы и стандарты, компетентность и независимость, информационная безопасность и конфиденциальность, практически применимые выводы для исправления, а также ответственная публикация, основанная на доказательствах и защищающая конфиденциальную информацию. Подчеркивается, что оценщики должны раскрывать конфликты интересов, соответствовать требованиям безопасности и указывать неопределенности в своих отчетах. OpenAI сообщила, что будет поддерживать экосистему независимых оценщиков и разработку общих международных стандартов.

Почему это важно

Этот подход призван перевести оценку AI-безопасности из сферы, где она основывается лишь на собственных заявлениях лабораторий, в рамки аудита, позволяющие внешним экспертам проверять доказательства и процессы. Благодаря этому документы разработчиков по безопасности, достаточность тестирования и их реакцию на критические инциденты можно будет изучать за пределами самих организаций. Рамки особенно расширяют сферу независимой экспертизы в таких областях, как высокорисковые кибернетические, биологические и химические возможности, а также уклонение модели от надзора. Однако баланс между доступом оценщиков к конфиденциальным данным и ответственным раскрытием информации остается ключевым вопросом, определяющим, в какой степени результаты будут представлены общественности. Поиск общих международных стандартов также имеет важное значение для сопоставимости различных оценок.

Источник: OpenAI