Безопасность искусственного интеллекта — это инженерная задача; для её решения необходимы определённые требования, реализуемые меры контроля, ответственные лица и доказательства того, что защитные меры работают. По мере роста возможностей доступ к средствам защиты следует расширять, а эффективными практиками — делиться быстрее.
Несмотря на изменения в интернете и облачных вычислениях, базовые обязанности, такие как аутентификация, контроль доступа, ограничение воздействия и проверка защитных мер, сохраняются. AI-агенты, способные рассуждать, использовать инструменты и адаптироваться к данным, требуют применения этих принципов в новых условиях.
Безопасность агентов зависит от совместной защиты модели, harness, управляющего контекстом и рабочими процессами, среды выполнения, кода, данных, идентификационных данных, сервисов и инфраструктуры. Например, сетевая политика должна блокировать агента, который пытается по вредоносной инструкции отправить данные клиента неавторизованному получателю; защищённые журналы должны показывать вызов инструмента, решение об авторизации и результат. Разрешение на обновление записи не даёт права на экспорт; агент не может самостоятельно одобрить дополнительный доступ.
Среда выполнения должна независимо применять ограничения для файлов, сети и процессов. У агентов должны быть отслеживаемые идентификаторы, учётные данные, ограниченные задачей, чёткие политики доступа и одобрение со стороны человека. Необходимо проверять источник и целостность инструментов, а также подготовить процедуры отзыва доступа и ограничения инцидентов. NVIDIA OpenShell — это среда выполнения с открытым исходным кодом и защитой, которая применяет политики за пределами агента.
Почему это важно
Эта концепция показывает, что оценка AI-агентов только по создаваемым ими результатам может быть недостаточной: риск распространяется от инструментов, которыми пользуется агент, до данных, к которым он получает доступ, и среды, в которой он работает. Поэтому разработчикам, системным администраторам и командам безопасности необходимо не только расследовать нарушения постфактум, но и разграничивать, на каком уровне находятся обязанности, а также устанавливать превентивные ограничения. Неспособность агента преобразовать полномочия, предоставленные для выполнения задачи, в иной способ доступа демонстрирует определяющую роль объёма полномочий в проектировании безопасности. Нерешённым остаётся вопрос о том, по каким критериям эти меры контроля будут проверяться в различных рабочих процессах и как будут осуществляться отзыв доступа и локализация инцидента в случае сбоя защитных механизмов.
Термин: агент
Агент искусственного интеллекта — это программное обеспечение, которое не просто создаёт единственный ответ, а вызывает инструменты и выполняет многоэтапную работу для достижения цели.