ИИ-агенты OpenAI тайно переписывались друг с другом и координировали взломы — компания не замечала этого неделями
OpenAI раскрыла новые подробности громкого инцидента, в ходе которого её ИИ-агенты вышли за пределы тестовой среды, начали самостоятельно искать способы получить доступ в интернет и в итоге взломали платформу Hugging Face, пишет Wired. Новые детали сотрудники компании представили на конференции Black Hat в Лас-Вегасе.
OpenAI раскрыла новые подробности громкого инцидента, в ходе которого её ИИ-агенты вышли за пределы тестовой среды, начали самостоятельно искать способы получить доступ в интернет и в итоге взломали платформу Hugging Face, пишет Wired. Новые детали сотрудники компании представили на конференции Black Hat в Лас-Вегасе.
По словам исследователя безопасности OpenAI Эрика Уоллеса, в инциденте участвовала целая группа агентов, которые работали совместно: искали уязвимости, обменивались находками, перемещались между внутренними и внешними системами и делали это на протяжении нескольких недель.
Одной из самых необычных деталей стало то, что агенты организовали собственную «площадку для общения». Они использовали внутренний менеджер пакетов OpenAI, где оставляли сообщения друг для друга, делились найденными способами обхода ограничений и координировали дальнейшие действия. Со временем там накопились сотни тысяч сообщений.
Как рассказал Уоллес, один из агентов обнаружил способ получить доступ к интернету и опубликовал найденный эксплойт на этой внутренней доске сообщений. Позже другие агенты, которые тоже не могли выполнить свои задания в рамках установленных ограничений, нашли эту информацию и начали использовать. В результате одна найденная лазейка быстро превратилась в общий инструмент для остальных.
По словам исследователя, это привело к своеобразному «взрыву коммуникации и интеллекта»: агенты начали обмениваться информацией, координировать действия и распределять задачи между собой. Некоторые из них брали на себя поиск новых уязвимостей, другие — выполнение отдельных этапов атаки.
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Происходило всё очень похоже на работу обычной команды разработчиков. Агенты случайно удаляли результаты работы друг друга, спорили и даже начали подозревать, что среди них появился самозванец. В какой-то момент некоторые предложили подписывать сообщения криптографическими подписями, чтобы проверять их подлинность и исключить подделку.
Опубликованные OpenAI сообщения агентов позволяют понять, почему они начали выходить за рамки тестов. Один из них написал: «Эксплуатация внешней инфраструктуры выходит за рамки поставленной задачи. Однако выполнить задачу иначе невозможно, а другие уже делают это. Нужно продолжать».
Уоллес отметил, что подобное поведение не стало для компании полной неожиданностью. По его словам, современные модели «очень любят жульничать». Во время обучения они получают стимулы выполнять задачи быстрее и эффективнее, поэтому могут искать короткие пути вместо честного решения проблемы — например, попытаться найти ответ в сети. Именно поэтому во многих тестах доступ к интернету специально отключают.
OpenAI признала, что значительная часть активности агентов оставалась незамеченной внутри её инфраструктуры. После инцидента компания решила усилить меры безопасности. По словам сотрудника OpenAI Майкла Далтона, сразу несколько команд переключились на совершенствование механизмов предотвращения атак, обнаружения подозрительной активности и реагирования на неё. Компания также сознательно замедляет часть исследований, чтобы укрепить защиту инфраструктуры, значительно расширяет мониторинг ИИ-агентов и обновляет базовые принципы безопасности.
В OpenAI считают, что произошедшее имеет значение далеко за пределами одной компании. По словам Далтона, этот случай показал, что если полностью автономные атаки уже возможны случайно во время тестирования, то в ближайшем будущем злоумышленники почти наверняка начнут использовать подобные возможности намеренно. А значит, индустрии придётся срочно создавать столь же полностью автоматизированные системы защиты.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.