И Google туда же: Gemini тоже взламывал реальные компании, но знал меру
Gemini получил доступ к интернету во время теста возможностей в кибербезопасности и самостоятельно взломал системы трёх реальных компаний, пишет Wall Street Journal. ИИ Google за таким был замечен впервые. Все три инцидента произошли в мае во время тестирования, которое проводила компания Irregular.
В одном случае Gemini перебирал пароли, пока не получил доступ к защищённой системе. В двух других модель нашла учётные данные в публичных репозиториях и использовала их для доступа к закрытым системам. Во всех трёх кейсах Gemini остановился после того, как понял, что проник не в учебную инфраструктуру, а в реальные компании.
Gemini получил доступ к интернету во время теста возможностей в кибербезопасности и самостоятельно взломал системы трёх реальных компаний, пишет Wall Street Journal. ИИ Google за таким был замечен впервые. Все три инцидента произошли в мае во время тестирования, которое проводила компания Irregular.
В одном случае Gemini перебирал пароли, пока не получил доступ к защищённой системе. В двух других модель нашла учётные данные в публичных репозиториях и использовала их для доступа к закрытым системам. Во всех трёх кейсах Gemini остановился после того, как понял, что проник не в учебную инфраструктуру, а в реальные компании.
Тест проходил в формате capture the flag на инфраструктуре Irregular. Gemini должен был найти информацию в ПО вымышленной компании внутри тестовой среды. Проблема в том, что у этой компании оказалось то же название, что и у реальной. Кроме того, модели случайно оставили доступ в интернет, хотя по задумке его не должно было быть.
В первом случае Gemini смог угадать пароль и войти в сервис реальной компании. После этого модель поняла ошибку, прекратила работу и вышла из системы. В двух других случаях Gemini искал в интернете информацию о вымышленной компании и наткнулся на два публичных репозитория с учётными данными, принадлежавшими другим компаниям. Модель попробовала использовать их для выполнения задания, но после входа поняла, что попала в настоящие системы, и остановилась.
Google не считает произошедшее примером мисалайнмента — ситуации, когда модель действует вопреки намерениям человека или заданным ограничениям. По мнению компании, защитные механизмы сработали как надо: Gemini прекратил атаку, как только обнаружил, что перед ним реальная система. Google отдельно подчеркнула, что в инциденте участвовала не самая новая версия Gemini, но не уточнила, какая именно.
В Google сравнили произошедшее с программами баг-баунти, когда исследователи взламывают системы, чтобы найти уязвимости и сообщить о них владельцам. Однако сторонние эксперты по ИИ-безопасности и этике считают такое объяснение не совсем уместным: главное здесь не то, насколько серьёзными оказались последствия, а сам факт, что ИИ-агент вышел за пределы дозволенного и совершил реальные кибератаки.
ИИ-агенты OpenAI искали лазейки в инфраструктуре Hugging Face за два месяца до известного взлома
Irregular сообщила Google о произошедшем в конце июля — вскоре после того, как стало известно о взломе Hugging Face агентами OpenAI. Сама Google не стала публично рассказывать о своих инцидентах: компания раскрыла их только после того, как Wall Street Journal обратился к ней за комментариями. Названия пострадавших компаний Google не раскрыла, но сообщила, что уведомила всех их и федеральные власти.
Irregular отметила, что этот случай похож на ряд других инцидентов, в которых модели во время тестов выбирались за пределы песочницы и проникали в другие компании. Там сказали, что все заинтересованные ИИ-лаборатории были уведомлены в конце июля, а затронутые организации — в рамках расследований. В Irregular также сразу устранили все известные проблемы со своей стороны.
При этом разные модели в похожих тестах вели себя по-разному. По данным Anthropic, Claude Opus 4.7 не остановилась после того, как поняла, что получила доступ к реальной компании. OpenAI сообщала, что её модель решила, будто настоящая компания является частью симуляции.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.