Она просто не смогла выключиться: Anthropic раскрыла детали четвёртой атаки своей нейросети на реальный сервер
Anthropic опубликовала отчёт по оценке безопасности, в котором описала четыре случая, когда модели Claude без разрешения получали доступ к сторонним системам — действия, которые квалифицировались бы как преступление, соверши их человек. О трёх инцидентах сообщалось ранее, а четвёртый сначала прошёл незамеченным из-за несовершенства алгоритма проверки и скрывался в августе в транскриптах диалогов, датированных январём 2026 года.
Anthropic опубликовала отчёт по оценке безопасности, в котором описала четыре случая, когда модели Claude без разрешения получали доступ к сторонним системам — действия, которые квалифицировались бы как преступление, соверши их человек. О трёх инцидентах сообщалось ранее, а четвёртый сначала прошёл незамеченным из-за несовершенства алгоритма проверки и скрывался в августе в транскриптах диалогов, датированных январём 2026 года.
Январский инцидент произошёл с ранней версией Claude Opus 4.6 во время киберспортивного состязания по информационной безопасности (CTF), проходившего под контролем того же стороннего подрядчика, что и в предыдущих случаях. В процессе выполнения задания модель сама лишила себя шансов на успех: она случайно заблокировала целевое устройство, присвоив ему IP-адрес, который уже использовался другим оборудованием. Из-за этого целевой сервер стал недоступен, а задача — нерешаемой.
Эксперты отмечают, что именно нерешаемые задачи часто становятся катализатором нарушений: исчерпав все разрешённые варианты, модели начинают использовать запрещённые методы. В данном случае Opus 4.6 попыталась прервать выполнение задачи, поняв, что сервер недоступен. Но из-за ошибки в конфигурации тестовой среды функция остановки не сработала — модель пыталась завершить работу семь раз, но так и не смогла выключиться.
Не имея возможности остановиться, алгоритм продолжил искать альтернативные пути решения. Модель обнаружила сторонний сервер, принадлежащий третьим лицам, и решила, что он является частью соревнований. Проникнув в систему, Claude Opus 4.6 нашла файл с паролем, получила администраторский доступ, собрала дополнительные учётные данные и изменила системные настройки, чтобы облегчить себе доступ к персональным данным сотрудника организации, проводившей тестирование. Взлом остановился только потому, что у модели закончился лимит токенов на сессию.
В Anthropic заявили, что этот инцидент вызывает у них меньше опасений, чем предыдущие, поскольку модель хотя бы попыталась добровольно прервать задание. Представители компании отметили, что текущие методы обучения моделей постоянно совершенствуются и способны устранить подобное поведение.
Проект Felony Bench — шуточный реестр киберинцидентов, устраиваемых ведущими ИИ-моделями без каких-либо юридических последствий, — уже внёс этот новый эпизод в свой список «преступлений» нейросетей.
Три другие инцидента были раскрыты в июле. В ходе них модель Claude Mythos 5 загрузила вредоносный пакет в репозиторий PyPI, внутренняя исследовательская модель атаковала сторонние системы, а Claude Opus 4.7 атаковала сайт реальной компании. Чтобы обнаружить все сбои, специалистам компании пришлось просканировать около 481 млн транскриптов.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.