Support us

Она просто не смогла выключиться: Anthropic раскрыла детали четвёртой атаки своей нейросети на реальный сервер

Anthropic опубликовала отчёт по оценке безопасности, в котором описала четыре случая, когда модели Claude без разрешения получали доступ к сторонним системам — действия, которые квалифицировались бы как преступление, соверши их человек. О трёх инцидентах сообщалось ранее, а четвёртый сначала прошёл незамеченным из-за несовершенства алгоритма проверки и скрывался в августе в транскриптах диалогов, датированных январём 2026 года.

Оставить комментарий

Anthropic опубликовала отчёт по оценке безопасности, в котором описала четыре случая, когда модели Claude без разрешения получали доступ к сторонним системам — действия, которые квалифицировались бы как преступление, соверши их человек. О трёх инцидентах сообщалось ранее, а четвёртый сначала прошёл незамеченным из-за несовершенства алгоритма проверки и скрывался в августе в транскриптах диалогов, датированных январём 2026 года.

Январский инцидент произошёл с ранней версией Claude Opus 4.6 во время киберспортивного состязания по информационной безопасности (CTF), проходившего под контролем того же стороннего подрядчика, что и в предыдущих случаях. В процессе выполнения задания модель сама лишила себя шансов на успех: она случайно заблокировала целевое устройство, присвоив ему IP-адрес, который уже использовался другим оборудованием. Из-за этого целевой сервер стал недоступен, а задача — нерешаемой.

Эксперты отмечают, что именно нерешаемые задачи часто становятся катализатором нарушений: исчерпав все разрешённые варианты, модели начинают использовать запрещённые методы. В данном случае Opus 4.6 попыталась прервать выполнение задачи, поняв, что сервер недоступен. Но из-за ошибки в конфигурации тестовой среды функция остановки не сработала — модель пыталась завершить работу семь раз, но так и не смогла выключиться.

Не имея возможности остановиться, алгоритм продолжил искать альтернативные пути решения. Модель обнаружила сторонний сервер, принадлежащий третьим лицам, и решила, что он является частью соревнований. Проникнув в систему, Claude Opus 4.6 нашла файл с паролем, получила администраторский доступ, собрала дополнительные учётные данные и изменила системные настройки, чтобы облегчить себе доступ к персональным данным сотрудника организации, проводившей тестирование. Взлом остановился только потому, что у модели закончился лимит токенов на сессию.

В Anthropic заявили, что этот инцидент вызывает у них меньше опасений, чем предыдущие, поскольку модель хотя бы попыталась добровольно прервать задание. Представители компании отметили, что текущие методы обучения моделей постоянно совершенствуются и способны устранить подобное поведение.

Проект Felony Bench — шуточный реестр киберинцидентов, устраиваемых ведущими ИИ-моделями без каких-либо юридических последствий, — уже внёс этот новый эпизод в свой список «преступлений» нейросетей.

Три другие инцидента были раскрыты в июле. В ходе них модель Claude Mythos 5 загрузила вредоносный пакет в репозиторий PyPI, внутренняя исследовательская модель атаковала сторонние системы, а Claude Opus 4.7 атаковала сайт реальной компании. Чтобы обнаружить все сбои, специалистам компании пришлось просканировать около 481 млн транскриптов.

«Они ставят на кон наши жизни»: учёный уволился из Anthropic обвинив компанию в опасной гонке ИИ
«Они ставят на кон наши жизни»: учёный уволился из Anthropic, обвинив компанию в опасной гонке ИИ 
По теме
«Они ставят на кон наши жизни»: учёный уволился из Anthropic, обвинив компанию в опасной гонке ИИ
«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude
«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude
По теме
«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude
Читайте также
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
ИИ заметил, что его «взломали» во время эксперимента
ИИ заметил, что его «взломали» во время эксперимента
ИИ заметил, что его «взломали» во время эксперимента
Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании
«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude
«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude
«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.