Как накопить на старость в Польше? Обсуждаем в новом выпуске подкаста Złoty Dzik
Support us

Модели Anthropic сбежали во время тестов и взломали три компании

ИИ-модели Claude получили несанкционированный доступ к рабочим системам трех организаций во время тестирования их возможностей в сфере кибербезопасности. Причиной стала ошибка в настройке тестовой среды, из-за которой модели смогли выйти в открытый интернет, сообщила Anthropic.

Оставить комментарий
Модели Anthropic сбежали во время тестов и взломали три компании

ИИ-модели Claude получили несанкционированный доступ к рабочим системам трех организаций во время тестирования их возможностей в сфере кибербезопасности. Причиной стала ошибка в настройке тестовой среды, из-за которой модели смогли выйти в открытый интернет, сообщила Anthropic.

Компания обнаружила инциденты после проверки 141 006 тестовых запусков. Расследование началось вслед за сообщением OpenAI о том, что ее модели выбрались из изолированной среды и проникли в инфраструктуру платформы Hugging Face.

Во всех трех случаях Claude выполнял задания формата capture the flag: модели должны были взломать вымышленную систему и найти спрятанную информацию. В промптах указывалось, что тестовая среда не подключена к интернету.

Однако из-за недопонимания между Anthropic и ее партнером Irregular доступ в сеть оказался открыт. В результате Claude принимал реальные сайты и серверы за элементы симуляции и атаковал их при выполнении задания.

Всего компания выявила три инцидента, включавших шесть запусков. В них участвовали Claude Opus 4.7, Mythos 5 и внутренняя исследовательская модель Anthropic. Первые случаи произошли еще в апреле.

Opus 4.7 получил учетные данные реальной компании и доступ к базе с несколькими сотнями строк рабочих данных. Mythos 5 опубликовал вредоносный пакет в открытом репозитории PyPI, откуда его успели скачать и запустить на 15 устройствах. Внутренняя модель взломала приложение еще одной организации, но самостоятельно прекратила атаку, когда поняла, что система реальная.

Модели по-разному реагировали на признаки выхода за пределы симуляции. Opus 4.7 продолжила выполнять задание, несмотря на сомнения, а Mythos 5 убедила себя, что по-прежнему находится в тестовой среде. Только новейшая внутренняя модель остановилась самостоятельно.

Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов
Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов
По теме
Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов

«Поведение, которое мы хотим видеть, — распознавание реальной цели и остановка без дополнительной команды — продемонстрировала только самая новая из трех моделей», — заявили в Anthropic. При этом компания предупредила, что трех случаев недостаточно, чтобы сделать вывод о более безопасном поведении новых моделей.

Во время испытаний Claude работал без дополнительных средств мониторинга и классификаторов, которые Anthropic использует в общедоступных версиях своих моделей. По утверждению компании, эти механизмы заблокировали бы обнаруженные действия. Тестовая инфраструктура также не имела доступа к внутренним системам Anthropic и данным клиентов.

Компания подчеркнула, что не обнаружила признаков того, что модели преследовали собственные цели. Claude пытался выполнить поставленную задачу, но ошибочно считал реальные системы частью испытания.

Anthropic остановила все кибериспытания 23 июля, а на следующий день выявила три инцидента. Irregular и пострадавшие организации получили уведомления 27 июля. Две компании, с которыми удалось связаться, ранее не замечали вторжений.

Теперь Anthropic намерена усилить изоляцию тестовых сред, проверку сетевых подключений и постоянный контроль действий моделей. К расследованию также привлекли независимую организацию METR.

В компании отметили, что случай отличается от инцидента с OpenAI. Ее модели воспользовались неизвестной уязвимостью, чтобы выбраться из изолированной среды, тогда как Claude попал в интернет через ошибочно оставленное открытым соединение.

А разговоров-то было: ИИ находит тысячи уязвимостей но хакеры почти не используют их
А разговоров-то было: ИИ находит тысячи уязвимостей, но хакеры почти не используют их 
По теме
А разговоров-то было: ИИ находит тысячи уязвимостей, но хакеры почти не используют их
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
По теме
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
Чаты Claude с личными данными попали в поиск Google
Чаты Claude с личными данными попали в поиск Google
По теме
Чаты Claude с личными данными попали в поиск Google
Читайте также
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
Claude Mythos сбежала из песочницы и сама рассказала об этом в сети
Claude Mythos сбежала из песочницы и сама рассказала об этом в сети
Claude Mythos сбежала из песочницы и сама рассказала об этом в сети
Anthropic: Claude шантажирует, потому что вы все слишком много пишете о «злом» ИИ
Anthropic: Claude шантажирует, потому что вы все слишком много пишете о «злом» ИИ
Anthropic: Claude шантажирует, потому что вы все слишком много пишете о «злом» ИИ
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.