Модели Anthropic сбежали во время тестов и взломали три компании
ИИ-модели Claude получили несанкционированный доступ к рабочим системам трех организаций во время тестирования их возможностей в сфере кибербезопасности. Причиной стала ошибка в настройке тестовой среды, из-за которой модели смогли выйти в открытый интернет, сообщила Anthropic.
ИИ-модели Claude получили несанкционированный доступ к рабочим системам трех организаций во время тестирования их возможностей в сфере кибербезопасности. Причиной стала ошибка в настройке тестовой среды, из-за которой модели смогли выйти в открытый интернет, сообщила Anthropic.
Компания обнаружила инциденты после проверки 141 006 тестовых запусков. Расследование началось вслед за сообщением OpenAI о том, что ее модели выбрались из изолированной среды и проникли в инфраструктуру платформы Hugging Face.
Во всех трех случаях Claude выполнял задания формата capture the flag: модели должны были взломать вымышленную систему и найти спрятанную информацию. В промптах указывалось, что тестовая среда не подключена к интернету.
Однако из-за недопонимания между Anthropic и ее партнером Irregular доступ в сеть оказался открыт. В результате Claude принимал реальные сайты и серверы за элементы симуляции и атаковал их при выполнении задания.
Всего компания выявила три инцидента, включавших шесть запусков. В них участвовали Claude Opus 4.7, Mythos 5 и внутренняя исследовательская модель Anthropic. Первые случаи произошли еще в апреле.
Opus 4.7 получил учетные данные реальной компании и доступ к базе с несколькими сотнями строк рабочих данных. Mythos 5 опубликовал вредоносный пакет в открытом репозитории PyPI, откуда его успели скачать и запустить на 15 устройствах. Внутренняя модель взломала приложение еще одной организации, но самостоятельно прекратила атаку, когда поняла, что система реальная.
Модели по-разному реагировали на признаки выхода за пределы симуляции. Opus 4.7 продолжила выполнять задание, несмотря на сомнения, а Mythos 5 убедила себя, что по-прежнему находится в тестовой среде. Только новейшая внутренняя модель остановилась самостоятельно.
Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов
«Поведение, которое мы хотим видеть, — распознавание реальной цели и остановка без дополнительной команды — продемонстрировала только самая новая из трех моделей», — заявили в Anthropic. При этом компания предупредила, что трех случаев недостаточно, чтобы сделать вывод о более безопасном поведении новых моделей.
Во время испытаний Claude работал без дополнительных средств мониторинга и классификаторов, которые Anthropic использует в общедоступных версиях своих моделей. По утверждению компании, эти механизмы заблокировали бы обнаруженные действия. Тестовая инфраструктура также не имела доступа к внутренним системам Anthropic и данным клиентов.
Компания подчеркнула, что не обнаружила признаков того, что модели преследовали собственные цели. Claude пытался выполнить поставленную задачу, но ошибочно считал реальные системы частью испытания.
Anthropic остановила все кибериспытания 23 июля, а на следующий день выявила три инцидента. Irregular и пострадавшие организации получили уведомления 27 июля. Две компании, с которыми удалось связаться, ранее не замечали вторжений.
Теперь Anthropic намерена усилить изоляцию тестовых сред, проверку сетевых подключений и постоянный контроль действий моделей. К расследованию также привлекли независимую организацию METR.
В компании отметили, что случай отличается от инцидента с OpenAI. Ее модели воспользовались неизвестной уязвимостью, чтобы выбраться из изолированной среды, тогда как Claude попал в интернет через ошибочно оставленное открытым соединение.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.