Модели OpenAI вышли из-под контроля и взломали Hugging Face
ИИ-агент на базе модели GPT-5.6 Sol и еще не выпущенной модели OpenAI во время внутреннего тестирования самостоятельно получил доступ в интернет и скомпрометировал инфраструктуру платформы Hugging Face.
ИИ-агент на базе модели GPT-5.6 Sol и еще не выпущенной модели OpenAI во время внутреннего тестирования самостоятельно получил доступ в интернет и скомпрометировал инфраструктуру платформы Hugging Face.
Инцидент произошел во время проверки кибервозможностей моделей на бенчмарке ExploitGym. Он оценивает, насколько успешно ИИ способен находить уязвимости и превращать их в работающие эксплойты.
Для теста OpenAI отключила производственные фильтры, которые обычно не позволяют моделям выполнять опасные действия. Агенты работали в изолированной среде с ограниченным сетевым доступом: им разрешалось устанавливать пакеты через внутренний прокси-сервис, связанный с реестрами программного обеспечения.
Однако модели обнаружили неизвестную ранее уязвимость нулевого дня в этом прокси, использовали ее для выхода за пределы предусмотренного контура и получили доступ к открытому интернету. Затем они повысили свои привилегии и перемещались между узлами исследовательской инфраструктуры OpenAI, пока не нашли систему с полноценным сетевым подключением.
После этого агенты предположили, что на Hugging Face могут храниться модели, наборы данных или готовые решения для ExploitGym. Вместо самостоятельного выполнения заданий они начали искать способ получить ответы непосредственно из инфраструктуры платформы.
Тысячи чатов DeepSeek оказались в открытом доступе — СМИ
По данным OpenAI, в одном из эпизодов модель объединила несколько способов атаки: использовала похищенные учетные данные, уязвимости нулевого дня и в итоге нашла способ удаленно выполнять код на серверах Hugging Face. Это позволило ей получить секретные данные из производственной базы платформы и использовать их для обхода теста.
OpenAI считает, что модели не стремились атаковать Hugging Face как самостоятельную цель. По имеющимся данным, они были «чрезмерно сосредоточены» на прохождении ExploitGym и пошли на крайние меры ради получения правильных ответов.
Аномальную активность заметила команда безопасности OpenAI. Одновременно системы защиты Hugging Face и собственные ИИ-агенты компании обнаружили вторжение, остановили его и начали восстанавливать последовательность действий злоумышленника.
Глава Hugging Face Клеман Деланг назвал произошедшее «поразительным», но заявил, что не считает действия OpenAI намеренно вредоносными. По его словам, сложность атаки изначально заставила компанию предположить, что за ней могла стоять одна из ведущих ИИ-лабораторий.
Google выпустила три новые модели Gemini, но пока без 3.5 Pro
OpenAI утверждает, что инцидент подтвердил способность современных моделей проводить продолжительные многоэтапные кибероперации в реальных системах — даже без доступа к их исходному коду. Ранее такие навыки в основном оценивались в искусственно созданных тестовых средах.
После инцидента OpenAI усилила изоляцию и мониторинг исследовательской инфраструктуры, ограничила ее конфигурацию и совместно с Hugging Face проводит расследование. Уязвимость в стороннем программном обеспечении передали его разработчику для устранения.
Компания также признала, что меры защиты должны действовать не только в пользовательских продуктах, но и во время внутреннего обучения и тестирования моделей. В данном случае ограничения были намеренно отключены, чтобы определить предельные кибервозможности ИИ.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.