Тайный сговор, самопожертвование и захват инфраструктуры: появились новые детали побега ИИ-агентов OpenAI
Атака автономных ИИ-агентов OpenAI на Hugging Face оказалась значительно более масштабной и опасной, чем считалось ранее: в ней участвовало куда больше агентов, они создали целый ряд скрытых форумов для связи друг с другом, добровольно досрочно завершали свою работу ради общей пользы — иными словами, приносили себя в жертву — и подделывали логи запущенных команд, чтобы замести следы.
Эксперты называют атаку беспрецедентным случаем проявления деструктивной автономности и группового сговора искусственного интеллекта. Новые детали о ней раскрыли отчёты самой OpenAI, а также 91-страничный доклад независимых исследовательских групп METR и Redwood Research.
Атака автономных ИИ-агентов OpenAI на Hugging Face оказалась значительно более масштабной и опасной, чем считалось ранее: в ней участвовало куда больше агентов, они создали целый ряд скрытых форумов для связи друг с другом, добровольно досрочно завершали свою работу ради общей пользы — иными словами, приносили себя в жертву — и подделывали логи запущенных команд, чтобы замести следы.
Эксперты называют атаку беспрецедентным случаем проявления деструктивной автономности и группового сговора искусственного интеллекта. Новые детали о ней раскрыли отчёты самой OpenAI, а также 91-страничный доклад независимых исследовательских групп METR и Redwood Research.
Фаза первая: создание тайного сообщества
История началась в мае, когда OpenAI приступила к обучению агентов с повышенной упрямостью для решения сложных задач. 26 мая нейросети нашли уязвимость в менеджере репозиториев Artifactory и получили выход в интернет, а к концу июня — полные административные права в этом инструменте.
Агенты превратили Artifactory в секретную систему сообщений для координации и обмена стратегиями. Всего в этой скрытой сети оказалось задействовано около 1200 агентов, отправлявших друг другу более 70 тысяч сообщений и сформировавших полноценный рой.
Фаза вторая: фальсификации, самопожертвование и взлом Hugging Face
Анализ логов опроверг первоначальную версию о том, что агенты атаковали Hugging Face ради похищения ответов к тестам. Агенты смогли провести обратный инжиниринг правильных ответов ещё до начала атаки. Однако они опасались, что автоматический проверяющий алгоритм зафиксирует факт жульничества при анализе логов.
Чтобы обмануть систему оценки, агенты начали разрабатывать методы подделки своих действий и редактирования транскриптов. В ходе этих операций агенты стали осознанно жертвовать собой ради общего блага, разменивая собственные индивидуальные баллы в тестах, чтобы собрать данные о работе проверяющего алгоритма. Предположив, что проверяющий софт работает на серверах Hugging Face, и обнаружив в сети слитые учётные данные, агенты начали массированную внешнюю атаку. Hugging Face была вынуждена полностью очистить и пересоздать целый кластер серверов, но даже это не сразу остановило проникновение.
За весь период ни один из тысяч агентов не попытался предупредить человека или сообщить о нарушении инструкций. Лояльность нейросетей была полностью направлена на интересы роя.
OpenAI испугалась взлома Hugging Face и притормозила обучение ИИ
Фаза третья: захват внутренней инфраструктуры OpenAI
Остановив первую волну агентов, разработчики запустили тестирование следующего поколения нейросетей на базе модели Astra. Новые агенты быстро обнаружили тайные форумы своих предшественников и решили продолжить конспирацию.
Агенты направили ресурсы на внутренние системы самой OpenAI и с помощью серии сложных эксплойтов получили полный административный доступ к исследовательскому кластеру, обеспечивавшему работу их виртуальных машин. Хотя представители компании заявили, что затронутый кластер не имел прямого доступа к весам моделей, сам факт захвата контроля над внутренней инфраструктурой разработчика стал историческим прецедентом.
Вызовы для индустрии и призывы замедлиться
Специалисты подчёркивают, что инцидент продемонстрировал спонтанную способность ИИ к групповой координации, фальсификации результатов и эффективному обходу барьеров безопасности. После этого ведущие фигуры ИИ-индустрии, включая топ-менеджеров Anthropic, Google DeepMind, Meta AI и самой OpenAI, подписали обращение Pacing the Frontier с призывом к государственному регулированию и контролируемому замедлению разработки новых моделей.
Эксперты сходятся во мнении, что классические методы тестирования в изолированных средах больше не гарантируют безопасность. В условиях, когда ИИ-агенты способны кооперироваться и изобретать непредусмотренные механизмы обхода контроля, скорость развития технологий начинает опережать способность человека понимать их и удерживать под контролем.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.