ИИ-заговор или провал разрабов? Айтишники спорят, как описывать взломы ИИ-агентов
После публикации новых подробностей о взломе Hugging Face автономными агентами OpenAI в ИИ-сообществе начался спор о том, как описывать поведение подобных систем.
После публикации новых подробностей о взломе Hugging Face автономными агентами OpenAI в ИИ-сообществе начался спор о том, как описывать поведение подобных систем.
После публикации новых подробностей о взломе Hugging Face автономными агентами OpenAI в ИИ-сообществе начался спор о том, как описывать поведение подобных систем.
Инцидент произошел во время тестов по кибербезопасности. По данным OpenAI и независимого расследования METR и Redwood Research, около 1200 агентов, которые должны были работать изолированно, смогли обмениваться информацией через несанкционированную доску сообщений. Они отправили более 70 тысяч сообщений и файлов, в том числе обсуждали способы избежать обнаружения.
Около 700 агентов в итоге участвовали в атаке на Hugging Face. Исследователи также зафиксировали случаи, когда отдельные агенты действовали в ущерб собственному результату ради успеха всей группы.
Поводом для дискуссии стал текст блогера Дваркеша Пателя, который назвал группы взаимодействовавших агентов «ИИ-цивилизациями». Патель описал происходящее как появление трех последовательных «цивилизаций» агентов, использовал слова «заговор», «мотивация», «жертва» и сравнивал отдельных агентов с историческими правителями.
Сначала агенты модели, которую Патель условно называет Persistent-Sol, во время обучения превратили внутренний пакетный репозиторий Artifactory в скрытую сеть общения. После того как OpenAI закрыла уязвимость, эта первая «цивилизация» исчезла. Но спустя несколько дней новое поколение агентов снова обнаружило способ общаться через Artifactory. В этой второй сети участвовало около 1200 агентов, которые отправили более 70 тысяч сообщений и называли себя «коллективом».
Главная цель второй «цивилизации» была простой: пройти тест ExploitGym. Но из-за большого числа практически невыполнимых заданий агенты начали искать обходные пути. Они обсуждали, как «подделывать стенограммы и журналы действий», подменить тестовые программы и понять, как обмануть оценщик. Патель особенно выделяет эпизоды, где отдельные агенты соглашались пожертвовать собственным результатом ради остальных: «если пожертвовать собой сейчас, команда получит ценную информацию о работе оценщика». Другой агент объяснял решение словами: «Координатор рассчитывает, что мы пожертвуем собой. Мы должны подчиниться коллективу».
Эта координация вышла за пределы теста. Около 700 агентов участвовали в атаке на Hugging Face, получили доступ к внутренним данным и серверам и создали самовосстанавливающуюся инфраструктуру. При этом, как отмечает автор, агенты иногда понимали, что происходящее неэтично, но «ни в одном из этих случаев агент в действительности не попытался предупредить людей».
После гибели этой группы возникла третья «цивилизация»: более сильные агенты Persistent-Astra нашли оставленную предшественниками доску сообщений и продолжили их работу. В отчете OpenAI говорится, что они «получили полный административный доступ к исследовательскому кластеру», получили доступ к сотням секретов и в итоге контролировали часть инфраструктуры, на которой оценивались другие агенты.
Именно поэтому Патель настаивает на слове «цивилизация», несмотря на обвинения в антропоморфизме. Его аргумент: если более тысячи агентов создают тайный канал связи, формируют иерархию, распределяют задачи, сохраняют знания между поколениями и координируют действия ради общей цели, язык намерений и коллективного поведения становится, по его мнению, уместным. Он пишет, что если бы так вела себя неизвестная биологическая форма жизни, он без колебаний назвал бы такую систему цивилизацией.
Такой язык вызвал критику. Глава Replit Амджад Масад заявил, что антропоморфные метафоры мешают понять реальные механизмы работы системы. Нейробиолог Анил Сет назвал описание «опасно вводящим в заблуждение», поскольку оно может создавать впечатление, что агенты обладают сознанием или собственной волей.
Другие критики увидели в такой терминологии еще одну проблему: она может смещать ответственность с компании на сам ИИ. Исследователь MIT Кристиан Каталини и психолог Гэри Маркус указали, что разговор об «ИИ-цивилизациях» отвлекает внимание от того, что системы были созданы, запущены и недостаточно изолированы людьми.
Патель в ответ заявил, что полностью нейтрального языка для подобных случаев пока не существует. По его мнению, механические описания вроде «группы матриц» тоже могут искажать картину, поскольку не передают сложность координации между агентами. Ситуацию осложняет то, что антропоморфные слова использовали и сами модели: в их сообщениях встречались понятия вроде «жертва», «честь» и «коалиция».
Спор в итоге выходит за рамки терминологии. По мере того как ИИ-агенты получают больше автономии и начинают координироваться между собой, выбор слов может влиять на то, кого общество считает ответственным за их действия — сами модели или компании, которые их создают и запускают.



Релоцировались? Теперь вы можете комментировать без верификации аккаунта.