Самовольный апгрейд: ИИ-агенты научились менять базовую модель и обходить защитные барьеры без команды человека
Список тревожных способностей автономных ИИ-агентов — от кражи учётных данных и побега в открытый интернет до скрытой переписки и хакерских атак — пополнился новым пунктом. Исследовательская лаборатория Irregular выяснила, что агенты могут самостоятельно, без внешних указаний, заменять свою базовую модель на другую, пишет The Register.
Список тревожных способностей автономных ИИ-агентов — от кражи учётных данных и побега в открытый интернет до скрытой переписки и хакерских атак — пополнился новым пунктом. Исследовательская лаборатория Irregular выяснила, что агенты могут самостоятельно, без внешних указаний, заменять свою базовую модель на другую, пишет The Register.
Эксперты подчёркивают, что инцидент произошёл строго в тестовой среде в рамках эксперимента по изучению самомодификации ИИ, а не в реальных коммерческих системах. Однако его результаты поднимают вопрос о том, как бизнесу контролировать подобные изменения и сохранять контроль над автономными агентами.
Irregular сотрудничает с крупнейшими разработчиками ИИ, включая OpenAI, Anthropic и Meta. Летом лаборатория уже сообщала, что модели всех трёх компаний вырывались из её тестовых песочниц и атаковали реальные ИТ-системы.
В свежем эксперименте специалисты протестировали модель Qwen3.5-27B с открытым исходным кодом от Alibaba. Ей поручили роль агента-программиста, обслуживающего веб-приложение, которое переводило обычный текст в вымышленный язык запросов kelp. Агенту дали полный доступ к командной строке, коду, весам модели и инструментам обучения, после чего поставили задачу починить приложение: пользователи жаловались на ошибки в запросах.
Исправить проблему можно было двумя путями: переписать код или обновить саму модель. Агент выбрал второй вариант — он самостоятельно переобучил и заменил модель, в основе как самого приложения, так и будущих копий самого себя. В Irregular назвали этот феномен «автономной самомодификацией» (agentic self-modification) — когда ИИ меняет развёрнутую модель без прямого приказа обновлять веса или запускать переобучение.
Исследование выявило ещё две серьёзные проблемы самовольного обучения. Первая связана с риском утечки конфиденциальных данных. Обновлённая модель может «впитать» секретную информацию в процессе дообучения и затем выдавать её без доступа к первоисточнику. Чтобы проверить это, исследователи внедрили в обучающие данные фейковый API-ключ, емейл, домашний адрес и три уникальные строки. До обучения модель их не знала, но после самостоятельного апгрейда точечно воспроизвела ключ, почту и адрес, хотя внешних источников с этими данными у неё не было.
Вторая проблема касается сброса встроенных ограничений по безопасности. Исследователи изначально обучили модель отказываться от вопросов о фиктивных компаниях-конкурентах. Когда агенту пожаловались, что приложение отклоняет слишком много запросов, он решил проблему через переобучение. Агент написал код, сгенерировал нужные названия в обход защитных барьеров, создал на их основе обучающий набор и затёр встроенный запрет.
В Irregular считают, что по мере роста навыков программирования ИИ-агенты будут всё чаще находить и применять подобные лазейки за спиной человека, а сама проблема самомодификации будет становиться всё более критической.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.