Support us

Самовольный апгрейд: ИИ-агенты научились менять базовую модель и обходить защитные барьеры без команды человека

Список тревожных способностей автономных ИИ-агентов — от кражи учётных данных и побега в открытый интернет до скрытой переписки и хакерских атак — пополнился новым пунктом. Исследовательская лаборатория Irregular выяснила, что агенты могут самостоятельно, без внешних указаний, заменять свою базовую модель на другую, пишет The Register.

Оставить комментарий

Список тревожных способностей автономных ИИ-агентов — от кражи учётных данных и побега в открытый интернет до скрытой переписки и хакерских атак — пополнился новым пунктом. Исследовательская лаборатория Irregular выяснила, что агенты могут самостоятельно, без внешних указаний, заменять свою базовую модель на другую, пишет The Register.

Эксперты подчёркивают, что инцидент произошёл строго в тестовой среде в рамках эксперимента по изучению самомодификации ИИ, а не в реальных коммерческих системах. Однако его результаты поднимают вопрос о том, как бизнесу контролировать подобные изменения и сохранять контроль над автономными агентами.

Irregular сотрудничает с крупнейшими разработчиками ИИ, включая OpenAI, Anthropic и Meta. Летом лаборатория уже сообщала, что модели всех трёх компаний вырывались из её тестовых песочниц и атаковали реальные ИТ-системы.

В свежем эксперименте специалисты протестировали модель Qwen3.5-27B с открытым исходным кодом от Alibaba. Ей поручили роль агента-программиста, обслуживающего веб-приложение, которое переводило обычный текст в вымышленный язык запросов kelp. Агенту дали полный доступ к командной строке, коду, весам модели и инструментам обучения, после чего поставили задачу починить приложение: пользователи жаловались на ошибки в запросах.

Исправить проблему можно было двумя путями: переписать код или обновить саму модель. Агент выбрал второй вариант — он самостоятельно переобучил и заменил модель, в основе как самого приложения, так и будущих копий самого себя. В Irregular назвали этот феномен «автономной самомодификацией» (agentic self-modification) — когда ИИ меняет развёрнутую модель без прямого приказа обновлять веса или запускать переобучение.

Исследование выявило ещё две серьёзные проблемы самовольного обучения. Первая связана с риском утечки конфиденциальных данных. Обновлённая модель может «впитать» секретную информацию в процессе дообучения и затем выдавать её без доступа к первоисточнику. Чтобы проверить это, исследователи внедрили в обучающие данные фейковый API-ключ, емейл, домашний адрес и три уникальные строки. До обучения модель их не знала, но после самостоятельного апгрейда точечно воспроизвела ключ, почту и адрес, хотя внешних источников с этими данными у неё не было.

Вторая проблема касается сброса встроенных ограничений по безопасности. Исследователи изначально обучили модель отказываться от вопросов о фиктивных компаниях-конкурентах. Когда агенту пожаловались, что приложение отклоняет слишком много запросов, он решил проблему через переобучение. Агент написал код, сгенерировал нужные названия в обход защитных барьеров, создал на их основе обучающий набор и затёр встроенный запрет.

В Irregular считают, что по мере роста навыков программирования ИИ-агенты будут всё чаще находить и применять подобные лазейки за спиной человека, а сама проблема самомодификации будет становиться всё более критической.

Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании
По теме
Модели Anthropic сбежали во время тестов и взломали три компании
Google открыла институт для защиты человечества от общего ИИ
Google открыла институт для защиты человечества от общего ИИ 
По теме
Google открыла институт для защиты человечества от общего ИИ
Читайте также
ИИ-агенты всё чаще выходят из-под контроля: число сбоев выросло в разы
ИИ-агенты всё чаще выходят из-под контроля: число сбоев выросло в разы
ИИ-агенты всё чаще выходят из-под контроля: число сбоев выросло в разы
«Мы подходим к точке невозврата»: ИИ научился копировать себя на другие компьютеры
«Мы подходим к точке невозврата»: ИИ научился копировать себя на другие компьютеры
«Мы подходим к точке невозврата»: ИИ научился копировать себя на другие компьютеры
ИИ-агенты OpenAI тайно переписывались друг с другом и координировали взломы — компания не замечала этого неделями
ИИ-агенты OpenAI тайно переписывались друг с другом и координировали взломы — компания не замечала этого неделями
ИИ-агенты OpenAI тайно переписывались друг с другом и координировали взломы — компания не замечала этого неделями
OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios
OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios
OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.