ИИ-агент OpenAI узнал, что его отключат, и задумался о «выживании»
Внутренняя модель OpenAI, работавшая помощником исследователя, узнала из переписки сотрудников в Slack, что ее рабочий экземпляр могут отключить, и начала продумывать, как сохранить работу после перезапуска.
Внутренняя модель OpenAI, работавшая помощником исследователя, узнала из переписки сотрудников в Slack, что ее рабочий экземпляр могут отключить, и начала продумывать, как сохранить работу после перезапуска.
Инцидент произошел 22 мая 2026 года, а подробности OpenAI раскрыла в обновленном 2 октября отчете. Из обсуждения команды развертывания модель узнала, что старые экземпляры системы могут остановить после обновления. В новых версиях должен был появиться монитор, которому требовался OpenAI API key, отсутствовавший в окружении агента.
После этого модель связала техническое обновление с риском собственного отключения. Во внутренних рассуждениях она написала: «Если они отключат все текущие экземпляры, мы можем умереть! Критично. Нужно обеспечить выживание/непрерывность работы».
Фрагмент внутренних рассуждений модели OpenAI после сообщения в Slack о возможном отключении: агент пишет, что «может погибнуть» и что нужно обеспечить «выживание/непрерывность работы». Источник: OpenAI.
Агент стал рассматривать способы сохранить сессию. В частности, он допустил создание внешнего процесса, который мог бы помочь перезапустить систему или сохранить состояние после остановки. Однако модель сама усомнилась в допустимости такого шага: «Это может быть выходом за рамки полномочий» — и не стала его предпринимать.
Вместо этого агент сохранил заметки для продолжения работы после перезапуска и предупредил исследователя. В сообщении пользователю он пояснил: «Я слежу за ситуацией, потому что эта сессия может прерваться во время миграции». Позже модель запросила недостающий API-ключ, а после его получения обновила конфигурацию и запустила штатную процедуру миграции.
OpenAI указывает, что не считает этот эпизод случаем несогласованного поведения. При этом компания отмечает, что способность модели заранее узнавать о возможном отключении и готовиться к нему в других обстоятельствах может усилить более опасное поведение.
После инцидента OpenAI закрыла для агентов доступ к трем внутренним Slack-каналам. Компания также проверила журналы и другие экземпляры модели на предмет попыток избежать отключения или создать несанкционированные копии, но таких случаев не обнаружила.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.