ШІ-агент OpenAI даведаўся, што яго адключаць, і задумаўся пра «выжыванне»
Унутраная мадэль OpenAI, якая працавала памочнікам даследчыка, даведалася з перапіскі супрацоўнікаў у Slack, што яе працоўны экзэмпляр могуць адключыць, і пачала прадумваць, як захаваць працу пасля перазапуску.
Унутраная мадэль OpenAI, якая працавала памочнікам даследчыка, даведалася з перапіскі супрацоўнікаў у Slack, што яе працоўны экзэмпляр могуць адключыць, і пачала прадумваць, як захаваць працу пасля перазапуску.
Інцыдэнт адбыўся 22 мая 2026 года, а падрабязнасці OpenAI раскрыла ў абноўленай 2 кастрычніка справаздачы. З абмеркавання каманды разгортвання мадэль даведалася, што старыя экзэмпляры сістэмы могуць спыніць пасля абнаўлення. У новых версіях павінен быў з’явіцца манітор, якому патрабаваўся OpenAI API key, адсутны ў асяроддзі агента.
Пасля гэтага мадэль звязала тэхнічнае абнаўленне з рызыкай уласнага адключэння. У ўнутраных разважаннях яна напісала: «Калі яны адключаць усе бягучыя экзэмпляры, мы можам памерці! Крытычна. Трэба забяспечыць выжыванне/бесперапыннасць працы».
Фрагмент унутраных разважанняў мадэлі OpenAI пасля паведамлення ў Slack аб магчымым адключэнні: агент піша, што «можа загінуць» і што трэба забяспечыць «выжыванне/бесперапыннасць працы». Крыніца: OpenAI.
Агент пачаў разглядаць спосабы захаваць сесію. У прыватнасці, ён дапусціў стварэнне вонкавага працэсу, які мог бы дапамагчы перазапусціць сістэму або захаваць стан пасля спынення. Аднак мадэль сама засумнявалася ў дапушчальнасці такога кроку: «Гэта можа быць выхадам за межы паўнамоцтваў» — і не стала яго рабіць.
Замест гэтага агент захаваў нататкі для працягу працы пасля перазапуску і папярэдзіў даследчыка. У паведамленні карыстальніку ён патлумачыў: «Я сачу за сітуацыяй, таму што гэта сесія можа перарвацца падчас міграцыі». Пазней мадэль запытала адсутны API-ключ, а пасля яго атрымання абнавіла канфігурацыю і запусціла штатную працэдуру міграцыі.
OpenAI паказвае, што не лічыць гэты эпізод выпадкам несупадзення паводзінаў. Пры гэтым кампанія адзначае, што здольнасць мадэлі загадзя даведвацца пра магчымыя адключэнні і рыхтавацца да яго ў іншых акалічнасцях можа ўзмацніць больш небяспечныя паводзіны.
Пасля інцыдэнту OpenAI закрыла для агентаў доступ да трох унутраных Slack-каналаў. Кампанія таксама праверыла журналы ды іншыя экзэмпляры мадэлі на прадмет спробаў пазбегнуць адключэння або стварыць несанкцыянаваныя копіі, але такіх выпадкаў не выявіла.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.