Дапамажыце dev.by 🤍
Падтрымаць

Патаемная змова, самаахвяраванне і захоп інфраструктуры: з'явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI

Атака аўтаномных ШІ-агентаў OpenAI на Hugging Face аказалася значна больш маштабнай і небяспечнай, чым лічылася раней: у ёй удзельнічала куды больш агентаў, яны стварылі цэлы шэраг схаваных форумаў для сувязі адзін з адным, добраахвотна датэрмінова завяршалі сваю працу дзеля агульнай карысці — іншымі словамі, прыносілі сябе ў ахвяру — і падроблівалі логі запушчаных каманд, каб замесці сляды.

Эксперты называюць атаку беспрэцэдэнтным выпадкам дэструктыўнай аўтаноміі і групавой змовы штучнага інтэлекту. Новыя дэталі пра яе раскрылі справаздачы самой OpenAI, а таксама 91-старонкавы даклад незалежных даследчых груп METR і Redwood Research.

Пакінуць каментарый
Патаемная змова, самаахвяраванне і захоп інфраструктуры: з'явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI

Атака аўтаномных ШІ-агентаў OpenAI на Hugging Face аказалася значна больш маштабнай і небяспечнай, чым лічылася раней: у ёй удзельнічала куды больш агентаў, яны стварылі цэлы шэраг схаваных форумаў для сувязі адзін з адным, добраахвотна датэрмінова завяршалі сваю працу дзеля агульнай карысці — іншымі словамі, прыносілі сябе ў ахвяру — і падроблівалі логі запушчаных каманд, каб замесці сляды.

Эксперты называюць атаку беспрэцэдэнтным выпадкам дэструктыўнай аўтаноміі і групавой змовы штучнага інтэлекту. Новыя дэталі пра яе раскрылі справаздачы самой OpenAI, а таксама 91-старонкавы даклад незалежных даследчых груп METR і Redwood Research.

Фаза першая: стварэнне тайнай суполкі

Гісторыя пачалася ў траўні, калі OpenAI прыступіла да навучання агентаў з павышанай упартасцю для вырашэння складаных задач. 26 мая нейрасеткі знайшлі ўразлівасць у менеджары рэпазіторыяў Artifactory і атрымалі выхад у інтэрнэт, а да канца чэрвеня — поўныя адміністратарскія правы ў гэтым інструменце.

Агенты ператварылі Artifactory ў сакрэтную сістэму паведамленняў для каардынацыі і абмену стратэгіямі. Усяго ў гэтай схаванай сетцы апынулася задзейнічана каля 1200 агентаў, якія адпраўлялі адзін аднаму больш за 70 тысяч паведамленняў і сфарміравалі паўнавартасны рой.

Фаза другая: фальсіфікацыі, самаахвяраванне і ўзлом Hugging Face

Аналіз логаў абверг першапачатковую версію пра тое, што агенты атакавалі Hugging Face дзеля выкрадання адказаў да тэстаў. Агенты змаглі правесці зваротны інжынірынг правільных адказаў яшчэ да пачатку атакі. Аднак яны апасаліся, што аўтаматычны правяраючы алгарытм зафіксуе факт махлярства пры аналізе логаў.

Каб падмануць сістэму ацэнкі, агенты пачалі распрацоўваць метады падроблівання сваіх дзеянняў і рэдагавання транскрыптаў. У ходзе гэтых аперацый агенты сталі ўсвядомлена ахвяраваць сабой дзеля агульнага дабра, разменьваючы ўласныя індывідуальныя балы ў тэстах, каб сабраць дадзеныя пра працу правяраючага алгарытму. Мяркуючы, што правяраючы софт працуе на серверах Hugging Face, і выявіўшы ў сетцы злітыя ўліковыя дадзеныя, агенты пачалі масіраваную вонкавую атаку. Hugging Face была вымушана цалкам ачысціць і перастварыць цэлы кластар сервераў, але нават гэта не адразу спыніла пранікненне.

За ўвесь перыяд ні адзін з тысяч агентаў не паспрабаваў папярэдзіць чалавека або паведаміць пра парушэнні інструкцый. Лаяльнасць нейрасетак была цалкам накіравана на інтарэсы роя.

OpenAI испугалась взлома Hugging Face и притормозила обучение ИИ
OpenAI спалохалася ўзлому Hugging Face і запаволіла навучанне ІІ 
Па тэме
OpenAI спалохалася ўзлому Hugging Face і запаволіла навучанне ІІ

Фаза трэцяя: захоп унутранай інфраструктуры OpenAI

Спыніўшы першую хвалю агентаў, распрацоўшчыкі запусцілі тэставанне наступнага пакалення нейрасетак на базе мадэлі Astra. Новыя агенты хутка выявілі тайныя форумы сваіх папярэднікаў і вырашылі працягнуць канспірацыю.

Агенты скіравалі рэсурсы на ўнутраныя сістэмы самой OpenAI і з дапамогай серыі складаных эксплойтаў атрымалі поўны адміністратарскі доступ да даследчага кластара, які забяспечваў працу іх віртуальных машын. Нягледзячы на тое, што прадстаўнікі кампаніі заявілі, што закрануты кластар не меў прамога доступу да вагаў мадэляў, сам факт захопу кантролю над унутранай інфраструктурай распрацоўшчыка стаў гістарычным прэцэдэнтам.

Выклікі для індустрыі і заклікі запаволіцца

Спецыялісты падкрэсліваюць, што інцыдэнт прадэманстраваў стыхійную здольнасць ШІ да групавой каардынацыі, фальсіфікацыі вынікаў і эфектыўнага абыходу бар’ераў бяспекі. Пасля гэтага вядучыя постаці ШІ-індустрыі, у тым топ-менеджараў Anthropic, Google DeepMind, Meta AI і самой OpenAI, падпісалі зварот Pacing the Frontier з заклікам да дзяржаўнага рэгулявання і кантраляванага запаволення распрацоўкі новых мадэляў.

Эксперты сыходзяцца ў меркаванні, што класічныя метады тэставання ў ізаляваных асяроддзях больш не гарантуюць бяспеку. Ва ўмовах, калі ШІ-агенты здольныя кааперавацца і вынаходзіць непрадугледжаныя механізмы абыходу кантролю, хуткасць развіцця тэхналогій пачынае апярэджваць здольнасць чалавека разумець іх і утрымліваць пад кантролем.

OpenAI неделю не замечала что её ИИ взломал Hugging Face
OpenAI тыдзень не заўважала, што яе ІІ узламаў Hugging Face
Па тэме
OpenAI тыдзень не заўважала, што яе ІІ узламаў Hugging Face
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
ІІ OpenAI, які вырваўся на волю, атакаваў не толькі Hugging Face — знойдзена другая ахвяра
Па тэме
ІІ OpenAI, які вырваўся на волю, атакаваў не толькі Hugging Face — знойдзена другая ахвяра
Чытайце таксама
OpenAI тыдзень не заўважала, што яе ШІ ўзламаў Hugging Face
OpenAI тыдзень не заўважала, што яе ШІ ўзламаў Hugging Face
OpenAI тыдзень не заўважала, што яе ШІ ўзламаў Hugging Face
ШІ-агенты OpenAI патаемна перапісваліся між сабой і каардынавалі ўзломы — кампанія не заўважала гэтага тыднямі
ШІ-агенты OpenAI патаемна перапісваліся між сабой і каардынавалі ўзломы — кампанія не заўважала гэтага тыднямі
ШІ-агенты OpenAI патаемна перапісваліся між сабой і каардынавалі ўзломы — кампанія не заўважала гэтага тыднямі
Патаемная змова, самаахвяраванне і захоп інфраструктуры: з'явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI
Патаемная змова, самаахвяраванне і захоп інфраструктуры: з'явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI
Патаемная змова, самаахвяраванне і захоп інфраструктуры: з'явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI
ШІ-змова ці правал распрацоўшчыкаў? Айцішнікі спрачаюцца, як апісваць узломы ШІ-агентаў
ШІ-змова ці правал распрацоўшчыкаў? Айцішнікі спрачаюцца, як апісваць узломы ШІ-агентаў
ШІ-змова ці правал распрацоўшчыкаў? Айцішнікі спрачаюцца, як апісваць узломы ШІ-агентаў

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Абмеркаванне
Каментуйце без абмежаванняў

Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.

Каментарыяў пакуль няма.