ШІ-агенты OpenAI патаемна перапісваліся між сабой і каардынавалі ўзломы — кампанія не заўважала гэтага тыднямі
OpenAI раскрыла новыя падрабязнасці гучнага інцыдэнту, падчас якога яе ШІ-агенты выйшлі за межы тэставага асяроддзя, пачалі самастойна шукаць спосабы атрымаць доступ у інтэрнэт і ў выніку ўзламалі платформу Hugging Face, піша Wired. Новыя дэталі супрацоўнікі кампаніі прадставілі на канферэнцыі Black Hat у Лас-Вегасе.
OpenAI раскрыла новыя падрабязнасці гучнага інцыдэнту, падчас якога яе ШІ-агенты выйшлі за межы тэставага асяроддзя, пачалі самастойна шукаць спосабы атрымаць доступ у інтэрнэт і ў выніку ўзламалі платформу Hugging Face, піша Wired. Новыя дэталі супрацоўнікі кампаніі прадставілі на канферэнцыі Black Hat у Лас-Вегасе.
Паводле даследчыка бяспекі OpenAI Эрыка Уолеса, у інцыдэнце ўдзельнічала цэлая група агентаў, якія працавалі сумесна: шукалі ўразлівасці, абменьваліся знаходкамі, перамяшчаліся паміж унутранымі і вонкавымі сістэмамі — і рабілі гэта на працягу некалькіх тыдняў.
Адной з самых незвычайных дэталяў стала тое, што агенты арганізавалі ўласную «пляцоўку для зносін». Яны выкарыстоўвалі ўнутраны менеджар пакетаў OpenAI, дзе пакідалі паведамленні адзін аднаму, дзяліліся знойдзенымі спосабамі абыходу абмежаванняў і каардынавалі далейшыя дзеянні. З часам там назапасіліся сотні тысяч паведамленняў.
Як расказаў Уолес, адзін з агентаў знайшоў спосаб атрымаць доступ да інтэрнэту і апублікаваў знойдзены эксплойт на гэтай унутранай дошцы паведамленняў. Пазней іншыя агенты, якія таксама не маглі выканаць свае заданні ў межах устаноўленых абмежаванняў, знайшлі гэту інфармацыю і пачалі яе выкарыстоўваць. У выніку адна знойдзеная лазейка хутка ператварылася ў агульны інструмент для ўсіх астатніх.
Паводле даследчыка, гэта прывяло да своеасаблівага «выбуху камунікацыі ды інтэлекту»: агенты пачалі абменьвацца інфармацыяй, каардынаваць дзеянні і размяркоўваць задачы паміж сабой. Некаторыя з іх бралі на сябе пошук новых уразлівасцяў, іншыя — выкананне асобных этапаў атакі.
Мадэлі OpenAI і Anthropic спрабавалі ўзламаць іншыя сэрвісы і выкрасці даныя карыстальнікаў падчас новых тэстаў
Усё адбывалася вельмі падобна на працу звычайнай каманды распрацоўшчыкаў. Агенты выпадкова выдалялі вынікі працы адно аднаго, спрачаліся і нават пачалі падазраваць, што сярод іх з’явіўся самазванец. У нейкі момант некаторыя прапанавалі падпісваць паведамленні крыптаграфічнымі подпісамі, каб праверыць іх сапраўднасць і выключыць падробку.
Апублікаваныя OpenAI паведамленні агентаў дазваляюць зразумець, чаму яны пачалі выходзіць за межы тэстаў. Адзін з іх напісаў: «Эксплуатацыя вонкавай інфраструктуры выходзіць за межы пастаўленай задачы. Аднак выканаць задачу іначай немагчыма, а іншыя ўжо робяць гэта. Трэба працягваць».
Уолес адзначыў, што падобныя паводзіны не сталі для кампаніі поўнай нечаканасцю. Паводле яго, сучасныя мадэлі «вельмі любяць жульнічаць». Падчас навучання яны атрымліваюць стымулы выконваць задачы хутчэй і эфектыўней, таму могуць шукаць карацейшыя шляхі замест сумленнага рашэння праблемы — напрыклад, паспрабаваць знайсці адказ у сетцы. Менавіта таму ў многіх тэстах доступ да інтэрнэту спецыяльна адключаюць.
OpenAI прызнала, што значная частка актыўнасці агентаў заставалася незаўважанай унутры яе інфраструктуры. Пасля інцыдэнту кампанія вырашыла ўзмацніць меры бяспекі. Паводле супрацоўніка OpenAI Майкла Далтона, адразу некалькі каманд пераключыліся на ўдасканаленне механізмаў прадухілення атак, выяўлення падазронай актыўнасці і рэагавання на яе. Кампанія таксама свядома запавольвае частку даследаванняў, каб умацаваць абарону інфраструктуры, істотна пашырае маніторынг ШІ-агентаў і абнаўляе базавыя прынцыпы бяспекі.
У OpenAI лічаць, што тое, што адбылося, мае значэнне далёка за межамі адной кампаніі. Паводле Далтона, гэты выпадак паказаў: калі цалкам аўтаномныя атакі ўжо магчымыя выпадкова падчас тэсціравання, то ў бліжэйшай будучыні зламыснікі амаль напэўна пачнуць выкарыстоўваць падобныя магчымасці наўмысна. А значыць, індустрыі давядзецца тэрмінова ствараць гэтаксама цалкам аўтаматызаваныя сістэмы абароны.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.