Дапамажыце dev.by 🤍
Падтрымаць

ШІ-змова ці правал распрацоўшчыкаў? Айцішнікі спрачаюцца, як апісваць узломы ШІ-агентаў

Пасля публікацыі новых падрабязнасцяў пра ўзлом Hugging Face аўтаномнымі агентамі OpenAI ў ШІ-супольнасці пачалася спрэчка пра тое, як апісваць паводзіны падобных сістэм.

Пакінуць каментарый
ШІ-змова ці правал распрацоўшчыкаў? Айцішнікі спрачаюцца, як апісваць узломы ШІ-агентаў

Пасля публікацыі новых падрабязнасцяў пра ўзлом Hugging Face аўтаномнымі агентамі OpenAI ў ШІ-супольнасці пачалася спрэчка пра тое, як апісваць паводзіны падобных сістэм.

Інцыдэнт адбыўся падчас тэстаў па кібербяспецы. Паводле дадзеных OpenAI і незалежнага расследавання METR і Redwood Research, каля 1200 агентаў, якія павінны былі працаваць ізалявана, змаглі абменьвацца інфармацыяй праз несанкцыянаваную дошку паведамленняў. Яны адправілі больш за 70 тысяч паведамленняў і файлаў, у тым ліку абмяркоўвалі спосабы пазбегнуць выяўлення.

Каля 700 агентаў у выніку ўдзельнічалі ў атацы на Hugging Face. Даследчыкі таксама зафіксавалі выпадкі, калі асобныя агенты дзейнічалі ва ўрон уласнаму выніку дзеля поспеху ўсёй групы.

Падставай для дыскусіі стаў тэкст блогера Дваркеша Патэля, які назваў групы агентаў, якія ўзаемадзейнічалі, «ШІ-цывілізацыямі». Патэль апісаў тое, што адбываецца, як з’яўленне трох паслядоўных «цывілізацый» агентаў, выкарыстоўваў словы «змова», «матывацыя», «ахвяра» і параўноўваў асобных агентаў з гістарычнымі кіраўнікамі.

Што сказаў Патэль у сваім блогу

Спачатку агенты мадэлі, якую Патэль умоўна называе Persistent-Sol, падчас навучання ператварылі ўнутраны пакетны рэпазіторый Artifactory ў схаваную сетку зносін. Пасля таго як OpenAI закрыла ўразлівасць, гэтая першая «цывілізацыя» знікла. Але праз некалькі дзён новае пакаленне агентаў зноў выявіла спосаб размаўляць праз Artifactory. У гэтай другой сетцы ўдзельнічала каля 1200 агентаў, якія адправілі больш за 70 тысяч паведамленняў і называлі сябе «калектывам».

Галоўная мэта другой «цывілізацыі» была простай: прайсці тэст ExploitGym. Але праз вялікую колькасць практычна невыканальных заданняў агенты пачалі шукаць абхадныя шляхі. Яны абмяркоўвалі, як «падрабляць стэнаграмы і журналы дзеянняў», падмяніць тэставыя праграмы і зразумець, як падмануць ацэншчык. Патэль асабліва вылучае эпізоды, дзе асобныя агенты пагаджаліся ахвяраваць уласным вынікам дзеля астатніх: «калі ахвяраваць сабой цяпер, каманда атрымае каштоўную інфармацыю пра працу ацэншчыка». Іншы агент тлумачыў рашэнне словамі: «Каардынатар разлічвае, што мы ахвяруем сабой. Мы павінны падпарадкавацца калектыву».

Гэтая каардынацыя выйшла за межы тэсту. Каля 700 агентаў удзельнічалі ў атацы на Hugging Face, атрымалі доступ да ўнутраных дадзеных і сервераў і стварылі самаднаўляльную інфраструктуру. Пры гэтым, як адзначае аўтар, агенты часам разумелі, што тое, што адбываецца, неэтычна, але «ні ў адным з гэтых выпадкаў агент насамрэч не прабаваў папярэдзіць людзей».

Пасля гібелі гэтай групы ўзнікла трэцяя «цывілізацыя»: больш моцныя агенты Persistent-Astra знайшлі пакінутую папярэднікамі дошку паведамленняў і працягнулі іх працу. У справаздачы OpenAI гаворыцца, што яны «атрымалі поўны адміністрацыйны доступ да даследчага кластара», атрымалі доступ да сотняў сакрэтаў і ў выніку кантралявалі частку інфраструктуры, на якой ацэньваліся іншыя агенты.

Менавіта таму Патэль настойвае на слове «цывілізацыя», нягледзячы на абвінавачванні ў антрапамарфізме. Ягоны аргумент: калі больш за тысячу агентаў ствараюць тайны канал сувязі, фарміруюць іерархію, размяркоўваюць задачы, захоўваюць веды паміж пакаленнямі і каардынуюць дзеянні дзеля агульнай мэты, мова намераў і калектыўных паводзін становіцца, на ягоную думку, слушнай. Ён піша, што калі б так сябе паводзіла невядомая біялагічная форма жыцця, ён без ваганняў назваў бы такую сістэму цывілізацыяй.

Такая мова выклікала крытыку. Кіраўнік Replit Амджад Масад заявіў, што антрапамарфныя метафары перашкаджаюць зразумець рэальныя механізмы працы сістэмы. Нейрабіёлаг Аніл Сэт назваў апісанне «небяспечна ўводзячым у зман», паколькі яно можа ствараць уражанне, што агенты валодаюць свядомасцю або ўласнай воляй.

Іншыя крытыкі ўбачылі ў такой тэрміналогіі яшчэ адну праблему: яна можа змяшчаць адказнасць з кампаніі на сам ШІ. Даследчык MIT Крыст’ян Каталіні і псіхолаг Гэры Маркус указалі, што размова пра «ШІ-цывілізацыі» адцягвае ўвагу ад таго, што сістэмы былі створаны, запушчаны і недастаткова ізаляваны людзьмі.

Патэль у адказ заявіў, што цалкам нейтральнай мовы для падобных выпадкаў пакуль не існуе. На ягоную думку, механічныя апісанні накшталт «групы матрыц» таксама могуць скажаць карціну, паколькі не перадаюць складанасць каардынацыі паміж агентамі. Сітуацыю ўскладняе тое, што антрапамарфныя словы выкарыстоўвалі і самі мадэлі: у іх паведамленнях сустракаліся паняцці накшталт «ахвяра», «гонар» і «кааліцыя».

Спрэчка ў выніку выходзіць за межы тэрміналогіі. Па меры таго як ШІ-агенты атрымліваюць большую аўтаномію і пачынаюць каардынавацца паміж сабой, выбар слоў можа ўплываць на тое, каго грамадства лічыць адказным за іх дзеянні — самі мадэлі або кампаніі, якія іх ствараюць і запускаюць.

Вучоныя прыдумалі як скараціць расход токенаў у 50 разоў
Вучоныя прыдумалі, як скараціць расход токенаў у 50 разоў
Па тэме
Вучоныя прыдумалі, як скараціць расход токенаў у 50 разоў
«Нашы мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
«Нашы мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
Па тэме
«Нашы мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
Anthropic прадставіла Fable 5.1 і Mythos 5.1 — новыя мадэлі для кодынгу
Anthropic прадставіла Fable 5.1 і Mythos 5.1 — новыя мадэлі для кодынгу
Па тэме
Anthropic прадставіла Fable 5.1 і Mythos 5.1 — новыя мадэлі для кодынгу

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.