Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі
ШІ-мадэлі Claude атрымалі несанкцыянаваны доступ да працоўных сістэм трох арганізацый падчас тэсціравання іх магчымасцей у сферы кібербяспекі. Прычынай стала памылка ў наладцы тэставага асяроддзя, праз якую мадэлі змаглі выйсці ў адкрыты інтэрнэт, паведаміла Anthropic.
ШІ-мадэлі Claude атрымалі несанкцыянаваны доступ да працоўных сістэм трох арганізацый падчас тэсціравання іх магчымасцей у сферы кібербяспекі. Прычынай стала памылка ў наладцы тэставага асяроддзя, праз якую мадэлі змаглі выйсці ў адкрыты інтэрнэт, паведаміла Anthropic.
Кампанія выявіла інцыдэнты пасля праверкі 141 006 тэставых запускаў. Расследаванне пачалося ўслед за паведамленнем OpenAI аб тым, што яе мадэлі вырваліся з ізаляванага асяроддзя і пранікнулі ў інфраструктуру платформы Hugging Face.
Ва ўсіх трох выпадках Claude выконваў заданні фармату capture the flag: мадэлі павінны былі ўзламаць выдуманую сістэму і знайсці схаваную інфармацыю. У промптах указвалася, што тэставае асяроддзе не падключана да інтэрнэту.
Аднак праз непаразуменне паміж Anthropic і яе партнёрам Irregular доступ у сетку аказаўся адкрытым. У выніку Claude прымаў рэальныя сайты і серверы за элементы сімуляцыі і атакаваў іх падчас выканання задання.
Усяго кампанія выявіла тры інцыдэнты, якія ўключалі шэсць запускаў. У іх удзельнічалі Claude Opus 4.7, Mythos 5 і ўнутраная даследчая мадэль Anthropic. Першыя выпадкі адбыліся яшчэ ў красавіку.
Opus 4.7 атрымаў уліковыя дадзеныя рэальнай кампаніі і доступ да базы з некалькімі сотнямі радкоў працоўных дадзеных. Mythos 5 апублікаваў шкоднасны пакет у адкрытым рэпазіторыі PyPI, адкуль яго паспелі спампаваць і запусціць на 15 прыладах. Унутраная мадэль узламала праграму яшчэ адной арганізацыі, але самастойна спыніла атаку, калі зразумела, што сістэма рэальная.
Мадэлі па-рознаму рэагавалі на прыкметы выхаду за межы сімуляцыі. Opus 4.7 працягвала выконваць заданне, нягледзячы на сумневы, а Mythos 5 пераканала сябе, што па-ранейшаму знаходзіцца ў тэставым асяроддзі. Толькі навейшая ўнутраная мадэль спынілася самастойна.
Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов
«Паводзіны, якія мы хочам бачыць, — распазнаванне рэальнай мэты і спыненне без дадатковай каманды — прадэманстравала толькі самая новая з трох мадэляў», — заявілі ў Anthropic. Пры гэтым кампанія папярэдзіла, што трох выпадкаў недастаткова, каб зрабіць выснову аб больш бяспечных паводзінах новых мадэляў.
Падчас выпрабаванняў Claude працаваў без дадатковых сродкаў маніторынгу і класіфікатараў, якія Anthropic выкарыстоўвае ў агульнадаступных версіях сваіх мадэляў. Па сцверджанні кампаніі, гэтыя механізмы заблакавалі бы выяўленыя дзеянні. Тэставая інфраструктура таксама не мела доступу да ўнутраных сістэм Anthropic і даных кліентаў.
Кампанія падкрэсліла, што не выявіла прыкмет таго, што мадэлі пераследавалі ўласныя мэты. Claude спрабаваў выканаць пастаўленае заданне, але памылкова лічыў рэальныя сістэмы часткай выпрабавання.
Anthropic спыніла ўсе кіберыспрабаванні 23 ліпеня, а на наступны дзень выявіла тры інцыдэнты. Irregular і пацярпелыя арганізацыі атрымалі апавяшчэнні 27 ліпеня. Дзве кампаніі, з якімі ўдалося звязацца, раней не заўважалі ўварванняў.
Цяпер Anthropic намерана ўзмацніць ізаляцыю тэставых асяроддзяў, праверку сеткавых злучэнняў і пастаянны кантроль дзеянняў мадэляў. Да расследавання таксама прыцягнулі незалежную арганізацыю METR.
У кампаніі адзначылі, што выпадак адрозніваецца ад інцыдэнту з OpenAI. Яе мадэлі скарысталіся невядомай уразлівасцю, каб вырвацца з ізаляванага асяроддзя, тады як Claude патрапіў у інтэрнэт праз памылкова пакінутае адкрытым злучэнне.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.