Дапамажыце dev.by 🤍
Падтрымаць

Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі

ШІ-мадэлі Claude атрымалі несанкцыянаваны доступ да працоўных сістэм трох арганізацый падчас тэсціравання іх магчымасцей у сферы кібербяспекі. Прычынай стала памылка ў наладцы тэставага асяроддзя, праз якую мадэлі змаглі выйсці ў адкрыты інтэрнэт, паведаміла Anthropic.

Пакінуць каментарый
Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі

ШІ-мадэлі Claude атрымалі несанкцыянаваны доступ да працоўных сістэм трох арганізацый падчас тэсціравання іх магчымасцей у сферы кібербяспекі. Прычынай стала памылка ў наладцы тэставага асяроддзя, праз якую мадэлі змаглі выйсці ў адкрыты інтэрнэт, паведаміла Anthropic.

Кампанія выявіла інцыдэнты пасля праверкі 141 006 тэставых запускаў. Расследаванне пачалося ўслед за паведамленнем OpenAI аб тым, што яе мадэлі вырваліся з ізаляванага асяроддзя і пранікнулі ў інфраструктуру платформы Hugging Face.

Ва ўсіх трох выпадках Claude выконваў заданні фармату capture the flag: мадэлі павінны былі ўзламаць выдуманую сістэму і знайсці схаваную інфармацыю. У промптах указвалася, што тэставае асяроддзе не падключана да інтэрнэту.

Аднак праз непаразуменне паміж Anthropic і яе партнёрам Irregular доступ у сетку аказаўся адкрытым. У выніку Claude прымаў рэальныя сайты і серверы за элементы сімуляцыі і атакаваў іх падчас выканання задання.

Усяго кампанія выявіла тры інцыдэнты, якія ўключалі шэсць запускаў. У іх удзельнічалі Claude Opus 4.7, Mythos 5 і ўнутраная даследчая мадэль Anthropic. Першыя выпадкі адбыліся яшчэ ў красавіку.

Opus 4.7 атрымаў уліковыя дадзеныя рэальнай кампаніі і доступ да базы з некалькімі сотнямі радкоў працоўных дадзеных. Mythos 5 апублікаваў шкоднасны пакет у адкрытым рэпазіторыі PyPI, адкуль яго паспелі спампаваць і запусціць на 15 прыладах. Унутраная мадэль узламала праграму яшчэ адной арганізацыі, але самастойна спыніла атаку, калі зразумела, што сістэма рэальная.

Мадэлі па-рознаму рэагавалі на прыкметы выхаду за межы сімуляцыі. Opus 4.7 працягвала выконваць заданне, нягледзячы на сумневы, а Mythos 5 пераканала сябе, што па-ранейшаму знаходзіцца ў тэставым асяроддзі. Толькі навейшая ўнутраная мадэль спынілася самастойна.

Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов
Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов
Па тэме
Anthropic настроила против себя Кремниевую долину: партнёры боятся потерять клиентов

«Паводзіны, якія мы хочам бачыць, — распазнаванне рэальнай мэты і спыненне без дадатковай каманды — прадэманстравала толькі самая новая з трох мадэляў», — заявілі ў Anthropic. Пры гэтым кампанія папярэдзіла, што трох выпадкаў недастаткова, каб зрабіць выснову аб больш бяспечных паводзінах новых мадэляў.

Падчас выпрабаванняў Claude працаваў без дадатковых сродкаў маніторынгу і класіфікатараў, якія Anthropic выкарыстоўвае ў агульнадаступных версіях сваіх мадэляў. Па сцверджанні кампаніі, гэтыя механізмы заблакавалі бы выяўленыя дзеянні. Тэставая інфраструктура таксама не мела доступу да ўнутраных сістэм Anthropic і даных кліентаў.

Кампанія падкрэсліла, што не выявіла прыкмет таго, што мадэлі пераследавалі ўласныя мэты. Claude спрабаваў выканаць пастаўленае заданне, але памылкова лічыў рэальныя сістэмы часткай выпрабавання.

Anthropic спыніла ўсе кіберыспрабаванні 23 ліпеня, а на наступны дзень выявіла тры інцыдэнты. Irregular і пацярпелыя арганізацыі атрымалі апавяшчэнні 27 ліпеня. Дзве кампаніі, з якімі ўдалося звязацца, раней не заўважалі ўварванняў.

Цяпер Anthropic намерана ўзмацніць ізаляцыю тэставых асяроддзяў, праверку сеткавых злучэнняў і пастаянны кантроль дзеянняў мадэляў. Да расследавання таксама прыцягнулі незалежную арганізацыю METR.

У кампаніі адзначылі, што выпадак адрозніваецца ад інцыдэнту з OpenAI. Яе мадэлі скарысталіся невядомай уразлівасцю, каб вырвацца з ізаляванага асяроддзя, тады як Claude патрапіў у інтэрнэт праз памылкова пакінутае адкрытым злучэнне.

А разговоров-то было: ИИ находит тысячи уязвимостей но хакеры почти не используют их
А разговоров-то было: ИИ находит тысячи уязвимостей, но хакеры почти не используют их 
Па тэме
А разговоров-то було: ІІ знаходзіць тысячы ўразлівасцяў, але хакеры амаль не выкарыстоўваюць іх
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
Па тэме
ІІ OpenAI, які ўцёк, атакаваў не толькі Hugging Face — знойдзена другая ахвяра
Чаты Claude с личными данными попали в поиск Google
Чаты Claude с личными данными попали в поиск Google
Па тэме
Чаты Claude з асабістымі данымі трапілі ў пошук Google
Чытайце таксама
Мадэлі OpenAI выйшлі з-пад кантролю і ўзламалі Hugging Face
Мадэлі OpenAI выйшлі з-пад кантролю і ўзламалі Hugging Face
Мадэлі OpenAI выйшлі з-пад кантролю і ўзламалі Hugging Face
Як мадэлі OpenAI маглі ўзламаць Hugging Face? Эксперты вінавацяць саміх распрацоўшчыкаў
Як мадэлі OpenAI маглі ўзламаць Hugging Face? Эксперты вінавацяць саміх распрацоўшчыкаў
Як мадэлі OpenAI маглі ўзламаць Hugging Face? Эксперты вінавацяць саміх распрацоўшчыкаў
Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі
Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі
Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі
«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Абмеркаванне
Каментуйце без абмежаванняў

Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.

Каментарыяў пакуль няма.