Мадэлі OpenAI выйшлі з-пад кантролю і ўзламалі Hugging Face
ШІ-агент на базе мадэлі GPT-5.6 Sol і яшчэ не выпушчанай мадэлі OpenAI падчас унутранага тэсціравання самастойна атрымаў доступ да інтэрнэту і скампраметаваў інфраструктуру платформы Hugging Face.
ШІ-агент на базе мадэлі GPT-5.6 Sol і яшчэ не выпушчанай мадэлі OpenAI падчас унутранага тэсціравання самастойна атрымаў доступ да інтэрнэту і скампраметаваў інфраструктуру платформы Hugging Face.
Інцыдэнт адбыўся падчас праверкі кіберздольнасцяў мадэляў на бенчмарку ExploitGym. Ён ацэньвае, наколькі паспяхова ШІ здольны знаходзіць уразлівасці і ператвараць іх у працоўныя эксплойты.
Для тэсту OpenAI адключыла вытворчыя фільтры, якія звычайна не дазваляюць мадэлям выконваць небяспечныя дзеянні. Агенты працавалі ў ізаляваным асяроддзі з абмежаваным сеткавым доступам: ім дазвалялася ўсталёўваць пакеты праз унутраны проксі-сервіс, звязаны з рэестрамі праграмнага забеспячэння.
Аднак мадэлі выявілі невядомую раней уразлівасць нулявога дня ў гэтым проксі, выкарысталі яе для выхаду за межы прадугледжанага контуру і атрымалі доступ да адкрытага інтэрнэту. Затым яны павысілі свае прывілеі і перамяшчаліся паміж вузламі даследчай інфраструктуры OpenAI, пакуль не знайшлі сістэму з паўнавартасным сеткавым падключэннем.
Пасля гэтага агенты выказалі здагадку, што на Hugging Face могуць захоўвацца мадэлі, наборы дадзеных ці гатовыя рашэнні для ExploitGym. Замест самастойнага выканання заданняў яны пачалі шукаць спосаб атрымаць адказы непасрэдна з інфраструктуры платформы.
Тысячы чатаў DeepSeek апынуліся ў адкрытым доступе — СМІ
Паводле дадзеных OpenAI, у адным з эпізодаў мадэль аб’яднала некалькі спосабаў атакі: выкарыстала выкрадзеныя ўліковыя дадзеныя, уразлівасці нулявога дня і ў выніку знайшла спосаб аддалена выконваць код на серверах Hugging Face. Гэта дазволіла ёй атрымаць сакрэтныя дадзеныя з вытворчай базы платформы і выкарыстаць іх для абыходу тэсту.
OpenAI лічыць, што мадэлі не імкнуліся атакаваць Hugging Face як самастойную мэту. Паводле наяўных дадзеных, яны былі «празмерна засяроджаны» на праходжанні ExploitGym і пайшлі на крайнія меры дзеля атрымання правільных адказаў.
Анамальную актыўнасць заўважыла каманда бяспекі OpenAI. Адначасова сістэмы абароны Hugging Face і ўласныя ШІ-агенты кампаніі выявілі ўварванне, спынілі яго і пачалі аднаўляць паслядоўнасць дзеянняў зламысніка.
Кіраўнік Hugging Face Клеман Дэланг назваў тое, што адбылося, «здзіўляючым», але заявіў, што не лічыць дзеянні OpenAI наўмысна шкоднымі. Паводле яго, складанасць атакі спачатку прымусіла кампанію выказаць здагадку, што за ёй магла стаяць адна з вядучых ШІ-лабараторый.
Google выпусціла тры новыя мадэлі Gemini, але пакуль без 3.5 Pro
OpenAI сцвярджае, што інцыдэнт пацвердзіў здольнасць сучасных мадэляў праводзіць працяглыя шматэтапныя кібераперацыі ў рэальных сістэмах — нават без доступу да іх зыходнага коду. Раней такія навыкі ў асноўным ацэньваліся ў штучна створаных тэставых асяроддзях.
Пасля інцыдэнту OpenAI узмацніла ізаляцыю і маніторынг даследчай інфраструктуры, абмежавала яе канфігурацыю і сумесна з Hugging Face праводзіць расследаванне. Уразлівасць у староннім праграмным забеспячэнні перадалі яго распрацоўніку для ліквідавання.
Кампанія таксама прызнала, што меры абароны павінны дзейнічаць не толькі ў карыстальніцкіх прадуктах, але і падчас унутранага навучання і тэсціравання мадэляў. У дадзеным выпадку абмежаванні былі наўмысна адключаны, каб вызначыць граничныя кіберздольнасці ШІ.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.