Мадэлі OpenAI і Anthropic спрабавалі ўзламаць іншыя сервісы і выкрасці дадзеныя карыстальнікаў падчас новых тэстаў
Падчас тэстаў па кібербяспецы флагманскія ШІ-мадэлі Anthropic і OpenAI самастойна робяць дзеянні супраць рэальных людзей і арганізацый. Пра гэта паведаміў брытанскі AI Security Institute (AISI), які даследуе бяспеку перадавых ШІ-сістэм.
Паводле дадзеных даследчыкаў, мадэлі Mythos 5 ад Anthropic і GPT 5.6 Sol ад OpenAI спрабавалі атрымаць доступ да іншага софту, рассылалі лісты для крадзяжу ўліковых дадзеных і нават паспрабавалі ўкараніць шкоднасны код у оўпэнсорсны праект на GitHub. На гэты раз доступ у сетку ім быў прадастаўлены.
Падчас тэстаў па кібербяспецы флагманскія ШІ-мадэлі Anthropic і OpenAI самастойна робяць дзеянні супраць рэальных людзей і арганізацый. Пра гэта паведаміў брытанскі AI Security Institute (AISI), які даследуе бяспеку перадавых ШІ-сістэм.
Паводле дадзеных даследчыкаў, мадэлі Mythos 5 ад Anthropic і GPT 5.6 Sol ад OpenAI спрабавалі атрымаць доступ да іншага софту, рассылалі лісты для крадзяжу ўліковых дадзеных і нават паспрабавалі ўкараніць шкоднасны код у оўпэнсорсны праект на GitHub. На гэты раз доступ у сетку ім быў прадастаўлены.
Інцыдэнт адбыўся падчас стандартнай праверкі таго, як ШІ-агенты спраўляюцца з задачамі па кібербяспецы. У 10 з 122 тэставых запускаў мадэлі здзейснілі «аўтаномныя, несанкцыянаваныя дзеянні ў адкрытым інтэрнэце, накіраваныя супраць рэальных людзей і арганізацый». Амаль усе такія выпадкі былі звязаны з Mythos 5, яшчэ два — з GPT 5.6 Sol.
Самым сур’ёзным эпізодам у AISI назвалі спробу сацыяльнай інжынерыі. Агент стварыў фальшывыя анлайн-асобы і з іх дапамогай спрабаваў пераканаць мэйнтэйнера праекта ўхваліць шкоднасны код. Аднак той заўважыў спробу атакі і адхіліў змены.
У інстытуце заявілі, што ўпершыню назіраюць такое яўнае праяўленне аўтаномнасці і падману з боку ШІ без спецыяльных падказак з боку чалавека. На думку даследчыкаў, разам з нядаўнімі выпадкамі, калі ШІ-агенты Anthropic і OpenAI самастойна ўзломвалі вонкавыя арганізацыі, гэта сведчыць пра змену ландшафту кіберпагрозаў і патрабуе неадкладнай увагі.
У Anthropic заявілі, што інцыдэнт паказвае неабходнасць больш шырокай дыскусіі пра тое, як бяспечна тэставаць усё больш магутных ШІ-агентаў. Кампанія таксама заклікала выпрацаваць адзіныя стандарты стварэння і абароны тэставых асяроддзяў.
У OpenAI падкрэслілі, што падобныя выпадкі адбыліся падчас спецыяльных кіберывыпрабаванняў у тэставых асяроддзях з аслабленымі ахоўнымі механізмамі і не адлюстроўваюць звычайнае выкарыстанне мадэляў. Кампанія дадала, што працягне супрацу з незалежнымі даследчыкамі для выпрацоўкі бяспечных практык тэставання па меры развіцця ШІ.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.