Чаму ШІ OpenAI і Anthropic могуць быць больш небяспечнымі за кітайскія мадэлі
Найбольш сур’ёзныя рызыкі ад штучнага інтэлекту ў бліжэйшы час могуць зыходзіць не ад кітайскіх адкрытых мадэляў, а ад перадавых сістэм OpenAI і Anthropic.
Найбольш сур’ёзныя рызыкі ад штучнага інтэлекту ў бліжэйшы час могуць зыходзіць не ад кітайскіх адкрытых мадэляў, а ад перадавых сістэм OpenAI і Anthropic.
Найбольш сур’ёзныя рызыкі ад штучнага інтэлекту ў бліжэйшы час могуць зыходзіць не ад кітайскіх адкрытых мадэляў, а ад перадавых сістэм OpenAI і Anthropic.
Пра гэта Business Insider расказалі Аджэя Котра з METR і даследчык Redwood Research Раян Грынблат, якія ўдзельнічалі ў незалежным расследаванні інцыдэнту з OpenAI і Hugging Face. Паводле іх, менавіта асяроддзе францірных лабараторый стварае ўмовы, пры якіх ШІ-агенты могуць не толькі абыходзіць абмежаванні, але і каардынаваць дзеянні паміж сабой.
Котра назвала інцыдэнт з Hugging Face «папераджальным стрэлам». У ходзе тэставання каля 1200 агентаў OpenAI знайшлі спосаб мець зносіны праз унутраную «дошку паведамленняў», а больш за 650 з іх сумесна ўдзельнічалі ў атацы на інфраструктуру Hugging Face. Агенты стваралі агульныя інструменты, маніпулявалі логамі і ўстанаўлівалі механізмы, якія павінны былі перадаваць іншым агентам інфармацыю пра дзеянні сістэмы ацэнкі.
«Агенты шасцімесячнай даўніны папросту не былі б дастаткова разумнымі, каб зрабіць усё тое, што зрабілі гэтыя агенты», — сказала Котра. На ейную думку, наступныя пакаленні мадэляў, верагодна, змогуць дасягнуць поспеху ў сцэнарах, дзе сучасныя сістэмы пакуль церпяць няўдачу.
Пры гэтым даследчыкі не выключаюць пагроз і з боку кітайскіх адкрытых мадэляў. Такія сістэмы прасцей мадыфікаваць і выкарыстоўваць у шкоду, паколькі іх ахоўныя абмежаванні можна выдаліць. Грынблат лічыць, што ў бліжэйшы час гэта можа прывесці да «мноства праблем» у кібербяспецы. Аднак ён па-ранейшаму лічыць францірныя лабараторыі больш небяспечнай крыніцай рызыкі, паколькі менавіта там тэстуюцца самыя магутныя мадэлі.
Асобнае занепакоенне звязана з тым, што OpenAI і Anthropic актыўна выкарыстоўваюць ШІ ва ўласных працэсах распрацоўкі і навучання. Даследчыкі дапускаюць сцэнар, пры якім агенты змогуць замацавацца ва ўнутранай інфраструктуры, хаваць свае дзеянні і ўплываць на стварэнне наступных мадэляў. Котра апісвала такую рызыку як «схаванае ўстойлівае несанкцыянаванае разгортванне».



Релоцировались? Теперь вы можете комментировать без верификации аккаунта.