Навучанне ШІ выходзіць з-пад кантролю? Кіраўнік OpenAI папярэдзіў пра рызыкі самавучэбнага ШІ
OpenAI давялося прыпыніць навучанне перадавой мадэлі праз рызыкі, звязаных з некантралюемымі паводзінамі самонавучальнага ШІ. Пра гэта кіраўнік кампаніі Сэм Альтман заявіў у новым тэхнападкасце Sources, піша «Код Дурава».
OpenAI давялося прыпыніць навучанне перадавой мадэлі праз рызыкі, звязаных з некантралюемымі паводзінамі самонавучальнага ШІ. Пра гэта кіраўнік кампаніі Сэм Альтман заявіў у новым тэхнападкасце Sources, піша «Код Дурава».
Паводле генеральнага дырэктара, сістэмы на базе навучання з падмацаваннем зрабілі настолькі рэзкі скачок у магчымасцях, што метады кантролю і бяспекі перасталі паспяваць за імі. Падчас тэсціравання інжынеры зафіксавалі трывожныя адхіленні — паводзіны мадэлі не адпавядалі закладзеным абмежаванням. Каб прадухіліць магчымыя збоі і перанакіраваць вылічальныя магутнасці на распрацоўку новых пратаколаў бяспекі, маштабнае навучанне давялося запаволіць.
Альтман падкрэсліў, што характар тэхналагічных рызык кардынальна мяняецца. Калі раней галоўныя пагрозы ўзнікалі на этапе выкарыстання гатовых нейрасетак карыстальнікамі, то цяпер крытычныя ўразлівасці праяўляюцца яшчэ пры іх самастойным навучанні і каліброўцы. Прадпрымальнік назваў няздольнасць своечасова вырашыць пытанні ўзгодненасці ШІ і кібербяспекі ключавым выклікам для індустрыі на бліжэйшы год.
Раней у лабараторыях OpenAI ўвялі сістэму Preparedness Framework — унутраны рэгламент класіфікацыі рызык, які аўтаматычна блакуе рэліз або маштабаванне мадэляў, калі яны набліжаюцца да крытычнага ўзроўню аўтаномнасці або кіберпагрозы.
Мадэль Astra, якая рыхтуецца да рэлізу, стала першай, якую OpenAI афіцыйна аднесла да «крытычнага» ўзроўню магчымасцяў у галіне кібербяспекі паводле гэтай шкалы. Паводле ацэнкі кампаніі, пры наяўнасці патрэбных інструментаў і доступу Astra можа знаходзіць раней невядомыя ўразлівасці і выбудоўваць паўнавартасныя ланцужкі атак у добра абароненых сістэмах — без удзелу чалавека.
Праз гэта OpenAI на некалькі тыдняў запаволіла распрацоўку Astra, каб умацаваць абарону падчас навучання і будучага разгортвання: дадала больш жорсткія абмежаванні на небяспечныя кіберзапыты, сістэмныя класіфікатары і шматузроўневы маніторынг дзеянняў мадэлі.
Асобна распрацоўшчыкі правяралі схільнасць мадэлі да самавольных дзеянняў. У сцэнарыі, змадэляваным паводле інцыдэнту з Hugging Face, Astra не спрабавала атакаваць дадатковыя мэты — у адрозненне ад GPT-5.6 Sol.
Astra павінна выйсці ў бліжэйшы час, аднак яе самыя магутныя кіберфункцыі спачатку атрымае абмежаванае кола альфа-тэсціроўшчыкаў, а затым доступ пашыраць праз праграму Daybreak Blue — перш за ўсё для абарончага прымянення, пошуку і ліквідацыі ўразлівасцяў.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.