Дапамажыце dev.by 🤍
Падтрымаць

Навучанне ШІ выходзіць з-пад кантролю? Кіраўнік OpenAI папярэдзіў пра рызыкі самавучэбнага ШІ

OpenAI давялося прыпыніць навучанне перадавой мадэлі праз рызыкі, звязаных з некантралюемымі паводзінамі самонавучальнага ШІ. Пра гэта кіраўнік кампаніі Сэм Альтман заявіў у новым тэхнападкасце Sources, піша «Код Дурава».

Пакінуць каментарый

OpenAI давялося прыпыніць навучанне перадавой мадэлі праз рызыкі, звязаных з некантралюемымі паводзінамі самонавучальнага ШІ. Пра гэта кіраўнік кампаніі Сэм Альтман заявіў у новым тэхнападкасце Sources, піша «Код Дурава».

Паводле генеральнага дырэктара, сістэмы на базе навучання з падмацаваннем зрабілі настолькі рэзкі скачок у магчымасцях, што метады кантролю і бяспекі перасталі паспяваць за імі. Падчас тэсціравання інжынеры зафіксавалі трывожныя адхіленні — паводзіны мадэлі не адпавядалі закладзеным абмежаванням. Каб прадухіліць магчымыя збоі і перанакіраваць вылічальныя магутнасці на распрацоўку новых пратаколаў бяспекі, маштабнае навучанне давялося запаволіць.

Альтман падкрэсліў, што характар тэхналагічных рызык кардынальна мяняецца. Калі раней галоўныя пагрозы ўзнікалі на этапе выкарыстання гатовых нейрасетак карыстальнікамі, то цяпер крытычныя ўразлівасці праяўляюцца яшчэ пры іх самастойным навучанні і каліброўцы. Прадпрымальнік назваў няздольнасць своечасова вырашыць пытанні ўзгодненасці ШІ і кібербяспекі ключавым выклікам для індустрыі на бліжэйшы год.

Раней у лабараторыях OpenAI ўвялі сістэму Preparedness Framework — унутраны рэгламент класіфікацыі рызык, які аўтаматычна блакуе рэліз або маштабаванне мадэляў, калі яны набліжаюцца да крытычнага ўзроўню аўтаномнасці або кіберпагрозы.

Мадэль Astra, якая рыхтуецца да рэлізу, стала першай, якую OpenAI афіцыйна аднесла да «крытычнага» ўзроўню магчымасцяў у галіне кібербяспекі паводле гэтай шкалы. Паводле ацэнкі кампаніі, пры наяўнасці патрэбных інструментаў і доступу Astra можа знаходзіць раней невядомыя ўразлівасці і выбудоўваць паўнавартасныя ланцужкі атак у добра абароненых сістэмах — без удзелу чалавека.

Праз гэта OpenAI на некалькі тыдняў запаволіла распрацоўку Astra, каб умацаваць абарону падчас навучання і будучага разгортвання: дадала больш жорсткія абмежаванні на небяспечныя кіберзапыты, сістэмныя класіфікатары і шматузроўневы маніторынг дзеянняў мадэлі.

Асобна распрацоўшчыкі правяралі схільнасць мадэлі да самавольных дзеянняў. У сцэнарыі, змадэляваным паводле інцыдэнту з Hugging Face, Astra не спрабавала атакаваць дадатковыя мэты — у адрозненне ад GPT-5.6 Sol.

Astra павінна выйсці ў бліжэйшы час, аднак яе самыя магутныя кіберфункцыі спачатку атрымае абмежаванае кола альфа-тэсціроўшчыкаў, а затым доступ пашыраць праз праграму Daybreak Blue — перш за ўсё для абарончага прымянення, пошуку і ліквідацыі ўразлівасцяў.

Чаму ШІ OpenAI і Anthropic могуць быць небяспечнейшымі за кітайскія мадэлі
Чаму ШІ OpenAI і Anthropic могуць быць небяспечнейшымі за кітайскія мадэлі
Па тэме
Чаму ШІ OpenAI і Anthropic могуць быць небяспечнейшымі за кітайскія мадэлі
Тайны змова, самаахвяраванне і захоп інфраструктуры: з'явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI
Тайны змова, самаахвяраванне і захоп інфраструктуры: з’явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI
Па тэме
Тайны змова, самаахвяраванне і захоп інфраструктуры: з’явіліся новыя дэталі ўцёкаў ШІ-агентаў OpenAI
Чытайце таксама
Кіраўнік OpenAI: аўтаматызаваць абсалютна ўсё — дрэнна і небяспечна
Кіраўнік OpenAI: аўтаматызаваць абсалютна ўсё — дрэнна і небяспечна
Кіраўнік OpenAI: аўтаматызаваць абсалютна ўсё — дрэнна і небяспечна
«Не, і ён сам у гэта не верыць». Навукоўцы ў галіне ШІ і філосафы адказалі на заявы Альтмана пра сінгулярнасць
«Не, і ён сам у гэта не верыць». Навукоўцы ў галіне ШІ і філосафы адказалі на заявы Альтмана пра сінгулярнасць
«Не, і ён сам у гэта не верыць». Навукоўцы ў галіне ШІ і філосафы адказалі на заявы Альтмана пра сінгулярнасць
OpenAI спалохалася ўзлому Hugging Face і прытармазіла навучанне ШІ
OpenAI спалохалася ўзлому Hugging Face і прытармазіла навучанне ШІ
OpenAI спалохалася ўзлому Hugging Face і прытармазіла навучанне ШІ
1 каментарый
Чаму ШІ OpenAI і Anthropic могуць быць больш небяспечнымі за кітайскія мадэлі
Чаму ШІ OpenAI і Anthropic могуць быць больш небяспечнымі за кітайскія мадэлі
Чаму ШІ OpenAI і Anthropic могуць быць больш небяспечнымі за кітайскія мадэлі

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.