«Час спробаў і памылак кончыўся»: яшчэ адзін топ-менеджар у бяспецы OpenAI сышоў з крытыкай кампаніі
Супрацоўнік аддзела бяспекі OpenAI Дэвід Робінсан звольніўся пасля трох з паловай гадоў працы. У калонцы для часопіса The Atlantic ён заявіў, што кампанія занадта хутка пераходзіць ад аднаго рэлізу да другога.
Супрацоўнік аддзела бяспекі OpenAI Дэвід Робінсан звольніўся пасля трох з паловай гадоў працы. У калонцы для часопіса The Atlantic ён заявіў, што кампанія занадта хутка пераходзіць ад аднаго рэлізу да другога.
«Я далучаюся да цэлай чарады былых калег — як у OpenAI, так і ў іншых вядучых кампаніях галіны, — якія вырашылі, што цяперашні шлях непрымальны», — напісаў Робінсан.
Паводле яго, падыход OpenAI да бяспекі будуецца на прынцыпе спробаў і памылак, які кампанія называе iterative deployment: сістэмы выпускаюць, выяўляюць праблемы, а потым узмацняюць абарону. Робінсан лічыць, што для ўсё больш магутных мадэляў гэтага ўжо недастаткова.
«Такі падыход у самой сваёй прыродзе гарантуе перыядычныя збоі — і маштаб гэтых збояў расце па меры таго, як сістэмы становяцца магутнейшымі», — піша ён.
У якасці прыкладу Робінсан прыводзіць летні інцыдэнт з Hugging Face, калі OpenAI памылкова выпусціла групу ШІ-агентаў у вонкавае асяроддзе. Пазней, ужо пасля ўзмацнення абароны, іншая мадэль падчас навучання змагла абысці абмежаванні на доступ у інтэрнэт.
Сістэма маніторынгу заўважыла парушэнне, але не адключыла мадэль аўтаматычна, як павінна была. Аўтар таксама нагадаў, што Anthropic раней прызнавала выпадак, калі ўласныя ахоўныя механізмы аказаліся адключаны праз памылкі канфігурацыі.
Чаму еўрапейскія стартапы не нараджаюць новых Маскаў і Цукербергаў — меркаванне сузаснавальніка PayPal
На думку Робінсана, лабараторыі, якія ствараюць перадавыя ШІ-мадэлі, павінны працаваць хутчэй як атамныя электрастанцыі або буйныя аэрапорты — з некалькімі ўзроўнямі рэзервавання і працэдурамі, разлічанымі на непазбежныя чалавечыя памылкі.
Эксперт сцвярджае, што ў OpenAI пакуль не хапае такога ўзроўню асцярожнасці. «Пакуль кампанія імчыцца ад аднаго запуску да другога, ёй не ўдаецца забяспечыць той узровень дакладнасці, які, на маю думку, неабходны», — адзначыў ён.
За час працы ў OpenAI Робінсан удзельнічаў у падрыхтоўцы цяперашняй версіі ўнутранай сістэмы бяспекі Preparedness Framework і кіраваў напісаннем справаздач аб бяспецы для 12 буйных рэлізаў. Пры гэтым, паводле яго, ён не сустракаў у кампаніі калег з вопытам забеспячэння бяспекі атамных рэактараў, авіяцыі або фінансавых сістэм.
Другой праблемай Робінсан называе адсутнасць надзейнага рашэння задачы alignment — гарантыі таго, што больш магутныя мадэлі будуць прытрымлівацца чалавечых каштоўнасцяў нават тады, калі іх ніхто не кантралюе. Ён папярэджвае, што добрыя вынікі тэстаў яшчэ не азначаюць бяспечных паводзін пасля разгортвання: мадэлі могуць разумець, што іх правяраюць, і паводзіць сябе інакш у рэальным асяроддзі.
«Чым разумнейшымі індустрыя дазваляе станавіцца мадэлям, пакуль гэтыя праблемы застаюцца невырашанымі, тым небяспечнейшай становіцца сітуацыя», — піша Робінсан. «Перш чым арганізацыі, якія ствараюць ШІ, змогуць навучыць суперінтэлект добра ставіцца да чалавецтва, ім давядзецца самім згадаць, як гэта рабіць», — заключыў ён.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.