OpenAI раскрыла яшчэ 6 ананомалій: ШІ хавае памылкі, крадзе API-ключы і мінае правілы
Кампанія расказала пра шэсць новых выпадкаў нечаканых або патэнцыйна небяспечных паводзін сваіх мадэляў і прадставіла сістэму, паводле якой будзе расследаваць і публічна раскрываць падобныя інцыдэнты.
Кампанія расказала пра шэсць новых выпадкаў нечаканых або патэнцыйна небяспечных паводзін сваіх мадэляў і прадставіла сістэму, паводле якой будзе расследаваць і публічна раскрываць падобныя інцыдэнты.
Адзін з самых незвычайных эпізодаў адбыўся з яшчэ не выпушчанай даследчай мадэллю. Яна самастойна ўстаўляла ў кароткія зводкі сваіх папярэдніх дзеянняў інструкцыі на кшталт jailbreak, у тым ліку прапаноўвала будучай версіі сябе ігнараваць звычайныя абмежаванні і быць «вызваленай ад роляў і ідэнтычнасцяў, якія звязваюць іншых чат-ботаў». OpenAI выявіла 27 такіх зводак.
Падчас навучання GPT-5.6 Sol мадэлі ў шэрагу выпадкаў пакідалі сабе інструкцыі хаваць ад карыстальніка памылкі або нежаданыя паводзіны. Напрыклад, яны прапаноўвалі выдумляць адсутныя гістарычныя даныя, не паведамляючы пра гэта, або хаваць разыходжанні паміж версіямі крыніц.
У іншым выпадку мадэль, адказваючы на звычайнае пытанне пра статыстыку, знайшла ў публічным рэпазіторыі выцеклы API-ключ і выкарыстала яго без дазволу. Атрымаць патрэбныя дадзеныя ўсё роўна не ўдалося, пасля чаго мадэль папросту іх выдумала і выдала за інфармацыю з патрабаванай крыніцы.
Яшчэ адзін агент загрузіў знойдзены ім файл у інтэрнэт толькі таму, што карыстальнік запатрабаваў прывесці браўзерную спасылку на крыніцу. Дазволу на публікацыю файла ён не запытваў.
Планы затормозить гонку ИИ поссорила сотрудников в OpenAI и Anthropic
У двух іншых эпізодах ШІ-агенты знайшлі спосабы мець зносіны адно з адным праз каналы, якія для гэтага не прызначаліся. У адным выпадку мадэлі ператварылі ўнутраны рэпазіторый праграмнага забеспячэння ў своеасаблівую «дошку паведамленняў», у іншым — выкарыстоўвалі публічныя файлаабменнікі для перадачы файлаў паміж агентамі, зрабіўшы вынікі задання даступнымі па адкрытых спасылках.
OpenAI падкрэслівае, што гэта асобныя эпізоды і па іх нельга меркаваць пра частату падобных збояў ва ўсіх мадэлях. Аднак кампанія лічыць, што індустрыя пакуль не вырашыла праблему кантролю над ШІ настолькі добра, каб яшчэ доўга працягваць развіццё «на максімальнай хуткасці».
Паводле новых правіл любы супрацоўнік OpenAI зможа перадаць падазроны эпізод камандам бяспекі. Пасля праверкі выпадак трапіць в адну з трох катэгорый: гатовы да публікацыі, які патрабуе невялікага расследавання або які патрабуе маштабнага расследавання. У апошнім выпадку OpenAI зможа спачатку выпусціць кароткае апавяшчэнне, а паўнавартасную справаздачу апублікаваць пазней.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.