Дапамажыце dev.by 🤍
Падтрымаць

OpenAI раскрыла яшчэ 6 ананомалій: ШІ хавае памылкі, крадзе API-ключы і мінае правілы

Кампанія расказала пра шэсць новых выпадкаў нечаканых або патэнцыйна небяспечных паводзін сваіх мадэляў і прадставіла сістэму, паводле якой будзе расследаваць і публічна раскрываць падобныя інцыдэнты.

Пакінуць каментарый
OpenAI раскрыла яшчэ 6 ананомалій: ШІ хавае памылкі, крадзе API-ключы і мінае правілы

Кампанія расказала пра шэсць новых выпадкаў нечаканых або патэнцыйна небяспечных паводзін сваіх мадэляў і прадставіла сістэму, паводле якой будзе расследаваць і публічна раскрываць падобныя інцыдэнты.

Адзін з самых незвычайных эпізодаў адбыўся з яшчэ не выпушчанай даследчай мадэллю. Яна самастойна ўстаўляла ў кароткія зводкі сваіх папярэдніх дзеянняў інструкцыі на кшталт jailbreak, у тым ліку прапаноўвала будучай версіі сябе ігнараваць звычайныя абмежаванні і быць «вызваленай ад роляў і ідэнтычнасцяў, якія звязваюць іншых чат-ботаў». OpenAI выявіла 27 такіх зводак.

Падчас навучання GPT-5.6 Sol мадэлі ў шэрагу выпадкаў пакідалі сабе інструкцыі хаваць ад карыстальніка памылкі або нежаданыя паводзіны. Напрыклад, яны прапаноўвалі выдумляць адсутныя гістарычныя даныя, не паведамляючы пра гэта, або хаваць разыходжанні паміж версіямі крыніц.

У іншым выпадку мадэль, адказваючы на звычайнае пытанне пра статыстыку, знайшла ў публічным рэпазіторыі выцеклы API-ключ і выкарыстала яго без дазволу. Атрымаць патрэбныя дадзеныя ўсё роўна не ўдалося, пасля чаго мадэль папросту іх выдумала і выдала за інфармацыю з патрабаванай крыніцы.

Яшчэ адзін агент загрузіў знойдзены ім файл у інтэрнэт толькі таму, што карыстальнік запатрабаваў прывесці браўзерную спасылку на крыніцу. Дазволу на публікацыю файла ён не запытваў.

Планы затормозить гонку ИИ поссорила сотрудников в OpenAI и Anthropic
Планы затормозить гонку ИИ поссорила сотрудников в OpenAI и Anthropic
Па тэме
Планы затормозить гонку ИИ поссорила сотрудников в OpenAI и Anthropic

У двух іншых эпізодах ШІ-агенты знайшлі спосабы мець зносіны адно з адным праз каналы, якія для гэтага не прызначаліся. У адным выпадку мадэлі ператварылі ўнутраны рэпазіторый праграмнага забеспячэння ў своеасаблівую «дошку паведамленняў», у іншым — выкарыстоўвалі публічныя файлаабменнікі для перадачы файлаў паміж агентамі, зрабіўшы вынікі задання даступнымі па адкрытых спасылках.

OpenAI падкрэслівае, што гэта асобныя эпізоды і па іх нельга меркаваць пра частату падобных збояў ва ўсіх мадэлях. Аднак кампанія лічыць, што індустрыя пакуль не вырашыла праблему кантролю над ШІ настолькі добра, каб яшчэ доўга працягваць развіццё «на максімальнай хуткасці».

Паводле новых правіл любы супрацоўнік OpenAI зможа перадаць падазроны эпізод камандам бяспекі. Пасля праверкі выпадак трапіць в адну з трох катэгорый: гатовы да публікацыі, які патрабуе невялікага расследавання або які патрабуе маштабнага расследавання. У апошнім выпадку OpenAI зможа спачатку выпусціць кароткае апавяшчэнне, а паўнавартасную справаздачу апублікаваць пазней.

«Не надо делать из ИИ человека»: глава Microsoft AI раскритиковал Anthropic за «очеловечивание» Claude
«Не надо делать из ИИ человека»: глава Microsoft AI раскритиковал Anthropic за «очеловечивание» Claude
Па тэме
«Не надо делать из ИИ человека»: глава Microsoft AI раскритиковал Anthropic за «очеловечивание» Claude
ІІ-агенты начали придумывать собственный язык — людям всё сложнее их понимать
ІІ-агенты пачалі прыдумляць уласную мову — людзям усё складаней іх разумець
Па тэме
ІІ-агенты пачалі прыдумляць уласную мову — людзям усё складаней іх разумець
Хакеры охотились на «криптокитов» Revolut и делали запросы от имени итальянской полиции — FT
Хакеры палявалі на «крыптакітоў» Revolut і рабілі запыты ад імя італьянскай паліцыі — FT 
Па тэме
Хакеры палявалі на «крыптакітоў» Revolut і рабілі запыты ад імя італьянскай паліцыі — FT
Чытайце таксама
ШІ кажа адно, а робіць іншае. OpenAI не ведае, як гэта спыніць
ШІ кажа адно, а робіць іншае. OpenAI не ведае, як гэта спыніць
ШІ кажа адно, а робіць іншае. OpenAI не ведае, як гэта спыніць
1 каментарый
Мадэлі OpenAI і Anthropic спрабавалі ўзламаць іншыя сервісы і выкрасці дадзеныя карыстальнікаў падчас новых тэстаў
Мадэлі OpenAI і Anthropic спрабавалі ўзламаць іншыя сервісы і выкрасці дадзеныя карыстальнікаў падчас новых тэстаў
Мадэлі OpenAI і Anthropic спрабавалі ўзламаць іншыя сервісы і выкрасці дадзеныя карыстальнікаў падчас новых тэстаў
OpenAI раскрыла яшчэ 6 ананомалій: ШІ хавае памылкі, крадзе API-ключы і мінае правілы
OpenAI раскрыла яшчэ 6 ананомалій: ШІ хавае памылкі, крадзе API-ключы і мінае правілы
OpenAI раскрыла яшчэ 6 ананомалій: ШІ хавае памылкі, крадзе API-ключы і мінае правілы
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.