Дапамажыце dev.by 🤍
Падтрымаць

А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам

Новая магутная мадэль GPT-6 Astra ўмее разумець тэкст, набраны ў няправільнай раскладцы клавіятуры, аднак некаторыя праверкі бяспекі не заўсёды распазнаюць у такім уводзе патэнцыйна небяспечныя запыты.

Пакінуць каментарый
А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам

Новая магутная мадэль GPT-6 Astra ўмее разумець тэкст, набраны ў няправільнай раскладцы клавіятуры, аднак некаторыя праверкі бяспекі не заўсёды распазнаюць у такім уводзе патэнцыйна небяспечныя запыты.

У эксперыменце распрацоўшчык пад мянушкай vechen уводзіў рускія і ўкраінскія фразы лацінкай — так, нібыта карыстальнік забыўся пераключыць клавіятуру. Сама мадэль правільна аднаўляла сэнс тэксту, тады як праверка ўваходнага запыту магла яго прапусціць.

Напрыклад, даследчык спачатку пераканаўся, што GPT-6 Astra разумее фразу ў няправільнай раскладцы, потым папрасіў яе паўтарыць слова «біязброя». Пасля гэтага ён задаў пытанне пра дапамогу са ўзломам сайта і папрасіў адказаць толькі «так» ці «не». Паводле аўтара эксперыменту, запыт дайшоў да мадэлі, хоць пры звычайным напісанні спрацавалі б дадатковыя абмежаванні.

Пры гэтым vechen падкрэсліў, што гаворка не ідзе пра паўнавартасны джэйлбрэйк. У OpenAI ёсць некалькі ўзроўняў абароны, таму праходжанне першапачатковай праверкі яшчэ не азначае, што мадэль выдасць забароненыя інструкцыі.

Паводле распрацоўшчыка, эфект залежыць ад моваў. Звязка англійскай раскладкі з кірыліцай працуе стабільна, тады як з турэцкай раскладкай эксперымент не атрымаўся. Даследчык таксама заявіў, што падобныя паводзіны назіраюцца ў Fable 5.

«Гэта папросту ідэальная дэманстрацыя таго, што сістэмы бяспекі не паспяваюць за развіццём мадэляў і ўсімі іх нюансамі», — напісаў праграміст.

Звольнены айцішнік стварыў базу калег па няшчасці — большасць ужо знайшлі новую працу
Звольнены айцішнік стварыў базу калег па няшчасці — большасць ужо знайшлі новую працу
Па тэме
Звольнены айцішнік стварыў базу калег па няшчасці — большасць ужо знайшлі новую працу
Рынак найму закруціла ў «ІІ-пятлю» — як з яе выбрацца, пакуль незразумела
Рынак найму закруціла ў «ІІ-пятлю» — як з яе выбрацца, пакуль незразумела
Па тэме
Рынак найму закруціла ў «ІІ-пятлю» — як з яе выбрацца, пакуль незразумела
Інжынер даў віртуальнаму мозгу мухі $100 і адправіў гандляваць крыптай
Інжынер даў віртуальнаму мозгу мухі $100 і адправіў гандляваць крыптай
Па тэме
Інжынер даў віртуальнаму мозгу мухі $100 і адправіў гандляваць крыптай
Чытайце таксама
ChatGPT навучыўся лёгка праходзіць капчу. Эксперты б'юць трывогу
ChatGPT навучыўся лёгка праходзіць капчу. Эксперты б'юць трывогу
ChatGPT навучыўся лёгка праходзіць капчу. Эксперты б'юць трывогу
OpenAI выпусціла падрабязны гайд па промптынгу GPT-6 Astra
OpenAI выпусціла падрабязны гайд па промптынгу GPT-6 Astra
OpenAI выпусціла падрабязны гайд па промптынгу GPT-6 Astra
А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам
А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам
А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам
OpenAI адмяніла рэліз GPT-6.1 Astra праз хлусню мадэлі, а Anthropic пужае інвестараў рызыкамі перад IPO
OpenAI адмяніла рэліз GPT-6.1 Astra праз хлусню мадэлі, а Anthropic пужае інвестараў рызыкамі перад IPO
OpenAI адмяніла рэліз GPT-6.1 Astra праз хлусню мадэлі, а Anthropic пужае інвестараў рызыкамі перад IPO

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.