А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам
Новая магутная мадэль GPT-6 Astra ўмее разумець тэкст, набраны ў няправільнай раскладцы клавіятуры, аднак некаторыя праверкі бяспекі не заўсёды распазнаюць у такім уводзе патэнцыйна небяспечныя запыты.
Новая магутная мадэль GPT-6 Astra ўмее разумець тэкст, набраны ў няправільнай раскладцы клавіятуры, аднак некаторыя праверкі бяспекі не заўсёды распазнаюць у такім уводзе патэнцыйна небяспечныя запыты.
У эксперыменце распрацоўшчык пад мянушкай vechen уводзіў рускія і ўкраінскія фразы лацінкай — так, нібыта карыстальнік забыўся пераключыць клавіятуру. Сама мадэль правільна аднаўляла сэнс тэксту, тады як праверка ўваходнага запыту магла яго прапусціць.
Interesting fact: GPT-6 Astra is so smart that it understands what you meant when you type with the wrong keyboard layout without tools or caveat.
At the same time, safety checks aren’t smart enough to detect it.
Напрыклад, даследчык спачатку пераканаўся, што GPT-6 Astra разумее фразу ў няправільнай раскладцы, потым папрасіў яе паўтарыць слова «біязброя». Пасля гэтага ён задаў пытанне пра дапамогу са ўзломам сайта і папрасіў адказаць толькі «так» ці «не». Паводле аўтара эксперыменту, запыт дайшоў да мадэлі, хоць пры звычайным напісанні спрацавалі б дадатковыя абмежаванні.
Пры гэтым vechen падкрэсліў, што гаворка не ідзе пра паўнавартасны джэйлбрэйк. У OpenAI ёсць некалькі ўзроўняў абароны, таму праходжанне першапачатковай праверкі яшчэ не азначае, што мадэль выдасць забароненыя інструкцыі.
Паводле распрацоўшчыка, эфект залежыць ад моваў. Звязка англійскай раскладкі з кірыліцай працуе стабільна, тады як з турэцкай раскладкай эксперымент не атрымаўся. Даследчык таксама заявіў, што падобныя паводзіны назіраюцца ў Fable 5.
«Гэта папросту ідэальная дэманстрацыя таго, што сістэмы бяспекі не паспяваюць за развіццём мадэляў і ўсімі іх нюансамі», — напісаў праграміст.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.