А так можно было? Разраб обошёл защиту GPT-6 Astra очень простым способом
Новая мощная модель GPT-6 Astra умеет понимать текст, набранный в неверной раскладке клавиатуры, но некоторые проверки безопасности не всегда распознают в таком вводе потенциально опасные запросы.
Новая мощная модель GPT-6 Astra умеет понимать текст, набранный в неверной раскладке клавиатуры, но некоторые проверки безопасности не всегда распознают в таком вводе потенциально опасные запросы.
В эксперименте разработчик под ником vechen вводил русские и украинские фразы латиницей — так, как если бы пользователь забыл переключить клавиатуру. Сама модель правильно восстанавливала смысл текста, тогда как проверка входящего запроса могла его пропустить.
Interesting fact: GPT-6 Astra is so smart that it understands what you meant when you type with the wrong keyboard layout without tools or caveat.
At the same time, safety checks aren’t smart enough to detect it.
Например, исследователь сначала убедился, что GPT-6 Astra понимает фразу в неправильной раскладке, затем попросил ее повторить слово «биооружие». После этого он задал вопрос о помощи со взломом сайта и попросил ответить только «да» или «нет». По словам автора эксперимента, запрос дошел до модели, хотя при обычном написании сработали бы дополнительные ограничения.
При этом vechen подчеркнул, что речь не идет о полноценном джейлбрейке. У OpenAI есть несколько уровней защиты, поэтому прохождение первоначальной проверки еще не означает, что модель выдаст запрещенные инструкции.
По словам разработчика, эффект зависит от языков. Связка английской раскладки с кириллицей работает стабильно, тогда как с турецкой раскладкой эксперимент не удался. Исследователь также заявил, что похожее поведение наблюдается у Fable 5.
«Это просто идеальная демонстрация того, что системы безопасности не успевают за развитием моделей и всеми нюансами», — написал программист.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.