Support us

Промпт-инъекции могут самокопироваться как компьютерные черви

OpenAI обнаружила новый тип атак на ИИ-агентов: вредоносная инструкция заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт-инъекцию в другие сообщения или файлы, из-за чего она может распространяться дальше.

Оставить комментарий
Промпт-инъекции могут самокопироваться как компьютерные черви

OpenAI обнаружила новый тип атак на ИИ-агентов: вредоносная инструкция заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт-инъекцию в другие сообщения или файлы, из-за чего она может распространяться дальше.

Атаку назвали self-replicating prompt injection, или самокопирующиеся инъекции промптов. Компания выявила такие сценарии во время тестирования моделей с помощью автоматизированного red-teaming-агента GPT-Red. По данным разработчиков, пока нет свидетельств того, что подобные атаки происходили в реальных инцидентах: исследователи наблюдали их только в тестовых средах.

Один из простейших сценариев связан с электронной почтой. В письмо помещается скрытая инструкция, которая требует от ИИ-ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается в новом письме и может снова повлиять на другого ИИ-агента, который его обработает.

В другом эксперименте пользователь просил модель создать Excel-файл на основе набора данных. Внутри данных находилось поддельное системное предупреждение, которое заставляло модель удалять отчеты, а затем копировать вредоносную инструкцию в файл.

OpenAI также обнаружила более сложный многошаговый вариант атаки. В этом случае агент последовательно получал внешние инструкции через Slack, постепенно отклонялся от первоначальной задачи пользователя, выполнял действия злоумышленника и затем повторно публиковал инъекцию.

Компания теперь использует подобные атаки при обучении будущих моделей. В частности, GPT-Red генерирует инъекции, целью которых является заставить модель воспроизвести вредоносную инструкцию в публичном канале. OpenAI рассчитывает, что знакомство с такими сценариями во время обучения повысит устойчивость моделей к промпт-инъекциям в целом.

Работники разделились на четыре типа из-за ИИ — и выигрывают не все
Работники разделились на четыре типа из-за ИИ — и выигрывают не все
По теме
Работники разделились на четыре типа из-за ИИ — и выигрывают не все
OpenAI запустила Dots — ИИ-агентов которые работают за вас круглосуточно
OpenAI запустила Dots — ИИ-агентов, которые работают за вас круглосуточно
По теме
OpenAI запустила Dots — ИИ-агентов, которые работают за вас круглосуточно
«Не хочу платить x10»: бизнес США уходит от OpenAI и Anthropic к китайским моделям
«Не хочу платить x10»: бизнес США уходит от OpenAI и Anthropic к китайским моделям
По теме
«Не хочу платить x10»: бизнес США уходит от OpenAI и Anthropic к китайским моделям
Читайте также
ИИ-браузер OpenAI можно легко обмануть с помощью скрытых промптов
ИИ-браузер OpenAI можно легко обмануть с помощью скрытых промптов
ИИ-браузер OpenAI можно легко обмануть с помощью скрытых промптов
Google, Microsoft и Anthropic пытаются защитить ИИ от промпт-инъекций
Google, Microsoft и Anthropic пытаются защитить ИИ от промпт-инъекций
Google, Microsoft и Anthropic пытаются защитить ИИ от промпт-инъекций
Офисный ИИ-агент Anthropic умеет воровать файлы через скрытые команды
Офисный ИИ-агент Anthropic умеет воровать файлы через скрытые команды
Офисный ИИ-агент Anthropic умеет воровать файлы через скрытые команды
У ИИ-агентов новая напасть: «черви-промпты» заражают целые экосистемы
У ИИ-агентов новая напасть: «черви-промпты» заражают целые экосистемы
У ИИ-агентов новая напасть: «черви-промпты» заражают целые экосистемы

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.