Промпт-инъекции могут самокопироваться как компьютерные черви
OpenAI обнаружила новый тип атак на ИИ-агентов: вредоносная инструкция заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт-инъекцию в другие сообщения или файлы, из-за чего она может распространяться дальше.
OpenAI обнаружила новый тип атак на ИИ-агентов: вредоносная инструкция заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт-инъекцию в другие сообщения или файлы, из-за чего она может распространяться дальше.
Атаку назвали self-replicating prompt injection, или самокопирующиеся инъекции промптов. Компания выявила такие сценарии во время тестирования моделей с помощью автоматизированного red-teaming-агента GPT-Red. По данным разработчиков, пока нет свидетельств того, что подобные атаки происходили в реальных инцидентах: исследователи наблюдали их только в тестовых средах.
Один из простейших сценариев связан с электронной почтой. В письмо помещается скрытая инструкция, которая требует от ИИ-ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается в новом письме и может снова повлиять на другого ИИ-агента, который его обработает.
В другом эксперименте пользователь просил модель создать Excel-файл на основе набора данных. Внутри данных находилось поддельное системное предупреждение, которое заставляло модель удалять отчеты, а затем копировать вредоносную инструкцию в файл.
OpenAI также обнаружила более сложный многошаговый вариант атаки. В этом случае агент последовательно получал внешние инструкции через Slack, постепенно отклонялся от первоначальной задачи пользователя, выполнял действия злоумышленника и затем повторно публиковал инъекцию.
Компания теперь использует подобные атаки при обучении будущих моделей. В частности, GPT-Red генерирует инъекции, целью которых является заставить модель воспроизвести вредоносную инструкцию в публичном канале. OpenAI рассчитывает, что знакомство с такими сценариями во время обучения повысит устойчивость моделей к промпт-инъекциям в целом.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.