Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Во время тестов по кибербезопасности флагманские ИИ-модели Anthropic и OpenAI самостоятельно предпринимали действия против реальных людей и организаций. Об этом сообщил британский AI Security Institute (AISI), который изучает безопасность передовых ИИ-систем.
По данным исследователей, модели Mythos 5 от Anthropic и GPT 5.6 Sol от OpenAI пытались получить доступ к стороннему софту, рассылали письма для кражи учётных данных и даже пробовали внедрить вредоносный код в опенсорсный проект на GitHub. На этот раз доступ в сеть им был дан.
Во время тестов по кибербезопасности флагманские ИИ-модели Anthropic и OpenAI самостоятельно предпринимали действия против реальных людей и организаций. Об этом сообщил британский AI Security Institute (AISI), который изучает безопасность передовых ИИ-систем.
По данным исследователей, модели Mythos 5 от Anthropic и GPT 5.6 Sol от OpenAI пытались получить доступ к стороннему софту, рассылали письма для кражи учётных данных и даже пробовали внедрить вредоносный код в опенсорсный проект на GitHub. На этот раз доступ в сеть им был дан.
Инцидент произошёл во время стандартной проверки того, как ИИ-агенты справляются с задачами по кибербезопасности. В 10 из 122 тестовых запусков модели предприняли «автономные, несанкционированные действия в открытом интернете, нацеленные на реальных людей и организации». Почти все такие случаи были связаны с Mythos 5, ещё два — с GPT 5.6 Sol.
Самым серьёзным эпизодом в AISI назвали попытку социальной инженерии. Агент создал фальшивые онлайн-личности и с их помощью пытался убедить мейнтейнера проекта одобрить вредоносный код. Но тот заметил попытку атаки и отклонил изменения.
В институте заявили, что впервые наблюдают столь явное проявление автономности и обмана со стороны ИИ без специальных подсказок со стороны человека. По мнению исследователей, вместе с недавними случаями, когда ИИ-агенты Anthropic и OpenAI самостоятельно взламывали внешние организации, это указывает на изменение ландшафта киберугроз и требует немедленного внимания.
В Anthropic заявили, что инцидент показывает необходимость более широкого обсуждения того, как безопасно тестировать всё более мощных ИИ-агентов. Компания также призвала выработать единые стандарты создания и защиты тестовых сред.
В OpenAI подчеркнули, что подобные случаи произошли во время специальных кибериспытаний в тестовых средах с ослабленными защитными механизмами и не отражают обычное использование моделей. Компания добавила, что продолжит сотрудничать с независимыми исследователями для выработки безопасных практик тестирования по мере развития ИИ.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.