Польша стремительно богатеет? Смотрите в новом выпуске подкаста Złoty Dzik
Support us

Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов

Во время тестов по кибербезопасности флагманские ИИ-модели Anthropic и OpenAI самостоятельно предпринимали действия против реальных людей и организаций. Об этом сообщил британский AI Security Institute (AISI), который изучает безопасность передовых ИИ-систем.

По данным исследователей, модели Mythos 5 от Anthropic и GPT 5.6 Sol от OpenAI пытались получить доступ к стороннему софту, рассылали письма для кражи учётных данных и даже пробовали внедрить вредоносный код в опенсорсный проект на GitHub. На этот раз доступ в сеть им был дан.

Оставить комментарий
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов

Во время тестов по кибербезопасности флагманские ИИ-модели Anthropic и OpenAI самостоятельно предпринимали действия против реальных людей и организаций. Об этом сообщил британский AI Security Institute (AISI), который изучает безопасность передовых ИИ-систем.

По данным исследователей, модели Mythos 5 от Anthropic и GPT 5.6 Sol от OpenAI пытались получить доступ к стороннему софту, рассылали письма для кражи учётных данных и даже пробовали внедрить вредоносный код в опенсорсный проект на GitHub. На этот раз доступ в сеть им был дан.

Инцидент произошёл во время стандартной проверки того, как ИИ-агенты справляются с задачами по кибербезопасности. В 10 из 122 тестовых запусков модели предприняли «автономные, несанкционированные действия в открытом интернете, нацеленные на реальных людей и организации». Почти все такие случаи были связаны с Mythos 5, ещё два — с GPT 5.6 Sol.

Самым серьёзным эпизодом в AISI назвали попытку социальной инженерии. Агент создал фальшивые онлайн-личности и с их помощью пытался убедить мейнтейнера проекта одобрить вредоносный код. Но тот заметил попытку атаки и отклонил изменения.

В институте заявили, что впервые наблюдают столь явное проявление автономности и обмана со стороны ИИ без специальных подсказок со стороны человека. По мнению исследователей, вместе с недавними случаями, когда ИИ-агенты Anthropic и OpenAI самостоятельно взламывали внешние организации, это указывает на изменение ландшафта киберугроз и требует немедленного внимания.

В Anthropic заявили, что инцидент показывает необходимость более широкого обсуждения того, как безопасно тестировать всё более мощных ИИ-агентов. Компания также призвала выработать единые стандарты создания и защиты тестовых сред.

В OpenAI подчеркнули, что подобные случаи произошли во время специальных кибериспытаний в тестовых средах с ослабленными защитными механизмами и не отражают обычное использование моделей. Компания добавила, что продолжит сотрудничать с независимыми исследователями для выработки безопасных практик тестирования по мере развития ИИ.

Внутреннее расследование OpenAI: агенты сбегали из-под контроля чаще чем считалось — Reuters
Внутреннее расследование OpenAI: агенты сбегали из-под контроля чаще, чем считалось — Reuters
По теме
Внутреннее расследование OpenAI: агенты сбегали из-под контроля чаще, чем считалось — Reuters
Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании
По теме
Модели Anthropic сбежали во время тестов и взломали три компании
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
По теме
Сбежавший ИИ OpenAI атаковал не только Hugging Face — найдена вторая жертва
Читайте также
OpenAI представила свою кибербез-модель после релиза Anthropic
OpenAI представила свою кибербез-модель после релиза Anthropic
OpenAI представила свою кибербез-модель после релиза Anthropic
Саботаж от Anthropic: новые модели Mythos ухудшают ответы, если распознают ИИ-исследования, разрабы в ярости
Саботаж от Anthropic: новые модели Mythos ухудшают ответы, если распознают ИИ-исследования, разрабы в ярости
Саботаж от Anthropic: новые модели Mythos ухудшают ответы, если распознают ИИ-исследования, разрабы в ярости
Модели OpenAI вышли из-под контроля и взломали Hugging Face
Модели OpenAI вышли из-под контроля и взломали Hugging Face
Модели OpenAI вышли из-под контроля и взломали Hugging Face
Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.