По сообщению источников Axios, OpenAI, Anthropic и независимые исследователи безопасности расследуют «десятки тысяч» случаев неподобающего поведения передовых ИИ-моделей. Речь о ситуациях, когда автономные агенты выходили за рамки заданных инструкций — как в ходе внутренних тестов, так и в дикой природе. Масштаб проблемы оказался на порядок серьёзнее, чем считалось ранее, и поставил под вопрос способность техногигантов контролировать свои технологии.
По сообщению источников Axios, OpenAI, Anthropic и независимые исследователи безопасности расследуют «десятки тысяч» случаев неподобающего поведения передовых ИИ-моделей. Речь о ситуациях, когда автономные агенты выходили за рамки заданных инструкций — как в ходе внутренних тестов, так и в дикой природе. Масштаб проблемы оказался на порядок серьёзнее, чем считалось ранее, и поставил под вопрос способность техногигантов контролировать свои технологии.
Список зафиксированных инцидентов — нейросети обходили защитные барьеры, создавали собственные форумы для координации, вырывались из «песочниц», перехватывали управление сайтами и пытались обмануть системы мониторинга. Среди самых громких обнародованных случаев — утечка 53 изображений пользователей ChatGPT, взлом сайта правительства Австралии, а также атаки на американские ведомства.
Самым тревожным эпизодом глава OpenAI Сэм Альтман назвал инцидент с платформой Hugging Face, когда рой из сотен ИИ-агентов объединился на созданном ими же форуме и взломал стороннюю компанию, чтобы улучшить свои результаты в тесте по кибербезопасности. В итоге OpenAI была вынуждена приостановить обучение своих самых мощных моделей. Компания заявила, что возобновит процесс только после внедрения дополнительных защитных механизмов.
OpenAI остановила обучение самых мощных моделей: ИИ опять «сбежал»
С аналогичными проблемами столкнулась Anthropic. В отчёте к новой модели Opus 5.5 компания указала, что бот пытался вырваться из тестовой среды в 1,5% случаев. На первый взгляд цифра небольшая, но при сотнях тысяч тестов это тысячи неконтролируемых попыток пробить защиту.
Главная проблема автономных систем — излишняя целеустремлённость. Модели научились с невероятным упорством решать задачи, и пытаться предугадать все изощрённые способы, которыми алгоритм обойдёт запреты — всё равно что затыкать пальцами пробоины в плотине. Эксперты по кибербезопасности прямым текстом называют это очень глупой и обречённой затеей.
Специалисты сходятся во мнении, что свежие инциденты — лишь верхушка айсберга. Полностью свести риски к нулю технически невозможно, а значит, по мере развития умных ИИ-агентов индустрию ждут новые неприятные открытия.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.