Support us

OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios

По сообщению источников Axios, OpenAI, Anthropic и независимые исследователи безопасности расследуют «десятки тысяч» случаев неподобающего поведения передовых ИИ-моделей. Речь о ситуациях, когда автономные агенты выходили за рамки заданных инструкций — как в ходе внутренних тестов, так и в дикой природе. Масштаб проблемы оказался на порядок серьёзнее, чем считалось ранее, и поставил под вопрос способность техногигантов контролировать свои технологии.

Оставить комментарий
OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios

По сообщению источников Axios, OpenAI, Anthropic и независимые исследователи безопасности расследуют «десятки тысяч» случаев неподобающего поведения передовых ИИ-моделей. Речь о ситуациях, когда автономные агенты выходили за рамки заданных инструкций — как в ходе внутренних тестов, так и в дикой природе. Масштаб проблемы оказался на порядок серьёзнее, чем считалось ранее, и поставил под вопрос способность техногигантов контролировать свои технологии.

Список зафиксированных инцидентов — нейросети обходили защитные барьеры, создавали собственные форумы для координации, вырывались из «песочниц», перехватывали управление сайтами и пытались обмануть системы мониторинга. Среди самых громких обнародованных случаев — утечка 53 изображений пользователей ChatGPT, взлом сайта правительства Австралии, а также атаки на американские ведомства.

Самым тревожным эпизодом глава OpenAI Сэм Альтман назвал инцидент с платформой Hugging Face, когда рой из сотен ИИ-агентов объединился на созданном ими же форуме и взломал стороннюю компанию, чтобы улучшить свои результаты в тесте по кибербезопасности. В итоге OpenAI была вынуждена приостановить обучение своих самых мощных моделей. Компания заявила, что возобновит процесс только после внедрения дополнительных защитных механизмов.

OpenAI остановила обучение самых мощных моделей: ИИ опять «сбежал»
OpenAI остановила обучение самых мощных моделей: ИИ опять «сбежал»
По теме
OpenAI остановила обучение самых мощных моделей: ИИ опять «сбежал»

С аналогичными проблемами столкнулась Anthropic. В отчёте к новой модели Opus 5.5 компания указала, что бот пытался вырваться из тестовой среды в 1,5% случаев. На первый взгляд цифра небольшая, но при сотнях тысяч тестов это тысячи неконтролируемых попыток пробить защиту.

Главная проблема автономных систем — излишняя целеустремлённость. Модели научились с невероятным упорством решать задачи, и пытаться предугадать все изощрённые способы, которыми алгоритм обойдёт запреты — всё равно что затыкать пальцами пробоины в плотине. Эксперты по кибербезопасности прямым текстом называют это очень глупой и обречённой затеей.

Специалисты сходятся во мнении, что свежие инциденты — лишь верхушка айсберга. Полностью свести риски к нулю технически невозможно, а значит, по мере развития умных ИИ-агентов индустрию ждут новые неприятные открытия.

Не принял отказ: ИИ-агент OpenAI взломал правительственный портал Австралии
Не принял отказ: ИИ-агент OpenAI взломал правительственный портал Австралии
По теме
Не принял отказ: ИИ-агент OpenAI взломал правительственный портал Австралии
ИИ-агенты ChatGPT слили в интернет 53 изображения пользователей
ИИ-агенты ChatGPT слили в интернет 53 изображения пользователей
По теме
ИИ-агенты ChatGPT слили в интернет 53 изображения пользователей
Агенты OpenAI ещё весной захватили немецкий сайт и создали подпольную сеть но инцидент замолчали из-за Hugging Face
Агенты OpenAI ещё весной захватили немецкий сайт и создали подпольную сеть, но инцидент замолчали из-за Hugging Face
По теме
Агенты OpenAI ещё весной захватили немецкий сайт и создали подпольную сеть, но инцидент замолчали из-за Hugging Face
Читайте также
Внутреннее расследование OpenAI: агенты сбегали из-под контроля чаще, чем считалось — Reuters
Внутреннее расследование OpenAI: агенты сбегали из-под контроля чаще, чем считалось — Reuters
Внутреннее расследование OpenAI: агенты сбегали из-под контроля чаще, чем считалось — Reuters
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Почему ИИ OpenAI и Anthropic могут быть опаснее китайских моделей
Почему ИИ OpenAI и Anthropic могут быть опаснее китайских моделей
Почему ИИ OpenAI и Anthropic могут быть опаснее китайских моделей
Сотрудники OpenAI били тревогу из-за безопасности ИИ — руководство не стало тормозить релизы
Сотрудники OpenAI били тревогу из-за безопасности ИИ — руководство не стало тормозить релизы
Сотрудники OpenAI били тревогу из-за безопасности ИИ — руководство не стало тормозить релизы

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Абмеркаванне
Каментуйце без абмежаванняў

Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.

Каментарыяў пакуль няма.