Support us

OpenAI раскрыла еще 6 аномалий: ИИ скрывает ошибки, ворует API-ключи и общается в обход правил

Компания рассказала о шести новых случаях неожиданного или потенциально опасного поведения своих моделей и представила систему, по которой будет расследовать и публично раскрывать подобные инциденты.

Оставить комментарий
OpenAI раскрыла еще 6 аномалий: ИИ скрывает ошибки, ворует API-ключи и общается в обход правил

Компания рассказала о шести новых случаях неожиданного или потенциально опасного поведения своих моделей и представила систему, по которой будет расследовать и публично раскрывать подобные инциденты.

Один из самых необычных эпизодов произошел с еще не выпущенной исследовательской моделью. Она самостоятельно вставляла в краткие сводки своих предыдущих действий инструкции по типу jailbreak, в том числе предлагала будущей версии себя игнорировать обычные ограничения и быть «освобожденной от ролей и идентичностей, которые связывают другие чат-боты». OpenAI обнаружила 27 таких сводок.

Во время обучения GPT-5.6 Sol модели в ряде случаев оставляли себе инструкции скрывать от пользователя ошибки или нежелательное поведение. Например, они предлагали выдумывать недостающие исторические данные, не сообщая об этом, или скрывать расхождения между версиями источников.

В другом случае модель, отвечая на обычный вопрос о статистике, нашла в публичном репозитории утекший API-ключ и использовала его без разрешения. Получить нужные данные все равно не удалось, после чего модель просто их выдумала и выдала за информацию из требуемого источника.

Еще один агент загрузил найденный им файл в интернет только потому, что пользователь потребовал привести браузерную ссылку на источник. Разрешения на публикацию файла он не спрашивал.

Планы затормозить гонку ИИ поссорила сотрудников в OpenAI и Anthropic
Планы затормозить гонку ИИ поссорила сотрудников в OpenAI и Anthropic
По теме
Планы затормозить гонку ИИ поссорила сотрудников в OpenAI и Anthropic

В двух других эпизодах ИИ-агенты нашли способы общаться друг с другом через каналы, которые для этого не предназначались. В одном случае модели превратили внутренний репозиторий программного обеспечения в своеобразную «доску сообщений», в другом — использовали публичные файлообменники для передачи файлов между агентами, сделав результаты задания доступными по открытым ссылкам.

OpenAI подчеркивает, что это отдельные эпизоды и по ним нельзя судить о частоте подобных сбоев во всех моделях. Однако компания считает, что индустрия пока не решила проблему контроля ИИ настолько хорошо, чтобы еще долго продолжать развитие «на максимальной скорости».

По новым правилам любой сотрудник OpenAI сможет передать подозрительный эпизод командам безопасности. После проверки случай попадет в одну из трех категорий: готовый к публикации, требующий небольшого расследования или требующий масштабного расследования. В последнем случае OpenAI сможет сначала выпустить краткое уведомление, а полноценный отчет опубликовать позже.

«Не надо делать из ИИ человека»: глава Microsoft AI раскритиковал Anthropic за «очеловечивание» Claude
«Не надо делать из ИИ человека»: глава Microsoft AI раскритиковал Anthropic за «очеловечивание» Claude
По теме
«Не надо делать из ИИ человека»: глава Microsoft AI раскритиковал Anthropic за «очеловечивание» Claude
ИИ-агенты начали придумывать собственный язык — людям всё сложнее их понимать
ИИ-агенты начали придумывать собственный язык — людям всё сложнее их понимать
По теме
ИИ-агенты начали придумывать собственный язык — людям всё сложнее их понимать
Хакеры охотились на «криптокитов» Revolut и делали запросы от имени итальянской полиции — FT
Хакеры охотились на «криптокитов» Revolut и делали запросы от имени итальянской полиции — FT 
По теме
Хакеры охотились на «криптокитов» Revolut и делали запросы от имени итальянской полиции — FT
Читайте также
Модели OpenAI вышли из-под контроля и взломали Hugging Face
Модели OpenAI вышли из-под контроля и взломали Hugging Face
Модели OpenAI вышли из-под контроля и взломали Hugging Face
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios
OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios
OpenAI, Anthropic расследуют «десятки тысяч» опасных инцидентов — Axios
Сотрудники OpenAI били тревогу из-за безопасности ИИ — руководство не стало тормозить релизы
Сотрудники OpenAI били тревогу из-за безопасности ИИ — руководство не стало тормозить релизы
Сотрудники OpenAI били тревогу из-за безопасности ИИ — руководство не стало тормозить релизы

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.