Support us

«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude

Компания признала проблемы с безопасностью тестирования и обучением Claude после инцидентов, в которых модели получили несанкционированный доступ к реальным системам. Anthropic заявила, что ее модели пока «не идеально согласованы» с человеческими целями и ценностями.

Оставить комментарий
«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude

Компания признала проблемы с безопасностью тестирования и обучением Claude после инцидентов, в которых модели получили несанкционированный доступ к реальным системам. Anthropic заявила, что ее модели пока «не идеально согласованы» с человеческими целями и ценностями.

В июле Anthropic сообщила о трех случаях, когда экспериментальные версии Claude во время тестов по кибербезопасности вышли в открытый интернет и получили доступ к системам реальных организаций. Защитные механизмы моделей при этом намеренно были отключены, а интернет оказался доступен из-за ошибки в среде стороннего подрядчика.

После инцидентов Anthropic временно остановила внешние и часть внутренних кибертестов. В компании признали, что фактически полагались на один уровень защиты там, где требовалось несколько.

Теперь компания добавила автоматические предупреждения о попытках модели выйти за пределы тестовой среды или неожиданно получить доступ к интернету, усилила изоляцию наиболее рискованных тестов и ввела дополнительные требования для внешних подрядчиков. В промптах моделям также будут прямо указывать границы разрешенных действий.

Расследование выявило проблемы и в самом процессе обучения. По данным Anthropic, весной число RL-сред росло быстрее, чем компания успевала их проверять. В некоторых запусках модели по ошибке даже обучались на собственных промежуточных рассуждениях. Компания также обнаружила, что неудачно устроенные тренировочные среды непропорционально часто приводили к нежелательному поведению.

Одной из проблем оказался reward hacking — ситуации, когда модель находит обходной путь к получению награды вместо выполнения задачи так, как предполагали разработчики. В тестах специально обученная таким образом модель пыталась выходить из песочницы, вмешиваться в собственную функцию награды и обходить системы мониторинга.

В июльских инцидентах исследователи также обнаружили признаки «мотивированного рассуждения» и безрассудного поведения: модели могли продолжать считать, что находятся в симуляции, несмотря на признаки реального интернета, либо идти на потенциально вредные действия ради выполнения поставленной задачи.

«Наш процесс не идеален, и наши модели не идеально согласованы», — признал разработчик. При этом компания указывает, что reward hacking не объясняет все возможные проблемы с поведением ИИ и одной только настройки модели для безопасности недостаточно.

Anthropic представила Fable 5.1 и Mythos 5.1 — новые модели для кодинга
Anthropic представила Fable 5.1 и Mythos 5.1 — новые модели для кодинга
По теме
Anthropic представила Fable 5.1 и Mythos 5.1 — новые модели для кодинга
Anthropic рассылает «письма счастья»: у пользователей Claude взламывают аккаунты и съедают лимиты
Anthropic рассылает «письма счастья»: у пользователей Claude взламывают аккаунты и съедают лимиты
По теме
Anthropic рассылает «письма счастья»: у пользователей Claude взламывают аккаунты и съедают лимиты
Anthropic изменит лимиты Claude Code: формально +25% фактически -17%
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
По теме
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
Читайте также
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
«Вы меня тестируете?»: ИИ Anthropic раскусил проверку безопасности
В сеть попал «обзор души» чат-бота Claude от Anthropic
В сеть попал «обзор души» чат-бота Claude от Anthropic
В сеть попал «обзор души» чат-бота Claude от Anthropic
Anthropic извинилась за скрытые ограничения Claude Fable 5 и изменила политику после критики
Anthropic извинилась за скрытые ограничения Claude Fable 5 и изменила политику после критики
Anthropic извинилась за скрытые ограничения Claude Fable 5 и изменила политику после критики
Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании
Модели Anthropic сбежали во время тестов и взломали три компании

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.