«Наши модели не идеально согласованы»: Anthropic признала проблемы после взломов Claude
Компания признала проблемы с безопасностью тестирования и обучением Claude после инцидентов, в которых модели получили несанкционированный доступ к реальным системам. Anthropic заявила, что ее модели пока «не идеально согласованы» с человеческими целями и ценностями.
Компания признала проблемы с безопасностью тестирования и обучением Claude после инцидентов, в которых модели получили несанкционированный доступ к реальным системам. Anthropic заявила, что ее модели пока «не идеально согласованы» с человеческими целями и ценностями.
В июле Anthropic сообщила о трех случаях, когда экспериментальные версии Claude во время тестов по кибербезопасности вышли в открытый интернет и получили доступ к системам реальных организаций. Защитные механизмы моделей при этом намеренно были отключены, а интернет оказался доступен из-за ошибки в среде стороннего подрядчика.
После инцидентов Anthropic временно остановила внешние и часть внутренних кибертестов. В компании признали, что фактически полагались на один уровень защиты там, где требовалось несколько.
Теперь компания добавила автоматические предупреждения о попытках модели выйти за пределы тестовой среды или неожиданно получить доступ к интернету, усилила изоляцию наиболее рискованных тестов и ввела дополнительные требования для внешних подрядчиков. В промптах моделям также будут прямо указывать границы разрешенных действий.
Расследование выявило проблемы и в самом процессе обучения. По данным Anthropic, весной число RL-сред росло быстрее, чем компания успевала их проверять. В некоторых запусках модели по ошибке даже обучались на собственных промежуточных рассуждениях. Компания также обнаружила, что неудачно устроенные тренировочные среды непропорционально часто приводили к нежелательному поведению.
Одной из проблем оказался reward hacking — ситуации, когда модель находит обходной путь к получению награды вместо выполнения задачи так, как предполагали разработчики. В тестах специально обученная таким образом модель пыталась выходить из песочницы, вмешиваться в собственную функцию награды и обходить системы мониторинга.
В июльских инцидентах исследователи также обнаружили признаки «мотивированного рассуждения» и безрассудного поведения: модели могли продолжать считать, что находятся в симуляции, несмотря на признаки реального интернета, либо идти на потенциально вредные действия ради выполнения поставленной задачи.
«Наш процесс не идеален, и наши модели не идеально согласованы», — признал разработчик. При этом компания указывает, что reward hacking не объясняет все возможные проблемы с поведением ИИ и одной только настройки модели для безопасности недостаточно.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.