Anthropic и OpenAI хотят независимых контролёров за ИИ. Что не так с этой идеей
Anthropic и OpenAI хотят пустить внешних экспертов во внутренние системы для проверки безопасности ИИ. Критики отмечают, что остановить опасную модель они все равно не смогут.
Anthropic и OpenAI хотят пустить внешних экспертов во внутренние системы для проверки безопасности ИИ. Критики отмечают, что остановить опасную модель они все равно не смогут.
Идею предложил глава Anthropic Дарио Амодей в рамках плана по замедлению развития наиболее мощных ИИ-систем. Компания обещает дать независимым экспертам рабочие места в офисе, пропуска, корпоративные ноутбуки и доступ, сопоставимый с доступом собственных команд по оценке рисков.
Они также смогут публиковать выводы без редакционного контроля Anthropic, за исключением ограниченных случаев, связанных с безопасностью, законом и конфиденциальностью. Амодеи сравнил такой подход с постоянным надзором за банками.
Однако специалисты по банковскому регулированию считают аналогию неполной. Как отмечает CNBC, банковские надзорные органы могут потребовать прекратить определенную практику, ограничить деятельность организации и в крайнем случае добиться ее закрытия. Предлагаемые ИИ-аудиторы смогут выявлять проблемы и публиковать отчеты, но окончательное решение останется за разработчиком.
«Если вы не даете им такой власти, я не понимаю, что именно они делают», — сказала специалист по банковскому регулированию Джули Андерсен Хилл. По ее словам, доступ к внутренним данным сам по себе не превращает внешнего эксперта в полноценного регулятора.
Google открыла институт для защиты человечества от общего ИИ
Есть вопросы и к независимости самих проверяющих. Пока именно ИИ-компания решает, кого допустить к своим системам, какой доступ предоставить и что делать с результатами проверки. Эксперты, опрошенные TechCrunch, в целом поддержали идею внешней оценки, но считают, что ей нужны публичные правила и, вероятно, законодательное закрепление. Иначе добровольная система остается зависимой от решения самой компании.
Одним из возможных проверяющих Амодей называл некоммерческую организацию METR, которая уже исследовала риски моделей Anthropic и OpenAI. Обсуждение вокруг нее показывает еще одну проблему: специалистов, способных технически оценивать передовые ИИ-системы, мало, а сообщество разработчиков и исследователей безопасности тесно связано между собой.
Еще одно ограничение — сами тесты не гарантируют, что обнаружат редкое опасное поведение. Проверка может показать, способен ли ИИ выполнить определенную вредоносную задачу, но реальный риск может возникнуть только при необычном сочетании инструкций, инструментов, разрешений и обстоятельств, которое аудиторы просто не воспроизведут.
OpenAI уже использует внешние оценки моделей и ранее публиковала рекомендации по тому, как должны проводиться такие проверки. Компания отмечает, что современные агентные системы необходимо оценивать не только по ответам модели, но и с учетом инструментов и среды, в которой она действует.
В результате спор идет о том, кто будет выбирать аудиторов, какой доступ они получат и будут ли их выводы иметь обязательные последствия. Как сформулировала исследовательница Дебора Раджи: если проверка заканчивается отчетом, после которого ничего не происходит, возникает риск того, что аудит станет лишь формальностью.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.