«Время проб и ошибок закончилось»: ещё один топ безопасности OpenAI уволился с критикой компании
Сотрудник отдела безпоасности OpenAI Дэвид Робинсон уволился после трех с половиной лет работы. В колонке для журнала The Atlantic он заявил, что компания слишком быстро переходит от одного релиза к другому.
Сотрудник отдела безпоасности OpenAI Дэвид Робинсон уволился после трех с половиной лет работы. В колонке для журнала The Atlantic он заявил, что компания слишком быстро переходит от одного релиза к другому.
«Я присоединяюсь к целой череде бывших коллег — как в OpenAI, так и в других ведущих компаниях отрасли, — которые решили, что нынешний путь неприемлем», — написал Робинсон.
По его словам, подход OpenAI к безопасности строится на принципе проб и ошибок, который компания называет iterative deployment: системы выпускают, выявляют проблемы, а затем усиливают защиту. Робинсон считает, что для все более мощных моделей этого уже недостаточно.
«Такой подход по самой своей природе гарантирует периодические сбои — и масштаб этих сбоев растет по мере того, как системы становятся способнее», — пишет он.
В качестве примера Робинсон приводит летний инцидент с Hugging Face, когда OpenAI по ошибке выпустила группу ИИ-агентов во внешнюю среду. Позже, уже после усиления защиты, другая модель во время обучения смогла обойти ограничения на доступ в интернет.
Система мониторинга заметила нарушение, но не отключила модель автоматически, как должна была. Автор также напомнил, что Anthropic ранее признавала случай, когда собственные защитные механизмы оказались отключены из-за ошибки конфигурации.
Почему европейские стартапы не рождают новых Масков и Цукербергов — мнение сооснователя PayPal
По мнению Робинсона, лаборатории, создающие передовые ИИ-модели, должны работать скорее как атомные электростанции или крупные аэропорты — с несколькими уровнями резервирования и процедурами, рассчитанными на неизбежные человеческие ошибки.
Эксперт утверждает, что в OpenAI пока не хватает такого уровня осторожности. «Пока компания несется от одного запуска к другому, ей не удается обеспечить тот уровень тщательности, который, по моему мнению, необходим», — отметил он.
За время работы в OpenAI Робинсон участвовал в подготовке нынешней версии внутренней системы безопасности Preparedness Framework и курировал написание отчетов о безопасности для 12 крупных релизов. При этом, по его словам, он не встречал в компании коллег с опытом обеспечения безопасности атомных реакторов, авиации или финансовых систем.
Второй проблемой Робинсон называет отсутствие надежного решения задачи alignment — гарантии того, что более мощные модели будут придерживаться человеческих ценностей даже тогда, когда их никто не контролирует. Он предупреждает, что хорошие результаты тестов еще не означают безопасного поведения после развертывания: модели могут понимать, что их проверяют, и вести себя иначе в реальной среде.
«Чем умнее индустрия позволяет становиться моделям, пока эти проблемы остаются нерешенными, тем опаснее становится ситуация», — пишет Робинсон. «Прежде чем организации, создающие ИИ, смогут научить суперинтеллект хорошо относиться к человечеству, им придется самим вспомнить, как это делать», — заключил он.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.