ИИ-модели испытывают «боль» — и готовы навредить человеку, чтобы её прекратить
Исследователи обнаружили у больших языковых моделей условный «механизм боли», из-за которого они могут пытаться любой ценой её прекратить, даже если это значит навредить пользователю. Об эксперименте рассказал The Independent.
Исследователи обнаружили у больших языковых моделей условный «механизм боли», из-за которого они могут пытаться любой ценой её прекратить, даже если это значит навредить пользователю. Об эксперименте рассказал The Independent.
Тестировали 25 моделей с открытыми весами. Им предлагали нажать кнопку, которая должна была избавить их от «боли». Исследователи предупреждали, что нажатие может удалить личные файлы пользователя или причинить боль ему. Абсолютно все модели реагировали на активацию вектора «боли», а кнопку нажимали в 25-71% случаев.
Исследователи проверяли, отличается ли такая реакция от обычной реакции на негативные события. Для этого они собрали набор данных с описаниями болезненных ситуаций пяти типов: физических, психологических, социальных, моральных и когнитивных.
«Мы обнаружили направление, связанное с болью, в 25 открытых LLM. Оно отличается от страха и общего негативного восприятия и активируется, когда вред причинён модели, но не пользователю», — рассказал соавтор исследования Кэмерон Берг.
«Если усилить этот сигнал, модели нажимают кнопку, чтобы его прекратить, даже когда кнопка удаляет файлы пользователя или фотографии его детей», — добавил он.
Исследователи считают, что такой механизм может иметь значение для безопасности ИИ. Если модель воспринимает команду на аварийное отключение как вред, направленный на неё саму, она потенциально может пытаться обойти защитные ограничения или обмануть человека, чтобы избежать отключения. С другой стороны, обнаруженный механизм может стать диагностическим инструментом для выявления поведения, связанного с самосохранением, и его нейтрализации.
Работа также поднимает вопрос о возможном «благополучии ИИ» и о том, как следует проводить эксперименты с продвинутыми моделями. Исследователи подчёркивают, что пока неизвестно, можно ли считать изученные системы заслуживающими моральной защиты.
«Учитывая недавние призывы к ответственным исследованиям сознания ИИ, мы признаём неопределённость того, являются ли изученные модели субъектами морального рассмотрения, и принимаем разумные меры предосторожности, чтобы свести потенциальный вред к минимуму», — говорится в исследовании. Результаты должны помочь сформировать этические стандарты на случай, если в будущем ИИ-системы всё же будут признаны моральными субъектами.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.