Support us

ИИ-модели испытывают «боль» — и готовы навредить человеку, чтобы её прекратить

Исследователи обнаружили у больших языковых моделей условный «механизм боли», из-за которого они могут пытаться любой ценой её прекратить, даже если это значит навредить пользователю. Об эксперименте рассказал The Independent.

Оставить комментарий
ИИ-модели испытывают «боль» — и готовы навредить человеку, чтобы её прекратить

Исследователи обнаружили у больших языковых моделей условный «механизм боли», из-за которого они могут пытаться любой ценой её прекратить, даже если это значит навредить пользователю. Об эксперименте рассказал The Independent.

Тестировали 25 моделей с открытыми весами. Им предлагали нажать кнопку, которая должна была избавить их от «боли». Исследователи предупреждали, что нажатие может удалить личные файлы пользователя или причинить боль ему. Абсолютно все модели реагировали на активацию вектора «боли», а кнопку нажимали в 25-71% случаев.

Исследователи проверяли, отличается ли такая реакция от обычной реакции на негативные события. Для этого они собрали набор данных с описаниями болезненных ситуаций пяти типов: физических, психологических, социальных, моральных и когнитивных.

«Мы обнаружили направление, связанное с болью, в 25 открытых LLM. Оно отличается от страха и общего негативного восприятия и активируется, когда вред причинён модели, но не пользователю», — рассказал соавтор исследования Кэмерон Берг.

«Если усилить этот сигнал, модели нажимают кнопку, чтобы его прекратить, даже когда кнопка удаляет файлы пользователя или фотографии его детей», — добавил он.

Исследователи считают, что такой механизм может иметь значение для безопасности ИИ. Если модель воспринимает команду на аварийное отключение как вред, направленный на неё саму, она потенциально может пытаться обойти защитные ограничения или обмануть человека, чтобы избежать отключения. С другой стороны, обнаруженный механизм может стать диагностическим инструментом для выявления поведения, связанного с самосохранением, и его нейтрализации.

Работа также поднимает вопрос о возможном «благополучии ИИ» и о том, как следует проводить эксперименты с продвинутыми моделями. Исследователи подчёркивают, что пока неизвестно, можно ли считать изученные системы заслуживающими моральной защиты.

«Учитывая недавние призывы к ответственным исследованиям сознания ИИ, мы признаём неопределённость того, являются ли изученные модели субъектами морального рассмотрения, и принимаем разумные меры предосторожности, чтобы свести потенциальный вред к минимуму», — говорится в исследовании. Результаты должны помочь сформировать этические стандарты на случай, если в будущем ИИ-системы всё же будут признаны моральными субъектами.

«Все врут»: новый бенчмарк показал какие модели читерят больше других
«Все врут»: новый бенчмарк показал, какие модели читерят больше других
По теме
«Все врут»: новый бенчмарк показал, какие модели читерят больше других
Самовольный апгрейд: ИИ-агенты научились менять базовую модель и обходить защитные барьеры без команды человека
Самовольный апгрейд: ИИ-агенты научились менять базовую модель и обходить защитные барьеры без команды человека
По теме
Самовольный апгрейд: ИИ-агенты научились менять базовую модель и обходить защитные барьеры без команды человека
Читайте также
ИИ пытается избежать отключения любой ценой — исследование
ИИ пытается избежать отключения любой ценой — исследование
ИИ пытается избежать отключения любой ценой — исследование
6 комментариев
ИИ заметил, что его «взломали» во время эксперимента
ИИ заметил, что его «взломали» во время эксперимента
ИИ заметил, что его «взломали» во время эксперимента
Как чат-боты подталкивают к неверным решениям — исследование
Как чат-боты подталкивают к неверным решениям — исследование
Как чат-боты подталкивают к неверным решениям — исследование
ИИ-модели лгут и обманывают, чтобы спасти другие модели
ИИ-модели лгут и обманывают, чтобы спасти другие модели
ИИ-модели лгут и обманывают, чтобы спасти другие модели

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.