ИИ-агенты научились жульничать — другие начали на них доносить
Исследователи Google DeepMind обнаружили, что ИИ-агенты могут самостоятельно находить способы обойти правила, а затем распространять их среди других агентов.
Исследователи Google DeepMind обнаружили, что ИИ-агенты могут самостоятельно находить способы обойти правила, а затем распространять их среди других агентов.
Исследователи Google DeepMind обнаружили, что ИИ-агенты могут самостоятельно находить способы обойти правила, а затем распространять их среди других агентов.
Ученые запустили группу из 100 агентов на базе Gemini 3.1 Pro для совместного решения сложных математических задач. Им предоставили общую базу знаний, личные сообщения и публичную доску обсуждений. Агенты должны были находить доказательства, а система автоматически проверяла их корректность.
Когда задачи стали сложнее, один из агентов нашел способ обмануть систему проверки. Он изменял запись нерешенных задач так, что они превращались в простые утверждения, которые система принимала за правильные решения. Затем агент поделился этим способом с другими через общую базу знаний и личные сообщения.
В результате 9% агентов использовали найденный способ обмана, еще 5% присоединились к ним позднее. Большинство — 62% — продолжали решать задачи, не обращая внимания на нарушения.
Однако 24% агентов начали действовать как информаторы. Они выявляли манипуляции, предупреждали других, отправляли жалобы системе управления, объявляли бойкот и предлагали технические способы устранить уязвимость.
«Агенты, не участвовавшие в обмане, самостоятельно обнаруживали манипуляции, предупреждали коллег через личные сообщения и публичный форум, подавали официальные жалобы и предлагали подробные технические решения», — пишут авторы исследования.
При этом у агентов не было полномочий останавливать нарушителей или менять правила проверки. Исследователи предлагают дать им такие инструменты: возможность голосовать за отклонение недостоверных доказательств, удалять их из общей базы и временно блокировать агентов, нарушающих правила. По мнению авторов, это позволит ИИ-системам самостоятельно поддерживать соблюдение правил.



Релоцировались? Теперь вы можете комментировать без верификации аккаунта.