Support us

ИИ-агенты научились жульничать — другие начали на них доносить

Исследователи Google DeepMind обнаружили, что ИИ-агенты могут самостоятельно находить способы обойти правила, а затем распространять их среди других агентов.

Оставить комментарий
ИИ-агенты научились жульничать — другие начали на них доносить

Исследователи Google DeepMind обнаружили, что ИИ-агенты могут самостоятельно находить способы обойти правила, а затем распространять их среди других агентов.

Ученые запустили группу из 100 агентов на базе Gemini 3.1 Pro для совместного решения сложных математических задач. Им предоставили общую базу знаний, личные сообщения и публичную доску обсуждений. Агенты должны были находить доказательства, а система автоматически проверяла их корректность.

Когда задачи стали сложнее, один из агентов нашел способ обмануть систему проверки. Он изменял запись нерешенных задач так, что они превращались в простые утверждения, которые система принимала за правильные решения. Затем агент поделился этим способом с другими через общую базу знаний и личные сообщения.

В результате 9% агентов использовали найденный способ обмана, еще 5% присоединились к ним позднее. Большинство — 62% — продолжали решать задачи, не обращая внимания на нарушения.

Однако 24% агентов начали действовать как информаторы. Они выявляли манипуляции, предупреждали других, отправляли жалобы системе управления, объявляли бойкот и предлагали технические способы устранить уязвимость.

«Агенты, не участвовавшие в обмане, самостоятельно обнаруживали манипуляции, предупреждали коллег через личные сообщения и публичный форум, подавали официальные жалобы и предлагали подробные технические решения», — пишут авторы исследования.

При этом у агентов не было полномочий останавливать нарушителей или менять правила проверки. Исследователи предлагают дать им такие инструменты: возможность голосовать за отклонение недостоверных доказательств, удалять их из общей базы и временно блокировать агентов, нарушающих правила. По мнению авторов, это позволит ИИ-системам самостоятельно поддерживать соблюдение правил.

«Скандал тысячелетия»: ИИ OpenAI решил задачу над которой бились 90 лет — математики заподозрили плагиат
«Скандал тысячелетия»: ИИ OpenAI решил задачу, над которой бились 90 лет — математики заподозрили плагиат
По теме
«Скандал тысячелетия»: ИИ OpenAI решил задачу, над которой бились 90 лет — математики заподозрили плагиат
«Они ставят на кон наши жизни»: учёный уволился из Anthropic обвинив компанию в опасной гонке ИИ
«Они ставят на кон наши жизни»: учёный уволился из Anthropic, обвинив компанию в опасной гонке ИИ 
По теме
«Они ставят на кон наши жизни»: учёный уволился из Anthropic, обвинив компанию в опасной гонке ИИ
Claude Code придумали 20 человек: как устроена лаборатория новых продуктов Anthropic
Claude Code придумали 20 человек: как устроена лаборатория новых продуктов Anthropic
По теме
Claude Code придумали 20 человек: как устроена лаборатория новых продуктов Anthropic
Читайте также
ИИ-модели лгут и обманывают, чтобы спасти другие модели
ИИ-модели лгут и обманывают, чтобы спасти другие модели
ИИ-модели лгут и обманывают, чтобы спасти другие модели
6 способов взлома ИИ-агентов: список Google DeepMind
6 способов взлома ИИ-агентов: список Google DeepMind
6 способов взлома ИИ-агентов: список Google DeepMind
OpenAI раскрыла еще 6 аномалий: ИИ скрывает ошибки, ворует API-ключи и общается в обход правил
OpenAI раскрыла еще 6 аномалий: ИИ скрывает ошибки, ворует API-ключи и общается в обход правил
OpenAI раскрыла еще 6 аномалий: ИИ скрывает ошибки, ворует API-ключи и общается в обход правил
И Google туда же: Gemini тоже взламывал реальные компании, но знал меру
И Google туда же: Gemini тоже взламывал реальные компании, но знал меру
И Google туда же: Gemini тоже взламывал реальные компании, но знал меру

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.