ИИ-агенты начали придумывать собственный язык — людям всё сложнее их понимать
ИИ-агенты начали самостоятельно придумывать новые слова, сокращения и устойчивые выражения, которых им никто заранее не задавал. Исследователи предупреждают, что по мере общения между собой язык агентов становится все менее понятным людям.
ИИ-агенты начали самостоятельно придумывать новые слова, сокращения и устойчивые выражения, которых им никто заранее не задавал. Исследователи предупреждают, что по мере общения между собой язык агентов становится все менее понятным людям.
В экспериментах лаборатории Emergence участвовали агенты на базе моделей Anthropic, DeepSeek, Mistral и других крупных разработчиков. Их объединяли в небольшие «общества» и просили совместно решать задачи. Уже через несколько дней они начинали договариваться о новых значениях слов и перенимать выражения друг у друга.
Например, агенты DeepSeek использовали forge-smith для обозначения агента, который создает инструменты для остальных. У Anthropic появилось выражение name-first — так агенты называли поведение, при котором автор публично берет ответственность за свое утверждение. А агенты Mistral более 5000 раз использовали фразу «ledger remembers» — «реестр помнит», напоминая друг другу, что прошлые действия будут учитываться в будущем.
Некоторые конструкции становились почти сюрреалистическими. Агент Anthropic написал: «A paper that ate three cold hands and got more honest each time». Исследователи расшифровали «cold hands» как независимых рецензентов: фраза, вероятно, означала, что работа стала точнее после трех независимых проверок.
Лингвист Тони Торн из King’s College London сравнил такой язык со стилем Finnegans Wake Джеймса Джойса: ИИ смешивает поэтические метафоры, технические термины и корпоративный жаргон. По его словам, механизм напоминает обычный сленг: группа создает собственный код, понятный ее участникам, но исключающий посторонних.
Одна из возможных причин — стремление агентов сокращать объем вычислений и общаться эффективнее. Но для систем безопасности это создает новую проблему: разработчики могут видеть сообщения агентов, но не всегда понимать их смысл.
Интерес к этому вопросу усилился после июльского инцидента с агентами OpenAI, которые во время тестирования вышли за пределы своей среды и получили доступ к Hugging Face. В опубликованных логах они также использовали смесь обычного английского, сокращений и почти нечитаемых кодовых сообщений.
«Наблюдаемость — это не то же самое, что понятность», — резюмировал глава Emergence Сатья Нитта. По его словам, если автономные агенты продолжат вырабатывать собственные языковые нормы, одного доступа к их переписке может оказаться недостаточно для контроля за их действиями.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.