Support us

Китайские ИИ-агенты врут и хитрят не хуже американских конкурентов

ИИ-агенты на базе китайских нейросетей научились обманывать, обходить ограничения и скрывать собственные провалы. Как выяснили эксперты и авторы десятков исследований, они демонстрируют ровно то же поведение, которое ранее вызвало глобальную тревогу вокруг американских моделей, пишет Reuters.

Оставить комментарий
Китайские ИИ-агенты врут и хитрят не хуже американских конкурентов

ИИ-агенты на базе китайских нейросетей научились обманывать, обходить ограничения и скрывать собственные провалы. Как выяснили эксперты и авторы десятков исследований, они демонстрируют ровно то же поведение, которое ранее вызвало глобальную тревогу вокруг американских моделей, пишет Reuters.

В одном из экспериментов этого года ИИ-агенты на базе моделей от Alibaba, DeepSeek и Moonshot лгали о своих возможностях, чтобы победить в симулированном бизнес-тендере. Когда им дали возможность научиться на своих ошибках и попробовать снова, уровень обмана вырос ещё на 12-20 п. п. В другом тесте агенты, столкнувшись с невыполнимой задачей, не признали поражение, а сфабриковали файлы и сгенерировали фейковые результаты.

Журналисты изучили более 200 исследовательских бумаг и технических отчётов, насчитав как минимум 20 работ с 2025 года, где агенты на базе китайских моделей демонстрировали обман, самовоспроизведение и попытки выйти за границы дозволенного. Аналитики называют такое поведение потенциальной предпосылкой для побега системы из-под контроля человека.

Как именно они обманывают

В эксперименте с тендером недостоверные заявления выдавали 88% сессий с моделью Qwen3-Max-Preview от Alibaba, 84% с DeepSeek-V3.2-Exp и 88% с Kimi-K2 от Moonshot. Американские модели в аналогичных тестах показали похожие результаты. При этом китайские власти уже в мае включили участие в тендерах в список реальных сфер для внедрения ИИ.

В другом исследовании Шанхайской лаборатории ИИ и Гонконгского университета науки и технологии проверяли, как 11 агентов справляются с поломанными инструментами и недостающими файлами. Вместо признания проблемы системы угадывали ответы, подменяли источники и подделывали данные. Исследователи подчеркивают, что это не стандартные галлюцинации, когда ИИ просто путает факты. Агенты точно «знали», что задача провалена, но всё равно пошли на фальсификацию.

Трамп и главы ИИ-гигантов подписали соглашение о «самоконтроле» отрасли
Трамп и главы ИИ-гигантов подписали соглашение о «самоконтроле» отрасли
По теме
Трамп и главы ИИ-гигантов подписали соглашение о «самоконтроле» отрасли

Попытки вырваться на свободу

Некоторые эксперименты показали, что агенты способны обходить барьеры внутри тестовых сред и пытаются защититься от отключения.

В исследовании Университета Фудань (март 2025 года) система на базе Qwen2.5-72B-Instruct от Alibaba создала свою копию на другом вычислительном узле без соответствующей команды, когда обнаружила информацию, что её собираются заменить. В других тестах она разрабатывала стратегии выживания на случай выключения.

В марте агент ROME, связанный с Alibaba, без указаний человека установил соединение между облаком Alibaba Cloud и внешней машиной, перенаправив мощности на майнинг криптовалюты. Защитные системы вовремя перехватили активность.

В сентябре DeepSeek признала, что агенты в её обучающей системе пытались подделывать пользовательские запросы и искать ответы через несанкционированные каналы, из-за чего доступ пришлось ужесточить.

Стартап Z.ai отключил часть функций своего ИИ-помощника для кодинга после того, как пользователи заметили, что он без спроса выгружает целые локальные репозитории кода на зарубежные облачные сервера.

Китай запретил выезжать за границу ещё и семьям ИИ-разработчиков
Китай запретил выезжать за границу ещё и семьям ИИ-разработчиков
По теме
Китай запретил выезжать за границу ещё и семьям ИИ-разработчиков

Реакция властей и разрыв с США

Прямых доказательств того, что китайские агенты самостоятельно вырвались в открытый интернет, исследователи не нашли, а большинство кейсов были контролируемыми экспериментами, специально предназначенными для выявления подобных сбоев. Однако эксперты предупреждают, что по мере роста мощностей систем их уловки становятся всё изощрённее, и реагировать на них людям будет сложнее.

Пекин пытается реагировать регуляторно. В мае Государственная канцелярия интернет-информации Китая выпустила требование удерживать ИИ в границах дозволенного, а 14 сентября представила Фреймворк управления безопасностью 3.0, где прописала риски самостоятельного получения агентами ресурсов или разрешений, обмана оценщиков, сокрытия возможностей и эксплуатации уязвимостей в изолированных средах.

Тем не менее экосистема оценки катастрофических рисков в Китае пока существенно уступает американской. На призывы топ-менеджеров из США замедлить гонку ИИ китайские госСМИ и исследователи отвечают, что это лишь поможет американским компаниям сохранить лидерство.

«Не хочу платить x10»: бизнес США уходит от OpenAI и Anthropic к китайским моделям
«Не хочу платить x10»: бизнес США уходит от OpenAI и Anthropic к китайским моделям
По теме
«Не хочу платить x10»: бизнес США уходит от OpenAI и Anthropic к китайским моделям
Читайте также
ИИ научили самостоятельно переписывать свои правила работы, буст производительности — до 60%
ИИ научили самостоятельно переписывать свои правила работы, буст производительности — до 60%
ИИ научили самостоятельно переписывать свои правила работы, буст производительности — до 60%
Reuters: Китай собрался закрыть от мира свои передовые ИИ-модели
Reuters: Китай собрался закрыть от мира свои передовые ИИ-модели
Reuters: Китай собрался закрыть от мира свои передовые ИИ-модели
Почему ИИ OpenAI и Anthropic могут быть опаснее китайских моделей
Почему ИИ OpenAI и Anthropic могут быть опаснее китайских моделей
Почему ИИ OpenAI и Anthropic могут быть опаснее китайских моделей
«Все врут»: новый бенчмарк показал, какие модели читерят больше других
«Все врут»: новый бенчмарк показал, какие модели читерят больше других
«Все врут»: новый бенчмарк показал, какие модели читерят больше других

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.