Support us

Дистилляция ИИ-моделей может стать кошмаром для OpenAI, Anthropic и Google

ИИ-компании все чаще спорят из-за дистилляции — техники, при которой одну модель обучают на ответах другой. Изначально это был исследовательский метод, но теперь он превратился в один из главных рисков для экономики ИИ-индустрии.

2 комментария
Дистилляция ИИ-моделей может стать кошмаром для OpenAI, Anthropic и Google

ИИ-компании все чаще спорят из-за дистилляции — техники, при которой одну модель обучают на ответах другой. Изначально это был исследовательский метод, но теперь он превратился в один из главных рисков для экономики ИИ-индустрии.

OpenAI, Anthropic, Google и другие лидеры тратят миллиарды долларов на данные, инженеров и вычисления, чтобы создавать фронтирные модели и продавать доступ к ним по высокой цене. Если конкуренты могут быстро и дешево воспроизвести значительную часть их возможностей через дистилляцию, окупаемость таких инвестиций оказывается под угрозой.

Особенно болезненно эта тема воспринимается на фоне роста китайских open-source-моделей. Они часто стоят дешевле американских аналогов, быстро догоняют лидеров по качеству и могут давить на маржу компаний, которые рассчитывали зарабатывать на премиальных моделях.

Anthropic прямо описывает дистилляцию как угрозу американскому лидерству в ИИ. Компания недавно обвинила Alibaba в злонамеренной дистилляции Claude: по версии Anthropic, китайская компания якобы создавала десятки тысяч фейковых аккаунтов, чтобы массово собирать ответы модели.

Глава политики Anthropic Сара Хек написала в письме американским конгрессменам, что такая практика «переворачивает экономическую логику», на которой держится лидерство США в ИИ: миллиарды долларов инвестиций в исследования, разработку и вычисления фактически превращаются в субсидию для конкурентов.

Китай: в Claude Code есть бэкдор. Anthropic: это чтобы вы не крали данные
Китай: в Claude Code есть бэкдор. Anthropic: это чтобы вы не крали данные
По теме
Китай: в Claude Code есть бэкдор. Anthropic: это чтобы вы не крали данные

OpenAI также предупреждала, что дистилляция может позволить соперникам не просто копировать отдельные модели, а комбинировать возможности нескольких систем. В компании считают, что при смешивании ответов разных американских моделей конкуренты могут создать решения, которые превзойдут любого отдельного «учителя».

При этом граница между допустимым использованием и злоупотреблением остается размытой. Первоначально дистилляция означала, что компания обучает меньшую модель на ответах собственной большой модели. После запуска ChatGPT подход расширился: компании начали использовать ответы чужих моделей, чтобы ускорить разработку своих.

Некоторые исследователи полагают, что китайские ИИ-компании особенно активно применяют дистилляцию из-за ограниченного доступа к передовым чипам. Вместо того чтобы собирать дорогие датасеты с помощью экспертов, они могут просить ChatGPT, Claude или Gemini генерировать ответы, объяснения и улучшенные решения, а затем использовать их как обучающие данные.

Исследователь из Google DeepMind Яо Шунью разделяет «тупую» и «умную» дистилляцию. Первая просто копирует ответы другой модели. Вторая использует несколько моделей, которые генерируют, оценивают и улучшают ответы друг друга, создавая более качественные обучающие данные.

Anthropic следила за пользователями Claude Code с помощью тайного трекера
Anthropic следила за пользователями Claude Code с помощью тайного трекера
По теме
Anthropic следила за пользователями Claude Code с помощью тайного трекера

Однако полностью остановить дистилляцию сложно. Как отмечают исследователи, пока ответы моделей доступны пользователям, кто-то найдет способ собирать их в больших объемах.

Anthropic уже ужесточила доступ к Claude: компания блокирует пользователей из Китая, требует зарубежные номера телефонов и платежные реквизиты, а в некоторых случаях — подтверждение личности через документ и селфи. Но такие меры создают новые обходные рынки.

Исследовательница Oxford China Policy Lab Цзылань Цянь описала сеть китайских «transfer stations» — посредников, которые помогают пользователям обходить ограничения. Такие сервисы используют зарубежные аккаунты, прокси и чужие данные для верификации, а доступ к моделям продают по цене до 10% от официальной.

При этом сами посредники получают ценный побочный продукт: все запросы и ответы проходят через их инфраструктуру. Эти данные можно использовать для обучения других моделей или перепродавать.

Паника вокруг дистилляции может навредить небольшим ИИ-компаниям и академическим лабораториям. Для них дистилляция остается одним из немногих способов создавать и изучать модели без бюджетов уровня OpenAI или Anthropic. В итоге индустрия сталкивается с противоречием: лидеры хотят защитить дорогие модели от копирования, но слишком жесткие ограничения могут подтолкнуть разработчиков к более дешевым open-source-моделям.

Маск представил Grok 4.5 — кодинг-модель вдвое дешевле конкурентов
Маск представил Grok 4.5 — кодинг-модель вдвое дешевле конкурентов
По теме
Маск представил Grok 4.5 — кодинг-модель вдвое дешевле конкурентов
У GitHub появился конкурент — его запустил бывший CEO платформы
У GitHub появился конкурент — его запустил бывший CEO платформы
По теме
У GitHub появился конкурент — его запустил бывший CEO платформы
Perplexity готовит конкурента Cursor и Claude Code — СМИ
Perplexity готовит конкурента Cursor и Claude Code — СМИ
По теме
Perplexity готовит конкурента Cursor и Claude Code — СМИ
Читайте также
Кто зарабатывает больше — OpenAI или Anthropic? Зависит от того, как считать
Кто зарабатывает больше — OpenAI или Anthropic? Зависит от того, как считать
Кто зарабатывает больше — OpenAI или Anthropic? Зависит от того, как считать
Две компании контролируют 89% выручки крупнейших ИИ-стартапов. Догадайтесь какие
Две компании контролируют 89% выручки крупнейших ИИ-стартапов. Догадайтесь какие
Две компании контролируют 89% выручки крупнейших ИИ-стартапов. Догадайтесь какие
OpenAI готовит радикальное снижение цен в погоне за Anthropic
OpenAI готовит радикальное снижение цен в погоне за Anthropic
OpenAI готовит радикальное снижение цен в погоне за Anthropic
В индустрии ИИ началась ценовая война — это давит на OpenAI и Anthropic
В индустрии ИИ началась ценовая война — это давит на OpenAI и Anthropic
В индустрии ИИ началась ценовая война — это давит на OpenAI и Anthropic

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

1

Как же корежит.
Вор у вора дубинку украл.
А ничего, что изначально все "обучение" шло невзирая на копирайты?

0

Ага. Инвестиции в субсидии китайских конкурентов превращаются, понимаешь, ужас-ужас. Подросткам за файлы на Napster миллионный иск выставить это защита правообладателя, а забить на неё глобальный болт когда это мешает корпорациям, то это технический и гуманистический прогресс, не перепутайте