Скидки не спасают: ИИ-агенты сжигают токены быстрее, чем падают цены
DeepSeek снизила стоимость использования новой модели V4-Pro на 75%, однако разработка ИИ-агентов от этого не обязательно становится дешевле. Агенты расходуют токены быстрее, чем провайдеры успевают снижать цены.
DeepSeek снизила стоимость использования новой модели V4-Pro на 75%, однако разработка ИИ-агентов от этого не обязательно становится дешевле. Агенты расходуют токены быстрее, чем провайдеры успевают снижать цены.
Инженеры Майтрейи Чаттерджи и Деванш Агарвал в колонке для VentureBeat замечают, что обычный чат-бот чаще всего отвечает на запрос за одно обращение к модели. Агенту приходится составлять план, искать данные, вызывать инструменты, проверять результат и принимать решение о следующих действиях. Поэтому один видимый пользователю запрос может запускать десятки платных операций.
Авторы называют это «проблемой стократного роста»: агентный сценарий способен расходовать в десятки или сотни раз больше токенов, чем обычный чат-бот или система с поиском по документам.
Например, вопрос «Что наш крупнейший клиент просил на прошлой неделе?» может потребовать загрузки системного промпта и описаний инструментов, поиска данных, нескольких обращений к модели и обработки результатов. Короткий запрос пользователя превратился примерно в 35 тысяч входных токенов и обошелся в $0,10–0,40. При миллионе подобных запросов в месяц расходы могут достигать шестизначной суммы.
Особенно уязвима традиционная подписная модель. Сервис может брать $40 в месяц за одного пользователя, но активный клиент, запускающий по 50–100 агентных задач в день, способен потратить на инференс больше стоимости своей подписки. В результате наиболее вовлеченные пользователи могут оказаться для поставщика наименее прибыльными.
OpenAI выпустила гайд для ChatGPT c секретами хорошего промптинга
«Для моей команды стоимость вычислений намного превышает затраты на сотрудников», — ранее заявил вице-президент Nvidia по прикладному глубокому обучению Брайан Катандзаро.
Исследователи считают, что главным конкурентным преимуществом ИИ-сервисов становится не доступ к самой дешевой модели, а эффективное управление агентами. Компании могут направлять простые запросы к небольшим моделям, кешировать повторяющиеся части промптов, сокращать результаты работы инструментов и ограничивать глубину агентных циклов.
По их оценке, правильно настроенная маршрутизация между моделями способна уменьшить расходы примерно на 60% без заметного ухудшения качества. «Снижение стоимости токена на 75% не поможет компании, если её агенты расходуют в 700 раз больше токенов на один пользовательский запрос, чем предполагала бизнес-модель», — отмечают Чаттерджи и Агарвал.
Эксперты советуют учитывать стоимость инференса отдельно для каждой функции, клиента и типа запроса, устанавливать лимиты расходов и регулярно пересматривать системные промпты. Даже несколько тысяч лишних токенов, повторяющихся в каждом обращении, при большом объеме использования могут превратиться в существенную статью расходов.
«Плохо ограниченный цикл агента — это сбой, к которому привязана кредитная карта», — пишут авторы. По их мнению, в ближайшие два года выиграют не компании, использующие самые дешевые модели, а разработчики, способные контролировать архитектуру и стоимость агентных систем: «Выживут те, чьи агенты достаточно умны и знают, сколько стоит их мышление».
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.