Польша стремительно богатеет? Смотрите в новом выпуске подкаста Złoty Dzik
Support us

Скидки не спасают: ИИ-агенты сжигают токены быстрее, чем падают цены

DeepSeek снизила стоимость использования новой модели V4-Pro на 75%, однако разработка ИИ-агентов от этого не обязательно становится дешевле. Агенты расходуют токены быстрее, чем провайдеры успевают снижать цены.

Оставить комментарий
Скидки не спасают: ИИ-агенты сжигают токены быстрее, чем падают цены

DeepSeek снизила стоимость использования новой модели V4-Pro на 75%, однако разработка ИИ-агентов от этого не обязательно становится дешевле. Агенты расходуют токены быстрее, чем провайдеры успевают снижать цены.

Инженеры Майтрейи Чаттерджи и Деванш Агарвал в колонке для VentureBeat замечают, что обычный чат-бот чаще всего отвечает на запрос за одно обращение к модели. Агенту приходится составлять план, искать данные, вызывать инструменты, проверять результат и принимать решение о следующих действиях. Поэтому один видимый пользователю запрос может запускать десятки платных операций.

Авторы называют это «проблемой стократного роста»: агентный сценарий способен расходовать в десятки или сотни раз больше токенов, чем обычный чат-бот или система с поиском по документам.

Например, вопрос «Что наш крупнейший клиент просил на прошлой неделе?» может потребовать загрузки системного промпта и описаний инструментов, поиска данных, нескольких обращений к модели и обработки результатов. Короткий запрос пользователя превратился примерно в 35 тысяч входных токенов и обошелся в $0,10–0,40. При миллионе подобных запросов в месяц расходы могут достигать шестизначной суммы.

Особенно уязвима традиционная подписная модель. Сервис может брать $40 в месяц за одного пользователя, но активный клиент, запускающий по 50–100 агентных задач в день, способен потратить на инференс больше стоимости своей подписки. В результате наиболее вовлеченные пользователи могут оказаться для поставщика наименее прибыльными.

OpenAI выпустила гайд для ChatGPT c секретами хорошего промптинга
OpenAI выпустила гайд для ChatGPT c секретами хорошего промптинга
По теме
OpenAI выпустила гайд для ChatGPT c секретами хорошего промптинга

«Для моей команды стоимость вычислений намного превышает затраты на сотрудников», — ранее заявил вице-президент Nvidia по прикладному глубокому обучению Брайан Катандзаро.

Исследователи считают, что главным конкурентным преимуществом ИИ-сервисов становится не доступ к самой дешевой модели, а эффективное управление агентами. Компании могут направлять простые запросы к небольшим моделям, кешировать повторяющиеся части промптов, сокращать результаты работы инструментов и ограничивать глубину агентных циклов.

По их оценке, правильно настроенная маршрутизация между моделями способна уменьшить расходы примерно на 60% без заметного ухудшения качества. «Снижение стоимости токена на 75% не поможет компании, если её агенты расходуют в 700 раз больше токенов на один пользовательский запрос, чем предполагала бизнес-модель», — отмечают Чаттерджи и Агарвал.

Эксперты советуют учитывать стоимость инференса отдельно для каждой функции, клиента и типа запроса, устанавливать лимиты расходов и регулярно пересматривать системные промпты. Даже несколько тысяч лишних токенов, повторяющихся в каждом обращении, при большом объеме использования могут превратиться в существенную статью расходов.

«Плохо ограниченный цикл агента — это сбой, к которому привязана кредитная карта», — пишут авторы. По их мнению, в ближайшие два года выиграют не компании, использующие самые дешевые модели, а разработчики, способные контролировать архитектуру и стоимость агентных систем: «Выживут те, чьи агенты достаточно умны и знают, сколько стоит их мышление».

CEO OpenAI верит что ИИ создаёт больше рабочих мест. Ему напомнили что он меняет мнение каждый год
CEO OpenAI верит, что ИИ создаёт больше рабочих мест. Ему напомнили, что он меняет мнение каждый год
По теме
CEO OpenAI верит, что ИИ создаёт больше рабочих мест. Ему напомнили, что он меняет мнение каждый год
«Пишу код вручную»: программисты боятся потерять форму и создают профсоюзы из-за ИИ
«Пишу код вручную»: программисты боятся потерять форму и создают профсоюзы из-за ИИ 
По теме
«Пишу код вручную»: программисты боятся потерять форму и создают профсоюзы из-за ИИ
Anthropic встроила браузер прямо в Claude Code
Anthropic встроила браузер прямо в Claude Code
По теме
Anthropic встроила браузер прямо в Claude Code
Читайте также
DeepSeek сделала скидку 75% на флагманскую ИИ-модель постоянной
DeepSeek сделала скидку 75% на флагманскую ИИ-модель постоянной
DeepSeek сделала скидку 75% на флагманскую ИИ-модель постоянной
Токены съедают бюджеты: компании ищут способы снизить расходы на ИИ
Токены съедают бюджеты: компании ищут способы снизить расходы на ИИ
Токены съедают бюджеты: компании ищут способы снизить расходы на ИИ
Как DeepSeek бьёт по бизнес-модели OpenAI и Anthropic дешёвыми токенами
Как DeepSeek бьёт по бизнес-модели OpenAI и Anthropic дешёвыми токенами
Как DeepSeek бьёт по бизнес-модели OpenAI и Anthropic дешёвыми токенами
Как снизить расходы на токены? Компании вспомнили проверенный метод
Как снизить расходы на токены? Компании вспомнили проверенный метод
Как снизить расходы на токены? Компании вспомнили проверенный метод

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.