Как снизить расходы на токены? Компании вспомнили проверенный метод
Компании все чаще внедряют ИИ-агентов и одновременно сталкиваются с ростом расходов на токены. Чтобы удержать бюджеты под контролем, бизнес отслеживает потребление в реальном времени, вводит лимиты и переносит на ИИ практики управления облачными затратами.
Компании все чаще внедряют ИИ-агентов и одновременно сталкиваются с ростом расходов на токены. Чтобы удержать бюджеты под контролем, бизнес отслеживает потребление в реальном времени, вводит лимиты и переносит на ИИ практики управления облачными затратами.
Как отмечает The Wall Street Journal, особенно затратными становятся автономные агенты. По оценке аналитика Goldman Sachs Джима Шнайдера, выполнение задачи ИИ-агентом может требовать примерно в 50 раз больше вычислительных ресурсов, чем один запрос к чат-боту.
Аналитик ожидает, что за следующие четыре года потребление токенов агентами вырастет в 24 раза, а к 2040 году корпоративные ИИ-агенты будут использовать в 55 раз больше токенов, чем сейчас.
Например, в Priceline, американском сервисе онлайн-бронирования, отслеживают потребление токенов через внутренние дашборды, а ежемесячные отчеты получают финансовый и технический директора. Если сотрудник расходует необычно много токенов, с ним обсуждают, на какие задачи уходит бюджет. При этом лимиты могут увеличить, если ИИ используется в проекте, который приносит компании выручку.
«С ИИ вы фактически отдаете кредитную карту конечному пользователю. Если нет контроля или пользователь недостаточно понимает последствия, счет быстро вырастет», — сказал директор по IT-финансам Priceline Крис Рид.
Финансовая компания Principal Financial Group делает ставку на подбор модели под конкретную задачу. Логика проста: не все запросы требуют дорогой передовой модели, поэтому простые операции можно передавать более компактным или открытым системам.
Новая китайская модель догоняет OpenAI и Anthropic — и стоит в 6 раз дешевле
Поставщик корпоративного ПО Smartsheet поручил контроль расходов FinOps-команде. Компания настроила автоматические предупреждения, которые сообщают сотрудникам о приближении к лимиту, а также открыла дашборды по отделам и менеджерам, чтобы затраты не становились сюрпризом в конце месяца.
Некоторые компании показывают подразделениям стоимость их работы с ИИ в деньгах. Qualcomm ограничивает потребление токенов для отдельных команд и использует систему showback: сотрудники видят, сколько стоят их запросы. В OpenText считают, что такая практика — или более жесткий chargeback, когда расходы списываются на бюджет подразделения, — может сократить затраты на токены на 20–30%.
Расходы растут, даже несмотря на снижение стоимости самих токенов. По данным Bain & Company, с декабря 2024-го по декабрь 2025 года цены на токены снизились примерно на 50%, но их потребление за тот же период выросло в 4,5 раза.
Компании также пытаются экономить, используя старые, небольшие и open-source-модели, а Qualcomm запускает часть таких моделей на собственном оборудовании. В сети магазинов товаров для дома Lowe’s разрабатывают правила, которые должны предотвратить «пустую трату токенов» при работе с ИИ.
При этом руководители ИТ-подразделений признаются: высокая активность пользователей сама по себе не считается проблемой. Главное — привязать расходы к измеримому результату для бизнеса, например росту выручки, ускорению разработки или снижению затрат на рутинные операции.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.