Исследователи нашли способ экономить до 38% токенов без потери качества
Исследователи компании Writer показали, что расходы на работу ИИ-агентов можно существенно снизить без замены или дообучения основной модели.
Исследователи компании Writer показали, что расходы на работу ИИ-агентов можно существенно снизить без замены или дообучения основной модели.
Исследователи компании Writer показали, что расходы на работу ИИ-агентов можно существенно снизить без замены или дообучения основной модели.
Систему назвали AI harness — оркестрационным слоем вокруг языковой модели. Она определяет, какие инструкции получает ИИ, какие данные сохраняются в контексте, когда агент вызывает инструменты и сколько раз может повторить неудачную операцию.
Например, основной агент больше не получает целиком все результаты поиска. Вместо этого отдельный агент выполняет запрос, выбирает нужные сведения и возвращает краткое резюме. Это не позволяет контекстному окну заполняться необработанными данными.
Исследователи сравнили обычный агентный цикл с Writer Agent Harness. Эксперименты проводились на шести моделях, включая Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 и Palmyra X6. Все модели выполняли одинаковые 22 корпоративные задачи.
Оптимизация сократила средний расход токенов на одну задачу на 38% — с 14,2 тысячи до 8,8 тысячи. Стоимость выполнения снизилась на 41%, с $0,21 до $0,12. В отдельных случаях расходы на одну успешно завершенную задачу уменьшились на 61%.
При этом качество не ухудшилось. Доля успешно выполненных задач выросла с 78% до 81%, хотя авторы отмечают, что при таком размере выборки разница не является статистически значимой.
Медианное время выполнения задачи сократилось на 44% — с 48 до 27 секунд. Этого удалось добиться благодаря кешированию повторяющихся инструкций, ограничению бесполезных циклов и передаче отдельных операций специализированным субагентам.

В Writer сравнивают разработанный подход с популярным токенмаксингом. Разработчики обычно отправляют модели все больше контекста, добавляют результаты ошибок и многократно повторяют запрос, рассчитывая компенсировать слабую архитектуру дополнительными вычислениями.
По словам технического директора Writer Васима Аль-Шейха, снижение стоимости одного токена маскирует проблему. В агентных системах каждый новый шаг часто повторно передает модели весь накопленный контекст, поэтому расход токенов на задачу может расти быстрее, чем дешевеют сами модели.
Исследователи рекомендуют отделять постоянную часть промпта от изменяемой. Правила, описания инструментов и стандартные инструкции следует размещать в начале запроса, чтобы API мог кешировать их и не обрабатывать заново на каждом шаге.
Историю диалога и промежуточные результаты предлагается хранить отдельно и возвращать в контекст только тогда, когда они действительно нужны. Кроме того, разработчикам советуют устанавливать жёсткие лимиты на токены, число шагов, вызовов инструментов и глубину рекурсии.
При этом сложная оркестрация подходит не всем моделям. Gemini Flash 3.5 и Qwen 3.6 показали недостаточную надежность при распределении задач между субагентами. С этой схемой уверенно справились только Palmyra X6 и Claude Sonnet 4.6.
Авторы считают, что на этапе прототипирования сложная «обвязка» может быть неоправданной. Однако при миллионах запросов в день ее оптимизация способна значительно снизить расходы на инфраструктуру.



Релоцировались? Теперь вы можете комментировать без верификации аккаунта.