Польша стремительно богатеет? Смотрите в новом выпуске подкаста Złoty Dzik
Support us

Исследователи нашли способ экономить до 38% токенов без потери качества

Исследователи компании Writer показали, что расходы на работу ИИ-агентов можно существенно снизить без замены или дообучения основной модели.

Оставить комментарий
Исследователи нашли способ экономить до 38% токенов без потери качества

Исследователи компании Writer показали, что расходы на работу ИИ-агентов можно существенно снизить без замены или дообучения основной модели.

Систему назвали AI harness — оркестрационным слоем вокруг языковой модели. Она определяет, какие инструкции получает ИИ, какие данные сохраняются в контексте, когда агент вызывает инструменты и сколько раз может повторить неудачную операцию.

Например, основной агент больше не получает целиком все результаты поиска. Вместо этого отдельный агент выполняет запрос, выбирает нужные сведения и возвращает краткое резюме. Это не позволяет контекстному окну заполняться необработанными данными.

Исследователи сравнили обычный агентный цикл с Writer Agent Harness. Эксперименты проводились на шести моделях, включая Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 и Palmyra X6. Все модели выполняли одинаковые 22 корпоративные задачи.

Оптимизация сократила средний расход токенов на одну задачу на 38% — с 14,2 тысячи до 8,8 тысячи. Стоимость выполнения снизилась на 41%, с $0,21 до $0,12. В отдельных случаях расходы на одну успешно завершенную задачу уменьшились на 61%.

При этом качество не ухудшилось. Доля успешно выполненных задач выросла с 78% до 81%, хотя авторы отмечают, что при таком размере выборки разница не является статистически значимой.

Медианное время выполнения задачи сократилось на 44% — с 48 до 27 секунд. Этого удалось добиться благодаря кешированию повторяющихся инструкций, ограничению бесполезных циклов и передаче отдельных операций специализированным субагентам.

Google изучила 15 млн диалогов с ИИ — оказалось до автоматизации ещё очень далеко
Google изучила 15 млн диалогов с ИИ — оказалось, до автоматизации ещё очень далеко
По теме
Google изучила 15 млн диалогов с ИИ — оказалось, до автоматизации ещё очень далеко

В Writer сравнивают разработанный подход с популярным токенмаксингом. Разработчики обычно отправляют модели все больше контекста, добавляют результаты ошибок и многократно повторяют запрос, рассчитывая компенсировать слабую архитектуру дополнительными вычислениями.

По словам технического директора Writer Васима Аль-Шейха, снижение стоимости одного токена маскирует проблему. В агентных системах каждый новый шаг часто повторно передает модели весь накопленный контекст, поэтому расход токенов на задачу может расти быстрее, чем дешевеют сами модели.

Исследователи рекомендуют отделять постоянную часть промпта от изменяемой. Правила, описания инструментов и стандартные инструкции следует размещать в начале запроса, чтобы API мог кешировать их и не обрабатывать заново на каждом шаге.

Историю диалога и промежуточные результаты предлагается хранить отдельно и возвращать в контекст только тогда, когда они действительно нужны. Кроме того, разработчикам советуют устанавливать жёсткие лимиты на токены, число шагов, вызовов инструментов и глубину рекурсии.

При этом сложная оркестрация подходит не всем моделям. Gemini Flash 3.5 и Qwen 3.6 показали недостаточную надежность при распределении задач между субагентами. С этой схемой уверенно справились только Palmyra X6 и Claude Sonnet 4.6.

Авторы считают, что на этапе прототипирования сложная «обвязка» может быть неоправданной. Однако при миллионах запросов в день ее оптимизация способна значительно снизить расходы на инфраструктуру.

Новый плагин Claude Code сам ищет уязвимости и чинит код
Новый плагин Claude Code сам ищет уязвимости и чинит код
По теме
Новый плагин Claude Code сам ищет уязвимости и чинит код
OpenAI запустила Presence — платформу для внедрения ИИ-агентов в бизнес
OpenAI запустила Presence — платформу для внедрения ИИ-агентов в бизнес
По теме
OpenAI запустила Presence — платформу для внедрения ИИ-агентов в бизнес
Как модели OpenAI могли взломать Hugging Face? Эксперты обвиняют самих разрабов
Как модели OpenAI могли взломать Hugging Face? Эксперты обвиняют самих разрабов
По теме
Как модели OpenAI могли взломать Hugging Face? Эксперты обвиняют самих разрабов
Читайте также
Новая ИИ-модель DeepSeek сделает работу вдвое дешевле предыдущей
Новая ИИ-модель DeepSeek сделает работу вдвое дешевле предыдущей
Новая ИИ-модель DeepSeek сделает работу вдвое дешевле предыдущей
Разраб придумал способ снизить расходы на токены в разы
Разраб придумал способ снизить расходы на токены в разы
Разраб придумал способ снизить расходы на токены в разы
Токены съедают бюджеты: компании ищут способы снизить расходы на ИИ
Токены съедают бюджеты: компании ищут способы снизить расходы на ИИ
Токены съедают бюджеты: компании ищут способы снизить расходы на ИИ
Скидки не спасают: ИИ-агенты сжигают токены быстрее, чем падают цены
Скидки не спасают: ИИ-агенты сжигают токены быстрее, чем падают цены
Скидки не спасают: ИИ-агенты сжигают токены быстрее, чем падают цены

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.