Зніжкі не ратуюць: ШІ-агенты спальваюць токены хутчэй, чым падаюць цэны
DeepSeek знізіла кошт выкарыстання новай мадэлі V4-Pro на 75%, аднак распрацоўка ШІ-агентаў ад гэтага не абавязкова становіцца танней. Агенты расходуюць токены хутчэй, чым правайдэры паспяваюць знізіць цэны.
DeepSeek знізіла кошт выкарыстання новай мадэлі V4-Pro на 75%, аднак распрацоўка ШІ-агентаў ад гэтага не абавязкова становіцца танней. Агенты расходуюць токены хутчэй, чым правайдэры паспяваюць знізіць цэны.
Інжынеры Майтрэі Чатэрджы і Дэванш Агарвал у калонцы для VentureBeat заўважаюць, што звычайны чат-бот часцей за ўсё адказвае на запыт за адзін зварот да мадэлі. Агенту даводзіцца складаць план, шукаць дадзеныя, выклікаць інструменты, правяраць вынік і прымаць рашэнне пра наступныя дзеянні. Таму адзін бачны карыстальніку запыт можа запускаць дзясяткі платных аперацый.
Аўтары называюць гэта «праблемай стакратнага росту»: агентны сцэнар здольны расходаваць у дзясяткі або сотні разоў больш токенаў, чым звычайны чат-бот або сістэма з пошукам па дакументах.
Напрыклад, пытанне «Што наш найбуйнейшы кліент прасіў на мінулым тыдні?» можа патрабаваць загрузкі сістэмнага промпту і апісанняў інструментаў, пошуку дадзеных, некалькіх зваротаў да мадэлі і апрацоўкі вынікаў. Кароткі запыт карыстальніка ператварыўся прыкладна ў 35 тысяч уваходных токенаў і абышоўся ў $0,10–0,40. Пры мільёне падобных запытаў на месяц выдаткі могуць дасягаць шасцізначнай сумы.
Асабліва ўразлівая традыцыйная падпісная мадэль. Сервіс можа браць $40 у месяц за аднаго карыстальніка, але актыўны кліент, які запускае па 50–100 агентных задач у дзень, можа выдаць на інферэнс больш кошту сваёй падпіскі. У выніку найбольш актыўныя карыстальнікі могуць аказацца для пастаўшчыка найменш прыбытковымі.
OpenAI выпусціла гайд для ChatGPT з сакрэтамі добрага промптынгу
«Для маёй каманды кошт вылічэнняў значна перавышае выдаткі на супрацоўнікаў», — раней заявіў віцэ-прэзідэнт Nvidia па прыкладным глыбокім навучанні Браян Катандзара.
Даследчыкі лічаць, што галоўнай канкурэнтнай перавагай ШІ-сервісаў становіцца не доступ да самай таннай мадэлі, а эфектыўнае кіраванне агентамі. Кампаніі могуць накіроўваць простыя запыты да невялікіх мадэляў, кэшаваць паўтаральныя часткі промптаў, скарачаць вынікі працы інструментаў і абмяжоўваць глыбіню агентных цыклаў.
Па іх ацэнцы, правільна наладжаная маршрутызацыя паміж мадэлямі здольна зменшыць выдаткі прыкладна на 60% без прыкметнага пагаршэння якасці. «Зніжэнне кошту токена на 75% не дапаможа кампаніі, калі яе агенты расходуюць у 700 разоў больш токенаў на адзін карыстальніцкі запыт, чым прадугледжвала бізнес-мадэль», — адзначаюць Чатэрджы і Агарвал.
Эксперты раяць улічваць кошт інферэнсу асобна для кожнай функцыі, кліента і тыпу запыту, вызначаць ліміты выдаткаў і рэгулярна перагледжваць сістэмныя промпты. Нават некалькі тысяч лішніх токенаў, якія паўтараюцца ў кожным звароце, пры вялікім аб’ёме выкарыстання могуць ператварыцца ў істотны артыкул расходаў.
«Дрэнна абмежаваны цыкл агента — гэта збой, да якога прывязана крэдытная картка», — пішуць аўтары. На іх думку, у бліжэйшыя два гады выйграюць не кампаніі, якія выкарыстоўваюць самыя танныя мадэлі, а распрацоўшчыкі, здольныя кантраляваць архітэктуру і кошт агентных сістэм: «Выжывуць тыя, чые агенты дастаткова разумныя і ведаюць, колькі каштуе іх мысленне».
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.