У Кітаі навучылі ШІ-мадэлі размаўляць без словаў — яны запрацавалі ў 2,5 разы хутчэй
Даследчыкі з Універсітэта Цынхуа распрацавалі тэхналогію, якая дазваляе нейрасеткам абменьвацца інфармацыяй напрамую, цалкам абыходзячы тэкставую мову. Метад пад назвай Cache-to-Cache (C2C) ужо прынялі на міжнародную канферэнцыю ICLR 2026, а яго зыходны код выклалі ў адкрыты доступ, піша TechRadar.
Даследчыкі з Універсітэта Цынхуа распрацавалі тэхналогію, якая дазваляе нейрасеткам абменьвацца інфармацыяй напрамую, цалкам абыходзячы тэкставую мову. Метад пад назвай Cache-to-Cache (C2C) ужо прынялі на міжнародную канферэнцыю ICLR 2026, а яго зыходны код выклалі ў адкрыты доступ, піша TechRadar.
Праблема ў тым, што калі некалькі ШІ-мадэляў працуюць у звязцы (напрыклад, адна шукае факты, а другая піша тэкст), яны моцна тармозяць адна адну. Першая мусіць спачатку перакласці свой унутраны ход думак у звычайныя сказы і словы, надрукаваць іх, а другая — прачытаць і распазнаць. На гэтыя маніпуляцыі сыходзіць вялікая колькасць вылічальных рэсурсаў, а па дарозе губляецца мноства дробных дэталяў і кантэксту, якія былі ў «галаве» ў першай мадэлі.
Тэхналогія C2C проста бярэ працоўную памяць адной мадэлі і напрамую перакідвае яе ў памяць другой — без словаў, тэксту і чатаў. Аднак зрабіць гэта «ў лоб» немагчыма: у розных мадэляў памяць уладкавана зусім па-рознаму, адрозніваючыся структурай, аб’ёмам і логікай захоўвання.
Каб другая мадэль не зламалася і не пачала выдаваць бязглуздзіцу, кітайскія вучоныя дадалі ў сістэму два элементы. Прамежкавы канвертар Fuser на ляту «перакладае» і падганяе структуру памяці адной мадэлі пад фармат другой. А разумны фільтр вырашае, якія кавалкі чужой памяці другой нейрасетцы трэба засвоіць адразу, а якія ўнутраныя слаі павінны працягваць думаць самастойна, каб не збіцца.
На практыцы гэта дало адчувальны прырост хуткасці: пры сумеснай працы нейрасеткі сталі выконваць задачы на 100–150% хутчэй, чым пры звычайнай тэкставай перапісцы. Таксама пры перадачы «думак» напрамую дакладнасць працы мадэляў у звязцы вырасла на 14,2% у параўнанні з адзіночнай працай і на 3–5% у параўнанні са звычайным тэкставым абменам.
Пакуль C2C працуе толькі з мадэлямі з адкрытымі вагамі. Каб перадаць кэш напрамую, распрацоўшчыкам трэба доступ да ўнутраных слаёў і памяці нейрасеткі. Акрамя таго, эксперты раяць ставіцца да лічбаў з разумным скептыцызмам: усе тэсты праводзілі самі стваральнікі C2C. Наколькі метад рэальны і эфектыўны на практыцы, пакажуць толькі незалежныя праверкі іншых распрацоўшчыкаў.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.