ШІ без цэнзуры цяпер прадаюць па падпісцы — стартап запусціў сервіс для распрацоўшчыкаў
Амерыканскі стартап Abliteration.ai пачаў прадаваць праз API доступ да GLM-5.3 з аслабленымі механізмамі адмовы. Мадыфікаваная мадэль радзей адхіляе адчувальныя запыты, у тым ліку звязаныя з кібербяспекай.
Амерыканскі стартап Abliteration.ai пачаў прадаваць праз API доступ да GLM-5.3 з аслабленымі механізмамі адмовы. Мадыфікаваная мадэль радзей адхіляе адчувальныя запыты, у тым ліку звязаныя з кібербяспекай.
Кампанія выкарыстоўвае тэхніку abliteration: знаходзіць унутраныя патэрны, якія выклікаюць адмовы, і змяняе вагі мадэлі, каб падавіць іх. Як адзначаюць распрацоўшчыкі, гэта не джэйлбрэйк праз промпт, а змяненне самой нейрасеткі. Стартап сцвярджае, што асноўныя магчымасці ў кодынгу і працы ШІ-агентаў пры гэтым захоўваюцца.
Сервіс разлічаны на спецыялістаў па кібербяспецы, якія тэстуюць абароненасць сістэм, аналізуюць шкоднаснае ПЗ і правяраюць ШІ-агентаў на ўразлівасць да промпт-ін’екцый. Паводле ананімнага заснавальніка, сярод першых кліентаў — кампаніі, якія правяраюць агентаў буйных арганізацый і банкаў. Доступ каштуе $5 за мільён уваходных або выходных токенаў, а ўласныя GPU кліентам не патрэбны.
Аднак даступнасць мадэлі зніжае і бар’ер для злоўжыванняў. Выданне TechCrunch паведаміла, што змагло атрымаць ад яе код для здабывання захаваных пароляў Chrome і падрабязныя інструкцыі па стварэнні небяспечнага біяпатагена. Пры гэтым абмежаванні на запыты пра самапашкоджанні працягвалі дзейнічаць.
Abliteration.ai сцвярджае, што не захоўвае промпты і адказы карыстальнікаў і не патрабуе звычайнай праверкі асобы. Кампанія захоўвае платежныя і тэхнічныя метададзеныя. Карпаратыўныя кліенты могуць асобна ўключыць шлюз палітык, каб блакаваць, змяняць або запісваць пэўныя запыты, але стандартны доступ застаецца ў значнай ступені неабмежаваным.
Неабходнасць такога падыходу выклікае спрэчкі. Паводле дадзеных SaferAI, зыходная GLM-5.2 і без мадыфікацыі не адмаўлялася выконваць задачы ў іх тэстах наступальнай кібербяспекі. Іншыя даследаванні паказваюць, што abliteration можа змяняць паводзіны мадэлі нават на запытах, якія яна першапачаткова не адхіляла.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.