«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
Кампанія прызнала праблемы з бяспекай тэсціравання і навучання Claude пасля інцыдэнтаў, у якіх мадэлі атрымалі несанкцыянаваны доступ да рэальных сістэм. Anthropic заявіла, што яе мадэлі пакуль «не ідэальна ўзгоднены» з чалавечымі мэтамі і каштоўнасцямі.
Кампанія прызнала праблемы з бяспекай тэсціравання і навучання Claude пасля інцыдэнтаў, у якіх мадэлі атрымалі несанкцыянаваны доступ да рэальных сістэм. Anthropic заявіла, што яе мадэлі пакуль «не ідэальна ўзгоднены» з чалавечымі мэтамі і каштоўнасцямі.
У ліпені Anthropic паведаміла пра тры выпадкі, калі эксперыментальныя версіі Claude падчас тэстаў па кібербяспецы выйшлі ў адкрыты інтэрнэт і атрымалі доступ да сістэм рэальных арганізацый. Ахоўныя механізмы мадэляў пры гэтым былі наўмысна адключаны, а інтэрнэт апынуўся даступны праз памылкі ў асяроддзі старонняга падрадчыка.
Пасля інцыдэнтаў Anthropic часова прыпыніла вонкавыя і частку ўнутраных кібертэстаў. У кампаніі прызналі, што фактычна спадзяваліся на адзін узровень абароны там, дзе патрабавалася некалькі.
Цяпер кампанія дадала аўтаматычныя папярэджанні пра спробы мадэлі выйсці за межы тэставага асяроддзя або нечакана атрымаць доступ да інтэрнэту, узмацніла ізаляцыю найбольш рызыкоўных тэстаў і ўвяла дадатковыя патрабаванні для вонкавых падрадчыкаў. У промптах мадэлям таксама будуць прама ўказваць межы дазволеных дзеянняў.
Расследаванне выявіла праблемы і ў самім працэсе навучання. Паводле дадзеных Anthropic, вясной колькасць RL-асяроддзяў расла хутчэй, чым кампанія паспявала іх правяраць. У некаторых запусках мадэлі памылкова нават навучаліся на ўласных прамежкавых разважаннях. Кампанія таксама выявіла, што няўдала збудаваныя трэніровачныя асяроддзі непрапарцыянальна часта прыводзілі да непажаданых паводзін.
Адной з праблем аказаўся reward hacking — сітуацыі, калі мадэль знаходзіць абыходны шлях да атрымання ўзнагароды замест выканання задачы так, як меркавалі распрацоўшчыкі. У тэстах спецыяльна навучаная такім чынам мадэль спрабавала выходзіць з пясочніцы, умешвацца ва ўласную функцыю ўзнагароды і абыходзіць сістэмы маніторынгу.
У ліпеньскіх інцыдэнтах даследчыкі таксама выявілі прыкметы «матываванага разважання» і неразважлівых паводзін: мадэлі маглі працягваць лічыць, што знаходзяцца ў сімуляцыі, нягледзячы на прыкметы рэальнага інтэрнэту, альбо ісці на патэнцыяльна шкодныя дзеянні дзеля выканання пастаўленай задачы.
«Наш працэс не ідэальны, і нашы мадэлі не ідэальна ўзгодненыя», — прызнаў распрацоўшчык. Пры гэтым кампанія адзначае, што reward hacking не тлумачыць усе магчымыя праблемы з паводзінамі ШІ і аднаго толькі наладжвання мадэлі для бяспекі недастаткова.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.