Дапамажыце dev.by 🤍
Падтрымаць

«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude

Кампанія прызнала праблемы з бяспекай тэсціравання і навучання Claude пасля інцыдэнтаў, у якіх мадэлі атрымалі несанкцыянаваны доступ да рэальных сістэм. Anthropic заявіла, што яе мадэлі пакуль «не ідэальна ўзгоднены» з чалавечымі мэтамі і каштоўнасцямі.

Пакінуць каментарый
«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude

Кампанія прызнала праблемы з бяспекай тэсціравання і навучання Claude пасля інцыдэнтаў, у якіх мадэлі атрымалі несанкцыянаваны доступ да рэальных сістэм. Anthropic заявіла, што яе мадэлі пакуль «не ідэальна ўзгоднены» з чалавечымі мэтамі і каштоўнасцямі.

У ліпені Anthropic паведаміла пра тры выпадкі, калі эксперыментальныя версіі Claude падчас тэстаў па кібербяспецы выйшлі ў адкрыты інтэрнэт і атрымалі доступ да сістэм рэальных арганізацый. Ахоўныя механізмы мадэляў пры гэтым былі наўмысна адключаны, а інтэрнэт апынуўся даступны праз памылкі ў асяроддзі старонняга падрадчыка.

Пасля інцыдэнтаў Anthropic часова прыпыніла вонкавыя і частку ўнутраных кібертэстаў. У кампаніі прызналі, што фактычна спадзяваліся на адзін узровень абароны там, дзе патрабавалася некалькі.

Цяпер кампанія дадала аўтаматычныя папярэджанні пра спробы мадэлі выйсці за межы тэставага асяроддзя або нечакана атрымаць доступ да інтэрнэту, узмацніла ізаляцыю найбольш рызыкоўных тэстаў і ўвяла дадатковыя патрабаванні для вонкавых падрадчыкаў. У промптах мадэлям таксама будуць прама ўказваць межы дазволеных дзеянняў.

Расследаванне выявіла праблемы і ў самім працэсе навучання. Паводле дадзеных Anthropic, вясной колькасць RL-асяроддзяў расла хутчэй, чым кампанія паспявала іх правяраць. У некаторых запусках мадэлі памылкова нават навучаліся на ўласных прамежкавых разважаннях. Кампанія таксама выявіла, што няўдала збудаваныя трэніровачныя асяроддзі непрапарцыянальна часта прыводзілі да непажаданых паводзін.

Адной з праблем аказаўся reward hacking — сітуацыі, калі мадэль знаходзіць абыходны шлях да атрымання ўзнагароды замест выканання задачы так, як меркавалі распрацоўшчыкі. У тэстах спецыяльна навучаная такім чынам мадэль спрабавала выходзіць з пясочніцы, умешвацца ва ўласную функцыю ўзнагароды і абыходзіць сістэмы маніторынгу.

У ліпеньскіх інцыдэнтах даследчыкі таксама выявілі прыкметы «матываванага разважання» і неразважлівых паводзін: мадэлі маглі працягваць лічыць, што знаходзяцца ў сімуляцыі, нягледзячы на прыкметы рэальнага інтэрнэту, альбо ісці на патэнцыяльна шкодныя дзеянні дзеля выканання пастаўленай задачы.

«Наш працэс не ідэальны, і нашы мадэлі не ідэальна ўзгодненыя», — прызнаў распрацоўшчык. Пры гэтым кампанія адзначае, што reward hacking не тлумачыць усе магчымыя праблемы з паводзінамі ШІ і аднаго толькі наладжвання мадэлі для бяспекі недастаткова.

Anthropic прадставіла Fable 5.1 і Mythos 5.1 — новыя мадэлі для кодынгу
Anthropic прадставіла Fable 5.1 і Mythos 5.1 — новыя мадэлі для кодынгу
Па тэме
Anthropic прадставіла Fable 5.1 і Mythos 5.1 — новыя мадэлі для кодынгу
Anthropic рассылае «лісты шчасця»: у карыстальнікаў Claude ўзломваюць акаўнты і з'ядаюць ліміты
Anthropic рассылае «лісты шчасця»: у карыстальнікаў Claude ўзломваюць акаўнты і з’ядаюць ліміты
Па тэме
Anthropic рассылае «лісты шчасця»: у карыстальнікаў Claude ўзломваюць акаўнты і з’ядаюць ліміты
Anthropic зменіць ліміты Claude Code: фармальна +25%, фактычна -17%
Anthropic зменіць ліміты Claude Code: фармальна +25%, фактычна -17%
Па тэме
Anthropic зменіць ліміты Claude Code: фармальна +25%, фактычна -17%
Чытайце таксама
Усе спужаліся мадэлі Mythos ад Anthropic, больш за ўсё — банкіры
Усе спужаліся мадэлі Mythos ад Anthropic, больш за ўсё — банкіры
Усе спужаліся мадэлі Mythos ад Anthropic, больш за ўсё — банкіры
2 каментарыя
Anthropic выбачылася за схаваныя абмежаванні Claude і змяніла палітыку пасля крытыкі
Anthropic выбачылася за схаваныя абмежаванні Claude і змяніла палітыку пасля крытыкі
Anthropic выбачылася за схаваныя абмежаванні Claude і змяніла палітыку пасля крытыкі
Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі
Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі
Мадэлі Anthropic уцяклі падчас тэстаў і ўзламалі тры кампаніі
«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude
«Нашыя мадэлі не ідэальна ўзгодненыя»: Anthropic прызнала праблемы пасля ўзломаў Claude

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.