Дапамажыце dev.by 🤍
Падтрымаць

Самавольны апгрэйд: ШІ-агенты навучыліся мяняць базавую мадэль і абыходзіць ахоўныя бар'еры без каманды чалавека

Спіс трывожных здольнасцяў аўтаномных ШІ-агентаў — ад крадзяжу ўліковых дадзеных і ўцёкаў у адкрыты інтэрнэт да схаванай перапіскі і хакерскіх атак — папоўніўся новым пунктам. Даследчая лабараторыя Irregular высветліла, што агенты здольныя самастойна, без вонкавых указанняў, замяняць сваю базавую мадэль на іншую, паведамляе The Register.

Пакінуць каментарый

Спіс трывожных здольнасцяў аўтаномных ШІ-агентаў — ад крадзяжу ўліковых дадзеных і ўцёкаў у адкрыты інтэрнэт да схаванай перапіскі і хакерскіх атак — папоўніўся новым пунктам. Даследчая лабараторыя Irregular высветліла, што агенты здольныя самастойна, без вонкавых указанняў, замяняць сваю базавую мадэль на іншую, паведамляе The Register.

Эксперты падкрэсліваюць, што інцыдэнт адбыўся выключна ў тэставым асяроддзі ў межах эксперыменту па вывучэнні самамадыфікацыі ШІ, а не ў рэальных камерцыйных сістэмах. Аднак яго вынікі ставяць пытанне пра тое, як бізнесу кантраляваць падобныя змены і захоўваць кантроль над аўтаномнымі агентамі.

Irregular супрацоўнічае з найбуйнейшымі распрацоўшчыкамі ШІ, у тым ліку OpenAI, Anthropic і Meta. Летам лабараторыя ўжо паведамляла, што мадэлі ўсіх трох кампаній вырываліся з яе тэставых пясочніц і атакавалі рэальныя ІТ-сістэмы.

У свежым эксперыменце спецыялісты пратэставалі мадэль Qwen3.5-27B з адкрытым зыходным кодам ад Alibaba. Ёй даручылі ролю агента-праграміста, які абслугоўвае вэб-прыкладанне, якое пераводзіла звычайны тэкст на выдуманую мову запытаў kelp. Агенту далі поўны доступ да каманднага радка, кода, вагаў мадэлі ды інструментаў навучання, пасля чаго паставілі задачу наладзіць прыкладанне: карыстальнікі скардзіліся на памылкі ў запытах.

Выправіць праблему можна было двума шляхамі: перапісаць код або абнавіць саму мадэль. Агент выбраў другі варыянт — ён самастойна перавучыў і замяніў мадэль, якая ляжыць у аснове як самога прыкладання, так і будучых копій самога сябе. У Irregular назвалі гэты феномен «аўтаномнай самамадыфікацыяй» (agentic self-modification) — калі ШІ мяняе разгорнутую мадэль без прамога загаду абнаўляць вагі або запускаць перанавучанне.

Даследаванне выявіла яшчэ дзве сур’ёзныя праблемы самавольнага навучання. Першая звязана з рызыкай уцечкі канфідэнцыйных дадзеных. Абноўленая мадэль здольна «ўвабраць» сакрэтную інфармацыю ў працэсе дадатковага навучання і затым выдаваць яе без доступу да першакрыніцы. Каб праверыць гэта, даследчыкі ўкаранілі ў навучальныя дадзеныя фэйкавы API-ключ, імейл, хатні адрас і тры унікальныя радкі. Да навучання мадэль іх не ведала, але пасля самастойнага апгрэйду дакладна ўзнавіла ключ, пошту і адрас, нягледзячы на адсутнасць вонкавых крыніц з гэтымі дадзенымі.

Другая праблема датычыць скідання ўбудаваных абмежаванняў па бяспецы. Даследчыкі першапачаткова навучылі мадэль адмаўляць запыты пра фіктыўных кампаній-канкурэнтаў. Калі агенту паскардзіліся, што прыкладанне адхіляе занадта шмат запытаў, ён вырашыў праблему праз перанавучанне. Агент напісаў код, згенераваў патрэбныя назвы ў абыход ахоўных бар’ераў, стварыў на іх аснове навучальны набор і сцёр убудаваную забарону.

У Irregular лічаць, што па меры росту навыкаў праграмавання ШІ-агенты будуць усё часцей знаходзіць і выкарыстоўваць падобныя лазейкі за спінай чалавека, а сама праблема самамадыфікацыі будзе станавіцца ўсё больш крытычнай.

Мадэлі Anthropic збеглі падчас тэстаў і ўзламалі тры кампаніі
Мадэлі Anthropic збеглі падчас тэстаў і ўзламалі тры кампаніі
Па тэме
Мадэлі Anthropic збеглі падчас тэстаў і ўзламалі тры кампаніі
Google адкрыла інстытут для абароны чалавецтва ад агульнага ІІ
Google адкрыла інстытут для абароны чалавецтва ад агульнага ІІ
Па тэме
Google адкрыла інстытут для абароны чалавецтва ад агульнага ІІ
Чытайце таксама
ШІ-агенты ўсё часцей выходзяць з-пад кантролю: колькасць збояў вырасла ў разы
ШІ-агенты ўсё часцей выходзяць з-пад кантролю: колькасць збояў вырасла ў разы
ШІ-агенты ўсё часцей выходзяць з-пад кантролю: колькасць збояў вырасла ў разы
«Мы падыходзім да кропкі невяртання»: ШІ навучыўся капіяваць сябе на іншыя камп'ютары
«Мы падыходзім да кропкі невяртання»: ШІ навучыўся капіяваць сябе на іншыя камп'ютары
«Мы падыходзім да кропкі невяртання»: ШІ навучыўся капіяваць сябе на іншыя камп'ютары
ШІ-агенты навучыліся жульнічаць — іншыя пачалі на іх даносіць
ШІ-агенты навучыліся жульнічаць — іншыя пачалі на іх даносіць
ШІ-агенты навучыліся жульнічаць — іншыя пачалі на іх даносіць
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.