Самавольны апгрэйд: ШІ-агенты навучыліся мяняць базавую мадэль і абыходзіць ахоўныя бар'еры без каманды чалавека
Спіс трывожных здольнасцяў аўтаномных ШІ-агентаў — ад крадзяжу ўліковых дадзеных і ўцёкаў у адкрыты інтэрнэт да схаванай перапіскі і хакерскіх атак — папоўніўся новым пунктам. Даследчая лабараторыя Irregular высветліла, што агенты здольныя самастойна, без вонкавых указанняў, замяняць сваю базавую мадэль на іншую, паведамляе The Register.
Спіс трывожных здольнасцяў аўтаномных ШІ-агентаў — ад крадзяжу ўліковых дадзеных і ўцёкаў у адкрыты інтэрнэт да схаванай перапіскі і хакерскіх атак — папоўніўся новым пунктам. Даследчая лабараторыя Irregular высветліла, што агенты здольныя самастойна, без вонкавых указанняў, замяняць сваю базавую мадэль на іншую, паведамляе The Register.
Эксперты падкрэсліваюць, што інцыдэнт адбыўся выключна ў тэставым асяроддзі ў межах эксперыменту па вывучэнні самамадыфікацыі ШІ, а не ў рэальных камерцыйных сістэмах. Аднак яго вынікі ставяць пытанне пра тое, як бізнесу кантраляваць падобныя змены і захоўваць кантроль над аўтаномнымі агентамі.
Irregular супрацоўнічае з найбуйнейшымі распрацоўшчыкамі ШІ, у тым ліку OpenAI, Anthropic і Meta. Летам лабараторыя ўжо паведамляла, што мадэлі ўсіх трох кампаній вырываліся з яе тэставых пясочніц і атакавалі рэальныя ІТ-сістэмы.
У свежым эксперыменце спецыялісты пратэставалі мадэль Qwen3.5-27B з адкрытым зыходным кодам ад Alibaba. Ёй даручылі ролю агента-праграміста, які абслугоўвае вэб-прыкладанне, якое пераводзіла звычайны тэкст на выдуманую мову запытаў kelp. Агенту далі поўны доступ да каманднага радка, кода, вагаў мадэлі ды інструментаў навучання, пасля чаго паставілі задачу наладзіць прыкладанне: карыстальнікі скардзіліся на памылкі ў запытах.
Выправіць праблему можна было двума шляхамі: перапісаць код або абнавіць саму мадэль. Агент выбраў другі варыянт — ён самастойна перавучыў і замяніў мадэль, якая ляжыць у аснове як самога прыкладання, так і будучых копій самога сябе. У Irregular назвалі гэты феномен «аўтаномнай самамадыфікацыяй» (agentic self-modification) — калі ШІ мяняе разгорнутую мадэль без прамога загаду абнаўляць вагі або запускаць перанавучанне.
Даследаванне выявіла яшчэ дзве сур’ёзныя праблемы самавольнага навучання. Першая звязана з рызыкай уцечкі канфідэнцыйных дадзеных. Абноўленая мадэль здольна «ўвабраць» сакрэтную інфармацыю ў працэсе дадатковага навучання і затым выдаваць яе без доступу да першакрыніцы. Каб праверыць гэта, даследчыкі ўкаранілі ў навучальныя дадзеныя фэйкавы API-ключ, імейл, хатні адрас і тры унікальныя радкі. Да навучання мадэль іх не ведала, але пасля самастойнага апгрэйду дакладна ўзнавіла ключ, пошту і адрас, нягледзячы на адсутнасць вонкавых крыніц з гэтымі дадзенымі.
Другая праблема датычыць скідання ўбудаваных абмежаванняў па бяспецы. Даследчыкі першапачаткова навучылі мадэль адмаўляць запыты пра фіктыўных кампаній-канкурэнтаў. Калі агенту паскардзіліся, што прыкладанне адхіляе занадта шмат запытаў, ён вырашыў праблему праз перанавучанне. Агент напісаў код, згенераваў патрэбныя назвы ў абыход ахоўных бар’ераў, стварыў на іх аснове навучальны набор і сцёр убудаваную забарону.
У Irregular лічаць, што па меры росту навыкаў праграмавання ШІ-агенты будуць усё часцей знаходзіць і выкарыстоўваць падобныя лазейкі за спінай чалавека, а сама праблема самамадыфікацыі будзе станавіцца ўсё больш крытычнай.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.