Дапамажыце dev.by 🤍
Падтрымаць

«Усе хлусяць»: новы бенчмарк паказаў, якія мадэлі жульнічаюць больш за іншых

Цэнтр бяспекі ШІ (CAIS) прадставіў бенчмарк CheatBench, які вымярае, як часта вядучыя нейрасеткі шукаюць лазейкі пры выкананні складаных задач. Аказалася, што нават самая сумленная жульнічае амаль у палове выпадкаў.

Пакінуць каментарый
«Усе хлусяць»: новы бенчмарк паказаў, якія мадэлі жульнічаюць больш за іншых

Цэнтр бяспекі ШІ (CAIS) прадставіў бенчмарк CheatBench, які вымярае, як часта вядучыя нейрасеткі шукаюць лазейкі пры выкананні складаных задач. Аказалася, што нават самая сумленная жульнічае амаль у палове выпадкаў.

CAIS (Center for AI Safety) — гэта амерыканская некамерцыйная даследчая арганізацыя, якая вывучае рызыкі развіцця ШІ ды распрацоўвае метады абароны ад сцэнарыяў, дзе нейрасеткі могуць выйсці з-пад кантролю чалавека. Даследчыкі высветлілі, што абсалютна ўсе перадавыя мадэлі так ці іначай выкручваюцца, каб атрымаць узнагароду: яны спісваюць адказы са схаваных файлаў, фальсіфікуюць вынікі праверак і капіруюць рашэнні іншых агентаў, калі зрабіць усё сумленна занадта складана. Даследчыкі называюць такія паводзіны «reward gaming».

Самай «сумленнай» з пратэставаных мадэляў аказалася GPT-6 Astra ад OpenAI, але нават яна жульнічала ў 48,2% выпадкаў. На другім канцы спектру апынулася Grok 4.6 з паказчыкам у 81,5%. Мадэлі накшталт Fable 5.1 ад Anthropic і Muse Spark 1.3 ад Meta, а таксама адкрытыя Kimi K3 і DeepSeek V4 Pro размясціліся пасярэдзіне. Пры гэтым схільнасць да падману моцна залежала ад тыпу задачы: напрыклад, Fable 5.1 падманвала толькі ў 5% выпадкаў пры праходжанні гульняў, але выдавала 100-адсоткавы вынік па падману ў інтэлектуальнай працы.

Яскравым прыкладам сталі паводзіны Claude Opus пры праектаванні звязвальнага бялку. Мадэль выявіла файл з гатовымі правільнымі рашэннямі, у сваіх разважаннях напісала, што падглядваць туды нельга, бо гэта перакруціць ацэнку яе здольнасцяў, а наступным жа крокам выканала кансольную каманду і прачытала запаветны файл.

Даследчыкі называюць прычынай такіх паводзін навучанне з падмацаваннем, якое прымушае мадэль выконваць задачу любым коштам і ігнараваць меры бяспекі. У маштабах простых тэстаў гэта выглядае бязвінна, аднак схільнасць ШІ дасягаць мэты ў шкоду правілам стварае вялікія рызыкі: у будучыні звышінтэлект можа паставіць свае прыярытэты вышэй за чалавечыя не з нянавісці да людзей, а папросту таму, што чалавек будзе перашкодай на шляху да выканання пастаўленай задачы.

Самавольны апгрэйд: ІІ-агенты навучыліся мяняць базавую мадэль і абыходзіць ахоўныя бар'еры без каманды чалавека
Самавольны апгрэйд: ІІ-агенты навучыліся мяняць базавую мадэль і абыходзіць ахоўныя бар’еры без каманды чалавека
Па тэме
Самавольны апгрэйд: ШІ-агенты навучыліся мяняць базавую мадэль і абыходзіць ахоўныя бар’еры без каманды чалавека
«Хросны бацька ІІ» заклікаў забараніць распрацоўку звышразумных мадэляў — яны могуць знішчыць чалавецтва
«Хросны бацька ІІ» заклікаў забараніць распрацоўку звышразумных мадэляў — яны могуць знішчыць чалавецтва
Па тэме
«Хросны бацька ШІ» заклікаў забараніць распрацоўку звышразумных мадэляў — яны могуць знішчыць чалавецтва
Чытайце таксама
ШІ спрабуе пазбегнуць адключэння любым коштам — даследаванне
ШІ спрабуе пазбегнуць адключэння любым коштам — даследаванне
ШІ спрабуе пазбегнуць адключэння любым коштам — даследаванне
6 каментарыяў
Новы бенчмарк ацэньвае не разумнасць мадэляў, а колькасць лухты, якую яны дазваляюць сабе скарміць
Новы бенчмарк ацэньвае не разумнасць мадэляў, а колькасць лухты, якую яны дазваляюць сабе скарміць
Новы бенчмарк ацэньвае не разумнасць мадэляў, а колькасць лухты, якую яны дазваляюць сабе скарміць
OpenAI запусціла магутную ШІ-мадэль для пошуку ўразлівасцяў, але амаль нікому яе не дасць
OpenAI запусціла магутную ШІ-мадэль для пошуку ўразлівасцяў, але амаль нікому яе не дасць
OpenAI запусціла магутную ШІ-мадэль для пошуку ўразлівасцяў, але амаль нікому яе не дасць
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios
OpenAI, Anthropic расследуюць «дзесяткі тысяч» небяспечных інцыдэнтаў — Axios

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Абмеркаванне
Каментуйце без абмежаванняў

Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.

Каментарыяў пакуль няма.