Дапамажыце dev.by 🤍
Падтрымаць

GPT-6 Astra, Claude Fable і Grok селі за руль Toyota. Здагадайцеся, хто дабраўся да фінішу

Даследчыкі запусцілі DrivingBench — тэст, у якім універсальным ШІ-мадэлям далі кіраванне сапраўднай Toyota Corolla. З чатырох пратэставаных мадэляў поўнасцю прайсці трасу змагла толькі GPT-6 Astra.

1 каментарый
GPT-6 Astra, Claude Fable і Grok селі за руль Toyota. Здагадайцеся, хто дабраўся да фінішу

Даследчыкі запусцілі DrivingBench — тэст, у якім універсальным ШІ-мадэлям далі кіраванне сапраўднай Toyota Corolla. З чатырох пратэставаных мадэляў поўнасцю прайсці трасу змагла толькі GPT-6 Astra.

Для эксперыменту Toyota Corolla аснасцілі камерамі і сістэмай кіравання, якая дазваляла ШІ бачыць дарогу і аддаваць каманды рулю, газу і тормазу. Мадэлі атрымлівалі выявы з камер і дадзеныя пра хуткасць і стан кіраўніцы, а затым маглі аддаваць тры тыпы камандаў: паглядзець на абстаноўку, змяніць рух аўтамабіля або спыніцца. Чалавек увесь час знаходзіўся ў машыне і быў гатовы націснуць на тормаз.

Трасу даўжынёй каля 135 метраў размецілі конусамі на пустой паркоўцы. Мадэлям трэба было самастойна праходзіць павароты і ўтрымліваць машыну ўнутры пазначанага маршруту. Максімальную хуткасць абмежавалі 3,5 м/с, аднак мадэль-пераможца ехала значна павольней.

GPT-6 Astra прайшла трасу з другой спробы за 5 хвілін 22 секунды. У першым заездзе мадэль дабралася да 49% маршруту, пасля чаго прааналізавала свае памылкі. У другой спробе яна знізіла хуткасць, часцей выкарыстоўвала максімальны вугал павароту і даехала да фінішу. Даследчыкі лічаць гэта прыкладам навучання мадэлі непасрэдна ў кантэксце задачы.

«Так звучит гораздо лучше»: Трамп объявил о переименовании ИИ
«Гэта гучыць значна лепш»: Трамп абвясціў аб перайменаванні ІІ 
Па тэме
«Гэта гучыць значна лепш»: Трамп абвясціў аб перайменаванні ІІ

Астатнія мадэлі трасу не скончылі. Лепшы вынік Claude Fable 5.1 склаў 45%, Grok 4.6 — 11%, а GPT-5.6 Sol — 6%. У большасці няўдалых спроб мадэлі няправільна вызначалі межы дарогі ўжо на першым павароце.

Пры гэтым эксперымент мае мала агульнага з сістэмамі аўтаномнага кіравання накшталт Waymo або Tesla. Такія сістэмы спецыяльна навучаюць на даных аб дарожным руху, тады як у DrivingBench выкарыстоўвалі ўніверсальныя моўныя мадэлі без спецыяльнага навучання кіраванню.

Самі аўтары таксама падкрэсліваюць, што правялі толькі адзін тэст кожнай мадэлі з некалькімі звязанымі паміж сабой спробамі, таму вынікі нельга лічыць паўнавартасным параўнаннем іх вадзіцельскіх здольнасцей.

Спачатку некаторыя мадэлі, асабліва Astra, адмаўляліся кіраваць сапраўднай машынай з меркаванняў бяспекі. Даследчыкам удалося дасягнуць стабільнага выканання задання пасля таго, як яны перайменавалі інструмент кіравання ў DrivingBench Sandbox.

Подрядчиков OpenAI увольняют за использование ИИ при обучении ИИ
Падрадчыкаў OpenAI звальняюць за выкарыстанне ІІ пры навучанні ІІ 
Па тэме
Падрадчыкаў OpenAI звальняюць за выкарыстанне ІІ пры навучанні ІІ
Anthropic выпустила гайд по Claude Opus 5.5: советует писать меньше промптов
Anthropic выпусціла гайд па Claude Opus 5.5: раіць пісаць менш промптаў
Па тэме
Anthropic выпусціла гайд па Claude Opus 5.5: раіць пісаць менш промптаў
Не принял отказ: ИИ-агент OpenAI взломал правительственный портал Австралии
Не прыняў адмову: ІІ-агент OpenAI ўзламаў урадавы партал Аўстраліі
Па тэме
Не прыняў адмову: ІІ-агент OpenAI ўзламаў урадавы партал Аўстраліі
Чытайце таксама
ChatGPT разарыць, DeepSeek узбагаціць: чат-ботам далі ў кіраванне $10K, вось што было далей
ChatGPT разарыць, DeepSeek узбагаціць: чат-ботам далі ў кіраванне $10K, вось што было далей
ChatGPT разарыць, DeepSeek узбагаціць: чат-ботам далі ў кіраванне $10K, вось што было далей
Новы бенчмарк ацэньвае не разумнасць мадэляў, а колькасць лухты, якую яны дазваляюць сабе скарміць
Новы бенчмарк ацэньвае не разумнасць мадэляў, а колькасць лухты, якую яны дазваляюць сабе скарміць
Новы бенчмарк ацэньвае не разумнасць мадэляў, а колькасць лухты, якую яны дазваляюць сабе скарміць
GPT-6 Astra стварыла сімуляцыю ўнутры сімуляцыі — з уласнымі ІІ-персанажамі
GPT-6 Astra стварыла сімуляцыю ўнутры сімуляцыі — з уласнымі ІІ-персанажамі
GPT-6 Astra стварыла сімуляцыю ўнутры сімуляцыі — з уласнымі ІІ-персанажамі
А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам
А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам
А так можна было? Распрацоўшчык абышоў абарону GPT-6 Astra вельмі простым спосабам

Хочаце паведаміць важную навіну? Пішыце ў Telegram-бот

Галоўныя падзеі і карысныя спасылкі ў нашым Telegram-канале

Абмеркаванне
Каментуйце без абмежаванняў

Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.

-1

Qwen 3.8 27B в Q2km справился бы лучше
Шучу, это не задача для таких мощных LLM. Это не задача для GenAI вообще.
Недавно в массы вышла интересная штука Jev, можете заценить. Только там возможно до сих пор перегруз от наплыва пользователей, так что проверяйте.