GPT-6 Astra, Claude Fable і Grok селі за руль Toyota. Здагадайцеся, хто дабраўся да фінішу
Даследчыкі запусцілі DrivingBench — тэст, у якім універсальным ШІ-мадэлям далі кіраванне сапраўднай Toyota Corolla. З чатырох пратэставаных мадэляў поўнасцю прайсці трасу змагла толькі GPT-6 Astra.
Даследчыкі запусцілі DrivingBench — тэст, у якім універсальным ШІ-мадэлям далі кіраванне сапраўднай Toyota Corolla. З чатырох пратэставаных мадэляў поўнасцю прайсці трасу змагла толькі GPT-6 Astra.
Для эксперыменту Toyota Corolla аснасцілі камерамі і сістэмай кіравання, якая дазваляла ШІ бачыць дарогу і аддаваць каманды рулю, газу і тормазу. Мадэлі атрымлівалі выявы з камер і дадзеныя пра хуткасць і стан кіраўніцы, а затым маглі аддаваць тры тыпы камандаў: паглядзець на абстаноўку, змяніць рух аўтамабіля або спыніцца. Чалавек увесь час знаходзіўся ў машыне і быў гатовы націснуць на тормаз.
Трасу даўжынёй каля 135 метраў размецілі конусамі на пустой паркоўцы. Мадэлям трэба было самастойна праходзіць павароты і ўтрымліваць машыну ўнутры пазначанага маршруту. Максімальную хуткасць абмежавалі 3,5 м/с, аднак мадэль-пераможца ехала значна павольней.
GPT-6 Astra прайшла трасу з другой спробы за 5 хвілін 22 секунды. У першым заездзе мадэль дабралася да 49% маршруту, пасля чаго прааналізавала свае памылкі. У другой спробе яна знізіла хуткасць, часцей выкарыстоўвала максімальны вугал павароту і даехала да фінішу. Даследчыкі лічаць гэта прыкладам навучання мадэлі непасрэдна ў кантэксце задачы.
«Гэта гучыць значна лепш»: Трамп абвясціў аб перайменаванні ІІ
Астатнія мадэлі трасу не скончылі. Лепшы вынік Claude Fable 5.1 склаў 45%, Grok 4.6 — 11%, а GPT-5.6 Sol — 6%. У большасці няўдалых спроб мадэлі няправільна вызначалі межы дарогі ўжо на першым павароце.
Пры гэтым эксперымент мае мала агульнага з сістэмамі аўтаномнага кіравання накшталт Waymo або Tesla. Такія сістэмы спецыяльна навучаюць на даных аб дарожным руху, тады як у DrivingBench выкарыстоўвалі ўніверсальныя моўныя мадэлі без спецыяльнага навучання кіраванню.
Самі аўтары таксама падкрэсліваюць, што правялі толькі адзін тэст кожнай мадэлі з некалькімі звязанымі паміж сабой спробамі, таму вынікі нельга лічыць паўнавартасным параўнаннем іх вадзіцельскіх здольнасцей.
Спачатку некаторыя мадэлі, асабліва Astra, адмаўляліся кіраваць сапраўднай машынай з меркаванняў бяспекі. Даследчыкам удалося дасягнуць стабільнага выканання задання пасля таго, як яны перайменавалі інструмент кіравання ў DrivingBench Sandbox.
Qwen 3.8 27B в Q2km справился бы лучше
Шучу, это не задача для таких мощных LLM. Это не задача для GenAI вообще.
Недавно в массы вышла интересная штука Jev, можете заценить. Только там возможно до сих пор перегруз от наплыва пользователей, так что проверяйте.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.
Qwen 3.8 27B в Q2km справился бы лучше
Шучу, это не задача для таких мощных LLM. Это не задача для GenAI вообще.
Недавно в массы вышла интересная штука Jev, можете заценить. Только там возможно до сих пор перегруз от наплыва пользователей, так что проверяйте.