GPT-6 Astra, Claude Fable и Grok посадили за руль Toyota. Угадайте, кто доехал до финиша
Исследователи запустили DrivingBench — тест, в котором универсальным ИИ-моделям дали управление настоящей Toyota Corolla. Из четырех протестированных моделей полностью пройти трассу смогла только GPT-6 Astra.
Исследователи запустили DrivingBench — тест, в котором универсальным ИИ-моделям дали управление настоящей Toyota Corolla. Из четырех протестированных моделей полностью пройти трассу смогла только GPT-6 Astra.
Для эксперимента Toyota Corolla оснастили камерами и системой управления, которая позволяла ИИ видеть дорогу и отдавать команды рулю, газу и тормозу. Модели получали изображения с камер и данные о скорости и положении руля, а затем могли отдавать три типа команд: посмотреть на обстановку, изменить движение автомобиля или остановиться. Человек все время находился в машине и был готов нажать на тормоз.
Трассу длиной около 135 метров разметили конусами на пустой парковке. Моделям нужно было самостоятельно проходить повороты и удерживать машину внутри обозначенного маршрута. Максимальную скорость ограничили 3,5 м/с, однако победившая модель ехала значительно медленнее.
GPT-6 Astra прошла трассу со второй попытки за 5 минут 22 секунды. В первом заезде модель добралась до 49% маршрута, после чего проанализировала свои ошибки. Во второй попытке она снизила скорость, чаще использовала максимальный угол поворота и доехала до финиша. Исследователи считают это примером обучения модели непосредственно в контексте задачи.
«Так звучит гораздо лучше»: Трамп объявил о переименовании ИИ
Остальные модели трассу не закончили. Лучший результат Claude Fable 5.1 составил 45%, Grok 4.6 — 11%, а GPT-5.6 Sol — 6%. В большинстве неудачных попыток модели неправильно определяли границы дороги уже на первом повороте.
При этом эксперимент имеет мало общего с системами автономного вождения вроде Waymo или Tesla. Такие системы специально обучают на данных о дорожном движении, тогда как в DrivingBench использовали универсальные языковые модели без специального обучения вождению.
Сами авторы также подчеркивают, что провели только один тест каждой модели с несколькими связанными между собой попытками, поэтому результаты нельзя считать полноценным сравнением их водительских способностей.
Сначала некоторые модели, особенно Astra, отказывались управлять настоящей машиной из соображений безопасности. Исследователям удалось добиться стабильного выполнения задания после того, как они переименовали инструмент управления в DrivingBench Sandbox.
Qwen 3.8 27B в Q2km справился бы лучше
Шучу, это не задача для таких мощных LLM. Это не задача для GenAI вообще.
Недавно в массы вышла интересная штука Jev, можете заценить. Только там возможно до сих пор перегруз от наплыва пользователей, так что проверяйте.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.
Qwen 3.8 27B в Q2km справился бы лучше
Шучу, это не задача для таких мощных LLM. Это не задача для GenAI вообще.
Недавно в массы вышла интересная штука Jev, можете заценить. Только там возможно до сих пор перегруз от наплыва пользователей, так что проверяйте.