Support us

GPT-6 Astra, Claude Fable и Grok посадили за руль Toyota. Угадайте, кто доехал до финиша

Исследователи запустили DrivingBench — тест, в котором универсальным ИИ-моделям дали управление настоящей Toyota Corolla. Из четырех протестированных моделей полностью пройти трассу смогла только GPT-6 Astra.

1 комментарий
GPT-6 Astra, Claude Fable и Grok посадили за руль Toyota. Угадайте, кто доехал до финиша

Исследователи запустили DrivingBench — тест, в котором универсальным ИИ-моделям дали управление настоящей Toyota Corolla. Из четырех протестированных моделей полностью пройти трассу смогла только GPT-6 Astra.

Для эксперимента Toyota Corolla оснастили камерами и системой управления, которая позволяла ИИ видеть дорогу и отдавать команды рулю, газу и тормозу. Модели получали изображения с камер и данные о скорости и положении руля, а затем могли отдавать три типа команд: посмотреть на обстановку, изменить движение автомобиля или остановиться. Человек все время находился в машине и был готов нажать на тормоз.

Трассу длиной около 135 метров разметили конусами на пустой парковке. Моделям нужно было самостоятельно проходить повороты и удерживать машину внутри обозначенного маршрута. Максимальную скорость ограничили 3,5 м/с, однако победившая модель ехала значительно медленнее.

GPT-6 Astra прошла трассу со второй попытки за 5 минут 22 секунды. В первом заезде модель добралась до 49% маршрута, после чего проанализировала свои ошибки. Во второй попытке она снизила скорость, чаще использовала максимальный угол поворота и доехала до финиша. Исследователи считают это примером обучения модели непосредственно в контексте задачи.

«Так звучит гораздо лучше»: Трамп объявил о переименовании ИИ
«Так звучит гораздо лучше»: Трамп объявил о переименовании ИИ 
По теме
«Так звучит гораздо лучше»: Трамп объявил о переименовании ИИ

Остальные модели трассу не закончили. Лучший результат Claude Fable 5.1 составил 45%, Grok 4.6 — 11%, а GPT-5.6 Sol — 6%. В большинстве неудачных попыток модели неправильно определяли границы дороги уже на первом повороте.

При этом эксперимент имеет мало общего с системами автономного вождения вроде Waymo или Tesla. Такие системы специально обучают на данных о дорожном движении, тогда как в DrivingBench использовали универсальные языковые модели без специального обучения вождению.

Сами авторы также подчеркивают, что провели только один тест каждой модели с несколькими связанными между собой попытками, поэтому результаты нельзя считать полноценным сравнением их водительских способностей.

Сначала некоторые модели, особенно Astra, отказывались управлять настоящей машиной из соображений безопасности. Исследователям удалось добиться стабильного выполнения задания после того, как они переименовали инструмент управления в DrivingBench Sandbox.

Подрядчиков OpenAI увольняют за использование ИИ при обучении ИИ
Подрядчиков OpenAI увольняют за использование ИИ при обучении ИИ 
По теме
Подрядчиков OpenAI увольняют за использование ИИ при обучении ИИ
Anthropic выпустила гайд по Claude Opus 5.5: советует писать меньше промптов
Anthropic выпустила гайд по Claude Opus 5.5: советует писать меньше промптов
По теме
Anthropic выпустила гайд по Claude Opus 5.5: советует писать меньше промптов
Не принял отказ: ИИ-агент OpenAI взломал правительственный портал Австралии
Не принял отказ: ИИ-агент OpenAI взломал правительственный портал Австралии
По теме
Не принял отказ: ИИ-агент OpenAI взломал правительственный портал Австралии
Читайте также
«Эпоха AGI началась»: OpenAI представила супермощную GPT-6 Astra
«Эпоха AGI началась»: OpenAI представила супермощную GPT-6 Astra
«Эпоха AGI началась»: OpenAI представила супермощную GPT-6 Astra
2 комментария
GPT-6 Astra создала симуляцию внутри симуляции — с собственными ИИ-персонажами
GPT-6 Astra создала симуляцию внутри симуляции — с собственными ИИ-персонажами
GPT-6 Astra создала симуляцию внутри симуляции — с собственными ИИ-персонажами
OpenAI выпустила гайд по созданию игр с помощью GPT-6 Astra
OpenAI выпустила гайд по созданию игр с помощью GPT-6 Astra
OpenAI выпустила гайд по созданию игр с помощью GPT-6 Astra
«Все врут»: новый бенчмарк показал, какие модели читерят больше других
«Все врут»: новый бенчмарк показал, какие модели читерят больше других
«Все врут»: новый бенчмарк показал, какие модели читерят больше других

Хотите сообщить важную новость? Свяжитесь с редакцией через страницу контактов

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

-1

Qwen 3.8 27B в Q2km справился бы лучше
Шучу, это не задача для таких мощных LLM. Это не задача для GenAI вообще.
Недавно в массы вышла интересная штука Jev, можете заценить. Только там возможно до сих пор перегруз от наплыва пользователей, так что проверяйте.