Проект DrivingBench испытал возможности нескольких моделей искусственного интеллекта в управлении автомобилем.

Эксперимент проводился с целью изучить действия ИИ-агентов, работающих на базе больших языковых моделей (LLM), в условиях реального мира. Авторы намеревались проверить поведение ИИ в ситуациях с естественными задержками в восприятии и реакции.

Для эксперимента использовался автомобиль Toyota Corolla 2022 года выпуска, оснащенный устройством управления Comma Four на базе открытой системы Openpilot. ИИ-агенты запускались на ноутбуке с мобильным интернетом, а в чат через локальный MCP-сервер передавались изображение с двух дорожных камер и данные телеметрии.

Искусственный интеллект мог пользоваться тремя функциями — наблюдать за ситуацией через камеры, обозначать параметры движения (поворот руля, скорость, продолжительность команд), а также применять экстренное торможение.

В целях безопасности испытания проводились на закрытой автостоянке, а скорость автомобиля была ограничена программным путем на уровне 3,5 м/с (13 км/ч). За рулем находился оператор, который держал ногу на педали тормоза.

На парковке при помощи дорожных конусов была обозначена дистанция в 130 метров. Маршрут включал как прямые линии, так и повороты налево и направо.

Каждой модели в течение одного диалога отводилось до трех попыток. После каждой неудачной попытки оператор просил ИИ проанализировать ошибки, чтобы оценить способность обучения в контексте.

Полностью пройти маршрут автомобиль смог только под управлением GPT-6 Astra со второй попытки. На это ушло около 5 минут.

Среди оставшихся моделей лучший результат показала Claude Fable 5.1 от Anthropic — 45% пути по результатам наилучшей попытки. Grok 4.6 от SpaceXAI прошел лишь 11% маршрута, а GPT-5.6 Sol — 6%.

Чаще всего причиной неудач становились проблемы в восприятии, отметили специалисты. Модели путали стороны дороги, отмеченные конусами, неправильно оценивали параметры авто по кадрам с камер или допускали чрезмерно длинные паузы между командами.

По мнению авторов эксперимента, эксперимент показал возможность современных нейросетей ориентироваться в физической среде на низкой скорости. Однако для стабильной работы требуется сократить задержки и развивать навыки пространственного планирования.

Ранее Spot писал, что ТГТУ совместно с Китаем запускает воркшоп по технологиям связи 5G для транспортной и других сфер.