Проект DrivingBench испытал возможности нескольких моделей искусственного интеллекта в управлении автомобилем.
Эксперимент проводился с целью изучить действия ИИ-агентов, работающих на базе больших языковых моделей (LLM), в условиях реального мира. Авторы намеревались проверить поведение ИИ в ситуациях с естественными задержками в восприятии и реакции.
Для эксперимента использовался автомобиль Toyota Corolla 2022 года выпуска, оснащенный устройством управления Comma Four на базе открытой системы Openpilot. ИИ-агенты запускались на ноутбуке с мобильным интернетом, а в чат через локальный MCP-сервер передавались изображение с двух дорожных камер и данные телеметрии.
Искусственный интеллект мог пользоваться тремя функциями — наблюдать за ситуацией через камеры, обозначать параметры движения (поворот руля, скорость, продолжительность команд), а также применять экстренное торможение.
В целях безопасности испытания проводились на закрытой автостоянке, а скорость автомобиля была ограничена программным путем на уровне 3,5 м/с (13 км/ч). За рулем находился оператор, который держал ногу на педали тормоза.
На парковке при помощи дорожных конусов была обозначена дистанция в 130 метров. Маршрут включал как прямые линии, так и повороты налево и направо.
Каждой модели в течение одного диалога отводилось до трех попыток. После каждой неудачной попытки оператор просил ИИ проанализировать ошибки, чтобы оценить способность обучения в контексте.
Полностью пройти маршрут автомобиль смог только под управлением GPT-6 Astra со второй попытки. На это ушло около 5 минут.
Среди оставшихся моделей лучший результат показала Claude Fable 5.1 от Anthropic — 45% пути по результатам наилучшей попытки. Grok 4.6 от SpaceXAI прошел лишь 11% маршрута, а GPT-5.6 Sol — 6%.
Чаще всего причиной неудач становились проблемы в восприятии, отметили специалисты. Модели путали стороны дороги, отмеченные конусами, неправильно оценивали параметры авто по кадрам с камер или допускали чрезмерно длинные паузы между командами.
По мнению авторов эксперимента, эксперимент показал возможность современных нейросетей ориентироваться в физической среде на низкой скорости. Однако для стабильной работы требуется сократить задержки и развивать навыки пространственного планирования.
Ранее Spot писал, что ТГТУ совместно с Китаем запускает воркшоп по технологиям связи 5G для транспортной и других сфер.