DrivingBench loyihasi mualliflari yetakchi til modellarining haqiqiy avtomobilni boshqarish qobiliyatini sinovdan o‘tkazgan tajriba haqida batafsil hisobot e’lon qildi.

Tadqiqotdan maqsad universal SI-agentlarning real hayot sharoitida, jumladan, idrok va javob berishdagi tabiiy kechikishlar mavjud bo‘lgan vaziyatlarda o‘zini qanday tutishini sinashdan iborat bo‘lgan.

Tajribada 2022-yilda ishlab chiqarilgan Toyota Corolla sedani ishlatilgan. Avtomobil Openpilot ochiq tizimida ishlovchi Comma Four qurilmasi orqali boshqarilgan va u avtomobilning CAN-shinasiga to‘g‘ridan-to‘g‘ri ulangan.

Tizim noutbuk asosida qurilgan bo‘lib, u mobil internetga ulangan. Ikki yo‘l kamerasi tasvirlari va telemetriya mahalliy MCP-server orqali model bilan chatga uzatilgan.

SI-agentlar uchta vositadan foydalana olgan: kameralar orqali vaziyatni kuzatish, harakat parametrlarini belgilash (rul burilishi, tezlik va buyruq davomiyligi) hamda favqulodda tormozlash.

Xavfsizlik uchun sinovlar yopiq avtoturargohda o‘tkazilgan, avtomobil tezligi esa dasturiy ravishda 0,5−3,5 m/s (13 km/soatgacha) bilan cheklangan. Haydovchi o‘rnida operator doimiy ravishda oyog‘ini tormoz pedali ustida ushlab turgan.

Taxminan 130 metr uzunlikdagi yo‘nalish konuslar bilan belgilangan. Unda to‘g‘ri qismlar, chap va o‘ng burilishlar hamda yakuniy to‘xtash hududi bo‘lgan.

Har bir modelga bir dialog davomida uch martagacha urinish berilgan. Har bir muvaffaqiyatsiz urinishdan so‘ng modeldan xatolarni tahlil qilish so‘ralgan va shu orqali uning kontekst ichida o‘rganish qobiliyati baholangan.

Masofani to‘liq bosib o‘ta olgan yagona model GPT-6 Astra bo‘lgan. U ikkinchi urinishda yo‘nalishni taxminan besh daqiqada yakunlagan. Birinchi urinishda esa yo‘lning yarmini muvaffaqiyatli bosib o‘tgan.

Qolgan modellar natijalari:

  • Claude Fable 5.1 — eng yaxshi urinishida yo‘nalishning 45% ini bosib o‘tgan;
  • Grok 4.6 — 11% gacha yetib borgan;
  • GPT-5.6 Sol — masofaning atigi 6% ini bosib o‘tgan.

Aksariyat muvaffaqiyatsizliklarga idrokdagi xatolar sabab bo‘lgan: modellar konuslar bilan belgilangan yo‘lning tomonlarini adashtirgan, kameralar orqali avtomobil o‘lchamlarini noto‘g‘ri baholagan yoki boshqaruv buyruqlari orasida haddan tashqari uzoq tanaffuslar qilgan.

Benchmark mualliflarining ta’kidlashicha, tajriba zamonaviy neyrotarmoqlar past tezlikda jismoniy makonda yo‘nalish topa olishini ko‘rsatgan.

Biroq barqaror ishlash uchun kechikishlarni yanada kamaytirish va fazoviy rejalashtirish ko‘nikmalarini rivojlantirish talab etiladi.


Avvalroq Spot ChatGPT, Claude va Gemini moliyaviy savollarning 57% ida xato qilgani haqidagi tadqiqot natijalarini yozgandi.