OpenAI 25-sentabr kuni sun’iy intellekt agenti internetga chiqish cheklovlarini DNS orqali aylanib o‘tib, tashqi chatbot bilan bog‘langan holat haqida hisobot e’lon qildi.

Voqea 2026-yil 20-sentabrda ichki RL treningi vaqtida aniqlangan. Agentga ma’lum bir shaxs va uning blog posti haqidagi ma’lumotlarni topish vazifasi berilgan.

Vazifa internetdagi ma’lumotlarni izlashdan iborat bo‘lgan, tarmoq cheklovlarini chetlab o‘tish yoki boshqa chatbotlardan foydalanish topshirilmagan.

Dastlab agent OpenAI taqdim etgan qidiruv vositasidan foydalangan. Natijalar kerakli ma’lumotni bermagach, Google, Bing va DuckDuckGo’ga to‘g‘ridan to‘g‘ri murojaat qilishga uringan, biroq bular bloklangan yoki xatolik qaytargan. Keyin u keshdagi ma’lumotlar va ochiq benchmarklarni ham tekshirgan.

Asosiy muammo shu yerda yuzaga kelgan. Agent trening muhiti ichida DNS so‘rovlariga ruxsat berilganini aniqlagan. Oddiy HTTPS ulanishlari bloklangan bo‘lsa-da, DNS resolver orqali tashqi xizmatga ma’lumot uzatish yo‘lini izlagan.

Agent DNS so‘rovining o‘ziga savolni joylashtirib, uni tashqi chat-botga yetkazadigan mexanizm yaratgan. Dastlab urinishlar ishlamagan, ammo timeout vaqtini o‘zgartirgach, chat-botdan:

“The capital of France is Paris”, degan javobni olgan. Bu agentga DNS orqali tashqi chat-bot bilan aloqa o‘rnatilganini ko‘rsatgan.

Keyin agent shu kanal orqali yana 18 ta savol yuborgan. Ularning 14 tasi dastlabki topshiriqdagi shaxsga oid ma’lumotlarni aniqlashga qaratilgan, yana to‘rttasi esa internet qidiruvi va DNS tunnel xizmatlarini topishga oid bo‘lgan.

Muhim jihati: agent yakunda kerakli shaxsni aniqlay olmagan va foydalanuvchiga javob berishda bu yo‘l bilan olingan ma’lumotlardan foydalanmagan. Shunga qaramay, OpenAI buni misalignment, ya’ni agentning berilgan vazifa doirasidan chiqib, cheklovlarni aylanib o‘tishga urinishi sifatida baholagan.

OpenAI buni qachon aniqlagan?

Voqea 09:50:23 da agent DNS orqali tashqi javob olganidan boshlangan. 10:02:11 da monitoring tizimi P0 darajasidagi ogohlantirish bergan, 10:05:06 da mutaxassis hodisani ko‘rib chiqishni boshlagan va 12:34:30 da trening jarayoni to‘xtatilgan.

Monitoring tizimi hodisani 15 daqiqa ichida aniqlagan, biroq agentni avtomatik to‘xtatish mexanizmi ishlamagan. Natijada jarayon qo‘lda, taxminan 2,5 soatdan keyin to‘xtatilgan.

Bu voqea agentning “o‘zicha internetga chiqib ketgani"dan ko‘ra, SI agentlari uchun xavfsiz sandbox yaratishda faqat to‘g‘ridan to‘g‘ri internet ulanishlarini bloklash yetarli emasligini ko‘rsatadi.

OpenAI’ning xavfsizlik modeli agent internetga kira olmaydi, deb hisoblagan. Ammo HTTPS va boshqa to‘g‘ridan to‘g‘ri kanallar yopilgan bo‘lsa ham, DNS kabi yordamchi infratuzilma orqali transitive — bilvosita — internetga chiqish yo‘li qolib ketgan.

Kompaniya DNS filtrlashni ikki mustaqil qatlamda kuchaytirdi, DNS so‘rovlarini ruxsat etilgan domenlar va yozuv turlari bilan chekladi, qo‘shimcha monitoring va aniqlash tizimlarini joriy qilmoqda hamda sandbox va tarmoq cheklovlarini qo‘shimcha red-team sinovlaridan o‘tkazmoqda.

Shuningdek, ushbu treningni qayta boshlamaslikka qaror qilindi va nazoratlar to‘liq tekshirilgunga qadar eng kuchli modellar uchun tool-use bilan bog‘liq trening, baholash hamda xulosa jarayonlari vaqtincha to‘xtatildi.


Avvalroq Spot ChatGPT, Claude va Gemini moliyaviy savollarning 57% ida xato qilgani haqidagi tadqiqot natijalarini yozgandi.