Agent ishlab chiqargan natija har doim ham to‘g‘ri bo‘lavermaydi. Shuning uchun tekshirish — agent tizimining muhim qismi.
Nima uchun tekshirish kerak?
- LLM xato qilishi mumkin (hallucination);
- tool noto‘g‘ri ma’lumot qaytarishi mumkin;
- reja noto‘g‘ri tuzilgan bo‘lishi mumkin;
- foydalanuvchi noto‘g‘ri tushunishi mumkin.
Tekshirish usullari
1. O‘z-o‘zini tekshirish (self-check)
Agent javobini o‘zi baholaydi:
check_prompt = f"""
Javobni tekshir: {answer}
Savol: {question}
Agar javob noto‘g‘ri yoki to‘liq bo‘lmasa, qayta ishlashni taklif qil.
"""
2. Ikkilamchi model
Boshqa model (yoki ikkinchi chaqiruv) javobni mustaqil baholaydi.
3. Qoidaviy tekshirish
Aniq qoidalar bilan tekshirish:
def validate(result):
checks = [
len(result.answer) > 10,
result.sources if result.requires_citation else True,
result.confidence > 0.7,
]
return all(checks)
4. Foydalanuvchi feedback
Foydalanuvchi natijani baholay oladi: 👍 / 👎. Bu uzoq muddatda eng ishonchli manba.
Tekshirish oqimi
Natija → Tekshiruvchi → To‘g‘rimi?
├── Ha → Foydalanuvchiga
└── Yo‘q → Qayta ishlash (max N marta)
Muhim
Qayta ishlash ham chegaralangan bo‘lishi kerak. Agar 3 marta urinishdan keyin natija yaxshilanmasa — agent «bajarolmadim» deyishi shart.
Qachon tekshirish muhim?
| Soha | Tekshirish darajasi |
|---|---|
| Chat / suhbat | Past — xato oson tuzatiladi |
| Kod generatsiya | O‘rta — sintaksis + testlar |
| Moliyaviy hisobot | Yuqori — xato qimmatga tushadi |
| Tibbiyot | Juda yuqori — hayotga ta’sir qiladi |
Xulosa
Natijani tekshirish — agent sifatining kafolati. O‘z-o‘zini tekshirish, ikkilamchi model va qoidalar kombinatsiyasi eng yaxshi natija beradi.