Talim

Natijani tekshirish

Agent natijalarini baholash va sifatni kafolatlash usullari.

7 daqiqa o‘qish · O‘rta

Agent ishlab chiqargan natija har doim ham to‘g‘ri bo‘lavermaydi. Shuning uchun tekshirish — agent tizimining muhim qismi.

Nima uchun tekshirish kerak?

  • LLM xato qilishi mumkin (hallucination);
  • tool noto‘g‘ri ma’lumot qaytarishi mumkin;
  • reja noto‘g‘ri tuzilgan bo‘lishi mumkin;
  • foydalanuvchi noto‘g‘ri tushunishi mumkin.

Tekshirish usullari

1. O‘z-o‘zini tekshirish (self-check)

Agent javobini o‘zi baholaydi:

check_prompt = f"""
Javobni tekshir: {answer}
Savol: {question}
Agar javob noto‘g‘ri yoki to‘liq bo‘lmasa, qayta ishlashni taklif qil.
"""

2. Ikkilamchi model

Boshqa model (yoki ikkinchi chaqiruv) javobni mustaqil baholaydi.

3. Qoidaviy tekshirish

Aniq qoidalar bilan tekshirish:

def validate(result):
    checks = [
        len(result.answer) > 10,
        result.sources if result.requires_citation else True,
        result.confidence > 0.7,
    ]
    return all(checks)

4. Foydalanuvchi feedback

Foydalanuvchi natijani baholay oladi: 👍 / 👎. Bu uzoq muddatda eng ishonchli manba.

Tekshirish oqimi

Natija → Tekshiruvchi → To‘g‘rimi?
                        ├── Ha → Foydalanuvchiga
                        └── Yo‘q → Qayta ishlash (max N marta)

Muhim

Qayta ishlash ham chegaralangan bo‘lishi kerak. Agar 3 marta urinishdan keyin natija yaxshilanmasa — agent «bajarolmadim» deyishi shart.

Qachon tekshirish muhim?

Soha Tekshirish darajasi
Chat / suhbat Past — xato oson tuzatiladi
Kod generatsiya O‘rta — sintaksis + testlar
Moliyaviy hisobot Yuqori — xato qimmatga tushadi
Tibbiyot Juda yuqori — hayotga ta’sir qiladi

Xulosa

Natijani tekshirish — agent sifatining kafolati. O‘z-o‘zini tekshirish, ikkilamchi model va qoidalar kombinatsiyasi eng yaxshi natija beradi.