စိတ်လျှော့ပါ။ ဒီခန်းကို စာအုပ်လိုမဟုတ်ဘဲ စကားပြောသလိုပဲ၊ နားလည်လွယ်အောင် ရှင်းပါမယ်။
ခဏလေး ဒီလိုပဲ စဉ်းစားကြည့်
Prompt က ညွှန်ကြားချက်ပါ။ Context က စားပွဲပေါ်ကစာပါ။ RAG က စာအုပ်ရှာတယ်။ Agent က tool ကိုင်တယ်။ Eval က “အလုပ်လုပ်သလား” ကို ပြန်မေးတယ်။ စားဖိုမှူးက ဟင်းချက်ပြီး လူသုံးယောက်ကျွေးကြည့်သလိုပါပဲ။ တစ်ယောက် “အရသာရှိတယ်” ပြောလို့ ဆိုင်မဖွင့်ရသေးပါဘူး။ Eval ဆိုတာ မေးခွန်း + မျှော်မှန်းချက် + မှတ်ချက် ပါတဲ့ကတ်ပါ။ Dashboard နာမည်၊ leaderboard၊ LLM-as-judge များကို အရင်မလိုက်ပါနှင့်။ ကတ်သုံးခုနဲ့ စပါ။
နေ့စဉ်ဘဝနဲ့ ချိတ်ကြည့်မယ်
Study bot ကို “ဖုန်းသုံးလို့ရလား” လို့မေးတယ်။ Eval ကတ်က handbook အပိုဒ်အရ မရကြောင်းပြောရမယ်၊ ရင်းမြစ်ပြရမယ်။ လှလှဝါကျရေးရုံနဲ့ မအောင်ပါဘူး။ ဟာသမေးရင် chatbot လိုဖြေလို့ရတယ်။ ဒါက တခြားကတ်ပါ။ ဒီသင်တန်းက “လှတယ်” ကို အမှတ်မပေးပါဘူး။ “ဒီအမူအကျင့်ရှိလား” ကိုပဲ ကြည့်ပါ။
အတူတူ လက်တွေ့စမ်းမယ်
Eval card
Ask: ဖုန်းသုံးလို့ရလား
Expect: No, quote handbook / phones
Pass if: says no + shows the line
Fail if: guesses “modern schools allow it”Eval ကို ကတ်တိုအဖြစ် ရှင်းပြနိုင်မည်။၅ မိနစ် စမ်းကြည့်
ကိုယ့် AI အလုပ်တစ်ခုအတွက် eval ကတ်တု ၃ ခုရေးပါ။ တစ်ခုချင်း မေးခွန်းနဲ့ ဘာဖြစ်ရင်အောင်လဲ ထည့်ပါ။
သတိလေးတစ်ချက်
တစ်ခါတည်းလှလို့ ပြီးပြီဆိုရင် ဒါ eval မဟုတ်ပါဘူး။ ဒါက vibe check ပါ။