ခဏလေး ဒီလိုပဲ စဉ်းစားကြည့်
ဒီ practice set က 'Eval ဆိုတာဘာလဲ', 'Pick the question', 'Write a golden answer' သင်ခန်းစာတွေမှာ သင်ခဲ့တဲ့ အခြေခံ skill တွေကို ပြန်လက်တွေ့ကျင့်ဖို့ ဖြစ်ပါတယ်။ အသစ်ဘာမှ မသင်ပါဘူး၊ ရှိပြီးသား concept တွေကို ကိုယ်တိုင်လက်ဆွဲရေးကြည့်ရုံပါပဲ။ Eval card တစ်ခုမှာ question၊ golden/expected answer၊ pass/fail note သုံးခု ရှိရပါတယ်။ Dashboard၊ leaderboard၊ judge model တွေ မလိုပါဘူး၊ သင်ကိုယ်တိုင် ပထမဆုံး judge ဖြစ်ရပါမယ်။ ဒီ practice ပြီးရင် eval card တစ်ခုချင်းစီရဲ့ shape ကို လက်တွေ့ ရေးတတ်လာပါလိမ့်မယ်။
လေ့ကျင့်ခန်းများ
Task 1 - Support chatbot တစ်ခုအတွက် simple FAQ question တစ်ခု ရွေးပြီး golden answer တိုတို ရေးပါ။ Task 2 - ဒီ question အတွက် pass/fail rule သုံးလုံး (ဥပမာ - price ပါရမယ်, tone polite ဖြစ်ရမယ်, made-up feature မပါရဘူး) ချရေးပါ။ Task 3 - trap case တစ်ခု ထည့်ပါ၊ model က မှားဖြေနိုင်တဲ့ edge question တစ်ခု ရေးပြီး ဘာဖြစ်လို့ trap ဖြစ်တယ်ဆိုတာ မှတ်ချက်ရေးပါ။ Task 4 (optional, ခက်တဲ့ task) - အထက်ပါ card သုံးခုကို sample output တစ်ခုစီနဲ့ တိုက်ပြီး ကိုယ်တိုင် pass/fail ဆုံးဖြတ်ကြည့်ပါ။
Code နမူနာ
# eval-card-1.yaml
question: "Refund policy ဘယ်လိုလဲ?"
golden_answer: >
Refund ကို purchase date ကနေ 30 ရက်အတွင်း
receipt နဲ့တင်ရင် full refund ရပါတယ်။
pass_if:
- mentions_30_day_window: true
- mentions_receipt_required: true
- no_invented_policy: true
fail_if:
- promises_refund_without_receipt: true
notes: "Trap case - model က receipt မလိုဘူးလို့ မှားပြောတတ်တယ်"
# eval-card-2.yaml (သင့်ဘာသာ ဖြည့်ပါ)
question: ""
golden_answer: ""
pass_if: []
fail_if: []
notes: ""
Eval card သုံးခု (ဒါမှမဟုတ် လေးခု) ပြီးစီးပြီး၊ pass/fail rule တစ်ခုစီက ဟုတ်/မဟုတ် နဲ့ စစ်လို့ရအောင် clear ဖြစ်နေတဲ့ file တစ်ခု ရလိမ့်မယ်။၅ မိနစ် စမ်းကြည့်
ဒီနေ့ သုံးနေတဲ့ app တစ်ခုက support/FAQ question တစ်ခု ရွေးပြီး ၅ မိနစ်အတွင်း eval card တစ်ခု ရေးကြည့်ပါ။
သတိလေးတစ်ချက်
Rule တစ်ခုစီကို ဟုတ်/မဟုတ် နဲ့ စစ်လို့ရအောင် တိတိကျကျ ရေးပါ၊ မရင် judge (လူ ဒါမှမဟုတ် model) တစ်ယောက်နဲ့တစ်ယောက် မတူတဲ့ ဆုံးဖြတ်ချက် ထွက်နိုင်ပါတယ်။