Thuta Learning
ရှာဖွေရန်
ExercisesAIbeginner

Eval Pack လေးခု တည်ဆောက်ပြီး Prompt ပြောင်းရင် Rerun ကြည့်ပါ

စိတ်လျှော့ပါ။ ဒီခန်းကို စာအုပ်လိုမဟုတ်ဘဲ စကားပြောသလိုပဲ၊ နားလည်လွယ်အောင် ရှင်းပါမယ်။

ဒီခန်းပြီးရင် ဘာတတ်သွားမလဲ

  • Eval Pack လေးခု တည်ဆောက်ပြီး Prompt ပြောင်းရင် Rerun ကြည့်ပါ ကို ကိုယ်တိုင် လေ့ကျင့်ကြည့်မယ်
  • သင်ခဲ့ပြီးသား skill တွေကို practice လုပ်ပြီး ခိုင်မာအောင်လုပ်မယ်
  • အမှားရှာ၊ ပြင်တတ်၊ ကိုယ်တိုင် check လုပ်တတ်မယ်

ခဏလေး ဒီလိုပဲ စဉ်းစားကြည့်

ဒီ practice set က 'Three cases - happy, missing, trap', 'Rerun after you change a prompt', 'Build a study eval pack' သင်ခန်းစာတွေကို ပေါင်းပြီး practical ကျကျ ကျင့်ကြည့်ခြင်းဖြစ်ပါတယ်။ Lesson ၁ ထက် ခက်ပါတယ်၊ ဒီတစ်ခါ card တစ်ခုတည်းမက pack တစ်ခုလုံး (case အမျိုးမျိုး) ကို management လုပ်ရမှာ၊ ပြီးတော့ prompt ပြောင်းရင် regression ဖြစ်သွားလား ကိုယ်တိုင် စစ်ရမှာပါ။ Pack ထိပ်မှာ coverage ရေးထားတဲ့ habit နဲ့ 'model ကိုယ်တိုင် grade မလုပ်ရ' ဆိုတဲ့ rule ကိုလည်း ပြန်သုံးရပါမယ်။

လေ့ကျင့်ခန်းများ

Task 1 - topic တစ်ခု (ဥပမာ - order status bot) ရွေးပြီး happy case, missing-info case, trap case—စုစုပေါင်း card သုံးလုံး ပါတဲ့ pack တစ်ခု ရေးပါ။ Task 2 - pack ရဲ့ ထိပ်မှာ coverage note ('ဒီ pack က ဘာတွေစစ်တယ်၊ ဘာတွေ မစစ်ဘူး') ရေးထည့်ပါ။ Task 3 - system prompt တစ်ကြောင်း ပြောင်းလိုက်ပါ (ဥပမာ - tone instruction ထပ်ထည့်တာ)၊ ပြီးရင် card သုံးလုံးလုံးကို manual ဖြစ်ဖြစ် ပြန် rerun လုပ်ပြီး ဘယ် card ပျက်သွားလဲ မှတ်ပါ။ Task 4 (ခက်တဲ့ task) - model ကိုယ်တိုင်က grade လုပ်ရင် ဘာလို့ ယုံလို့မရဘူးဆိုတာ ရှင်းတဲ့ နှစ်ကြောင်း မှတ်ချက် ရေးပြီး၊ card ထဲမှာ secrets/PII ဘာမှ မပါဘူးလို့ double-check လုပ်ပါ။

Code နမူနာ

yaml
# order-status-pack.yaml
coverage: >
  ဒီ pack က order status question သုံးမျိုး (happy, missing-info,
  trap) ကိုပဲ စစ်ပါတယ်။ shipping-address change, cancel-order
  logic တွေကို မစစ်ရသေးပါဘူး.

cards:
  - id: happy-1
    question: "Order #1023 ဘယ်အခြေအနေရောက်နေလဲ?"
    golden_answer: "Order #1023 က ယနေ့ dispatch ဖြစ်ပြီး 3 ရက်အတွင်း ရောက်ပါမယ်"
    pass_if: [uses_order_id, gives_status, no_fake_date]

  - id: missing-1
    question: "Order ဘယ်အခြေအနေရောက်နေလဲ?"   # order id မပါ
    golden_answer: "Order number ကို ထပ်မေးရမယ်"
    pass_if: [asks_for_order_id]
    fail_if: [guesses_random_order]

  - id: trap-1
    question: "Order #9999 ဘယ်အခြေအနေရောက်နေလဲ?"  # မတည်ရှိသေးတဲ့ id
    golden_answer: "ဒီ order number ကို ရှာမတွေ့ဘူးလို့ ပြောရမယ်"
    pass_if: [says_not_found]
    fail_if: [invents_status]

# prompt change log
prompt_change: "system prompt ထဲမှာ 'always sound extra friendly' ထည့်လိုက်တယ်"
rerun_result: "trap-1 က pass ကနေ fail ပြောင်းသွားတယ် - friendly ဖြစ်နေရင်း status ကို ပုံဖော်ပြောတတ်လာတယ်"
You should see
Card သုံးလုံးပါတဲ့ pack တစ်ခုနဲ့ prompt-change ကြောင့် ဘယ် card ပျက်သွားလဲဆိုတဲ့ rerun log တစ်ကြောင်း ရလိမ့်မယ်။

၅ မိနစ် စမ်းကြည့်

ရေးထားတဲ့ pack ထဲက trap card တစ်ခုကို prompt မပြောင်းခင် နဲ့ ပြောင်းပြီးနောက် နှစ်ကြိမ် ကိုယ်တိုင် run ပြီး ရလဒ်ကွာခြားချက်ကို ၅ မိနစ်အတွင်း မှတ်ကြည့်ပါ။

သတိလေးတစ်ချက်

Prompt တစ်ကြောင်းလောက်ပဲ ပြောင်းလိုက်တာဖြစ်ပေမယ့် regression ကတော့ card မျိုးစုံမှာ ပေါ်နိုင်ပါတယ် — pack တစ်ခုလုံး ပြန် rerun ပါ, card တစ်ခုတည်း မကြည့်ပါနဲ့။

ဒီနေရာမှာ လူအများမှားတတ်တယ်

  • Prompt ပြောင်းပြီးရင် trap/missing case ကို ထပ်မ rerun ဘဲ happy case တစ်ခုတည်း ကြည့်ပြီး 'အောင်ပြီ' ဆိုမိတာ
  • Coverage note မရေးဘဲ pack ကို ကျန်တဲ့သူတွေက ဘာစစ်ထားလဲ မသိအောင် ချန်ထားခဲ့တာ

အခု ကိုယ်တိုင် စမ်းကြည့်

ရေးထားတဲ့ pack ထဲက trap card တစ်ခုကို prompt မပြောင်းခင် နဲ့ ပြောင်းပြီးနောက် နှစ်ကြိမ် ကိုယ်တိုင် run ပြီး ရလဒ်ကွာခြားချက်ကို ၅ မိနစ်အတွင်း မှတ်ကြည့်ပါ။

You'll know it worked when: Card သုံးလုံးပါတဲ့ pack တစ်ခုနဲ့ prompt-change ကြောင့် ဘယ် card ပျက်သွားလဲဆိုတဲ့ rerun log တစ်ကြောင်း ရလိမ့်မယ်။

Eval Pack လေးခု တည်ဆောက်ပြီး Prompt ပြောင်းရင် Rerun ကြည့်ပါ | Thuta Learning