# RAG Pipeline Checklist

## 1. Chunking

- [ ] Chunk size ကို document အမျိုးအစားနဲ့ ကိုက်ညီအောင် ရွေးထားခြင်း (ဥပမာ 300-800 token)
- [ ] Chunk များကြား overlap (အနည်းငယ် ထပ်နေခြင်း) ထားပြီး context ပြတ်တောက်မှု လျော့ချထားခြင်း
- [ ] Table/code block ကို အလယ်ကနေ မဖြတ်ထားခြင်း

## 2. Embedding

- [ ] Embedding model ကို document ဘာသာစကားနှင့် ကိုက်ညီအောင် ရွေးထားခြင်း
- [ ] Document အသစ်ထပ်ထည့်တိုင်း embedding pipeline ကို ပြန် run နိုင်အောင် automate ထားခြင်း

## 3. Retrieval

- [ ] Top-k (chunk ဘယ်နှစ်ခု ယူမလဲ) ကို စမ်းသပ်ပြီး ချိန်ညှိထားခြင်း
- [ ] Retrieval quality ကို sample query များနှင့် manual စစ်ဆေးထားခြင်း

## 4. Generation & Citation

- [ ] Model ကို "context ထဲ မပါရင် 'မသိပါ' ဟု ဖြေရန်" instruction ထည့်ထားခြင်း
- [ ] Answer ထဲ source document ကို citation အနေနဲ့ ညွှန်းနိုင်ခြင်း

## 5. Testing

- [ ] Context ထဲ ပါတဲ့ မေးခွန်း (happy case) နှင့် context ထဲ မပါတဲ့ မေးခွန်း (trap case) နှစ်မျိုးနဲ့ စမ်းထားခြင်း
- [ ] Hallucination rate ကို eval card အစုအဝေးတစ်ခုနှင့် periodically စစ်ဆေးထားခြင်း

Pipeline တစ်ခုလုံး run ခင် checklist ၅ ခုစလုံး ✓ ဖြစ်အောင် လုပ်ပါ။
