ရိုးရိုးလေး ရှင်းပြမယ်
LLM app ကို output တစ်ခုပဲကြည့်၍စိတ်ချမရပါ။ Prompt, model နှင့် tool call တစ်ဆင့်ချင်းကို trace လုပ်ပြီး expected tool sequence, grounded answer နှင့် latency ကဲ့သို့အချက်များကို dataset ပေါ်တွင်စစ်ပါ။ Sensitive data ကို metadata ထဲမပို့ခင်ဖယ်ရှားပါ။
python
test_cases = [
{
"input": "ရန်ကုန်အတွက် မိုးလေဝသကိုရှာပါ",
"expected_tool": "get_weather",
"must_include": "ရန်ကုန်",
}
]
for case in test_cases:
result = agent.invoke({
"messages": [{"role": "user", "content": case["input"]}]
})
assert result["messages"], "Agent returned no messages"
print("Evaluation case completed")You should see
Evaluation case completedလက်တွေ့စမ်းကြည့်ရန်
မိမိ agent အတွက် normal, ambiguous နှင့် unsafe inputs ပါသော evaluation cases အနည်းဆုံး 10 ခုရေးပါ။
LangSmith Observability — LangChain