Thuta Learning
ရှာဖွေရန်
AdvancedAIbeginner

Embeddings Explained

စိတ်လျှော့ပါ။ ဒီခန်းကို စာအုပ်လိုမဟုတ်ဘဲ စကားပြောသလိုပဲ၊ နားလည်လွယ်အောင် ရှင်းပါမယ်။

ဒီခန်းပြီးရင် ဘာတတ်သွားမလဲ

  • Embeddings Explained ကို ကြောက်စရာမလိုအောင် နားလည်မယ်
  • ကိုယ်တိုင် စမ်းသုံးတတ်အောင် လုပ်မယ်
  • မှားလွယ်တဲ့နေရာကို ပြုံးပြီး ရှောင်တတ်မယ်

စာသားအဓိပ္ပာယ်ကို number vector အဖြစ်ပြောင်းပြီး semantic similarity ရှာဖွေနိုင်ပုံ လေ့လာမည်။

ခဏလေး ဒီလိုပဲ စဉ်းစားကြည့်

Embedding က စာသား၊ ပုံ သို့မဟုတ် data တစ်ခုရဲ့ အဓိပ္ပာယ်ဆိုင်ရာလက္ခဏာကို number များပါတဲ့ vector အဖြစ် ကိုယ်စားပြုပါတယ်။ အဓိပ္ပာယ်နီးတဲ့အရာတွေက vector space ထဲမှာ နီးတတ်တာကြောင့် keyword တူမတူထက် အဓိပ္ပာယ်တူမတူရှာနိုင်ပါတယ်။

Embeddings Explained lesson illustration
RAG and Vector Search — Embeddings Explained

နေ့စဉ်ဘဝနဲ့ ချိတ်ကြည့်မယ်

“ကားပြင်ဆိုင်” နဲ့ “ယာဉ်ပြုပြင်ရေးဆိုင်” ဆိုတာ စကားလုံးမတူပေမယ့် embedding search က နီးစပ်ကြောင်း သိနိုင်ပါတယ်။ Search၊ clustering၊ recommendation နဲ့ duplicate detection တွေမှာ အသုံးဝင်ပါတယ်။

အတူတူ လက်တွေ့စမ်းမယ်

javascript
import OpenAI from "openai";
const client = new OpenAI();

const result = await client.embeddings.create({
  model: "text-embedding-3-small",
  input: "မြန်မာစာဖြင့် AI လေ့လာခြင်း",
});

console.log(result.data[0].embedding.length);
You should see
စာသားတစ်ကြောင်းအတွက် embedding vector ရရှိမည်။

၅ မိနစ် စမ်းကြည့်

စာကြောင်းသုံးကြောင်းကို embed လုပ်ပြီး ဘယ်နှစ်ကြောင်းအဓိပ္ပာယ်အနီးဆုံးဖြစ်မလဲ ကြိုခန့်မှန်းပါ။ ထို့နောက် similarity နဲ့စစ်ပါ။

သတိလေးတစ်ချက်

AI output ကို အပြီးသတ်အမှန်လို့မယူပါနှင့်။ အရေးကြီးတဲ့အချက်၊ code နဲ့ user data ကို လူကပြန်စစ်ပြီးမှ အသုံးပြုပါ။

OpenAI — EmbeddingsOpenAI

ဒီနေရာမှာ လူအများမှားတတ်တယ်

  • မတူတဲ့ embedding model များမှ vector ကို ရောနှိုင်းခြင်း
  • Vector နီးတာကို fact မှန်တယ်လို့ယူဆခြင်း

လေ့ကျင့်ခန်း

စာကြောင်းသုံးကြောင်းကို embed လုပ်ပြီး ဘယ်နှစ်ကြောင်းအဓိပ္ပာယ်အနီးဆုံးဖြစ်မလဲ ကြိုခန့်မှန်းပါ။ ထို့နောက် similarity နဲ့စစ်ပါ။

You'll know it worked when: စာသားတစ်ကြောင်းအတွက် embedding vector ရရှိမည်။