စာသားအဓိပ္ပာယ်ကို number vector အဖြစ်ပြောင်းပြီး semantic similarity ရှာဖွေနိုင်ပုံ လေ့လာမည်။
ခဏလေး ဒီလိုပဲ စဉ်းစားကြည့်
Embedding က စာသား၊ ပုံ သို့မဟုတ် data တစ်ခုရဲ့ အဓိပ္ပာယ်ဆိုင်ရာလက္ခဏာကို number များပါတဲ့ vector အဖြစ် ကိုယ်စားပြုပါတယ်။ အဓိပ္ပာယ်နီးတဲ့အရာတွေက vector space ထဲမှာ နီးတတ်တာကြောင့် keyword တူမတူထက် အဓိပ္ပာယ်တူမတူရှာနိုင်ပါတယ်။

နေ့စဉ်ဘဝနဲ့ ချိတ်ကြည့်မယ်
“ကားပြင်ဆိုင်” နဲ့ “ယာဉ်ပြုပြင်ရေးဆိုင်” ဆိုတာ စကားလုံးမတူပေမယ့် embedding search က နီးစပ်ကြောင်း သိနိုင်ပါတယ်။ Search၊ clustering၊ recommendation နဲ့ duplicate detection တွေမှာ အသုံးဝင်ပါတယ်။
အတူတူ လက်တွေ့စမ်းမယ်
import OpenAI from "openai";
const client = new OpenAI();
const result = await client.embeddings.create({
model: "text-embedding-3-small",
input: "မြန်မာစာဖြင့် AI လေ့လာခြင်း",
});
console.log(result.data[0].embedding.length);စာသားတစ်ကြောင်းအတွက် embedding vector ရရှိမည်။၅ မိနစ် စမ်းကြည့်
စာကြောင်းသုံးကြောင်းကို embed လုပ်ပြီး ဘယ်နှစ်ကြောင်းအဓိပ္ပာယ်အနီးဆုံးဖြစ်မလဲ ကြိုခန့်မှန်းပါ။ ထို့နောက် similarity နဲ့စစ်ပါ။
သတိလေးတစ်ချက်
AI output ကို အပြီးသတ်အမှန်လို့မယူပါနှင့်။ အရေးကြီးတဲ့အချက်၊ code နဲ့ user data ကို လူကပြန်စစ်ပြီးမှ အသုံးပြုပါ။
OpenAI — Embeddings — OpenAI