Thuta Learning
Local AI / Local LLM
IntermediateAIbeginner

Ollama နဲ့ Model များကို Run ခြင်း

ဒီခန်းပြီးရင် ဘာတတ်သွားမလဲ

  • Ollama နဲ့ Model များကို Run ခြင်း concept ကို နားလည်ရှင်းပြနိုင်ရန်
  • Diagram ကို ဖတ်ပြီး architecture ထဲမှာ data/request ဘယ်လိုစီးဆင်းသလဲ ခြေရာခံနိုင်ရန်
  • ကိုယ့် hardware/use case အတွက် ဘယ်လို ရွေးချယ်သင့်သလဲ ဆုံးဖြတ်နိုင်ရန်

နားလည်ထားရမယ့် အချက်

Ollama လိုမျိုး tool မတိုင်ခင်က local language model run ဖို့ဆိုရင် model file မှန်ကန်တာကို ရှာပြီး runtime နဲ့ ကိုက်ညီအောင် လုပ်ရတယ်၊ format ပြောင်းရတယ်၊ reply တစ်ခုတည်းရဖို့တောင် setting တွေကို လက်နဲ့ tune ရတယ်။ Ollama ကတော့ ဒီ process တစ်ခုလုံးကို command တစ်ခုထဲ ချုံ့ပေးလိုက်ပါတယ်။ Ollama ဆိုတာ command-line tool တစ်ခုနဲ့ background service တစ်ခုဖြစ်ပြီး model runtime, model downloader, local HTTP API သုံးခုကို install တစ်ခုထဲမှာ ထုပ်ပိုးပေးထားပါတယ်။

core idea ကတော့ default setting ကောင်းတွေနဲ့ အဆင်ပြေအောင် ပြုလုပ်ပေးထားတာပါ — quantization level, context length, prompt format တွေကို လက်နဲ့ ရွေးစရာမလိုဘဲ Ollama ရဲ့ library ထဲက model တစ်ခုစီအတွက် ‘Modelfile’ recipe က setting သင့်တင့်တာတွေကို ကိုယ်တိုင် ထည့်ပေးထားလို့ beginner နဲ့ expert နှစ်ဦးစလုံး model တူတူကို run ပြီး ပထမဆုံးအကြိမ်မှာပဲ သုံးလို့ရတဲ့ result ရရှိနိုင်ပါတယ်။

ollama pull

model weight တွေနဲ့ Modelfile ကို Ollama library ကနေ သင့်စက်ထဲ download ဆွဲပြီး local မှာ သိမ်းထားပေးလို့ နောက်ထပ် run တိုင်း ပြန် download စရာမလိုတော့ပါဘူး။

ollama run

terminal ထဲမှာ model နဲ့ interactive chat session တစ်ခု တိုက်ရိုက်စတင်ပေးပါတယ်၊ model မရှိသေးရင်တောင် အလိုအလျောက် pull လုပ်ပေးပါတယ်။

ollama list

လက်ရှိ local မှာ သိမ်းထားတဲ့ model အားလုံးကို size နဲ့အတူ ပြပေးလို့ disk space ဘယ်လောက်စားနေလဲ မြင်နိုင်ပါတယ်။

ollama rm

space ပြန်လွတ်ဖို့ model ကို ဖျက်ပေးပါတယ်။

CLI နဲ့ အတူတူ အရေးကြီးတာက နောက်ကွယ်မှာ တိတ်တဆိတ် run နေတာပါ — Ollama run နေတိုင်း local HTTP API တစ်ခုကို default အနေနဲ့ http://localhost:11434 မှာ ဖွင့်ထားပေးလို့ သင့်စက်ပေါ်က software တခြားတွေက တိုက်ရိုက် ခေါ်သုံးနိုင်ပါတယ်၊ ဒါကြောင့် Ollama ဟာ “chat app” တစ်ခုတည်းမဟုတ်ဘဲ software တခြားတွေ တည်ဆောက်နိုင်တဲ့ “local AI platform” တစ်ခု ဖြစ်လာတာပါ။

text
OLLAMA PULL TO CHAT LOOP
------------------------
------------------------------------------------------------
  $ ollama pull llama3.2
        |
        v
  LOCAL MODEL STORE  (weights + Modelfile saved on disk)
        |
        |  $ ollama run llama3.2
        v
  CHAT LOOP
    you type a prompt  ------------------>  model generates reply
        ^                                          |
        |                                          |
        +------------------- prints back <---------+

  meanwhile, in the background:
  Ollama service listening on http://localhost:11434
    (other programs can call this API at any time)

လက်တွေ့ scenario နဲ့ ချိတ်ကြည့်မယ်

private coding assistant တစ်ခုကို laptop ပေါ်မှာ setup ပြီးရင် internet မလိုအောင် လိုချင်တယ်ဆိုပါစို့။

Ollama ကို install လုပ်ခြင်း

ollama.com ကနေ သင့် OS အတွက် Ollama ကို install လုပ်ပါ၊ install ပြီးရင် background service အလိုအလျောက် စပါတယ်။

Model ကို pull လုပ်ခြင်း

terminal ဖွင့်ပြီး `ollama pull llama3.2` ကို run ပါ၊ ဒါက model ရဲ့ weight တွေနဲ့ Modelfile ကို Ollama ရဲ့ local storage ထဲ download ဆွဲပါတယ်; model ကြီးရင် ချိန်ပိုကြာပြီး disk space ပိုသုံးရုံပါပဲ၊ command ကတော့ size ဘယ်လောက်ပဲဖြစ်ဖြစ် အတူတူပါပဲ။

Model ကို run လုပ်ခြင်း

pull ပြီးသွားရင် `ollama run llama3.2` ကို run လိုက်ရင် setup ထပ်လုပ်စရာမလိုဘဲ terminal ထဲမှာ interactive chat prompt တစ်ခု တိုက်ရိုက် ရောက်သွားပြီး မေးခွန်းရေးပြီး reply ရနိုင်ပါပြီ။

Downloaded model တွေကို list ကြည့်ခြင်းနှင့် ဖျက်ခြင်း

model အမျိုးမျိုးကို compare လုပ်ကြည့်ထားလို့ အခုထိ download ချထားတာတွေကို ကြည့်ချင်ရင် `ollama list` ကို run ပါ၊ model name, disk size, နောက်ဆုံး modify လုပ်ခဲ့တဲ့ ရက်စွဲကို print ထုတ်ပါတယ်။ model တစ်ခုက disk space ယူထိုက်တော့မယ် မဟုတ်လို့ ဆုံးဖြတ်ရင် `ollama rm llama3.2` က clean ဖျက်ပေးပြီး နောက်မှ `ollama pull` ပြန်လုပ်ရင် ပြန် fetch ရနိုင်ပါတယ်။

ဒီအကုန်လုံး ဖြစ်နေချိန်တစ်လျှောက် Ollama ရဲ့ localhost:11434 API က တိတ်တဆိတ် အသင့်ရှိနေပြီး နောက်သင်ခန်းစာတွေက ဒီအပေါ်မှာ တိုက်ရိုက် တည်ဆောက်ကြမှာပါ။

အတူတူ စမ်းရေးကြည့်မယ်

bash
# Download a model's weights and Modelfile into local storage
ollama pull llama3.2

# Start an interactive chat session with that model
ollama run llama3.2

# List every model currently stored locally, with size and date
ollama list

# Remove a stored model and free its disk space
ollama rm llama3.2
You should see
`ollama pull llama3.2` က model ရဲ့ weight တွေနဲ့ Modelfile ကို Ollama ရဲ့ local storage ထဲ download ဆွဲပါတယ်; ကိုယ်တိုင် chat session စမလုပ်ပါဘူး။ `ollama run llama3.2` ကတော့ terminal ထဲမှာ model နဲ့ interactive chat တစ်ခု စပေးပါတယ်၊ model local မှာ မရှိသေးရင် အလိုအလျောက် pull လုပ်ပေးပါတယ်။ `ollama list` က local မှာ သိမ်းထားတဲ့ model အားလုံးရဲ့ name, disk size, နောက်ဆုံးပြင်ဆင်ချိန်ကို table အနေနဲ့ print ထုတ်ပါတယ်။ `ollama rm llama3.2` က သိမ်းထားတဲ့ model ကို ဖျက်ပြီး disk space ပြန်လွတ်စေပါတယ်; နောက်မှာ `ollama pull llama3.2` ပြန်လုပ်ရင် အစကနေ ပြန် download လုပ်ပေးပါလိမ့်မယ်။

၅ မိနစ် စမ်းကြည့်

model ဒုတိယခု (ဥပမာ `phi3` သို့မဟုတ် `qwen2.5:0.5b` လို ပိုသေးတဲ့ model) ကို `ollama pull` နဲ့ download ဆွဲပါ၊ ပြီးရင် `ollama list` ကို run ပြီး model နှစ်ခုရဲ့ disk size ကို compare ကြည့်ပါ။ ပိုသေးတဲ့ model ကို `ollama run` နဲ့ ဖွင့်ပြီး model ပထမဆုံးကို မေးခဲ့တဲ့ မေးခွန်းအတူတူကို မေးကြည့်ပါ၊ reply quality (သို့) speed ကွာခြားချက် ရှိမရှိ မှတ်ထားပါ။ နောက်ဆုံး ဆက်မသုံးတော့မယ့် model ကို `ollama rm` နဲ့ ဖျက်ပါ။

သတိလေးတစ်ချက်

`ollama run` chat run နေရင် local API အလုပ်မလုပ်တော့ဘူးလို့ ထင်ခြင်း — Ollama run နေသရွေ့ chat session ရှိမရှိမဆို API က အမြဲ ရနိုင်ပါတယ်။

`ollama rm` က disk space ပဲ ပြန်လွှတ်ပေးတာဖြစ်ပြီး Ollama service ကိုယ်တိုင်ကို ရပ် (သို့) uninstall မလုပ်ဘူးဆိုတာ မေ့နေခြင်း။

Ollama README (CLI reference)Local AI / Local LLM

ဒီနေရာမှာ လူအများမှားတတ်တယ်

  • `ollama run` chat run နေရင် local API အလုပ်မလုပ်တော့ဘူးလို့ ထင်ခြင်း — Ollama run နေသရွေ့ chat session ရှိမရှိမဆို API က အမြဲ ရနိုင်ပါတယ်။
  • `ollama rm` က disk space ပဲ ပြန်လွှတ်ပေးတာဖြစ်ပြီး Ollama service ကိုယ်တိုင်ကို ရပ် (သို့) uninstall မလုပ်ဘူးဆိုတာ မေ့နေခြင်း။
  • Model (သို့) tool အသစ်တစ်ခုကို production/daily-use workflow ထဲ တိုက်ရိုက်မထည့်ခင် သေးငယ်တဲ့ scale နဲ့ အရင်စမ်းကြည့်ပါ။

လေ့ကျင့်ခန်း

model ဒုတိယခု (ဥပမာ `phi3` သို့မဟုတ် `qwen2.5:0.5b` လို ပိုသေးတဲ့ model) ကို `ollama pull` နဲ့ download ဆွဲပါ၊ ပြီးရင် `ollama list` ကို run ပြီး model နှစ်ခုရဲ့ disk size ကို compare ကြည့်ပါ။ ပိုသေးတဲ့ model ကို `ollama run` နဲ့ ဖွင့်ပြီး model ပထမဆုံးကို မေးခဲ့တဲ့ မေးခွန်းအတူတူကို မေးကြည့်ပါ၊ reply quality (သို့) speed ကွာခြားချက် ရှိမရှိ မှတ်ထားပါ။ နောက်ဆုံး ဆက်မသုံးတော့မယ့် model ကို `ollama rm` နဲ့ ဖျက်ပါ။

You'll know it worked when: `ollama pull llama3.2` က model ရဲ့ weight တွေနဲ့ Modelfile ကို Ollama ရဲ့ local storage ထဲ download ဆွဲပါတယ်; ကိုယ်တိုင် chat session စမလုပ်ပါဘူး။ `ollama run llama3.2` ကတော့ terminal ထဲမှာ model နဲ့ interactive chat တစ်ခု စပေးပါတယ်၊ model local မှာ မရှိသေးရင် အလိုအလျောက် pull လုပ်ပေးပါတယ်။ `ollama list` က local မှာ သိမ်းထားတဲ့ model အားလုံးရဲ့ name, disk size, နောက်ဆုံးပြင်ဆင်ချိန်ကို table အနေနဲ့ print ထုတ်ပါတယ်။ `ollama rm llama3.2` က သိမ်းထားတဲ့ model ကို ဖျက်ပြီး disk space ပြန်လွတ်စေပါတယ်; နောက်မှာ `ollama pull llama3.2` ပြန်လုပ်ရင် အစကနေ ပြန် download လုပ်ပေးပါလိမ့်မယ်။

Ollama နဲ့ Model များကို Run ခြင်း | Thuta Learning