Ollama คืออะไร และวิธีรัน LLM บนเซิร์ฟเวอร์ของคุณเอง
Ollama คือเครื่องมือที่ทำให้การรันโมเดลภาษาขนาดใหญ่บนเซิร์ฟเวอร์ของตัวเองง่ายเหมือนติดตั้งแอปทั่วไป องค์กรจึงใช้ AI กับข้อมูลภายในได้โดยที่ข้อมูลไม่ต้องออกไปนอกองค์กร
- หมวดหมู่
- AI, Machine Learning และ LLM
- ติดตั้งบนเซิร์ฟเวอร์เองได้
- ได้
- สเปกเริ่มต้นที่แนะนำ
- 8 vCPU · RAM 16 GB
- ไลเซนส์
- MIT (โอเพนซอร์ส)
- เว็บทางการ
- เปิดเว็บไซต์
- ISO/IEC 27001
- ISO 22301
- ISO 20000-1
- CSA-STAR
Data Center ในไทย มาตรฐาน TIA-942 Tier 3+ ข้อมูลอยู่ในประเทศไทย
Ollama คืออะไร
ก่อนหน้านี้การรันโมเดลภาษาขนาดใหญ่ต้องตั้งค่าไลบรารีและจัดการไฟล์โมเดลเอง Ollama รวมทุกอย่างไว้ในคำสั่งเดียว ดาวน์โหลดโมเดล จัดการหน่วยความจำ และเปิด API ให้แอปเรียกใช้ได้ทันที
เหตุผลหลักที่องค์กรสนใจคือความเป็นส่วนตัวของข้อมูล เมื่อรันโมเดลบนเซิร์ฟเวอร์ของตัวเอง เอกสารสัญญา ข้อมูลลูกค้า หรือซอร์สโค้ดที่ส่งเข้าโมเดลจะไม่ออกไปนอกระบบ ซึ่งตอบข้อกำหนดที่ห้ามส่งข้อมูลลับออกนอกองค์กร
สิ่งที่กำหนดว่ารันได้เร็วแค่ไหนคือฮาร์ดแวร์ โมเดลขนาดเล็กรันบน CPU ได้แต่ตอบช้า ส่วนการใช้งานจริงในองค์กรควรใช้ GPU ที่มีหน่วยความจำมากพอกับขนาดโมเดลที่เลือก
ความสามารถเด่นของ Ollama
ติดตั้งและรันในคำสั่งเดียว
ดาวน์โหลดและเริ่มใช้โมเดลได้ทันทีโดยไม่ต้องตั้งค่าไลบรารีเอง
มี API ให้แอปเรียกใช้
เปิด API รูปแบบมาตรฐานให้ระบบภายในเชื่อมต่อได้ทั้งเว็บและแอป
เลือกโมเดลได้หลายขนาด
ตั้งแต่โมเดลเล็กที่รันบน CPU ไปจนถึงโมเดลใหญ่ที่ต้องใช้ GPU
จัดการหน่วยความจำอัตโนมัติ
โหลดและปล่อยโมเดลตามการใช้งาน ทำให้รันหลายโมเดลบนเครื่องเดียวได้
ข้อมูลไม่ออกนอกเครื่อง
ทุกการประมวลผลเกิดบนเซิร์ฟเวอร์ของคุณ ไม่มีการส่งข้อมูลไปยังผู้ให้บริการภายนอก
ใช้ Ollama ทำอะไรได้บ้าง
- ผู้ช่วย AI ภายในองค์กรที่ตอบคำถามจากเอกสารภายใน
- สรุปเอกสารและอีเมลที่มีข้อมูลลับซึ่งส่งออกนอกองค์กรไม่ได้
- ระบบ RAG ที่ค้นหาคำตอบจากคลังความรู้ของบริษัท
- ช่วยทีมพัฒนาเขียนและทบทวนโค้ดโดยไม่ส่งซอร์สโค้ดออกนอกระบบ
สเปก Cloud Server ที่แนะนำ
| ระดับการใช้งาน | vCPU | RAM | Disk |
|---|---|---|---|
| ทดลองใช้ (CPU)โมเดลขนาดเล็กราว 3 ถึง 8 พันล้านพารามิเตอร์ ตอบช้ากว่าแบบใช้ GPU มาก | 8 vCPU | 16 GB | NVMe 100 GB |
| แนะนำ (GPU)GPU หน่วยความจำ 24 GB รองรับโมเดลระดับ 8 ถึง 14 พันล้านพารามิเตอร์ได้ลื่น | 8 vCPU | 32 GB | NVMe 200 GB |
| ใช้งานจริงในองค์กรGPU หน่วยความจำ 48 GB ขึ้นไป สำหรับโมเดลใหญ่และผู้ใช้พร้อมกันหลายคน | 16 vCPU ขึ้นไป | 64 GB ขึ้นไป | NVMe 500 GB ขึ้นไป |
ดูราคาตามสเปกได้ที่ ราคา Cloud Compute หรือให้ทีมงานช่วยประเมินสเปกจากปริมาณผู้ใช้จริงของคุณ
วิธีติดตั้ง Ollama บน Cloud Server ของ THAI DATA CLOUD
ขั้นตอนด้านล่างใช้กับ Cloud Server ที่เพิ่งสร้างใหม่จากหน้าจัดการของ THAI DATA CLOUD ได้ทันที ถ้าไม่สะดวกทำเอง ทีมวิศวกรของเราติดตั้งและตั้งค่าให้ฟรีสำหรับลูกค้า Cloud Server
สิ่งที่ต้องเตรียม
- Ubuntu Server 22.04 หรือ 24.04 LTS
- GPU ที่รองรับพร้อมไดรเวอร์ที่ติดตั้งถูกต้อง (แนะนำอย่างยิ่งสำหรับการใช้งานจริง)
- พื้นที่ดิสก์สำหรับไฟล์โมเดล ซึ่งมีขนาดหลายกิกะไบต์ต่อโมเดล
- RAM มากพอสำหรับกรณีที่รันบน CPU
ทดสอบบน Ubuntu Server 24.04 LTS
- 1
ติดตั้ง Ollama
curl -fsSL https://ollama.com/install.sh | sh systemctl status ollama --no-pager - 2
ตรวจว่า GPU ถูกใช้งาน
ถ้าเป็น GPU Server ให้ยืนยันว่าไดรเวอร์ทำงานและ Ollama มองเห็นการ์ด
nvidia-smi - 3
ดาวน์โหลดและทดลองใช้โมเดล
เลือกโมเดลให้พอดีกับหน่วยความจำของ GPU โมเดลที่ใหญ่เกินหน่วยความจำจะถูกย้ายไปรันบน CPU และช้าลงมาก
ollama pull llama3.1:8b ollama run llama3.1:8b "สรุปหน้าที่ของฝ่ายไอทีใน 3 ข้อ" - 4
เปิด API ให้ระบบภายในเรียกใช้
ค่าเริ่มต้นฟังเฉพาะในเครื่อง ถ้าต้องการให้แอปในวงเรียกใช้ ให้ผูกกับไอพีภายในและจำกัดด้วย Firewall
sudo systemctl edit ollama # เพิ่มบรรทัดนี้ [Service] Environment="OLLAMA_HOST=10.10.0.60:11434" sudo systemctl restart ollama - 5
ทดสอบเรียกผ่าน API
curl http://10.10.0.60:11434/api/generate -d '{ "model": "llama3.1:8b", "prompt": "แนะนำสเปกเซิร์ฟเวอร์สำหรับเว็บ WordPress", "stream": false }' - 6
ต่อกับหน้าจอแชท
ติดตั้ง Open WebUI เพื่อให้พนักงานใช้งานผ่านหน้าเว็บที่คุ้นเคยแทนการเรียก API เอง
ห้ามเปิดพอร์ต 11434 สู่อินเทอร์เน็ตโดยไม่มีการยืนยันตัวตน เพราะเท่ากับเปิดให้ใครก็ได้ใช้ GPU ของคุณฟรีและอ่านโมเดลที่ติดตั้งไว้
พอร์ตที่ต้องเปิดบน Firewall
| พอร์ต | โปรโตคอล | ใช้ทำอะไร |
|---|---|---|
| 11434 | TCP | API ของ Ollama (เปิดเฉพาะวงภายในเท่านั้น) |
สิ่งที่ควรทำต่อหลังติดตั้งเสร็จ
- ไม่เปิด API สู่อินเทอร์เน็ต ให้เข้าถึงผ่าน Private Network หรือหลัง Reverse Proxy ที่มีการยืนยันตัวตน
- จำกัดว่าแอปใดเรียกใช้ API ได้ด้วยกฎ Firewall
- ตรวจสอบที่มาของโมเดลที่ดาวน์โหลดมาใช้
- เก็บ Log การเรียกใช้เพื่อตรวจสอบปริมาณและการใช้งานที่ผิดปกติ
- กำหนดนโยบายว่าข้อมูลประเภทใดส่งเข้าโมเดลได้ แม้จะรันในองค์กรก็ควรมีขอบเขตชัดเจน
ทำไมควรรัน Ollama บน Cloud Server ของ THAI DATA CLOUD
Data Center ในประเทศไทย มาตรฐาน ISO/IEC 27001 และ ISO 22301 พร้อมทีมวิศวกรคนไทยดูแลตลอด 24 ชั่วโมง
THAI DATA CLOUD มี GPU Server ในไทย ทำให้องค์กรใช้ AI กับข้อมูลภายในโดยข้อมูลไม่ออกนอกประเทศ
ค่าใช้จ่ายคงที่ต่อเดือนแทนการจ่ายตามจำนวนโทเคน ซึ่งคาดการณ์งบได้ง่ายกว่าเมื่อใช้งานหนัก
ผู้ใช้ในไทยได้เวลาตอบสนองที่ต่ำกว่าการเรียก API ไปยังผู้ให้บริการต่างประเทศ
เชื่อมกับระบบภายในอื่นในวง Private Network ได้ทันที เช่น คลังเอกสารหรือฐานข้อมูล
คำถามที่พบบ่อยเกี่ยวกับ Ollama
รัน LLM บน CPU ได้จริงไหม
ได้สำหรับโมเดลขนาดเล็กและการทดลอง แต่ความเร็วต่างจาก GPU มาก การใช้งานจริงที่มีผู้ใช้หลายคนควรใช้ GPU ที่มีหน่วยความจำพอกับขนาดโมเดล
ควรเลือกโมเดลขนาดเท่าไหร่
เลือกจากหน่วยความจำ GPU ที่มี โมเดลระดับ 8 พันล้านพารามิเตอร์เหมาะกับ GPU 24 GB และให้คุณภาพดีพอสำหรับงานสรุปและตอบคำถามภายใน ถ้าต้องการคุณภาพสูงขึ้นต้องเพิ่มหน่วยความจำตามขนาดโมเดล
ใช้แทนบริการ AI ภายนอกได้เลยไหม
ใช้แทนได้ในงานที่ความเป็นส่วนตัวสำคัญกว่าคุณภาพสูงสุด เช่น สรุปเอกสารภายในและค้นหาความรู้ในองค์กร แต่โมเดลระดับบริการเชิงพาณิชย์ยังให้คุณภาพสูงกว่าในงานที่ยากมาก หลายองค์กรจึงใช้ทั้งสองแบบตามระดับความลับของข้อมูล
ทางเลือกอื่นที่คล้ายกับ Ollama
แอปอื่นในหมวด AI, Machine Learning และ LLM
บริการของ THAI DATA CLOUD ที่เกี่ยวข้อง
ให้เราติดตั้ง Ollama ให้ฟรี บน Cloud Server ในไทย
แจ้งความต้องการสั้น ๆ ทีมวิศวกรจะช่วยประเมินสเปก ติดตั้ง และตั้งค่าความปลอดภัยให้พร้อมใช้งาน ปรึกษาฟรี ไม่มีข้อผูกมัด