โลโก้ Ollama
อันดับ 59 ใน Top 100 AI, Machine Learning และ LLMMIT (โอเพนซอร์ส)

Ollama คืออะไร และวิธีรัน LLM บนเซิร์ฟเวอร์ของคุณเอง

Ollama คือเครื่องมือที่ทำให้การรันโมเดลภาษาขนาดใหญ่บนเซิร์ฟเวอร์ของตัวเองง่ายเหมือนติดตั้งแอปทั่วไป องค์กรจึงใช้ AI กับข้อมูลภายในได้โดยที่ข้อมูลไม่ต้องออกไปนอกองค์กร

หมวดหมู่
AI, Machine Learning และ LLM
ติดตั้งบนเซิร์ฟเวอร์เองได้
ได้
สเปกเริ่มต้นที่แนะนำ
8 vCPU · RAM 16 GB
ไลเซนส์
MIT (โอเพนซอร์ส)
เว็บทางการ
เปิดเว็บไซต์
สร้าง Cloud Server เดี๋ยวนี้
  • ISO/IEC 27001
  • ISO 22301
  • ISO 20000-1
  • CSA-STAR

Data Center ในไทย มาตรฐาน TIA-942 Tier 3+ ข้อมูลอยู่ในประเทศไทย

Ollama คืออะไร

ก่อนหน้านี้การรันโมเดลภาษาขนาดใหญ่ต้องตั้งค่าไลบรารีและจัดการไฟล์โมเดลเอง Ollama รวมทุกอย่างไว้ในคำสั่งเดียว ดาวน์โหลดโมเดล จัดการหน่วยความจำ และเปิด API ให้แอปเรียกใช้ได้ทันที

เหตุผลหลักที่องค์กรสนใจคือความเป็นส่วนตัวของข้อมูล เมื่อรันโมเดลบนเซิร์ฟเวอร์ของตัวเอง เอกสารสัญญา ข้อมูลลูกค้า หรือซอร์สโค้ดที่ส่งเข้าโมเดลจะไม่ออกไปนอกระบบ ซึ่งตอบข้อกำหนดที่ห้ามส่งข้อมูลลับออกนอกองค์กร

สิ่งที่กำหนดว่ารันได้เร็วแค่ไหนคือฮาร์ดแวร์ โมเดลขนาดเล็กรันบน CPU ได้แต่ตอบช้า ส่วนการใช้งานจริงในองค์กรควรใช้ GPU ที่มีหน่วยความจำมากพอกับขนาดโมเดลที่เลือก

แผนผังการวางระบบ Ollama บน Cloud Server หนึ่งเครื่องที่ Data Center ในประเทศไทย ผู้ใช้เข้าถึงผ่านไฟร์วอลล์ที่เปิดเฉพาะพอร์ต 11434 ตัว Ollama และข้อมูลอยู่บนเครื่องเดียวกัน เริ่มต้นที่ 8 vCPU แรม 16 GB และมีสำเนาสำรองเขียนออกไปเก็บอีกไซต์หนึ่ง
Ollama ทำงานบน Cloud Server เครื่องเดียวได้ครบ เปิดเฉพาะพอร์ตที่จำเป็น ข้อมูลและสำเนาสำรองอยู่ใน Data Center ในประเทศไทย

ความสามารถเด่นของ Ollama

ติดตั้งและรันในคำสั่งเดียว

ดาวน์โหลดและเริ่มใช้โมเดลได้ทันทีโดยไม่ต้องตั้งค่าไลบรารีเอง

มี API ให้แอปเรียกใช้

เปิด API รูปแบบมาตรฐานให้ระบบภายในเชื่อมต่อได้ทั้งเว็บและแอป

เลือกโมเดลได้หลายขนาด

ตั้งแต่โมเดลเล็กที่รันบน CPU ไปจนถึงโมเดลใหญ่ที่ต้องใช้ GPU

จัดการหน่วยความจำอัตโนมัติ

โหลดและปล่อยโมเดลตามการใช้งาน ทำให้รันหลายโมเดลบนเครื่องเดียวได้

ข้อมูลไม่ออกนอกเครื่อง

ทุกการประมวลผลเกิดบนเซิร์ฟเวอร์ของคุณ ไม่มีการส่งข้อมูลไปยังผู้ให้บริการภายนอก

ใช้ Ollama ทำอะไรได้บ้าง

  • ผู้ช่วย AI ภายในองค์กรที่ตอบคำถามจากเอกสารภายใน
  • สรุปเอกสารและอีเมลที่มีข้อมูลลับซึ่งส่งออกนอกองค์กรไม่ได้
  • ระบบ RAG ที่ค้นหาคำตอบจากคลังความรู้ของบริษัท
  • ช่วยทีมพัฒนาเขียนและทบทวนโค้ดโดยไม่ส่งซอร์สโค้ดออกนอกระบบ

สเปก Cloud Server ที่แนะนำ

แผนภาพเทียบสเปก Cloud Server สำหรับ Ollama 3 ระดับ เริ่มจาก 8 vCPU แรม 16 GB ดิสก์ NVMe 100 GB ไปจนถึง 16 vCPU ขึ้นไป แรม 64 GB ขึ้นไป ดิสก์ NVMe 500 GB ขึ้นไป โดยเทียบขนาดแยกตามแต่ละคอลัมน์
เริ่มจากระดับที่ตรงกับการใช้งานตอนนี้ แล้วเพิ่ม CPU และ RAM ทีหลังได้บนเครื่องเดิม
ระดับการใช้งานvCPURAMDisk
ทดลองใช้ (CPU)โมเดลขนาดเล็กราว 3 ถึง 8 พันล้านพารามิเตอร์ ตอบช้ากว่าแบบใช้ GPU มาก8 vCPU16 GBNVMe 100 GB
แนะนำ (GPU)GPU หน่วยความจำ 24 GB รองรับโมเดลระดับ 8 ถึง 14 พันล้านพารามิเตอร์ได้ลื่น8 vCPU32 GBNVMe 200 GB
ใช้งานจริงในองค์กรGPU หน่วยความจำ 48 GB ขึ้นไป สำหรับโมเดลใหญ่และผู้ใช้พร้อมกันหลายคน16 vCPU ขึ้นไป64 GB ขึ้นไปNVMe 500 GB ขึ้นไป

ดูราคาตามสเปกได้ที่ ราคา Cloud Compute หรือให้ทีมงานช่วยประเมินสเปกจากปริมาณผู้ใช้จริงของคุณ

วิธีติดตั้ง Ollama บน Cloud Server ของ THAI DATA CLOUD

ขั้นตอนด้านล่างใช้กับ Cloud Server ที่เพิ่งสร้างใหม่จากหน้าจัดการของ THAI DATA CLOUD ได้ทันที ถ้าไม่สะดวกทำเอง ทีมวิศวกรของเราติดตั้งและตั้งค่าให้ฟรีสำหรับลูกค้า Cloud Server

สิ่งที่ต้องเตรียม

  • Ubuntu Server 22.04 หรือ 24.04 LTS
  • GPU ที่รองรับพร้อมไดรเวอร์ที่ติดตั้งถูกต้อง (แนะนำอย่างยิ่งสำหรับการใช้งานจริง)
  • พื้นที่ดิสก์สำหรับไฟล์โมเดล ซึ่งมีขนาดหลายกิกะไบต์ต่อโมเดล
  • RAM มากพอสำหรับกรณีที่รันบน CPU

ทดสอบบน Ubuntu Server 24.04 LTS

  1. 1

    ติดตั้ง Ollama

    curl -fsSL https://ollama.com/install.sh | sh
    systemctl status ollama --no-pager
  2. 2

    ตรวจว่า GPU ถูกใช้งาน

    ถ้าเป็น GPU Server ให้ยืนยันว่าไดรเวอร์ทำงานและ Ollama มองเห็นการ์ด

    nvidia-smi
  3. 3

    ดาวน์โหลดและทดลองใช้โมเดล

    เลือกโมเดลให้พอดีกับหน่วยความจำของ GPU โมเดลที่ใหญ่เกินหน่วยความจำจะถูกย้ายไปรันบน CPU และช้าลงมาก

    ollama pull llama3.1:8b
    ollama run llama3.1:8b "สรุปหน้าที่ของฝ่ายไอทีใน 3 ข้อ"
  4. 4

    เปิด API ให้ระบบภายในเรียกใช้

    ค่าเริ่มต้นฟังเฉพาะในเครื่อง ถ้าต้องการให้แอปในวงเรียกใช้ ให้ผูกกับไอพีภายในและจำกัดด้วย Firewall

    sudo systemctl edit ollama
    # เพิ่มบรรทัดนี้
    [Service]
    Environment="OLLAMA_HOST=10.10.0.60:11434"
    
    sudo systemctl restart ollama
  5. 5

    ทดสอบเรียกผ่าน API

    curl http://10.10.0.60:11434/api/generate -d '{
      "model": "llama3.1:8b",
      "prompt": "แนะนำสเปกเซิร์ฟเวอร์สำหรับเว็บ WordPress",
      "stream": false
    }'
  6. 6

    ต่อกับหน้าจอแชท

    ติดตั้ง Open WebUI เพื่อให้พนักงานใช้งานผ่านหน้าเว็บที่คุ้นเคยแทนการเรียก API เอง

ห้ามเปิดพอร์ต 11434 สู่อินเทอร์เน็ตโดยไม่มีการยืนยันตัวตน เพราะเท่ากับเปิดให้ใครก็ได้ใช้ GPU ของคุณฟรีและอ่านโมเดลที่ติดตั้งไว้

พอร์ตที่ต้องเปิดบน Firewall

พอร์ตโปรโตคอลใช้ทำอะไร
11434TCPAPI ของ Ollama (เปิดเฉพาะวงภายในเท่านั้น)

สิ่งที่ควรทำต่อหลังติดตั้งเสร็จ

  • ไม่เปิด API สู่อินเทอร์เน็ต ให้เข้าถึงผ่าน Private Network หรือหลัง Reverse Proxy ที่มีการยืนยันตัวตน
  • จำกัดว่าแอปใดเรียกใช้ API ได้ด้วยกฎ Firewall
  • ตรวจสอบที่มาของโมเดลที่ดาวน์โหลดมาใช้
  • เก็บ Log การเรียกใช้เพื่อตรวจสอบปริมาณและการใช้งานที่ผิดปกติ
  • กำหนดนโยบายว่าข้อมูลประเภทใดส่งเข้าโมเดลได้ แม้จะรันในองค์กรก็ควรมีขอบเขตชัดเจน

ทำไมควรรัน Ollama บน Cloud Server ของ THAI DATA CLOUD

Data Center ในประเทศไทย มาตรฐาน ISO/IEC 27001 และ ISO 22301 พร้อมทีมวิศวกรคนไทยดูแลตลอด 24 ชั่วโมง

THAI DATA CLOUD มี GPU Server ในไทย ทำให้องค์กรใช้ AI กับข้อมูลภายในโดยข้อมูลไม่ออกนอกประเทศ

ค่าใช้จ่ายคงที่ต่อเดือนแทนการจ่ายตามจำนวนโทเคน ซึ่งคาดการณ์งบได้ง่ายกว่าเมื่อใช้งานหนัก

ผู้ใช้ในไทยได้เวลาตอบสนองที่ต่ำกว่าการเรียก API ไปยังผู้ให้บริการต่างประเทศ

เชื่อมกับระบบภายในอื่นในวง Private Network ได้ทันที เช่น คลังเอกสารหรือฐานข้อมูล

คำถามที่พบบ่อยเกี่ยวกับ Ollama

รัน LLM บน CPU ได้จริงไหม

ได้สำหรับโมเดลขนาดเล็กและการทดลอง แต่ความเร็วต่างจาก GPU มาก การใช้งานจริงที่มีผู้ใช้หลายคนควรใช้ GPU ที่มีหน่วยความจำพอกับขนาดโมเดล

ควรเลือกโมเดลขนาดเท่าไหร่

เลือกจากหน่วยความจำ GPU ที่มี โมเดลระดับ 8 พันล้านพารามิเตอร์เหมาะกับ GPU 24 GB และให้คุณภาพดีพอสำหรับงานสรุปและตอบคำถามภายใน ถ้าต้องการคุณภาพสูงขึ้นต้องเพิ่มหน่วยความจำตามขนาดโมเดล

ใช้แทนบริการ AI ภายนอกได้เลยไหม

ใช้แทนได้ในงานที่ความเป็นส่วนตัวสำคัญกว่าคุณภาพสูงสุด เช่น สรุปเอกสารภายในและค้นหาความรู้ในองค์กร แต่โมเดลระดับบริการเชิงพาณิชย์ยังให้คุณภาพสูงกว่าในงานที่ยากมาก หลายองค์กรจึงใช้ทั้งสองแบบตามระดับความลับของข้อมูล

ให้เราติดตั้ง Ollama ให้ฟรี บน Cloud Server ในไทย

แจ้งความต้องการสั้น ๆ ทีมวิศวกรจะช่วยประเมินสเปก ติดตั้ง และตั้งค่าความปลอดภัยให้พร้อมใช้งาน ปรึกษาฟรี ไม่มีข้อผูกมัด