โลโก้ vLLM
AI, Machine Learning และ LLMApache License 2.0 (โอเพนซอร์ส)

vLLM คืออะไร และวิธีติดตั้งบน Cloud Server

vLLM คือระบบให้บริการโมเดลภาษาขนาดใหญ่ที่ออกแบบมาเพื่อรองรับคำขอพร้อมกันจำนวนมาก โดยจัดการหน่วยความจำของ GPU อย่างมีประสิทธิภาพกว่าวิธีให้บริการทั่วไป

หมวดหมู่
AI, Machine Learning และ LLM
ติดตั้งบนเซิร์ฟเวอร์เองได้
ได้
สเปกเริ่มต้นที่แนะนำ
8 vCPU · RAM 32 GB
ไลเซนส์
Apache License 2.0 (โอเพนซอร์ส)
เว็บทางการ
เปิดเว็บไซต์
สร้าง Cloud Server เดี๋ยวนี้
  • ISO/IEC 27001
  • ISO 22301
  • ISO 20000-1
  • CSA-STAR

Data Center ในไทย มาตรฐาน TIA-942 Tier 3+ ข้อมูลอยู่ในประเทศไทย

vLLM คืออะไร

การรันโมเดลภาษาขนาดใหญ่ด้วยวิธีตรงไปตรงมาจะใช้หน่วยความจำของ GPU ไม่คุ้ม เพราะต้องจองพื้นที่เผื่อไว้สำหรับความยาวสูงสุดของทุกคำขอ ทั้งที่คำขอส่วนใหญ่สั้นกว่านั้นมาก

vLLM แก้ด้วยการจัดการหน่วยความจำเป็นบล็อกย่อยและจัดสรรตามที่ใช้จริง ทำให้รับคำขอพร้อมกันได้มากขึ้นหลายเท่าบน GPU ตัวเดิม ซึ่งเปลี่ยนความคุ้มค่าของการให้บริการโมเดลเองอย่างมาก

ระบบเปิด API ที่เข้ากันได้กับรูปแบบที่ใช้กันทั่วไป แอปที่เขียนไว้เรียกใช้บริการภายนอกอยู่แล้วจึงเปลี่ยนมาเรียกเซิร์ฟเวอร์ของตัวเองได้โดยแก้เพียงที่อยู่ปลายทาง

แผนผังการวางระบบ vLLM บน Cloud Server หนึ่งเครื่องที่ Data Center ในประเทศไทย ผู้ใช้เข้าถึงผ่านไฟร์วอลล์ที่เปิดเฉพาะพอร์ต 8000, 443 ตัว vLLM และข้อมูลอยู่บนเครื่องเดียวกัน เริ่มต้นที่ 8 vCPU แรม 32 GB และมีสำเนาสำรองเขียนออกไปเก็บอีกไซต์หนึ่ง
vLLM ทำงานบน Cloud Server เครื่องเดียวได้ครบ เปิดเฉพาะพอร์ตที่จำเป็น ข้อมูลและสำเนาสำรองอยู่ใน Data Center ในประเทศไทย

ความสามารถเด่นของ vLLM

รับคำขอพร้อมกันได้มากกว่า

จัดการหน่วยความจำ GPU อย่างมีประสิทธิภาพกว่าวิธีทั่วไปหลายเท่า

API เข้ากันได้กับรูปแบบมาตรฐาน

แอปเดิมเปลี่ยนมาเรียกได้โดยแก้เพียงที่อยู่ปลายทาง

รองรับโมเดลเปิดจำนวนมาก

ใช้กับโมเดลที่เผยแพร่สาธารณะได้หลายตระกูล

ตอบแบบทยอยส่งข้อความ

ผู้ใช้เห็นคำตอบทันทีโดยไม่ต้องรอจนจบ

กระจายโมเดลข้าม GPU หลายตัวได้

รันโมเดลที่ใหญ่เกินหน่วยความจำของการ์ดเดียวได้

ใช้ vLLM ทำอะไรได้บ้าง

  • องค์กรที่ต้องการให้บริการโมเดลภาษาของตัวเองแทนการเรียกบริการภายนอก
  • ระบบภายในที่ต้องประมวลผลข้อความจำนวนมากต่อวัน
  • งานที่ข้อมูลอ่อนไหวจนส่งออกไปประมวลผลภายนอกไม่ได้
  • ผู้ให้บริการที่ต้องรองรับผู้ใช้หลายรายพร้อมกัน

สเปก Cloud Server ที่แนะนำ

แผนภาพเทียบสเปก Cloud Server สำหรับ vLLM 3 ระดับ เริ่มจาก 8 vCPU แรม 32 GB ดิสก์ NVMe 200 GB ไปจนถึง 32 vCPU ขึ้นไป แรม 128 GB ขึ้นไป ดิสก์ NVMe 1 TB ขึ้นไป โดยเทียบขนาดแยกตามแต่ละคอลัมน์
เริ่มจากระดับที่ตรงกับการใช้งานตอนนี้ แล้วเพิ่ม CPU และ RAM ทีหลังได้บนเครื่องเดิม
ระดับการใช้งานvCPURAMDisk
โมเดลเล็กโมเดลระดับไม่กี่พันล้านพารามิเตอร์บน GPU หนึ่งตัว8 vCPU32 GBNVMe 200 GB
แนะนำโมเดลขนาดกลางที่ต้องการหน่วยความจำ GPU สูง16 vCPU ขึ้นไป64 GB ขึ้นไปNVMe 500 GB ขึ้นไป
โมเดลใหญ่ต้องใช้ GPU หลายตัวและกระจายโมเดลข้ามการ์ด32 vCPU ขึ้นไป128 GB ขึ้นไปNVMe 1 TB ขึ้นไป

ดูราคาตามสเปกได้ที่ ราคา Cloud Compute หรือให้ทีมงานช่วยประเมินสเปกจากปริมาณผู้ใช้จริงของคุณ

วิธีติดตั้ง vLLM บน Cloud Server ของ THAI DATA CLOUD

ขั้นตอนด้านล่างใช้กับ Cloud Server ที่เพิ่งสร้างใหม่จากหน้าจัดการของ THAI DATA CLOUD ได้ทันที ถ้าไม่สะดวกทำเอง ทีมวิศวกรของเราติดตั้งและตั้งค่าให้ฟรีสำหรับลูกค้า Cloud Server

สิ่งที่ต้องเตรียม

  • GPU ที่มีหน่วยความจำเพียงพอกับขนาดโมเดล
  • ไดรเวอร์ GPU ที่ตรงกับรุ่นของไลบรารี
  • Python และพื้นที่ดิสก์สำหรับไฟล์โมเดล
  • แบนด์วิดท์สำหรับดาวน์โหลดโมเดลครั้งแรก

ทดสอบบน Ubuntu Server 24.04 LTS พร้อม GPU

  1. 1

    ตรวจไดรเวอร์ GPU

    nvidia-smi
    python3 -m venv ~/venv && source ~/venv/bin/activate
  2. 2

    ติดตั้ง vLLM

    pip install vllm
  3. 3

    เปิดเซิร์ฟเวอร์ให้บริการโมเดล

    ระบุชื่อโมเดลที่ต้องการ ระบบจะดาวน์โหลดให้ในรอบแรกซึ่งใช้เวลาพอสมควรตามขนาดโมเดล

    python -m vllm.entrypoints.openai.api_server \
      --model meta-llama/Llama-3.1-8B-Instruct \
      --host 127.0.0.1 --port 8000 \
      --gpu-memory-utilization 0.90 \
      --max-model-len 8192
  4. 4

    ทดสอบเรียกใช้

    curl http://127.0.0.1:8000/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{"model":"meta-llama/Llama-3.1-8B-Instruct","messages":[{"role":"user","content":"สรุปข้อดีของคลาวด์ในไทย"}]}'
  5. 5

    ตั้งให้รันเป็นบริการ

    # /etc/systemd/system/vllm.service
    [Unit]
    Description=vLLM API server
    After=network.target
    
    [Service]
    User=ubuntu
    ExecStart=/home/ubuntu/venv/bin/python -m vllm.entrypoints.openai.api_server --model meta-llama/Llama-3.1-8B-Instruct --host 127.0.0.1 --port 8000
    Restart=always
    
    [Install]
    WantedBy=multi-user.target
  6. 6

    วาง Reverse Proxy และจำกัดการเข้าถึง

    ให้ Nginx รับ HTTPS แล้วส่งต่อ พร้อมตั้งการยืนยันตัวตนและจำกัดอัตราการเรียก เพราะทุกคำขอใช้ทรัพยากร GPU จริง

หน่วยความจำของ GPU เป็นตัวกำหนดว่ารันโมเดลขนาดใดได้ ควรตรวจความต้องการของโมเดลก่อนเลือกสเปกเครื่อง เพราะเปลี่ยนทีหลังมีค่าใช้จ่ายสูง

พอร์ตที่ต้องเปิดบน Firewall

พอร์ตโปรโตคอลใช้ทำอะไร
8000TCPAPI ให้บริการโมเดล (เข้าผ่าน Reverse Proxy)
443TCPHTTPS สำหรับผู้เรียกใช้

สิ่งที่ควรทำต่อหลังติดตั้งเสร็จ

  • ไม่เปิด API สู่อินเทอร์เน็ตโดยไม่มีการยืนยันตัวตน
  • จำกัดอัตราการเรียกใช้ต่อผู้ใช้เพราะทุกคำขอใช้ทรัพยากร GPU
  • ตรวจใบอนุญาตของโมเดลที่นำมาใช้ว่าอนุญาตให้ใช้เชิงพาณิชย์หรือไม่
  • บันทึกการใช้งานเพื่อวิเคราะห์ต้นทุนและตรวจการใช้ผิดวัตถุประสงค์

ทำไมควรรัน vLLM บน Cloud Server ของ THAI DATA CLOUD

Data Center ในประเทศไทย มาตรฐาน ISO/IEC 27001 และ ISO 22301 พร้อมทีมวิศวกรคนไทยดูแลตลอด 24 ชั่วโมง

รันบน GPU Cloud Server ในไทย ทำให้ข้อมูลที่ส่งเข้าโมเดลไม่ออกนอกประเทศ

ควบคุมต้นทุนได้แน่นอนจากค่าเครื่องรายเดือน แทนการจ่ายตามจำนวนโทเคน

แอปที่รันในวง Private Network เรียกใช้ได้โดยไม่ผ่านอินเทอร์เน็ต

คำถามที่พบบ่อยเกี่ยวกับ vLLM

vLLM ต่างจาก Ollama อย่างไร

Ollama เน้นความง่ายในการรันโมเดลบนเครื่องเดียวสำหรับการทดลองและงานส่วนตัว ส่วน vLLM ออกแบบมาเพื่อให้บริการที่มีคำขอพร้อมกันจำนวนมาก จึงเหมาะกับระบบงานจริงที่มีผู้ใช้หลายคน

คุ้มกว่าการเรียกบริการภายนอกไหม

คุ้มเมื่อปริมาณการใช้งานสูงพอ เพราะค่าเครื่องเป็นต้นทุนคงที่ ขณะที่บริการภายนอกคิดตามปริมาณ จุดคุ้มทุนขึ้นกับขนาดโมเดลและปริมาณคำขอ ควรคำนวณจากการใช้งานจริงก่อนตัดสินใจ

ต้องใช้ GPU แบบไหน

ขึ้นกับขนาดโมเดลเป็นหลัก โมเดลระดับไม่กี่พันล้านพารามิเตอร์ต้องการหน่วยความจำ GPU ระดับหนึ่ง ส่วนโมเดลใหญ่ต้องใช้การ์ดที่มีหน่วยความจำสูงหรือหลายการ์ด ทีมงานของเราช่วยประเมินสเปกที่เหมาะสมได้

ให้เราติดตั้ง vLLM ให้ฟรี บน Cloud Server ในไทย

แจ้งความต้องการสั้น ๆ ทีมวิศวกรจะช่วยประเมินสเปก ติดตั้ง และตั้งค่าความปลอดภัยให้พร้อมใช้งาน ปรึกษาฟรี ไม่มีข้อผูกมัด