vLLM คืออะไร และวิธีติดตั้งบน Cloud Server
vLLM คือระบบให้บริการโมเดลภาษาขนาดใหญ่ที่ออกแบบมาเพื่อรองรับคำขอพร้อมกันจำนวนมาก โดยจัดการหน่วยความจำของ GPU อย่างมีประสิทธิภาพกว่าวิธีให้บริการทั่วไป
- หมวดหมู่
- AI, Machine Learning และ LLM
- ติดตั้งบนเซิร์ฟเวอร์เองได้
- ได้
- สเปกเริ่มต้นที่แนะนำ
- 8 vCPU · RAM 32 GB
- ไลเซนส์
- Apache License 2.0 (โอเพนซอร์ส)
- เว็บทางการ
- เปิดเว็บไซต์
- ISO/IEC 27001
- ISO 22301
- ISO 20000-1
- CSA-STAR
Data Center ในไทย มาตรฐาน TIA-942 Tier 3+ ข้อมูลอยู่ในประเทศไทย
vLLM คืออะไร
การรันโมเดลภาษาขนาดใหญ่ด้วยวิธีตรงไปตรงมาจะใช้หน่วยความจำของ GPU ไม่คุ้ม เพราะต้องจองพื้นที่เผื่อไว้สำหรับความยาวสูงสุดของทุกคำขอ ทั้งที่คำขอส่วนใหญ่สั้นกว่านั้นมาก
vLLM แก้ด้วยการจัดการหน่วยความจำเป็นบล็อกย่อยและจัดสรรตามที่ใช้จริง ทำให้รับคำขอพร้อมกันได้มากขึ้นหลายเท่าบน GPU ตัวเดิม ซึ่งเปลี่ยนความคุ้มค่าของการให้บริการโมเดลเองอย่างมาก
ระบบเปิด API ที่เข้ากันได้กับรูปแบบที่ใช้กันทั่วไป แอปที่เขียนไว้เรียกใช้บริการภายนอกอยู่แล้วจึงเปลี่ยนมาเรียกเซิร์ฟเวอร์ของตัวเองได้โดยแก้เพียงที่อยู่ปลายทาง
ความสามารถเด่นของ vLLM
รับคำขอพร้อมกันได้มากกว่า
จัดการหน่วยความจำ GPU อย่างมีประสิทธิภาพกว่าวิธีทั่วไปหลายเท่า
API เข้ากันได้กับรูปแบบมาตรฐาน
แอปเดิมเปลี่ยนมาเรียกได้โดยแก้เพียงที่อยู่ปลายทาง
รองรับโมเดลเปิดจำนวนมาก
ใช้กับโมเดลที่เผยแพร่สาธารณะได้หลายตระกูล
ตอบแบบทยอยส่งข้อความ
ผู้ใช้เห็นคำตอบทันทีโดยไม่ต้องรอจนจบ
กระจายโมเดลข้าม GPU หลายตัวได้
รันโมเดลที่ใหญ่เกินหน่วยความจำของการ์ดเดียวได้
ใช้ vLLM ทำอะไรได้บ้าง
- องค์กรที่ต้องการให้บริการโมเดลภาษาของตัวเองแทนการเรียกบริการภายนอก
- ระบบภายในที่ต้องประมวลผลข้อความจำนวนมากต่อวัน
- งานที่ข้อมูลอ่อนไหวจนส่งออกไปประมวลผลภายนอกไม่ได้
- ผู้ให้บริการที่ต้องรองรับผู้ใช้หลายรายพร้อมกัน
สเปก Cloud Server ที่แนะนำ
| ระดับการใช้งาน | vCPU | RAM | Disk |
|---|---|---|---|
| โมเดลเล็กโมเดลระดับไม่กี่พันล้านพารามิเตอร์บน GPU หนึ่งตัว | 8 vCPU | 32 GB | NVMe 200 GB |
| แนะนำโมเดลขนาดกลางที่ต้องการหน่วยความจำ GPU สูง | 16 vCPU ขึ้นไป | 64 GB ขึ้นไป | NVMe 500 GB ขึ้นไป |
| โมเดลใหญ่ต้องใช้ GPU หลายตัวและกระจายโมเดลข้ามการ์ด | 32 vCPU ขึ้นไป | 128 GB ขึ้นไป | NVMe 1 TB ขึ้นไป |
ดูราคาตามสเปกได้ที่ ราคา Cloud Compute หรือให้ทีมงานช่วยประเมินสเปกจากปริมาณผู้ใช้จริงของคุณ
วิธีติดตั้ง vLLM บน Cloud Server ของ THAI DATA CLOUD
ขั้นตอนด้านล่างใช้กับ Cloud Server ที่เพิ่งสร้างใหม่จากหน้าจัดการของ THAI DATA CLOUD ได้ทันที ถ้าไม่สะดวกทำเอง ทีมวิศวกรของเราติดตั้งและตั้งค่าให้ฟรีสำหรับลูกค้า Cloud Server
สิ่งที่ต้องเตรียม
- GPU ที่มีหน่วยความจำเพียงพอกับขนาดโมเดล
- ไดรเวอร์ GPU ที่ตรงกับรุ่นของไลบรารี
- Python และพื้นที่ดิสก์สำหรับไฟล์โมเดล
- แบนด์วิดท์สำหรับดาวน์โหลดโมเดลครั้งแรก
ทดสอบบน Ubuntu Server 24.04 LTS พร้อม GPU
- 1
ตรวจไดรเวอร์ GPU
nvidia-smi python3 -m venv ~/venv && source ~/venv/bin/activate - 2
ติดตั้ง vLLM
pip install vllm - 3
เปิดเซิร์ฟเวอร์ให้บริการโมเดล
ระบุชื่อโมเดลที่ต้องการ ระบบจะดาวน์โหลดให้ในรอบแรกซึ่งใช้เวลาพอสมควรตามขนาดโมเดล
python -m vllm.entrypoints.openai.api_server \ --model meta-llama/Llama-3.1-8B-Instruct \ --host 127.0.0.1 --port 8000 \ --gpu-memory-utilization 0.90 \ --max-model-len 8192 - 4
ทดสอบเรียกใช้
curl http://127.0.0.1:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"meta-llama/Llama-3.1-8B-Instruct","messages":[{"role":"user","content":"สรุปข้อดีของคลาวด์ในไทย"}]}' - 5
ตั้งให้รันเป็นบริการ
# /etc/systemd/system/vllm.service [Unit] Description=vLLM API server After=network.target [Service] User=ubuntu ExecStart=/home/ubuntu/venv/bin/python -m vllm.entrypoints.openai.api_server --model meta-llama/Llama-3.1-8B-Instruct --host 127.0.0.1 --port 8000 Restart=always [Install] WantedBy=multi-user.target - 6
วาง Reverse Proxy และจำกัดการเข้าถึง
ให้ Nginx รับ HTTPS แล้วส่งต่อ พร้อมตั้งการยืนยันตัวตนและจำกัดอัตราการเรียก เพราะทุกคำขอใช้ทรัพยากร GPU จริง
หน่วยความจำของ GPU เป็นตัวกำหนดว่ารันโมเดลขนาดใดได้ ควรตรวจความต้องการของโมเดลก่อนเลือกสเปกเครื่อง เพราะเปลี่ยนทีหลังมีค่าใช้จ่ายสูง
พอร์ตที่ต้องเปิดบน Firewall
| พอร์ต | โปรโตคอล | ใช้ทำอะไร |
|---|---|---|
| 8000 | TCP | API ให้บริการโมเดล (เข้าผ่าน Reverse Proxy) |
| 443 | TCP | HTTPS สำหรับผู้เรียกใช้ |
สิ่งที่ควรทำต่อหลังติดตั้งเสร็จ
- ไม่เปิด API สู่อินเทอร์เน็ตโดยไม่มีการยืนยันตัวตน
- จำกัดอัตราการเรียกใช้ต่อผู้ใช้เพราะทุกคำขอใช้ทรัพยากร GPU
- ตรวจใบอนุญาตของโมเดลที่นำมาใช้ว่าอนุญาตให้ใช้เชิงพาณิชย์หรือไม่
- บันทึกการใช้งานเพื่อวิเคราะห์ต้นทุนและตรวจการใช้ผิดวัตถุประสงค์
ทำไมควรรัน vLLM บน Cloud Server ของ THAI DATA CLOUD
Data Center ในประเทศไทย มาตรฐาน ISO/IEC 27001 และ ISO 22301 พร้อมทีมวิศวกรคนไทยดูแลตลอด 24 ชั่วโมง
รันบน GPU Cloud Server ในไทย ทำให้ข้อมูลที่ส่งเข้าโมเดลไม่ออกนอกประเทศ
ควบคุมต้นทุนได้แน่นอนจากค่าเครื่องรายเดือน แทนการจ่ายตามจำนวนโทเคน
แอปที่รันในวง Private Network เรียกใช้ได้โดยไม่ผ่านอินเทอร์เน็ต
คำถามที่พบบ่อยเกี่ยวกับ vLLM
vLLM ต่างจาก Ollama อย่างไร
Ollama เน้นความง่ายในการรันโมเดลบนเครื่องเดียวสำหรับการทดลองและงานส่วนตัว ส่วน vLLM ออกแบบมาเพื่อให้บริการที่มีคำขอพร้อมกันจำนวนมาก จึงเหมาะกับระบบงานจริงที่มีผู้ใช้หลายคน
คุ้มกว่าการเรียกบริการภายนอกไหม
คุ้มเมื่อปริมาณการใช้งานสูงพอ เพราะค่าเครื่องเป็นต้นทุนคงที่ ขณะที่บริการภายนอกคิดตามปริมาณ จุดคุ้มทุนขึ้นกับขนาดโมเดลและปริมาณคำขอ ควรคำนวณจากการใช้งานจริงก่อนตัดสินใจ
ต้องใช้ GPU แบบไหน
ขึ้นกับขนาดโมเดลเป็นหลัก โมเดลระดับไม่กี่พันล้านพารามิเตอร์ต้องการหน่วยความจำ GPU ระดับหนึ่ง ส่วนโมเดลใหญ่ต้องใช้การ์ดที่มีหน่วยความจำสูงหรือหลายการ์ด ทีมงานของเราช่วยประเมินสเปกที่เหมาะสมได้
ทางเลือกอื่นที่คล้ายกับ vLLM
แอปอื่นในหมวด AI, Machine Learning และ LLM
บริการของ THAI DATA CLOUD ที่เกี่ยวข้อง
ให้เราติดตั้ง vLLM ให้ฟรี บน Cloud Server ในไทย
แจ้งความต้องการสั้น ๆ ทีมวิศวกรจะช่วยประเมินสเปก ติดตั้ง และตั้งค่าความปลอดภัยให้พร้อมใช้งาน ปรึกษาฟรี ไม่มีข้อผูกมัด