PyTorch คืออะไร และวิธีติดตั้งบน Cloud Server
PyTorch คือเฟรมเวิร์กสำหรับสร้างและฝึกโมเดลปัญญาประดิษฐ์ที่ได้รับความนิยมสูงที่สุดในงานวิจัยและการพัฒนา จุดเด่นคือเขียนโค้ดได้เป็นธรรมชาติและตรวจสอบระหว่างทางได้ง่าย
- หมวดหมู่
- AI, Machine Learning และ LLM
- ติดตั้งบนเซิร์ฟเวอร์เองได้
- ได้
- สเปกเริ่มต้นที่แนะนำ
- 4 vCPU · RAM 16 GB
- ไลเซนส์
- BSD 3-Clause (โอเพนซอร์ส)
- เว็บทางการ
- เปิดเว็บไซต์
- ISO/IEC 27001
- ISO 22301
- ISO 20000-1
- CSA-STAR
Data Center ในไทย มาตรฐาน TIA-942 Tier 3+ ข้อมูลอยู่ในประเทศไทย
PyTorch คืออะไร
PyTorch ให้เขียนการคำนวณของโมเดลเหมือนเขียนโปรแกรม Python ทั่วไป จึงหยุดตรวจค่าระหว่างทางและแก้ปัญหาได้ง่ายกว่าเฟรมเวิร์กที่ต้องประกาศโครงสร้างทั้งหมดก่อน ซึ่งเป็นเหตุผลหลักที่นักวิจัยเลือกใช้
ระบบนิเวศรอบข้างใหญ่มาก โมเดลที่เผยแพร่ในงานวิจัยส่วนใหญ่มีโค้ดเป็น PyTorch และไลบรารีสำเร็จรูปสำหรับงานภาษา ภาพ และเสียง ก็รองรับเป็นหลัก ทำให้นำงานวิจัยมาต่อยอดได้เร็ว
ในการใช้งานจริง ตัวแปรที่สำคัญที่สุดคือ GPU และหน่วยความจำของ GPU เพราะกำหนดว่าจะฝึกหรือรันโมเดลขนาดใดได้ ส่วนงานที่เพียงรันโมเดลขนาดเล็กใช้ซีพียูอย่างเดียวก็พอ
ความสามารถเด่นของ PyTorch
เขียนโค้ดได้เป็นธรรมชาติ
ตรวจค่าระหว่างทางและแก้ปัญหาได้เหมือนโปรแกรม Python ทั่วไป
ระบบนิเวศงานวิจัยที่ใหญ่ที่สุด
โมเดลใหม่ส่วนใหญ่มีโค้ดเป็น PyTorch ให้นำมาต่อยอด
รองรับการฝึกบน GPU หลายตัว
กระจายการฝึกไปหลายการ์ดหรือหลายเครื่องได้
แปลงโมเดลไปใช้งานจริงได้
ส่งออกโมเดลเพื่อรันในระบบงานจริงได้หลายรูปแบบ
ไลบรารีสำเร็จรูปครบ
มีเครื่องมือสำหรับงานภาษา ภาพ และเสียงให้เริ่มได้ทันที
ใช้ PyTorch ทำอะไรได้บ้าง
- ทีมวิจัยที่พัฒนาโมเดลของตัวเอง
- การปรับแต่งโมเดลภาษาให้เข้ากับข้อมูลขององค์กร
- ระบบวิเคราะห์ภาพและวิดีโอในโรงงานหรืออาคาร
- งานประมวลผลภาษาไทยที่ต้องฝึกด้วยข้อมูลเฉพาะทาง
สเปก Cloud Server ที่แนะนำ
| ระดับการใช้งาน | vCPU | RAM | Disk |
|---|---|---|---|
| ทดลองบนซีพียูเรียนรู้และรันโมเดลขนาดเล็ก | 4 vCPU | 16 GB | NVMe 100 GB |
| แนะนำพร้อม GPUฝึกและปรับแต่งโมเดลขนาดกลาง | 8 vCPU ขึ้นไป | 32 GB ขึ้นไป | NVMe 500 GB ขึ้นไป |
| ฝึกโมเดลใหญ่ต้องใช้ GPU ที่มีหน่วยความจำสูงและอาจต้องหลายการ์ด | 16 vCPU ขึ้นไป | 64 GB ขึ้นไป | NVMe 1 TB ขึ้นไป |
ดูราคาตามสเปกได้ที่ ราคา Cloud Compute หรือให้ทีมงานช่วยประเมินสเปกจากปริมาณผู้ใช้จริงของคุณ
วิธีติดตั้ง PyTorch บน Cloud Server ของ THAI DATA CLOUD
ขั้นตอนด้านล่างใช้กับ Cloud Server ที่เพิ่งสร้างใหม่จากหน้าจัดการของ THAI DATA CLOUD ได้ทันที ถ้าไม่สะดวกทำเอง ทีมวิศวกรของเราติดตั้งและตั้งค่าให้ฟรีสำหรับลูกค้า Cloud Server
สิ่งที่ต้องเตรียม
- Ubuntu Server 24.04 LTS
- GPU พร้อมไดรเวอร์ที่ตรงกับรุ่นของไลบรารี ถ้าต้องฝึกโมเดล
- Python และเครื่องมือจัดการสภาพแวดล้อม
- พื้นที่ดิสก์สำหรับชุดข้อมูลและไฟล์โมเดล
ทดสอบบน Ubuntu Server 24.04 LTS
- 1
ติดตั้ง Python และเครื่องมือพื้นฐาน
sudo apt update sudo apt -y install python3-pip python3-venv build-essential python3 -m venv ~/venv && source ~/venv/bin/activate - 2
ติดตั้งไดรเวอร์ GPU ถ้ามีการ์ด
ตรวจว่าไดรเวอร์ทำงานถูกต้องก่อนติดตั้งไลบรารี เพราะเป็นสาเหตุของปัญหาที่พบบ่อยที่สุด
sudo apt -y install nvidia-driver-550 sudo reboot nvidia-smi - 3
ติดตั้ง PyTorch
เลือกคำสั่งติดตั้งให้ตรงกับรุ่นของไดรเวอร์จากเว็บทางการ เพราะเวอร์ชันที่ไม่ตรงกันจะทำให้ใช้ GPU ไม่ได้
pip install torch torchvision torchaudio - 4
ตรวจว่าใช้ GPU ได้จริง
python3 -c "import torch; print(torch.__version__, torch.cuda.is_available(), torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'CPU only')" - 5
ทดสอบฝึกโมเดลอย่างง่าย
import torch import torch.nn as nn model = nn.Sequential(nn.Linear(10, 64), nn.ReLU(), nn.Linear(64, 1)).cuda() x = torch.randn(256, 10).cuda() y = torch.randn(256, 1).cuda() opt = torch.optim.Adam(model.parameters(), lr=1e-3) for step in range(100): loss = ((model(x) - y) ** 2).mean() opt.zero_grad(); loss.backward(); opt.step() print("loss:", loss.item()) - 6
ตั้งการรันงานฝึกเป็นบริการ
สำหรับงานฝึกที่ใช้เวลานาน ให้รันผ่านตัวจัดการเซสชันหรือเป็นบริการของระบบ เพื่อไม่ให้งานหยุดเมื่อตัดการเชื่อมต่อ SSH
เลือกรุ่นของไลบรารีให้ตรงกับไดรเวอร์ GPU เสมอ เพราะเวอร์ชันที่ไม่ตรงกันเป็นสาเหตุอันดับหนึ่งที่ทำให้ใช้ GPU ไม่ได้ทั้งที่ติดตั้งสำเร็จ
พอร์ตที่ต้องเปิดบน Firewall
| พอร์ต | โปรโตคอล | ใช้ทำอะไร |
|---|---|---|
| 8888 | TCP | สมุดบันทึกสำหรับพัฒนา (เปิดเฉพาะผ่าน SSH Tunnel) |
| 443 | TCP | หน้าเว็บของบริการที่ให้บริการโมเดล |
สิ่งที่ควรทำต่อหลังติดตั้งเสร็จ
- ไม่เปิดสมุดบันทึกสำหรับพัฒนาสู่อินเทอร์เน็ตโดยไม่มีการยืนยันตัวตน
- เก็บชุดข้อมูลที่มีข้อมูลส่วนบุคคลไว้ในเครื่องที่จำกัดการเข้าถึง
- แยกสภาพแวดล้อมของแต่ละโครงการเพื่อไม่ให้ไลบรารีชนกัน
- สำรองไฟล์โมเดลที่ฝึกเสร็จแล้วเพราะใช้เวลาและค่าใช้จ่ายสูงในการฝึกใหม่
ทำไมควรรัน PyTorch บน Cloud Server ของ THAI DATA CLOUD
Data Center ในประเทศไทย มาตรฐาน ISO/IEC 27001 และ ISO 22301 พร้อมทีมวิศวกรคนไทยดูแลตลอด 24 ชั่วโมง
ข้อมูลที่ใช้ฝึกโมเดลอยู่ในเซิร์ฟเวอร์ในไทย ไม่ต้องส่งออกไปยังบริการต่างประเทศ
เปิดเครื่องที่มี GPU เฉพาะช่วงที่ฝึกโมเดลเพื่อคุมค่าใช้จ่าย
เก็บชุดข้อมูลขนาดใหญ่บน Object Storage แล้วดึงมาใช้ตอนฝึก
คำถามที่พบบ่อยเกี่ยวกับ PyTorch
PyTorch ต่างจาก TensorFlow อย่างไร
PyTorch เขียนโค้ดได้เป็นธรรมชาติกว่าและครองงานวิจัยเกือบทั้งหมด ส่วน TensorFlow มีเครื่องมือสำหรับนำโมเดลไปใช้งานจริงในระบบขนาดใหญ่ที่ครบกว่าในบางด้าน ทีมที่เริ่มใหม่ส่วนใหญ่เลือก PyTorch
จำเป็นต้องมี GPU ไหม
จำเป็นถ้าต้องฝึกหรือปรับแต่งโมเดล เพราะการฝึกบนซีพียูช้ากว่าหลายสิบเท่า ส่วนงานที่เพียงรันโมเดลขนาดเล็กเพื่อทำนายผล ใช้ซีพียูอย่างเดียวได้ในหลายกรณี
ฝึกโมเดลภาษาไทยได้ไหม
ได้ โดยใช้โมเดลพื้นฐานที่รองรับหลายภาษาแล้วปรับแต่งด้วยข้อมูลภาษาไทยขององค์กร ซึ่งให้ผลดีกว่าและใช้ทรัพยากรน้อยกว่าการฝึกใหม่ตั้งแต่ต้นมาก
ทางเลือกอื่นที่คล้ายกับ PyTorch
- TensorFlowเฟรมเวิร์ก Machine Learning จากกูเกิลAI, Machine Learning และ LLM
- #59Ollamaรันโมเดล LLM บนเซิร์ฟเวอร์ตัวเองในคำสั่งเดียวAI, Machine Learning และ LLM
- vLLMเสิร์ฟ LLM ให้เร็วและรับผู้ใช้พร้อมกันได้มากAI, Machine Learning และ LLM
- #62JupyterLabสมุดงาน Data Science บนเว็บAI, Machine Learning และ LLM
แอปอื่นในหมวด AI, Machine Learning และ LLM
บริการของ THAI DATA CLOUD ที่เกี่ยวข้อง
ให้เราติดตั้ง PyTorch ให้ฟรี บน Cloud Server ในไทย
แจ้งความต้องการสั้น ๆ ทีมวิศวกรจะช่วยประเมินสเปก ติดตั้ง และตั้งค่าความปลอดภัยให้พร้อมใช้งาน ปรึกษาฟรี ไม่มีข้อผูกมัด