สเปกคอมเท่านี้ รันโมเดลไหนไหว? คู่มือเลือก Local LLM และขนาด Quantization ให้เหมาะกับเครื่องคุณ

อยากรัน AI ในเครื่องแต่ไม่รู้ว่าคอมพิวเตอร์ตัวเองไหวแค่ไหน? เจาะลึกสเปกที่จำเป็น วิธีอ่านขนาดพารามิเตอร์ และการเลือกใช้ Quantization ที่คุ้มค่าที่สุด

Share
สเปกคอมเท่านี้ รันโมเดลไหนไหว? คู่มือเลือก Local LLM และขนาด Quantization ให้เหมาะกับเครื่องคุณ

ความตื่นเต้นในการรัน Local AI หรือ AI ส่วนตัวบนเครื่องตัวเองแบบออฟไลน์ 100% เพื่อรักษาความเป็นส่วนตัวของข้อมูล มักจะมาพร้อมกับคำถามแรกสุดยอดฮิตที่ว่า "คอมพิวเตอร์ของเราจะรันไหวไหม?"

หลายคนเห็นชื่อโมเดลภาษาขนาดใหญ่ตามด้วยตัวเลขอย่าง 3B, 8B, 70B หรือคำศัพท์เทคนิคอย่าง GGUF และ Q4_K_M แล้วอาจจะรู้สึกถอดใจไปเสียก่อน แต่จริงๆ แล้วการทำความเข้าใจความต้องการระบบของ Local LLM ไม่ได้ยากอย่างที่คิด และในปัจจุบันเทคโนโลยีการบีบอัดโมเดลช่วยให้คอมพิวเตอร์ทำงานทั่วไปหรือโน้ตบุ๊กธรรมดาสามารถรัน AI อัจฉริยะได้สบายๆ

ในบทความนี้ เราจะมาไขข้อข้องใจเรื่องสเปกคอมพิวเตอร์ที่จำเป็นสำหรับการรัน AI และวิธีการเลือกโมเดลที่คุ้มค่ากับฮาร์ดแวร์ของคุณที่สุดกันครับ


เข้าใจทรัพยากรหลัก: RAM vs VRAM

ในการรัน AI ในเครื่อง มีฮาร์ดแวร์สองตัวหลักๆ ที่คุณต้องให้ความสำคัญ นั่นคือ RAM (หน่วยความจำหลักของคอมพิวเตอร์) และ VRAM (หน่วยความจำบนการ์ดจอ หรือ GPU)

  • VRAM (Video RAM): คือหัวใจสำคัญที่สุดสำหรับการรัน AI หากโมเดลภาษาถูกโหลดเข้าไปอยู่ใน VRAM ทั้งหมด การประมวลผลและการตอบกลับจะเร็วมาก (ระดับ 30-80 tokens/second) คอมพิวเตอร์ที่มีการ์ดจอแยกอย่าง Nvidia RTX Series จึงได้เปรียบมากในการรัน AI
  • RAM (System RAM): หาก VRAM ของคุณไม่พอ (หรือไม่มีการ์ดจอแยก) โปรแกรมอย่าง Ollama จะโหลดโมเดลบางส่วนหรือทั้งหมดมาไว้ที่ RAM ของระบบแทน ซึ่งการรันบน CPU + RAM จะช้ากว่าการรันบน GPU + VRAM อย่างเห็นได้ชัด (อาจเหลือเพียง 2-10 tokens/second)
  • Apple Silicon (Mac M1/M2/M3/M4): ความเจ๋งของ Mac รุ่นใหม่คือโครงสร้างแบบ Unified Memory ซึ่งทำให้ชิปประมวลผลกราฟิกสามารถแชร์แรมหลักของเครื่องมาใช้เป็น VRAM ได้โดยตรง ทำให้ Mac ที่มีแรมเยอะๆ (เช่น 24GB หรือ 36GB) รันโมเดลขนาดใหญ่ได้อย่างลื่นไหลในราคาที่คุ้มค่ากว่าฝั่ง PC ที่ต้องซื้อการ์ดจอราคาแพง

ปลดล็อกความลับของ "Quantization" (การบีบอัดโมเดล)

ถ้าเราโหลดโมเดลดิบๆ (ความละเอียดเต็ม 16-bit หรือ FP16) มาใช้งาน โมเดลขนาด 8B (8 พันล้านพารามิเตอร์) จะต้องใช้เนื้อที่แรมมากถึง 16 GB ซึ่งคอมพิวเตอร์ทั่วไปรันไม่ไหวแน่นอน

นี่คือที่มาของเทคนิค Quantization ซึ่งเปรียบเสมือนการแปลงไฟล์ภาพดิบ (RAW) ให้เป็นไฟล์ JPEG ที่มีขนาดเล็กลงแต่ตาของมนุษย์แทบแยกความแตกต่างไม่ออก โดยระบบจะทำการลดทอนความละเอียดของตัวแปรตัวเลขในโมเดลจาก 16-bit เหลือเพียง 8-bit, 4-bit หรือกระทั่ง 2-bit

  • Q4 (4-bit): เป็นจุดกึ่งกลางที่คุ้มค่าที่สุด (Sweet Spot) เพราะขนาดโมเดลจะลดลงไปถึง 75% (เช่น โมเดล 8B จะเหลือขนาดเพียง ~4.8 GB) ทำให้ใช้แรมลดลงมหาศาล ในขณะที่คุณภาพในการตอบคำถามและระดับความฉลาดลดลงเพียงเล็กน้อย (ต่ำกว่า 1-2%) เท่านั้น
  • Q8 (8-bit): มีความละเอียดสูงขึ้น ขนาดโมเดลจะลดลงเหลือประมาณ 50% เหมาะสำหรับเครื่องที่มีแรมเหลือเฟือและต้องการความแม่นยำสูงสุด

ดังนั้น เวลาเราใช้โปรแกรมอย่าง Ollama ในการดาวน์โหลดโมเดล ค่าเริ่มต้นที่ระบบดึงมาให้มักจะเป็นเวอร์ชัน Q4_K_M (4-bit quantization) ซึ่งประหยัดทรัพยากรเครื่องอย่างมาก


สเปกคอมพิวเตอร์ของคุณกับโมเดลที่แนะนำ

เพื่อช่วยให้คุณเห็นภาพชัดเจน เราได้แบ่งสเปกคอมพิวเตอร์ออกเป็น 3 ระดับ พร้อมโมเดลที่รันได้อย่างลื่นไหล ดังนี้ครับ

ระดับสเปกเครื่อง รายละเอียดฮาร์ดแวร์ ขนาดโมเดลที่แนะนำ ตัวอย่างโมเดลที่เหมาะสม
เริ่มต้น (Entry-Level) RAM 8GB / ไม่มีการ์ดจอแยก หรือมี VRAM 2-4GB 2B - 4B (Quantized) Gemma 2:2b, Phi 3:mini (3.8B)
ระดับกลาง (Mainstream) RAM 16GB / การ์ดจอ VRAM 6-8GB (เช่น RTX 3060/4060) หรือ Mac M-series 16GB ขึ้นไป 8B - 9B (Quantized) Llama 3.1:8b, Gemma 2:9b
ระดับสูง (High-End / Creator) RAM 32GB+ / การ์ดจอ VRAM 12-16GB+ หรือ Mac M-series 24GB ขึ้นไป 8B (Q8) หรือ 12B - 27B (Q4) Mistral-Nemo (12B), Gemma 2:27b

3 โมเดลยอดฮิตในกลุ่ม Local AI & Privacy

ถ้าคุณตัดสินใจจะรันโมเดลในเครื่องแล้ว นี่คือ 3 โมเดลที่คุณต้องดาวน์โหลดมาลองใช้งานเป็นตัวเลือกแรกๆ:

1. Llama 3.1 (8B) - ขวัญใจมหาชนรอบด้าน

ผลงานจาก Meta ที่เป็นรากฐานของโมเดล Open Source ยุคปัจจุบัน จุดเด่นคือการรองรับบริบทคำถามที่ยาวขึ้น (Context Window 128k) มีตรรกะเหตุผลที่ดีเยี่ยม และมีความเข้าใจภาษาไทยในเกณฑ์ที่ใช้งานทั่วไปได้ดี รันได้ลื่นไหลมากบนคอมพิวเตอร์แรม 16GB

2. Gemma 2 (9B และ 2B) - ผู้ชนะด้านภาษาไทยและเหตุผล

โมเดลรุ่นล่าสุดจาก Google ที่ได้รับการปรับแต่งมาอย่างประณีต จุดเด่นที่สำคัญคือ เข้าใจภาษาไทยได้ดีที่สุด ในกลุ่มโมเดลระดับเดียวกัน มีทักษะการใช้เหตุผลที่คมคาย สำหรับเครื่องแรม 8GB แนะนำให้ใช้รุ่น Gemma 2:2b ซึ่งทำงานได้เร็วมากและฉลาดเกินตัว ส่วนแรม 16GB ขึ้นไปต้องลอง Gemma 2:9b แล้วคุณจะประหลาดใจในคุณภาพ

3. Phi 3 / 3.5 (3.8B) - เล็กพริกขี้หนูจาก Microsoft

ถ้าคุณมีข้อจำกัดเรื่องแรม หรือใช้คอมพิวเตอร์รุ่นเก่า โมเดลขนาด 3.8 พันล้านพารามิเตอร์ตัวนี้คือคำตอบ มันประหยัดแรมอย่างไม่น่าเชื่อ (ใช้แรมเพียง 2.2 GB) แต่ให้ประสิทธิภาพในการตอบคำถามภาษาอังกฤษและเขียนโค้ดได้เทียบเท่ากับโมเดลรุ่นเก่าที่ใหญ่กว่าสองเท่า


บทสรุป

การเลือกใช้ Local-first AI ไม่จำเป็นต้องพึ่งพาซูเปอร์คอมพิวเตอร์ราคาหลักแสนเสมอไป ขอเพียงแค่คุณเข้าใจขนาดพารามิเตอร์และการเลือกใช้ Quantization (บีบอัดโมเดล) ที่เหมาะสม คุณก็สามารถเปลี่ยนคอมพิวเตอร์เครื่องเดิมของคุณให้กลายเป็นเซิร์ฟเวอร์ AI ส่วนตัวที่มีความปลอดภัยสูงสุดแบบออฟไลน์ 100% ได้ทันที

สำหรับผู้ที่เริ่มต้น แนะนำให้ดาวน์โหลด Ollama และลองรันคำสั่ง ollama run gemma2:2b หรือ ollama run llama3.1 ดูครับ แล้วคุณจะค้นพบว่ายุคสมัยของการเป็นเจ้าของพลังประมวลผล AI ด้วยตัวเองเริ่มต้นขึ้นแล้วจริงๆ


อุปกรณ์แนะนำสำหรับคู่มือนี้

  • การ์ดจอ RTX 3060 12GB — VRAM 12GB ในราคามือสองหมื่นต้นๆ — จุดคุ้มค่าที่สุดสำหรับรันโมเดล 7–14B แบบลื่น
  • แรม DDR4 32GB (16GB×2) — ขั้นต่ำที่แนะนำถ้าจะรันโมเดล 14B บน CPU หรือเปิดหลายโมเดลพร้อมกัน
  • SSD NVMe 1TB — โมเดลตัวละ 4–9GB โหลดจาก NVMe เร็วกว่า HDD หลายเท่า เก็บได้เป็นสิบโมเดล

หมายเหตุ: ส่วนนี้เป็นลิงก์แนะนำสินค้า หากซื้อผ่านลิงก์ บล็อกอาจได้รับค่าแนะนำเล็กน้อยโดยราคาที่คุณจ่ายไม่เปลี่ยน — เราเลือกเฉพาะของที่ใช้ได้จริงกับคู่มือนี้เท่านั้น

Read more

สร้าง AI Agent สกัด Knowledge Graph จากโน้ตส่วนตัว: เปลี่ยนข้อความกระจัดกระจายให้เป็นเครือข่ายความรู้ออฟไลน์ 100% ด้วย Python

สร้าง AI Agent สกัด Knowledge Graph จากโน้ตส่วนตัว: เปลี่ยนข้อความกระจัดกระจายให้เป็นเครือข่ายความรู้ออฟไลน์ 100% ด้วย Python + Ollama

เปลี่ยนเอกสารและโน้ตข้อความร้อยแก้วให้เป็น Knowledge Graph แบบโครงสร้าง (Subject-Predicate-Object) โดยอัตโนมัติ ด้วยสคริปต์ Python ร่วมกับ Local LLM ในเครื่อง ช่วยสกัดความสัมพันธ์ระหว่างความคิด เทคโนโลยี และบุคคลอย่างเป็นระบบออฟไลน์ 100%

By Linn
บอกลา Audible: คู่มือติดตั้ง Audiobookshelf เซิร์ฟเวอร์หนังสือเสียงและ eBook ส่วนตัวบน Home Server ด้วย Docker

บอกลา Audible: คู่มือติดตั้ง Audiobookshelf เซิร์ฟเวอร์หนังสือเสียงและ eBook ส่วนตัวบน Home Server ด้วย Docker

เปลี่ยนคลังหนังสือเสียงและดิจิทัลไฟล์ของคุณให้กลายเป็นเซิร์ฟเวอร์สตรีมมิ่งส่วนตัว ด้วย Audiobookshelf บน Home Server ผ่าน Docker พร้อมวิธีซิงค์ความคืบหน้าการฟังข้ามอุปกรณ์แบบเรียลไทม์

By Linn
สร้าง AI Agent สกัดและสังเคราะห์ Book Highlights: เปลี่ยนโน้ตอ่านหนังสือเป็น Book Summary อัจฉริยะใน Obsidian ด้วย Python + O

สร้าง AI Agent สกัดและสังเคราะห์ Book Highlights: เปลี่ยนโน้ตอ่านหนังสือเป็น Book Summary อัจฉริยะใน Obsidian ด้วย Python + Ollama

เปลี่ยนไฮไลต์และโน้ตย่อยจากการอ่านหนังสือให้กลายเป็น Book Summary ที่ทรงคุณค่าด้วย AI Agent ออฟไลน์ส่วนตัวที่จะสกัด Core Key Takeaways, Actionable Insights และเชื่อมโยงเข้ากับระบบ Second Brain แบบ Local 100%

By Linn
สร้าง Private AI Router ในเครื่องตัวเอง: คู่มือตั้งค่า LiteLLM สลับโมเดลอัจฉริยะตามประเภทงานแบบออฟไลน์ 100%

สร้าง Private AI Router ในเครื่องตัวเอง: คู่มือตั้งค่า LiteLLM สลับโมเดลอัจฉริยะตามประเภทงานแบบออฟไลน์ 100%

เรียนรู้วิธีตั้งค่า LiteLLM เป็น AI Gateway และ Router ในเครื่องตัวเอง เพื่อสลับรันโมเดล Ollama อัตโนมัติ ทั้งโมเดลเน้นความเร็ว โมเดลคิดวิเคราะห์เชิงลึก และโมเดลวิเคราะห์ภาพ ปลอดภัย 100% ไม่ต้องพึ่งคลาวด์

By Linn