สร้าง Private AI Router ในเครื่องตัวเอง: คู่มือตั้งค่า LiteLLM สลับโมเดลอัจฉริยะตามประเภทงานแบบออฟไลน์ 100%
เรียนรู้วิธีตั้งค่า LiteLLM เป็น AI Gateway และ Router ในเครื่องตัวเอง เพื่อสลับรันโมเดล Ollama อัตโนมัติ ทั้งโมเดลเน้นความเร็ว โมเดลคิดวิเคราะห์เชิงลึก และโมเดลวิเคราะห์ภาพ ปลอดภัย 100% ไม่ต้องพึ่งคลาวด์
เมื่อคุณเริ่มต้นใช้งาน Local-first AI บนเครื่องคอมพิวเตอร์ส่วนตัวไปสักพัก คุณจะเริ่มสะสมโมเดลภาษา (LLM) ไว้หลากหลายตัวตามความเหมาะสมของงาน เช่น ใช้โมเดลขนาดเล็กอย่าง Llama 3.2 (3B) สำหรับงานตอบแชตทั่วไปที่ต้องการความเร็วสูง, ใช้โมเดลสายคิดวิเคราะห์อย่าง DeepSeek-R1 สำหรับงานแก้โจทย์ซับซ้อน หรือใช้ Llama 3.2 Vision สำหรับงานอ่านภาพและเอกสาร PDF
ทว่าปัญหาที่ตามมาคือการต้องคอยสลับชื่อโมเดลในแอปพลิเคชันต่างๆ (เช่น Obsidian, VS Code, Open WebUI หรือ Python scripts) อยู่ตลอดเวลา ซึ่งทั้งยุ่งยากและสิ้นเปลืองทรัพยากรการประมวลผล
ในบทความนี้ เราจะมาดูวิธีแก้ปัญหานี้ด้วยการสร้าง Private AI Router ในเครื่องตัวเองโดยใช้ LiteLLM ร่วมกับ Ollama เพื่อรวมศูนย์โมเดลทั้งหมดไว้ที่จุดเดียว และสลับการทำงานอัตโนมัติอย่างชาญฉลาดและปลอดภัยแบบ Offline 100%
Private AI Router คืออะไร และทำไมระบบ Local AI ถึงต้องการ?
Private AI Router ทำหน้าที่เป็นตัวกลาง (AI Gateway / Proxy) ที่คอยรับคำสั่ง (Requests) จากแอปพลิเคชันทั้งหมดของคุณ แล้วตัดสินใจส่งคำสั่งนั้นไปประมวลผลยังโมเดลท้องถิ่นที่เหมาะสมที่สุดในเครื่อง
เปรียบเสมือนคุณมี "ผู้จัดการส่วนตัว" คอยคัดแยกงาน: * งานทั่วไป/สรุปข้อความสั้น: ส่งให้โมเดลเบาๆ ประมวลผลเสร็จในไม่กี่วินาที * งานคิดวิเคราะห์/เขียนโค้ด: ส่งให้โมเดล Reasoning ทำงานเชิงลึก * งานประมวลผลภาพ: ส่งเข้าโมเดล Vision โดยอัตโนมัติ
ประโยชน์สำคัญคือ แอปพลิเคชันปลายทางทั้งหมดของคุณจะเชื่อมต่อกับ Endpoint เดียวกัน (http://localhost:4000/v1) ทำให้คุณไม่ต้องคอยเปลี่ยนการตั้งค่าในแอปพลิเคชันบ่อยๆ อีกต่อไป
สิ่งที่ต้องเตรียมก่อนเริ่มตั้งค่า
- Ollama: ติดตั้งและเปิดใช้งานเรียบร้อยแล้วในเครื่อง (
http://localhost:11434) - โมเดลใน Ollama: ดาวน์โหลดโมเดลที่ต้องการใช้งานไว้ในเครื่อง เช่น:
bash ollama pull llama3.2:3b ollama pull deepseek-r1:14b ollama pull llama3.2-vision:11b - Python (3.10+): สำหรับติดตั้งและรันแพ็กเกจ LiteLLM
ขั้นตอนที่ 1: ติดตั้ง LiteLLM Proxy
เปิด Terminal แล้วติดตั้ง LiteLLM พร้อม Proxy server ผ่านคำสั่ง:
pip install "litellm[proxy]"
LiteLLM เป็นไลบรารีโอเพนซอร์สที่ออกแบบมาเพื่อแปลง API ของโมเดลต่างๆ ให้มีรูปแบบมาตรฐานเดียวกันกับ OpenAI API ทำให้รองรับการเชื่อมต่อกับซอฟต์แวร์สาย AI เกือบทั้งหมดในปัจจุบัน
ขั้นตอนที่ 2: เขียนไฟล์กำหนดโครงสร้าง Router (config.yaml)
สร้างไฟล์ชื่อ config.yaml ในโฟลเดอร์ทำงานของคุณ เพื่อตั้งนามแฝง (Model Aliases) และตั้งค่ากฎการส่งคำสั่งไปยัง Ollama:
model_list:
# 1. โมเดลเน้นความเร็วสำหรับงานทั่วไป (Fast Tier)
- model_name: fast-model
litellm_params:
model: ollama/llama3.2:3b
api_base: http://localhost:11434
# 2. โมเดลเน้นการคิดวิเคราะห์เชิงลึก (Reasoning Tier)
- model_name: reasoning-model
litellm_params:
model: ollama/deepseek-r1:14b
api_base: http://localhost:11434
# 3. โมเดลอ่านภาพและเอกสาร (Vision Tier)
- model_name: vision-model
litellm_params:
model: ollama/llama3.2-vision:11b
api_base: http://localhost:11434
# 4. โมเดลสำรองเริ่มต้น (Default Fallback)
- model_name: gpt-3.5-turbo
litellm_params:
model: ollama/llama3.2:3b
api_base: http://localhost:11434
router_settings:
routing_strategy: usage-based-routing-v2
num_retries: 2
request_timeout: 120
ข้อสังเกต: การตั้งนามแฝงอย่างgpt-3.5-turboชี้ไปที่ollama/llama3.2:3bจะช่วยให้แอปพลิเคชันเก่าๆ ที่บังคับใช้ชื่อโมเดลของ OpenAI สามารถทำงานกับ Local AI ในเครื่องของคุณได้ทันทีโดยไม่ต้องแก้ไขโค้ด!
ขั้นตอนที่ 3: เปิดใช้งาน Private AI Router
รันคำสั่งเปิดตัว Proxy Server บนพอร์ต 4000:
litellm --config config.yaml --port 4000
เมื่อรันสำเร็จ คุณจะได้ประตูเชื่อมต่อ AI ส่วนตัวที่ URL: http://localhost:4000/v1
ขั้นตอนที่ 4: ทดสอบการทำงานและการเชื่อมต่อแอปพลิเคชัน
ทดสอบด้วยคำสั่ง curl
ส่งคำสั่งทดสอบไปยัง Reasoning Tier:
curl http://localhost:4000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "reasoning-model",
"messages": [{"role": "user", "content": "อธิบายหลักการทำงานของ Vector Database สั้นๆ"}]
}'
การเชื่อมต่อกับแอปในเครื่อง (Obsidian / Open WebUI / VS Code)
เพียงเปลี่ยนค่าการตั้งค่าในแอปพลิเคชันส่วนตัวของคุณดังนี้: * OpenAI API Base URL: http://localhost:4000/v1 * API Key: sk-local-anything (ใส่ข้อความอะไรก็ได้) * Model Name: เลือก fast-model, reasoning-model หรือ vision-model ตามที่ระบุไว้ใน config.yaml
3 เทคนิคขั้นสูงเพื่อเพิ่มประสิทธิภาพ Private AI Router
- ระบบสำรองอัตโนมัติ (Fallback Strategy): หากแรมการ์ดจอ (VRAM) เต็มขณะรันโมเดลใหญ่ คุณสามารถตั้งค่าใน
config.yamlให้ส่งคำสั่งย้อนกลับไปหาโมเดลขนาดเล็กชั่วคราวได้ เพื่อป้องกันไม่ให้ระบบล่ม - การจัดการ Context Window: กำหนดค่า
max_tokensและขนาดบริบทล่วงหน้าใน LiteLLM เพื่อควบคุมไม่ให้โมเดลใช้งาน RAM เกินขีดจำกัดของเครื่อง - รักษาความเป็นส่วนตัว 100% (No Telemetry): ตั้งค่าโหมดออฟไลน์เพื่อปิดการส่งข้อมูลสถิติออกภายนอกด้วยการใส่สภาพแวดล้อม
DISABLE_TELEMETRY=True
บทสรุป
การสร้าง Private Brain OS ที่สมบูรณ์แบบ ไม่ได้หยุดอยู่แค่การมีโมเดล AI ในเครื่อง แต่คือการวางสถาปัตยกรรมระบบให้ประมวลผลได้อย่างราบรื่น ชาญฉลาด และประหยัดพลังงาน
การใช้งาน LiteLLM ร่วมกับ Ollama ในฐานะ Private AI Router ช่วยให้คุณดึงพลังของโมเดลแต่ละตัวมาใช้งานได้ตรงจุด โดยไม่ต้องเสียเวลาสลับการตั้งค่าแบบ Manual อีกต่อไป ที่สำคัญคือ ข้อมูลทั้งหมดของคุณยังคงวนเวียนอยู่แค่ภายในเครื่องคอมพิวเตอร์ของคุณเอง 100% ไร้กังวลเรื่องข้อมูลรั่วไหลสู่โลกภายนอกครับ