สร้าง Private AI Router ในเครื่องตัวเอง: คู่มือตั้งค่า LiteLLM สลับโมเดลอัจฉริยะตามประเภทงานแบบออฟไลน์ 100%

เรียนรู้วิธีตั้งค่า LiteLLM เป็น AI Gateway และ Router ในเครื่องตัวเอง เพื่อสลับรันโมเดล Ollama อัตโนมัติ ทั้งโมเดลเน้นความเร็ว โมเดลคิดวิเคราะห์เชิงลึก และโมเดลวิเคราะห์ภาพ ปลอดภัย 100% ไม่ต้องพึ่งคลาวด์

Share
สร้าง Private AI Router ในเครื่องตัวเอง: คู่มือตั้งค่า LiteLLM สลับโมเดลอัจฉริยะตามประเภทงานแบบออฟไลน์ 100%

เมื่อคุณเริ่มต้นใช้งาน Local-first AI บนเครื่องคอมพิวเตอร์ส่วนตัวไปสักพัก คุณจะเริ่มสะสมโมเดลภาษา (LLM) ไว้หลากหลายตัวตามความเหมาะสมของงาน เช่น ใช้โมเดลขนาดเล็กอย่าง Llama 3.2 (3B) สำหรับงานตอบแชตทั่วไปที่ต้องการความเร็วสูง, ใช้โมเดลสายคิดวิเคราะห์อย่าง DeepSeek-R1 สำหรับงานแก้โจทย์ซับซ้อน หรือใช้ Llama 3.2 Vision สำหรับงานอ่านภาพและเอกสาร PDF

ทว่าปัญหาที่ตามมาคือการต้องคอยสลับชื่อโมเดลในแอปพลิเคชันต่างๆ (เช่น Obsidian, VS Code, Open WebUI หรือ Python scripts) อยู่ตลอดเวลา ซึ่งทั้งยุ่งยากและสิ้นเปลืองทรัพยากรการประมวลผล

ในบทความนี้ เราจะมาดูวิธีแก้ปัญหานี้ด้วยการสร้าง Private AI Router ในเครื่องตัวเองโดยใช้ LiteLLM ร่วมกับ Ollama เพื่อรวมศูนย์โมเดลทั้งหมดไว้ที่จุดเดียว และสลับการทำงานอัตโนมัติอย่างชาญฉลาดและปลอดภัยแบบ Offline 100%


Private AI Router คืออะไร และทำไมระบบ Local AI ถึงต้องการ?

Private AI Router ทำหน้าที่เป็นตัวกลาง (AI Gateway / Proxy) ที่คอยรับคำสั่ง (Requests) จากแอปพลิเคชันทั้งหมดของคุณ แล้วตัดสินใจส่งคำสั่งนั้นไปประมวลผลยังโมเดลท้องถิ่นที่เหมาะสมที่สุดในเครื่อง

เปรียบเสมือนคุณมี "ผู้จัดการส่วนตัว" คอยคัดแยกงาน: * งานทั่วไป/สรุปข้อความสั้น: ส่งให้โมเดลเบาๆ ประมวลผลเสร็จในไม่กี่วินาที * งานคิดวิเคราะห์/เขียนโค้ด: ส่งให้โมเดล Reasoning ทำงานเชิงลึก * งานประมวลผลภาพ: ส่งเข้าโมเดล Vision โดยอัตโนมัติ

ประโยชน์สำคัญคือ แอปพลิเคชันปลายทางทั้งหมดของคุณจะเชื่อมต่อกับ Endpoint เดียวกัน (http://localhost:4000/v1) ทำให้คุณไม่ต้องคอยเปลี่ยนการตั้งค่าในแอปพลิเคชันบ่อยๆ อีกต่อไป


สิ่งที่ต้องเตรียมก่อนเริ่มตั้งค่า

  1. Ollama: ติดตั้งและเปิดใช้งานเรียบร้อยแล้วในเครื่อง (http://localhost:11434)
  2. โมเดลใน Ollama: ดาวน์โหลดโมเดลที่ต้องการใช้งานไว้ในเครื่อง เช่น: bash ollama pull llama3.2:3b ollama pull deepseek-r1:14b ollama pull llama3.2-vision:11b
  3. Python (3.10+): สำหรับติดตั้งและรันแพ็กเกจ LiteLLM

ขั้นตอนที่ 1: ติดตั้ง LiteLLM Proxy

เปิด Terminal แล้วติดตั้ง LiteLLM พร้อม Proxy server ผ่านคำสั่ง:

pip install "litellm[proxy]"

LiteLLM เป็นไลบรารีโอเพนซอร์สที่ออกแบบมาเพื่อแปลง API ของโมเดลต่างๆ ให้มีรูปแบบมาตรฐานเดียวกันกับ OpenAI API ทำให้รองรับการเชื่อมต่อกับซอฟต์แวร์สาย AI เกือบทั้งหมดในปัจจุบัน


ขั้นตอนที่ 2: เขียนไฟล์กำหนดโครงสร้าง Router (config.yaml)

สร้างไฟล์ชื่อ config.yaml ในโฟลเดอร์ทำงานของคุณ เพื่อตั้งนามแฝง (Model Aliases) และตั้งค่ากฎการส่งคำสั่งไปยัง Ollama:

model_list:
  # 1. โมเดลเน้นความเร็วสำหรับงานทั่วไป (Fast Tier)
  - model_name: fast-model
    litellm_params:
      model: ollama/llama3.2:3b
      api_base: http://localhost:11434

  # 2. โมเดลเน้นการคิดวิเคราะห์เชิงลึก (Reasoning Tier)
  - model_name: reasoning-model
    litellm_params:
      model: ollama/deepseek-r1:14b
      api_base: http://localhost:11434

  # 3. โมเดลอ่านภาพและเอกสาร (Vision Tier)
  - model_name: vision-model
    litellm_params:
      model: ollama/llama3.2-vision:11b
      api_base: http://localhost:11434

  # 4. โมเดลสำรองเริ่มต้น (Default Fallback)
  - model_name: gpt-3.5-turbo
    litellm_params:
      model: ollama/llama3.2:3b
      api_base: http://localhost:11434

router_settings:
  routing_strategy: usage-based-routing-v2
  num_retries: 2
  request_timeout: 120
ข้อสังเกต: การตั้งนามแฝงอย่าง gpt-3.5-turbo ชี้ไปที่ ollama/llama3.2:3b จะช่วยให้แอปพลิเคชันเก่าๆ ที่บังคับใช้ชื่อโมเดลของ OpenAI สามารถทำงานกับ Local AI ในเครื่องของคุณได้ทันทีโดยไม่ต้องแก้ไขโค้ด!

ขั้นตอนที่ 3: เปิดใช้งาน Private AI Router

รันคำสั่งเปิดตัว Proxy Server บนพอร์ต 4000:

litellm --config config.yaml --port 4000

เมื่อรันสำเร็จ คุณจะได้ประตูเชื่อมต่อ AI ส่วนตัวที่ URL: http://localhost:4000/v1


ขั้นตอนที่ 4: ทดสอบการทำงานและการเชื่อมต่อแอปพลิเคชัน

ทดสอบด้วยคำสั่ง curl

ส่งคำสั่งทดสอบไปยัง Reasoning Tier:

curl http://localhost:4000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "reasoning-model",
    "messages": [{"role": "user", "content": "อธิบายหลักการทำงานของ Vector Database สั้นๆ"}]
  }'

การเชื่อมต่อกับแอปในเครื่อง (Obsidian / Open WebUI / VS Code)

เพียงเปลี่ยนค่าการตั้งค่าในแอปพลิเคชันส่วนตัวของคุณดังนี้: * OpenAI API Base URL: http://localhost:4000/v1 * API Key: sk-local-anything (ใส่ข้อความอะไรก็ได้) * Model Name: เลือก fast-model, reasoning-model หรือ vision-model ตามที่ระบุไว้ใน config.yaml


3 เทคนิคขั้นสูงเพื่อเพิ่มประสิทธิภาพ Private AI Router

  1. ระบบสำรองอัตโนมัติ (Fallback Strategy): หากแรมการ์ดจอ (VRAM) เต็มขณะรันโมเดลใหญ่ คุณสามารถตั้งค่าใน config.yaml ให้ส่งคำสั่งย้อนกลับไปหาโมเดลขนาดเล็กชั่วคราวได้ เพื่อป้องกันไม่ให้ระบบล่ม
  2. การจัดการ Context Window: กำหนดค่า max_tokens และขนาดบริบทล่วงหน้าใน LiteLLM เพื่อควบคุมไม่ให้โมเดลใช้งาน RAM เกินขีดจำกัดของเครื่อง
  3. รักษาความเป็นส่วนตัว 100% (No Telemetry): ตั้งค่าโหมดออฟไลน์เพื่อปิดการส่งข้อมูลสถิติออกภายนอกด้วยการใส่สภาพแวดล้อม DISABLE_TELEMETRY=True

บทสรุป

การสร้าง Private Brain OS ที่สมบูรณ์แบบ ไม่ได้หยุดอยู่แค่การมีโมเดล AI ในเครื่อง แต่คือการวางสถาปัตยกรรมระบบให้ประมวลผลได้อย่างราบรื่น ชาญฉลาด และประหยัดพลังงาน

การใช้งาน LiteLLM ร่วมกับ Ollama ในฐานะ Private AI Router ช่วยให้คุณดึงพลังของโมเดลแต่ละตัวมาใช้งานได้ตรงจุด โดยไม่ต้องเสียเวลาสลับการตั้งค่าแบบ Manual อีกต่อไป ที่สำคัญคือ ข้อมูลทั้งหมดของคุณยังคงวนเวียนอยู่แค่ภายในเครื่องคอมพิวเตอร์ของคุณเอง 100% ไร้กังวลเรื่องข้อมูลรั่วไหลสู่โลกภายนอกครับ

Read more

สร้าง AI Agent สำหรับการทำ Decision Log อัตโนมัติ: เปลี่ยนทุกการตัดสินใจสำคัญให้เป็นบทเรียนเพื่อการเติบโต

สร้าง AI Agent สำหรับการทำ Decision Log อัตโนมัติ: เปลี่ยนทุกการตัดสินใจสำคัญให้เป็นบทเรียนเพื่อการเติบโต

เรียนรู้วิธีใช้ AI Agent ช่วยบันทึกและวิเคราะห์การตัดสินใจสำคัญในชีวิตประจำวัน เพื่อเปลี่ยนทุกทางเลือกให้กลายเป็นฐานข้อมูลบทเรียนที่มีค่าสำหรับอนาคต

By Linn
คู่มือใช้งาน Obsidian Graph View: เปลี่ยนใยแมงมุมความรู้ให้เป็นเครื่องมือนำทางความคิดใน Second Brain

คู่มือใช้งาน Obsidian Graph View: เปลี่ยนใยแมงมุมความรู้ให้เป็นเครื่องมือนำทางความคิดใน Second Brain

Graph View ใน Obsidian ไม่ใช่แค่ภาพกราฟสวยๆ ไว้ดูเล่น มาเรียนรู้วิธีปรับแต่ง Local Graph, Color Groups และฟิลเตอร์ เพื่อเปลี่ยนเครือข่ายความรู้ให้กลายเป็นเครื่องมือนำทางความคิดจริง

By Linn
สร้าง Smart Clipboard Agent: ดักจับและคัดแยกข้อความที่คัดลอกระหว่างวัน บันทึกเข้า Obsidian อัตโนมัติด้วย Python + Ollama

สร้าง Smart Clipboard Agent: ดักจับและคัดแยกข้อความที่คัดลอกระหว่างวัน บันทึกเข้า Obsidian อัตโนมัติด้วย Python + Ollama

เปลี่ยนข้อความ โค้ด ลิงก์ และไอเดียที่คุณคัดลอกระหว่างวันให้กลายเป็นบันทึกความรู้ที่มีบริบทใน Second Brain โดยอัตโนมัติ ด้วยสคริปต์ Python คอยมอนิเตอร์คลิปบอร์ดคู่กับ Local LLM บน Ollama แบบออฟไลน์ 100%

By Linn
บอกลาคำสั่ง Docker CLI ที่ซับซ้อน: คู่มือติดตั้ง Dockge จัดการ Docker Compose บน Home Server อย่างมือโปร

บอกลาคำสั่ง Docker CLI ที่ซับซ้อน: คู่มือติดตั้ง Dockge จัดการ Docker Compose บน Home Server อย่างมือโปร

ยกระดับการจัดการคอนเทนเนอร์บน Home Server ให้ง่ายและเป็นระเบียบ ด้วย Dockge ตัวจัดการ Docker Compose สไตล์มินิมอลที่เน้นความโปร่งใส ควบคุมไฟล์ .yml ได้โดยตรง 100%

By Linn