สร้าง Private AI Router ในเครื่องตัวเอง: คู่มือตั้งค่า LiteLLM สลับโมเดลอัจฉริยะตามประเภทงานแบบออฟไลน์ 100%

เรียนรู้วิธีตั้งค่า LiteLLM เป็น AI Gateway และ Router ในเครื่องตัวเอง เพื่อสลับรันโมเดล Ollama อัตโนมัติ ทั้งโมเดลเน้นความเร็ว โมเดลคิดวิเคราะห์เชิงลึก และโมเดลวิเคราะห์ภาพ ปลอดภัย 100% ไม่ต้องพึ่งคลาวด์

Share
สร้าง Private AI Router ในเครื่องตัวเอง: คู่มือตั้งค่า LiteLLM สลับโมเดลอัจฉริยะตามประเภทงานแบบออฟไลน์ 100%

เมื่อคุณเริ่มต้นใช้งาน Local-first AI บนเครื่องคอมพิวเตอร์ส่วนตัวไปสักพัก คุณจะเริ่มสะสมโมเดลภาษา (LLM) ไว้หลากหลายตัวตามความเหมาะสมของงาน เช่น ใช้โมเดลขนาดเล็กอย่าง Llama 3.2 (3B) สำหรับงานตอบแชตทั่วไปที่ต้องการความเร็วสูง, ใช้โมเดลสายคิดวิเคราะห์อย่าง DeepSeek-R1 สำหรับงานแก้โจทย์ซับซ้อน หรือใช้ Llama 3.2 Vision สำหรับงานอ่านภาพและเอกสาร PDF

ทว่าปัญหาที่ตามมาคือการต้องคอยสลับชื่อโมเดลในแอปพลิเคชันต่างๆ (เช่น Obsidian, VS Code, Open WebUI หรือ Python scripts) อยู่ตลอดเวลา ซึ่งทั้งยุ่งยากและสิ้นเปลืองทรัพยากรการประมวลผล

ในบทความนี้ เราจะมาดูวิธีแก้ปัญหานี้ด้วยการสร้าง Private AI Router ในเครื่องตัวเองโดยใช้ LiteLLM ร่วมกับ Ollama เพื่อรวมศูนย์โมเดลทั้งหมดไว้ที่จุดเดียว และสลับการทำงานอัตโนมัติอย่างชาญฉลาดและปลอดภัยแบบ Offline 100%


Private AI Router คืออะไร และทำไมระบบ Local AI ถึงต้องการ?

Private AI Router ทำหน้าที่เป็นตัวกลาง (AI Gateway / Proxy) ที่คอยรับคำสั่ง (Requests) จากแอปพลิเคชันทั้งหมดของคุณ แล้วตัดสินใจส่งคำสั่งนั้นไปประมวลผลยังโมเดลท้องถิ่นที่เหมาะสมที่สุดในเครื่อง

เปรียบเสมือนคุณมี "ผู้จัดการส่วนตัว" คอยคัดแยกงาน: * งานทั่วไป/สรุปข้อความสั้น: ส่งให้โมเดลเบาๆ ประมวลผลเสร็จในไม่กี่วินาที * งานคิดวิเคราะห์/เขียนโค้ด: ส่งให้โมเดล Reasoning ทำงานเชิงลึก * งานประมวลผลภาพ: ส่งเข้าโมเดล Vision โดยอัตโนมัติ

ประโยชน์สำคัญคือ แอปพลิเคชันปลายทางทั้งหมดของคุณจะเชื่อมต่อกับ Endpoint เดียวกัน (http://localhost:4000/v1) ทำให้คุณไม่ต้องคอยเปลี่ยนการตั้งค่าในแอปพลิเคชันบ่อยๆ อีกต่อไป


สิ่งที่ต้องเตรียมก่อนเริ่มตั้งค่า

  1. Ollama: ติดตั้งและเปิดใช้งานเรียบร้อยแล้วในเครื่อง (http://localhost:11434)
  2. โมเดลใน Ollama: ดาวน์โหลดโมเดลที่ต้องการใช้งานไว้ในเครื่อง เช่น: bash ollama pull llama3.2:3b ollama pull deepseek-r1:14b ollama pull llama3.2-vision:11b
  3. Python (3.10+): สำหรับติดตั้งและรันแพ็กเกจ LiteLLM

ขั้นตอนที่ 1: ติดตั้ง LiteLLM Proxy

เปิด Terminal แล้วติดตั้ง LiteLLM พร้อม Proxy server ผ่านคำสั่ง:

pip install "litellm[proxy]"

LiteLLM เป็นไลบรารีโอเพนซอร์สที่ออกแบบมาเพื่อแปลง API ของโมเดลต่างๆ ให้มีรูปแบบมาตรฐานเดียวกันกับ OpenAI API ทำให้รองรับการเชื่อมต่อกับซอฟต์แวร์สาย AI เกือบทั้งหมดในปัจจุบัน


ขั้นตอนที่ 2: เขียนไฟล์กำหนดโครงสร้าง Router (config.yaml)

สร้างไฟล์ชื่อ config.yaml ในโฟลเดอร์ทำงานของคุณ เพื่อตั้งนามแฝง (Model Aliases) และตั้งค่ากฎการส่งคำสั่งไปยัง Ollama:

model_list:
  # 1. โมเดลเน้นความเร็วสำหรับงานทั่วไป (Fast Tier)
  - model_name: fast-model
    litellm_params:
      model: ollama/llama3.2:3b
      api_base: http://localhost:11434

  # 2. โมเดลเน้นการคิดวิเคราะห์เชิงลึก (Reasoning Tier)
  - model_name: reasoning-model
    litellm_params:
      model: ollama/deepseek-r1:14b
      api_base: http://localhost:11434

  # 3. โมเดลอ่านภาพและเอกสาร (Vision Tier)
  - model_name: vision-model
    litellm_params:
      model: ollama/llama3.2-vision:11b
      api_base: http://localhost:11434

  # 4. โมเดลสำรองเริ่มต้น (Default Fallback)
  - model_name: gpt-3.5-turbo
    litellm_params:
      model: ollama/llama3.2:3b
      api_base: http://localhost:11434

router_settings:
  routing_strategy: usage-based-routing-v2
  num_retries: 2
  request_timeout: 120
ข้อสังเกต: การตั้งนามแฝงอย่าง gpt-3.5-turbo ชี้ไปที่ ollama/llama3.2:3b จะช่วยให้แอปพลิเคชันเก่าๆ ที่บังคับใช้ชื่อโมเดลของ OpenAI สามารถทำงานกับ Local AI ในเครื่องของคุณได้ทันทีโดยไม่ต้องแก้ไขโค้ด!

ขั้นตอนที่ 3: เปิดใช้งาน Private AI Router

รันคำสั่งเปิดตัว Proxy Server บนพอร์ต 4000:

litellm --config config.yaml --port 4000

เมื่อรันสำเร็จ คุณจะได้ประตูเชื่อมต่อ AI ส่วนตัวที่ URL: http://localhost:4000/v1


ขั้นตอนที่ 4: ทดสอบการทำงานและการเชื่อมต่อแอปพลิเคชัน

ทดสอบด้วยคำสั่ง curl

ส่งคำสั่งทดสอบไปยัง Reasoning Tier:

curl http://localhost:4000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "reasoning-model",
    "messages": [{"role": "user", "content": "อธิบายหลักการทำงานของ Vector Database สั้นๆ"}]
  }'

การเชื่อมต่อกับแอปในเครื่อง (Obsidian / Open WebUI / VS Code)

เพียงเปลี่ยนค่าการตั้งค่าในแอปพลิเคชันส่วนตัวของคุณดังนี้: * OpenAI API Base URL: http://localhost:4000/v1 * API Key: sk-local-anything (ใส่ข้อความอะไรก็ได้) * Model Name: เลือก fast-model, reasoning-model หรือ vision-model ตามที่ระบุไว้ใน config.yaml


3 เทคนิคขั้นสูงเพื่อเพิ่มประสิทธิภาพ Private AI Router

  1. ระบบสำรองอัตโนมัติ (Fallback Strategy): หากแรมการ์ดจอ (VRAM) เต็มขณะรันโมเดลใหญ่ คุณสามารถตั้งค่าใน config.yaml ให้ส่งคำสั่งย้อนกลับไปหาโมเดลขนาดเล็กชั่วคราวได้ เพื่อป้องกันไม่ให้ระบบล่ม
  2. การจัดการ Context Window: กำหนดค่า max_tokens และขนาดบริบทล่วงหน้าใน LiteLLM เพื่อควบคุมไม่ให้โมเดลใช้งาน RAM เกินขีดจำกัดของเครื่อง
  3. รักษาความเป็นส่วนตัว 100% (No Telemetry): ตั้งค่าโหมดออฟไลน์เพื่อปิดการส่งข้อมูลสถิติออกภายนอกด้วยการใส่สภาพแวดล้อม DISABLE_TELEMETRY=True

บทสรุป

การสร้าง Private Brain OS ที่สมบูรณ์แบบ ไม่ได้หยุดอยู่แค่การมีโมเดล AI ในเครื่อง แต่คือการวางสถาปัตยกรรมระบบให้ประมวลผลได้อย่างราบรื่น ชาญฉลาด และประหยัดพลังงาน

การใช้งาน LiteLLM ร่วมกับ Ollama ในฐานะ Private AI Router ช่วยให้คุณดึงพลังของโมเดลแต่ละตัวมาใช้งานได้ตรงจุด โดยไม่ต้องเสียเวลาสลับการตั้งค่าแบบ Manual อีกต่อไป ที่สำคัญคือ ข้อมูลทั้งหมดของคุณยังคงวนเวียนอยู่แค่ภายในเครื่องคอมพิวเตอร์ของคุณเอง 100% ไร้กังวลเรื่องข้อมูลรั่วไหลสู่โลกภายนอกครับ

Read more

สร้าง AI Agent สกัด Knowledge Graph จากโน้ตส่วนตัว: เปลี่ยนข้อความกระจัดกระจายให้เป็นเครือข่ายความรู้ออฟไลน์ 100% ด้วย Python

สร้าง AI Agent สกัด Knowledge Graph จากโน้ตส่วนตัว: เปลี่ยนข้อความกระจัดกระจายให้เป็นเครือข่ายความรู้ออฟไลน์ 100% ด้วย Python + Ollama

เปลี่ยนเอกสารและโน้ตข้อความร้อยแก้วให้เป็น Knowledge Graph แบบโครงสร้าง (Subject-Predicate-Object) โดยอัตโนมัติ ด้วยสคริปต์ Python ร่วมกับ Local LLM ในเครื่อง ช่วยสกัดความสัมพันธ์ระหว่างความคิด เทคโนโลยี และบุคคลอย่างเป็นระบบออฟไลน์ 100%

By Linn
บอกลา Audible: คู่มือติดตั้ง Audiobookshelf เซิร์ฟเวอร์หนังสือเสียงและ eBook ส่วนตัวบน Home Server ด้วย Docker

บอกลา Audible: คู่มือติดตั้ง Audiobookshelf เซิร์ฟเวอร์หนังสือเสียงและ eBook ส่วนตัวบน Home Server ด้วย Docker

เปลี่ยนคลังหนังสือเสียงและดิจิทัลไฟล์ของคุณให้กลายเป็นเซิร์ฟเวอร์สตรีมมิ่งส่วนตัว ด้วย Audiobookshelf บน Home Server ผ่าน Docker พร้อมวิธีซิงค์ความคืบหน้าการฟังข้ามอุปกรณ์แบบเรียลไทม์

By Linn
สร้าง AI Agent สกัดและสังเคราะห์ Book Highlights: เปลี่ยนโน้ตอ่านหนังสือเป็น Book Summary อัจฉริยะใน Obsidian ด้วย Python + O

สร้าง AI Agent สกัดและสังเคราะห์ Book Highlights: เปลี่ยนโน้ตอ่านหนังสือเป็น Book Summary อัจฉริยะใน Obsidian ด้วย Python + Ollama

เปลี่ยนไฮไลต์และโน้ตย่อยจากการอ่านหนังสือให้กลายเป็น Book Summary ที่ทรงคุณค่าด้วย AI Agent ออฟไลน์ส่วนตัวที่จะสกัด Core Key Takeaways, Actionable Insights และเชื่อมโยงเข้ากับระบบ Second Brain แบบ Local 100%

By Linn
บอกลาการจำพอร์ตและ SSL หมดอายุ: คู่มือติดตั้ง Nginx Proxy Manager จัดการ Domain และ HTTPS บน Home Server ด้วย Docker

บอกลาการจำพอร์ตและ SSL หมดอายุ: คู่มือติดตั้ง Nginx Proxy Manager จัดการ Domain และ HTTPS บน Home Server ด้วย Docker

เปลี่ยนการเข้าถึงบริการบน Home Server จาก IP และพอร์ตยุ่งยาก ให้กลายเป็นชื่อโดเมนส่วนตัวพร้อมระบบ SSL (HTTPS) อัตโนมัติด้วย Nginx Proxy Manager บน Docker ทำง่ายผ่าน Web UI ไร้บรรทัดคำสั่งซับซ้อน

By Linn