ai

Ollama Local LLM Site Reliability SRE — จัดการ

ollama local llm site reliability sre
Ollama Local LLM Site Reliability SRE — จัดการ

Ollama LLM SRE

Ollama Local LLM Site Reliability SRE — จัดการ

Ollama Local LLM Site Reliability SRE GPU Monitoring Auto-scaling Incident Response Model Management Token Throughput Production Operations

เนื้อหาเกี่ยวข้อง — แนะนำให้อ่าน REST API Design Testing Strategy QA

MetricSLISLO TargetAlert ThresholdTool
Inference Latency p99Response time< 5s (simple) < 30s (complex)> 10s / > 45sPrometheus histogram
Token ThroughputTokens/second> 30 tok/s per user< 15 tok/sCustom metric
Error Rate5xx / total< 0.5%> 1%Prometheus counter
GPU MemoryVRAM usage %< 85%> 90%nvidia-smi exporter
GPU TemperatureCelsius< 75°C> 80°Cnvidia-smi exporter
AvailabilityUptime %99.9%Any downtimeBlackbox exporter
Ollama Local LLM Site Reliability SRE — จัดการ

เคล็ดลับ

  • VRAM: ดู VRAM ก่อนโหลด Model ใช้ ollama ps ดู Model ที่โหลดอยู่
  • Parallel: ตั้ง OLLAMA_NUM_PARALLEL ตาม VRAM ที่มี ไม่ให้ OOM
  • Watchdog: ใช้ systemd WatchdogSec ตรวจ Health อัตโนมัติ
  • Rate Limit: ตั้ง Rate Limit ใน Nginx ป้องกัน Overload
  • Backup: เก็บ Modelfile และ Config ใน Git สำหรับ Disaster Recovery

Ollama คืออะไร

Open Source Local LLM Llama Mistral Gemma Phi CodeLlama ollama run REST API GPU CUDA Metal Modelfile Custom Development Production

แนะนำเพิ่มเติม — อ่านเพิ่มเติมที่ SiamCafeBook

เนื้อหาเกี่ยวข้อง — อ่านต่อ: Skaffold Dev Code Review Best Practice

เนื้อหาเกี่ยวข้อง — Sto คืออะไร — คู่มือฉบับสมบูรณ์ 2026

XM Legend · เทรดเดอร์ & ผู้สอน Forex 13 ปี

ผู้ก่อตั้ง SiamCafe ตั้งแต่ปี 1997 · เทรดเดอร์สาย Forex มากกว่า 13 ปี ได้รับการยกย่องเป็น XM Legend · แบ่งปันความรู้ Forex, ไอที, AI และการเทรด จากประสบการณ์จริงในตลาดจริง