ai
Ollama Local LLM Site Reliability SRE — จัดการ

Ollama LLM SRE

Ollama Local LLM Site Reliability SRE GPU Monitoring Auto-scaling Incident Response Model Management Token Throughput Production Operations
เนื้อหาเกี่ยวข้อง — แนะนำให้อ่าน REST API Design Testing Strategy QA
| Metric | SLI | SLO Target | Alert Threshold | Tool |
|---|---|---|---|---|
| Inference Latency p99 | Response time | < 5s (simple) < 30s (complex) | > 10s / > 45s | Prometheus histogram |
| Token Throughput | Tokens/second | > 30 tok/s per user | < 15 tok/s | Custom metric |
| Error Rate | 5xx / total | < 0.5% | > 1% | Prometheus counter |
| GPU Memory | VRAM usage % | < 85% | > 90% | nvidia-smi exporter |
| GPU Temperature | Celsius | < 75°C | > 80°C | nvidia-smi exporter |
| Availability | Uptime % | 99.9% | Any downtime | Blackbox exporter |

เคล็ดลับ
- VRAM: ดู VRAM ก่อนโหลด Model ใช้ ollama ps ดู Model ที่โหลดอยู่
- Parallel: ตั้ง OLLAMA_NUM_PARALLEL ตาม VRAM ที่มี ไม่ให้ OOM
- Watchdog: ใช้ systemd WatchdogSec ตรวจ Health อัตโนมัติ
- Rate Limit: ตั้ง Rate Limit ใน Nginx ป้องกัน Overload
- Backup: เก็บ Modelfile และ Config ใน Git สำหรับ Disaster Recovery
Ollama คืออะไร
Open Source Local LLM Llama Mistral Gemma Phi CodeLlama ollama run REST API GPU CUDA Metal Modelfile Custom Development Production
แนะนำเพิ่มเติม — อ่านเพิ่มเติมที่ SiamCafeBook
เนื้อหาเกี่ยวข้อง — อ่านต่อ: Skaffold Dev Code Review Best Practice
เนื้อหาเกี่ยวข้อง — Sto คืออะไร — คู่มือฉบับสมบูรณ์ 2026





