ai
Ollama Local LLM Site Reliability SRE — จัดการ

Ollama LLM SRE

Ollama Local LLM Site Reliability SRE GPU Monitoring Auto-scaling Incident Response Model Management Token Throughput Production Operations
| Metric | SLI | SLO Target | Alert Threshold | Tool |
|---|---|---|---|---|
| Inference Latency p99 | Response time | < 5s (simple) < 30s (complex) | > 10s / > 45s | Prometheus histogram |
| Token Throughput | Tokens/second | > 30 tok/s per user | < 15 tok/s | Custom metric |
| Error Rate | 5xx / total | < 0.5% | > 1% | Prometheus counter |
| GPU Memory | VRAM usage % | < 85% | > 90% | nvidia-smi exporter |
| GPU Temperature | Celsius | < 75°C | > 80°C | nvidia-smi exporter |
| Availability | Uptime % | 99.9% | Any downtime | Blackbox exporter |

เคล็ดลับ
- VRAM: ดู VRAM ก่อนโหลด Model ใช้ ollama ps ดู Model ที่โหลดอยู่
- Parallel: ตั้ง OLLAMA_NUM_PARALLEL ตาม VRAM ที่มี ไม่ให้ OOM
- Watchdog: ใช้ systemd WatchdogSec ตรวจ Health อัตโนมัติ
- Rate Limit: ตั้ง Rate Limit ใน Nginx ป้องกัน Overload
- Backup: เก็บ Modelfile และ Config ใน Git สำหรับ Disaster Recovery
Ollama คืออะไร
Open Source Local LLM Llama Mistral Gemma Phi CodeLlama ollama run REST API GPU CUDA Metal Modelfile Custom Development Production





