Fase 10
SLO/SLISLI Definitions · Que Medimos
Los SLIs (Service Level Indicators) son las metricas que miden la salud del sistema desde la perspectiva del usuario. Cuatro indicadores cubren disponibilidad, latencia, tasa de error y builds.
01
Indicadores
Disponibilidad de Grafana
avg_over_time(up{job='grafana'}[30d]) * 100 Porcentaje del tiempo que Grafana responde. Si Grafana esta caido, los dashboards no son accesibles y el SLO se esta consumiendo.
Latencia p95 de n8n
histogram_quantile(0.95, rate(http_request_duration_seconds_bucket{job='n8n'}[5m])) Tiempo que tarda n8n en procesar requests. Un p95 alto significa que el 5% de las requests son lentas.
Error rate de procesamiento
rate(n8n_executions_failed_total[5m]) / rate(n8n_executions_total[5m]) * 100 Porcentaje de ejecuciones de workflows que fallan. Si este SLI se dispara, las alertas no se estan procesando correctamente.
Build success rate (Jenkins)
rate(jenkins_builds_failed[24h]) / rate(jenkins_builds_total[24h]) * 100 Porcentaje de builds que fallan. Un SLI complementario sin SLO — se monitorea para detectar regresiones en el pipeline.
Por que SLIs y no solo alerts. Las alerts dicen "algo esta mal ahora". Los SLIs dicen "que tan bien estuvo funcionando el sistema en el ultimo mes". Son complementarios.
Siguiente: SLO Objectives
Los objetivos de nivel de servicio y el concepto de error budget.