Prometheus y Alertmanager · Metricas + Alertas
El corazon del observability stack. Prometheus recolecta metricas de cada componente y evalua reglas de alerta. Alertmanager recibe las alertas disparadas y las enruta a n8n para su procesamiento automatico con LLM.
Scrape Jobs
Prometheus recolecta metricas de 7 endpoints via HTTP. Cada 15 segundos, consulta /metrics en cada target y almacena las series temporales en su TSDB con 15 dias de retencion.
prometheuslocalhost:9090node-exporternode-exporter:9100kube-state-metricskube-state-metrics:8080n8nn8n:5678alertmanageralertmanager:9093jenkinsjenkins:8080grafanagrafana:3000Reglas de Alerta
Siete reglas cubren los escenarios de fallo mas comunes. Cada regla tiene un severity (critical/warning) que Alertmanager usa para decidir la ruta.
PodCrashLoopingcriticalfor: 5mkube_pod_container_status_waiting_reason == 'CrashLoopBackOff'HighMemoryUsagewarningfor: 5mnode_memory_MemAvailable_bytes / node_memory_MemTotal_bytes * 100 < 15DiskSpaceLowwarningfor: 5mnode_filesystem_avail_bytes / node_filesystem_size_bytes * 100 < 20N8nDowncriticalfor: 2mup{job='n8n'} == 0GrafanaSLOBreachwarningfor: 5mavg_over_time(up{job='grafana'}[30d]) * 100 < 99.9HighCPUwarningfor: 10m100 - (avg(rate(node_cpu_seconds_total{mode='idle'}[5m])) * 100) > 80ServiceDowncriticalfor: 2mup == 0De estas 7 reglas, 2 disparan el loop de respuesta a incidentes (PodCrashLooping y ServiceDown), 4 monitorean la salud del sistema (HighCPU, HighMemoryUsage, DiskSpaceLow, N8nDown), y 1 monitorea el SLO de Grafana.
Alertmanager: Enrutamiento a n8n
Alertmanager recibe las alertas de Prometheus y las enruta segun severity. Todas las alertas —criticas y warnings— terminan en el mismo webhook de n8n. La diferencia esta en la agrupacion.
severity: criticalgroup_wait: 10sseverity: warninggroup_wait: 30sdefaultgroup_wait: 30sreceivers:
- name: n8n-webhook
webhook_configs:
- url: http://n8n.aiops.svc.cluster.local:5678/webhook/alertmanager
send_resolved: true
route:
receiver: n8n-webhook
routes:
- match:
severity: critical
group_wait: 10s
receiver: n8n-webhook send_resolved: true es clave: cuando una alerta se resuelve, Alertmanager envia una segunda notificacion a n8n con status 'resolved'. El workflow de n8n puede usar esto para cerrar incidentes o notificar que el sistema se recupero.
Siguiente: Loki y Grafana Alloy
Las metricas cubren el QUE. Los logs cubren el POR QUE. Loki almacena los logs del cluster y Alloy los recolecta de cada pod.