Estado actual del servicio
SLI Disponibilidad
99,85%
SLI Latencia p95
99,40%
Error Budget Restante
-50%
Burn Rate (1h)
1,8×
Presupuesto de Errores (28 días)
Disponibilidad · SLO 99,9%
−50%
Permitido: 43,2 min/mes ·
Consumido: 64,8 min ·
Presupuesto agotado — 21,6 min en deuda
Latencia p95 · SLO 99,0%
+140%
Permitido: 1% requests lentos ·
Actual: 0,6% ·
Superávit: 0,4pp (presupuesto sobrante: 40%)
Política de error budget
100%
Velocidad de desarrollo normal · deploys sin restricción
50%
Revisar cambios de riesgo · evitar migraciones de BD
10%
Congelar cambios no críticos · activar on-call 24/7
0%
Feature freeze · foco 100% en fiabilidad ← ESTADO ACTUAL
Análisis de Burn Rate por ventana temporal
Disponibilidad — Tasa de consumo vs umbrales
5m
0,19×
30m
0,38×
1h
1,8×
6h
1,5×
28d
1,5×
| Fast burn (14,4×) → critical
| Slow burn (6×) → warning
Sparkline SLI disponibilidad — últimas 4 semanas
19 May
26 May
2 Jun
9 Jun
Hoy
SLOs definidos — FlowMetrics API v2
| SLO | SLI (PromQL) | Target | Actual | Estado |
|---|---|---|---|---|
| api_availability | rate(http_requests{status!~"5.."}[28d]) / rate(...) | 99,9% | 99,85% | BREACH |
| api_latency_p95 | rate(http_req_duration_bucket{le="0.5"}[28d]) / rate(...) | 99,0% | 99,4% | OK |
| write_durability | storage_writes_successful / storage_writes_total | 99,99% | 99,997% | OK |
Tabla de referencia SLO (downtime mensual)
| SLO% | Downtime/mes | Downtime/año | Error budget/mes |
|---|---|---|---|
| 99,0% | 7,2 h | 3,65 días | 43.200 s |
| 99,9% ← FM API | 43,2 min | 8,76 h | 2.592 s |
| 99,95% | 21,6 min | 4,38 h | 1.296 s |
| 99,99% | 4,32 min | 52,56 min | 259 s |
Reglas de alerta — Burn Rate multiventana
SLOErrorBudgetBurnFast · CRITICAL
slo:availability:burn_rate_1h > 14.4 AND slo:availability:burn_rate_5m > 14.4
Consume 2% del presupuesto en 1 hora.
Se activa a los 2 min. Página al equipo de guardia inmediatamente.
Severidad: critical
SLOErrorBudgetBurnSlow · WARNING
slo:availability:burn_rate_6h > 6 AND slo:availability:burn_rate_30m > 6
Consume 5% del presupuesto en 6 horas.
Se activa a los 15 min. Slack al equipo de SRE.
Severidad: warning
SLOErrorBudgetExhausted · CRITICAL
slo:availability:error_budget_remaining < 0
Presupuesto agotado · ESTADO ACTUAL.
Feature freeze activado. Escalar a CTO.
Severidad: critical
Recording rules — Prometheus YAML
# groups: sli_rules
- record: sli:http_availability:ratio
expr: |
sum(rate(http_requests_total{status!~"5.."}[28d]))
/ sum(rate(http_requests_total[28d]))
- record: slo:http_availability:error_budget_remaining
expr: |
(sli:http_availability:ratio - 0.999)
/ (1 - 0.999) * 100
- record: slo:http_availability:burn_rate_1h
expr: |
(1 - sum(rate(http_requests_total{status!~"5.."}[1h]))
/ sum(rate(http_requests_total[1h])))
/ (1 - 0.999)
Plan de accion — Presupuesto agotado · Feature Freeze activo
Inmediato (hoy)
- ✕ Congelar todos los deploys a produccion
- ✕ Revisar logs de errores 5xx (ultimas 4h)
- ✕ Identificar top-3 endpoints con mayor tasa de error
- ✕ Escalar a CTO y Head of Engineering
Esta semana
- ● Postmortem del incidente del 2-3 Jun
- ● Revisar pool de conexiones DB (timeout 30s)
- ● Implementar circuit breaker en /events/ingest
- ● Aumentar replicas del API Gateway a x4
Proximo mes
- ✓ Revisar SLO: <99,9% hasta recuperar 80% presupuesto
- ✓ Implementar canary releases (5%→25%→100%)
- ✓ SLO para write_durability en Grafana
- ✓ Alertas de PagerDuty multiventana automatizadas