FlowMetrics API — SLO Dashboard
Service Reliability Engineering · Ventana rolling 28 días
● LIVE
Actualizado: 15 Jun 2026 · 09:42 UTC
Prometheus + Grafana Cloud
Estado actual del servicio
SLI Disponibilidad
99,85%
Target SLO: 99,9% · ▼ -0,05pp
SLI Latencia p95
99,40%
Requests <500ms · Target: 99,0% · ▲ OK
Error Budget Restante
-50%
Consumido: 73.050 errores de 48.700 permitidos
Burn Rate (1h)
1,8×
Umbral fast burn: 14,4× · Normal
Presupuesto de Errores (28 días)
Disponibilidad · SLO 99,9%
−50%
Permitido: 43,2 min/mes  ·  Consumido: 64,8 min  ·  Presupuesto agotado — 21,6 min en deuda
Latencia p95 · SLO 99,0%
+140%
Permitido: 1% requests lentos  ·  Actual: 0,6%  ·  Superávit: 0,4pp (presupuesto sobrante: 40%)
100%
Velocidad de desarrollo normal · deploys sin restricción
50%
Revisar cambios de riesgo · evitar migraciones de BD
10%
Congelar cambios no críticos · activar on-call 24/7
0%
Feature freeze · foco 100% en fiabilidad ← ESTADO ACTUAL
Análisis de Burn Rate por ventana temporal
5m
0,19×
0,19×
30m
0,38×
0,38×
1h
1,8×
1,8×
6h
1,5×
1,5×
28d
1,5× acum.
1,5×
| Fast burn (14,4×) → critical | Slow burn (6×) → warning
19 May 26 May 2 Jun 9 Jun Hoy
SLOs definidos — FlowMetrics API v2
SLO SLI (PromQL) Target Actual Estado
api_availability rate(http_requests{status!~"5.."}[28d]) / rate(...) 99,9% 99,85% BREACH
api_latency_p95 rate(http_req_duration_bucket{le="0.5"}[28d]) / rate(...) 99,0% 99,4% OK
write_durability storage_writes_successful / storage_writes_total 99,99% 99,997% OK
SLO%Downtime/mesDowntime/añoError budget/mes
99,0% 7,2 h 3,65 días 43.200 s
99,9% ← FM API 43,2 min 8,76 h 2.592 s
99,95% 21,6 min 4,38 h 1.296 s
99,99% 4,32 min 52,56 min 259 s
Reglas de alerta — Burn Rate multiventana
SLOErrorBudgetBurnFast · CRITICAL
slo:availability:burn_rate_1h > 14.4 AND slo:availability:burn_rate_5m > 14.4
Consume 2% del presupuesto en 1 hora. Se activa a los 2 min. Página al equipo de guardia inmediatamente. Severidad: critical
SLOErrorBudgetBurnSlow · WARNING
slo:availability:burn_rate_6h > 6 AND slo:availability:burn_rate_30m > 6
Consume 5% del presupuesto en 6 horas. Se activa a los 15 min. Slack al equipo de SRE. Severidad: warning
SLOErrorBudgetExhausted · CRITICAL
slo:availability:error_budget_remaining < 0
Presupuesto agotado · ESTADO ACTUAL. Feature freeze activado. Escalar a CTO. Severidad: critical
# groups: sli_rules - record: sli:http_availability:ratio expr: | sum(rate(http_requests_total{status!~"5.."}[28d])) / sum(rate(http_requests_total[28d])) - record: slo:http_availability:error_budget_remaining expr: | (sli:http_availability:ratio - 0.999) / (1 - 0.999) * 100 - record: slo:http_availability:burn_rate_1h expr: | (1 - sum(rate(http_requests_total{status!~"5.."}[1h])) / sum(rate(http_requests_total[1h]))) / (1 - 0.999)
Plan de accion — Presupuesto agotado · Feature Freeze activo
Inmediato (hoy)
  • ✕ Congelar todos los deploys a produccion
  • ✕ Revisar logs de errores 5xx (ultimas 4h)
  • ✕ Identificar top-3 endpoints con mayor tasa de error
  • ✕ Escalar a CTO y Head of Engineering
Esta semana
  • ● Postmortem del incidente del 2-3 Jun
  • ● Revisar pool de conexiones DB (timeout 30s)
  • ● Implementar circuit breaker en /events/ingest
  • ● Aumentar replicas del API Gateway a x4
Proximo mes
  • ✓ Revisar SLO: <99,9% hasta recuperar 80% presupuesto
  • ✓ Implementar canary releases (5%→25%→100%)
  • ✓ SLO para write_durability en Grafana
  • ✓ Alertas de PagerDuty multiventana automatizadas