NutriPaw — PagerDuty Incident Management

Gestión de incidentes 24/7 · API Pagos · API Nutrición · Infraestructura · Configurado por CULTIVA IA

Sistema operativo
Última sync: Jun 16, 2026 · 09:42 UTC
🔴
INC-0047 ACTIVO: API Pagos · Error rate 8.3% (umbral: 0.5%) · On-call: Carlos Méndez · Acknowledged hace 3 min · TTR estimado: 20 min
Incidentes abiertos
1
2 resueltos hoy
MTTA (tiempo respuesta)
3.2min
SLA objetivo: < 5 min ✓
MTTR (p50 resolución)
27min
SLA objetivo: < 30 min ✓
Alertas suprimidas hoy
143
Health checks / ruido filtrado
🔧
Servicios PagerDuty
API Pagos — Production
ID: PSVC_PAY · Integration key activa · Agrupación inteligente ON
critical
1 incidente abierto
API Nutrición — Production
ID: PSVC_NUT · Urgencia por horario (09-20 h) · Auto-resolve: 4h
ok
0 incidentes
Infraestructura (Redis + RDS)
ID: PSVC_INFRA · Alertas Prometheus · Ack timeout: 30 min
ok
0 incidentes
Configuración del servicio (curl)
# Crear servicio API Pagos con política de escalado curl -X POST "https://api.pagerduty.com/services" \ -H "Authorization: Token token=${PD_API_KEY}" \ -d '{"service": { "name": "API Pagos — Production", "escalation_policy": {"id": "PESC001"}, "alert_grouping_parameters": {"type": "intelligent"}, "auto_resolve_timeout": 14400, "acknowledgement_timeout": 1800 }}'
📢
Política de Escalado — NutriPaw Platform
1
On-call primario (rotación)
Inmediato
📅 Horario: Platform Team Primary On-Call · PSCHED01
→ Esta semana: Carlos Méndez
2
Escalado automático
+10 min sin respuesta
👥 Horario secundario (todos los miembros alertados)
Ana García + Laura Torres en paralelo
3
Escalado CTO
+15 min adicionales
🔴 Marcos Vidal — CTO (PXYZ789)
2 repeticiones de bucle antes de bridge call
Configuración: repeat_enabled=true · num_loops=2 · Notificaciones: SMS + Email + App
📅
Horario de Guardia — Semana 24 (16–22 Jun 2026) · Rotación semanal
LUN
CMéndez
MAR
CMéndez
MIÉ
CMéndez
JUE
CMéndez
VIE
CMéndez
SÁB
CMéndez
DOM
CMéndez
↳ Sem 25 (23–29 Jun): Ana García  ·  Sem 26 (30 Jun–6 Jul): Laura Torres
Carlos Méndez — DevOps (sem actual)
Ana García — Backend Lead
Laura Torres — Full-stack
Restricciones: Turno partido 09:00–18:00 (16h laborables) / Noches: solo critical urgency pasa filtro · rotation_turn_length: 604800s (7 días)
🚨
Incidentes — Últimas 24h
ID Resumen Servicio Severidad Estado TTR
INC-0047
Error rate 8.3% en /api/charge
Prometheus · hace 18 min
pagos ● Critical Acknowledged
INC-0046
Redis conn pool > 90%
hace 3h 22min
infra ● High Resolved 24 min
INC-0045
P99 latencia nutrición > 800ms
hace 7h 10min
nutrición ● Low Resolved 31 min
# Listar incidentes abiertos curl -s "https://api.pagerduty.com/incidents?statuses[]=triggered&statuses[]=acknowledged" \ -H "Authorization: Token token=${PD_API_KEY}" | \ jq '.incidents[] | {id, title, status, urgency}'
Orquestación de Eventos
Reglas activas (router)
Enrutar alertas de pagos
IF event.component contains "payment" → PSVC_PAY
Enrutar alertas de nutrición
IF event.component contains "nutrition" → PSVC_NUT
Suprimir health checks
IF summary contains "health check" → SUPPRESS
Suprimir deploys informativos
IF class == "deployment_info" → SUPPRESS
Enriquecer con runbook
IF severity == "critical" → ADD runbook link
Catch-all → PSVC_DEFAULT
Resto de eventos → infraestructura
Resultado de hoy
143 health checks suprimidos · 8 alertas enriquecidas · 3 enrutadas correctamente · 0 escalados perdidos
📋
Runbook activo — INC-0047: Error rate API Pagos
Generado automáticamente por PagerDuty + Nota de Carlos Méndez
Pasos de respuesta
1
Verificar Grafana: Panel "Payments Overview" · Observar error rate por endpoint /api/charge y /api/refund
2
Revisar logs: kubectl logs -n prod -l app=payment-api --tail=200
3
Verificar Stripe: Dashboard Stripe → Error rate webhooks, posible fallo de conexión externa
4
RDS connection pool: Revisar CloudWatch · pg_stat_activity · si saturado → pgbouncer reload
5
Si no resuelto en 20 min: Escalar automáticamente a Ana García + notificar a Marcos Vidal
Nota del on-call (Carlos Méndez · hace 3 min)
"Identificada causa raíz: agotamiento del pool de conexiones a RDS (100/100 activas). Escalando de 100 → 200 conexiones. Monitorizando recovery en Grafana. ETA resolución: ~15 min."
Enviado vía API: POST /incidents/INC-0047/notes
Alert payload enviado desde Prometheus
POST events.pagerduty.com/v2/enqueue "routing_key": "r1kXnuPaY..." "event_action": "trigger" "dedup_key": "payment/high-error-rate/prod" "severity": "critical" "error_rate": "8.3%" (umbral: 0.5%) "runbook": "wiki.nutripaw.io/runbooks/..."
Configuración generada por CULTIVA IA · Skill: pagerduty-gestion-incidentes · Cliente: NutriPaw SaaS · Jun 2026
Stack: PagerDuty API v2 + Events API v2 + Prometheus Alertmanager · MTTA actual: 3.2 min (SLA < 5 min ✓)