Handoff de Guardia On-Call

CULTIVA IA Platform · Equipo de Infraestructura & Backend

⚠ Incidente Activo 18 Jun 2026 · 09:00 UTC Generado por patrones-handoff-guardia v1.0
🔴
SEV2 · Incidente en Curso
agent-runner: Errores 502 Intermitentes — Pipeline de Agentes IA
Inicio: 18 Jun 2026 · 07:42 UTC  |  Duración: ~1h 18min  |  Mitigación en progreso (escalado de pods)
8%
error rate actual
ML
María López
@mlopez
▲ Saliente · 11–18 Jun 2026
HANDOFF
09:00 UTC
18 Jun 2026 (hoy)
30 min solapamiento
TOMA
CV
Carlos Vega
@cvega
▼ Entrante · 18–25 Jun 2026
🔴

Incidentes Activos

1 ACTIVO
SEV2 agent-runner: Errores 502 Intermitentes Mitigando
🕐 Inicio: 07:42 UTC hoy ⚠️ Impacto: ~8% requests fallando 🎫 Ticket: INC-2026-0618-01
  • El pipeline de agentes IA devuelve 502 Bad Gateway de forma intermitente — principalmente en workflows de más de 3 pasos.
  • Se correlaciona con el aumento del límite de concurrencia (50→80) del 2026-06-16; posible sobrecarga del servicio downstream.
  • Acción en curso: escalando pods de agent-runner de 4 → 12 réplicas (Kubernetes HPA).
  • Rate de error bajó de 22% (08:00) a 8% (09:00); tendencia positiva.
Recuperación estimada
~30 min
Próximos pasos para @cvega
  • Monitorear Grafana dashboard "Agent Runner — Error Rate" cada 5 min
  • Si error rate no cae por debajo de 2% en 30 min, escalar a @infra-manager
  • Una vez estable, abrir investigación postmortem en Notion
  • @mlopez disponible en Slack hasta las 09:30 UTC para preguntas
🟡

Investigaciones en Curso

2
Memory Leak en skill-executor Monitorizando
📅 Detectado: 14 Jun 2026 🎫 ENG-2026-047 ⚡ Sin impacto usuario aún
  • Uso de RAM crece ~12% diario en el pod skill-executor. Hoy está al 85% del límite.
  • Profiling descartó leak explícito; sospecha: connection pool a Redis no libera correctamente.
  • PR #1124 añade logging de pool abierto para identificar culpable (deployed v2.8.5).
Uso RAM actual
85%
  • Revisar logs de pool tras próximo ciclo (hoy 11:00 UTC)
  • Si RAM supera 90%: restart preventivo del pod antes de que crashe
  • Cmd: kubectl rollout restart deploy/skill-executor -n production
Latencia Elevada en Generación de PDFs Investigando
📅 Detectado: 14 Jun 2026 (post-deploy v2.9.0) 🎫 ENG-2026-048 ⚡ Afecta reportes, no crítico
  • p95 de pdf-service subió de 1.2 s a 4.8 s tras deploy de v2.9.0 (migración renderer).
  • Sospecha principal: nueva versión de wkhtmltopdf con configuración de DPI diferente genera renders más pesados.
  • Workaround temporal activo: reducido max_concurrent_pdf de 10 a 4 para evitar saturación.
  • Comparar trazas APM v2.8.x vs v2.9.0 en Grafana
  • Probar downgrade a wkhtmltopdf 0.12.6 en staging
  • Si persiste, revertir pdf-service a v2.8.4 (rollback seguro)

Resuelto Este Turno

2
Auth Service — Fallo de OAuth con Google Workspace Resuelto
📅 11 Jun 2026 · Duración: 47 min 🔑 Causa: certificado caducado 🎫 INC-2026-0611-02
Rotado certificado OAuth, renovación automática activada. Postmortem en Notion: #PM-2026-012. Follow-up: ENG-2026-041 (alertas de expiración de certs).
api-gateway — Throttling excesivo en endpoints de exportación Resuelto
📅 15 Jun 2026 · Duración: 2h 10min 🎫 INC-2026-0615-01
Rate limit subido de 100 a 250 RPM en exportaciones CSV/XLSX. Deployado api-gateway v3.1.2. Sin regresiones.
📦

Cambios Recientes

Últimos 7 días
Servicio Versión Fecha/Hora UTC Notas Riesgo
agent-runner v3.1.2 17 Jun · 11:00 Mejora retry logic — posible relación con incidente activo ⚠ Vigilar
pdf-service v2.9.0 14 Jun · 16:00 Migración renderer wkhtmltopdf — causa latencia p95 ⚠ Posible rollback
skill-executor v2.8.5 15 Jun · 09:30 Fix OAuth + logging de pool para investigación RAM Estable
api-gateway v3.1.2 15 Jun · 17:00 Rate limit exportaciones 100→250 RPM Estable
Cambios de Configuración
16 Jun: Límite de concurrencia de agentes subido de 50 → 80 tareas simultáneas (config Kubernetes)
14 Jun: Reducido max_concurrent_pdf de 10 → 4 (workaround latencia PDFs)
11 Jun: Renovación automática de certificados OAuth activada
⚠️

Problemas Conocidos y Workarounds

2
Webhook Slack (#cultiva-oncall) falla los lunes OPS-0341 · P3
Síntoma: Alertas P2 vía webhook de Slack no llegan entre 04:00–05:00 UTC los lunes (mantenimiento de Slack).
Workaround: Verificar PagerDuty directamente en ese horario. Alertas críticas (P1) van por SMS y email — esas sí llegan.
Fix definitivo: Pendiente migrar a Slack App en ENG-2026-039.
Job de limpieza de logs falla en namespace staging OPS-0312 · P3
Síntoma: CronJob log-cleaner en staging falla con OOMKilled (~2x por semana).
Workaround: Ejecutar manualmente:
kubectl delete pods -l app=log-cleaner -n staging
Fix definitivo: Aumentar memory limit en ENG-2026-043 (sprint siguiente).