🔴
Incidentes Activos
1 ACTIVO
SEV2
agent-runner: Errores 502 Intermitentes
Mitigando
- El pipeline de agentes IA devuelve 502 Bad Gateway de forma intermitente — principalmente en workflows de más de 3 pasos.
- Se correlaciona con el aumento del límite de concurrencia (50→80) del 2026-06-16; posible sobrecarga del servicio downstream.
- Acción en curso: escalando pods de
agent-runnerde 4 → 12 réplicas (Kubernetes HPA). - Rate de error bajó de 22% (08:00) a 8% (09:00); tendencia positiva.
Recuperación estimada
~30 min
Próximos pasos para @cvega
- Monitorear Grafana dashboard "Agent Runner — Error Rate" cada 5 min
- Si error rate no cae por debajo de 2% en 30 min, escalar a @infra-manager
- Una vez estable, abrir investigación postmortem en Notion
- @mlopez disponible en Slack hasta las 09:30 UTC para preguntas
🟡
Investigaciones en Curso
2
Memory Leak en skill-executor
Monitorizando
- Uso de RAM crece ~12% diario en el pod
skill-executor. Hoy está al 85% del límite. - Profiling descartó leak explícito; sospecha: connection pool a Redis no libera correctamente.
- PR #1124 añade logging de pool abierto para identificar culpable (deployed v2.8.5).
Uso RAM actual
85%
- Revisar logs de pool tras próximo ciclo (hoy 11:00 UTC)
- Si RAM supera 90%: restart preventivo del pod antes de que crashe
- Cmd:
kubectl rollout restart deploy/skill-executor -n production
Latencia Elevada en Generación de PDFs
Investigando
- p95 de
pdf-servicesubió de 1.2 s a 4.8 s tras deploy de v2.9.0 (migración renderer). - Sospecha principal: nueva versión de
wkhtmltopdfcon configuración de DPI diferente genera renders más pesados. - Workaround temporal activo: reducido max_concurrent_pdf de 10 a 4 para evitar saturación.
- Comparar trazas APM v2.8.x vs v2.9.0 en Grafana
- Probar downgrade a wkhtmltopdf 0.12.6 en staging
- Si persiste, revertir pdf-service a v2.8.4 (rollback seguro)
✅
Resuelto Este Turno
2
Auth Service — Fallo de OAuth con Google Workspace
Resuelto
Rotado certificado OAuth, renovación automática activada. Postmortem en Notion: #PM-2026-012. Follow-up: ENG-2026-041 (alertas de expiración de certs).
api-gateway — Throttling excesivo en endpoints de exportación
Resuelto
Rate limit subido de 100 a 250 RPM en exportaciones CSV/XLSX. Deployado api-gateway v3.1.2. Sin regresiones.
📦
Cambios Recientes
Últimos 7 días| Servicio | Versión | Fecha/Hora UTC | Notas | Riesgo |
|---|---|---|---|---|
| agent-runner | v3.1.2 | 17 Jun · 11:00 | Mejora retry logic — posible relación con incidente activo | ⚠ Vigilar |
| pdf-service | v2.9.0 | 14 Jun · 16:00 | Migración renderer wkhtmltopdf — causa latencia p95 | ⚠ Posible rollback |
| skill-executor | v2.8.5 | 15 Jun · 09:30 | Fix OAuth + logging de pool para investigación RAM | Estable |
| api-gateway | v3.1.2 | 15 Jun · 17:00 | Rate limit exportaciones 100→250 RPM | Estable |
Cambios de Configuración
• 16 Jun: Límite de concurrencia de agentes subido de 50 → 80 tareas simultáneas (config Kubernetes)
• 14 Jun: Reducido max_concurrent_pdf de 10 → 4 (workaround latencia PDFs)
• 11 Jun: Renovación automática de certificados OAuth activada
⚠️
Problemas Conocidos y Workarounds
2
Webhook Slack (#cultiva-oncall) falla los lunes
OPS-0341 · P3
Síntoma: Alertas P2 vía webhook de Slack no llegan entre 04:00–05:00 UTC los lunes (mantenimiento de Slack).
Workaround: Verificar PagerDuty directamente en ese horario. Alertas críticas (P1) van por SMS y email — esas sí llegan.
Fix definitivo: Pendiente migrar a Slack App en ENG-2026-039.
Workaround: Verificar PagerDuty directamente en ese horario. Alertas críticas (P1) van por SMS y email — esas sí llegan.
Fix definitivo: Pendiente migrar a Slack App en ENG-2026-039.
Job de limpieza de logs falla en namespace staging
OPS-0312 · P3
Síntoma: CronJob
Workaround: Ejecutar manualmente:
log-cleaner en staging falla con OOMKilled (~2x por semana).Workaround: Ejecutar manualmente:
kubectl delete pods -l app=log-cleaner -n staging
Fix definitivo: Aumentar memory limit en ENG-2026-043 (sprint siguiente).