Comandante de Incidentes SRE
Framework completo de respuesta a incidentes operacionales (outages, degradaciones, deploys fallidos) con clasificacion de severidad SEV1-SEV4, reconstruccion de timelines y generacion de post-incident reviews estructurados. Practicas SRE/DevOps battle-tested para gestionar crisis en produccion con comunicacion stakeholder incluida.
Incluida en el Pase · para PagerDuty, Opsgenie, Datadog
// qué_hace
Clasifica la severidad de incidentes, reconstruye timelines desde logs dispersos y genera documentos PIR con frameworks RCA (5 Whys, Fishbone) y plantillas de comunicacion para stakeholders.
// cómo_lo_hace
Mediante tres scripts Python (incident_classifier, timeline_reconstructor, pir_generator) que procesan descripciones de incidentes y eventos timestamped para producir reportes estructurados y planes de accion.
// ejemplo_de_uso
Imprescindible justo después de una caída de producción para documentar qué pasó y evitar que vuelva a ocurrir. Ej.: reconstruir el timeline de un incidente de 3 horas desde logs de AWS y generar el PIR listo para enviar al cliente en 20 minutos.
// plataformas
// opiniones_de_la_comunidad
Opiniones
Cargando opiniones…