/ API Gateway — Dashboard Operativo
● SISTEMA SANO
Últimas 6 h | 30s
Prod · GCP EU-West1
Grafana 10.2
Tasa de error OK
0.28%
Umbral alerta: > 0.5%
↓ −0.04% vs hora anterior
Pods listos OK
12/12
kube_pod_status_ready
0 reinicios en 6 h
Cache hit rate (Redis) ATENCIÓN
71.4%
Umbral saludable: > 80%
↓ −8.2% vs ayer misma hora
Disponibilidad (30 d) OK
99.92%
SLA contratado: 99.9%
Downtime acumulado: 3.5 min
Latencia p50 / p95 / p99 — últimas 6 h p95 ELEVADO
800ms
p50 · 245 ms
p95 · 742 ms
p99 · 1.18 s
SLA 800ms
Latencia por endpoint
Endpoint p50 p95 Estado
/api/plan/generate 612 ms 1.48 s LENTO
/api/user/profile 42 ms 118 ms OK
/api/meals/log 85 ms 310 ms OK
/api/analytics/report 380 ms 820 ms ATENCIÓN
/api/clinic/dashboard 155 ms 498 ms OK
Requests / hora (actual) NORMAL
11.847
req/h · pico esperado: 12.000
▲ +3.2% vs semana pasada
Distribución de status HTTP (6h)
2xx Éxito 99.72%
4xx Cliente 0.18%
5xx Servidor 0.10%
Total peticiones (6 h): 71.082
Top 5 clientes por volumen (6h)
ClínicaReqErr%
Clínica Mediterránea18.4K0.1%
NutriVida Madrid12.1K0.2%
Centro Salud Activa9.8K0.6%
Dietistas Online8.3K0.1%
Clínica Wellbeing7.2K0.3%
CPU promedio (cluster) OK
58%
Umbral: 80%
Pico 6h: 72%
Memoria (cluster) OK
65%
Umbral: 85%
8.45 GB / 13 GB
PostgreSQL · query time OK
28 ms
Latencia media queries
SELECT18 ms
INSERT35 ms
UPDATE52 ms
Redis · memoria usada OK
40%
Umbral eviction: 75%
2.0 GB / 5.0 GB
Inferencia ML — latencia (p50/p95) REVISAR
520 ms
p50 inferencia
1.22 s
p95 inferencia
Modelo: nutriplan-v2.3.1 · GPU utilization: 74%
Errores de inferencia (6h) BAJO
Timeout (>3s) 14
OOM / memoria 3
Input inválido 28
Total errores: 45 de 71.082 req
Versiones de modelo en producción
VersiónTráficoErr%Estado
v2.3.195%0.06% STABLE
v2.4.0-beta5%0.12% CANARY
Canary OK
v2.4.0-beta sin degradación significativa. Promote en 48h si se mantiene.
[WARN] Redis cache hit rate < 80%
Actual: 71.4%. Posible TTL demasiado corto o nuevo patrón de acceso en /api/plan/generate. Revisar política de caché.
Hace 22 min
[WARN] /api/plan/generate p95 > 800ms
p95 = 1.48s. Correlado con latencia ML p95 = 1.22s. Cuello de botella en inferencia, no en BD.
Hace 1 h 8 min
[RESOLVED] Spike de errores 5xx · Centro Salud Activa
Error rate 0.6% → bajó a 0.1% tras reinicio de pod nutritrack-api-7. Sin impacto SLA.
Hace 3 h 42 min