Gasto por feature (% del total €8.400/mes)
Requests diarios y coste unitario (aprox.)
Análisis del system prompt actual
Implementación: cache_control Anthropic
cache_control: {type:"ephemeral"} en el primer bloque de contenido. Los tokens cacheados cuestan 10% del precio normal.max_tokens por endpoint (actual vs. recomendado)
Antes — headline-optimizer (78 tokens)
Después — headline-optimizer (22 tokens)
Logging de tokens por request (Deliverable #1 — bloqueante)
Implementar schema: model, input_tokens, output_tokens, latency_ms, endpoint, user_tier, cost_eur. Sin esto no se puede medir el impacto de ninguna otra acción. Owner: Backend. Deadline: D+5.
Alertas de coste + max_tokens por endpoint
Configurar alerta p95 coste-por-request y alerta diaria al 80% del techo. Fijar max_tokens individuales por endpoint según tabla de la sección 5. Owner: Backend + Infra. Deadline: D+7.
Activar prompt caching en system prompt (3.400 tokens)
Añadir cache_control en Anthropic; verificar hit rate en 48h. Target >60%. Si se usa OpenAI en todos los endpoints, migrar brand-voice-check y headline-optimizer a Anthropic Haiku para aprovechar caching nativo. Owner: Backend. Deadline: D+12.
Implementar routing de modelos (4 endpoints simples)
Desplegar routing_classifier.py para brand-voice-check, headline-optimizer, chat-support y seo-brief/Starter. A/B test 20% del tráfico primero; escalar al 100% si CSAT no baja. Owner: Backend + Producto. Deadline: D+18.
Routing content-generator (Growth tier → Claude Sonnet)
A/B test 2 semanas: GPT-4o vs. Claude Sonnet 4 en Growth tier. Medir: calidad percibida, CSAT, tasa de regeneración. Escalar si diferencia estadísticamente no significativa. Owner: Producto + Backend. Deadline: D+28.
Compresión de prompts + semantic caching en chat-support
Auditar y comprimir system prompt (objetivo: <1.500 tokens). Implementar Redis + embedding cache para chat-support (cosine >0.95). Owner: IA + Backend. Deadline: D+55.
en 60 días
€68.880 ahorro anual