NovaMind — Auditoría de Costes LLM

Informe ejecutivo · Modo: Cost Audit + Optimize Existing System · Generado por Optimizador de Costes LLM
Auditoría Completa 12 jun 2025
⚠️

6 FLAGS CRÍTICOS DETECTADOS — Acción inmediata requerida

NovaMind gasta €8.400/mes con un perfil de monocultura GPT-4o. El 100% del tráfico va al modelo más caro independientemente de la complejidad. Sin logging de tokens ni alertas activas, el gasto puede escalar sin detección. Ahorro proyectado aplicando este plan: €5.040/mes (60%).

Gasto actual
€8.400
por mes · solo APIs LLM
↑ Sin techo configurado
Objetivo 60 días
€3.360
objetivo ≤ €3.400/mes
↓ Viable con este plan
Ahorro mensual
€5.040
€60.480 anualizados
↓ −60% en gasto
Score actual
18/100
eficiencia de coste LLM
⚑ 6 flags críticos abiertos
1
Flags proactivos detectados
Severidad Señal detectada Acción requerida Ahorro est. Confianza
CRÍTICO Sin logging de tokens por request. No hay visibilidad de coste por feature ni por usuario. Implementar logging schema (modelo, tokens in/out, latencia, feature, coste) antes de cualquier otra acción. Deliverable #1. Base necesaria Verificado
CRÍTICO Monocultura GPT-4o. El 100% del tráfico va al modelo más caro. brand-voice-check (sí/no) usa el mismo modelo que content-generator. Iniciar diseño de capa de routing esta semana. Routing del 65% del tráfico a modelos baratos. €4.200/mes Verificado
CRÍTICO System prompt de 3.400 tokens enviado en cada request. Multiplicador de coste oculto en todos los endpoints. Activar cache_control (Anthropic) o prompt caching (OpenAI). Target hit rate >60%. €840/mes Verificado
ALTO max_tokens global a 2.000 para todos los endpoints. headline-optimizer solo necesita ~120 tokens; está regalando 1.880 tokens potenciales por request. Fijar max_tokens por endpoint según p95 observado: headline=200, brand-voice=100, support=500, content=1500, seo=1800. €420/mes Verificado
ALTO Usuarios Starter consumen GPT-4o igual que usuarios Scale. ~40% del tráfico es de usuarios gratis en el modelo premium. Asignar GPT-4o-mini o Haiku a tier Starter en todos los endpoints excepto content-generator. €336/mes Estimado
ALTO Sin alertas de coste configuradas. Picos de gasto pasan desapercibidos días. Configurar alerta p95 coste-por-request + alerta de gasto diario al 80% del límite. Semana 1. Protección Verificado
2
Distribución del gasto actual

Gasto por feature (% del total €8.400/mes)

content-generator41% · €3.444
seo-brief28% · €2.352
headline-optimizer14% · €1.176
brand-voice-check10% · €840
chat-support7% · €588

Requests diarios y coste unitario (aprox.)

brand-voice-check5.200 req/día · €0,005
headline-optimizer3.600 req/día · €0,011
content-generator1.200 req/día · €0,096
chat-support900 req/día · €0,022
seo-brief480 req/día · €0,163
20/80 identificado: content-generator + seo-brief representan el 69% del gasto (€5.796/mes) con solo 1.680 requests/día. Son los targets primarios de optimización.
3
Diseño de routing de modelos — Ahorro proyectado: €4.200/mes
Feature Complejidad Modelo actual Modelo recomendado Tier usuario Ahorro est. Calidad
brand-voice-check
5.200 req/día · sí/no + nota
Simple GPT-4o GPT-4o-mini Todos −85% Sin degradación
headline-optimizer
3.600 req/día · 5 titulares
Simple GPT-4o GPT-4o-mini Todos −85% Sin degradación
chat-support
900 req/día · soporte interno
Simple GPT-4o Claude Haiku 3.5 Todos −80% Sin degradación
seo-brief
480 req/día · brief estructurado
Medio GPT-4o Claude Sonnet 4 Growth + Scale −30% Equivalente
seo-brief
Starter tier
Simple GPT-4o GPT-4o-mini Starter −85% Aceptable
content-generator
1.200 req/día · borradores largos
Complejo GPT-4o GPT-4o (Scale)
Sonnet 4 (Growth)
Scale / Growth −40% Verificar A/B
# routing_classifier.py — regla de routing por endpoint + tier def route_model(endpoint: str, user_tier: str, input_tokens: int = 0) -> str: if endpoint in ["brand-voice-check", "headline-optimizer"]: return "gpt-4o-mini" # simple · sin excepción de tier if endpoint == "chat-support": return "claude-haiku-3-5-20241022" if endpoint == "seo-brief": return "gpt-4o-mini" if user_tier == "starter" else "claude-sonnet-4-5" if endpoint == "content-generator": return "gpt-4o" if user_tier == "scale" else "claude-sonnet-4-5" return "gpt-4o-mini" # fallback seguro
4
Estrategia de prompt caching — Ahorro proyectado: €840/mes

Análisis del system prompt actual

Tokens del system prompt3.400 tokens
Requests/día totales11.380
Tokens input total/día (solo system)38,7M tokens
Coste diario del system prompt~€46/día
Estado del cachingNO ACTIVADO
Target hit rate con caching>70%
Ahorro esperado con hit rate 70%€32/día · €966/mes

Implementación: cache_control Anthropic

El system prompt es estático para todos los usuarios. Activar cache_control: {type:"ephemeral"} en el primer bloque de contenido. Los tokens cacheados cuestan 10% del precio normal.
messages=[{ "role": "user", "content": [{ "type": "text", "text": SYSTEM_PROMPT, # 3.400 tokens "cache_control": {"type": "ephemeral"} },{ "type": "text", "text": user_message # variable }] }]
5
Control de longitud de salida + compresión de prompts — Ahorro: €420/mes

max_tokens por endpoint (actual vs. recomendado)

Endpoint
Actual
Target
Ahorro
content-generator
2.000
1.500
−25%
seo-brief
2.000
1.800
−10%
headline-optimizer
2.000
200
−90%
brand-voice-check
2.000
100
−95%
chat-support
2.000
500
−75%
Antes — headline-optimizer (78 tokens)
Por favor, genera cuidadosamente 5 titulares creativos para el siguiente contenido de blog. Es importante que recuerdes que siempre debes usar un tono profesional pero cercano. Asegúrate de que todos los titulares sean únicos y atractivos.
Tokens: 78  ·  Filler: ~55%
Después — headline-optimizer (22 tokens)
Genera 5 titulares para este post. Tono profesional-cercano. Únicos y atractivos.
Tokens: 22  ·  Ahorro: −72%
Regla de compresión: Comprimir filler ("por favor", "cuidadosamente", "es importante que recuerdes"), redundancias y contexto ya presente en el system prompt. Nunca comprimir instrucciones de tarea específicas.
6
Hoja de ruta de implementación — 60 días
Sem 1

Logging de tokens por request (Deliverable #1 — bloqueante)

Implementar schema: model, input_tokens, output_tokens, latency_ms, endpoint, user_tier, cost_eur. Sin esto no se puede medir el impacto de ninguna otra acción. Owner: Backend. Deadline: D+5.

Base
necesaria
Sem 1

Alertas de coste + max_tokens por endpoint

Configurar alerta p95 coste-por-request y alerta diaria al 80% del techo. Fijar max_tokens individuales por endpoint según tabla de la sección 5. Owner: Backend + Infra. Deadline: D+7.

€420/mes
ahorro est.
Sem 2

Activar prompt caching en system prompt (3.400 tokens)

Añadir cache_control en Anthropic; verificar hit rate en 48h. Target >60%. Si se usa OpenAI en todos los endpoints, migrar brand-voice-check y headline-optimizer a Anthropic Haiku para aprovechar caching nativo. Owner: Backend. Deadline: D+12.

€840/mes
ahorro est.
Sem 2-3

Implementar routing de modelos (4 endpoints simples)

Desplegar routing_classifier.py para brand-voice-check, headline-optimizer, chat-support y seo-brief/Starter. A/B test 20% del tráfico primero; escalar al 100% si CSAT no baja. Owner: Backend + Producto. Deadline: D+18.

€3.500/mes
ahorro est.
Sem 3-4

Routing content-generator (Growth tier → Claude Sonnet)

A/B test 2 semanas: GPT-4o vs. Claude Sonnet 4 en Growth tier. Medir: calidad percibida, CSAT, tasa de regeneración. Escalar si diferencia estadísticamente no significativa. Owner: Producto + Backend. Deadline: D+28.

€700/mes
ahorro est.
Sem 5-8

Compresión de prompts + semantic caching en chat-support

Auditar y comprimir system prompt (objetivo: <1.500 tokens). Implementar Redis + embedding cache para chat-support (cosine >0.95). Owner: IA + Backend. Deadline: D+55.

€280/mes
ahorro est.
7
Proyección de ahorro — Resumen ejecutivo
Gasto actual (julio 2025)
€8.400/mes
− Routing a modelos baratos (sem 2-3)
−€4.200/mes
− Prompt caching system prompt (sem 2)
−€840/mes
− max_tokens por endpoint (sem 1)
−€420/mes
− Compresión + semantic caching (sem 5-8)
−€280/mes
Gasto proyectado (D+60)
€2.660/mes
Objetivo marcado (≤€3.400)
✓ CUMPLIDO
−68%
reducción de costes LLM
en 60 días
€5.740/mes
€68.880 ahorro anual
8
Scorecard de eficiencia LLM (estado actual vs. objetivo)
Observabilidad
8
Sin logging activo
Routing
10
Monocultura GPT-4o
Caching
10
Caching no activado
Output Control
20
max_tokens global
Tier Control
20
Sin diferenciación
Score global: 18/100 · Objetivo a D+60: >75/100. Las 5 dimensiones tienen mejoras de alta palanca disponibles sin degradar la calidad del producto.