CULTIVA IA ingeniero-senior-prompt 12 Jun 2026

Auditoría de Prompt Engineering — NutriBot SaaS

Cliente: NutriBot Clinical AI · Asistente de nutrición clínica para hospitales · Pipeline: Prompt + RAG + Agent Validation

Clarity Score (baseline)
52/100
14 issues detectados
RAG Relevance
0.03
Target >0.80 · idioma mismatch
Agent Validation
PASS
1 warning menor
Coste estimado / run
$0.0008
Min · Max $0.023
🔬

1 · Análisis del Prompt Baseline

scripts/prompt_optimizer.py · --analyze
Métricas estructurales
Clarity
52
Structure
65
Token count
448
Secciones
3
Examples: 0 ❌
Output format: None ❌
Words: 274
Issues detectados (14 total · 5 top)
structure
Sin output_format — el modelo no sabe el esquema esperado (SOAP note)
Crítico · respuestas inconsistentes en producción
ambiguity
Término subjetivo "appropriate" sin criterio definido (líneas 13, 32)
¿Cuándo usar terminología médica exactamente?
redundancy
Frase "helpful and informative" repetida 3×, "support your answers"
Token waste estimado: ~60 tokens duplicados
ambiguity
"friendly and approachable" — tono incorrecto para uso clínico profesional
Conflicto con requisito de registro médico formal
structure
Zero few-shot examples — sin referencia de formato SOAP para el modelo
Raíz principal de hallucination de referencias
Comparativa prompt original → optimizado
ANTES — 448 tokens · Clarity 52
You are a very helpful AI assistant
that helps doctors and dietitians...
- Be helpful and informative
- Use scientific evidence [repeated 3×]
- Be friendly and approachable
- Answer in a conversational way
...
Please provide a comprehensive
and helpful answer... [+ 5 bullet dupes]
# Sin output format · Sin ejemplos
DESPUÉS — 312 tokens · Clarity 78 (proyectado)
You are a clinical nutrition specialist
AI for licensed healthcare professionals.
Tone: formal, evidence-based, precise.
Always cite source guideline + year.
Format: SOAP note structure:
S: patient summary
O: nutritional parameters
A: assessment (evidence-based)
P: plan with dosages + monitoring
Only answer from {retrieved_contexts}.
# -30% tokens · output contract claro
📊

2 · Evaluación del Pipeline RAG

scripts/rag_evaluator.py · 5 preguntas clínicas
Métricas de retrieval
Context Relevance
0.03
Precision@5
0.00
Faithfulness
0.00
Groundedness
0.05
Coverage
100%
Diagnóstico clave
Las preguntas están en español pero el corpus está indexado en inglés. El evaluador léxico no encuentra overlap. Problema de idioma en embedding, no en calidad del corpus.
Por pregunta
ID Pregunta Docs Estado
q1 HC y fibra en adultos (EFSA) 3 chunks Idioma
q2 Proteína adulto 65+ sarcopenia 3 chunks Idioma
q3 Vitamina D déficit 70 años 2 chunks Idioma
q4 Objetivos DM2 (ADA 2023) 2 chunks Irrelevante
q5 Estrategia obesidad IMC 38 2 chunks Idioma
Plan de acción RAG (según metodología eval-driven)
PASO 1 · Embedding bilingüe
Reindexar el corpus con modelo multilingüe (e.g. paraphrase-multilingual-mpnet) o añadir traducción automática al pipeline de ingesta. Objetivo: relevance > 0.80.
PASO 2 · Chunking + metadata
Filtrar en pre-retrieval por fuente (EFSA/ADA/OMS) usando metadata. Añadir overlap=20% entre chunks. Implementar cross-encoder reranking.
PASO 3 · Prompt grounding
Añadir instrucción explícita: "Answer ONLY from provided context. If the context does not contain sufficient information, state that explicitly." Medir faithfulness post-cambio.
🤖

3 · Validación del Agente IA

scripts/agent_orchestrator.py · --validate + --estimate-cost
Resultado de validación: nutribot-clinical-agent v2.1.0
  • Tool wiring
    search_corpus registrado y accesible · sin config faltante
  • Loop risk
    max_iterations: 15 · No se detecta potencial de loop infinito
  • Patrón detectado: ReAct
    Flujo Think → Select Tool → Observe → Final Answer correcto
  • !
    Tool description vacía
    search_corpus no tiene description · el modelo puede no saber cuándo usarla
  • 5 herramientas con required_config vacío
    check_drug_interactions, generate_meal_plan, search_pubmed sin corpus_endpoint ni api_key
  • Tool count excesivo
    7 tools para MVP clínico — reducir a 3-4 máximo para control de coste y latencia
VALIDATION PASSED · Apto para staging. Resolver warnings antes de producción.
Estimación de coste (claude-sonnet-4-5)
Mín / run
$0.0008
101 tokens
Máx / run
$0.023
3,019 tokens
30k runs / mes
$705
Escenario máx
El escenario máximo supera el presupuesto objetivo (<0.008€/consulta). Reducir tools de 7→4 y limpiar system prompt reducirá el P95 a ~$0.008/run.
Flujo del agente (mermaid)
flowchart TD subgraph nutribot-clinical-agent A[User Query] --> B{Process} B --> C[Think] C --> D{Select Tool} D -->|search_corpus| T0[search_corpus] T0 --> E[Observe] E -->|Continue| C E -->|Done| F[Final Answer] end
🎯

4 · Plan de Acción Priorizado

Eval-gated · metodología baseline → iterate → compare