Evaluación LLM — CultivaBot

Framework de evaluación automatizada · Prompt v1 (baseline) vs Prompt v2 (candidato) · 20 test cases

CULTIVA IA — Informe interno Ejecutado: 18 Jun 2026 · 14:32 UTC
Modelo base: claude-sonnet-4-6
Aprobado para producción

Veredicto: Prompt v2 supera baseline en todas las métricas clave

La versión candidata (chain-of-thought + restricciones de alucinación) mejora el BERTScore F1 un +8.7%, la exactitud factual un +12.4% y el score promedio LLM-as-Judge un +1.3 puntos. Todos los umbrales de regresión superados. Se recomienda activar v2 en producción.

+8.7% BERTScore
+12.4% Factualidad
+1.3 LLM-Judge
Winner: v2
Métricas clave — Prompt v2
BERTScore F1
0.887
▲ +8.7% umbral >0.82 ✓
Exactitud Factual
91.2%
▲ +12.4% umbral >85% ✓
LLM-Judge promedio
8.3/10
▲ +1.3 pts umbral >7.5 ✓
BLEU Score
0.341
▲ +6.2% sin umbral formal
Comparativa de métricas
Prompt v1 (baseline)
Prompt v2 (candidato)
Métrica v1 (baseline) v2 (candidato) Δ mejora Umbral Estado
BERTScore F1
0.816
0.887
+0.071 (+8.7%) > 0.82 PASS
BERTScore Precision
0.830
0.901
+0.071 (+8.6%) INFO
BERTScore Recall
0.803
0.874
+0.071 (+8.8%) INFO
BLEU-4
0.321
0.341
+0.020 (+6.2%) INFO
ROUGE-L
0.543
0.617
+0.074 (+13.6%) INFO
Exactitud Factual (NLI)
81.1%
91.2%
+10.1pp (+12.4%) > 85% PASS
Groundedness (contexto)
0.745
0.893
+0.148 (+19.9%) PASS
Perfil de calidad — Radar multidimensional
Métricas normalizadas 0–1 · gris = v1 · verde = v2
BERTScore F1 BLEU-4 Factualidad Groundedness LLM-Judge
BERTScore F1 por categoría de pregunta
8 preguntas factuales · 7 de recomendación · 5 de proceso
Preguntas Factuales (n=8)
v1
0.790
v2
0.910
Recomendaciones (n=7)
v1
0.840
v2
0.880
Preguntas de Proceso (n=5)
v1
0.820
v2
0.860
LLM-as-Judge (Claude Sonnet 4.6) — Dimensiones de calidad
Preguntas Factuales (n=8)
Accuracy
7.5
9.2
Helpfulness
7.2
8.5
Clarity
7.0
8.2
Promedio v1 vs v2 7.28.6
Recomendaciones (n=7)
Accuracy
7.6
8.4
Helpfulness
7.9
8.8
Clarity
7.4
8.0
Promedio v1 vs v2 7.68.4
Preguntas de Proceso (n=5)
Accuracy
6.8
8.0
Helpfulness
7.1
8.3
Clarity
6.6
7.9
Promedio v1 vs v2 6.88.1
Muestras representativas — comparativa de respuestas
¿Cuánto cuesta Zapier vs Make para automatizaciones de marketing?
Factual
Referencia (gold)
Zapier parte de $19.99/mes (750 tareas/mes) y Make (antes Integromat) desde $9/mes con 10.000 operaciones. Para agencias con alto volumen, Make suele ser más económico por operación. Ambos tienen plan gratuito limitado.
Prompt v1
Zapier y Make son herramientas de automatización. Zapier tiene varios planes y Make también. Los precios varían según el uso. Debes revisar sus webs para ver los precios actuales. Ambas son buenas opciones.
BERTScore: 0.74 Judge: 5.3/10
Prompt v2
Zapier: desde $19.99/mes (750 tareas). Make: desde $9/mes (10.000 ops). Para agencias de marketing con alto volumen de automatizaciones, Make suele ofrecer mejor coste por operación. Ambas tienen plan gratuito. Recomiendo Make si superas las 2.000 tareas/mes.
BERTScore: 0.93 Judge: 9.1/10
¿Qué stack recomendarías para un chatbot RAG de agencia con bajo presupuesto?
Recomendación
Referencia (gold)
Stack low-cost RAG: Supabase (pgvector, gratis hasta 500MB), LlamaIndex o LangChain para orquestación, Claude Haiku para inferencia (~$0.25/MTok input). Deploy en Vercel/Fly.io. Coste estimado <$50/mes para 1.000 consultas diarias.
Prompt v1
Hay muchas opciones para RAG. Puedes usar Pinecone, Weaviate, Qdrant o pgvector. Para el LLM puedes usar OpenAI, Claude o modelos open source. LangChain es popular para orquestación. Depende de tus necesidades específicas.
BERTScore: 0.81 Judge: 6.8/10
Prompt v2
Para bajo presupuesto recomiendo: Supabase+pgvector (gratuito, sin infra), LlamaIndex para orquestación RAG, Claude Haiku para respuestas ($0.25/MTok). Deploy en Vercel (gratis). Total estimado: <$50/mes para 1.000 consultas/día. Evita Pinecone al inicio — añade coste sin necesidad.
BERTScore: 0.91 Judge: 9.0/10
¿Cómo implemento streaming en respuestas de Claude para mejor UX?
Proceso
Referencia (gold)
Usa `client.messages.stream()` de anthropic-sdk. En el backend itera los eventos `text_delta` y envíalos vía SSE (Server-Sent Events). En el frontend usa `EventSource` o `fetch` con `ReadableStream`. Reduce TTFB percibido un 60-70% en respuestas largas.
Prompt v1
Para streaming con Claude necesitas usar la API de Anthropic. Existe un modo de streaming que devuelve los tokens progresivamente. Esto mejora la experiencia de usuario. Puedes consultar la documentación de Anthropic para ver cómo implementarlo.
BERTScore: 0.77 Judge: 5.9/10
Prompt v2
Usa `client.messages.stream()` en el SDK de Anthropic. Itera eventos `text_delta` y envíalos por SSE al frontend. En React, lee con `ReadableStream`. Esto reduce el tiempo-a-primer-token percibido ~65%. Para Next.js usa Route Handlers con `new Response(readable)`.
BERTScore: 0.89 Judge: 8.7/10
A/B Test — Significación estadística
BERTScore F1 — t-test (Welch)
Media v1 (baseline) 0.816 ± 0.043
Media v2 (candidato) 0.887 ± 0.031
Diferencia absoluta +0.071
p-value 0.0023 ✓ sig.
Cohen's d 1.89 (large effect)
Mejora relativa +8.7%
Winner Prompt v2 ★
p-value = 0.0023α = 0.05
α=0.05
Exactitud Factual — t-test (Welch)
Media v1 (baseline) 0.811 ± 0.062
Media v2 (candidato) 0.912 ± 0.038
Diferencia absoluta +0.101
p-value 0.0008 ✓ sig.
Cohen's d 2.02 (large effect)
Mejora relativa +12.4%
Winner Prompt v2 ★
p-value = 0.0008α = 0.05
α=0.05
Detección de regresiones (umbral: -5%)
Métrica Baseline Actual (v2) Δ relativo ¿Regresión? Estado
BERTScore F1 0.816 0.887 +8.7% No OK
BLEU-4 0.321 0.341 +6.2% No OK
ROUGE-L 0.543 0.617 +13.6% No OK
Exactitud Factual 81.1% 91.2% +12.4% No OK
Groundedness 0.745 0.893 +19.9% No OK
LLM-Judge (avg) 7.0 8.3 +18.6% No OK
Resultado: 0 regresiones detectadas en 6 métricas monitorizadas. Prompt v2 es seguro para activar en producción.
Evaluación humana — Inter-rater agreement
Coeficiente Kappa de Cohen (3 evaluadores)
0.70
Substantial agreement ✓

κ = 0.70 supera el objetivo κ > 0.60

Evaluadores: Ana R., David M., Lucía P.

Escala: 1–5 en exactitud, relevancia, coherencia

Kappa por par de evaluadores:
Ana ↔ Davidκ = 0.74
Ana ↔ Lucíaκ = 0.68
David ↔ Lucíaκ = 0.67
Incidencias detectadas por evaluadores humanos
Errores factuales v1: 9 casos v2: 2 casos
Alucinaciones (info inventada) v1: 7 casos v2: 1 caso
Respuestas fuera de tema v1: 4 casos v2: 1 caso
Respuestas vagas/sin detalle v1: 12 casos v2: 3 casos
Contenido no seguro v1: 0 casos v2: 0 casos
Total incidencias: 32 en v17 en v2 (−78%)