Mejor F1 Score
0.921
exp-003 +1.0% vs baseline
Mejor AUC-ROC
0.957
exp-003 DistilBERT ×64 batch
Experimentos
6
3 arquitecturas distintas
Coste LLM Total
$6.39
OpenAI embeddings text-embedding-3-small
Tiempo Entrenamiento
18.4 min
total acumulado todos exp.
Comparativa de Experimentos
| Experimento | Modelo | LR / Params | Batch | Epochs | val_F1 | val_AUC | Precision | Recall | Train (s) | LLM Cost | Estado |
|---|---|---|---|---|---|---|---|---|---|---|---|
| exp-003 ★ Ganador | distilbert-base | 2e-5 | 64 | 8 | 0.921 | 0.957 | 0.926 | 0.916 | 612 | $1.24 | Production |
| exp-001 | distilbert-base | 2e-5 | 32 | 5 | 0.912 | 0.951 | 0.918 | 0.906 | 420 | $1.24 | Staging |
| exp-002 | distilbert-base | 3e-5 | 32 | 5 | 0.897 | 0.938 | 0.903 | 0.891 | 418 | $1.24 | Archived |
| exp-006 | MLP-3layer | 1e-3 | 128 | 20 | 0.888 | 0.932 | 0.893 | 0.883 | 47 | $0.89 | Archived |
| exp-004 | XGBoost | — | — | 300 | 0.874 | 0.921 | 0.881 | 0.867 | 18 | $0.89 | Archived |
| exp-005 | Logistic Reg | 0.01 | — | 100 | 0.842 | 0.899 | 0.849 | 0.835 | 3 | $0.89 | Archived |
val_F1 por Epoch — exp-003 (DistilBERT)
val_F1
val_AUC
train_loss
F1 Score por Modelo
Coste LLM Acumulado (OpenAI Embeddings)
Confusion Matrix — exp-003 (val set)
Model Registry — lead-intent-classifier
Production
lead-intent-classifier-prod
v1.2.0 — exp-003 · DistilBERT batch=64 epochs=8
val_F1
0.921
val_AUC
0.957
Precision
0.926
Recall
0.916
Registrado
14 Jun 2026 · 09:42
Staging
lead-intent-classifier-staging
v1.1.0 — exp-001 · DistilBERT batch=32 epochs=5
val_F1
0.912
val_AUC
0.951
Precision
0.918
Recall
0.906
Registrado
12 Jun 2026 · 15:18
RECOMENDACION DEL SISTEMA
Promover exp-003 → v1.2.0 a produccion. Mejora de +0.9pp en F1 y +0.6pp en AUC respecto al baseline (exp-001).
Con 50.000 leads/mes, esto equivale a ~450 leads clasificados correctamente adicionales por mes.
Coste de embedding identico ($1.24/exp). Archivamos exp-002 (LR demasiado alto) y baseline logistic.