Capa 1 — Análisis Estático · 1.4 s
Capa 2 — Juez LLM · 52.3 s
Capa 3 — Monte Carlo N=50 · 14 min 7 s
74.6
Puntuación Compuesta
★★★ Silver
Penalización anti-patrones: ×0.90
⚠️
Badge Silver — Publicación condicional
La skill supera el umbral mínimo (60) y alcanza Silver (≥70). No alcanza Gold (≥80) por dos anti-patrones detectados y triggering_accuracy en grado D. Se puede publicar con advertencia; se recomienda resolver los dos puntos críticos antes del siguiente sprint.
Capa 1 — Análisis Estático
DETERMINISTA
1.4 s · sin LLM
⚠
OVER_CONSTRAINED
18 instancias de MUST / ALWAYS / NEVER detectadas. El umbral es 15. Cada instancia adicional reduce el score ×0.95; en este caso penalización = ×0.90. Fix: reducir a <10 directivas y sustituir por framing explicativo.
⚠
MISSING_TRIGGER
La descripción contiene "Use when" pero no el patrón "Use this skill when" o "Use proactively". El enrutador necesita señal sintáctica explícita para activación autónoma.
0.84
Sub-check estático · feeds → triggering_accuracy
0.91
Output/input documentados, 3 code blocks
0.71
312 líneas en sweet-spot (200-600) pero sin references/
0.83
5 H2/H3 headings, sección Examples presente
0.61
18 MUST/ALWAYS/NEVER — ratio excesivo (5.8/100 líneas)
0.82
2 cross-references a skills sibling detectadas
Capa 2 — Juez LLM
SONNET 4.5 · 1 JUEZ
52.3 s · kappa: N/A (1 juez)
0.62
Peso: 0.25
F1 estimado: 0.60
IC 95%: [0.55 – 0.70] · Solo 6/10 test-prompts mentales activaron correctamente
0.92
Peso: 0.20
IC 95%: [0.88 – 0.96] · Worker puro, sin lógica de supervisión
0.81
Peso: 0.15
3 tareas simuladas
IC 95%: [0.75 – 0.87] · Instrucciones concretas, falta un edge-case de datos vacíos
0.85
Peso: 0.12
IC 95%: [0.80 – 0.90] · Profundidad correcta para skill de nivel medio
Capa 3 — Monte Carlo
N=50 SIMULACIONES
14 min 7 s · CIs Clopper-Pearson 95%
72%
Tasa de Activación
IC: [57%–84%]
0.18
CV (Consistencia)
1 − CV = 0.82
4%
Tasa de Fallo
IC: [0.5%–13.7%]
1 847
Tokens Mediana
IQR: 1 640–2 210 · 2 outliers
Score Monte Carlo compuesto
mc_score = 0.40 × 0.72 + 0.30 × (1−0.18) + 0.20 × (1−0.04) + 0.10 × max(0, 1−1847/8000)
= 0.288 + 0.246 + 0.192 + 0.077 = 0.803
Desglose Compuesto
Penalización ×0.90 aplicada
| Dimensión |
Peso |
Static |
Judge |
MC |
Blended |
Grade |
Contribución |
| triggering_accuracy |
0.25 |
0.68 |
0.62 |
0.72 |
0.68 |
D |
+17.0 pts
|
| orchestration_fitness |
0.20 |
0.91 |
0.92 |
0.89 |
0.91 |
A |
+18.2 pts
|
| output_quality |
0.15 |
— |
0.81 |
0.80 |
0.81 |
B |
+12.1 pts
|
| scope_calibration |
0.12 |
0.88 |
0.85 |
0.75 |
0.85 |
B |
+10.2 pts
|
| progressive_disclosure |
0.10 |
0.71 |
0.65 |
— |
0.70 |
C |
+7.0 pts
|
| token_efficiency |
0.06 |
0.61 |
0.65 |
0.80 |
0.68 |
D |
+4.1 pts
|
| robustness |
0.05 |
— |
0.78 |
0.80 |
0.79 |
C |
+4.0 pts
|
| structural_completeness |
0.03 |
0.83 |
0.79 |
— |
0.82 |
B |
+2.5 pts
|
| code_template_quality |
0.02 |
0.80 |
0.88 |
— |
0.83 |
B |
+1.7 pts
|
| ecosystem_coherence |
0.02 |
0.82 |
0.75 |
— |
0.81 |
B |
+1.6 pts
|
| RAW TOTAL (antes de penalización) |
|
|
+82.9 × 0.90 = 74.6 |
Ranking Elo
BRADLEY-TERRY · CORPUS 2.022 SKILLS
1 518
Rating Elo actual
IC 95% bootstrap: [1 487 – 1 549]
54º %
Percentil corpus (pairwise win rate)
Supera al 54% del corpus activo
+18
Delta vs. última versión
Anterior: 1.500 (baseline) → +18 pts
Plan de Mejora Prioritizado — hacia Badge Gold
1.
triggering_accuracy (peso 0.25, grado D) — Reescribir descripción incluyendo "Use this skill when generating cold email sequences..." + 3-4 contextos separados por coma. Coste: ~20 min. Ganancia estimada: +4.5 pts.
2.
OVER_CONSTRAINED — Reducir de 18 a <10 instancias MUST/ALWAYS/NEVER. Sustituir directivas redundantes por framing explicativo. Elimina la penalización ×0.90 y recupera ~8.3 pts.
3.
progressive_disclosure (peso 0.10, grado C) — Crear references/rubrics.md con ejemplos extendidos; mantener SKILL.md bajo 350 líneas. Ganancia: +1.5 pts en este dimension.
→
Proyección post-fix: score compuesto ≈ 83.4 — Badge Gold alcanzable en el próximo sprint.