Informe de Certificación — PluginEval

Evaluación completa (3 capas) · Modo certify
2026-06-16 · 14:23:07 UTC
Capa 1 — Análisis Estático · 1.4 s
Capa 2 — Juez LLM · 52.3 s
Capa 3 — Monte Carlo N=50 · 14 min 7 s
74.6
Puntuación Compuesta
★★★ Silver
Penalización anti-patrones: ×0.90

Skill evaluada

Archivo cold-email-sequence-generator
Servicio Marketing / Cold Outreach
Líneas SKILL.md 312
Directorio references/ Ausente
Bloques de código 3
Anti-patrones detectados 2 de 6
Resultado publicación Requiere revisión
⚠️

Badge Silver — Publicación condicional

La skill supera el umbral mínimo (60) y alcanza Silver (≥70). No alcanza Gold (≥80) por dos anti-patrones detectados y triggering_accuracy en grado D. Se puede publicar con advertencia; se recomienda resolver los dos puntos críticos antes del siguiente sprint.

Capa 1 — Análisis Estático DETERMINISTA 1.4 s · sin LLM
OVER_CONSTRAINED
18 instancias de MUST / ALWAYS / NEVER detectadas. El umbral es 15. Cada instancia adicional reduce el score ×0.95; en este caso penalización = ×0.90. Fix: reducir a <10 directivas y sustituir por framing explicativo.
MISSING_TRIGGER
La descripción contiene "Use when" pero no el patrón "Use this skill when" o "Use proactively". El enrutador necesita señal sintáctica explícita para activación autónoma.
Frontmatter Quality B
0.84
Sub-check estático · feeds → triggering_accuracy
Orchestration Wiring A
0.91
Output/input documentados, 3 code blocks
Progressive Disclosure C
0.71
312 líneas en sweet-spot (200-600) pero sin references/
Structural Completeness B
0.83
5 H2/H3 headings, sección Examples presente
Token Efficiency D
0.61
18 MUST/ALWAYS/NEVER — ratio excesivo (5.8/100 líneas)
Ecosystem Coherence B
0.82
2 cross-references a skills sibling detectadas
Capa 2 — Juez LLM SONNET 4.5 · 1 JUEZ 52.3 s · kappa: N/A (1 juez)
Triggering Accuracy D
0.62
Peso: 0.25 F1 estimado: 0.60
IC 95%: [0.55 – 0.70] · Solo 6/10 test-prompts mentales activaron correctamente
Orchestration Fitness A
0.92
Peso: 0.20
IC 95%: [0.88 – 0.96] · Worker puro, sin lógica de supervisión
Output Quality B
0.81
Peso: 0.15 3 tareas simuladas
IC 95%: [0.75 – 0.87] · Instrucciones concretas, falta un edge-case de datos vacíos
Scope Calibration B
0.85
Peso: 0.12
IC 95%: [0.80 – 0.90] · Profundidad correcta para skill de nivel medio
Capa 3 — Monte Carlo N=50 SIMULACIONES 14 min 7 s · CIs Clopper-Pearson 95%
72%
Tasa de Activación
IC: [57%–84%]
0.18
CV (Consistencia)
1 − CV = 0.82
4%
Tasa de Fallo
IC: [0.5%–13.7%]
1 847
Tokens Mediana
IQR: 1 640–2 210 · 2 outliers
Score Monte Carlo compuesto
mc_score = 0.40 × 0.72 + 0.30 × (1−0.18) + 0.20 × (1−0.04) + 0.10 × max(0, 1−1847/8000)
= 0.288 + 0.246 + 0.192 + 0.077 = 0.803
Desglose Compuesto Penalización ×0.90 aplicada
Dimensión Peso Static Judge MC Blended Grade Contribución
triggering_accuracy 0.25 0.68 0.62 0.72 0.68 D +17.0 pts
orchestration_fitness 0.20 0.91 0.92 0.89 0.91 A +18.2 pts
output_quality 0.15 0.81 0.80 0.81 B +12.1 pts
scope_calibration 0.12 0.88 0.85 0.75 0.85 B +10.2 pts
progressive_disclosure 0.10 0.71 0.65 0.70 C +7.0 pts
token_efficiency 0.06 0.61 0.65 0.80 0.68 D +4.1 pts
robustness 0.05 0.78 0.80 0.79 C +4.0 pts
structural_completeness 0.03 0.83 0.79 0.82 B +2.5 pts
code_template_quality 0.02 0.80 0.88 0.83 B +1.7 pts
ecosystem_coherence 0.02 0.82 0.75 0.81 B +1.6 pts
RAW TOTAL (antes de penalización) +82.9 × 0.90 = 74.6
Ranking Elo BRADLEY-TERRY · CORPUS 2.022 SKILLS
1 518
Rating Elo actual
IC 95% bootstrap: [1 487 – 1 549]
54º %
Percentil corpus (pairwise win rate)
Supera al 54% del corpus activo
+18
Delta vs. última versión
Anterior: 1.500 (baseline) → +18 pts
Plan de Mejora Prioritizado — hacia Badge Gold
1. triggering_accuracy (peso 0.25, grado D) — Reescribir descripción incluyendo "Use this skill when generating cold email sequences..." + 3-4 contextos separados por coma. Coste: ~20 min. Ganancia estimada: +4.5 pts.
2. OVER_CONSTRAINED — Reducir de 18 a <10 instancias MUST/ALWAYS/NEVER. Sustituir directivas redundantes por framing explicativo. Elimina la penalización ×0.90 y recupera ~8.3 pts.
3. progressive_disclosure (peso 0.10, grado C) — Crear references/rubrics.md con ejemplos extendidos; mantener SKILL.md bajo 350 líneas. Ganancia: +1.5 pts en este dimension.
Proyección post-fix: score compuesto ≈ 83.4 — Badge Gold alcanzable en el próximo sprint.