Informe de Experimentos A/B

NeuroLearn SaaS — Plataforma de Formacion Corporativa — Junio 2026
3 experimentos Z-test t-test Calculo de muestra Intervalo de confianza
Analista: CULTIVA IA Fecha: 12 junio 2026 Skill: analista-estadistico-ab v1.0.0
2/2
Tests significativos
+25.3%
Lift max. CTA
37.202
Muestra req. Exp.2
-15.5%
Mejora onboarding
1 Test de CTA: Boton de Registro en Landing Page
Estadisticamente significativo Efecto negligible (h=0.049) 🟡 Likely
Control
"Empieza gratis" — Boton azul neutro
4,00%
168 conversiones / 4.200 visitantes
+25.3%
lift relativo
vs
★ Variante (Ganadora)
"Activa tu equipo hoy" — Boton naranja
5,01%
218 conversiones / 4.350 visitantes
p-valor
0.0243
Umbral α = 0.05 → Rechaza H0
Z-estadistico
2.252
Test Z de dos proporciones
Diferencia absoluta
+1.01pp
4,00% → 5,01%
Cohen's h
0.049
Tamano efecto: negligible

Intervalo de confianza 95% — Diferencia de proporciones (Control vs Variante)

0
-0.005 +0.001 (lim inf) +0.019 (lim sup) +0.025
IC 95%: [+0.13pp, +1.89pp] — El intervalo no incluye el cero, confirmando significancia. Rango del efecto real entre +0.13% y +1.89% absoluto.
Bottom Line
La variante "Activa tu equipo hoy" (naranja) aumenta la conversion en +1.01pp respecto al control (IC 95%: +0.13pp a +1.89pp). El resultado es estadisticamente significativo (p=0.024, Z=2.25). Sin embargo, el tamano de efecto es negligible (Cohen's h=0.049), lo que requiere evaluar el impacto practico antes de decidir el despliegue.
⚠️
DECISION: Mantener en revision — Estadisticamente significativo, pero efecto negligible (h=0.049). Evaluar impacto en negocio: con 4.200 visitas/dia, +1pp equivale a ~42 registros adicionales/dia. Si conversion a cliente de pago es >=5%, el uplift economico justifica el cambio. Desplegar si el funnel completo mejora; sin datos de calidad del lead, no desplegar solo por significancia.
Alertas de validez
⚠️ Tamano de efecto pequeno: p-valor significativo no implica importancia practica. Con muestras grandes (n>4.000), es facil obtener significancia con efectos minimos. Verificar que +1pp de conversion se traduce en valor de negocio medible.
⚠️ Calidad del lead: La metrica de registro no captura si los nuevos usuarios convierten a pago. Solicitar datos de activacion y upgrade antes de declarar ganador definitivo.
Muestra suficiente: 4.200-4.350 usuarios por variante superan el minimo recomendado para detectar efectos de este tamano con potencia >80%.
2 Calculo de Muestra — Test de Precio Plan Pro
Pre-lanzamiento MDE = +8% relativo 🟢 Plan valido

Parametros del experimento

Tasa base de upgrade12.00%
Tasa objetivo (MDE 8% rel.)12.96%
Nivel de significancia (α)0.05
Potencia estadistica (1-β)80%
Numero de variantes2
Muestra requerida / variante18.601
Muestra total requerida37.202
Calculo de duracion estimada
Con 500 usuarios activos/dia expuestos al precio:
→ 250 por variante/dia
~74 dias para alcanzar muestra minima
⚠️ Considerar incrementar trafico o reducir MDE
Recomendacion de diseno
Definir la regla de parada antes de lanzar para evitar p-hacking. No revisar resultados hasta alcanzar 18.601 por variante. Usar test de una cola si la hipotesis es directional (precio alto → menos upgrade).
Tabla de tradeoff Tamano de muestra vs Potencia (por variante)
MDE relativo Potencia 70% Potencia 75% Potencia 80% Potencia 85% Potencia 90% Potencia 95%
+4% relativo 57.549 64.712 73.183 83.715 97.972 121.163
+6% relativo 25.791 29.002 32.798 37.518 43.907 54.301
+8% relativo ◀ actual 14.627 16.448 18.601 21.278 24.901 30.796
+12% relativo 6.606 7.429 8.401 9.610 11.247 13.909
+16% relativo 3.775 4.245 4.800 5.491 6.426 7.947
Bottom Line
Para detectar un efecto del +8% relativo en la tasa de upgrade (12% → 12,96%) con α=0.05 y potencia=80%, se necesitan 18.601 usuarios por variante (37.202 total). Si el MDE real es mayor (efecto mas facil de detectar), el numero de muestra cae significativamente — ej., con MDE=12% solo se necesitan 8.401 por variante.
⚠️ Riesgo de peeking: Con 74 dias de duracion, la presion para revisar resultados antes de tiempo es alta. Configurar el dashboard para que solo muestre datos al alcanzar la muestra minima, o usar Bonferroni si se realizan revisiones intermedias planificadas.
💡 Alternativa: Si el equipo no puede esperar 74 dias, considerar relajar el MDE a 12% (8.401/variante, ~33 dias) o implementar testing secuencial (SPRT) que permite parar anticipadamente con control del error.
3 Tiempo de Onboarding — Rediseno del Flujo de Activacion
Altamente significativo (p<0.001) Efecto medio (d=0.648) 🟢 Verified
Control
Flujo antiguo de onboarding
8.4 min
n=320 usuarios • std=2.1 min
-15.5%
reduccion tiempo
vs
★ Variante (Ganadora)
Flujo rediseniado de onboarding
7.1 min
n=298 usuarios • std=1.9 min
p-valor
<0.0001
Welch's t-test — t=-8.08
Diferencia media
-1.3 min
8.4 → 7.1 minutos
IC 95% (diferencia)
[-1.62, -0.98]
En minutos (no incluye 0)
Cohen's d
0.648
Tamano efecto: MEDIO

Tamano de efecto Cohen's d = 0.648 (medio)

Negligible
Grande
00.20.50.81.0+
d=0.648 se ubica en la zona media — efecto notable, robusto y practicamente relevante
Bottom Line
El rediseno del flujo de onboarding reduce el tiempo de completado en -1.3 minutos (de 8.4 a 7.1 min). IC 95%: [-1.62, -0.98 min]. El resultado es altamente significativo (p<0.0001, t=-8.08) con un tamano de efecto medio (Cohen's d=0.648). Recomendacion: desplegar el nuevo flujo inmediatamente.
DECISION: DESPLEGAR — Estadisticamente significativo (p<0.0001) + efecto medio (d=0.648) + impacto practico claro. -1.3 min en onboarding reduce la tasa de abandono durante activacion y mejora la primera experiencia. Sin amenazas a la validez identificadas.
Potencia retroactiva: Con n=320/298 y d=0.648, la potencia del test supera el 99.9%. El no-resultado habria sido igualmente informativo.
⚠️ Efecto novedad: Redisenos de UX pueden mostrar mejoras transitorias por el efecto novedad. Monitorizar la metrica de tiempo en cohorts de usuarios 30 y 60 dias post-lanzamiento para confirmar que la mejora es sostenida.