| Dimensión | Score | Evidencia del revisor | Prioridad |
|---|---|---|---|
|
1. Problema y Pregunta de Investigación
Pregunta clara y acotada; contribución relevante para PYME hispana. Los alcances (sector servicios, herramientas específicas) están bien delimitados.
|
4 | El paper identifica explícitamente el gap geográfico (evidencia iberoamericana escasa) y el gap de tamaño de empresa. La hipótesis nula sobre tasa de conversión es honesta. Pendiente: la pregunta de "juicio estratégico" no se operacionaliza. |
Menor |
|
2. Literatura y Contexto
La revisión cubre trabajos relevantes pero depende excesivamente de fuentes de consultora (McKinsey) como evidencia empírica primaria.
|
3 | Brown et al. (2020) es un paper técnico de LLMs, no de productividad en marketing; citarlo como evidencia del impacto económico es un salto no justificado. No se citan estudios previos sobre automatización del trabajo (Autor & Salomons, 2018; Acemoglu & Restrepo, 2022). La síntesis existe pero es superficial. |
Media |
|
3. Metodología
Diseño cuasi-experimental con sesgo de autoselección no controlado; muestreo por conveniencia no justificado estadísticamente.
|
2 | La asignación al grupo tratamiento dependió de "la voluntad de los directivos", lo que introduce sesgo de innovador (empresas más dispuestas a adoptar IA pueden diferir sistemáticamente del control). No se aplica Propensity Score Matching ni se reportan tests de comparabilidad pre-tratamiento. El papel no especifica si se midió adherencia al tratamiento (uso real vs. uso declarado de herramientas de IA). |
Crítica |
|
4. Datos y Evidencia
Variable principal medida con autopercepción Likert; mezcla de instrumentos objetivos y subjetivos sin discusión de implicaciones.
|
2 | La nota al pie "Los datos de tiempo de producción provienen de encuestas de autopercepción, no de registros objetivos" reconoce el problema pero lo minimiza. El sesgo de deseabilidad social es especialmente alto cuando los participantes saben que forman parte del grupo de IA. Coste por lead se mide en euros (objetivamente obtenible de plataformas) pero se usa Wilcoxon sin explicar la distribución. n=47 empresas total es insuficiente para regresión múltiple con los controles listados. |
Crítica |
|
5. Análisis Estadístico
Mezcla inconsistente de pruebas paramétricas y no paramétricas; los controles en regresión no se reportan completamente.
|
3 | Se aplica t-test para tiempo de producción (asumiendo normalidad) y Wilcoxon para coste por lead sin justificar la diferencia. Si el coste/lead no es normal, tampoco lo serán los tiempos de producción. La regresión con controles no reporta los coeficientes de control, solo menciona los tamaños de efecto de las variables de interés. Ausencia de análisis de potencia estadística post-hoc con n=24/23. |
Media |
|
6. Resultados e Interpretación
Resultados bien presentados; honesto con el resultado nulo en conversión. Tablas y cifras razonablemente claras.
|
3 | La conclusión de que "la IA mejora la eficiencia operativa pero no sustituye el juicio estratégico" excede la evidencia: la tasa de conversión no es un proxy directo del juicio estratégico. Esta interpretación es especulativa y debería atenuarse. Los resultados positivos se expresan en porcentajes relativos de reducción, lo que puede amplificar visualmente efectos modestos. |
Media |
|
7. Limitaciones y Amenazas a la Validez
Se mencionan el sesgo de autoselección y el tamaño muestral, pero el tratamiento es incompleto.
|
3 | No se aborda la amenaza de contaminación (¿pudo el grupo control adoptar IA durante los 6 meses?). Tampoco se discute la validez de constructo de las escalas Likert usadas. La validez externa está limitada a Madrid/Barcelona/sector servicios, lo cual merece más énfasis. El efecto Hawthorne (los participantes del grupo tratamiento saben que están siendo observados) no se menciona. |
Media |
|
8. Escritura y Estructura
Manuscrito bien organizado; argumento fluido; terminología consistente.
|
4 | La estructura IMRaD es apropiada y la prosa es clara y académica. Las definiciones de las variables independientes (herramientas de IA específicas) son concretas. El abstract es informativo y estructurado. Correcciones menores: algunas oraciones del marco teórico son excesivamente largas. |
Menor |
|
9. Citas y Referencias
Uso de Brown et al. (2020) como evidencia de productividad es incorrecto; informes de consultora no son evidencia empírica peer-reviewed.
|
2 | Brown et al. (2020) es un paper sobre capacidades de modelos de lenguaje (GPT-3), no un estudio de productividad en empresas. Usarlo para afirmar que "la adopción de IA ha crecido exponencialmente" mezca capacidades técnicas con adopción empresarial. McKinsey (2023) es un informe corporativo, no peer-reviewed; debe citarse con esa etiqueta. ONTSI (2023) es adecuado como fuente institucional. Chui et al. (2023) es un informe McKinsey, mismo problema. |
Crítica |
- 1 Sesgo de autoselección sin controlar: El grupo tratamiento se autoseleccionó por predisposición a adoptar IA. Sin Propensity Score Matching o un análisis de comparabilidad pre-tratamiento (tests de balance en variables covariables), los efectos estimados no son causalmente atribuibles a la IA.
- 2 Variable principal medida con autopercepción: El tiempo de producción de contenidos se midió mediante encuesta subjetiva en el grupo que sabía que usaba IA. El sesgo de deseabilidad social y el efecto Hawthorne inflan sistemáticamente los 38% de reducción reportados.
- 3 Citas incorrectamente aplicadas: Brown et al. (2020) es un paper de NLP, no de productividad empresarial. Informes McKinsey citados como evidencia empírica equiparable a estudios peer-reviewed. Esto socava la credibilidad del marco teórico.
- Añadir análisis de comparabilidad pre-tratamiento (medias, desviaciones y tests de balance para tamaño, sector y antigüedad del equipo entre grupos T y C).
- Reemplazar o complementar las escalas Likert de tiempo de producción con datos objetivos (por ejemplo, registros de horas en herramientas de gestión de proyectos, o metadatos de archivos creados).
- Sustituir Brown et al. (2020) y los informes McKinsey con estudios académicos sobre productividad y automatización (Acemoglu & Restrepo 2022; Dell'Acqua et al. 2023 —"Navigating the Jagged Frontier"— o estudios similares).
- Justificar la elección de t-test vs. Wilcoxon: reportar tests de normalidad (Shapiro-Wilk) y decidir consistentemente. Si las distribuciones no son normales, usar Wilcoxon para ambas variables.
- Reportar tablas completas de regresión con coeficientes, errores estándar y p-valores de todos los controles incluidos.
- Añadir análisis de potencia (power analysis) post-hoc con el tamaño de efecto observado para discutir si n=24/23 era suficiente.
- Discutir explícitamente el efecto Hawthorne y la posible contaminación del grupo control.
- Atenuar la conclusión sobre "juicio estratégico": la tasa de conversión no-significativa no demuestra ausencia de impacto en toma de decisiones estratégicas; son constructos distintos.
- Verificar que Brown et al. (2020) NeurIPS contiene alguna mención a productividad empresarial o adopción en PYMEs (hipótesis del revisor: no la contiene; el paper es un benchmark de capacidades de GPT-3).
- Confirmar que Chui et al. (2023) McKinsey es el informe "The economic potential of generative AI" (junio 2023) y etiquetarlo como informe de consultora, no como literatura académica peer-reviewed.
- Solicitar a los autores los datos de encuesta brutos para verificar la escala Likert utilizada: ¿era una sola pregunta sobre tiempo percibido, o una batería validada psicométricamente?
- Verificar si los datos de Google Ads / Meta Ads para tasa de conversión son atribuibles al mismo período exacto (6 meses de tratamiento) y si hay efectos de estacionalidad no controlados.
- Comprobar que la regresión múltiple con 3 controles (tamaño, sector, antigüedad) es viable con n=47: la regla empírica de 10-20 observaciones por predictor sugiere que el modelo está al límite de su especificidad.
- +Pregunta de investigación novedosa y bien delimitada para el contexto español.
- +Datos primarios propios con seguimiento longitudinal de 6 meses (no encuesta puntual).
- +Honestidad sobre resultado nulo en tasa de conversión (no publication bias evidente).
- +Prosa académica clara; estructura IMRaD bien ejecutada.
- 1Añadir Tabla 0 de balance de covariables pre-tratamiento (Revisión mayor — obligatoria).
- 2Reescribir sección 2.1 sustituyendo citas incorrectas por literatura de productividad (Dell'Acqua et al. 2023; Noy & Zhang 2023).
- 3Añadir análisis de sensibilidad: re-ejecutar modelo excluyendo empresas con menor adherencia al tratamiento.
- 4Discusión 5.3: atenuar claim sobre juicio estratégico o proponer un estudio de seguimiento que lo operacionalice.