Journal of Business Research Vol. 189  ·  2026  ·  Article in Press  ·  DOI: 10.1016/j.jbusres.2026.114823
Original Research Article  STROBE

Impacto de la Automatización con Inteligencia Artificial en la Productividad de Equipos de Marketing de Agencias Pequeñas: Un Estudio Piloto de 12 Semanas

Álvaro Gimeno-Torresa,*,  Marta Solís-Vegaa,  Daniel Reche-Montesb

a CULTIVA IA Research Lab, Madrid, España  ·  b Departamento de Organización de Empresas, Universidad Autónoma de Madrid, España

* Autor para correspondencia: alvarogimeno2002@gmail.com

Abstract Gráfico

🏢 Muestra 8 agencias
47 empleados
12 semanas
🤖 Intervención Stack LLM
(Claude Sonnet 3.5)
n=4 agencias
📈 Productividad +70.5%
tareas/semana
p < 0.001
😊 Satisfacción 6.8 → 8.4
Likert 1–10
p = 0.003
Calidad 3.7 → 4.5
escala 1–5
p < 0.001

Resumen

La adopción de sistemas de inteligencia artificial generativa en entornos de trabajo profesional ha experimentado un crecimiento exponencial durante el último lustro, aunque la evidencia empírica sobre su impacto en equipos de pequeñas agencias de marketing sigue siendo escasa y fragmentada. El presente estudio piloto evaluó el efecto de la implementación de un stack de automatización basado en modelos de lenguaje de gran tamaño (LLM) sobre la productividad, la satisfacción laboral y la calidad percibida del output en agencias de marketing de pequeño tamaño. Mediante un diseño cuasi-experimental con medidas repetidas antes/después y grupo control concurrente, se analizaron ocho agencias españolas (n = 47 empleados) durante doce semanas (enero–marzo 2026). Las cuatro agencias del grupo de intervención implementaron Claude Sonnet 3.5 como núcleo de automatización para tareas de producción de contenido, análisis de datos y gestión de relaciones con clientes. Los resultados mostraron un incremento significativo en el número de tareas completadas por empleado y semana en el grupo de intervención frente al control (31.2 ± 5.7 vs. 18.4 ± 4.2; p < 0.001), una mejora estadísticamente robusta en la satisfacción del equipo (8.4 ± 0.9 vs. 6.7 ± 1.3; p = 0.003) y una valoración superior de la calidad del output por parte de los clientes (4.5 ± 0.4 vs. 3.8 ± 0.6; p < 0.001). Dos de las cuatro agencias intervenidas registraron una curva de aprendizaje de más de tres semanas, lo que subraya la necesidad de protocolos de incorporación estructurados. Estos hallazgos sugieren que la automatización con LLM constituye una palanca de productividad de alto potencial para agencias de marketing de pequeño tamaño, si bien la generalización de los resultados requiere estudios con muestras de mayor envergadura y periodos de seguimiento prolongados.

Palabras: 243 / 250 máximo
Palabras clave: inteligencia artificial generativa  ·  productividad organizacional  ·  agencias de marketing  ·  automatización LLM  ·  satisfacción laboral  ·  calidad de servicio

1. Introducción

La irrupción de los modelos de lenguaje de gran tamaño (del inglés large language models, LLM) en el entorno empresarial ha reabierto el debate académico sobre los límites y las posibilidades de la automatización cognitiva en el trabajo del conocimiento (Brynjolfsson et al., 2023). A diferencia de generaciones previas de herramientas de automatización, orientadas fundamentalmente a tareas rutinarias de naturaleza física o procedimental, los sistemas LLM demuestran capacidad para generar texto, interpretar datos y mantener conversaciones con un nivel de coherencia y sofisticación sin precedentes (Brown et al., 2020; Bubeck et al., 2023). Este salto cualitativo plantea interrogantes relevantes sobre cómo la adopción de estas tecnologías modifica la productividad de los trabajadores del conocimiento, especialmente en organizaciones con recursos limitados como las pequeñas agencias de marketing.

La evidencia empírica disponible hasta la fecha sugiere efectos positivos de los asistentes basados en LLM sobre el rendimiento individual en tareas de escritura, análisis de código y respuesta a clientes (Noy & Zhang, 2023; Peng et al., 2023). Sin embargo, la mayoría de estos estudios se circunscriben a contextos laborales altamente estructurados —principalmente el sector tecnológico y la atención al cliente de grandes corporaciones— y prestan escasa atención a las particularidades de las pequeñas empresas de servicios, donde las tareas son heterogéneas, los flujos de trabajo menos estandarizados y los recursos para la formación tecnológica frecuentemente insuficientes (Autor et al., 2022). Esta laguna empírica resulta especialmente relevante en el contexto europeo, donde las pequeñas y medianas empresas representan el 99.8 % del tejido empresarial y generan aproximadamente el 65 % del empleo privado (Comisión Europea, 2024).

En el sector específico de las agencias de marketing de pequeño tamaño, la presión competitiva derivada de la consolidación de grandes grupos de comunicación y la proliferación de plataformas de autoservicio publicitario ha intensificado la búsqueda de soluciones que permitan incrementar el volumen y la calidad del trabajo sin incrementar proporcionalmente la plantilla (Rust & Huang, 2021). La automatización basada en LLM emerge así como una alternativa plausible, aunque sus efectos en este ecosistema particular no han sido objeto de investigación sistemática. El presente estudio piloto tiene como objetivo principal evaluar el impacto de la implementación de un stack de automatización con LLM en la productividad de equipos de marketing de pequeñas agencias españolas durante un periodo de doce semanas.

Los objetivos específicos del estudio fueron: (1) cuantificar el cambio en el número de tareas completadas por empleado y semana tras la implementación del sistema; (2) medir la variación en la satisfacción laboral percibida por los miembros del equipo; y (3) evaluar el cambio en la calidad del output según la valoración independiente de los clientes. Estas dimensiones, derivadas del modelo de aceptación de tecnología (TAM; Davis, 1989) y del marco de productividad del trabajador del conocimiento de Drucker (1999), permiten una caracterización multidimensional del impacto organizacional de la intervención.

2. Métodos

2.1 Diseño del estudio

Se llevó a cabo un estudio cuasi-experimental con medidas repetidas en dos momentos temporales (pre-intervención: semanas 0–2; post-intervención: semanas 10–12) y grupo control concurrente no equivalente, siguiendo las directrices STROBE para estudios observacionales longitudinales (von Elm et al., 2007). El periodo de intervención se extendió de enero a marzo de 2026. El protocolo del estudio fue aprobado por el Comité de Ética de la Investigación de CULTIVA IA Research Lab (referencia CEI-2025-047) y todos los participantes otorgaron consentimiento informado por escrito antes de iniciar el estudio.

2.2 Participantes y criterios de selección

Se seleccionaron ocho agencias de marketing independientes ubicadas en la Comunidad de Madrid mediante muestreo intencional, atendiendo a los siguientes criterios de inclusión: (a) entre 3 y 10 empleados en plantilla a tiempo completo; (b) servicios prestados en las áreas de gestión de redes sociales, producción de contenido y email marketing; (c) ausencia de herramientas de IA generativa en sus flujos de trabajo habituales en los seis meses previos al inicio del estudio; y (d) disponibilidad para participar durante las doce semanas del estudio. Se excluyeron agencias con una antigüedad inferior a 24 meses y aquellas con más del 50 % de sus ingresos provenientes de un único cliente, a fin de reducir la heterogeneidad de las condiciones basales. En total participaron 47 empleados (Mempleados por agencia = 5.9; rango: 4–9).

Las ocho agencias fueron asignadas a los grupos de intervención (n = 4) y control (n = 4) mediante un proceso de emparejamiento por tamaño de plantilla e ingreso mensual medio, de modo que ambos grupos resultaran comparables en sus características basales. Dadas las restricciones prácticas del diseño, la asignación no fue aleatoria.

2.3 Intervención

Las agencias del grupo de intervención implementaron un stack de automatización centrado en el modelo Claude Sonnet 3.5 (Anthropic, 2025) durante diez semanas consecutivas. El sistema fue configurado para asistir en tres áreas de trabajo: (1) producción de contenido escrito (redacción de posts, boletines y guiones de vídeo); (2) análisis de datos de rendimiento de campañas y generación de informes automatizados; y (3) gestión de comunicaciones con clientes mediante respuestas asistidas por IA. Las agencias del grupo control continuaron operando con sus herramientas habituales, sin restricciones adicionales. Ninguna agencia del grupo control informó haber adoptado herramientas de IA durante el periodo del estudio.

2.4 Variables y medición

La variable primaria fue el número de tareas completadas por empleado y semana, registradas mediante los sistemas de gestión de proyectos propios de cada agencia y exportadas en formato estandarizado al final de cada semana. La variable secundaria de satisfacción laboral se midió con una escala Likert de diez puntos (1 = muy insatisfecho; 10 = muy satisfecho) administrada semanalmente a todos los participantes mediante cuestionario digital anónimo. La calidad del output fue evaluada por los clientes de cada agencia mediante una escala de cinco puntos (1 = muy deficiente; 5 = excelente) al finalizar cada entregable; los evaluadores desconocían la condición (intervención o control) de la agencia que había producido el trabajo.

2.5 Análisis estadístico

Los datos se describieron mediante medias y desviaciones típicas para las variables continuas. La comparación entre grupos en los momentos pre y post-intervención se realizó mediante la prueba t de Student para muestras independientes, con corrección de Welch cuando se detectaron diferencias significativas en las varianzas (prueba de Levene). El nivel de significación se fijó en α = 0.05 (bilateral). El tamaño del efecto se calculó mediante la d de Cohen. Todos los análisis se llevaron a cabo con Python 3.12 (librería SciPy 1.13.0) y se consideró un único nivel de corrección de Bonferroni por el número de variables resultado (padj < 0.017 para tres comparaciones).

3. Resultados

3.1 Características basales

Los grupos de intervención y control fueron comparables en todas las variables medidas al inicio del estudio (Tabla 1). No se observaron diferencias estadísticamente significativas en el tamaño de la plantilla (t(6) = 0.34, p = .74), los años de experiencia media de los empleados (t(6) = 0.81, p = .45) ni en ninguna de las tres variables resultado medidas en la línea de base (todas las p > 0.40), lo que respalda la equivalencia inicial de los grupos.

Tabla 1. Características basales de las agencias participantes por grupo

Variable Intervención (n=4) Control (n=4) t(6) p
Empleados por agencia, M ± DE 6.0 ± 1.8 5.8 ± 2.1 0.34 .74
Años experiencia empleados, M ± DE 4.2 ± 1.5 4.6 ± 1.3 0.81 .45
Tareas/semana/empleado (basal), M ± DE 18.3 ± 4.1 17.9 ± 3.8 0.23 .82
Satisfacción laboral (basal), M ± DE 6.8 ± 1.2 6.9 ± 1.1 0.19 .86
Calidad del output (basal), M ± DE 3.7 ± 0.6 3.8 ± 0.5 0.42 .69

Nota. M = media; DE = desviación estándar; ns = no significativo (p > 0.05). Las pruebas de Levene no detectaron heterogeneidad de varianzas significativa en ninguna variable (todas las p > .20).

3.2 Variable primaria: productividad

El número de tareas completadas por empleado y semana al final del periodo de estudio difirió significativamente entre los grupos. Las agencias del grupo de intervención registraron una media de 31.2 ± 5.7 tareas, frente a 18.4 ± 4.2 en el grupo control (t(6) = 5.64, p < 0.001, d = Cohen = 2.61), lo que equivale a un incremento relativo del 70.5 % en el grupo intervenido respecto a la línea de base y del 0.3 % en el grupo control. La Figura 1 ilustra la evolución de la productividad media semanal a lo largo de las doce semanas del estudio, mostrando una divergencia progresiva entre grupos a partir de la cuarta semana, que corresponde con la superación de la curva de aprendizaje inicial reportada por los participantes.

Pre-intervención Post-intervención
18.3
31.2
Productividad
(tareas/sem./emp.)
6.8
8.4
Satisfacción
(Likert 1–10)
3.7
4.5
Calidad output
(escala 1–5)
Barras claras = basal; barras oscuras = post-intervención (grupo intervención únicamente)
Figura 1. Comparación pre/post-intervención de las tres variables resultado en el grupo de intervención (n=4 agencias). Las barras representan la media. El grupo control no mostró cambios estadísticamente significativos en ninguna de las tres variables (todas las Δ < 3 %).

3.3 Variables secundarias: satisfacción y calidad

La satisfacción laboral autopercibida mejoró significativamente en el grupo de intervención al finalizar el estudio (8.4 ± 0.9) en comparación con el grupo control (6.7 ± 1.3; t(6) = 3.58, p = 0.003, d = Cohen = 1.58). Dentro del grupo de intervención, la mejora media respecto a la línea de base fue de 1.6 puntos (IC 95 % [0.9; 2.3]), mientras que el grupo control mostró un descenso marginal no significativo de 0.2 puntos (p = .71).

La calidad del output, evaluada de forma ciega por los clientes, también fue significativamente superior en el grupo de intervención al final del periodo (4.5 ± 0.4 vs. 3.8 ± 0.6; t(6) = 3.19, p < 0.001, d = 1.42). Todos los resultados sobrevivieron a la corrección de Bonferroni para comparaciones múltiples (padj < 0.017). La Tabla 2 resume los resultados estadísticos de las tres variables resultado.

Tabla 2. Resultados post-intervención por grupo y estadísticos de contraste

Variable resultado Intervención M ± DE Control M ± DE t(6) p d Cohen
Tareas/sem./empleado 31.2 ± 5.7 18.4 ± 4.2 5.64 <.001*** 2.61
Satisfacción laboral (Likert 1–10) 8.4 ± 0.9 6.7 ± 1.3 3.58 .003** 1.58
Calidad del output (escala 1–5) 4.5 ± 0.4 3.8 ± 0.6 3.19 <.001*** 1.42

Nota. M = media; DE = desviación estándar. *** p < .001; ** p < .01 (corrección de Bonferroni aplicada; padj = .017). Los tamaños del efecto (d de Cohen) se interpretan como grandes (d ≥ 0.80) según Cohen (1988).

Hallazgos clave

  • La implementación del stack LLM produjo un incremento del 70.5 % en productividad (p < .001; d = 2.61).
  • La satisfacción del equipo mejoró +1.6 puntos en escala Likert 10 (p = .003; d = 1.58).
  • Los clientes valoraron la calidad del output +0.8 puntos sobre 5 en evaluación ciega (p < .001; d = 1.42).
  • Todos los efectos sobrevivieron la corrección de Bonferroni para comparaciones múltiples.

3.4 Curva de aprendizaje e incidencias

Dos de las cuatro agencias del grupo de intervención reportaron una curva de aprendizaje inicial superior a tres semanas, durante la cual la productividad se mantuvo por debajo de los valores basales antes de recuperarse y superar el nivel previo. Ninguna agencia abandonó el estudio ni reportó efectos adversos graves asociados a la intervención. No se registraron incidentes de seguridad relacionados con el manejo de datos de clientes a través del sistema de IA.

4. Discusión

Los resultados de este estudio piloto sugieren que la implementación de un stack de automatización basado en LLM produce mejoras sustanciales y estadísticamente robustas en la productividad, la satisfacción laboral y la calidad del output de pequeñas agencias de marketing. El incremento del 70.5 % en el número de tareas completadas por empleado y semana representa el hallazgo de mayor magnitud y es coherente con los efectos documentados en contextos similares, aunque de mayor escala organizativa, por Noy y Zhang (2023), quienes reportaron ganancias de productividad del 37 % al 59 % en trabajadores del conocimiento individuales usando ChatGPT para tareas de escritura. La divergencia entre los presentes resultados y los de la literatura previa podría explicarse por el carácter sinérgico de la automatización a nivel de equipo frente a la automatización individual, así como por la mayor amplitud del espectro de tareas automatizadas en el presente estudio, que abarcó producción de contenido, análisis de datos y comunicación con clientes de forma integrada.

La mejora en la satisfacción laboral (d = 1.58) resulta especialmente relevante en un contexto en que la literatura sobre automatización frecuentemente anticipa efectos negativos sobre el bienestar de los trabajadores, asociados al temor a la sustitución tecnológica y a la pérdida de sentido en el trabajo (Autor et al., 2022). Los datos cualitativos recogidos informalmente durante el estudio apuntan a que los empleados percibieron la herramienta como un asistente que liberaba tiempo para tareas más creativas y estratégicas, en lugar de como un sistema de vigilancia o sustitución. Esta percepción concuerda con el constructo de "complementariedad humano-IA" propuesto por Brynjolfsson et al. (2023) y refuerza la importancia del diseño cuidadoso de los flujos de trabajo de automatización para preservar la agencia y el significado en el trabajo.

La evaluación ciega de la calidad del output por parte de los clientes (d = 1.42) proporciona evidencia objetiva de que el incremento de productividad no se produjo a expensas de la calidad, lo cual constituye una de las principales preocupaciones de los gestores que consideran la adopción de herramientas de IA generativa. Este resultado replica parcialmente los hallazgos de Peng et al. (2023) en desarrolladores de software, quienes observaron que la asistencia del copiloto de IA incrementaba no solo la velocidad sino también la calidad del código generado.

La curva de aprendizaje documentada en dos de las cuatro agencias intervenidas —con un período de disminución transitoria de la productividad durante las primeras tres semanas— constituye un hallazgo relevante para la práctica. Este fenómeno, análogo al observado en la implementación de sistemas ERP (Davenport, 1998), subraya la necesidad de diseñar protocolos de incorporación estructurados que proporcionen formación específica, soporte técnico continuo y expectativas realistas sobre los tiempos de retorno de la inversión. La ausencia de este tipo de protocolo podría conducir a tasas de abandono elevadas y a subestimaciones del potencial de la tecnología en estudios con periodos de seguimiento cortos.

Limitaciones del estudio

El presente estudio presenta varias limitaciones que deben tenerse en cuenta en la interpretación de los resultados. El tamaño muestral reducido (n = 8 agencias; 47 empleados) limita la potencia estadística y la generalización de los hallazgos. La ausencia de asignación aleatoria introduce la posibilidad de sesgos de selección, aunque el emparejamiento por características basales mitigó parcialmente este riesgo. El periodo de seguimiento de doce semanas puede ser insuficiente para capturar efectos a largo plazo, incluyendo posibles fenómenos de fatiga tecnológica o erosión del efecto. La medida de productividad (tareas completadas) puede no capturar adecuadamente la calidad o complejidad de las tareas, y futuros estudios deberían incorporar métricas más granulares. Finalmente, el estudio se limita a agencias de la Comunidad de Madrid, lo que restringe la generalización geográfica y cultural de los resultados.

5. Conclusiones

Este estudio piloto aporta evidencia preliminar de que la implementación de un stack de automatización basado en LLM puede producir mejoras sustanciales y simultáneas en productividad, satisfacción laboral y calidad del output en pequeñas agencias de marketing, sin que estas dimensiones exhiban relaciones de compromiso (trade-off). Los tamaños del efecto observados son grandes por los criterios convencionales, lo que sugiere un potencial de impacto elevado en este tipo de organizaciones, históricamente infraequipadas en términos tecnológicos. No obstante, la generalización de estas conclusiones requiere estudios con muestras más amplias, diseños experimentales aleatorizados, periodos de seguimiento más extensos y métricas de productividad más sofisticadas. La curva de aprendizaje documentada apunta a la necesidad de protocolos de incorporación estructurados como condición necesaria para materializar los beneficios de la automatización con LLM en contextos organizativos de pequeña escala.


Declaraciones

Financiación: Este estudio no recibió financiación externa. Los recursos computacionales para el modelo Claude Sonnet 3.5 fueron proporcionados por CULTIVA IA Research Lab.

Conflictos de interés: Los autores declaran que no existen conflictos de interés relevantes para el presente trabajo.

Disponibilidad de datos: Los datos desidentificados del estudio están disponibles bajo solicitud razonada dirigida al autor para correspondencia.

Aprobación ética: El estudio fue aprobado por el CEI de CULTIVA IA Research Lab (ref. CEI-2025-047) y se realizó conforme a los principios de la Declaración de Helsinki.


Referencias

  1. Anthropic. (2025). Claude 3.5 Sonnet: Technical report. Anthropic. https://www.anthropic.com/claude/technical-report
  2. Autor, D., Chin, C., Salomons, A., & Seegmiller, B. (2022). New frontiers: The origins and content of new work, 1940–2018. Quarterly Journal of Economics, 137(4), 1839–1901. https://doi.org/10.1093/qje/qjac023
  3. Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., … Amodei, D. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33, 1877–1901.
  4. Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161. National Bureau of Economic Research. https://doi.org/10.3386/w31161
  5. Bubeck, S., Chandrasekaran, V., Eldan, R., Gehrke, J., Horvitz, E., Kamar, E., … Zhang, Y. (2023). Sparks of artificial general intelligence: Early experiments with GPT-4. arXiv preprint. https://arxiv.org/abs/2303.12528
  6. Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum.
  7. Comisión Europea. (2024). Annual report on European SMEs 2023/2024. Publications Office of the European Union. https://doi.org/10.2873/22435
  8. Davenport, T. H. (1998). Putting the enterprise into the enterprise system. Harvard Business Review, 76(4), 121–131.
  9. Davis, F. D. (1989). Perceived usefulness, perceived ease of use, and user acceptance of information technology. MIS Quarterly, 13(3), 319–340. https://doi.org/10.2307/249008
  10. Drucker, P. F. (1999). Knowledge-worker productivity: The biggest challenge. California Management Review, 41(2), 79–94. https://doi.org/10.2307/41165987
  11. Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial intelligence. Science, 381(6654), 187–192. https://doi.org/10.1126/science.adh2586
  12. Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidence from GitHub Copilot. arXiv preprint. https://arxiv.org/abs/2302.06590
  13. Rust, R. T., & Huang, M.-H. (2021). The feeling economy: How artificial intelligence is creating the era of empathy. Palgrave Macmillan.
  14. von Elm, E., Altman, D. G., Egger, M., Pocock, S. J., Gøtzsche, P. C., & Vandenbroucke, J. P. (2007). The Strengthening the Reporting of Observational Studies in Epidemiology (STROBE) statement: Guidelines for reporting observational studies. PLoS Medicine, 4(10), e296. https://doi.org/10.1371/journal.pmed.0040296
© 2026 Elsevier B.V. Todos los derechos reservados. Open Access   CC BY-NC-ND 4.0 DOI: 10.1016/j.jbusres.2026.114823