GAMIFICACIÓN Y MOTIVACIÓN EN EL APRENDIZAJE DEL INGLÉS COMO LENGUA EXTRANJERA EN EDUCACIÓN
SUPERIOR: UNA REVISIÓN SISTEMÁTICA
De los 38 estudios, 16 (42,1%) se publicaron entre los años 2023 y 2025, 14 (36,8%) entre 2021 y
2022, y 8 (21,1%) entre los años 2018 y 2020, confirmando la tendencia creciente. Por diseño, 20
(52,6%) emplearon diseños cuasi-experimentales, 9 (23,7%) experimentales con aleatorización, 5
(13,2%) pre-experimentales (pre-post sin control) y 4 (10,5%) mixtos. Los contextos geográficos
predominantes fueron Asia (16 estudios; 42,1%), Medio Oriente (9; 23,7%), Europa (7; 18,4%) y
América Latina (4; 10,5%), con 2 estudios multicéntricos (5,3%). Las herramientas más utilizadas
fueron Kahoot (18 estudios; 47,4%), Quizizz (12; 31,6%), Duolingo (8; 21,1%), ClassDojo (5; 13,2%),
Genially (4; 10,5%) y plataformas de diseño propio (6; 15,8%). El impacto de estas herramientas
no fue uniforme. Kahoot, basado en cuestionarios competitivos en tiempo real, mostró los
efectos más consistentes sobre la motivación extrínseca (d mediana = 0,51) gracias a sus
mecánicas de ranking y retroalimentación inmediata, pero su efecto sobre la motivación
intrínseca fue menor (d mediana = 0,33), lo que sugiere que su fortaleza reside en la activación
competitiva más que en el interés genuino por el contenido. Duolingo, en cambio, mostró efectos
más equilibrados entre lo que es la motivación intrínseca (d = 0,40) y extrínseca (d = 0,38),
posiblemente porque su sistema de progresión por niveles y rachas diarias genera tanto
satisfacción de competencia como hábito autónomo. Quizizz obtuvo resultados intermedios (d =
0,44 para MI), mientras que las plataformas de diseño propio mostraron la mayor variabilidad (d
entre 0,18 y 0,72), reflejando la heterogeneidad inherente a las soluciones no estandarizadas.
Respecto a la influencia del diseño metodológico en los resultados, se observó una tendencia
relevante: los estudios cuasi-experimentales (n = 20) reportaron tamaños del efecto superiores
(d mediana = 0,45) a los experimentales con aleatorización (n = 9, d mediana = 0,38). Esta
discrepancia es coherente con lo dicho por Sailer y Homner (4), quienes advirtieron que los
diseños sin aleatorización tienden a sobreestimar los efectos al no controlar completamente las
variables de confusión, selección de participantes motivados, efecto Hawthorne, diferencias
preexistentes entre los grupos. Los estudios pre-experimentales (n = 5), sin grupo control alguno,
reportaron los efectos más altos (d mediana = 0,71), confirmando que, a menor rigor
metodológico, mayor es la estimación del efecto. Esta gradación sugiere que la eficacia real de la
gamificación es probablemente mucho más modesta que lo que la literatura reporta en conjunto,
y que los resultados deben interpretarse con cautela según el diseño empleado. La duración de
las intervenciones osciló entre 3 y 16 semanas, con una mediana de 8 semanas. Los tamaños
muestrales fueron heterogéneos, con un rango de 24 a 312 participantes y una mediana de 78.
De los 38 estudios, 22 (57,9%) utilizaron la escala de motivación intrínseca de Vallerand o
adaptaciones de la misma, 9 (23,7%) emplearon el AMTB de Gardner (28) o versiones adaptadas,
y 7 (18,4%) utilizaron instrumentos de diseño propio. La fiabilidad reportada (alfa de Cronbach)
osciló entre 0,72 y 0,95, con una mediana de 0,86. Sobre la evolución temporal, se observa un
incremento sostenido: mientras que en el período entre los años 2018-2020 predominaban los
estudios pre-experimentales con herramienta única (62,5% de los 8 estudios), a partir de 2021 se
registra un viraje hacia diseños cuasi-experimentales con grupo control (60,7% de los 30 estudios
de entre 2021-2025) y hacia la combinación de múltiples plataformas gamificadas. Este cambio
metodológico sugiere una maduración del campo. Los instrumentos más utilizados para medir
ansiedad fueron la Foreign Language Classroom Anxiety Scale (FLCAS) de Horwitz et al. (9
estudios) y adaptaciones del cuestionario de Dewaele y MacIntyre (21) (6 estudios). Sobre el
reporte de tamaños del efecto, solo 20 de los 38 estudios (52,6%) incluyeron la d de Cohen o la g
92