La ficha
- Qué es: The Generative AI Learning Penalty: Evidence from Chinese Secondary Education
- Quiénes: David Strömberg (Stockholm University), Victor Lei y Yanhui Wu (University of Hong Kong)
- Dónde: SSRN, junio de 2026. Documento de trabajo, todavía sin revisión de pares. papers.ssrn.com/abstract=6977138
- Tipo: estudio cuantitativo. Panel administrativo de 30 meses, 26.811 estudiantes, diferencias en diferencias con adopción escalonada.
Primera lectura: qué hace y qué encuentra
Conviene partir por el diseño, porque de ahí sale casi toda la fuerza del paper. Los autores obtuvieron de la oficina de educación de un condado del centro de China, que ellos describen como representativo de los condados fuera de la costa desarrollada, los registros de 26.811 estudiantes de séptimo a duodécimo grado, el 90 por ciento de los matriculados en secundaria ahí. Los datos van de septiembre de 2022 a junio de 2025 y juntan tres cosas que rara vez aparecen en el mismo conjunto: las notas de las pruebas mensuales a libro cerrado, la nota y el tiempo de entrega de las tareas semanales en nueve asignaturas, y los dos exámenes nacionales de alto impacto, el Zhongkao, que ordena a los estudiantes hacia distintas escuelas de nivel medio, y el Gaokao, que en la práctica decide el ingreso a la universidad.
Una encuesta de junio de 2025 preguntó en qué mes cada estudiante empezó a usar IA generativa. La adopción pasó de casi cero en 2022 a cerca del 80 por ciento en 2025, y avanzó de forma escalonada, lo que habilita el diseño: comparar cómo cambian los resultados de quienes adoptaron en un mes dado contra los de quienes nunca adoptaron. Las herramientas más usadas fueron Doubao, DeepSeek, ChatGLM, Ernie Bot y Qwen, no aplicaciones educativas especializadas.
El hallazgo central es una divergencia limpia entre productividad y aprendizaje. A los seis meses de adoptar IA, las notas de las tareas suben 18 por ciento respecto de la media inicial y el tiempo de entrega cae de 64 a 45 minutos. En paralelo, las notas de las pruebas mensuales a libro cerrado caen 20 por ciento. Las dos curvas se separan justo en el mes de adopción y venían pegadas antes, que es lo que el diseño necesita.
El segundo hallazgo es sobre el tiempo. El efecto en las pruebas mensuales se completa en unos seis meses; el de los exámenes de admisión tarda cerca de dos años en llegar a su magnitud plena, 18 por ciento en el Gaokao y 24 por ciento en el Zhongkao, porque esos exámenes cubren materia de varios años. La consecuencia metodológica la sacan los propios autores y es incómoda para el resto de la literatura: los estudios cortos, que son casi todos, subestiman el costo de largo plazo.
El tercer hallazgo explica el mecanismo y evita la conclusión gruesa de que la IA daña por sí sola. La pérdida se concentra en los usuarios cuyo patrón es compatible con externalizar la tarea, que son el 58 por ciento de quienes usan IA y suben al 81 por ciento entre quienes llevan más de cinco meses usándola: entregan en menos tiempo que incluso el más rápido de los estudiantes sin IA, sacan notas de tarea que coinciden con lo que estas herramientas aciertan en ese tipo de ejercicios, y rinden muy mal en las pruebas. En cambio, quienes usan IA y dedican a la tarea el mismo tiempo que los no usuarios sacan notas de prueba similares a las de ellos, con mejores notas de tarea, y no son mejores estudiantes de partida. La conclusión de los autores es precisa: la IA reduce el tiempo dedicado a aprender en la mayoría, pero no reduce la eficiencia con que aprenden quienes mantienen el tiempo.
Al abrir por asignatura, las mayores caídas están en ciencias sociales (27 por ciento en promedio), luego STEM (22 por ciento) y al final los idiomas (inglés 17 por ciento, chino 9 por ciento). Vale la pena notarlo, porque los experimentos previos se concentran casi todos en matemáticas, programación e idiomas, y ninguna de esas es la asignatura más golpeada acá: matemáticas cae 22 por ciento y los idiomas menos que eso. Por perfil, la caída es mayor en los estudiantes menores, en los hombres y en los de mejor rendimiento inicial, lo que comprime la distribución de habilidades por un camino distinto al conocido: no porque la IA levante a los de abajo, sino porque castiga más a los de arriba.
Segunda lectura: desde América Latina
Lo que hace este paper traducible es que no estudia una herramienta, estudia un incentivo. Los autores lo dicen al cerrar: la literatura está concentrada en cómo diseñar tutores de IA que anden bien, y en China esos tutores ya existen y son baratos o gratis. Los estudiantes igual eligen el chatbot de propósito general que entrega la respuesta directa. No falta la buena herramienta, falta el motivo para preferirla.
De ahí sale el hallazgo que más se parece a la región, y es un problema de medición antes que de tecnología. Entre los estudiantes que usan IA y sacan notas de tarea sobre la media, mejores notas de tarea vienen asociadas a peores notas de prueba. La tarea deja de informar sobre el aprendizaje, y la brecha solo se hace visible en una evaluación a libro cerrado. Eso importa donde las notas de aula pesan en la calificación escolar y esa calificación entra en la admisión universitaria. Chile con el NEM y el ranking de notas, Brasil con el ENEM, México con sus exámenes de ingreso: la arquitectura de un examen externo de alto impacto conviviendo con notas de aula hoy fáciles de externalizar existe en toda la región. Esto último es lectura mía y no del paper, que estudió un condado chino y nada más.
Una precisión de los autores conviene no saltársela: el ahorro de tiempo en tareas es de 2,2 a 2,8 horas semanales, entre 5 y 6 por ciento del tiempo total de estudio, mucho menos que la caída de 20 por ciento en las notas. Ellos plantean que otros factores deben estar contribuyendo, probablemente que quien externaliza la tarea del fin de semana también externaliza lo demás.
Hay una nota optimista que ellos mismos presentan como sugerente y no como establecida. Medida a los cinco meses de uso, la penalidad pasó de alrededor de 25 por ciento a comienzos de 2023 a alrededor de 16 por ciento en junio de 2025, y el patrón se mantiene al fijar la muestra en los adoptantes tempranos. Algo se está adaptando, en los estudiantes o en los profesores, aunque la pérdida está lejos de desaparecer.
Sus tres sugerencias de política son sobrias y baratas, que es lo que las vuelve pertinentes para ministerios sin presupuesto para reformas grandes. Dar información creíble a los estudiantes sobre el costo de aprendizaje de externalizar tareas, porque hoy no lo perciben. Aumentar el peso de las evaluaciones presenciales y a libro cerrado. Y que profesores y familias monitoreen insumos, tiempo de estudio y esfuerzo, en vez de productos, que es lo que la IA volvió poco informativo.
La pregunta que deja es directa para cualquier ministerio de la región. Si la nota de la tarea ya no dice si el estudiante aprendió, ¿con qué se está evaluando?
La letra chica
- Es un documento de trabajo en SSRN, sin revisión de pares todavía.
- El mes de adopción es autorreportado y retrospectivo. Los autores lo discuten: un reporte demasiado tardío habría dejado tendencias previas, que no aparecen; uno demasiado temprano explicaría parte de la rampa de seis meses, pero no la magnitud final.
- La identificación es más débil en los exámenes de admisión, que se observan una o dos veces y donde no se pueden mostrar tendencias previas. Los autores lo reconocen y apoyan su lectura causal en que el orden de los efectos por asignatura y por perfil es casi idéntico en ambos tipos de examen.
- El tiempo de tarea es el intervalo entre abrir y entregar en la plataforma, no el tiempo efectivo de trabajo. Los autores lo dicen y lo tratan como una aproximación razonable, pero es la variable sobre la que descansa todo el mecanismo de externalización.
- La relación entre tiempo de tarea y notas de prueba no es causal, y lo dicen expresamente: sirve para caracterizar a quiénes les va peor, no para concluir que obligar a dedicar más tiempo restauraría el aprendizaje.
- Es un condado de China. Los mecanismos viajan mejor que las magnitudes.
Palabras clave del paper: generative AI, learning, homework outsourcing, secondary education, difference-in-differences
Lectura automática. Este texto lo generó Claude, un modelo de Anthropic, a partir de la fuente original, sin revisión humana línea por línea. Puede contener errores o interpretaciones discutibles; para validar cualquier punto, revisa la fuente original.