作业分数越高 考试成绩越差?CEPR调研预警生成式AI的学习代价

【编辑推荐】生成式AI工具能帮学生更快完成作业,拿到更高的作业分数。但完成作业本身不是目的,从作业中收获知识才是。本斯德哥尔摩大学经济学系教授大卫·斯特伦贝里、香港大学经济学系博士生雷维克多、香港大学经济系、管理与战略系教授吴彦辉关注到学生自主使用生成式AI对学习产生的影响。研究发现:使用AI的学生写作业的时间减少,作业分数上升,但考试成绩却出现下滑。这种影响起初并不明显,但随着学生对AI工具越来越熟练、学习内容不断深入,负面影响会逐步扩大。这意味着,现有的短期研究,可能低估了使用生成式AI的长期学习成本。

本文基于欧洲政策研究中心(CEPR)第21577号讨论稿《生成式AI的学习代价:来自中国中学教育的证据》整理。

ChatGPT、Claude、deepseek为代表的生成式AI工具,能在几秒内帮学生解题、讲解知识点、润色写作。这就带来了效率提升:学生能更快完成作业,成绩也更好。但在校园里,完成作业从来不是最终目的,而是要学有所成。民主与技术中心近期的一项调查显示,超过70%的家长和教师担心,学生使用AI可能会削弱自身的学业能力(莱尔德、德怀尔,2025)。多个经合组织(OECD)成员国正在制定相关指引或政策,规范生成式AI在教育领域的使用(经合组织,2026)。要制定科学的政策,首先要清晰认识生成式AI对学生学习的影响:影响究竟是正面还是负面?幅度有多大?哪些学生、哪些学科受影响更显著?不同的使用方式会带来怎样不同的结果?

现有针对特定AI辅导工具学习效果的研究,结论并不统一。设计严谨、符合教学规律的AI辅导工具,能够提升学习效果(凯斯丁等,2025)。反之,如果AI工具直接给出答案,虽然能提高学生随堂练习的表现(这类场景可以使用AI),但后续闭卷考试的成绩反而会下降(巴斯塔尼等,2025)。

这些研究为“强制使用AI辅导工具”在特定教学场景下的影响提供了有效参考,但对于更宽泛的问题,我们却知之甚少:在真实的教学环境中,学生自主使用生成式AI,长期来看对各学科的整体学习效果会有怎样的影响?

我们基于中国中部某区县26811名7至12年级学生长达30个月的教务数据,对这一问题展开了研究(斯特伦贝里等,2026)。数据覆盖九门学科,将每周的作业分数、完成时长,与月度闭卷考试、全区统考,以及中考、高考成绩都进行了关联。

重要的是,我们通过学校发放的调查问卷,获取了学生开始使用生成式AI的准确时间(老师会引导学生核对自己所用AI工具的注册时间)。截至2025年6月,约80%的学生表示自己在使用生成式AI;而在2022年9月样本刚开始时,几乎没有学生使用这类工具。学生最常用的AI工具是豆包和deepseek,都是没有专门教学功能的通用型AI工具。

由于学生开始使用AI的时间各不相同,我们针对使用者开始使用前后的成绩变化,与同期未使用AI的学生的成绩变化做了对比。在使用AI之前,两组学生的成绩几乎一致,变化趋势也相近。我们采用“交错式双重差分”研究设计(卡拉韦、圣安娜,2021),估算学生使用生成式AI带来的因果效应。

作业表现提升,考试成绩下滑

如图1所示,开始使用AI后的6个月内,学生完成一次作业的平均时长由使用前的64分钟,缩短到约45分钟;作业分数相比使用前的平均水平提升了18%。AI确实提升了写作业的效率:用时更少,产出更好。

但对学习而言,完成作业远不是终点。作为衡量学习成果的通用指标,闭卷考试的成绩却呈现出完全相反的走向。使用AI的6个月后,学生的月考成绩相比使用前的平均水平下降了20%。

6个月内考试成绩下滑20%,这个代价相当显著。巴斯塔尼等人(2025)的随机对照试验也得出了相近的结果:直接给出作业答案的生成式AI工具,会让学生的数学闭卷考试成绩下降17%。在我们的样本中,这种幅度的学习下滑,在不使用AI的学生群体中是非常少见的。

图1使用生成式AI前后,作业分数、作业时长与考试成绩的变化

作业分数越高,考试成绩越差?CEPR调研预警生成式AI的学习代价

注:左侧图表展示了不同群体的成绩分布,包括:最终使用生成式AI的学生,使用前与使用后的月度观测数据;以及截至2025年6月从未使用生成式AI的学生的月度观测数据。右侧图表展示了最终使用AI的学生,在使用前后各时间节点的平均成绩。对于“从未使用AI学生组”,我们构建了加权后的对比均值序列,确保每个时间节点上,对照组的月份、年级、学校分布,与对应的使用AI组完全一致。

资料来源:斯特伦贝里等(2026)。

学习代价随时间持续加深

从月度考试来看,AI的负面影响起初很小,随着学生对通用AI工具的使用越来越熟练,加上学习内容不断深入,影响会逐步扩大。在学生开始使用生成式AI约6个月后,负面影响会达到峰值。

对于中考、高考这类高利害考试,学习损失的显现速度更慢,大约需要两年时间才会完全显现。等它到达最大幅度时,代价和常规考试相当:中考成绩相比基准线下降24%,高考下降18%。由于升学考试是决定录取结果的核心因素,这种学习损失会直接影响学生的学业发展路径和未来职业走向。

图片来源|iStock

两类考试的影响显现时长不同,大概率是因为常规考试主要考查近期所学内容,而升学考试整合了多年的知识。这意味着,现有的短期研究,可能系统性地低估了使用生成式AI的长期学习成本。

作业分数与考试成绩不再挂钩

传统认知里,作业分数高代表学习效果好。在我们的研究中,不使用AI的学生群体,作业分数和考试分数之间,能看到预期的正向关系。但在使用AI的学生中,这种关联发生了彻底反转:作业分数越高的学生,考试成绩往往越差。对这部分学生而言,作业分数已经不再是评估学习效果的有效指标,相反,作业分数快速上升,会成为学习水平下滑的预警信号。这也提醒老师和家长,想要保障学习效果,需要关注学习的其他维度,比如学生实际花在作业上的时间,或是通过频繁的课堂小测,检验学生对作业内容的掌握程度。

是用AI辅导,还是直接外包作业?

推荐

我们观察到两种截然不同的AI使用方式,带来了完全不同的学习结果(见图2)。在AI使用6个月后,约五分之四的学生能在50分钟内完成作业,比不用AI的学生里速度最快的群体还要快,作业分数也极高(和通用AI工具的输出水平相当)。但这部分高效使用AI的学生,考试成绩明显更差。这种表现,和学生把大部分作业直接交给生成式AI完成的“外包”行为是一致的。

剩下五分之一的学生,花在作业上的时间和不用AI的学生大致相当。尽管从更高的作业分数来看,他们也在用AI辅助作业,但他们的考试成绩和不用AI的学生相差无几。换句话说,只要学生在作业上投入的时间相当,无论是否使用AI,最终的学习效果都差不多。

但这一发现并不意味着,只要要求学生多花时间写作业,就能挽回学习效果。选择不同AI使用方式的学生,本身在学习动机、信息获取、AI使用能力上就可能存在差异。有效的干预措施,需要同时把作业时长监督、正确使用AI的方法指导,以及让学生了解作业外包带来的学习损失等各方面兼顾起来。

图2作业时长相当时,AI使用者与非使用者的考试成绩相近

作业分数越高,考试成绩越差?CEPR调研预警生成式AI的学习代价

注:图中展示了不同作业完成时长对应的作业与考试成绩中位数,色带表示四分位距。红线代表AI使用者,蓝色虚线代表非使用者。

资料来源:斯特伦贝里等(2026)。

谁受影响最大?优等生受冲击更突出

整体来看,生成式AI带来的学习代价普遍存在,但分布并不均衡。受负面影响最大的是社会科学类学科(如历史、政治),考试成绩下降约27%;理科下降约22%,英语下降17%,语文下降9%。从学生群体来看,低年级学生、男生,以及原本成绩优异的学生,受到的负面影响格外显著。

劳动力市场的相关研究发现,AI会不成比例地提升低技能劳动者的生产率,从而压缩技能差距(诺伊、张,2023;布林约尔松等,2025;崔等,2026),大学生群体也有类似现象(豪斯曼等,2025)。而在教育场景中,差距压缩的原因恰好相反:学习代价更多地落在了成绩更好的学生身上。

重新设计激励机制

学生把作业外包给生成式AI,学习效果下降,这其实并不奇怪。至少对我们而言,真正意外的是这种学习损失的幅度之大、范围之广、持续时间之久。当然,我们不能直接把这一影响幅度套用到其他场景中,但这一结果足以敲响警钟。问题背后的核心特征(比如青少年只要有机会就会逃避写作业的天性)是普遍存在的。

我们的研究表明,学习损失的程度,取决于学生如何使用生成式AI。在中国和其他很多国家,已经有设计精良的AI辅导工具,而且大多几乎免费,但大部分学生并不会去用。相反,他们更愿意选择能轻松外包作业的通用AI工具。奥雷奥普洛斯和洛(2026)的研究也发现了类似的激励问题:如果AI辅导工具的定位是引导思考而非直接给答案,学生的使用意愿就会很低。

这类激励问题,不会随着AI技术的进步而消失。教育领域落地AI的核心问题,从来都不是技术问题,而是组织与制度问题。在通用AI工具能直接给出答案的环境下,如何激励学生用正确的方式使用AI工具,还需要更多的研究探索。

参考文献

Bastani, H, O Bastani, A Sungu, H Ge, Ö Kabakci, and R Mariman (2025), “Generative AI without guardrails can harm learning: Evidence from high school mathematics”, Proceedings of the National Academy of Sciences 122(26): e2422633122.

Brynjolfsson, E, D Li, and L Raymond (2025), “Generative AI at work”, The Quarterly Journal of Economics 140(2): 889–942.

Callaway, B, and P H C Sant’Anna (2021), “Difference-in-differences with multiple time periods”, Journal of Econometrics 225(2): 200–230.

Cui, K Z, M Demirer, S Jaffe, L Musolff, S Peng, and T Salz (2026), “The effects of generative AI on high-skilled work: Evidence from three field experiments with software developers”, Management Science.

Hausman, N, O Rigbi, and S Weisburd (2025), “Generative AI in universities: Grades up, signals down, skills in flux”, VoxEU.org, 17 June.

Kestin, G, K Miller, A Klales, T Milbourne, and G Ponti (2025), “AI tutoring outperforms in-class active learning: An RCT introducing a novel research-based design in an authentic educational setting”, Scientific Reports 15: 17458.

Laird, E, and M Dwyer (2025), “Up in the air: Educators juggling the potential of generative AI with detection, discipline, and distrust”, Center for Democracy and Technology Report.

Noy, S, and W Zhang (2023), “Experimental evidence on the productivity effects of generative artificial intelligence”, Science 381(6654): 187–92.

OECD (2026), OECD digital education outlook 2026: Exploring effective uses of generative AI in education, OECD Publishing.

Oreopoulos, P, and N Low (2026), “One click away: AI tutoring with Khanmigo in a two-year school experiment”, NBER Working Paper 35620.

Strömberg, D, V Lei, and Yanhui Wu (2026), “The generative AI learning penalty: Evidence from Chinese secondary education”, CEPR Discussion Paper 21577.

推荐
上一篇

港校雅思门槛调整 27Fall申请季政策解读

下一篇

香港考评局官宣 广东DSE与考学校拟从4所暴增至12所

返回顶部