
博科尼大学与OpenAI联合实验表明,ChatGPT接入能显著提升学生作业的专业度和逻辑性,而因果推理训练能增加观点的原创性和多样性。两者结合效果最佳,这为AI时代的教育评估改革提供了数据支撑。
当学生使用ChatGPT完成现实作业时,质量提升是否以牺牲原创性为代价?这是教育界面对AI浪潮时最核心的焦虑之一。近期,博科尼大学(Bocconi University)与OpenAI经济研究团队联合开展的一项随机实验,为这一议题提供了颇具启示性的数据支撑。实验发现,ChatGPT的接入与因果推理训练(一种批判性思维形式)对学生作业的改善路径截然不同,且二者具有显著的互补性。
该研究的样本量超过1000名大一本科生,他们需要为一个真实商业案例——本校商品店的营销推广——制定建议方案。研究者将学生随机分为四组:仅使用ChatGPT(GPT-4o)组、仅接受因果推理训练组、两者兼具组,以及既无工具也无训练的对照组。值得注意的是,训练内容与AI无关,而是通过游戏、案例和反馈练习,专门教授学生如何建立因果链条并解释方案为何可行或失效。
作业由训练有素的评分员依据五级量表进行评判,同时研究者运用自动化文本分析,衡量每份提交中的观点数量、观点多样性、因果推理迹象以及与专家方案的相似度。这种多维度的评估设计,让实验得以剥离出不同干预因素的独立效应。
从实验结果看,ChatGPT的接入带来了立竿见影的效果。获得AI访问权的学生,在五级量表上的得分几乎高出整整一分。他们的答案包含更多想法,逻辑链条更清晰,与专家撰写的建议方案相似度更高。换言之,AI帮助初学者产出了看起来更专业的内容。
但关键在于,学生并非简单地将作业“外包”给ChatGPT。他们仍需自主决定提问方向、甄别AI输出的质量,并选择哪些内容纳入最终提交。这实际上锻炼了人机协作中的判断力——一种在AI时代愈发重要的元技能。
批判性思维训练的效果则更为微妙。完成训练的学生在评分量表上并未获得更高分数——因为该量表仅衡量建议是否达成两个标准营销目标(提升商店知名度和使用率)。然而,文本分析揭示了量表之外的显著差异:这些学生产出的观点范围更广,且与同伴方案的区分度更高。
这一发现直指传统教育评估的盲区。正如OpenAI经济研究团队在论文中所指出的,传统量规(rubric)往往奖励结构清晰、表达流畅的答案,却可能忽视学生是否提出了独一无二的见解。当AI让“流畅”变得唾手可得时,评估体系对“原创性”的捕捉能力就显得尤为关键。
该实验最引人注目的发现,在于两种干预的协同作用。同时获得ChatGPT和思维训练的学生,兼收两者之长:他们的观点多样性媲美仅受训练的学生,评分和观点数量与仅用AI的学生相当,同时还展现出更强的逻辑连贯性和质疑假设的倾向。
从博科尼大学的官方发布看,这一结果挑战了“让学生独立思考还是学会用AI”的二元对立叙事。实验设计者强调,两者并非替代关系,而是服务于不同的教育目标:AI提升答案的“专业度”,思维训练拓展思路的“广度”。
实验揭示的核心矛盾,在于训练效果与量规评分之间的脱节。这指向一个更广泛的现实:如果AI能帮助学生产出专家级的精美作品,那么仅仅审视最终答案,我们便难以判断学生真正理解了什么。
实际上,这延续了数十年来技术与教育协同演进的模式。从计算器到搜索引擎,每次工具革新都在倒逼教育者重新定义“可测量的能力”。如今,AI将这一进程推向了新的高度。许多教育工作者已经开始反思,作业设计与评估标准是否需要从“产出正确结果”转向“展示推理过程与多元视角”。
这一实验结论对国内AI教育实践同样具有参考价值。当前,国内高校和K-12阶段正积极推进生成式AI的落地应用。例如,文心一言和通义千问等国产大模型已进入多所学校的教学辅助场景,用于作文批改、外语对话练习等。
与博科尼实验强调“思维训练”相呼应,国内教育界也越来越重视AI素养与批判性思维的综合培养。一些学校开始尝试“AI+项目式学习”模式,鼓励学生利用AI工具进行资料搜集和方案迭代,同时通过课堂辩论、案例复盘等形式强化逻辑推理训练。这种“工具赋能+思维筑基”的双轨路径,与实验揭示的互补效应不谋而合。
这项实验的最终启示,或许在于教育目标的重新排序。当AI能够轻松产出“标准答案”时,教育的差异化价值便体现在那些AI难以替代的品质上——提出新颖问题、构建独特视角、反思方案局限。正如研究者所言:AI让答案更好,批判性思维让想法更广。二者在为学生准备未来时,扮演着互补的角色。
实验发现,ChatGPT接入能显著提升学生作业的专业度、逻辑性和观点丰富度,而因果推理训练则能增加观点的多样性和原创性。两者结合使用时,学生能同时获得这两方面的收益,表现出最强的综合能力。
因为传统评分量规主要衡量答案是否达成预设的营销目标(如提升知名度和使用率),而思维训练带来的观点多样性并未被该量规捕捉。这暴露了传统评估体系对原创性维度的忽视。
实验表明,学生并非直接复制AI输出,而是需要自主提问、评估和筛选信息。这种“人机协作”模式本身锻炼了判断力和决策力,可视为一种新型的认知技能。关键在于作业设计能否有效衡量这些过程性能力。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI 发布 Astra for Law,将 GPT-6 Astra 与法律搜索索引、专业指令和治理工具整合,面向律所提供 AI 基础底座。本文分析其技术架构、性能数据、隐私治理及对国内法律 AI 的启示。

国际律所 Cooley 基于 ChatGPT Work 打造 GO Public,用代理编排层重构 IPO 准备流程:AI 负责信息梳理,律师专注判断与决策。本文解析其运作逻辑,并对比国内法律 AI 的落地路径。

OpenAI 与 AARP 旗下 OATS 合作,在美国10座城市为老年人开设免费 ChatGPT 线下工作坊,课程兼顾日常应用与防诈骗教育,为AI普惠提供了可复制的社区样本。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。