能拿高分的技能,正是 AI 最擅长伪造的
博科尼大学实验发现,GPT-4o能显著提高学生作业分数,但传统评分体系无法区分真实学习与AI辅助,揭示教育评估的深层危机。
原贴
查看原文原文
中文翻译
博科尼大学一项涉及1000多名新生的实验显示,GPT-4o显著提高了商业作业的成绩。关于因果推理的短期课程没有提高传统分数,但促使学生提出更多样化、更非寻常的解决方案。AI的使用是否也提高了实际学习效果,仍未得到解答。没有进行不使用ChatGPT的后续测试。
ChatGPT显著改善了学生作业,而教学干预鼓励了更多样化、非寻常的解决方案。AI是否也能提高学习仍是一个悬而未决的问题。
是什么造就了一篇好的学生论文,其中哪些部分AI能够改进?博科尼大学对1053名新生进行的随机实验发现,GPT-4o帮助学生在商业作业中获得了显著更高的成绩。关于因果推理的短期课程没有提高传统分数,但促使学生提出更多样化的解决方案,并更深入地思考原因、假设以及他们的建议如何实际运作。
2025年11月,一门管理学入门课程的13个班级被随机分为四组:对照组、因果推理课程组、GPT-4o使用组,或两者兼有。学生必须为大学的商品店撰写最多180词的市场营销建议。课程内容涵盖连贯的因果逻辑、可证伪性,以及提议的行动如何可能导致期望的结果。
使用GPT-4o的学生在1到5分的评分标准上,得分高出近整整1分。他们的答案平均多出约两个想法,逻辑更连贯,且与三位主题专家的建议更加吻合。即使研究人员控制了论证质量、想法数量、想法多样性和文本属性,GPT-4o的可衡量优势依然存在。作者将此归因于更高的内容质量,而非学生知识更丰富。
因果推理课程没有提高传统分数。这些学生的作业平均得分实际上略低,但他们更常解释提议的行动为何应当奏效,以及在什么条件下可能会失败。他们还生成了更多与同伴所写内容不同的多样化想法。将课程与GPT-4o结合,传统分数并未获得进一步提升。在因果推理指标上,两种方法相互补充,且课程组产生的更大想法多样性得以保持。
更多的想法、更连贯的论证以及单个答案中更大的想法多样性都与更高的分数相关。但更强的可证伪性、对提议行动如何运作的更详细解释,以及与其他学生想法更大的差异性与较低的分数相关。这并不意味着原创性在所有方面都受到惩罚。对于这项作业,传统分数主要奖励那些结构良好、保持在预期解决方案空间内的答案。作者得出结论,如果希望多样性和原创性得到重视,就需要将其明确纳入评分标准。
但当前的评分体系衡量的是润色、结构和完整性,而非学习和理解。这使得很容易将AI用作作弊工具。
核心信息
博科尼大学实验发现,GPT-4o能显著提高学生作业分数,但传统评分体系无法区分真实学习与AI辅助,揭示教育评估的深层危机。
- 博科尼大学实验发现,GPT-4o能显著提高学生作业分数,但传统评分体系无法区分真实学习与AI辅助,揭示教育评估的深层危机。
- 原贴提到:An experiment at Bocconi University with over 1,000 freshmen shows that
- 来源:the-decoder.com
详细解读
信号解读:博科尼大学的随机实验揭示了一个尖锐的矛盾:AI(GPT-4o)能显著提升学生作业的得分,但传统评分体系所奖励的“高分技能”——论证的润色、结构的完整、内容的丰富——恰恰是AI最擅长模仿的。这并非意味着AI“作弊”,而是说明现有教育评估机制严重滞后于技术现实。当AI可以轻松生产出“高分答案”时,分数已无法真实反映学生的知识掌握程度,整个“以分数论能力”的体系正在被釜底抽薪。
为什么重要:这一信号直接冲击教育领域的核心评价标准。如果大多数学校继续沿用旧式评分标准,那么学生使用AI优化论文将难以监管,且会加剧“高分低能”现象——学生可能获得漂亮分数,但实际分析和解决问题能力并未提升。实验还发现,旨在提升因果推理的教学干预虽然未提高传统分数,却增加了学生的思维多样性,这暗示当前评分标准正在系统性压制原创性和深度思考。教育界必须重新定义“什么是好学生”,否则AI将加速教育异化。
对谁有价值:对教育管理者,这是改革评分系统的警报;对教师,需要设计能评估“学习过程”而非“作业成品”的考核方式;对学生,则需警示不要依赖AI应付作业,而应专注于可迁移的深层能力;对AI教育产品开发者,这是一个开发“学习评估工具”的绝佳机会——通过过程追踪、思维路径分析来替代结果评分。
行动建议:1)教育机构应立刻审查评分标准,将原创性、思维多样性、批判性论证等维度显性化,并纳入评价体系;2)教师可设计更多课堂内限时写作、口试、项目答辩等无法用AI替代的评估形式;3)学生应主动将AI视为“思维教练”而非“代笔”,在使用AI后提炼自己的观点;4)AI工具研发者可以构建“辅助学习”模式,记录用户如何修改AI输出,从而量化其学习增量。
风险与限制:该实验仅测试了一门管理课程的一次作业,样本为大学新生,且没有考察长期学习效果和不同学科差异。GPT-4o的优势可能仅限于结构化分析任务,在需要实践或创意领域的表现未知。此外,“评分标准改革”可能面临教师主观性、实施成本等挑战,需要谨慎试点。最重要的是,实验没有追踪学生是否真正内化知识,因此不能断言AI对学习完全无益,更不能直接判定其“有害”。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《能拿高分的技能,正是 AI 最擅长伪造的》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
能拿高分的技能,正是 AI 最擅长伪造的主要讲什么?
博科尼大学实验发现,GPT-4o能显著提高学生作业分数,但传统评分体系无法区分真实学习与AI辅助,揭示教育评估的深层危机。
这篇文章最值得关注的要点是什么?
博科尼大学实验发现,GPT-4o能显著提高学生作业分数,但传统评分体系无法区分真实学习与AI辅助,揭示教育评估的深层危机。;原贴提到:An experiment at Bocconi University with over 1,000 freshmen shows that;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在Agent工作流、AI超级个体、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、工作流」等主题信号。;这篇内容命中「技能、学习」等主题信号。;这篇内容来自该专题长期覆盖的栏目。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。