On this page · 6 sections

先把两件事分开

共同的基础标准可以让学习有起点,也让不同背景的人知道要求是什么。它不等于要求所有人采用同样的路径,提出同样的问题,或交出同一种作品。把“标准化”作为单一敌人,反而会忽略标准所承担的公共作用。

我的疑问在于:当评价只剩可以快速打分的输出时,我们是否会漏掉一个人怎样处理模糊问题、怎样解释选择,以及怎样发现自己错了?这是一种评价取向的讨论,不是对某一教育体系的整体排名。

让过程可见,而不是取消考试

一种值得尝试的组合是:保留必要的基础测验,同时让项目提供过程记录、口头解释、反例与修订。作品之外,还要能回答为什么这样做,以及更换条件后结论是否成立。AI 工具的使用也应该说明,而不是把工具参与简单等同于没有学习。

但项目评价并不天然公平。有更多时间、设备或指导资源的人,可能更容易做出漂亮成果;口头表达也不能成为唯一尺度。因此,应把评价要求、资源限制与可获得的支持一并设计,而不是用一种单一标准替换另一种。

工具进入教育,仍需教育判断

UNESCO 的生成式 AI 教育指南强调以人为本、隐私以及教育适用性的验证。这提供了一种提醒:不能因为工具能生成答案,就假定它已经适合某个学习目标,也不能把技术变化直接推导成确定的职业命运。[1]

我希望被看见的能力是:有基础,能迁移,也愿意承认局限。考试、项目和讨论可以分别提供证据,但没有一种形式能完整代表一个人。教育的空间,恰恰在于不让任何一个可测量结果过早结束理解。

我既批评标准化,也重视基础训练

我曾用“我们还需要标准化人才吗”表达不满,又写过中式基础训练在 AI 时代可能被重新估值。它们表面矛盾,实际上指向两种不同的训练:一种不断重复固定答案,另一种通过做错、订正、理解和迁移建立可靠的基础。

没有数学与代码的基础,模型生成再漂亮的方案,我也很难判断它哪里错了。因此,我反对的不是认真练习,而是练习结束之后仍然没有机会提出自己的问题。基础应该使人更自由,而不是使人永远停在标准答案里。

刷题有没有意义,要看练习改变了什么

我在短稿中问过:对一个已经知道答案的问题不断重复作答,究竟在学习什么?这个问题里有真实的不满:如果奖励始终只对应标准输出,人就容易把寻找标准答案当成思考的全部。但“看过答案”与“能够自己重建答案”,也不能混为一谈。

Roediger 与 Karpicke 的实验比较了学习文章后主动回忆与重复阅读。重复阅读在五分钟后的测试中占优,主动回忆在两天或一周后的测试中更有利于保持记忆。这说明测验可以参与学习,而不仅是在学习结束后打分;它并不证明所有刷题都有用,更没有直接证明长期记忆等于解决陌生问题的能力。[2]

因此,值得区分的至少有三件事:照着答案复述、关掉答案独立重建、改变条件后重新判断。它们外表都像在做题,却留下不同的能力。背下一个证明的句子,可能仍然不知道哪个假设一旦拿走,结论就会失败。

同一道题,可以练出不同的东西
练习方式检查什么下一步
参照答案完成是否看懂每一步合上答案,独立重建
间隔后重新作答能否主动提取与解释记录真正卡住的前提
更改假设或目标能否迁移,而非识别题型找反例并修正方法

我想反对的,是把熟悉感当理解,把累计题量当成长。AI 可以在这里扮演出题者和反例提供者,但如果每次卡住就让它继续写,练到的可能只是请求下一段答案。一个简单的改法是先留下自己的尝试,再请求提示,最后脱离提示重新解释。这样,工具帮助暴露思维缺口,而不是把缺口遮住。

换一下条件,才知道理解有没有发生

例如学生能熟练套用最短路算法,接着可以追问:边的代价变成负数怎么办?地图状态改变后,旧答案还成立吗?如果优化目标从时间变为无障碍通行,需要重新表达什么?这些问题仍然依赖扎实基础,却不能只靠记住原来那道题回答。

AI 能够帮助生成反例、解释错误和比较解法,也可能让学生更快跳过自己不懂的步骤。评价的对象因此应该包括迁移与解释,而不只是最终答案。一个人能否在条件改变时修正方案,比作品看起来复杂更能说明理解。

Sources & further reading

  1. UNESCO · 生成式 AI 教育与研究指南 ↗

    Source · 以人为本、隐私与教育适用性;不是对某种考试制度的效果评估。

  2. Roediger & Karpicke · Test-enhanced learning(2006) ↗

    Source · 原始实验摘要:文章材料的主动回忆与重复阅读,比较即时及延迟记忆表现;并非对全部考试制度的评价。