摘 要:人工智能正在改变教育评价赖以进行的信号基础。知识获取与文本生成成本显著下降,使“答案—能力”对应关系出现松动,而筛选、判断与责任成本同步上升。学习者的提问对象、产出方式和讨论入口随之迁移,最终提交物不再稳定呈现真实学习过程。若评价继续奖励外观完整、表达流畅的答案,便会高估生成能力而低估判断能力。这一挑战首先不是学术诚信或工具使用问题,而是教育评价的测量问题,当答案变廉价,评估信号也随之贬值。可持续的回应方向,是把评价对象从结果转向过程证据链,评价标准从答案质量转向判断路径,使用规则从“是否允许”转向人机协作可解释性,评价证据从单一提交物转向多元组合,评价从教师个人经验提升为课程级设计。评价重构的目标,是让能力在答案日益廉价的条件下重新变得可观测。
关键词:人工智能;教育评价;评估信号;学习行为;可观测性
引言:从工具争议到评价问题
当前关于人工智能(AI)与教育的讨论,仍有相当部分停留在工具伦理层面,例如学生能否使用AI,特别是生成式AI(本文如无特别说明,“AI”即指生成式AI)、哪些情形构成学术不端、教师应如何界定使用边界等。这些问题当然重要,但如果只从“允许”或“禁止”的角度理解AI,就容易低估其对教育评价产生的深层影响。AI并非只是进入课堂的一个新工具,而是已经进入了学习行为本身,并正在改变教育评价赖以进行的信号基础。
从现实看,AI已广泛嵌入学生的提问、资料整理、写作与课堂讨论等教学环节。完成作业的过程,也可能不再经历传统意义上的“阅读—思考—提纲—成文”,而是进入“生成—编辑—修订—润色”的人机协作流程。由此,学习活动的起点、过程和产出方式都在发生变化。这种变化并不必然意味着学习质量下降,也不意味着所有AI使用都应被视为违规。相反,AI确实能够降低学习门槛,提高资料整理和表达生成效率,为学生提供及时反馈与学习支持。然而,正是因为这些功能正在变得低成本、常态化和日常化,教育评价才会面临新的压力。过去,一篇结构完整、语言流畅、格式规范的作业,通常可以在一定程度上被视为学生阅读、理解、组织和表达能力的外在表现;但在AI广泛参与之后,最终提交物与真实学习过程之间的对应关系不再稳定。结果仍然存在,甚至可能更加规范,但结果背后的能力水平变得更难识别。
因此,AI进入教育后真正值得追问的问题,不只是学生是否可以使用工具,而是教育评价如何继续有效识别学生能力。换言之,问题的核心并不是“AI应不应该进入教育”,而是:当AI已经进入学习行为本身,当答案生成成本被显著压低,教育系统如何重新建立区分能力的评价机制?如果最终答案不再能够稳定代表学习过程和能力水平,那么教育评价就必须从结果表面进一步深入到过程证据、判断路径和责任归属之中。围绕这一问题,本文将依次展开四个层面的分析:首先说明AI如何改变知识获取成本,并使筛选、判断与责任成本上升;其次分析提问对象、产出方式和讨论入口的迁移如何改变学习路径;再次讨论评估信号为何出现失真,以及这种失真为何首先是测量问题而不只是纪律问题;最后提出教育评价重构的制度回应,并结合中外高校实践说明从工具管理走向评价治理的可能方向。AI带来的教育挑战,最终不是技术是否可用的问题,而是教育如何在答案日益廉价的条件下恢复能力的可观测性。
一、知识获取成本的重组:从效率提升到评估承压
从经济学视角看,AI首先改变的是成本结构。解释概念、总结文献、给出例子、提供初稿等,这些原本需要投入较多时间与认知努力的工作,如今的边际成本已经大幅下降。最关键的变化,不在于“学生终于省了很多时间”,而在于教育系统原先赖以成立的一些隐含条件开始失效。例如,答案稀缺、解释稀缺、初稿稀缺等,这些曾经构成学习门槛的条件正在被快速削弱。但更重要的是,成本下降并不是均匀的。至少有三类成本在同步上升,而且这三类成本恰恰决定了教育如何重新分配自己的稀缺性。
(一)筛选成本的上升
在信息不足的时代,学生的主要问题是找不到足够多的资料;在信息近乎泛滥的时代,问题则变成如何判断哪些信息可信、哪些答案相关、哪些答案看起来通顺但其实不适合当前任务。AI降低的主要是信息生成成本,却没有同步降低信息甄别成本。
更具体地说,AI会制造一种特殊的认知局面:它给出的答案经常不是明显错误,而是“局部正确但整体不适用”,或者“语言流畅但证据不足”。这种输出会让筛选成本呈现出与搜索时代不同的特征。在搜索时代,学生更多是在多个来源之间比对;在AI时代,学生还需要判断一个“已经整合好的回答”内部哪些部分可信、哪些部分需要再证实。这意味着,AI不是简单地减少了检索工作量,而是把部分检索成本重新转化为甄别成本。
这一点在学习情境中尤其明显。例如,学生让AI总结论文,看似节省了阅读时间,但若摘要忽略关键限定条件、或把描述性结论误写成规范性主张,后续核对反而需要更多投入。AI并非无效,而是把劳动类型从“先读再写”改成了“先收再验”。
(二)判断成本的上升
面对多个“看起来合理”的回答,学习者必须投入更多认知资源进行比较、取舍与重组。筛选成本关注“这个答案靠不靠谱”,判断成本则进一步关注“几个答案都大体靠谱,我该选择哪一个,或者如何重新组合它们”。
判断成本之所以重要,是因为教育要培养的很多能力,并不体现在能不能给出一个答案,而体现在能不能在不确定情境中作出合理判断。AI降低了草拟答案的成本,却往往把真正困难的部分,如界定问题、设定标准、处理冲突信息等,更鲜明地暴露出来。过去这部分劳动被写作过程本身包裹着,不容易被单独看见;现在由于“写出来”变得太容易,判断本身反而成为最稀缺的环节。
例如,同一作业题目,AI可以给出三四种结构都还不错的写法,但学生究竟选择哪一种结构、为什么不采用另一种、如何取舍文风与论证深度,都不再是“工具自动给定”的问题,而是判断问题。教育若继续只奖励最终提交的成稿,就很容易忽略最有价值的那部分劳动:学生为何最终采用此种结构与论证方式。
(三)责任成本的上升
无论AI如何参与,最终提交作业、给出观点、承担后果的仍然是人,而不是大模型。责任成本在过去并未消失,只是它常常被理解为学术诚信问题;而在人机协作环境下,责任成本还包括一个更广泛的层面:学习者是否能为其引用的信息、组织的论证和最终观点负责。
责任成本之所以会被抬高,是因为AI让“输出”变得非常容易,但输出的来源链条却更不透明。学生如果使用AI写出一段论证,就必须额外回答:材料是否可靠、引用是否准确、关键判断与机器输出的边界何在。责任成本并不是一个附加项,而是人机协作环境下能力的一部分。
从制度角度看,责任成本的上升意味着教育评价不能再默认“提交的最终成果即学生能力的直接映射”。相反,制度必须开始追问:这一成果是如何形成的,哪些判断是学生亲自完成的,哪些证据是可以追溯的。
(四)成本重组的制度含义
当“产出一个像样答案”的成本下降时,教育体系原本依赖的筛选机制就会承受更大压力。也正因为如此,筛选、判断与责任这些原本被隐藏在学习过程内部的成本,开始转移到评估与制度层面上来。
因此,本文的第一个核心判断是:当知识获取成本下降,教育的稀缺性就必须迁移。它不再主要体现为“谁更容易获得知识”,而更多体现为谁更会筛选、谁更会判断、谁更能将信息转化为可负责任的行动。这里的关键并不是说知识不重要了,而是知识的取得不再构成最主要的区分机制。教育若仍把稀缺性安放在“获取答案”上,就会越来越难解释自身的独特价值。
(五)成本重组如何传导为评价压力
上述成本变化并不只发生在学生学习端,也会进一步传导到教师评价端和学校制度端。AI降低了学生获得解释、材料、结构和初稿的成本,但这种成本下降并不意味着教育系统的评价成本同步下降。相反,当学生更容易生成外观完整的学习成果时,教师和课程制度需要投入更多精力判断这些成果背后是否存在真实理解、独立判断和责任承担。换言之,学生端的生成成本下降,可能转化为教育系统端的识别成本上升。
首先,这种传导体现在结果代理功能的减弱。过去,教师在一定程度上可以把作业、论文、报告等最终成果视为学生学习过程的压缩呈现。虽然这种判断从来不是完全准确的,但在生成成本较高的条件下,最终成果通常意味着学生至少经历了阅读、理解、组织和表达等基本环节。AI介入之后,结果仍然存在,甚至可能更加规范和流畅,但结果背后的学习过程却不再透明。教师面对同样完整的文本,需要额外判断:这是学生真实理解后的表达,还是AI生成后经过少量修改的产物;这是学生自主形成的结构,还是工具提供的框架;这是学生经过证据比较后的结论,还是对模型输出的接受。
其次,成本传导体现为评价任务本身的复杂化。AI使观点是否清楚、结构是否合理、表达是否准确等外观指标更容易被满足,因而教师必须进一步关注成果形成过程中的关键节点:学生如何定义问题、筛选材料、处理反方观点、修订AI输出、对最终结论负责。评价对象由此从“判断成品质量”扩展为“识别能力形成过程”,评价成本自然上升,课程设计也随之承压:仅以最终文本作为依据的旧式作业设计难以应对信号失真,教师需要在任务中加入选题说明、资料筛选说明、AI使用声明、口头答辩或阶段性反馈,使学生的筛选、判断和修订过程重新进入评价视野。
因此,知识获取成本下降并不意味着教育评价更轻松。恰恰相反,答案、解释和初稿的廉价化,使教育评价必须从结果判断转向过程识别,从成品检查转向能力追踪。成本重组的制度含义正在于此:当学习成果更容易被生成时,教育系统就必须重新设计判断真实能力的方式,否则评价就可能在高质量表面成果面前失去区分功能。
二、学习行为路径的系统性迁移:从工具使用到学习回路重写
成本结构的变化通常会推动学习行为路径的迁移。当知识获取与文本生成的成本被显著压低时,学生从提出问题、获取材料到形成表达的整个回路,都会随之发生调整,而不再停留在某一个孤立的工具使用环节。具体而言,当前至少有三类变化值得关注:其一是提问对象的迁移,学生遇到问题时的第一触点正在从教材与教师转向AI;其二是产出方式的迁移,写作过程从“从零起草”转向“生成—编辑—修订—润色”的人机协作;其三是讨论入口的迁移,课堂与小组研讨越来越多地从AI预处理过的摘要和提纲出发。这三类变化并非彼此孤立,而是相互衔接,共同构成了学习回路的整体重写。
(一)提问对象迁移:从教材/教师到AI
越来越多学生在遇到问题时的第一触点不是教材或教师,而是AI。它降低了提问门槛,也降低了“开口求助”的心理成本,但同时改变了学习过程的起点。
这一变化看起来很温和,因为“多了一个咨询对象”似乎并不必然改变学习本质。但实际上,第一触点决定了后续认知建构的方向。若学生先接触的是教材,他需要自己界定问题、定位概念、分辨重点;若学生先接触的是AI,他接收到的往往是一个已经被压缩、改写甚至预解释过的版本。学习不再从“原问题”开始,而更可能从“一个被加工过的问题表述”开始。
这并不意味着质量自动下降。有时,AI确实可以帮助学生跨过理解门槛,尤其是在陌生领域中降低初学者的挫败感。但问题在于,当AI成为默认第一触点时,教育需要重新思考:学生是否还有机会练习在没有现成解释的情况下独立界定问题?换句话说,提问对象的迁移并非只有便利性后果,也有能力训练后果。
(二)产出方式迁移:从“从零写作”到“生成—编辑—修订—润色”
大量作业、报告和文稿的形成过程,正从“从零写作”转向“生成—编辑—修订—润色”。在这种流程里,学习者的工作重心从独立生成内容,转向选择、修订和整合。
这一迁移的意义在于,它打破了教育长期以来对“完成作业”的默认想象。过去,一份作业的生成过程大致被理解为:学生阅读、思考、提纲、成文。现在,流程更可能变成:学生提出指令、接收初稿、调整结构、补充材料、删除冗余、润色语言。这并不一定比过去更轻松,也不一定更浅薄,但它确实让“写作”从一种以原创生成为中心的活动,转向一种以编辑和判断为中心的活动。
这种变化会直接影响评估。因为传统评估之所以默认一份成稿可以代表能力,是因为成稿通常是大量隐性劳动的浓缩结果。而在AI介入条件下,成稿可能只是若干次人机迭代的终点,评估者若只看终稿,就难以判断真正有价值的劳动究竟发生在哪里:是在问题设定时,还是在多轮修订时,还是在最后的证据核查中。
(三)讨论入口迁移:从原始材料到AI预处理版本
课堂讨论和小组研讨越来越可能从AI生成的摘要、提纲或解释出发,而不是直接从原始材料和原始问题出发。这会改变学习者与材料之间的接触方式:从直接面对问题,变成先面对一个经过AI初步加工的版本。
讨论入口的迁移之所以重要,是因为教育场景里的很多深度学习,并不是靠“快速得到正确解释”发生的,而是靠与原始材料之间的摩擦发生的。学生读不懂、误解、反复重读、在讨论中修正,这些过程本身就是学习的一部分。如果讨论直接从AI总结开始,那么原始材料对学习者造成的阻力会被显著减弱。阻力减少未必总是坏事,但它确实可能减少某些高阶理解产生的机会。
同时,讨论入口的迁移还会影响课堂权威结构。过去,教师指定材料、设置问题,构成课堂共同起点;现在,学生在进入课堂前可能已经拿着各自不同的AI摘要和解释进入讨论,这使得课堂共同起点更加分散。课堂的任务不再只是围绕共同材料展开,而更像是先清理不同版本的预理解,再进入真正讨论。
由此,提问起点、写作流程、讨论入口三个关键节点共同迁移,学习路径已经不是原来的那条路径了。当这三个节点同步变化时,评估体系就不能再假设自己仍然面对的是“旧时代的学习过程”,由此进入下一个问题——评价预设的失效。
(四)评价预设的失效
传统评价体系隐含着一组关于学习过程的预设:作业、论文、报告等大致浓缩了学生从阅读材料、理解问题、组织观点到表达成文的过程;成品虽然不是学习过程本身,却长期作为学习过程的结果性证据。学习路径在AI介入后发生迁移,这一预设开始失效,成品形成过程、学生与原始材料的接触关系、表面质量与真实能力的对应关系,都不再像过去那样稳定。
由此,学习路径迁移带来的关键影响不只是学生用了一个新工具,而是评价体系原本依赖的学习过程模型发生了变化。评价不再能够简单假设“最终成果=学习过程的自然沉淀”,而必须同时考察成品背后的形成过程、判断路径和责任归属。
三、评估信号的失真与制度性压力:从纪律问题到测量问题
过去,教育之所以能通过一份作业、一篇文章或一次报告大致推断学生能力,是因为“生成一个像样的答案”本身具有门槛,答案与能力之间存在较稳定的相关关系。AI打破了这一前提:当生成成本显著下降时,外观完整、逻辑流畅、形式规范的答案,不再足以稳定代表作者真实的分析能力、判断深度与问题意识,评估对象与真实能力之间由此出现系统性偏离。前文已说明,AI降低了知识获取成本,却抬高了筛选、判断与责任成本;其直接后果是,学生最宝贵的劳动越来越不在成稿表面,而在成稿背后的选择、取舍、验证与负责过程之中。因此,本文提出第二个核心判断:当答案变廉价,如果教育仍只奖励答案,就会奖励生成能力,而不是判断能力。这句话的关键不在于否定生成能力本身,而在于指出:如果评估指标仍然主要停留在“答案是否完整、是否流畅、是否像样”,那么教育最终筛选出的就会更多是“谁更会调用生成”,而不是“谁更会判断与负责”。
(一)评估信号的失真
教育信号理论有助于解释评估为何会承压。成绩、学历与作业之所以能发挥筛选作用,一个重要前提是信号的生产存在差异性成本:更高能力者能以更低代价完成更高质量的产出。当AI显著压缩信号生产成本后,原有信号的区分能力就会下降。若过去一篇条理清晰、结构完整的文章常常意味着作者投入了较多理解、组织和写作劳动,那么在AI条件下,这种对应关系便开始松动。
评估信号的失真,并不是指所有学生提交的作业、论文或报告都不再具有评价意义,而是指这些提交物作为能力代理的稳定性正在下降。过去,一份外观完整、结构清晰、表达流畅的作业,通常意味着学生经历了阅读、理解、资料组织、观点生成和语言表达等过程。虽然这种推断从来不是完全准确的,但在生成成本较高的条件下,最终成果与学生能力之间仍然保持着相对稳定的关联。AI介入后,这种关联开始松动:结果仍然存在,甚至可能更加规范和流畅,但结果背后的能力含量变得更难判断。这种失真至少体现在三个层面。
第一,来源失真。来源失真指的是最终成果中不同内容来源之间的边界变得模糊。学生提交的一段论证,可能来自自主思考,也可能来自AI生成;可能经过学生严格筛选和改写,也可能只是对模型输出的直接接受。对教师而言,如果只面对最终文本,就很难判断哪些部分反映了学生的真实理解,哪些部分主要体现了工具的生成能力。来源失真并不等同于简单的“抄袭”或“代写”,因为许多学生确实可能在学习过程中真实参与了人机协作;但问题在于,最终成果本身未必能够呈现这种参与关系。
第二,过程失真。过程失真指的是最终成果无法充分呈现学生实际经历的学习过程。传统评价之所以能够依赖作业、论文或报告,是因为这些成果在一定程度上压缩了学生的阅读、比较、选择、组织和修订过程。但在AI辅助下,成品可能跳过部分原本具有训练价值的环节,或者把这些环节转化为人机互动中的隐性过程。例如,学生可能不再经历从材料混乱到结构成形的完整探索,而是直接在AI生成的提纲或初稿基础上进行局部修补。此时,最终成果看似完整,但学生是否真正经历了问题界定、证据筛选和论证修订等过程,已经不能由成品本身直接推出。
第三,能力失真。能力失真指的是最终成果所呈现的表面质量与学生真实能力之间出现偏离。生成式AI尤其擅长提升文本的流畅度、结构感和规范性,这使得一些原本需要较长训练才能形成的外观特征变得更容易获得。于是,一份语言顺畅、结构整齐的答案,未必稳定地对应于学生的分析能力、判断能力和问题意识。反过来说,一些真正有判断含金量但表达尚不成熟的成果,也可能在评价中被表面形式掩盖。由此,评价面临的并不是“答案有没有价值”的简单问题,而是“答案还能在多大程度上代表能力”的信号问题。来源失真、过程失真和能力失真共同说明,AI带来的评价压力,不只是最终成果是否真实的问题,而是最终成果作为能力信号是否仍然充分的问题。若评价体系继续把最终答案作为主要甚至唯一依据,就可能在不知不觉中高估生成能力、低估判断能力,进而使教育评价偏离其原本想要识别和培养的能力目标。
(二)制度性压力
第一,披露不等于可评价。在应对AI带来的评价挑战时,许多制度设计会首先想到“披露”原则,即要求学生说明是否使用AI、使用了哪些工具、使用在哪些环节。披露当然是必要的,它能够提高人机协作过程的透明度,也有助于维护学术诚信的基本边界。然而,披露并不等于可评价。换言之,即使学生如实说明自己使用了AI,教师仍然可能无法仅凭这一说明判断学生真实能力的形成过程。
原因在于,“使用AI”本身是一个过于宽泛的表述:从用AI检查错别字到用AI生成论文框架,从让AI提供反方观点到直接采纳AI生成的主要论证,这些行为都可以被概括为“使用AI”,但它们对应的学习投入和能力含量完全不同。如果评价制度只要求学生披露“是否使用”,而不进一步追问“如何使用”“使用后如何判断”“哪些关键决定由谁完成”,那么披露只能提供有限的信息,不能真正解决评价问题。
因此,披露的意义不应被夸大为评价重构本身。它更像是评价重构的入口,而不是终点。真正重要的是,在披露之后,教师和课程制度能否进一步识别人机协作中的关键能力节点:学生是否能够解释问题是如何界定的,材料为何被采纳或排除,AI输出为何被修改或拒绝,最终结论为何由学生本人承担。只有当披露与过程证据、判断说明和口头追问结合起来,学生的AI使用才可能从一个合规声明转化为可评价的学习过程。否则,披露制度容易停留在形式透明层面,却无法恢复教育评价对真实能力的识别功能。
第二,这是测量问题,不只是纪律问题。这里的问题不宜被简单还原为“作弊增加”。把AI带来的挑战理解为纪律问题,意味着问题被表述为:学生是否违规使用了工具、是否应被惩罚、教师如何加强监督。这样的视角当然触及现实,但它只能解释问题的一部分。
更深层的困难在于:即便学生如实披露AI参与过程,当前评估体系也可能依然难以区分“依赖AI获得的高输出”和“高能力学习者的高输出”。换言之,就算没有任何故意隐瞒,评估仍可能失效。因为AI改变的,不只是学生是否“诚实”,而是结果与能力之间原有的映射关系。
为说明这种测量失效,可以设想一个构造性情境:两个学生都提交了一篇结构完整、语言规范的论文。甲主要依靠AI生成初稿,再做少量润色;乙也使用AI,但在问题定义、证据选择、论证结构与反例处理上投入了大量判断劳动。若教师只看最终成稿,这两者可能呈现出相似的表面质量。此时,即使两人都完全如实披露使用过程,评估若没有专门设计去识别“判断劳动”发生在哪里,仍然无法有效区分二者。
这正说明:问题的核心并不是学生是否如实披露,而是现有测量工具是否还能识别真正想测的能力。因此,这首先是测量问题,其次才是纪律问题。纪律问题解决的是“有没有违规”,测量问题解决的是“我们到底测到了什么”。前者当然必要,但不能替代后者。
第三,监控路线不是可持续解。如果沿着纪律逻辑继续推进,教育系统自然会倾向于第一条路径:不断提高监控、检测与惩罚成本。例如,开发更强的AI检测工具、增加现场写作、强化口头核查、细化惩戒规则等。这类措施并非毫无价值,但它们面临一个明显的制度性限制:它们更多是在修补信号,而不是重建信号。
从信号理论看,一个有效信号之所以有效,不在于系统投入了多少资源去抓作弊,而在于高能力者和低能力者之间本来存在成本差异。如果这种差异已被新技术显著压缩,那么单靠外部监控去维持旧信号,成本会越来越高,且效果越来越脆弱。因为系统需要不断投入额外资源,去证明一个本已开始失去区分度的指标仍然有区分度。
更具体地说,“监控路线”容易陷入一种持续升级的博弈均衡:生成工具变强,检测工具也必须变强;学生学会规避检测,制度就必须追加新规则;教师为确认真实性增加口头追问,学生和AI协作的方式也同步调整。结果并不是系统重新获得稳定,而是监控成本、对抗成本和执行负担不断上升。
这就是为什么前文所说的责任成本会转移到制度层。教育系统若沿用旧信号进行筛选,就只能不断追加对结果真实性的核查;但一旦核查本身变成高成本、低稳定性的活动,这条路径就越来越难维持。它可以阶段性延缓问题,却很难从根本上恢复评估的区分能力。
第四,从结果代理走向能力可观测性。相比之下,第二条路径——重新思考评估应当测量什么、如何测量——更具有制度可持续性。所谓可持续,不是说它更轻松,而是说它更接近问题的结构根源:如果答案已经不能稳定代表能力,就必须寻找新的能力代理变量。
从信号理论看,这相当于重新寻找新的差异性成本。生成一篇像样文章的成本被压缩了,但解释自己如何选择结构、如何处理冲突证据、如何修订错误推理的成本,并没有被同样压缩。恰恰是在这些环节中,高能力者和低能力者之间仍然存在更清晰的差异。换言之,评估重构不是抽象地“更先进”,而是在技术改变旧信号后,重新寻找仍然有筛选效力的新信号。
由此,AI带来的挑战,表面上是“答案越来越容易写出来”,实质上是“能力越来越不容易从答案中被看见”。如果教育不能回应这一点,就会在答案愈发精致的同时,越来越难判断答案背后究竟有什么能力含量。
因此,评估危机的核心不是答案的存在,而是答案作为信号的贬值。一旦认识到这一点,教育面对AI的真正任务,不止于设立更多禁令,关键在于重新设计能够稳定指向能力本身的评估方式。
(三)从监控回应转向评价重构
AI带来的制度性压力,不能仅靠监控和惩罚来化解。监控路线可以在一定程度上维护学术规范,也可以对明显违规行为形成约束,但它难以解决更深层的测量问题:当答案生成成本下降、最终成果与真实能力之间的对应关系变弱时,教育评价真正需要恢复的是能力的可观测性,而不仅是结果的可追责性。
因此,制度回应的重点应从“如何防止学生使用AI”转向“如何在AI参与之后仍然识别学生能力”。这意味着,教育评价不能只围绕工具使用本身设置规则,而应进一步重构评价对象、评价标准、评价证据和评价程序。学生是否使用AI固然重要,但更重要的是:AI参与了哪些环节,学生完成了哪些关键判断,最终成果能否经受推敲、追问和复核。
从这一意义上说,评价重构不是对传统评价的简单替代,而是对传统评价功能的再组织。结果评价仍然重要,但必须被放回过程证据和判断路径之中;学术诚信仍然重要,但不能替代对真实能力的识别;技术检测可以作为辅助,但不能成为评价判断的中心。如何把这些原则落实到课程任务、作业设计、评分标准和制度安排之中,将构成下一部分需要展开讨论的核心问题。
四、评价重构的制度回应
评价重构的核心任务,是重新建立一种能够观察能力形成过程的评价机制,使学生的筛选、判断、取舍、修订和负责能力能够在评价中被看见。具体而言,这种重构可以从评价对象、评价标准、评价规则、评价证据和评价制度五个层面展开,共同服务于一个目标:在AI参与学习过程之后,恢复学生真实能力的可观测性。
(一)评价对象重构:从结果评价转向过程证据链
评价重构的第一步,是从单一结果评价转向过程证据链评价。所谓过程证据链,并不是要求学生无休止地提交材料,而是围绕关键能力形成若干可以被观察、被追问、被评价的证据节点。对于课程论文、案例分析、调研报告、项目方案等任务而言,评价不应只停留在最终文本,而应进一步关注学生如何形成问题、如何寻找材料、如何比较证据、如何处理反方观点、如何修改初稿,以及如何解释最终结论。
具体而言,过程证据链至少可以包括五类材料:一是问题形成材料(如选题说明、问题拆解、概念界定等),显示学生是否真正理解任务要求;二是资料筛选材料(如来源说明、引用理由和排除理由等),显示学生是否具备判断可靠性和建立证据基础的能力;三是结构生成材料(如提纲版本、论证框架、修改说明等),显示学生是否能够根据自身判断组织材料;四是反思修订材料(如初稿问题、修改理由、反馈调整等),显示学生是否能够识别自身论证中的漏洞并主动修正;五是AI使用说明(如哪些环节使用了AI、哪些建议被采纳或拒绝、拒绝理由),显示学生在人机协作中的判断位置。
这一做法的意义在于,把过去隐藏在最终成品背后的学习劳动重新呈现出来。AI可以帮助学生生成文本,但较难替学生稳定地完成“为什么这样定义问题”“为什么采用这一证据”“为什么不接受某个AI建议”等解释性任务。也就是说,过程证据链的价值不在于增加形式材料,而在于把筛选、判断、取舍、修订和负责这些能力重新变得可见。当然,过程证据链不应被理解为对学生学习过程的全面监控;如何在不增加形式负担的前提下设计关键证据节点,将在(五)评价制度重构中进一步讨论。
(二)评价标准重构:从答案质量转向判断路径
评价重构的第二步,是从答案质量转向判断路径。传统评价往往关注最终答案是否完整、表达是否清楚、结构是否规范、观点是否成立。AI并没有使这些标准失效,但削弱了它们作为能力信号的充分性——因为在AI辅助下,答案的完整性、语言的流畅性和结构的规范性更容易被生成出来。此时,如果评价仍主要停留在答案表面,就容易把“结果像样”误认为“能力充分”。
判断路径评价的重点是要求学生说明自己如何在多个可能答案之间作出选择。在写作任务中,学生不仅需要给出观点,还需要解释为什么选择这一问题角度而不是另一个角度;不仅需要列出证据,还需要说明为何这些证据比其他材料更适合支撑论点;不仅需要呈现结论,还需要解释结论的适用边界。这样的评价方式,实际上把评价重心从“写出了什么”推进到“为什么这样写”。
判断路径评价尤其适合回应AI带来的信号贬值问题。AI可以生成多个看似合理的结构、论点和表述,但学生如何判断这些方案的优劣、如何根据课程目标和问题情境进行取舍,仍然体现出较大的能力差异。对于教师而言,这意味着评分标准需要从“表达质量”进一步扩展到“判断质量”,包括问题意识、证据意识、反方意识、边界意识和责任意识。评价标准只有从答案表面进入判断路径,才能在AI生成能力不断提高的条件下继续发挥区分功能。
(三)评价规则重构:从是否使用AI转向人机协作的可解释性
评价重构的第三步,是从“是否使用AI”的二元判断转向“人机协作是否可解释”的过程判断。在AI已经进入学习行为的现实条件下,简单追问“有没有使用AI”往往难以触及问题本质。一方面,在某些基础训练任务中,限制AI使用仍然有必要,因为教育需要确认学生是否保有基本阅读、写作、计算、表达和理解能力;另一方面,在综合性学习任务或项目制学习中,完全排除AI既未必现实,也未必符合未来真实工作情境。
因此,更合理的制度回应不是在所有场景中采用同一规则,而是根据任务性质区分AI使用方式:对于基础性任务,可以设置人机分离要求,确认学生是否掌握核心基础能力;对于训练性任务,可以允许学生透明使用AI,但要求记录使用目的、使用环节和修改过程;对于综合性任务,可以鼓励学生使用AI进行资料整理、方案比较和反馈迭代,但评价重点放在问题定义、证据组织、方案取舍和责任解释上。
所谓人机协作可解释性,至少包括三层含义:第一,学生能够说明AI参与了哪些环节,例如资料整理、提纲生成、语言润色或反方观点提示;第二,学生能够说明自己完成了哪些关键判断,例如选题、论点确定、证据取舍和结论边界;第三,学生能够对最终作品承担解释责任,即能够在口头答辩或课堂讨论中说明作品形成过程,并回答教师关于材料、逻辑和判断依据的追问。规则的目的不是简单防止学生使用工具,而是确保工具参与之后,学生的理解、判断和责任仍然能够被解释和评价。
(四)评价证据重构:从单一提交物转向多元证据组合
评价重构的第四步,是从单一提交物转向多元证据组合。AI并不是使论文、报告、作业等传统提交物完全失去价值,而是使它们不能再独自承担全部评价功能。更合理的方式,是把最终提交物与过程材料、课堂表现、口头答辩、同伴互评和教师反馈结合起来,形成多元证据组合。例如,课程论文可以由“最终文本+选题说明+资料筛选说明+AI使用声明+口头答辩”共同构成评价依据;项目制学习可以由“项目成果+过程日志+分工说明+问题复盘+现场陈述”共同构成评价依据。
多元证据组合的意义,在于用不同来源的证据相互校正:最终文本显示表达和组织结果,过程材料显示思考和修改轨迹,口头答辩检验学生是否真正理解作品,同伴互评反映协作贡献与责任。单一提交物容易被AI生成能力放大其表面质量,而多元证据组合能够更好地呈现学生在任务完成过程中的真实参与程度。
多元证据组合也有助于降低单一检测工具的误用风险。AI检测工具可以作为辅助,但不宜成为判断学生能力或学术诚信的唯一依据:检测工具本身存在误判可能,也容易促使学生和工具之间形成新的规避博弈。相比之下,过程证据、口头说明和判断路径更能帮助教师识别学生是否真正理解任务、是否能够对作品负责。评价重构应当把技术检测放在辅助位置,把教育判断重新放回评价中心。
(五)评价制度重构:从教师个人经验转向课程级评价设计
评价重构最终还需要从教师个人经验上升为课程级评价设计。如果每位教师都只能凭经验临时判断学生是否合理使用AI,评价规则就会变得不稳定,学生也难以形成明确预期;不同课程、不同教师之间若缺乏基本规则,还会加重教师处理争议的负担。因此,AI背景下的评价重构,需要在课程层面明确任务类型、AI使用边界、过程材料要求和评分标准。
课程大纲可以对不同类型任务作出分层说明:哪些任务必须独立完成,哪些任务可以透明使用AI,哪些任务鼓励人机协作;使用AI后需要提交什么说明,教师将如何评价过程材料。课程级评价设计还需要配套评分量规。量规不应只评价最终成果,也应评价问题定义、证据筛选、判断取舍、人机协作说明和反思修订等维度。例如,一项课程论文的评价量规可以包括:问题界定是否清楚,证据来源是否可靠,论证结构是否合理,反方观点是否得到处理,AI使用说明是否透明,学生是否能够解释关键判断。这样的量规既有助于教师保持评价一致性,也能让学生提前理解课程期待。
与此同时,评价制度重构不能无限增加教师负担。过程证据链如果设计不当,容易变成新的形式主义。为了避免这种情况,评价设计应当坚持“少而关键”的原则——只要求学生提交能够反映核心能力的过程证据,而不是收集所有痕迹。此外,课程级评价设计还需要教师能力建设的支持:教师需要理解AI能够完成什么、不能稳定地完成什么,才能设计出能够观察学生真实能力的评价任务。
由此可见,AI背景下的评价重构,不是简单增加规则,也不是单纯加强监控,而是围绕能力可观测性重新设计评价对象、评价标准、评价规则、评价证据和评价制度。教育系统真正需要回应的,不是AI是否出现在学习过程中,而是学生的理解、判断、责任和创造能否在AI参与之后仍然被看见、被追问、被评价。
五、中外高校的治理回应:专业结构、课程规范与评价治理
AI对教育评价的影响,并不只是课堂内部的技术使用问题,也会进一步传导至专业结构、课程规则与制度治理层面。高校如何调整专业设置,如何在课程中界定AI使用边界,如何在作业、考试和评价环节中重新确认学生能力,构成观察教育评价重构的重要现实窗口。中外高校虽处于不同制度环境,却共同显示出一个趋势:AI正在推动高校从单纯使用管理工具,转向重新设计人才培养目标与能力评价规则。
(一)中国高校专业结构调整:能力结构变化的制度信号
中国高校专业结构正经历系统性调整,这一过程折射出人才培养能力结构的深刻变化。根据教育部2024年统计,全国高校新增专业点1839个,撤销专业点1428个、停招2220个,撤销与停招总数已超过新增数量。教育部在政策表述中明确指出,高校专业设置需更快速响应国家战略、科技前沿与市场需求。值得强调的是,AI是这一轮专业结构优化的重要变量之一,但并非唯一变量。
以2026年3月中国传媒大学的专业调整为例,该校对翻译、摄影等16个本科专业及方向进行关停并转,引发广泛关注。这一案例的关键并不在于削减数量,而在于校方对调整性质的界定。根据校方2026年3月9日的官方说明,此次调整被定义为“人工智能时代的系统性专业优化”,而非简单裁撤。在后续访谈中,学校负责人进一步阐释,诸如摄影、翻译等核心能力并未失去价值,但其原有的独立专业形态可能已无法完全适应新技术与产业环境的变化。
该案例至少揭示了两重趋势:第一,高校正在重新判断“哪些能力值得以独立专业形式培养”;第二,技术变迁与产业变化正在共同作用于专业结构,而不只是课堂工具层面的变化。
(二)中国高校教学与评价规范回应
如果说专业结构调整体现的是高校在人才培养目标层面对AI冲击作出的回应,那么教学与评价规范的调整,则更直接体现了高校在课程运行层面对AI介入学习过程的治理。专业结构回答的是“培养什么样的人”和“哪些能力应当重新组合”,教学与评价规范回答的则是“在具体课程中如何训练这些能力”以及“如何判断这些能力是否真实形成”。因此,高校面对AI的制度回应,并不应只停留在专业目录和培养方案层面,还必须落实到课程任务、作业规则、考试方式和能力评价机制之中。
以中国传媒大学的相关公开回应为例,其意义并不只在于部分专业方向的调整,更在于学校进一步出台了AI教学规范、学术规范、作业规范和考试规范等制度安排。“关键课程必须考核人机分离能力,通过手写作答、闭卷考试、独立创作等方式,守住人的基础能力与独立思考底线,避免被AI‘废掉基本功’”。这说明高校正在尝试把AI从一种外部工具,纳入教学治理和评价治理的框架之中。换言之,问题不再只是学生“能不能使用AI”,而是不同课程、不同任务、不同能力训练环节中,AI应当如何被允许、被限制、被说明和被评价。校方提出关键课程“必须考核人机分离能力”,尤其值得注意。这一提法表明,高校在接纳AI工具的同时,并未放弃对学生基础能力的独立考核。所谓人机分离,并不是要求所有学习任务都排除AI,而是在关键能力节点上确认学生是否具备不依赖工具也能完成的基本能力。例如,在基础写作、核心概念理解、口头表达、专业判断等环节,课程可以通过限时写作、现场讨论、口头答辩、闭卷测试等方式,确认学生是否真正掌握了必要能力。这类评价并非回到简单的“禁用AI”,而是在AI广泛参与学习的背景下,为基础能力保留必要的验证机制。
综上,中国高校的教学与评价规范,正在从单纯的工具使用管理,转向更深层的能力验证与评价设计。其核心不是简单防止学生使用AI,而是在AI参与学习过程之后,仍然能够判断学生是否具备独立理解、问题界定、证据筛选、判断取舍和责任承担的能力。这与前文所讨论的评价重构方向是一致的:教育评价需要重新设计能力被观察、被追问和被确认的方式。
(三)国际高校的课程AI政策
国际高校的课程AI政策呈现出差异化与共识性并存的特征。
哈佛大学于2023年7月13日发布面向全校的AI初步指引。公开材料强调的重点包括信息安全、隐私、版权与学术诚信;在教学层面,哈佛文理学院教学支持页面提供了从“禁止使用”到“允许使用”的课程政策范例,核心是要求教师在课程中明确说明AI使用边界。
麻省理工学院(MIT)已发布机构层面的指引,公开强调的重点是信息安全、隐私、知识产权、合规与学术诚信。对高风险场景,尤其是涉及学生评价与决策的用途,该校更强调审慎评估,而不是简单也把AI视作一种无条件可用的常规教学工具。斯坦福大学并未形成一个统一的“全校单一文件”来覆盖所有课程场景,但教学支持页面明确建议教师在教学大纲中写明课程的AI使用政策。如果教师未明确说明,则相关使用通常按“接受他人帮助”的规则处理。这里真正稳定的事实不是某个单一框架文件,而是课程层面政策明确化已经成为必要动作。
加州大学伯克利大学法学院自2026年夏季起执行新的AI政策。该政策一方面承认未来法律从业者需要具备使用人工智能的能力,另一方面强调,AI使用必须以法律教育所要求的核心认知能力、批判性评估能力和职业伦理责任为基础。因此,在默认规则下,学生不得在计入成绩的作业中使用AI辅助构思、列纲、起草、修订、翻译或编辑,也不得在考试情境中为任何目的使用AI;教师可在课程中通过书面说明设置不同规则,并要求学生披露经授权的AI使用。该案例显示,在法律教育这类高度依赖文本推理、规范判断和责任承担的专业训练中,高校并非只是简单地“禁止工具”,而是在特定评价场景中通过默认限制、课程授权和责任说明来保护基础能力训练。
牛津大学目前的官方口径很严格,在伦理使用中强调“始终以诚信、诚实和透明的态度使用AI工具,并对使用这些工具产生的任何输出保持批判态度”。学生指导页面明确指出,在评估中使用AI,默认是不被允许的;只有在该项评估的书面说明明确许可时才可使用,且使用后必须正式声明。其重点不在于抽象鼓励或反对,而在于“默认禁止、逐项许可、许可后声明”。任何未经授权使用AI的作品均构成作弊和抄袭,违规者将面临未通过相关评估,并在适当情况下被开除。
这些案例共同说明,国际高校的现实回应并不是简单的“全面禁止”或“全面开放”,而是把AI使用边界、教师课程自主权、数据与隐私风险,以及评估中的声明规则等制度化。
(四)共同趋势:从工具管理到评价治理
综合中国高校的专业结构调整、教学规范的回应,以及国际高校围绕AI所形成的课程政策,可以看到一个较为清晰的共同趋势:高校对AI的回应正在从“工具管理”转向“评价治理”。早期讨论往往集中在学生是否可以使用AI、教师是否应当禁止使用AI、学校是否需要检测AI生成内容等问题上。这些问题仍然重要,但如果停留在工具管理层面,就容易把AI的教育影响理解为外部技术风险,而忽略其对学习过程和评价逻辑的深层改变。
所谓工具管理,关注的是“能不能用”“何时能用”“怎样防止滥用”。而评价治理关注的则是更深一层的问题:在AI已经进入学习过程之后,课程如何设计任务,教师如何判断学生能力,学生如何说明人机协作过程,学校如何建立可执行、可申诉、可持续的评价规则。前者主要以限制和规范为中心,后者则以能力识别和制度设计为中心。
从中国高校的回应看,专业结构调整、教学规范、作业规范、考试规范以及人机分离能力考核,指向的是人才培养结构和评价方式的联动调整。从国际高校的回应看,哈佛、牛津、MIT、斯坦福等高校的政策差异虽然明显,但共同点是都在课程或评估层面明确AI使用边界,要求教师或课程对AI使用规则作出说明,并在涉及评价和决策的场景中保持审慎。这些做法表明,高校并非简单在“全面禁止”和“全面开放”之间选择,而是在具体教学任务中重新界定AI使用与能力评价的关系。
这一趋势说明,AI带来的制度挑战,最终会落到课程评价规则之中。学生是否使用AI并不是唯一问题,真正关键的是:使用AI之后,学习过程是否仍然可解释,关键判断是否仍然可归属,最终成果是否仍然能够作为能力证据。也正是在这个意义上,高校治理的重点将逐渐从“管住工具”转向“重构评价”:通过明确任务类型、使用边界、过程证据和责任归属,使AI参与学习过程之后,学生的真实能力仍然能够被识别和评价。
因此,中外高校回应的共同方向不是简单抵制AI,而是把AI纳入更成熟的教学与评价治理框架。专业结构调整回答能力结构如何变化,课程级政策回答工具边界如何设定,评价规则则回答学生能力如何被确认,这三者共同构成AI背景下高等教育制度回应的基本图景。
讨论与结论:教育稀缺性的重新定义及其政策含义
如果把本文的核心判断压缩为一句话,可以表述为:当获取变得便宜,教育必须把稀缺性重新安放到判断、责任与可解释的人机协作之上。AI并没有使知识、作业、论文或课堂学习本身失去意义,但它改变了这些活动作为能力信号的稳定性。过去,教育评价可以在相当程度上通过最终结果推断学生能力;现在,最终结果仍然重要,却不能再单独承担能力识别的全部功能。教育评价必须进一步追问:结果是如何形成的,关键判断发生在哪些环节,学生是否能够解释证据选择、结构安排和结论边界,AI参与了什么,人完成了什么,最终责任如何归属。
这一判断也意味着教育稀缺性的迁移:知识获取与文本生成本身仍然重要,但它们的区分功能下降;更具教育价值的部分,正在转向问题定义、证据筛选、反方处理、判断取舍、过程修订和责任解释。这也是为什么本文第四部分所讨论的五层面评价重构,不能被理解为附加的技术安排,而应被视为教育评价功能的再组织。当然,评价重构并不意味着越复杂越好,也不意味着所有课程都应立即引入大量过程材料、AI使用记录和口头答辩。恰恰相反,AI背景下的评价改革更需要警惕新的形式主义。
第一,过程证据链不能变成材料主义。如果学生只是为了满足要求而提交大量选题记录、修改痕迹和AI使用说明,而教师并不真正阅读、评价和反馈,这些材料就会成为新的形式负担,无法提升评价有效性。过程证据的价值不在于数量,而在于能否有效显示关键能力节点。
第二,AI使用披露不能变成单纯的惩罚机制。披露的目的应是提高人机协作过程的透明度,使教师能够进一步判断学生真实参与程度,而不是把披露本身作为扣分依据。如果学生披露AI使用就面临负面评价,他们就更可能转向隐性使用,反而削弱制度透明度。因此,披露制度必须与任务类型、使用边界和评价标准相配套,使学生知道哪些环节可以使用AI,哪些环节必须独立完成,哪些使用方式需要解释。
第三,AI检测工具不能替代教育判断。检测工具可以作为辅助,但不应成为判断学术诚信或学生能力的唯一依据。AI检测存在误判可能,也容易引发新的规避行为。如果教育系统过度依赖检测工具,就可能重新落入技术对抗逻辑,把评价问题简化为识别工具痕迹的问题,而忽略真正需要判断的是学生是否理解、是否判断、是否负责。
第四,评价重构不能无限增加教师负担。过程证据链、多元证据组合和课程级评价设计都需要教师投入时间和专业判断。如果缺乏简明量规、任务分层和制度支持,评价重构就可能变成教师个人额外承担的工作压力。因此,课程评价改革应坚持“少而关键”的原则:不追求记录一切过程,而是识别与课程目标最相关的关键证据。
第五,还需要关注评价公平问题。不同学生在AI工具获取、使用经验、语言表达、数字素养等方面存在差异。如果评价制度只是鼓励学生更熟练地使用工具,而不同时评价学生的判断过程和责任说明,就可能扩大新的能力差距。因此,教育评价应避免把“会使用AI”直接等同于“能力更强”,而应关注学生是否能够对AI输出进行审查、选择、修正和解释。只有这样,人机协作才不会成为新的不平等来源,而能成为促进学习能力发展的支持条件。
综上,AI改变的不是某一种学习形式,而是教育评价赖以运作的信号成本。未来评价的关键,不是简单禁止或全面放开AI,而是建立能够在AI参与之后继续识别真实能力的制度安排。若仍以旧有方式奖励答案,教育会越来越难区分生成能力与判断能力;若能把评价重心从答案信号转向能力的可观测性,AI则不只是评价危机的来源,也可以成为推动教育评价更新的契机。教育评价重构的最终目标,不是排除技术,而是在技术参与之后,仍然让学生的理解、判断、创造与责任变得可见。
(本文参考文献略)
Reconstructing the Signaling Basis of Educational Assessment in the Age of Artificial Intelligence
Zhao Li
Abstract: Artificial intelligence is reshaping the signaling basis on which educational assessment depends. As the costs of knowledge acquisition and text generation fall sharply, the correspondence between answers and competence weakens, while the costs of screening, judgment, and accountability rise in parallel. Whom learners turn to with questions, how they produce their work, and how they enter into discussion all shift accordingly, so that final submissions no longer reliably reflect the actual learning process. If assessment continues to reward answers that appear complete and read fluently, it will overvalue generative capacity while undervaluing the capacity for judgment. This challenge is, in the first instance, not a matter of academic integrity or tool use, but a measurement problem in educational assessment: when answers become cheap, assessment signals lose their value. A sustainable response is to shift the object of assessment from outcomes to chains of process evidence; its criteria from answer quality to pathways of judgment; its rules of use from whether AI is permitted to how human-AI collaboration is disclosed, traced, and accounted for; its evidence base from a single submitted artifact to a portfolio of evidence; and assessment practice itself from individual teachers’ experience to course-level design. The aim of this reconstruction is to make competence observable again under conditions in which answers are becoming increasingly cheap.
Key words: Artificial Intelligence; educational assessment; assessment signals; learning behavior; observability
初审:胡天扬
复审:孙振东
终审:蒋立松