← 返回洞察与实践

生成式AI能替教师"看作业"吗?高等教育形成性评价的智能升级

生成式人工智能赋能形成性评价,是指借助能够自主生成文本、代码等内容的大语言模型,为以促进学习为目的的形成性评价过程提供即时、个性化反馈的技术应用。 生成式人工智能(Generative Artificial Intelligence,简称GAI)由大语言模型驱动,能以人类可理解的方式开展多轮对话,并根据用户的输入…

一门课上完,教师抱回两百份作业,真正逐个诊断的却寥寥无几——不是不想,而是精力撑不住。当生成式人工智能能进行多轮对话、给出逐条点评,"批不完的作业"这道难题似乎有了新的解法。但它会成为教师的好帮手,还是让评价本身失去意义?这需要我们先看懂"生成式人工智能赋能形成性评价"这件事。

什么是"生成式人工智能赋能形成性评价"

生成式人工智能赋能形成性评价,是指借助能够自主生成文本、代码等内容的大语言模型,为以促进学习为目的的形成性评价过程提供即时、个性化反馈的技术应用。 生成式人工智能(Generative Artificial Intelligence,简称GAI)由大语言模型驱动,能以人类可理解的方式开展多轮对话,并根据用户的输入即时给出评价建议。国内如文心一言、讯飞星火等工具,已具备这种能力。它发力的对象是"形成性评价"——一种与"总结性评价"相对、以"为了学习的评价"为取向的评价方式,其目的在于通过反馈帮助学生改进学习,而非仅在期末给学习结果盖章。

这一概念并非凭空出现,而是踩在政策与技术两条线上同时演进的结果。在政策端,2020年中共中央、国务院印发《深化新时代教育评价改革总体方案》,明确提出要创新评价工具,利用人工智能、大数据等现代信息技术,探索开展学生全过程纵向评价。 在技术端,2022年11月OpenAI发布的ChatGPT引发全球教育界关注,其后国内对话式大模型迅速跟进,让"机器能像人一样点评作业"第一次成为可触及的现实。此后,围绕生成式人工智能形成的"赋能观"与"限制观"之争始终激烈:有人看到它把教师从繁琐事务中解放、应成为评价的未来;也有人担心它助长照搬抄袭、消解批判思维,主张在高等教育中谨慎或禁止使用。这些争议恰恰说明,它已经不是一个可讨论要不要用的选项,而是一个必须弄懂的当务之急。

要准确把握这个概念,关键在于理解"形成性评价"与"智能反馈"这对组合。形成性评价这一思想最早可追溯到上世纪六十年代,由布鲁姆提出,其核心是一套"为了促进学习"的评价设计;而智能反馈则是其中提高反馈及时性的技术手段。 传统智能反馈多基于预定义答案或学习分析,只能给出"对或错"式的机械回应;生成式人工智能的出现,则让反馈第一次能够"说人话"、分层次、追着学生的回答深入下去。

通俗而专业的解释——它到底解决了什么

要明白它的价值,得先看清传统形成性评价的困境。主流观点认为,形成性评价与总结性评价的核心分野,正在于前者对应"为了学习的评价"、后者对应"对学习的评价"这一经典二分(Black与Wiliam)。前者的终点是让学生学得更好,后者则是鉴定学习结果。 然而在实际的大学课堂里,形成性评价长期受制于两处短板:一是反馈不够及时,作业交上去往往要等上好几天才见到批改;二是个性化程度不足,不可能为每位学生逐一量体裁衣。生成式人工智能恰恰在这两点上展现出优势。

要理解它为何能"取代一部分教师工作",还得先弄明白"反馈"在形成性评价里的分量。研究普遍认为,反馈已成为形成性评价的核心策略——按照Hattie与Timperley提出的反馈模型,反馈可以作用于任务、过程、自我调节与个人四个层次:任务层面的反馈回应"做对了没有",过程层面的反馈提示"方法行不行",自我调节层面的反馈帮助"自己检查自己",个人层面的反馈则直接面向学习者本人的状态。 传统上,这些反馈主要依靠教师口头点评或同伴互评来完成,成本高、覆盖窄。如今常见的智能反馈虽然能实现自动即时响应,却大多基于预定义答案或简单的学习分析,交流与评价能力受限——这正是生成式人工智能切入的空间:它既能理解自然语言,又能在多轮对话中不断逼近真正的"过程性指导"。

具体而言,它在三个层面发力:在知识层面,它能即时产出文本反馈并承担部分自动化评价,把教师从机械批改中解放出来,去从事更有价值的高质量师生互动;在能力层面,它能依据学生的学习痕迹提供即时、个性化的帮助,间接改善学习习惯;在实践层面,它能构造情境化任务,提供持续、高质量的智能反馈。进一步说,生成式人工智能的长处在于通晓并贯通文本、图像、语音这类多种形态的信息,这使它能够从"过程性文本""课堂对话"这类原本难以量化的定性材料里挖掘价值,还能识别学生的情绪状态、评估个体或群体的观点倾向,为每位学生生成差异化的发展建议。它甚至能支撑自适应测试,依据答题表现动态调整题目难度与反馈方向。

它究竟好在哪、卡在哪

从创新的角度看,生成式人工智能至少带来三重价值。其一,创新了形成性评价的方式。 它能够设计复杂的、情境化的评价任务,把评价场景扩展为基于游戏的、交互式的模拟环境;这类情境化评价既可用于考查问题解决等高阶能力,也能通过"情境感知"实时澄清学生的困惑,还可自动生成题目、降低出题成本。其二,提高了评价效率。 通过多轮对话,在教师监督下它能产出更准确、客观的教师评语,减少重复劳动。其三,提升了个性化水平。 它能为学生提供自定步调的个性化学习支持,依据学习行为与文本足迹给出针对性的评估与反馈。

但这条路径并非一路坦途,研究揭示了五方面挑战值得警惕。理念层面,若缺乏"以人为中心"的指导思想,评价容易滑向"以机器为中心"——机器难以充分考虑情感、文化与个体差异。对象层面,学生容易把生成式人工智能当作"答案提供者"而非"学习促进者",人与工具的关系从"辅助"退化为"替代",进而陷入所谓的"认知外包陷阱",忽视基础巩固、削弱高阶思维。过程层面,大模型常被形容为"黑匣子",其推导过程与依据不透明,教师和学生很难看懂结论背后的理由,由此带来评价口径模糊、对结果信任不足的问题。结果层面,学生可能直接复制机器输出充当作业,使真实的技能水平无法被准确评估,从而破坏评价的准确性与公平性。伦理层面,大规模使用学生数据诱发隐私泄露担忧,训练数据中的偏见可能导致算法歧视,生成内容还可能触发学业作弊与版权问题。

别混淆:它与"智能反馈""自适应评价"有什么不同

这一概念与几个近义表述常被混用,需要厘清。它不同于一般意义上的"智能反馈"。 智能反馈泛指一切由系统自动产生的即时回应,很多早于大模型出现,基于固定规则或学习分析,只能回复"对错"而不能展开对话;生成式人工智能的反馈则具备理解语境、组织语言、追问深挖的能力,能够真正贴近"教师的点评"。它也不同于"自适应测试"。 自适应测试侧重根据答题表现动态调整题目难度,可被看作是生成式人工智能赋能评价中的一个应用子集,而非其全貌——后者还涵盖开放文本评价、情境任务生成、情绪识别等多个方向。此外,它与"数据驱动的形成性评价"也有差别:后者强调的是用行为数据描述学习状态,而生成式人工智能更强调"生成"——它不满足于描述"发生了什么",还会主动产出针对性的新意见与建议。厘清这层边界,有助于院校在选型时看清"我引入的究竟是什么能力"。

一张表看懂:五重挑战与应对思路

挑战维度具体表现应对取向
评价理念重机器、轻育人确立以人为中心的导向
评价对象依赖工具、弱化思维明确人机协同边界
评价过程黑箱、标准不明转变评价方式、明确标准
评价结果作弊、失真、不公多元反馈相互佐证
评价伦理隐私、偏见、诚信多方联合、家校社协同

表:生成式人工智能介入形成性评价时,五类隐忧与对应的化解思路(依据公开研究梳理)

它该如何落地于高校与高职课堂

要让这一技术从实验室走进真实教学,关键在于把握"以人为中心"这条主线。教师不能把评价全盘交给机器,而要扮演"设计者"与"把关者"。 智能反馈不能仅仅依托通用大模型,还需要建立在学科知识图谱、问题库与反馈库之上,而教师恰恰是这些知识库的建设与检验者。

对人机协同的边界,应当给出清晰约定:头脑风暴、思路启发可以被允许,直接复制机器输出充当自己的思考则不可接受。 在方式上,可以通过布置多模态作业、强调协作分享、应用抄袭检测工具等,降低作弊空间;在伦理上,则需国家、院校与教师三方联动——国家依规规范数据使用,院校明确师生应用边界并保障数据安全,教师通过设计合理任务并开展诚信教育来防患于未然。

对高职院校而言,这一概念的落地尤其具有现实土壤。高职课堂以实训、操作、项目制学习为主,恰恰是最需要"过程性、个性化反馈"的场景。 一家学校可以先从一门实训课程切入,把生成式人工智能用于实训报告批改、操作步骤诊断与技能短板分析;同时利用它生成情境化的任务情境,把评价嵌入"接单—做活—交付"式的仿真流程中。需强调的是,技术是放大器而非替代者——它放大的是教师评价的能力半径,而不是取代教师对学生成长的判断。高职院校在引入时应同步配套教师培训,让教师先明白"什么时候该用、什么时候必须亲自看",再考虑铺开规模。

具体到教学流程的各个环节,便能更清楚地区分"能做什么"与"必须保留人工"的分界,这能帮助部门负责人规划落地的优先级,也便于向教师讲清数据使用与隐私保护的约定——所有涉及学生画像的信息原则上应脱敏使用,评价结论的最终解释权仍应保留在教师手中。

教学环节生成式AI能承担的需保留教师亲自判断的
实训报告批改即时点评语法、结构与格式工艺正确性与操作规范把关
技能短板诊断基于文本痕迹识别薄弱环节现场操作的安全与价值判断
情境任务生成自动拟制接单式仿真情境情境难度与教学目标匹配
学习态度反馈识别情绪与参与度信号师生面对面的人文关怀与疏导
期末综合评定汇总过程数据、辅助赋分最终评价结论与争议裁决

表:生成式AI与教师在高职不同教学环节的分工参考(依据实际应用设想梳理)

结构梳理:它如何运转

flowchart TD A[生成式AI赋能形成性评价] --> B["价值层面 创新方式·提效·个性化"] B --> C["落地约束 以人为中心评价理念"] C --> D["人机协同边界 可接受/不可接受用途"] D --> E["多元反馈互证 教师反馈+同伴反馈+智能反馈"] E --> F["伦理保障 国家·院校·教师联动"] F --> G["高职落地 实训报告批改·情境任务·短板诊断"]

总结

生成式人工智能赋能形成性评价,本质上是一次"把反馈做到及时、做到个性化、做到有对话感"的能力越迁。 它把教师从机械批改的重复劳动里解脱出来,让评价的重心重新回到人的成长。但必须清醒地看到,技术的边界始终是由人来划定的——AI可以替教师"看作业",却无法替教师"看见人"。 只有当评价始终坚持"以人为中心",这一工具才能真正成为教育的助推器,而不是让学习陷入认知外包的陷阱。

 

电话咨询
189-1106-2816
工作日 9:00–18:00
微信咨询
微信咨询 微信咨询
扫码添加