Clasa logo
返回博客
#评分标准#评分量规#评价#教师

如何制作评分标准(评分量规):分步指南

通过Momna Ikram
如何制作评分标准(评分量规):分步指南

制作评分标准(也称评分量规、评价量规)的方法是:先从作业和学习目标出发,选定评分标准的类型,挑出四到六个评价维度,设定表现水平,为每个水平写出具体的描述,给各维度分配权重,最后在评分之前用真实的学生作业试用一遍。

简单来说,评分标准是一份说明项目、展示或作业将如何被评判的评价与打分指南。它列出被评价的维度、各个表现水平及其描述,以及计分的方法。

对教师而言,一份好的评分标准能让批改更有章法;对学生而言,它在作业交上来之前就把要求讲清楚了。不仅如此,它还提供了一种前后一致的评价方式,让学生看到什么样的成果才算达标。

不过有几点需要注意。Jonsson 和 Svingby(2007)对 75 项研究做了综述,发现评分标准能够提高评分的信度,尤其是分析型、针对具体主题的评分标准,再配合评分员培训或范例,效果更明显。但评分标准本身并不能保证评价有效。一份设计欠佳的评分标准,可能每次给出的分数都很一致,评的却是不该评的东西。

评分标准怎么做:分步指南

起点应该是作业本身,而不是一张空白的打分表。目的是让评分标准反映这份作业真正要考查的内容。

1. 从作业出发

先把作业要求从头到尾读一遍,再确定评价维度。问问自己:怎样的作业才算成功?它必须体现哪些能力?哪些部分不可或缺?哪些迹象说明学习目标没有达成?

以议论文为例,通常应当看到论点、论据、论证分析和规范的引用。这样做可以避免评分标准沦为千篇一律的检查清单,这与康奈尔大学关于使用评分标准的指南(Cornell University, Using Rubrics)是一致的。

2. 明确学习目标

先想清楚你希望学生展示什么。最好把笼统的目标写成可观察的表现。与其写“理解议论文写作”,不如写“提出明确的中心论点,并用相关论据加以支撑”。

再比如,与其写“懂得如何做实验”,不如要求“准确记录观察结果,并说明证据与假设之间的关系”。这样,教师批改时就有了具体的依据,知道要找什么。这些学习目标是后面一切工作的基础。

3. 选择评分标准的类型

格式要适合被评价的作业。学生需要就多项能力获得详细反馈时,适合用分析型评分标准,因为每个维度单独打分。

整体型评分标准对作业给出一个总体判断,当各组成部分很难拆开时更合适。还有单点式评分标准:只描述“达标”的标准,教师再记录作业在哪些地方低于或高于这个标准。伊利诺伊大学芝加哥分校的评分标准指南(University of Illinois Chicago)详细介绍了这几种格式的优点和适用情形。

相比之下,检查清单只能告诉你某项要求是否完成,简单的事项用它没问题;但要对复杂的质量做出判断,它就不够用了。想进一步了解分析型和整体型评分标准的区别,可以参考耶鲁大学的评分标准指南(Yale Poorvu Center)。

归根结底,无论选择分析型、整体型还是单点式,目标都一样:做出一份既公平又能提供有用信息的工具。先确定格式,再设计评分维度,后面的工作会容易得多。

4. 选定评价维度

抓住与学习目标相关的主要方面,不必把作业的每个特点都拿来评分。议论文可以分别设置论点、结构、论证分析和引用几项;科学探究项目则可以包括实验步骤、数据收集等相关内容。

各个维度要有明显区别,评分时才能分得清。要避免出现重叠,比如“想法的质量”和“想法的说服力”,除非二者的区别很明确。

5. 设定表现水平

要决定这份作业需要几个水平。评分标准通常设三到五个水平,课堂上常用四个,因为偶数能避免评分者习惯性地打中间档。水平名称可以这样起:

  • 卓越
  • 良好
  • 发展中
  • 起步

也可以这样:

  • 超出预期
  • 达到预期
  • 接近预期
  • 未达预期

不必过分纠结名称,关键是描述。学生要能清楚地看出一个水平在哪里结束、下一个水平从哪里开始。下面这类形容词没有提供任何有意义的信息,用了也是白用:

  • 优秀:作业很好
  • 良好:作业还不错
  • 一般:作业一般
  • 较差:作业较差

这样的描述对改进没有任何指导作用。

6. 描述要具体

写各水平的描述,可以说是整个过程中最重要的一环。“分析很出色”是一条很弱的描述;更好的写法是:“说明相关论据如何支撑中心论点,并把单个例子与更大的解读联系起来。”结构也是如此。“结构合理”太笼统;应当写成学生“按合乎逻辑的顺序展开观点,并用恰当的过渡衔接来支撑论证”。康奈尔大学的评价指南主张用清晰的指标取代主观的标准。

描述应当告诉教师要看什么,也告诉学生成功的作业是什么样子。

评分标准不必复杂:如何做到简洁实用

行数多不一定意味着评价更好。实用的评分标准通常有四到六个主要维度,每个都直接对应作业的学习目标。要结合作业调整描述,而不是套用通用模板。下面是一份初三(九年级)议论文评分标准的示例,满分 100 分:

评价维度(分值)卓越良好发展中起步
论点(20)提出具体、可辩论的观点,紧扣题意提出可辩论的观点,但较宽泛或表述不够严谨只陈述事实或话题,或只部分回应题意没有可辨认的观点
论据(25)相关且引用准确的论据支撑每个主要观点大部分论据相关且有出处,一两处联系较松散论据单薄或笼统,常与观点脱节几乎没有相关论据
论证分析(25)说明每条论据如何支撑观点,并回应一个反面观点说明了大部分论据;提到反面观点但没有回应多为复述或概括论据只有概括,没有解释
结构(15)每段只有一个清晰的中心,过渡显示出思路的衔接思路顺序合理,个别过渡较弱部分段落观点混杂或顺序不当难以读懂
语言规范(15)几乎没有错误,且不影响理解有一些错误,但不影响理解错误较多,少数影响理解错误常使文意不清

无论是什么作业,要点都是让每个维度与它真正要考查的内容保持一致。

评分标准的权重怎么设置

你需要决定每个维度在总分中的权重。以上面的议论文评分标准为例,论点占 20 分,论据和论证分析各占 25 分,结构和语言规范各占 15 分。

权重要与作业的目的相符,也要向学生传达什么最重要。占 25 分的论证分析,理应比一个格式细节更受重视。不要图省事就默认平均分配。

Jonsson 和 Svingby 的综述表明,评分标准,尤其是针对具体主题的分析型评分标准,能让评分更可靠,在有评分员培训或范例时更是如此。不过作者也提醒,评分标准并不能保证判断有效。

因此,不仅要关注最后的分数,还要留意评分标准是否真正提供了关于学生表现的有用信息。

小学生评分标准怎么做

语言和维度数量都要简单。低年级孩子对冗长的书面语没有多大收获。以三年级的习作为例,评价维度应当用他们看得懂的句子来写:“我的习作有开头、中间和结尾”,或者“我用了完整的句子”。

表现水平可以这样写:

  • 4——我每次都能自己做到。
  • 3——我大多数时候能自己做到。
  • 2——我需要一点帮助才能做到。
  • 1——我刚刚开始学。

对低年级学生,可以配图辅助,前提是图起辅助作用,而不是取代文字描述。目标是把要求讲清楚,又不要弄得过于复杂。

作文评分标准怎么做

作文要求学生综合运用多种能力,所以它的评分标准值得多花些心思。

最好从作文的目的入手。如果作业要求学生提出论点,并用文本证据加以支撑,评分标准就应当把重点放在分析和论据的质量上,而不是让几处语病决定最终的成绩。上面的示例用了这五个维度:

  • 论点:中心论点是否可辩论、是否明确?
  • 论据:学生是否选用了相关的材料,并且引用准确?
  • 论证分析:学生是否说明了论据为什么重要?
  • 结构:观点的组织是否合乎逻辑?
  • 语言规范:行文是否清楚,语法和标点等方面错误是否很少?

需要注意,Rezaei 和 Lovorn 2010 年的一项研究发现,即使手里有评分标准,评分员仍会受到文字表面规范的左右;如果评分员没有接受过使用评分标准的培训,评分标准对提高信度的作用可能很有限。所以,评价维度要精心设计,使用时也要认真。

因此,作文评分标准应当聚焦于作业真正要评价的能力和目标。评分标准做好之后,你可以将其导出,在 Clasa AI 中用你自己的评分标准批改作文:它会按你设定的评价维度给每篇作文打分并给出反馈,这些反馈由你审阅和修改后,才会交到学生手中。

写成别的老师也能直接使用的样子

对刚开始学着做评分标准的老师来说,评分标准应当不言自明:另一位老师拿起来,不需要额外说明就能使用。每个维度都要回答三个问题:评什么、怎样才算成功、更好的作业好在哪里。

在推广到全班之前,先用几份样本作业试一试。如果发现两位老师对同一个维度的理解不同,就说明措辞可能需要重写。最好一开始就把评分标准发给学生,让他们写作时就知道对自己的要求,而不是等分数出来以后才发现标准。

如何让评分更一致

不要把评分标准看成客观性的绝对保障。要想更一致,就使用可观察、定义明确的维度,避免类别之间重叠,并把各表现水平写具体。学生作业范例在这里很有帮助。如果某个分数看起来不对,就重新复核。

评分标准也适用于同伴互评和自评。正如康奈尔大学的指南所说,它是学生提供反馈、评价自己表现的一种工具。目的并不是每次都得出同样的数字,而是让分数真正反映当前的学习目标。

用 AI 制作评分标准

AI 适合用来起草,但审阅仍然要由教师来做。无论用哪种工具,都不要提笼统的要求,而要把作业本身放进去。在一章关于用 ChatGPT 制作评分标准的内容中,德克萨斯大学阿灵顿分校的教学设计师 Jess Kahlow 建议:粘贴完整的作业要求,说明你想要的评价维度(她推荐三到九个),并指定评分等级。

Clasa AI 评分标准制作工具就是为这类起草工作设计的。你可以用一句提示描述作业,也可以上传现有的评分标准(PDF、Word、Excel、CSV 或图片)来提取或改进。它会生成分析型、整体型或单点式评分标准,放在一份可编辑的文档中,作业说明和评分标准表格在同一页,之后可以导出为 Word 或 PDF。它免费使用,每天的生成次数有限制。

提示语是设定细节的地方,所以请把年级、学科、评分标准类型、水平数量和分值范围写进去。

下面这样的提示语效果不错:

“请为[学科]的[作业类型]制作一份适用于[年级]的评分标准。作业要求如下:[粘贴作业要求]。我想评价[能力],并设一个针对[引用规范等]的维度。设置四个水平(从卓越到起步),总分 100 分,其中[重点维度]占最大权重。”

第一稿用简短的提示也可以,例如:“为九年级议论文创建一份评分标准,设置四个表现水平,涵盖论点、论据、结构和语言规范。”

把 AI 的输出当作草稿。Kahlow 指出,ChatGPT 往往会插入与课程大纲不符的分值,所以要核实权重和描述是否准确,以及每个维度在作业中是否有对应的位置。如果想更全面地了解 AI 在评价中的位置,请参阅我们的概述文章:教育中的 AI 评分。

评分前先试用

这是制作评分标准的最后一步。拿一份以前或现在的学生作业,用你的草稿评一评,看它是否行得通。描述是否人人都能看懂?分值是否反映了能力的重要程度?有时一条描述在理论上看起来没问题,真到批改作业时却很难用。如果某个维度让人困惑,就改。

对于新类型的作业,试用尤其有用,因为它能暴露出最初起草时并不明显的问题。

评分标准检查清单

投入使用前,对照检查一遍:

  • 是否与作业一致,考查的是否是重要的内容?
  • 各维度是否可观察?
  • 各表现水平之间是否有清晰的区分?
  • 计分方式是否简明,权重是否符合重点?
  • 是否用真实的作业试用过?
  • 学生是否知道会被如何评价?

说到底,评分标准不只是一张打分表,而是作业、目标和反馈之间的纽带。一旦掌握了窍门,过程其实很简单:明确目的,设定维度和权重,试用并修改。不需要写得长,只需要清楚、一致。如果你不想从空白表格开始,可以用免费的 AI 评分标准生成器先生成一份初稿,再在此基础上修改。

常见问题

评分标准应该有几个评价维度?

对课堂作业来说,四到六个维度通常就够了,每个都直接对应一个学习目标。耶鲁大学 Poorvu 中心建议不要超过七个。行数多不一定意味着评价更好,还会让评分标准更难保持一致地使用。

评分标准应该设几个表现水平?

大多数评分标准设三到五个水平。课堂上常用四个,名称如卓越、良好、发展中和起步。名称不如描述重要:每个水平都应清楚说明,一档作业的标准到哪里为止,下一档从哪里开始。

分析型和整体型评分标准有什么区别?

分析型评分标准对每个维度分别打分,能让学生获得关于各项能力的详细反馈。整体型评分标准则对作业整体给出一个总分,用起来更快,在各组成部分难以拆分时更合适,但反馈没那么具体。

AI 能帮我制作评分标准吗?

可以。只要你提供作业要求、要评价的能力、水平数量和分值范围,AI 就能生成一份有用的初稿。像 Clasa AI 评分标准制作工具这样的工具,会生成可编辑的评分标准,并支持导出为 Word 或 PDF。教师仍应审阅草稿、核对分值,并用真实的学生作业试用。

怎样把评分标准的得分换算成成绩?

在每个维度的权重范围内,为每个水平设定一个分数区间。例如,对一个 20 分的维度,卓越可得 18 到 20 分,良好可得 15 到 17 分。然后把所有维度的得分相加。避免简单地用 4 分制的水平分除以 4:良好的 3 分(满分 4 分)会变成 75%,这通常比预期低。

参考资料

以下为英文原始文献,标题保留原文,括号内为中文说明。

Jonsson & Svingby (2007) — The Use of Scoring Rubrics: Reliability, Validity and Educational Consequences, Educational Research Review(评分量规的使用:信度、效度与教育影响)

Rezaei & Lovorn (2010) — Reliability and Validity of Rubrics for Assessment Through Writing, Assessing Writing(通过写作进行评价的评分量规的信度与效度)

Cornell University — Using Rubrics(康奈尔大学:使用评分量规)

Yale Poorvu Center — Rubrics(耶鲁大学 Poorvu 中心:评分量规)

University of Illinois Chicago — Rubrics(伊利诺伊大学芝加哥分校:评分量规)

Kahlow, University of Texas at Arlington — Using ChatGPT for Rubrics(德克萨斯大学阿灵顿分校:用 ChatGPT 制作评分量规)

University of South Carolina — Developing Rubrics(南卡罗来纳大学:设计评分量规)

Stevens & Levi — Introduction to Rubrics (2nd ed.)(评分量规导论,第 2 版)

想把评分标准真正用起来?免费注册 Clasa AI,上传学生作文和你的评分标准,按你设定的评价维度获得反馈,再由你审阅和修改。