評分規準怎麼做?6 步驟設計評分規準(含範例)

評分規準怎麼做?先從作業與學習目標出發,選定評分規準的類型,挑出四到六個評量面向,訂定表現等級,替每個等級寫出具體的描述,再為各面向配置權重,最後用真實的學生作品試評,確認沒問題再正式使用。
評分規準(rubric,也稱評分量表、評量尺規),簡單說就是一份說明作業、報告或實作將如何被評量的評分指引。它會列出評量面向、各表現等級的描述,以及計分的方式。
對老師來說,好的評分規準讓評分有一套依循的準則;對學生來說,它在作品交出之前就把要求說清楚。除此之外,一份設計得宜的評分規準也提供了一致的評閱方式,讓學生看見什麼叫做達到標準。
不過有幾點要留意。Jonsson 與 Svingby(2007)回顧了 75 項研究,發現評分規準能提高評分的信度,尤其是分析式、針對特定主題設計,並搭配評分者訓練或範例作品時效果更明顯。但評分規準本身並不保證評量有效。一份設計不良的評分規準,可能給出前後一致的分數,卻評量了錯誤的東西。
評分規準怎麼做:6 個步驟
起點應該是作業本身,而不是一張空白的評分表。目標是讓評分規準反映這份作業真正想評量的能力。
1. 從作業本身開始
先把作業說明完整讀過,再決定評量面向。問問自己:怎樣的作品算成功?作品必須展現哪些能力?哪些部分是關鍵?什麼情況代表學習目標沒有達成?
以作文為例,你會期待看到論點、論據、對資料的分析,以及正確的引用。這樣做能避免評分規準淪為千篇一律的檢核表,這也與 Cornell 大學使用評分規準的建議一致。
2. 明確訂出學習目標
決定你要學生展現什麼。最好把籠統的目標改寫成看得見的表現。與其寫「了解論說文的寫法」,不如寫成「提出明確的主張,並以相關的證據支持」。
又例如,與其寫「了解如何進行實驗」,不如要求學生「正確記錄觀察結果,並說明證據與假設之間的關係」。這樣老師評分時就有具體的證據可以對照。這些學習目標,是後面所有步驟的基礎。
3. 選擇評分規準的類型
格式要配合所評量的作業。當學生需要針對多項能力得到細緻的回饋時,適合用分析式評分規準,因為每個評量面向都單獨計分。
整體式評分規準則對作品給一個整體判斷,當各個組成部分很難分開看待時比較合適。另外還有單點式評分規準:只寫出達標的標準,由老師在旁邊記錄作品低於或高於標準之處。伊利諾大學芝加哥分校的評分規準指南對這幾種格式的優點與適用時機有更多說明。
相較之下,檢核表只能告訴你某項要求「有」或「沒有」完成,適合簡單的事項;遇到需要判斷品質高低的複雜作業,就不夠用了。想進一步了解分析式與整體式評分規準的差別,可以參考 Yale 大學的評分規準指引。
不論選分析式、整體式或單點式,目標都一樣:做出一份既公平又能提供資訊的工具。先決定格式,再建立評分標準,後面的工作會順利許多。
4. 選定評量面向
把重心放在與學習目標相關的主要面向,不必把作品所有可能的特質都拿來評。以作文而言,可以分別列出論點、組織、分析與引用;以自然科的專題實作而言,則可以包含實驗步驟、資料蒐集及其他相關項目。
要確保各個面向之間區分得夠清楚,評分時才分得開。除非差異很明確,否則要避免「想法的品質」與「想法的強度」這類高度重疊的面向。
5. 訂定表現等級
你得決定這份作業需要幾個等級。評分規準通常使用三到五個等級,課堂上常見的是四個,因為偶數等級能避免評分者習慣性地選擇中間值。等級名稱可以這樣設定:
- 卓越
- 精熟
- 發展中
- 起步
或者:
- 超越期待
- 符合期待
- 接近期待
- 尚未達到期待
不用太執著於名稱本身,真正重要的是描述。學生必須看得出一個等級在哪裡結束、下一個等級從哪裡開始。至於那些沒有實質資訊的形容詞,就不要用了:
- 優:表現很好
- 甲:表現不錯
- 乙:表現普通
- 丙:表現不佳
這樣的描述,並不能為學生指出改進的方向。
6. 描述要具體
撰寫各等級的表現描述,可以說是整個過程中最重要的部分。「分析很優秀」是不夠好的寫法;比較好的寫法是:「說明相關證據如何支持中心論點,並把個別例子與更大的詮釋連結起來。」組織也一樣,「組織良好」太模糊了,應該寫成學生「依合乎邏輯的順序安排想法,並以適當的轉折銜接,支持整體論證」。Cornell 大學的評量指引也建議避免主觀的標準,改用明確的指標。
描述要讓老師知道該看什麼,也要讓學生知道成功的作品長什麼樣子。
評分規準範例:不必把它弄得太複雜
列越多列,不代表評量越好。實用的評分規準大約有四到六個主要評量面向,每個都直接連結作業的學習目標。描述要依作業量身調整,而不是套用通用的範本。以下是國中三年級(九年級)議論文(論說文)的範例,滿分 100 分:
| 評量面向(配分) | 卓越 | 精熟 | 發展中 | 起步 |
|---|---|---|---|---|
| 論點(20) | 提出具體、可辯論的主張,並切合題目要求 | 提出可辯論的主張,但範圍偏廣或措辭不夠精確 | 只陳述事實或主題,或僅部分回應題目 | 看不出明確的主張 |
| 論據(25) | 每個主要論點都有相關且引用正確的證據支持 | 多數證據相關且有出處,一兩項與論點的關聯較弱 | 證據不足或過於籠統,常與主張脫節 | 幾乎沒有相關證據 |
| 分析論證(25) | 說明每項證據如何支持主張,並回應一項反方意見 | 說明大部分證據;提到反方意見,但沒有回應 | 多半只是重述或摘要證據 | 只有摘要,沒有說明 |
| 結構組織(15) | 每段有一個明確重點,轉折清楚呈現想法之間的關係 | 想法依合理順序排列,部分轉折較弱 | 部分段落混雜多個想法,或順序顛倒 | 難以閱讀理解 |
| 語文表達(15) | 錯誤極少或沒有,且不影響文意 | 有一些錯誤,但不影響文意 | 常有錯誤,少數影響文意 | 錯誤多,常使文意不清 |
不論是什麼作業,重點都是讓每個評量面向,與它真正要評量的能力保持連結。
評分規準的配分與權重怎麼設定
你必須決定每個評量面向在總分中所占的比重。以上面的作文評分規準為例,論點占 20 分,論據與分析論證各占 25 分,結構組織與語文表達各占 15 分。
權重應該符合作業的目的,也向學生傳達什麼最重要。分析論證占 25 分,就代表它比版面格式之類的細節更值得花心思。不要只為了方便,就預設每一項的權重相同。
Jonsson 與 Svingby 的回顧指出,評分規準,尤其是針對特定主題的分析式評分規準,可以帶來更可靠的評分,特別是在有評分者訓練或範例作品的情況下。不過研究者也提醒,評分規準並不保證判斷有效。
因此,不只要看最後的分數,也要留意評分標準是否提供了關於學生表現的有用資訊。
國小評分規準怎麼做
語言和評量面向的數量都要簡單。年紀小的孩子看不懂冗長的學術用語。以國小三年級的作文為例,評量面向應該是他們看得懂的句子,像是「我的文章有開頭、中間和結尾」,或者「我用了完整的句子」。
表現等級可以這樣寫:
- 4:我每次都能自己做到。
- 3:我大部分時候能自己做到。
- 2:我需要一些協助才能做到。
- 1:我才剛開始學習這件事。
對低年級的孩子,可以搭配圖示,但圖示應該是輔助文字描述,而不是取代它。目標是把期待說清楚,不要讓事情變得不必要地複雜。
作文評分規準怎麼做
作文需要學生運用多種能力,因此它的評分規準值得多花一些心思。
最好的起點是這篇作文的目的。如果作業要求學生提出論點,並以文本證據支持,評分規準就應該把重點放在分析與證據的品質,而不是讓幾個文法上的小失誤決定最後的成績。上面的範例使用了這五個評量面向:
- 論點:中心主張是否可辯論、界定清楚?
- 論據:學生是否選出相關的證據,並正確引用?
- 分析論證:學生是否說明證據為什麼重要?
- 結構組織:想法是否依合乎邏輯的方式組織?
- 語文表達:文句是否清晰,文法與格式的錯誤是否很少?
還要注意,Rezaei 與 Lovorn 在 2010 年的一項研究中發現,即使手上有評分規準,評分者仍會受到文章書寫形式的影響;而且如果評分者沒有受過使用訓練,評分規準對提高信度的幫助可能很有限。這也是為什麼評量面向必須用心設計,並且謹慎地使用。
因此,作文評分規準應該聚焦於這份作業真正要評量的能力與學習成果。完成之後,你可以將它匯出,在 Clasa AI 中用自己的評分規準批改作文:它會依你的評量面向為每篇作文評分,並提供回饋,你可以先檢視和編輯,再交到學生手上。
讓另一位老師也能拿來就用
對剛開始學習設計評分規準的人來說,評分規準必須不言自明:另一位老師拿到後,不需要額外說明就能使用。每個評量面向都必須回答三件事:評量的是什麼、什麼算成功,以及好的作品與其他作品的差別在哪裡。
在全班使用之前,先拿幾份樣本作品試評。如果兩位老師對同一個評量面向有不同的解讀,可能就得重新修改文字。此外,最好一開始就把評分規準發給學生,讓他們寫作時就知道被期待什麼,而不是等到成績公布後才發現標準。
讓評分更一致
不要把評分規準當成客觀性的絕對保證。要讓評分更一致,可以採用看得見、定義明確的評量面向,避免類別之間重疊,並且把表現等級寫得具體。學生的範例作品在這方面很有幫助。如果某個分數看起來不對勁,就回頭檢視。
評分規準也可以用在同儕互評與自我評量上。正如 Cornell 大學的指南所說,它是讓學生提供回饋、評斷自己表現的工具。重點不在於每次都得出相同的數字,而是讓分數確實反映當下的學習成果。
用 AI 製作評分規準
AI 很適合用來起草,但檢視與判斷仍然要由老師來做。不論用哪一種工具,都不要只丟出籠統的要求,而是把作業本身放進去。在一章介紹如何用 ChatGPT 製作評分規準的內容中,德州大學阿靈頓分校的教學設計師 Jess Kahlow 建議貼上完整的作業說明,列出你想要的評量面向(她建議三到九個),並指明評分量尺。
Clasa AI 的評分規準製作工具就是為這樣的起草工作設計的。你可以用一段提示描述作業,或上傳現有的評分規準(PDF、Word、Excel、CSV 或圖片),加以擷取或改進。它會在可編輯的文件中產生分析式、整體式或單點式評分規準,你的說明和評分規準表格放在同一頁,之後可以匯出成 Word 或 PDF。這個工具可免費使用,每天有產生次數的限制。
提示是你設定細節的地方,所以請在其中寫明年級、科目、評分規準類型、等級數量和配分。
像下面這樣的提示效果不錯:
「請為〔科目〕〔年級〕的〔作業類型〕製作一份評分規準。作業說明如下:〔貼上說明〕。我想評量〔能力〕,並設一個關於〔引用格式等〕的評量面向。請使用四個等級(卓越到起步),總分 100 分,並把最高的權重給〔優先面向〕。」
即使是簡短的提示,也足以產生第一版草稿,例如:「為國中三年級議論文建立一份評分規準,設定四個表現等級,涵蓋論點、論據、組織與語文表達。」
請把 AI 產生的內容當成草稿。Kahlow 指出,ChatGPT 常會放進與課程綱要不符的配分,所以務必確認權重與描述是否正確,並且每個評量面向在作業中都有其位置。若想進一步了解 AI 在評量中的角色,可以參考我們的教育中的 AI 評分概覽。
正式評分前先試評
這是製作評分規準的最後一步。拿一份過去或現在學生的作品,用你的草稿評看看,檢查是否行得通。描述是不是任何人都看得懂?分數是否反映了能力的重要性?有時描述在理論上看起來沒問題,實際評分時卻很難操作。如果某個評量面向造成困惑,就修改它。
試評對新類型的作業特別有用,因為它能揭露初稿時不明顯的問題。
評分規準檢核表
正式使用之前,請逐項檢查:
- 是否與作業一致,並評量重要的能力?
- 評量面向是否看得見、可觀察?
- 各表現等級之間是否有清楚的區分?
- 計分方式是否簡單明瞭,權重是否符合優先順序?
- 是否用真實的作品試評過?
- 學生是否知道會被如何評量?
說到底,評分規準不只是一張打分數的表格,它連結了作品、學習目標與回饋。掌握訣竅之後,過程其實很簡單:釐清目的、訂定評量面向與權重、試評並修正。不需要寫得很長,只需要清楚而一致。如果你不想從空白的表格開始,也可以用免費的 AI 評分規準產生器先得到一份初稿,再慢慢修改。
常見問題
評分規準應該有幾個評量面向?
課堂作業通常四到六個評量面向就夠了,每一個都直接連結一項學習目標。Yale 大學 Poorvu 中心建議不要超過七個。列越多,不代表評量越好,反而讓評分規準更難一致地使用。
評分規準應該有幾個表現等級?
多數評分規準使用三到五個等級。課堂上常見的是四個,名稱可以是卓越、精熟、發展中與起步。名稱不如描述重要:每個等級都應該清楚說明,一種水準的作品在哪裡結束、下一種從哪裡開始。
分析式評分規準與整體式評分規準有什麼差別?
分析式評分規準會分別為每個評量面向計分,能讓學生得到針對各項能力的細緻回饋。整體式評分規準則對作品整體給一個分數,使用起來比較快,當各個組成部分很難分開時也更合適,但提供的回饋比較不具體。
AI 可以幫我製作評分規準嗎?
可以。只要提供作業說明、要評量的能力、等級數量與配分,AI 就能產生有用的初稿。像 Clasa AI 評分規準製作工具這樣的工具,能產生可編輯、可匯出成 Word 或 PDF 的評分規準。不過老師仍應檢視草稿、確認配分,並用真實的學生作品試評。
評分規準的分數要怎麼換算成成績?
在該面向的權重內,替每個等級設定一個分數區間。以 20 分的面向為例,卓越可以是 18 到 20 分,精熟則是 15 到 17 分。然後把所有面向的分數加總。避免直接把 4 分制的等級分數除以四,因為精熟的 3 分(滿分 4 分)會變成 75%,通常比預期的低。
資料來源
Jonsson & Svingby (2007) — The Use of Scoring Rubrics: Reliability, Validity and Educational Consequences, Educational Research Review(評分規準的使用:信度、效度與教育影響)
Rezaei & Lovorn (2010) — Reliability and Validity of Rubrics for Assessment Through Writing, Assessing Writing(以寫作進行評量之評分規準的信度與效度)
Cornell University — Using Rubrics(康乃爾大學:使用評分規準)
Yale Poorvu Center — Rubrics(耶魯大學 Poorvu 中心:評分規準)
University of Illinois Chicago — Rubrics(伊利諾大學芝加哥分校:評分規準)
Kahlow, University of Texas at Arlington — Using ChatGPT for Rubrics(德州大學阿靈頓分校:用 ChatGPT 製作評分規準)
University of South Carolina — Developing Rubrics(南卡羅來納大學:設計評分規準)
Stevens & Levi — Introduction to Rubrics (2nd ed.)(評分規準入門,第二版)
想省下從零開始的時間嗎?免費註冊 Clasa AI,用評分規準製作工具建立你的評分規準,再用自己的評分規準批改作文,每一份回饋都由你檢視與編修後再交給學生。