Clasa logo
블로그로 돌아가기
#AI 자동채점#서논술형 평가#연구#교사

AI 자동채점, 얼마나 정확할까? 최신 연구로 본 가능성과 한계

Momna Ikram에 의해
AI 자동채점, 얼마나 정확할까? 최신 연구로 본 가능성과 한계

AI 자동채점은 AI가 학생의 글을 읽고 루브릭(채점 기준표)과 비교해 몇 초 만에 점수와 피드백을 돌려주는 방식입니다. 2026년 연구에 따르면 AI는 일부 과제에서 사람 채점자와 꽤 비슷한 점수를 줄 수 있습니다. 하지만 AI는 사람과 다른 요소에 무게를 두고, 아주 약한 글과 아주 뛰어난 글을 구별하는 데 어려움을 겪습니다. 그래서 교사에게 AI 채점은 교사의 평가를 대신하는 도구가 아니라 1차 채점과 고쳐 쓰기를 돕는 도구로 쓸 때 가장 효과적입니다.

Clasa는 루브릭 기반의 AI 에세이 채점기를 만들고 있습니다. 그래서 우리 도구를 기준으로 삼기보다 독립적인 연구를 인용하며 이 분야의 연구를 꼼꼼히 살피고 있습니다. 이 글에서는 AI 채점에 대해 최신 연구가 실제로 무엇을 보여 주는지, 그리고 서·논술형 평가가 늘어나고 있는 한국 학교에 그것이 어떤 의미인지 정리합니다.

AI 자동채점(AES)이란?

AI 자동채점(영어로 Automated Essay Scoring, 줄여서 AES)은 AI, 머신러닝, 자연어 처리를 활용해 미리 정한 기준이나 루브릭에 따라 글을 평가하는 기술입니다. 시스템이 점수를 제안하기 때문에 교사가 모든 답안의 1차 채점을 직접 하지 않아도 됩니다. 도구에 따라 맞춤법과 문법, 어휘, 구성, 내용, 과제 요구에 맞게 답했는지 등을 살핍니다.

자동채점은 새로운 기술이 아닙니다. 1960년대에 이미 Project Essay Grade(PEG)가 컴퓨터로 글을 분석했고, 미국 ETS의 e-rater는 수십 년 동안 영어 글쓰기 평가에 쓰여 왔습니다. 최근 시스템은 신경망과 대규모 언어 모델(LLM)을 사용하기 때문에, 겉으로 드러나는 언어 특징뿐 아니라 글의 의미와 세부 채점 기준까지 다룰 수 있습니다.

즉, 오늘날의 AI 채점은 단어 수를 세거나 오류에 표시하는 데서 그치지 않습니다. 글의 여러 측면을 동시에 평가할 수 있기 때문에, 자주 혼동되는 도구와 구분해 두면 좋습니다.

도구주요 역할제공하는 것주 사용자
맞춤법·문법 검사기언어 오류 찾기맞춤법, 문법, 문장 부호, 표현 수정 제안학생과 글쓴이
자동 글쓰기 피드백(AWE)고쳐 쓰기 돕기구성, 표현, 내용 전개에 대한 피드백학생과 교사
AI 자동채점(AES)루브릭에 따라 채점하기점수와, 도구에 따라 평가 기준별 피드백교사와 학교

차이는 목적에 있습니다. 맞춤법 검사기는 언어 오류를 고치고, 자동 피드백은 고쳐 쓰기를 돕고, 자동채점은 정해진 기준으로 글을 평가해 점수를 매깁니다.

AI는 글을 어떻게 채점할까?

방식은 모델마다 다르지만, 일반적으로 AI 채점은 언어 사용, 구성, 내용, 루브릭의 평가 기준을 함께 따져 판단합니다.

맞춤법·문법과 어휘

AI는 맞춤법 오류, 문장 부호 오류, 어색한 단어 선택을 안정적으로 찾아내며, 이는 언어 능력을 가늠하는 데 도움이 됩니다. 하지만 문법이 완벽해도 생각이 얕거나 근거가 없으면 좋은 글이라고 할 수 없습니다. 쓸모 있는 도구라면 글의 겉모습 너머를 볼 수 있어야 합니다.

구성과 일관성

AI는 글의 짜임새도 평가할 수 있습니다. 서론이 주제를 제시하는지, 문단이 논리적인 순서로 이어지는지, 결론이 핵심 주장으로 돌아오는지 등입니다.

생성형 AI가 비교적 잘하는 영역입니다. Huang, Palermo, Wilson(2026)은 초등학교 3~4학년 학생의 글 1,768편을 분석해, 지시문(프롬프트)을 잘 설계한 GPT-4o가 구성과 문체 평가에서 사람 채점자에 더 가까웠다고 보고했습니다. 반면 기존의 특징 기반 채점 시스템은 내용 전개와 표면적 특징 평가에서 사람과 더 잘 일치했습니다.

내용과 논증

글의 내용을 평가하는 일은 더 어렵습니다. 의견을 밝히는 것만으로는 부족하고, 그 의견을 전개하고 근거로 뒷받침해야 합니다. LLM도 루브릭이 있으면 이런 부분을 평가할 수 있지만, 그 판단은 사람 독자와 다를 수 있습니다.

Wang, Chen, Huang, Lai(2026)는 영어가 모국어가 아닌 학생들이 쓴 영어 글을 대상으로 Qwen, GPT, Gemini를 사람 채점자와 비교했습니다. 모델은 문법의 정확성, 어휘, 문장의 복잡성에 더 큰 비중을 두었습니다. 사람은 내용이 빠짐없이 갖춰졌는지를 더 중시했고, 글의 보기 좋은 정도에도 주의를 기울였으며, 사소한 언어 오류에는 더 너그러웠습니다. 사람의 채점은 학생의 수준이 달라져도 더 안정적이었습니다.

과제와 루브릭에 맞는지

제대로 된 AI 채점은 학생이 실제로 문제에 답했는지도 확인합니다. 루브릭이 "근거를 들어 주장을 설명할 것"을 요구한다면, AI는 바로 그 부분을 채점할 수 있습니다.

루브릭이 중요한 이유는 AI가 '좋은 글'이 무엇인지 스스로 알지 못하기 때문입니다. AI는 주어진 평가 기준만 압니다. 그래서 루브릭 기반 채점이 현재 AI 평가의 중심이 되었습니다.

예를 들어 교사가 '근거 제시'라는 평가 기준을 정하면, AI는 핵심 주장이 적절한 사례나 자료로 뒷받침되는지 확인합니다. 아직 루브릭이 없다면 무료 AI 루브릭 제작 도구로 과제에 맞는 루브릭을 만들 수 있고, 루브릭 만드는 법에서 단계별 방법을 자세히 안내합니다.

루브릭 평가 기준AI가 확인하는 것피드백 예시
근거 제시핵심 주장을 뒷받침하는 적절한 사례나 자료"주장은 분명하지만, 두 번째 문단에는 이를 뒷받침할 더 설득력 있는 근거가 필요합니다."

즉, AI는 글이 '그럴듯하게 들리는지'를 판단하는 것이 아닙니다. 교사가 정한 구체적인 평가 기준에 비추어 확인하는 것입니다.

AI 자동채점은 얼마나 정확할까?

핵심 질문은 AI의 점수가 교사의 점수와 충분히 가까워서 실제로 쓸모가 있느냐입니다. 연구에 따르면 그럴 수 있습니다. 다만 정확도는 모델, 학생, 과제, 그리고 정확도를 측정하는 방법에 따라 달라진다는 중요한 전제가 붙습니다.

먼저 짚어 둘 점이 있습니다. AI 채점 연구는 대부분 영어권에서 이루어졌고, 여기서 소개하는 해외 연구도 영어 글을 다룹니다. 한국어 서·논술형 답안에서도 같은 결과가 나올지는 아직 충분히 검증되지 않았습니다. 결과는 참고 자료로 읽어 주세요.

Huang, Palermo, Wilson(2026)은 초등학교 3~4학년 학생의 글 1,768편으로 GPT-4o와 기존 특징 기반 채점 시스템을 비교했습니다. 프롬프트를 신중하게 설계한 GPT-4o는 사람과 기존 시스템 사이의 일치도에 가까워졌고, 과제에 맞춰 추가 학습(파인튜닝)한 GPT-4o가 가장 높은 정확도를 보였습니다. 그래도 학생 집단 간 차이가 완전히 사라진 모델은 없었습니다.

Zhou(2026)는 8개의 LLM이 채점한 글 1,726편을 신호 탐지 이론으로 분석했습니다. 이 방법은 채점자가 약한 글과 강한 글을 얼마나 잘 구별하는지를 측정합니다. 사람 채점자는 이 구별 능력이 AI의 약 2배였습니다. LLM은 점수를 척도의 중간에 몰아 주었고, 루브릭의 최고 등급은 거의 주지 않았습니다.

두 결과는 모순되지 않습니다. '일치도'는 AI와 사람의 점수가 전체적으로 얼마나 자주 맞아떨어지는지를 봅니다. 대부분의 글은 중간 점수대에 모이기 때문에 AI는 여기서 그럭저럭 잘합니다. 반면 '변별력'은 약한 글과 뛰어난 글을 구별할 수 있는지를 보며, AI가 약한 지점이 바로 여기입니다.

사람 채점자끼리도 점수가 다르다

채점이 완벽하지 않은 것은 사람도 마찬가지입니다. 서·논술형 평가에서 채점의 공정성과 신뢰성이 늘 쟁점이 되는 것도 그 때문입니다. 그래서 따져야 할 질문은 AI가 '정답 점수'를 내느냐가 아니라, 또 한 명의 사람 채점자와 비교해 더 많이 틀리는지, 혹은 다른 방식으로 틀리는지입니다. 위의 연구를 보면 AI는 다른 방식으로 틀립니다. 점수를 중간에 모으고, 내용보다 형식을 더 중시하는 경향이 있습니다.

사람과 AI가 중시하는 것

평가 대상사람 채점자의 경향AI의 경향선생님에게 주는 의미출처
문법, 어휘, 문장의 복잡성사소한 오류에 너그러움이런 특징에 더 큰 비중을 둠표현은 매끄럽지만 내용이 빈약한 글이 AI에게서 더 높은 점수를 받을 수 있음Wang et al. (2026)
내용이 빠짐없이 갖춰졌는지크게 중시함언어적 특징보다 가볍게 다룸글이 실제로 문제에 답했는지 확인하기Wang et al. (2026)
아주 약한 글과 뛰어난 글척도 전체를 사용함점수를 중간에 모으고 만점을 거의 주지 않음최상위·최하위가 될 만한 글은 직접 읽기Zhou (2026); Kay et al. (2026)
구성과 문체기준이 됨프롬프트를 잘 설계한 GPT-4o는 초등 3~4학년 글에서 사람에 가까웠음구성에 관한 피드백의 1차 초안으로는 무난함Huang et al. (2026)

'일관됨'과 '정확함'은 다르다

용어의미
신뢰도같은 글에 얼마나 일관되게 같은 점수를 주는지
정확도숙련된 채점자의 점수처럼 믿을 만한 기준에 얼마나 가까운지
타당도점수가 루브릭이 측정하려는 쓰기 능력을 실제로 측정하는지
공정성서로 다른 학생 집단을 똑같이 잘 평가하는지

이 용어들은 자주 같은 뜻으로 쓰이지만, 측정하는 것은 서로 다릅니다. 매번 같은 점수를 주는 시스템도 매번 똑같이 틀릴 수 있습니다.

Debelak, Ziegler(2026)는 네 가지를 모두 확인해야 하는 이유를 보여 줍니다. PLOS One에 실린 방법론 논문에서, 공개된 영어 글 데이터셋 'Hewlett ASAP'으로 학습한 DistilBERT 모델을 검증한 결과, Spearman-Brown 계수 0.77~0.92의 높은 내적 일관성과 타당도의 근거가 나타났습니다. 그러나 글의 주제별로 사람과 AI의 점수를 비교하자 공정성이 부족하다는 신호도 보였습니다. 결론은 신뢰도, 타당도, 공정성을 함께 평가해야 한다는 것입니다.

한국에서는 어디까지 왔을까?

한국에서도 AI 채점은 이미 연구를 넘어 정책 과제가 되었습니다. 한국교육과정평가원은 2024년부터 '서·논술형 평가 자동채점 AI 모델 적용 방안 연구'를 진행해 왔습니다. 2026년 9월 보도에 따르면 평가원은 국어, 수학, 사회, 과학 교과에서 학생 답안 2만 9,520건과 전문가 피드백 데이터 8,844건을 구축했습니다. 학생 답안뿐 아니라 전문가의 채점과 피드백을 함께 모았다는 점이 특징입니다.

김문희 평가원장은 2026년 인터뷰에서 올해 연구 결과를 종합해 단위 학교가 AI 채점을 도입·활용할 수 있는 실천적 로드맵과 가이드라인을 제안하겠다고 밝혔습니다. 동시에 "AI 기술의 활용이 확대되더라도 학생평가의 본질적 역할과 교사의 전문성은 여전히 중요"하다고 강조했습니다.

이 방향은 해외 연구와도 일치합니다. AI가 1차 채점과 피드백을 맡고, 최종 평가는 교사가 책임지는 구조입니다.

AI 채점은 학생의 글쓰기를 바꿀까?

AI는 평가 방식을 바꾸고 있으며, 어쩌면 글쓰기 자체도 바꾸고 있을지 모릅니다. 예전에는 '쓰고, 제출하고, 채점 결과를 기다리는' 흐름이었습니다. AI 채점 도구를 쓰면 피드백이 바로 돌아오기 때문에 '쓰고, 피드백을 받고, 고쳐 쓰고, 다시 확인하는' 빠른 순환이 생깁니다.

이는 과정 중심 평가에 큰 도움이 됩니다. 학생은 약한 주장이나 연결이 어색한 문단을 AI에게 짚어 달라고 한 뒤, 교사에게 제출하기 전에 초안을 고칠 수 있습니다. 그래서 AI 피드백은 제출한 뒤보다 고쳐 쓰는 단계에서 가장 큰 가치를 발휘합니다.

다만 위험도 있습니다. AI가 특정 어휘나 문장 구조를 높게 평가한다는 사실을 학생들이 알게 되면, 기계를 위해 글을 쓰기 시작할 수 있습니다. 그 결과 틀에 박히고 자기 생각이 적은 글이 늘어날 수 있습니다.

한국어로 예를 들면 이렇습니다. 기계를 위해 쓴 문장은 "교육적 맥락에서의 기술 통합이 내포하는 다층적 함의는 포괄적 평가의 필요성을 제기한다."와 같은 모습일 수 있습니다. 독자를 위해 쓴 문장은 "학교는 AI로 점수를 매기기 전에 먼저 AI 도구를 시험해 봐야 한다."입니다. Wang 등(2026)의 연구에서 모델은 사람 채점자보다 어휘와 문장의 복잡성에 더 큰 비중을 두었기 때문에, 첫 번째 문장이 AI에게서 더 높은 점수를 받을 수도 있습니다. 하지만 어느 선생님이든 두 번째 문장을 고를 것입니다.

AI 피드백은 글을 더 명료하게 만들어야지, 더 현학적으로 만들어서는 안 됩니다. 학생에게 가장 도움이 되는 것은 주장, 근거, 구성에 대한 피드백을 반영하는 일입니다. 어려운 단어 덕분에 점수가 올랐다면 그것은 목표가 아니라 경고 신호로 받아들여야 합니다.

교사에게 AI 자동채점은 어떤 도움이 될까?

서·논술형 평가를 한 번 치르고 나면 채점할 답안지가 산더미처럼 쌓인다는 것을 많은 선생님이 알고 있습니다. AI 채점의 주요 장점은 시간 절약, 흔들림이 적은 1차 채점, 그리고 빠른 피드백입니다. AI는 많은 양의 답안을 검토하고, 학급 전체에 공통된 문제를 찾아내며, 학생이 고쳐 쓰기에 활용할 수 있는 피드백을 줄 수 있습니다.

자동채점 시스템은 100번째 답안도 첫 번째 답안과 같은 기준으로 채점하기 때문에, 오랜 시간 채점하다 보면 기준이 조금씩 흔들리는 문제를 줄일 수 있습니다. 하지만 일관성은 공정성과 같지 않습니다. 편향된 시스템은 일관되게 편향된 점수를 줍니다.

즉각적인 피드백은 과제를 하는 도중의 학생에게 도움이 됩니다. 학교 입장에서는 모든 제출물에 사람 채점자를 배정하지 않고도 1차 검토를 할 수 있습니다. 도구와 수업 활용법을 더 폭넓게 알고 싶다면 교육에서의 AI 채점 가이드도 참고하세요.

AI를 가장 잘 쓰는 방법은 교사를 대신하는 것이 아니라 교사를 돕는 것입니다. 1차 채점, 고쳐 쓰기를 위한 피드백, 루브릭에 따른 일관된 점검은 AI에게 맡기고, 선생님은 학생 한 명 한 명에게 필요한 개별 지도에 시간을 쓰세요. 결과를 검토하고 최종 판단을 내리는 사람은 교사입니다.

루브릭 기반 AI 채점을 직접 써 보고 싶다면 Clasa를 무료로 사용해 보세요. 글과 루브릭을 올리면 평가 기준별 채점 결과를 받을 수 있고, 학생에게 돌려주기 전에 피드백을 검토하고 수정할 수 있습니다.

AI 자동채점의 한계

큰 발전이 있었지만, 자동채점에는 여전히 분명한 약점이 있습니다.

AI는 교사처럼 읽지 않는다

AI는 엄청난 양의 언어를 처리할 수 있지만, 사람처럼 글을 읽지는 않습니다. 교사는 경험과 맥락, 학급 학생들에 대한 이해를 바탕으로 AI가 놓치기 쉬운 미묘한 의미를 읽어 냅니다. 위의 연구가 보여 주듯, AI와 사람은 언어, 내용, 외형에 두는 비중이 달라서 비슷한 점수라도 그 이유가 다를 수 있습니다.

편향과 공정성

또 다른 문제는 편향입니다. Huang, Palermo, Wilson(2026)은 같은 1,768편의 글로 성별, 영어를 제2언어로 배우는 학생, 특수교육 대상 학생 등 집단 간 공정성을 살펴보았습니다. 추가 학습한 GPT-4o가 전반적으로 가장 공정했지만, 집단 간 차이가 완전히 사라진 모델은 없었습니다.

모든 AI 채점이 똑같이 편향되어 있다는 뜻은 아닙니다. 하지만 성적처럼 중요한 결정에 쓰기 전에, 여러 학생 집단과 과제로 검증해야 한다는 것은 분명합니다.

점수가 중간에 몰린다

AI는 점수를 중간으로 압축하는 경향도 있습니다. 교사는 '매우 미흡'부터 '매우 우수'까지 척도 전체를 자연스럽게 쓰지만, 많은 LLM은 양 끝을 피합니다. Zhou(2026)의 1,726편 연구에서 모델은 강한 중심화 경향을 보였고, 루브릭의 최고 등급은 거의 주지 않았습니다. 뛰어난 글과 그저 괜찮은 글을 구별하는 것이 이런 시스템에게는 어렵습니다.

성취평가제로 말하면, A를 줄지 B를 줄지 판단해야 하는 바로 그 지점에서 AI가 가장 믿기 어렵다는 뜻입니다.

같은 경향은 대학에서도 나타납니다. 카디프대학교와 멜버른대학교의 Kay 등(2026)은 두 가지 버전의 ChatGPT에게 생명과학 전공 학부생의 에세이 50편을 채점하게 했습니다. 전체 점수는 사람 채점자와 비슷한 경우가 많았지만, 개별 에세이에서는 차이가 났습니다. AI는 약한 에세이에 점수를 후하게, 뛰어난 에세이에는 박하게 주었고, 중간 점수대에서 가장 잘 일치했습니다. 연구진은 생성형 AI가 아직 긴 글을 믿을 만하게 채점할 수 없다고 결론지었습니다.

학생들이 불필요하게 긴 글, 어려운 어휘, 같은 내용의 반복으로 AI 채점을 '공략'하려 할 수도 있습니다. 좋은 AI 채점은 표면적 특징이 아니라 루브릭과 논증의 질을 기준으로 평가해야 합니다.

어느 글에나 들어맞는 피드백

점수는 맞아도 피드백이 쓸모없을 수 있습니다. AI는 "내용을 좀 더 구체적으로 써 보세요"처럼 도움이 되는 것 같지만 어느 글에나 해당하는 피드백을 쓰기도 합니다. 구체적인 평가 기준과 글의 구체적인 부분에 연결되고, 학생에게 돌려주기 전에 교사가 검토하고 다듬은 피드백이 훨씬 유용합니다.

모델마다 다른 결과

Jiao, Song, Lee(2026)는 GPT, Claude, Gemini, DeepSeek 계열의 모델 10개를 두 가지 쓰기 과제로 비교해, 채점의 일관성과 성능에 의미 있는 차이가 있음을 확인했습니다. 다만 표본이 작아 연구진은 모델 순위를 매기지 않았습니다.

결국 'AI로 채점했다'는 말만으로는 정보가 부족합니다. 어떤 모델을, 어떻게 설정하고, 어떻게 검증했는지가 중요합니다.

AI가 성적을 매겨도 될까?

교육적인 문제와 함께 법과 제도의 문제도 있습니다.

인공지능기본법. 2026년 1월 22일 시행된 인공지능기본법은 「교육기본법」에 따른 유아교육·초등교육 및 중등교육에서의 학생 평가를 '고영향 인공지능' 영역으로 규정합니다. 학생 평가에 쓰이는 AI는 사람의 기본권에 중대한 영향을 줄 수 있는 분야로 보고, 사업자에게 더 엄격한 안전성·신뢰성 확보 의무를 지우는 것입니다.

개인정보 보호법. 학생의 글에는 이름부터 가정사까지 개인정보가 담길 수 있습니다. 개인정보 보호법은 만 14세 미만 아동의 개인정보를 처리할 때 법정대리인의 동의를 받도록 하는 등 아동·청소년의 정보를 특히 엄격하게 보호합니다.

AI 채점 도구를 쓰기 전에 학교에서 다음을 확인하세요.

  • 학생의 글은 어디에 저장되고 어디에서 처리되는가?
  • 학생의 글이 AI 모델 학습에 사용되는가?
  • 얼마나 오래 보관되며, 완전히 삭제할 수 있는가?
  • 시·도교육청과 학교의 방침상 사용이 허용되는가?

일상에서 할 수 있는 간단한 방법은 업로드 전에 이름 등 학생을 알아볼 수 있는 정보를 지우는 것입니다. 판단이 어려울 때는 학교의 개인정보 보호 담당자나 관리자와 상의하세요. 이 내용은 일반적인 안내이며 법률 자문을 대신하지 않습니다.

AI가 채점하는 교사를 대신할 수 있을까?

AI는 이미 채점의 일부를 맡을 수 있습니다. 특히 빠른 1차 채점, 자주 나타나는 문제 표시, 많은 답안에 대한 루브릭 기준 점검이 그렇습니다.

하지만 사람의 판단을 완전히 대신하는 것은 다른 문제입니다. 미묘한 의미를 해석하고, 창의적이거나 틀을 벗어난 답안을 평가하고, 이상해 보이는 AI 점수에 의문을 제기하려면 교사가 꼭 필요합니다. 중요한 결정은 교사가 내려야 합니다.

연구를 함께 읽어 보면, AI와 사람 중 하나를 고르는 것이 아니라 둘이 협력하는 방향이 보입니다. 현실적인 질문은 어떤 일을 누가 더 잘하느냐입니다.

  • 초안과 고쳐 쓰기: AI가 1차 채점을 하고 피드백을 제안합니다. 교사는 표본을 골라 확인합니다.
  • 수업 중 과제: AI가 루브릭으로 채점합니다. 교사는 점수를 검토하고 피드백을 다듬은 뒤 돌려줍니다.
  • 지필평가 서·논술형 문항과 성적에 큰 영향을 주는 평가: 교사가 읽고 판단합니다. AI는 확인할 점을 알려 줄 수 있지만 점수를 정하지 않습니다.
  • 창의적이거나 틀을 벗어난 글, 경계선에 있는 글: 교사가 전부 읽습니다. 특히 최상위와 최하위가 될 만한 글이 그렇습니다.

구체적인 도구를 비교하고 싶다면 교사를 위한 최고의 AI 에세이 채점기 비교 글을 참고하세요.

AI 자동채점의 앞날

연구자들은 AI와 사람의 채점 차이를 줄이기 위해 더 나은 루브릭, 프롬프트, 기준 답안을 시험하고 있습니다.

Choi, Tate, Warschauer(2026)는 학술지 Assessing Writing에서, 이미 채점된 예시 글인 '기준 답안(앵커)'을 프롬프트에 넣으면 LLM과 사람의 채점 일치도가 크게 높아져 두 사람 채점자 사이의 일치도에 가까워진다는 것을 보여 주었습니다. 일부 등급만이 아니라 척도 전체를 아우르는 기준 답안이 더 효과적이었습니다. 가장 좋은 결과를 낸 것은 GPT-4o였지만, GPT-4o mini도 훨씬 적은 비용으로 비슷한 결과를 냈습니다.

선생님에게는 실용적이면서도 익숙한 발견입니다. 채점 전에 동료 교사들과 예시 답안을 함께 보며 채점 기준을 맞추는 협의회와 같은 원리이기 때문입니다. AI에게 낮은 등급부터 높은 등급까지 척도 전체의 채점된 예시를 몇 개 주는 것은 AI의 점수를 내 채점에 가깝게 만드는 가장 쉬운 방법 중 하나입니다.

연구자들은 AI가 어떻게 점수를 내는지도 살피고 있습니다. 어떤 글의 특징에 비중을 두는지, 학생의 수준에 따라 그것이 달라지는지, 모든 집단에 공정한 결과가 나오는지 등입니다. 한국어 서·논술형 답안을 대상으로 한 연구도 더 필요합니다. 점수가 빨리 나오는 것만으로는 충분하지 않습니다. AI 채점이 쓸모 있으려면 배움을 돕고 독립적인 검증을 견뎌야 합니다.

AI 자동채점에 대해 자주 묻는 질문

AI 자동채점이란 무엇인가요?

글을 읽고 정해진 기준이나 루브릭에 따라 점수를 매기는 소프트웨어입니다. 초기 시스템은 언어적 특징을 세는 방식이었지만, 지금은 교사의 루브릭을 직접 다룰 수 있는 대규모 언어 모델을 사용합니다. 맞춤법 검사기가 아니라 평가 도구이지만, 두 기능을 모두 갖춘 제품도 많습니다.

AI 채점은 어떻게 작동하나요?

시스템은 글을 읽고 루브릭의 평가 기준마다 비교해 점수를 제안하며, 보통 기준별 피드백도 함께 줍니다. 대규모 언어 모델에서는 루브릭과 선생님이 제공한 채점 예시가 결과를 크게 좌우합니다. 모호한 루브릭보다 명확하고 구체적인 루브릭이 더 일관된 점수를 만듭니다.

AI 자동채점은 얼마나 정확한가요?

모델, 루브릭, 글의 종류에 따라 다릅니다. 초등학교 3~4학년 학생의 글 1,768편에서는 추가 학습한 GPT-4o가 사람의 점수에 가장 가까웠습니다(Huang, Palermo, Wilson, 2026). 8개의 LLM이 채점한 1,726편에서는 약한 글과 강한 글을 구별하는 능력이 사람 쪽이 약 2배 높았습니다(Zhou, 2026). AI 점수는 1차 채점으로 보고 반드시 검토하세요.

AI가 서·논술형 문항을 채점해도 되나요?

1차 채점과 피드백에는 활용할 수 있지만, 최종 점수는 교사가 정해야 합니다. 한국교육과정평가원도 학교 현장의 AI 채점 가이드라인을 준비하면서 교사의 전문성이 여전히 중요하다고 강조했습니다. 인공지능기본법도 초·중등 학생 평가를 고영향 인공지능 영역으로 규정하고 있습니다.

학생이 AI 채점을 속일 수 있나요?

경우에 따라 가능합니다. 일부 모델은 사람 채점자보다 언어의 난이도에 더 큰 비중을 두기 때문에, 긴 문장과 어려운 어휘로 점수가 오를 수 있습니다. 근거와 논증을 분명히 평가하는 루브릭을 쓰면 분량 늘리기가 통할 여지가 줄어듭니다. 예상보다 점수가 높은 글은 교사가 표본으로 직접 읽어 보는 것이 좋습니다.

학생 글을 AI에 올려도 안전한가요?

도구에 따라 다릅니다. 글이 어디에 저장되는지, AI 모델 학습에 쓰이는지, 얼마나 오래 보관되는지 확인하세요. 개인정보 보호법과 교육청 방침을 따르고, 업로드하기 전에 이름 등 학생을 알아볼 수 있는 정보를 지우세요.

AI 자동채점의 단점은 무엇인가요?

학생 집단 사이에 공정성 차이가 나타나거나, 교사와 다르게 평가할 수 있습니다. 아주 약한 글과 뛰어난 글을 구별하기 어려워해 점수를 중간에 모으는 경향이 있습니다. 또 도움이 되는 것 같지만 정작 그 글에 대해서는 말하지 않는 일반적인 피드백을 내기도 합니다.

AI 채점으로 글쓰기 실력이 늘까요?

학생이 AI 피드백을 활용해 글을 고쳐 쓰면 늘 수 있습니다. 효과는 주장, 근거, 구성에 대한 피드백을 반영할 때 나타납니다. 목표는 AI의 마음에 드는 글이 아니라 더 명료한 생각이어야 합니다.

마치며

AI 자동채점은 교사의 시간을 아끼고 학생에게 더 빠른 피드백을 줄 수 있지만, 아직 한계가 있습니다. AI는 평균적으로는 교사와 비슷한 점수를 주면서도 약한 글과 뛰어난 글의 차이를 놓칠 수 있고, 학생 집단에 따라 다르게 평가할 수도 있습니다.

가장 좋은 방법은 1차 채점과 고쳐 쓰기 피드백에 AI를 쓰고, 최종 점수는 교사가 정하는 것입니다. 내 루브릭으로 평가 기준별 1차 채점이 어떻게 나오는지 보고 싶다면 Clasa를 무료로 사용해 보세요.