Clasa logo
Retour au blog
#Correction automatique#Correction de copies IA#Recherche#Enseignants

Correction automatique des copies par l’IA : ce que disent les études

Par Momna Ikram
Correction automatique des copies par l’IA : ce que disent les études

La correction automatique des copies, c’est une IA qui lit un texte d’élève, le confronte à une grille d’évaluation et propose en quelques secondes une note accompagnée d’appréciations. Les études publiées en 2026 montrent que l’IA peut rejoindre l’avis de correcteurs humains sur certaines tâches, mais qu’elle ne pondère pas les critères de la même façon et qu’elle peine avec les copies très faibles et les très bonnes. Pour l’enseignant, elle fonctionne donc mieux comme pré-correction et aide à la réécriture que comme remplaçant de sa propre évaluation.

Chez Clasa, nous développons un correcteur IA de dissertations fondé sur des grilles d’évaluation. C’est précisément pour cela que nous suivons la recherche de près et que nous nous appuyons sur des études indépendantes plutôt que sur notre propre outil. Voici ce que disent réellement les travaux les plus récents sur la correction des copies par l’IA, et ce que cela implique en France, sur le plan pédagogique comme sur le plan juridique.

Qu’est-ce que la correction automatique des copies ?

La correction automatique (en anglais Automated Essay Scoring, ou AES) désigne les systèmes qui évaluent un écrit à l’aide de l’IA, de l’apprentissage automatique ou du traitement automatique des langues, à partir de critères définis ou d’une grille. Le système propose une note pour que l’enseignant n’ait pas à faire à la main toute la première lecture. Selon l’outil, il prend en compte l’orthographe et la grammaire, le vocabulaire, la structure, le contenu et le respect de la consigne.

L’idée n’est pas neuve. Le Project Essay Grade (PEG) analysait déjà des textes par ordinateur dans les années 1960, et le système e-rater d’ETS sert depuis des décennies à évaluer des rédactions en anglais. Les systèmes récents reposent sur des réseaux de neurones et de grands modèles de langage (LLM), ce qui leur permet de travailler sur le sens et sur des critères détaillés, et plus seulement sur des marqueurs de surface.

La correction par IA moderne ne se contente donc pas de compter les mots ou de souligner les fautes. Elle peut juger plusieurs aspects d’une copie à la fois, d’où l’intérêt de la distinguer des outils avec lesquels on la confond souvent :

OutilRôle principalCe qu’il fournitUtilisateurs habituels
Correcteur orthographique et grammaticalRepérer les fautes de langueSuggestions d’orthographe, de grammaire, de ponctuation et de formulationÉlèves et rédacteurs
Aide automatisée à l’écriture (AWE)Aider à améliorer un texteRemarques sur l’organisation, la langue et le développement des idéesÉlèves et enseignants
Correction automatique (AES)Noter selon une grilleUne note et, selon l’outil, une appréciation par critèreEnseignants et établissements

La différence tient à la finalité : le correcteur grammatical corrige la langue, l’aide à l’écriture aide à progresser, et la correction automatique évalue la copie au regard de critères définis pour lui attribuer une note.

Comment une IA corrige-t-elle une copie ?

Le fonctionnement varie selon les modèles, mais une IA de correction pèse en général un ensemble de critères : langue, structure, contenu et critères de la grille.

Langue et expression

L’IA repère de façon fiable les fautes d’orthographe, les erreurs de ponctuation et les maladresses lexicales, ce qui aide à estimer la maîtrise de la langue. Mais une grammaire irréprochable ne fait pas une bonne copie si les idées sont minces ou les arguments absents. Un outil utile doit regarder au-delà de la surface du texte.

Organisation et cohérence

L’IA peut aussi juger si le devoir est bien construit : si l’introduction pose le sujet, si les paragraphes s’enchaînent logiquement et si la conclusion revient à la thèse.

C’est un domaine où l’IA générative s’en sort plutôt bien. Dans une étude portant sur 1 768 rédactions d’élèves de 8 à 10 ans (l’équivalent du CE2 et du CM1), Huang, Palermo et Wilson (2026) ont montré que GPT-4o, guidé par des consignes (prompts) soigneusement rédigées, se rapprochait davantage des correcteurs humains sur l’organisation et le style. Un système plus ancien, fondé sur des indicateurs textuels, concordait en revanche mieux sur le développement des idées et sur les aspects de surface.

Contenu et argumentation

Évaluer le fond est plus difficile. Une opinion ne suffit pas : elle doit être développée et étayée. Un modèle de langage peut juger ces aspects avec une grille, mais son jugement peut différer de celui d’un lecteur humain.

Wang, Chen, Huang et Lai (2026) ont comparé Qwen, GPT et Gemini à des correcteurs humains sur des rédactions écrites en anglais par des non-natifs. Les modèles accordaient plus de poids à la correction grammaticale, au vocabulaire et à la complexité des phrases. Les humains accordaient plus de poids à l’exhaustivité du contenu, tenaient compte de la présentation et pardonnaient plus facilement les petites erreurs de langue. Leurs notes restaient aussi plus stables d’un niveau d’élève à l’autre.

Transposé à la classe, ce résultat compte. Une IA qui pèse davantage la langue que le fond déplace l’équilibre de la grille : elle peut sanctionner une copie bien argumentée pour ses fautes, notamment chez les élèves allophones, ou survaloriser une copie bien écrite qui traite mal le sujet.

Respect de la consigne et de la grille

Une correction par IA sérieuse vérifie aussi que l’élève a bien répondu à la question posée. Si la grille exige une thèse défendue par des arguments et des exemples, l’IA peut évaluer précisément cela.

La grille est décisive, car l’IA n’a aucune idée propre de ce qu’est une « bonne copie ». Elle ne connaît que les critères qu’on lui donne. C’est pourquoi la correction fondée sur une grille d’évaluation est devenue centrale dans l’évaluation par IA.

Par exemple, un enseignant peut fixer un critère « Appui sur des exemples ». L’IA vérifie alors si la thèse est étayée par des exemples ou des références pertinents. Si vous n’avez pas encore de grille, un créateur de grilles d’évaluation gratuit peut en générer une à partir de votre consigne, et notre guide explique comment faire une grille d’évaluation étape par étape.

Critère de la grilleCe que l’IA rechercheExemple d’appréciation
Appui sur des exemplesDes exemples pertinents qui étayent la thèse« Votre thèse est claire, mais le deuxième paragraphe a besoin d’un exemple plus solide pour la soutenir. »

L’IA ne décide donc pas si une copie « sonne bien ». Elle la confronte à des critères précis fixés par l’enseignant.

La correction automatique des copies est-elle fiable ?

La vraie question est de savoir si la note de l’IA est assez proche de celle de l’enseignant pour être utile. La recherche répond que oui, avec des réserves importantes : la précision dépend du modèle, des élèves, de la tâche et de la manière dont on la mesure.

Une précision d’abord : la recherche sur la correction par IA vient encore surtout du monde anglophone, et les études citées ici portent sur des textes en anglais. On dispose de beaucoup moins de travaux comparables sur des copies en français, et encore moins sur des exercices aussi codifiés que la dissertation ou le commentaire de texte. Ces résultats donnent donc une orientation, pas une garantie.

À l’école élémentaire, Huang, Palermo et Wilson (2026) ont comparé GPT-4o à un système classique fondé sur des indicateurs textuels, sur 1 768 rédactions. Avec des prompts soignés, GPT-4o s’approchait de la concordance entre humains et système classique, et une version de GPT-4o spécialement entraînée pour la tâche (fine-tuning) obtenait la meilleure précision. Aucun modèle n’était toutefois exempt d’écarts entre groupes d’élèves.

Zhou (2026) a analysé 1 726 rédactions notées par huit LLM à l’aide de la théorie de la détection du signal, qui mesure la capacité d’un correcteur à distinguer les copies faibles des copies solides. Les correcteurs humains y étaient environ deux fois meilleurs. Les modèles regroupaient leurs notes au milieu de l’échelle et n’attribuaient presque jamais le niveau le plus élevé de la grille.

Ces résultats ne se contredisent pas. La concordance mesure à quelle fréquence les notes de l’IA et des humains coïncident globalement. Comme la plupart des copies se situent au milieu de l’échelle, l’IA s’en sort correctement. La discrimination mesure si l’IA sait distinguer une copie faible d’une excellente, et c’est là qu’elle pèche.

Les correcteurs humains non plus ne sont pas d’accord

Aucune correction n’est parfaite, et la France le sait mieux que personne : c’est ici qu’est née la docimologie, la science des examens. Dès 1922 pour le certificat d’études, puis en 1932 pour le baccalauréat, les travaux d’Henri Laugier et d’Henri Piéron ont mis en évidence des écarts considérables entre correcteurs d’une même copie. En 1936, on avait même calculé qu’il faudrait 127 correcteurs pour stabiliser une note de philosophie.

C’est la raison d’être des barèmes communs et des réunions d’harmonisation. La bonne question n’est donc pas de savoir si l’IA « trouve la bonne note », mais si elle se trompe davantage, ou autrement, qu’un second correcteur humain. D’après les études ci-dessus, elle se trompe autrement : elle tasse les notes vers le milieu et pèse davantage la forme que le fond.

Ce que regardent les humains et l’IA

Ce qui est évaluéLes correcteurs humains ont tendance àL’IA a tendance àCe que cela signifie pour vousSource
Grammaire, vocabulaire et complexité des phrasesPardonner les petites erreurs de langueAccorder plus de poids à ces aspectsUne copie bien écrite mais creuse peut obtenir une meilleure note de l’IA que de vousWang et al. (2026)
Complétude du contenuY accorder beaucoup de poidsY accorder moins de poids qu’à la langueVérifiez que la copie traite réellement le sujetWang et al. (2026)
Copies très faibles et très bonnesUtiliser toute l’échelle de notesTasser les notes au milieu et attribuer rarement la note maximaleLisez vous-même les copies probablement les meilleures et les plus faiblesZhou (2026) ; Kay et al. (2026)
Organisation et styleServir de référenceAvec de bons prompts, GPT-4o s’est approché des humains chez les 8-10 ansUne pré-correction raisonnable pour les remarques sur la structureHuang et al. (2026)

Fiable ne veut pas dire juste

TermeSignification
FidélitéLa constance avec laquelle le système donne la même note à la même copie
JustesseLa proximité des notes avec une référence fiable, comme celle de correcteurs formés
ValiditéLe fait que la note mesure vraiment la compétence d’écriture visée par la grille
ÉquitéLe fait que le système évalue aussi bien les différents groupes d’élèves

On confond souvent ces termes, mais ils mesurent des choses différentes. Un système peut donner la même note à chaque passage et se tromper à chaque fois.

Debelak et Ziegler (2026) montrent pourquoi il faut vérifier les quatre. Dans un article méthodologique publié dans PLOS One, ils ont testé un modèle DistilBERT entraîné sur le jeu de données public Hewlett ASAP, composé de rédactions en anglais. Le modèle présentait une forte cohérence interne, avec des coefficients de Spearman-Brown compris entre 0,77 et 0,92, et des indices de validité, mais aussi des signes d’iniquité quand on comparait les notes humaines et celles de l’IA d’un sujet à l’autre. Leur conclusion : fidélité, validité et équité doivent être évaluées ensemble.

Ce qu’on observe dans les lycées français

La correction assistée par IA n’est plus seulement un sujet de recherche en France. Selon La Clé Publique, une expérimentation menée avant la rentrée 2026 dans 20 lycées d’Île-de-France a mobilisé 150 enseignants et 1 250 élèves, pour 400 évaluations et 7 600 copies en trois mois, d’abord en français et en mathématiques.

Le principe : l’enseignant fournit son sujet, son corrigé ou son barème, puis numérise les copies. L’outil propose une note, des annotations et des commentaires, et le professeur reprend et valide la proposition. La note produite reste une proposition jusqu’à cette validation.

Les limites relevées sont instructives : une reconnaissance encore imparfaite de l’écriture manuscrite, moins de finesse sur les copies atypiques et des difficultés avec certains formats comme la cartographie ou la géométrie. Autrement dit, exactement les cas où la recherche conseille de garder l’œil de l’enseignant.

L’IA change-t-elle la façon dont les élèves écrivent ?

L’IA transforme l’évaluation, et peut-être l’écriture elle-même. Le cycle classique consistait à écrire, rendre sa copie et attendre la correction. Avec un correcteur IA, le retour arrive immédiatement, ce qui crée une boucle rapide : écrire, recevoir un retour, réécrire, vérifier à nouveau.

Pour l’évaluation formative, c’est précieux. L’élève peut demander à l’IA de repérer un argument faible ou un paragraphe décousu et corriger son brouillon avant de le rendre. Les retours de l’IA sont donc les plus utiles pendant la réécriture, plutôt qu’une fois le devoir rendu.

Il y a toutefois un risque. Si les élèves comprennent que l’IA récompense certains mots ou certaines structures, ils risquent d’écrire pour la machine, avec des copies plus formatées et moins de pensée personnelle.

Concrètement, une phrase écrite pour la machine pourrait ressembler à ceci : « Les multiples ramifications de l’intégration technologique au sein des dispositifs pédagogiques nécessitent une évaluation exhaustive. » Une phrase écrite pour un lecteur : « Les établissements devraient tester les outils d’IA avant de s’en servir pour noter. » Comme les modèles de l’étude de Wang et al. (2026) accordaient plus de poids au vocabulaire et à la complexité des phrases que les correcteurs humains, la première phrase pourrait obtenir une meilleure note d’une IA. N’importe quel enseignant préférerait la seconde.

Les retours de l’IA doivent rendre l’écriture plus claire, pas plus ampoulée. Les élèves en tirent le meilleur parti lorsqu’ils appliquent les remarques sur l’argumentation, les exemples et la structure, et qu’ils voient une meilleure note obtenue grâce à des mots compliqués comme un signal d’alerte, pas comme un objectif.

Quels avantages pour les enseignants ?

Tout enseignant de lettres, de philosophie ou d’histoire-géographie connaît le paquet de copies du week-end. Les principaux avantages de la correction par IA sont le gain de temps, une pré-correction homogène et des retours plus rapides. L’IA peut passer en revue de gros lots de copies, faire ressortir les difficultés communes d’une classe et donner aux élèves des remarques exploitables pour réécrire.

Un système automatique corrige aussi la centième copie avec les mêmes critères que la première, ce qui limite la dérive qui s’installe quand on corrige un long paquet à la main. Mais homogène ne veut pas dire équitable : un système biaisé l’est de façon homogène.

Un retour immédiat aide l’élève au milieu de son travail. Pour l’établissement, l’IA permet de donner une première lecture à chaque copie sans affecter un correcteur humain à chacune. Pour un panorama plus large des outils et des pratiques en classe, consultez notre guide sur la notation par IA dans l’éducation.

Le meilleur usage de l’IA en classe consiste à épauler l’enseignant, pas à le remplacer. Laissez le système s’occuper de la pré-correction, des remarques pour la réécriture et de la vérification homogène de la grille, pendant que vous apportez l’accompagnement individuel dont chaque élève a besoin. L’enseignant relit les résultats et décide en dernier ressort.

Si vous voulez essayer la correction par IA fondée sur une grille, testez Clasa gratuitement. Importez une copie et votre grille pour obtenir une analyse critère par critère, puis relisez et modifiez les appréciations avant de les transmettre à vos élèves.

Les limites de la correction automatique

Malgré de vrais progrès, la correction automatique a encore des faiblesses nettes.

L’IA ne lit pas comme un enseignant

L’IA traite le langage à une échelle immense, mais elle ne lit pas une copie comme une personne. Un enseignant mobilise son expérience, sa connaissance du contexte et de sa classe, et perçoit des nuances de sens qui échappent souvent à l’IA. Comme le montrent les études ci-dessus, l’IA et les humains peuvent arriver à des notes proches pour des raisons différentes, en pondérant autrement la langue, le contenu et la présentation.

Biais et équité

Le biais est un deuxième problème. Dans la même étude portant sur 1 768 rédactions, Huang, Palermo et Wilson (2026) ont examiné l’équité entre groupes d’élèves : selon le sexe, chez les élèves apprenant l’anglais comme langue seconde et chez les élèves à besoins éducatifs particuliers. Le GPT-4o entraîné spécifiquement était globalement le plus équitable, mais aucun modèle n’était totalement exempt d’écarts entre groupes.

Cela ne veut pas dire que toutes les IA de correction sont aussi biaisées les unes que les autres. Cela veut dire que tout système doit être testé sur différents groupes d’élèves et différents types de tâches avant d’être utilisé pour des décisions qui comptent.

Des notes tassées vers le milieu

L’IA a aussi tendance à resserrer les notes. Un enseignant utilise sans hésiter toute l’échelle, de la copie très insuffisante à l’excellente, alors que beaucoup de LLM évitent les extrêmes. Dans l’étude de Zhou (2026) portant sur 1 726 rédactions, les modèles présentaient une forte tendance centrale et attribuaient rarement le niveau le plus élevé de la grille. Distinguer une copie exceptionnelle d’une simple bonne copie leur est difficile.

Sur une échelle de 0 à 20, cela signifie que c’est entre 15 et 20, là où se jouent une mention ou un dossier Parcoursup, que l’IA est la moins fiable.

On observe la même tendance dans l’enseignement supérieur. Kay et al. (2026), de l’université de Cardiff et de l’université de Melbourne, ont fait noter 50 dissertations de licence en biosciences par deux versions de ChatGPT. Les notes globales étaient souvent proches de celles des correcteurs, mais pas copie par copie : l’IA surnotait les travaux les plus faibles, sous-notait les meilleurs et s’accordait surtout au milieu de l’échelle. Les auteurs concluent que l’IA générative ne peut pas encore noter de façon fiable des travaux écrits longs.

Les élèves peuvent aussi tenter de tromper l’IA avec des copies inutilement longues, un vocabulaire compliqué ou des répétitions. Une bonne correction par IA doit s’en tenir à la grille et à la qualité de l’argumentation, pas aux effets de surface.

Des appréciations génériques

Une note peut être juste et l’appréciation inutile. L’IA produit parfois des remarques qui semblent pertinentes mais pourraient s’appliquer à n’importe quelle copie, comme « Développez davantage vos idées ». Des appréciations liées à des critères précis et à des passages précis, relues et ajustées par l’enseignant avant d’arriver à l’élève, sont bien plus utiles.

Des écarts entre modèles

Jiao, Song et Lee (2026) ont comparé dix modèles des familles GPT, Claude, Gemini et DeepSeek sur deux tâches d’écriture et ont constaté des différences sensibles de constance et de performance. L’échantillon étant réduit, les auteurs ont renoncé à établir un classement.

« Corrigé par IA » ne dit donc pas grand-chose à lui seul. Tout dépend du modèle utilisé, de sa configuration et de la manière dont il a été testé.

L’IA peut-elle attribuer la note ?

Au-delà de la pédagogie, il y a le droit, et en France la réponse est claire.

La CNIL. Dans ses recommandations aux enseignants publiées en juin 2025, la CNIL est explicite : l’enseignant ne doit pas déléguer son pouvoir d’évaluation et de décision à un outil d’IA, et ne peut pas fonder son évaluation uniquement sur ce que produit l’outil. Elle recommande aussi de ne transmettre aucune information susceptible de révéler des éléments de la vie privée des élèves.

Le ministère. Le cadre d’usage de l’IA en éducation, publié par le ministère de l’Éducation nationale en juin 2025, va dans le même sens : l’IA peut accompagner l’évaluation des élèves, mais sans se substituer à l’expertise de l’enseignant.

Le RGPD et le règlement européen sur l’IA. L’article 22 du RGPD protège contre les décisions fondées exclusivement sur un traitement automatisé qui produisent des effets juridiques ou affectent la personne de manière significative. Le règlement européen sur l’IA (AI Act) classe par ailleurs les systèmes destinés à évaluer les acquis d’apprentissage parmi les systèmes à haut risque. Après le report adopté en 2026, les obligations correspondantes s’appliquent à partir du 2 décembre 2027.

Avant d’utiliser un outil de correction par IA, l’établissement devrait vérifier :

  • Où les copies sont-elles stockées et traitées, et le traitement reste-t-il dans l’UE ?
  • Les copies servent-elles à entraîner des modèles d’IA ?
  • Combien de temps sont-elles conservées, et peut-on les supprimer complètement ?
  • Existe-t-il un contrat de sous-traitance conforme à l’article 28 du RGPD ?

Un réflexe simple au quotidien : retirez les noms et autres éléments d’identification avant d’importer les copies. En cas de doute, adressez-vous à votre chef d’établissement ou au délégué à la protection des données de votre académie. Cette section donne des repères généraux et ne remplace pas un conseil juridique.

L’IA peut-elle remplacer l’enseignant dans la correction ?

L’IA peut déjà prendre en charge une partie du travail de correction, surtout la pré-correction rapide, le repérage des difficultés fréquentes et la vérification des critères de la grille sur de gros paquets de copies.

Remplacer entièrement le jugement humain est une autre affaire, sur le plan pédagogique comme juridique. Les enseignants restent indispensables pour interpréter les nuances, apprécier une copie créative ou inattendue et remettre en cause une note de l’IA qui semble fausse. Pour les décisions importantes, c’est l’enseignant qui tranche.

Lues ensemble, les études plaident pour une collaboration plutôt que pour un choix entre l’IA et l’humain. La question pratique est de savoir qui fait le mieux quelle tâche :

  • Brouillons et réécriture : l’IA fait la pré-correction et suggère des remarques. L’enseignant contrôle par sondage.
  • Devoirs notés en classe : l’IA note selon la grille. L’enseignant relit les notes et retouche les appréciations avant de rendre les copies.
  • Devoirs surveillés, bacs blancs et examens : l’enseignant lit et décide. L’IA peut signaler des points d’attention, mais ne fixe pas la note.
  • Copies atypiques, créatives ou limites : l’enseignant les lit intégralement, en particulier les meilleures et les plus faibles probables.

Pour une comparaison détaillée des outils, consultez notre sélection des meilleurs correcteurs de dissertations IA pour enseignants.

L’avenir de la correction automatique

Les chercheurs testent de meilleures grilles, de meilleurs prompts et des copies de référence pour réduire l’écart entre la correction par IA et la correction humaine.

Choi, Tate et Warschauer (2026) ont montré dans la revue Assessing Writing qu’ajouter au prompt des copies d’ancrage, c’est-à-dire des exemples déjà notés, améliorait nettement la concordance entre le modèle et les correcteurs humains, jusqu’à s’approcher de celle observée entre deux correcteurs humains. Des copies couvrant toute l’échelle de notes donnaient de meilleurs résultats que des copies limitées à quelques niveaux. GPT-4o obtenait les meilleurs résultats, mais GPT-4o mini atteignait des performances comparables pour un coût bien moindre.

Pour les enseignants, c’est un résultat très concret, et familier. C’est le principe des copies de référence étudiées en réunion d’entente ou d’harmonisation. Fournir à l’IA quelques copies notées couvrant toute l’échelle, des plus faibles aux meilleures, est l’un des moyens les plus simples de rapprocher ses notes des vôtres.

Les chercheurs étudient aussi la manière dont l’IA arrive à ses notes : quels aspects du texte elle pondère, si cela varie selon le niveau de l’élève, et si les résultats sont équitables pour tous les groupes. Il manque encore des études sur des copies en français. Une note rapide ne suffit pas : pour être utile, une IA de correction doit servir les apprentissages et résister à des tests indépendants.

Questions fréquentes sur la correction automatique des copies

Qu’est-ce que la correction automatique des copies ?

C’est un logiciel qui lit une copie et la note selon des critères définis ou une grille d’évaluation. Les premiers systèmes comptaient des marqueurs linguistiques ; les systèmes actuels utilisent de grands modèles de langage capables de travailler directement à partir de la grille de l’enseignant. C’est un outil d’évaluation, pas un correcteur orthographique, même si beaucoup de produits proposent les deux.

Comment fonctionne la correction de copies par IA ?

Le système lit le texte, le confronte à chaque critère de la grille et propose une note, généralement accompagnée d’une appréciation par critère. Avec les grands modèles de langage, la grille et les exemples notés que vous fournissez déterminent largement le résultat. Une grille claire et précise produit des notes plus homogènes qu’une grille vague.

La correction automatique est-elle fiable ?

Cela dépend du modèle, de la grille et du type d’écrit. Sur 1 768 rédactions d’élèves de 8 à 10 ans, un GPT-4o entraîné spécifiquement était le plus proche de la note humaine (Huang, Palermo et Wilson, 2026). Sur 1 726 rédactions notées par huit LLM, les correcteurs humains distinguaient environ deux fois mieux les copies faibles des copies solides (Zhou, 2026). Considérez la note de l’IA comme une pré-correction et relisez-la.

L’IA peut-elle noter à la place de l’enseignant ?

Elle peut proposer une note, mais la décision revient à l’enseignant. La CNIL rappelle que l’enseignant ne doit pas déléguer son pouvoir d’évaluation à un outil d’IA, l’article 22 du RGPD protège contre les décisions entièrement automatisées et le règlement européen sur l’IA classe ces systèmes parmi les systèmes à haut risque.

Les élèves peuvent-ils tromper une IA de correction ?

Parfois. Des phrases longues et un vocabulaire recherché peuvent faire monter la note, car certains modèles accordent plus de poids à la sophistication de la langue que les correcteurs humains. Une grille qui valorise explicitement l’argumentation et les exemples laisse moins de place au remplissage, et l’enseignant devrait relire les copies mieux notées que prévu.

Peut-on confier les copies des élèves à une IA en respectant le RGPD ?

Cela dépend de l’outil et de l’usage. Vérifiez où les copies sont stockées, si elles servent à entraîner des modèles d’IA et combien de temps elles sont conservées. Demandez un contrat de sous-traitance et suivez les recommandations de la CNIL : retirez les noms et toute information permettant d’identifier l’élève avant l’envoi.

Quels sont les inconvénients de la correction automatique ?

La correction par IA peut présenter des écarts d’équité entre groupes d’élèves et noter certaines copies autrement que les enseignants. Elle peine avec les copies très faibles et très bonnes et tasse les notes vers le milieu. Elle produit aussi parfois des appréciations génériques qui semblent utiles, mais ne disent rien de la copie concernée.

La correction par IA aide-t-elle les élèves à mieux écrire ?

Elle peut aider, quand les élèves utilisent les retours pour réécrire. Le bénéfice vient de l’application des remarques sur l’argumentation, les exemples et l’organisation. L’objectif doit être des idées plus claires, pas un style conçu pour plaire à l’IA.

Conclusion

La correction automatique des copies peut faire gagner du temps aux enseignants et donner aux élèves des retours plus rapides, mais elle a encore des limites. L’IA peut s’accorder en moyenne avec les enseignants tout en manquant la différence entre copies faibles et excellentes, et elle peut noter différemment certains groupes d’élèves.

La meilleure approche consiste à utiliser l’IA pour la pré-correction et les retours de réécriture, et à laisser la note finale à l’enseignant, comme le recommande la CNIL. Si vous voulez voir à quoi ressemble une pré-correction critère par critère avec votre propre grille, testez Clasa gratuitement.