Étude de cas

Retrouver la validité de l’évaluation à l’ère de l’apprentissage en ligne

Une étude de cas sur la distribution des scores et la surveillance à distance

Par Trevor Basil, PhD, en collaboration avec Kevin Rockmael

Résumé exécutif

Début 2026, le Dr Trevor Basil a remarqué quelque chose d’inhabituel dans ses cours en ligne dans deux universités californiennes. Les quiz non surveillés produisaient presque tous des scores quasi parfaits. Les résultats étaient serrés en haut, un effet de plafond clair, rendant difficile de distinguer qui comprenait vraiment le contenu et qui ne comprenait pas.

Lorsque la surveillance à distance a été introduite, ce schéma a changé. Les notes se sont réparties sur toute l’échelle de notation et ont commencé à ressembler davantage à celles d’une classe supervisée en présentiel. Le changement s’est poursuivi dans les quiz ultérieurs, et les cours surveillés en ligne correspondaient étroitement aux résultats en présentiel.

Les notes n’ont pas chuté soudainement. Les élèves forts ont tout de même bien réussi. Ce qui a changé, c’est que les examens pouvaient à nouveau distinguer différents niveaux de performance. L’étude suggère que la surveillance à distance peut aider à restaurer l’objectif fondamental d’une évaluation : mesurer avec précision ce que les élèves savent.

Illustration du résumé exécutif
Illustration de restauration de la normalité

Rétablir la normalité : Une étude en classe sur la surveillance à distance et la répartition des scores

Début 2026, le Dr Trevor Basil, professeur de psychologie enseignant dans deux établissements californiens, a remarqué quelque chose d’inhabituel. Les résultats des élèves passant ses quiz en ligne étaient presque parfaits. La plupart des élèves obtenaient des notes au maximum ou proches. Il y avait très peu de variation.

Lorsque cela se produit, l’évaluation peut ne plus mesurer les différences de compréhension. Cela peut ne pas distinguer la préparation de la supposition. À ce moment-là, il cesse de fonctionner comme un instrument fiable.

Plutôt que de sculoter, il a mené une comparaison structurée.

La question était
simple

Que se passe-t-il avec les distributions des scores lorsque la surveillance à distance est introduite ?

Conception de l’étude

Ce sont des institutions différentes, des étudiants différents, des cursus différents.

Toutes les autres variables sont restées les mêmes : enseignant, contenu, normes de notation, devoirs.

L’étude s’est déroulée dans deux collèges différents :

Collège DeAnza

Méthodes de recherche

Cal State Fullerton

Méthodes de recherche

Trois quiz ont été réalisés dans l’ordre :

Quiz 1

Pas de surveillance

Quiz 2

Introduction de la surveillance

Quiz 3

La surveillance continue

De plus, un cours était dispensé en formats parallèles :

Une section en personne

Surveillance physique

Une section en ligne

Surveillé à distance

Ce qui s’est passé sans surveillance
Quiz 1 : Pas de Proctorio

Le Quiz 1 (Graphique 1 ci-dessous) a produit une distribution compressée. Les scores dans les deux établissements étaient regroupés de manière serrée à la valeur maximale. Les graphiques de densité ont montré une dispersion minimale. La plupart des élèves obtenaient des résultats quasi parfaits.

Ce schéma s’est manifesté dans les deux institutions. Quand un grand groupe d’élèves obtient tous les meilleurs résultats, il devient difficile de déterminer les différences réelles de maîtrise. Le test perd en résolution et en validité. Le point clé : la répartition n’était pas normale. Elle a montré un fort effet plafond, la plupart des élèves obtenant le score maximum ou proche du maximum.

Qu’est-ce qui a changé avec la surveillance ?
Quiz 2 • Proctorio ajouté

Lorsque la surveillance a été introduite en utilisant Proctorio dans le Quiz 2 (Graphique 2), la répartition a changé immédiatement. Les scores s’étalaient sur toute l’échelle de notation, et la variance était revenue. La courbe de densité ressemblait à une distribution normale plutôt qu’à un pic au maximum. En d’autres termes, l’effet plafond a disparu.

Statistiquement, les tests t par paires comparant le Quiz 1 et le Quiz 2 ont montré des valeurs p inférieures à 0,001 dans les deux établissements. Cela signifie que le changement était très peu susceptible d’être aléatoire, et que les deux distributions de scores étaient significativement différentes, supprimant l’effet plafond. Les notes ne se sont pas effondrées. Ils ont montré des distributions normales et attendues.

L’effet a-t-il persisté ?
Quiz 3 • Proctorio Suite

Pour déterminer si cela était temporaire, le Quiz 2 a été comparé au Quiz 3 (tous deux surveillés).

Comme vous pouvez le voir ci-dessous (Graphique 3), il n’y avait pas de différence statistiquement significative. Une valeur p supérieure à 0,05 indique qu’il n’y a pas de différence statistiquement significative entre les deux distributions. En d’autres termes, l’effet plafond observé précédemment a été supprimé avec succès, ce qui a donné des scores normalement distribués où le quiz asynchrone en ligne a performé de manière similaire à celui surveillé en présentiel.

Le plus grand changement a eu lieu lors de l’introduction de la surveillance. Après cela, les schémas de performance sont restés constants.

Ce schéma suggère que les attentes ont rapidement changé. Lorsque la surveillance a été introduite, l’environnement d’évaluation a évolué. Les étudiants se sont adaptés. Le système a été recalibré.

Le Dr Basil l’a décrit clairement lorsque « l’objectif n’était pas d’attraper les étudiants. C’était pour s’assurer que les notes reflètent le travail réel. »

La surveillance, dans ce contexte, sert à apprendre en ligne, pas à punir.

Comparaison en ligne vs en présentiel
Examen • Proctorio ajouté au cours en ligne

La comparaison la plus importante pourrait être la modalité.

Un cours était dispensé en présentiel et en ligne en même temps (Graphique 4). Même instructeur. Mêmes matériaux. Mêmes critères de notation.

Cela confirme que la technologie de surveillance restaure efficacement l’intégrité de l’évaluation, car elle reproduit la répartition des scores d’une classe sous supervision physique et élimine l’effet de plafond artificiel observé dans les environnements en ligne non surveillés.

De Anza
0%
SCORE PARFAIT
Fullerton
0%
SCORE PARFAIT
Quiz 1 vs Quiz 2 (Cours en ligne)
Quiz 1
Quiz 2
Quiz 1 vs Quiz 2 vs Quiz 3 (Cours en ligne)
Quiz 1 (Pas de surveillance)
Quiz 2 (Proctorio)
Quiz 3 (Proctorio)
Examen 1 : DeAnza50 vs DeAnza02
DeAnza50 (en ligne)
DeAnza02 (en présentiel)

Ce que cela suggère

Cela ne montre pas la suppression de grade. Il montre une correction de distribution.
Les élèves performants ont tout de même bien réussi. La différence, c’est que la différenciation est revenue.

Sans surveillance, les distributions de scores étaient regroupées au maximum, l’effet plafond.

Illustration de l’effet de plafond

L’introduction de la surveillance a rétabli la variance normale.

Illustration de la variance normale

Les examens surveillés en ligne correspondaient statistiquement aux examens en présentiel.

Illustration de l’alignement

Pourquoi cela compte maintenant

L’apprentissage en ligne se développe. Les outils d’IA sont répandus. Les institutions doivent équilibrer accès et crédibilité.

Revenir entièrement aux salles de classe physiques n’est pas évolutif. Éliminer les contrôles d’intégrité sape la confiance.

Cette étude montre que la conception de l’évaluation structurelle modifie des résultats mesurables. Quand la surveillance était absente, la différenciation disparaissait. Lorsqu’elle a été introduite, elle est revenue. La diffusion en ligne et la validité de l’évaluation peuvent coexister.

Limitations

Il s’agissait d’une étude en classe, pas d’un essai contrôlé randomisé. L’analyse s’est appuyée sur des tests t par paires et des graphiques de distribution. De futures recherches pourraient examiner des échantillons plus vastes, les effets à long terme de la moyenne générale, les variables socio-économiques et les comportements de préparation. Néanmoins, le changement de distribution observé ici est clair.

Conclure

Conclusions

À travers deux établissements et plusieurs quiz, le schéma était clair. Les examens en ligne non surveillés montraient un fort regroupement en haut, l’effet plafond, avec un nombre inhabituellement élevé de notes parfaites ou presque parfaites.

Illustration de conclusion 1

Lorsque la surveillance a été ajoutée, l’écart de score est revenu à une plage plus typique. Ce changement s’est vérifié sur plusieurs évaluations, pas seulement sur un seul test. Les résultats des examens surveillés en ligne correspondaient également étroitement à ceux des examens en présentiel.

Illustration de clôture 2
Illustration de conclusion 3

Si un test ne peut pas distinguer une performance plus forte d’une performance plus faible, les notes perdent vraiment de sens. Quand la répartition des scores redevient normale, l’examen fait son travail. Les données suggèrent que la surveillance à distance aide à restaurer cette fonction fondamentale : mesurer ce que les élèves savent réellement de manière cohérente et fiable.

Chercheur, conférencier et chargé de cours en psychologie

Trevor Basil, PhD

Trevor Basil, PhD, est chercheur, conférencier et chargé de cours en psychologie dont les travaux explorent l’intersection du comportement humain et des technologies émergentes comme l’IA. Il enseigne la psychologie à Cal State Fullerton, au College of San Mateo et au De Anza College, et ses recherches couvre à la fois les collèges communautaires et les universités.

Pour plus d’informations sur ces données, veuillez contacter le Dr Trevor Basil

Contactez Trevor Basil