Casestudy

Het herwinnen van validiteit van de beoordeling in het tijdperk van online leren

Een casestudy over scoreverdelingen en remote surveillering

Door Trevor Basil, PhD, in samenwerking met Kevin Rockmael

Samenvatting

Begin 2026 merkte Dr. Trevor Basil iets ongewoons op in zijn online lessen aan twee universiteiten in Californië. Ongecontroleerde quizzen leverden bijna alleen maar bijna perfecte scores op. De resultaten waren dicht gegroepeerd bovenaan, een duidelijk plafondeffect, waardoor het moeilijk was te zeggen wie het materiaal echt begreep en wie niet.

Toen remote proctoring werd geïntroduceerd, veranderde dat patroon. De scores verspreidden zich over de beoordelingsschaal en begonnen meer te lijken op die van een typische, fysiek begeleide klaslokaal. De verandering zette zich voort in latere quizzen, en online begeleidde lessen kwamen nauw overeen met de resultaten op locatie.

De cijfers daalden niet plotseling. Sterke studenten presteerden nog steeds goed. Wat veranderde, was dat de examens opnieuw verschillende prestatieniveaus konden onderscheiden. De studie suggereert dat remote surveillering kan helpen het basisdoel van een assessment te herstellen: nauwkeurig meten wat studenten weten.

Illustratie van de samenvatting
Herstel van Normaliteit illustratie

Herstel van normaliteit: Een klaslokaalstudie over Remote Proctoring en scoreverdeling

Begin 2026 merkte Dr. Trevor Basil, een psychologieprofessor die lesgeeft aan twee instellingen in Californië, iets ongewoons op. De scores van studenten die zijn online quizzen maakten waren bijna perfect. De meeste leerlingen kregen cijfers op of dicht bij het maximaal. Er was heel weinig variatie.

Wanneer dat gebeurt, meet de beoordeling mogelijk geen verschillen meer in begrip. Het kan zijn dat er geen onderscheid is tussen voorbereiding en giswerk. Op dat moment stopt het met functioneren als betrouwbaar instrument.

In plaats van te speculeren, voerde hij een gestructureerde vergelijking uit.

De vraag was
eenvoudig

Wat gebeurt er met scoreverdelingen wanneer remote surrector wordt ingevoerd?

Studieontwerp

Dit zijn verschillende instellingen, verschillende studenten, verschillende vakken.

Alle andere variabelen bleven hetzelfde: docent, inhoud, beoordelingsnormen, opdrachten.

De studie vond plaats aan twee verschillende hogescholen:

DeAnza College

Onderzoeksmethoden

Cal State Fullerton

Onderzoeksmethoden

Drie quizzen werden achter elkaar afgenomen:

Quiz 1

Geen toezicht

Quiz 2

Proctoring introduceert

Quiz 3

Het toezicht ging door

Daarnaast werd één cursus in parallelle formaten gegeven:

Eén sectie in persoon

Fysiek gemonitord

Eén sectie online

Op afstand toezicht

Wat gebeurde zonder toezicht
Quiz 1: Geen Proctorio

Quiz 1 (grafiek 1 hieronder) leverde een gecomprimeerde distributie op. De scores bij beide instellingen waren dicht op het maximum gefocust. Dichtheidsplots toonden minimale spreiding. De meeste studenten behaalden bijna perfecte resultaten.

Dat patroon kwam bij beide instellingen voor. Wanneer een grote groep studenten allemaal bovenaan scoort, wordt het moeilijk om daadwerkelijke verschillen in beheersing te bepalen. De test verliest resolutie en validiteit. Het belangrijkste punt: de verdeling was niet normaal. Het toonde een sterk plafondeffect, waarbij de meeste leerlingen de maximale of bijna maximale score behaalden.

Wat is er veranderd aan het toezicht?
Quiz 2 • Proctorio toegevoegd

Toen proctoring met Proctorio werd geïntroduceerd in Quiz 2 (Grafiek 2), veranderde de verdeling direct. De scores verspreidden zich over de volledige beoordelingsschaal en de variantie keerde terug. De dichtheidscurve leek op een normale verdeling in plaats van op een piek op het maximum. Met andere woorden, het plafondeffect verdween.

Statistisch gezien toonden gekoppelde t-tests die Quiz 1 en Quiz 2 vergeleken p-waarden van minder dan 0,001 bij beide instellingen. Dat betekent dat de verandering zeer onwaarschijnlijk willekeurig was, en dat de twee scoreverdelingen significant verschilden van elkaar, waardoor het plafondeffect werd weggenomen. De cijfers zijn niet ingestort. Ze toonden normale en verwachte verdelingen.

Bleef het effect bestaan?
Quiz 3 • Proctorio Vervolg

Om te bepalen of dit tijdelijk was, werd Quiz 2 vergeleken met Quiz 3 (beide gesurcoteerd).

Zoals je hieronder kunt zien (grafiek 3), was er geen statistisch significant verschil. Een p-waarde groter dan 0,05 geeft aan dat er geen statistisch significant verschil is tussen de twee verdelingen. Met andere woorden, het eerder waargenomen plafondeffect werd succesvol verwijderd, wat resulteerde in normaal verdeelde scores waarbij de online asynchrone quiz vergelijkbaar presteerde als de fysiek, gecontroleerde quiz.

De grootste verandering vond plaats toen toezicht werd ingevoerd. Daarna bleven de prestatiepatronen consistent.

Dit patroon suggereert dat de verwachtingen snel veranderden. Toen monitoring werd ingevoerd, veranderde de beoordelingsomgeving. Studenten pasten zich aan. Het systeem werd opnieuw gekalibreerd.

Dr. Basil beschreef het duidelijk toen "het doel niet was om studenten te vangen. Het was om ervoor te zorgen dat cijfers daadwerkelijk werk weerspiegelen."

Proctoring dient in deze context als een manier om te leren in een online omgeving, niet als straf.

Online versus fysieke vergelijking
Examen • Proctorio toegevoegd aan online cursus

De belangrijkste vergelijking is misschien modaliteit.

Eén cursus werd zowel fysiek als online gegeven (Grafiek 4). Dezelfde instructeur. Zelfde materialen. Zelfde beoordelingsnormen.

Dit bevestigt dat proctoring-technologie effectief de integriteit van de beoordeling herstelt, omdat het de scoreverdeling van een fysiek begeleid klaslokaal nabootst en het kunstmatige plafondeffect dat wordt gezien in ongecontroleerde online omgevingen elimineert.

De Anza
0%
PERFECT GESCOORD
Fullerton
0%
PERFECT GESCOORD
Quiz 1 vs Quiz 2 (Online Cursussen)
Quiz 1
Quiz 2
Quiz 1 vs Quiz 2 vs Quiz 3 (Online Cursussen)
Quiz 1 (Geen toezicht)
Quiz 2 (Proctorio)
Quiz 3 (Proctorio)
Examen 1: DeAnza50 vs DeAnza02
DeAnza50 (Online)
DeAnza02 (Persoonlijk)

Wat dit suggereert

Dit toont geen grade suppression. Het toont distributiecorrectie.
Hoogpresterende studenten presteerden nog steeds goed. Het verschil is dat de differentiatie terugkeert.

Zonder toezicht werden scoreverdelingen gegroepeerd op het maximum, het plafondeffect.

Illustratie van het plafondeffect

Het introduceren van proctoring herstelde de normale variantie.

Normale variantieillustratie

Online proctored examens kwamen statistisch overeen met fysieke examens.

Uitlijningsillustratie

Waarom het nu belangrijk is

Online leren breidt zich uit. AI-tools zijn wijdverspreid. Instellingen moeten toegang en geloofwaardigheid in balans brengen.

Volledig terugkeren naar fysieke klaslokalen is niet schaalbaar. Het afschaffen van integriteitscontroles ondermijnt het vertrouwen.

Deze studie toont aan dat structurele beoordelingsontwerpen meetbare uitkomsten veranderen. Wanneer proctoring ontbrak, verdween differentiatie. Toen het werd geïntroduceerd, keerde het terug. Online levering en validiteit van beoordeling kunnen naast elkaar bestaan.

Beperkingen

Dit was een klassikale studie, geen gerandomiseerde gecontroleerde studie. De analyse was gebaseerd op gepaarde t-tests en distributiegrafieken. Toekomstig onderzoek kan grotere steekproeven, langetermijn-GPA-effecten, sociaaleconomische variabelen en voorbereidingsgedrag onderzoeken. Toch is de hier waargenomen verdelingsverschuiving duidelijk.

Afronden

Bevindingen

Over twee instellingen en verschillende quizzen heen was het patroon duidelijk. Ongecontroleerde online examens toonden een zware clustering aan de bovenkant, het plafondeffect, met een ongewoon hoog aantal perfecte of bijna-perfecte scores.

Afronding van illustratie 1

Toen toezicht werd toegevoegd, keerde de scorespreiding terug naar een meer gebruikelijk bereik. Deze verandering gold voor meerdere toetsen, niet slechts één test. De resultaten van online geproctoreerde examens kwamen ook sterk overeen met die van fysieke examens.

Afronding van illustratie 2
Afronding van illustratie 3

Als een test sterkere prestaties niet kan onderscheiden van zwakkere prestaties, stoppen de cijfers met veel betekenis. Wanneer de scoreverdeling er weer normaal uitziet, doet het examen zijn werk. De gegevens suggereren dat remote surveillering helpt die basisfunctie te herstellen: het meten van wat studenten daadwerkelijk weten op een consistente en betrouwbare manier.

Onderzoeker, spreker en docent psychologie

Trevor Basil, PhD

Trevor Basil, PhD, is onderzoeker, spreker en docent psychologie wiens werk de kruising van menselijk gedrag en opkomende technologieën zoals AI onderzoekt. Hij doceert psychologie aan Cal State Fullerton, het College of San Mateo en De Anza College, en zijn onderzoek bestrijkt zowel community colleges als universiteiten.

Voor meer informatie over de gegevens kunt u contact opnemen met Dr. Trevor Basil

Contact Trevor Basil