Estudio de caso

Recuperando la validez de la evaluación en la era del aprendizaje en línea

Un estudio de caso sobre distribuciones de puntuaciones y supervisión remota

Por Trevor Basil, PhD, en colaboración con Kevin Rockmael

Resumen ejecutivo

A principios de 2026, el Dr. Trevor Basil notó algo inusual en sus clases online en dos universidades de California. Los cuestionarios sin supervisión producían casi todos puntuaciones casi perfectas. Los resultados estaban muy agrupados en la parte superior, un efecto de techo claro, lo que dificultaba distinguir quién entendía realmente el material y quién no.

Cuando se introdujo la supervisión remota, ese patrón cambió. Las puntuaciones se distribuyeron a lo largo de la escala de calificaciones y empezaron a parecerse más a las de un aula presencial y supervisada. El cambio continuó en los cuestionarios posteriores, y las clases supervisadas online coincidían mucho con los resultados presenciales.

Las notas no bajaron de repente. Los estudiantes fuertes seguían teniendo buenos resultados. Lo que cambió fue que los exámenes pudieron distinguir de nuevo diferentes niveles de rendimiento. El estudio sugiere que la supervisión remota puede ayudar a restaurar el propósito básico de una evaluación: medir con precisión lo que saben los estudiantes.

Ilustración del resumen ejecutivo
Ilustración de Restauración de la Normalidad

Restaurar la normalidad: Un estudio en el aula sobre supervisión remota y distribución de puntuaciones

A principios de 2026, el Dr. Trevor Basil, profesor de psicología que imparte clases en dos instituciones de California, notó algo inusual. Las notas de los estudiantes que hacían sus cuestionarios online eran casi perfectas. La mayoría de los estudiantes recibían calificaciones al máximo o cerca de esa puntuación. Había muy poca variación.

Cuando eso ocurre, la evaluación puede dejar de medir diferencias en la comprensión. Puede no distinguir la preparación de las conjeturas. En ese momento, deja de funcionar como un instrumento fiable.

En lugar de especular, realizó una comparación estructurada.

La pregunta era
sencilla

¿Qué ocurre con las distribuciones de puntuaciones cuando se introduce la supervisión remota?

Diseño del estudio

Son instituciones diferentes, estudiantes diferentes, cursos diferentes.

Todas las demás variables permanecían iguales: profesor, contenido, estándares de calificación, tareas.

El estudio se llevó a cabo en dos universidades diferentes:

Colegio DeAnza

Métodos de investigación

Cal State Fullerton

Métodos de investigación

Se realizaron tres cuestionarios en secuencia:

Quiz 1

Sin supervisión

Quiz 2

Introducción de la supervisión

Quiz 3

La supervisión continuó

Además, se impartía un curso en formatos paralelos:

Una sección en persona

Vigilado físicamente

Una sección online

Supervisado remotamente

Lo que pasó sin supervisión
Cuestionario 1: Sin Proctorio

El Quiz 1 (Gráfico 1 a continuación) produjo una distribución comprimida. Las puntuaciones en ambas instituciones se agrupaban muy estrechamente en el valor máximo. Los gráficos de densidad mostraron una dispersión mínima. La mayoría de los estudiantes obtenían resultados casi perfectos.

Ese patrón apareció en ambas instituciones. Cuando un gran grupo de estudiantes obtiene todas las mejores calificaciones, se vuelve difícil determinar diferencias reales en el dominio. La prueba pierde resolución y validez. El punto clave: la distribución no era normal. Mostró un fuerte efecto techo, con la mayoría de los estudiantes alcanzando la puntuación máxima o cercana a la máxima.

¿Qué cambió con la supervisión?
Quiz 2 • Proctorio añadido

Cuando se introdujo la supervisión usando Proctorio en el Quiz 2 (Gráfico 2), la distribución cambió inmediatamente. Las puntuaciones se distribuyeron a lo largo de toda la escala de calificación y se devolvió la varianza. La curva de densidad se asemejaba a una distribución normal más que a un pico en el máximo. En otras palabras, el efecto de techo desapareció.

Estadísticamente, las pruebas t emparejadas que comparan el Quiz 1 y el Quiz 2 mostraron valores p inferiores a 0,001 en ambas instituciones. Eso significa que el cambio era muy poco probable que fuera aleatorio, y que las dos distribuciones de puntuación eran significativamente diferentes entre sí, eliminando el efecto techo. Las notas no se desplomaron. Mostraron distribuciones normales y esperadas.

¿Persistió el efecto?
Quiz 3 • Proctorio Continuado

Para determinar si esto era temporal, se comparó el Quiz 2 con el Quiz 3 (ambos supervisados).

Como puedes ver a continuación (Gráfico 3), no hubo ninguna diferencia estadísticamente significativa. Un valor p mayor que 0,05 indica que no hay diferencia estadísticamente significativa entre ambas distribuciones. En otras palabras, el efecto techo observado anteriormente fue eliminado con éxito, resultando en puntuaciones normalmente distribuidas donde el cuestionario asíncrono en línea tuvo un rendimiento similar al cuestionario presencial supervisado.

El mayor cambio ocurrió cuando se introdujo la supervisión. Después de eso, los patrones de rendimiento se mantuvieron constantes.

Este patrón sugiere que las expectativas cambiaron rápidamente. Cuando se introdujo la monitorización, el entorno de evaluación cambió. Los estudiantes se adaptaron. El sistema se recalibró.

El Dr. Basil lo describió claramente cuando "el objetivo no era atrapar a los estudiantes. Era para asegurar que las notas reflejaran el trabajo real."

La vigilancia, en este contexto, sirve como medio de aprendizaje en un entorno online, no como castigo.

Comparación online vs. presencial
Examen • Proctorio añadido al curso online

La comparación más importante puede ser la modalidad.

Un curso se impartió presencialmente y online al mismo tiempo (Cuadro 4). El mismo instructor. Mismos materiales. Mismos estándares de calificación.

Esto confirma que la tecnología de supervisión restaura eficazmente la integridad de la evaluación, ya que replica la distribución de puntuaciones de un aula supervisada físicamente y elimina el efecto de techo artificial que se observa en entornos online no supervisados.

De Anza
0%
PUNTUACIÓN PERFECTA
Fullerton
0%
PUNTUACIÓN PERFECTA
Quiz 1 vs Quiz 2 (Cursos online)
Quiz 1
Quiz 2
Quiz 1 vs Quiz 2 vs Quiz 3 (Cursos online)
Quiz 1 (Sin supervisión)
Quiz 2 (Proctorio)
Quiz 3 (Proctorio)
Examen 1: DeAnza50 vs DeAnza02
DeAnza50 (Online)
DeAnza02 (Presencial)

Lo que esto sugiere

Esto no indica supresión de grado. Muestra corrección de distribución.
Los estudiantes de alto rendimiento seguían teniendo buenos resultados. La diferencia es que la diferenciación volvió.

Sin supervisión, las distribuciones de puntuaciones se agrupaban en el máximo, el efecto techo.

Ilustración del efecto del techo

Introducir la supervisión restauró la varianza normal.

Ilustración de varianza normal

Los exámenes supervisados online se alineaban estadísticamente con los exámenes presenciales.

Ilustración de alineación

Por qué importa ahora

El aprendizaje online está en expansión. Las herramientas de IA están muy extendidas. Las instituciones deben equilibrar el acceso con la credibilidad.

Volver completamente a las aulas físicas no es escalable. Eliminar los controles de integridad socava la confianza.

Este estudio muestra que el diseño de la evaluación estructural cambia resultados medibles. Cuando no había supervisión, la diferenciación desaparecía. Cuando se introdujo, volvió. La validez de la entrega y la evaluación online pueden coexistir.

Limitaciones

Este fue un estudio realizado en el aula, no un ensayo controlado aleatorizado. El análisis se basó en pruebas t emparejadas y gráficos de distribución. Investigaciones futuras podrían examinar muestras más amplias, efectos a largo plazo del GPA, variables socioeconómicas y comportamientos de preparación. Aun así, el cambio de distribución observado aquí es claro.

Concluyendo

Hallazgos

En dos instituciones y varios cuestionarios, el patrón era claro. Los exámenes online sin supervisión mostraron un fuerte agrupamiento en la parte superior, el efecto techo, con un número inusualmente alto de puntuaciones perfectas o casi perfectas.

Ilustración de cierre 1

Cuando se añadió la supervisión, la distribución de puntuaciones volvió a un rango más típico. Este cambio se mantuvo en varias evaluaciones, no solo en una prueba. Los resultados de los exámenes supervisados online también coincidían estrechamente con los de los exámenes presenciales.

Ilustración de cierre 2
Ilustración de cierre 3

Si una prueba no puede separar un rendimiento más fuerte del más débil, las calificaciones dejan de significar mucho. Cuando la distribución de la puntuación vuelve a ser normal, el examen está cumpliendo su función. Los datos sugieren que la supervisión remota ayuda a restaurar esa función básica: medir lo que los estudiantes realmente saben de forma coherente y fiable.

Investigador, conferenciante y profesor de psicología

Trevor Basil, PhD

Trevor Basil, PhD, es investigador, conferenciante y profesor de psicología cuyo trabajo explora la intersección entre el comportamiento humano y tecnologías emergentes como la IA. Enseña psicología en Cal State Fullerton, el College of San Mateo y De Anza College, y su investigación abarca tanto entornos de colegios comunitarios como universitarios.

Para más información sobre los datos, por favor contacte con el Dr. Trevor Basil

Contacta con Trevor Basil