«Cada reactivo representa una pequeña hipótesis sobre el comportamiento humano; su análisis permite determinar si la evidencia respalda esa hipótesis».
— Gerardo Valderrama
El análisis de reactivos constituye una etapa posterior a su construcción y aplicación piloto. Por ello, se parte del supuesto de que los reactivos fueron elaborados conforme a la definición del constructo, la tabla de especificaciones y las reglas técnicas de redacción. Examina el funcionamiento de cada ítem y su contribución a la puntuación de una prueba. Su propósito no consiste en aplicar límites numéricos de manera automática, sino en reunir evidencia para decidir si un reactivo debe conservarse, revisarse o eliminarse. La interpretación siempre depende del constructo, la población, el propósito de la prueba y la composición del instrumento.
Formas de respuesta
En términos generales, pueden distinguirse los reactivos con calificación dicotómica y los reactivos con respuestas graduadas. Esta distinción afecta los estadísticos empleados, pero no establece dos clases rígidas de comportamiento humano.
Fig. 1
Formato | Puntuación habitual | Aplicaciones frecuentes | Análisis básico |
Dicotómico | 0 y 1 | Conocimientos, aptitudes y ejecución máxima | Dificultad, discriminación, punto biserial y distractores |
Graduado | Tres o más categorías ordenadas | Actitudes, rasgos, opiniones y ejecución típica | Distribución de respuestas, correlación ítem total corregida y estructura interna |
En los reactivos dicotómicos, el valor 1 suele indicar una respuesta correcta o clave y el 0 una respuesta incorrecta. Un reactivo de selección múltiple también puede calificarse dicotómicamente cuando una alternativa es la clave. En los reactivos graduados no existe necesariamente una respuesta correcta: las categorías expresan posiciones ordenadas respecto del contenido del enunciado.
Una respuesta tipo Likert es ordinal por construcción. La suma de varios ítems puede tratarse, bajo determinadas condiciones, como una aproximación cuantitativa, pero esa decisión requiere justificación. No debe afirmarse que cada ítem aislado constituye automáticamente una escala de intervalo ni que el atributo observado sea continuo por el solo hecho de asignar números a sus categorías.
La matriz de puntuaciones
El análisis comienza con una matriz en la cual las filas representan a las personas y las columnas a los reactivos. Cada celda contiene la respuesta o la puntuación de una persona en un ítem. La última columna puede registrar la puntuación total, calculada según la clave y las reglas definidas para la prueba.
Fig.2
Persona | Ítem 1 | Ítem 2 | Ítem 3 | Ítem 4 | Total |
P1 | 1 | 1 | 1 | 0 | 3 |
P2 | 1 | 1 | 0 | 1 | 3 |
P3 | 1 | 0 | 1 | 0 | 2 |
P4 | 0 | 1 | 0 | 0 | 1 |
P5 | 1 | 1 | 1 | 1 | 4 |
Antes de calcular los indicadores deben revisarse la codificación, los valores perdidos, la inversión de reactivos redactados en dirección contraria y la clave de respuestas. Un error de codificación puede producir discriminaciones negativas o correlaciones ítem-total engañosas.
Análisis de reactivos dicotómicos
Índice de dificultad
En la Teoría Clásica de los Tests, el índice p es la proporción de personas que responde correctamente un reactivo:
p = número de respuestas correctas / número de respuestas válidas
Sus valores oscilan entre 0 y 1. Un valor alto indica un reactivo fácil; un valor bajo indica un reactivo difícil. Por esa razón, la expresión índice de dificultad puede resultar contraintuitiva: p representa en realidad una proporción de aciertos. Su complemento es q = 1 – p, y la varianza de un ítem dicotómico es pq.
Fig. 3
p | Descripción orientativa |
0.00 a 0.20 | Muy difícil |
0.21 a 0.39 | Difícil |
0.40 a 0.60 | Dificultad media |
0.61 a 0.79 | Fácil |
0.80 a 1.00 | Muy fácil |
Estos intervalos sirven como guía, no como reglas universales. Una prueba diagnóstica, una prueba de dominio o un instrumento que cubre un rango amplio de habilidad puede necesitar reactivos fáciles y difíciles. El valor p = 0.50 maximiza la varianza del ítem dicotómico, pero no es siempre el valor óptimo para el propósito de la medición.
Ejemplo. Si 12 de 14 personas responden correctamente un ítem, p = 12/14 = 0.86. El reactivo fue fácil para esa muestra. Esta interpretación es dependiente del grupo: el mismo ítem puede arrojar otro valor en una población distinta.
Discriminación mediante grupos extremos
El índice D compara la proporción de aciertos del grupo con puntuaciones altas con la proporción de aciertos del grupo con puntuaciones bajas:
D = p superior – p inferior
D puede variar entre -1 y +1. Un valor positivo indica que el grupo alto acierta con mayor frecuencia. Un valor cercano a cero revela escasa diferenciación. Un valor negativo exige revisar la clave, la redacción, la multidimensionalidad o posibles problemas de aplicación.
Fig. 4
Grupo | Aciertos | Tamaño | Proporción |
Superior | 6 | 7 | 0.86 |
Inferior | 1 | 7 | 0.14 |
D | 0.72 |
El uso del 27 por ciento superior y del 27 por ciento inferior maximiza la separación cuando la distribución se aproxima a la normalidad. Por razones prácticas también se emplean otros porcentajes. Con muestras pequeñas, la eliminación de la franja central reduce información y vuelve inestables los resultados; por ello conviene complementar D con una correlación calculada sobre toda la muestra.
Correlación punto biserial
La correlación punto biserial relaciona la puntuación dicotómica del reactivo con la puntuación total de la prueba. Para evitar que el ítem se correlacione parcialmente consigo mismo, es preferible emplear el total corregido, es decir, la puntuación total menos la puntuación del reactivo analizado.
Un coeficiente positivo y suficientemente alto respalda la coherencia del reactivo con el conjunto. No existe un punto de corte que funcione en toda situación. Los valores deben interpretarse junto con el tamaño de la muestra, la finalidad del instrumento, la heterogeneidad del grupo y el contenido del ítem. Un coeficiente bajo puede deberse a mala redacción, dificultad extrema, escasa variabilidad o a que el reactivo representa una faceta distinta del constructo.
Análisis de las alternativas
En un reactivo de selección múltiple, la clave debe atraer proporcionalmente a más personas del grupo alto. Los distractores deben resultar plausibles y atraer especialmente a quienes no dominan el contenido. Una alternativa que nadie selecciona no contribuye al funcionamiento del ítem y conviene revisarla.
Fig. 5
Alternativa | Grupo alto | Grupo bajo | Lectura |
A clave | 24 | 10 | La clave discrimina en la dirección esperada |
B | 3 | 5 | Distractor funcional |
C | 2 | 6 | Distractor funcional |
D | 0 | 6 | Conviene revisar su atractivo para el grupo alto |
E | 3 | 5 | Distractor funcional |
Si el grupo bajo acierta más que el grupo alto, primero debe verificarse la clave. También pueden existir ambigüedad, más de una respuesta defendible, pistas gramaticales o contenido ajeno al dominio evaluado. La eliminación inmediata no siempre es la mejor decisión: cuando el contenido es esencial, puede ser preferible revisar y someter el reactivo a una nueva aplicación piloto.
Análisis de reactivos con respuestas graduadas
Los reactivos con categorías ordenadas se utilizan con frecuencia para evaluar actitudes, intereses, rasgos y otras manifestaciones de ejecución típica. El análisis debe comenzar con la distribución de las respuestas. Un ítem en el que casi todas las personas eligen la misma categoría aporta poca variabilidad, aunque podría ser importante por razones teóricas o de contenido.
Ejemplo de formato de respuesta
Fig. 6
Enunciado | Totalmente en desacuerdo | En desacuerdo | Indeciso | De acuerdo | Totalmente de acuerdo |
Los resultados de una prueba deben interpretarse considerando su error de medición | 1 | 2 | 3 | 4 | 5 |
Las etiquetas deben corresponder al significado de las categorías. La opción central puede representar neutralidad, indecisión o falta de información; estas interpretaciones no son equivalentes. Por ello conviene definir qué respuesta se espera y evitar categorías ambiguas como no sé cuando se pretende medir acuerdo.
Correlación ítem total corregida
La correlación ítem-total corregida relaciona cada ítem con la suma de los demás reactivos. La corrección evita inflar el coeficiente por la inclusión del propio ítem en el total. En forma operativa:
r corregida = correlación entre el ítem i y el total sin el ítem i
Una correlación positiva indica que las personas con puntuaciones altas en la escala tienden a puntuar también alto en el reactivo. Una correlación negativa puede revelar que el ítem invertido no fue recodificado, que su redacción es confusa o que mide otra dimensión. Los coeficientes deben examinarse junto con el contenido y la estructura interna. No debe eliminarse un reactivo únicamente para aumentar un coeficiente de consistencia interna.
Fig.7
Resultado | Interpretación inicial | Decisión posible |
Positivo y moderado o alto | Coherencia con la puntuación del conjunto | Conservar y revisar su contenido |
Cercano a cero | Escasa relación o poca variabilidad | Examinar redacción, distribución y pertinencia |
Negativo | Dirección contraria o error de codificación | Verificar inversión, clave y dimensionalidad |
Decisiones sobre los reactivos
Los indicadores estadísticos describen el comportamiento observado en una muestra; no sustituyen el juicio teórico. La decisión final debe integrar al menos los siguientes elementos:
- La correspondencia del reactivo con la definición del constructo y la tabla de especificaciones.
- La claridad de la redacción y la ausencia de contenido irrelevante para la medición.
- La dificultad, la discriminación y el funcionamiento de las alternativas, cuando corresponda.
- La distribución de respuestas y la correlación ítem-total corregida en escalas graduadas.
- La representación equilibrada de las dimensiones y los grupos relevantes para el uso previsto.
- La necesidad de confirmar los resultados en una nueva muestra después de revisar los ítems.
La dificultad y la discriminación dependen de la muestra en la Teoría Clásica de los Tests. Por eso, los valores obtenidos durante el estudio piloto no deben interpretarse como propiedades invariables. Cuando el proyecto y el tamaño muestral lo permiten, la Teoría de Respuesta al Ítem ofrece modelos que estiman parámetros de los ítems y permiten estudiar con mayor precisión su funcionamiento a lo largo del nivel del rasgo.
Síntesis del procedimiento
Fig.8
Etapa | Pregunta principal |
Revisión conceptual | ¿El contenido representa el constructo y su dominio? |
Preparación de datos | ¿La clave, la codificación y los valores perdidos son correctos? |
Descripción del ítem | ¿Cómo se distribuyen las respuestas y cuánta variabilidad existe? |
Relación con el total | ¿El reactivo diferencia y se relaciona con la puntuación del conjunto? |
Revisión de alternativas | ¿La clave y los distractores funcionan como se esperaba? |
Decisión y nueva prueba | ¿Debe conservarse, revisarse o retirarse y confirmarse en otra muestra? |
El análisis de reactivos aporta evidencia sobre el funcionamiento de cada ítem dentro de una aplicación concreta. Un buen reactivo debe ser pertinente para el constructo, comprensible para la población y estadísticamente coherente con el uso previsto. La calidad del instrumento depende de esa convergencia; ningún índice aislado garantiza por sí solo validez o confiabilidad.
Referencias
American Educational Research Association, American Psychological Association, and National Council on Measurement in Education. (2014). Standards for educational and psychological testing. American Educational Research Association.
Crocker, L., and Algina, J. (1986). Introduction to classical and modern test theory. Holt, Rinehart and Winston.
Kaplan, R. M., and Saccuzzo, D. P. (2006). Psychological testing Principles applications and issues. Thomson Wadsworth.
Magnusson, D. (1975). Teoría de los tests. Trillas.
Nunnally, J. C., and Bernstein, I. H. (1994). Psychometric theory. McGraw Hill.