La psicometría es el área más técnica del repaso y la que menos margen deja a la interpretación: las respuestas son verificables. También es la que sostiene el resto, porque cada instrumento que un psicólogo usa para decidir algo sobre una persona debe justificar su fiabilidad y su validez.
La fiabilidad es la consistencia de la medida. Se estima por métodos distintos que responden a preguntas distintas: la estabilidad temporal mediante test-retest, la equivalencia mediante formas paralelas, la consistencia interna mediante la división por mitades corregida y mediante el coeficiente alfa, y el acuerdo entre observadores mediante índices de concordancia que descuentan el acuerdo debido al azar. De la fiabilidad se deriva el error típico de medida, que permite construir el intervalo de confianza alrededor de una puntuación: informar una puntuación sin su intervalo es una de las malas prácticas que el examen sanciona. Aumentar la longitud de la prueba con ítems homogéneos incrementa la fiabilidad; restringir el rango de la muestra la reduce.
La validez no es una propiedad del test sino de las inferencias que se hacen a partir de sus puntuaciones para un uso concreto. Se acumulan evidencias de contenido (representatividad del dominio, juicio de expertos), de relación con un criterio (concurrente y predictiva) y de constructo (convergente y discriminante, estructura interna mediante análisis factorial, diferencias entre grupos conocidos). La validez aparente no es evidencia de validez: solo afecta a la aceptabilidad de la prueba. Una prueba puede ser fiable y no válida; no puede ser válida sin ser fiable. La validez incremental pregunta qué añade un instrumento sobre lo que ya se sabía sin él.
El repaso trabaja la distribución normal y sus proporciones, las puntuaciones z (media 0, desviación 1), las puntuaciones T (media 50, desviación 10), las puntuaciones típicas de desviación de las escalas de inteligencia (media 100, desviación 15), los estaninos y los percentiles, y el error frecuente de tratar los percentiles como una escala de intervalo. En la toma de decisiones aparecen la sensibilidad, la especificidad, los valores predictivos y el efecto decisivo de la tasa base: un instrumento excelente puede producir más falsos positivos que aciertos cuando la condición es poco frecuente. Se estudian también el análisis de ítems (dificultad y discriminación), la diferencia entre la teoría clásica de los tests y la teoría de respuesta al ítem, el funcionamiento diferencial del ítem, y la distinción entre sesgo (propiedad psicométrica) y equidad (juicio sobre el uso).
La entrevista clínica —estructurada, semiestructurada y no estructurada—, el examen del estado mental, la observación conductual y el análisis funcional componen el núcleo cualitativo. Sobre él se ordenan las familias de instrumentos: escalas de inteligencia y de desarrollo, inventarios de personalidad de banda ancha con escalas de validez que detectan estilos de respuesta, escalas de síntomas, técnicas proyectivas y el debate sobre su evidencia, y baterías neuropsicológicas. Cierra el área la ética de la evaluación: consentimiento informado, uso únicamente dentro de la competencia acreditada, seguridad de los materiales, obligación de devolver resultados en lenguaje comprensible, cautela con las interpretaciones generadas automáticamente, prohibición de emitir conclusiones sin haber examinado a la persona cuando el tipo de dictamen lo exige, y adaptación cultural y lingüística de los instrumentos, un punto crítico en Puerto Rico, donde una traducción literal sin estudio de equivalencia no basta.
1. ¿Qué expresa el coeficiente de fiabilidad de una prueba?
En la teoría clásica de los tests, el coeficiente de fiabilidad es la razón entre la varianza verdadera y la varianza total observada. Cuanto mayor es esa proporción, menor es el peso relativo del error de medida. Fuente: consenso establecido en psicometría.
2. ¿Qué aspecto de la fiabilidad evalúa el procedimiento de test-retest?
El test-retest estima la estabilidad temporal aplicando la misma prueba a las mismas personas en dos momentos. Su interpretación depende del intervalo elegido y del carácter estable o cambiante del constructo medido. Fuente: consenso establecido en psicometría.
3. ¿Qué estima el coeficiente alfa de una prueba?
El coeficiente alfa estima la consistencia interna a partir de la covariación entre los ítems. Un valor elevado no garantiza unidimensionalidad, porque también aumenta con el número de ítems. Fuente: consenso establecido en psicometría.
4. ¿Qué factor aumenta el coeficiente alfa sin que ello implique una mejor medida?
El coeficiente alfa aumenta con el número de ítems, de modo que una prueba larga con ítems casi idénticos puede alcanzar valores muy altos sin aportar información adicional. Esa redundancia se conoce como inflación por longitud. Fuente: consenso establecido en psicometría.
5. ¿Qué corrige la fórmula que ajusta la fiabilidad obtenida por división en dos mitades?
Dividir la prueba en dos mitades produce la fiabilidad de una prueba de la mitad de longitud, y la fórmula correspondiente estima la de la prueba completa. Es la aplicación clásica de la relación entre longitud y fiabilidad. Fuente: consenso establecido en psicometría.
6. ¿Qué índice se emplea para el acuerdo entre observadores descontando el azar?
El porcentaje simple de acuerdo sobreestima la concordancia porque parte del acuerdo se produce por azar. Los coeficientes de concordancia corrigen ese componente y ofrecen una estimación más ajustada. Fuente: consenso establecido en psicometría.
7. ¿Qué permite construir el error típico de medida?
El error típico de medida expresa la imprecisión de una puntuación individual y permite construir el intervalo dentro del cual se sitúa razonablemente la puntuación verdadera. Informar una puntuación sin su intervalo es una mala práctica frecuente. Fuente: consenso establecido en psicometría.
8. ¿Qué relación existe entre la fiabilidad de una prueba y su error típico de medida?
El error típico de medida depende de la desviación típica de las puntuaciones y de la fiabilidad: cuanto mayor es la fiabilidad, menor es el error y más estrecho el intervalo de confianza alrededor de la puntuación. Fuente: consenso establecido en psicometría.
9. ¿De qué es propiedad la validez en la concepción psicométrica contemporánea?
La concepción actual sitúa la validez en las inferencias y en los usos, no en el instrumento: una misma prueba puede sostener una inferencia y no otra. De ahí que la validez se acumule como argumento y no se declare de una vez. Fuente: consenso establecido en estándares de pruebas educativas y psicológicas.
10. ¿Qué distingue la validez concurrente de la predictiva?
Ambas son evidencias de relación con un criterio: en la concurrente el criterio se mide al mismo tiempo que la prueba y en la predictiva se mide después. La segunda es más exigente y más relevante para las decisiones de selección. Fuente: consenso establecido en psicometría.
11. ¿Qué aporta la evidencia de validez de contenido?
La evidencia de contenido examina si los ítems cubren de forma representativa el dominio definido, normalmente mediante el juicio sistemático de personas expertas y una especificación previa del dominio. Fuente: consenso establecido en psicometría.
12. ¿Qué distingue la evidencia convergente de la discriminante?
La evidencia convergente muestra correlaciones sustanciales con medidas del mismo constructo o de constructos afines; la discriminante muestra correlaciones bajas con medidas de constructos que deberían ser distintos. Ambas son necesarias. Fuente: consenso establecido en psicometría.
13. ¿Qué es la validez aparente y qué valor psicométrico tiene?
La validez aparente se refiere a cómo percibe la prueba quien la responde y afecta a su aceptabilidad y a la motivación, pero no constituye evidencia psicométrica de validez. En algunos contextos interesa deliberadamente reducirla. Fuente: consenso establecido en psicometría.
14. ¿Qué relación existe entre fiabilidad y validez?
Una prueba no puede sostener inferencias válidas si sus puntuaciones son inestables o inconsistentes, pero una prueba muy fiable puede medir con precisión algo distinto de lo que se pretende. La fiabilidad limita el techo de la validez. Fuente: consenso establecido en psicometría.
15. ¿Qué pregunta responde el concepto de validez incremental?
La validez incremental examina la mejora en la predicción o en la decisión que aporta un instrumento por encima de la información ya disponible, y es un criterio decisivo para justificar el coste de añadir una prueba a una batería. Fuente: consenso establecido en psicometría.
16. ¿Qué indica una puntuación típica z de valor cero?
La puntuación z expresa la distancia respecto de la media en unidades de desviación típica, de modo que un valor cero indica coincidencia con la media del grupo normativo. No informa sobre el número de aciertos. Fuente: consenso establecido en psicometría.
17. ¿Qué media y desviación típica tiene por convención una escala de puntuaciones T?
Las puntuaciones T se construyen por convención con media cincuenta y desviación típica diez, lo que evita los valores negativos de la escala z y facilita la interpretación en perfiles. Fuente: consenso establecido en psicometría.
18. ¿Qué convención se emplea habitualmente en las puntuaciones típicas de desviación de las escalas de inteligencia?
Las escalas de inteligencia contemporáneas emplean puntuaciones típicas de desviación con media cien y desviación típica quince, que sustituyeron al cociente entre edad mental y edad cronológica de los primeros modelos. Fuente: consenso establecido en psicometría.
19. ¿Qué error frecuente se comete al interpretar los percentiles?
Los percentiles son una escala ordinal: cerca de la media, pequeñas diferencias de puntuación producen grandes saltos de percentil, y en los extremos ocurre lo contrario. Promediarlos o restarlos como si fueran intervalos es un error. Fuente: consenso establecido en psicometría.
20. ¿Qué proporción aproximada de casos se sitúa entre una desviación típica por debajo y una por encima de la media en una distribución normal?
En la distribución normal, aproximadamente dos tercios de los casos se sitúan a una desviación típica de la media, cerca del noventa y cinco por ciento a dos, y prácticamente la totalidad a tres. Fuente: consenso establecido en estadística aplicada.
21. ¿Qué condición debe cumplir una muestra normativa para interpretar una puntuación?
Lo determinante es la representatividad respecto de la población de referencia de la persona evaluada en las variables relevantes, más que el tamaño absoluto de la muestra. Una muestra grande pero sesgada produce interpretaciones erróneas. Fuente: consenso establecido en psicometría.
22. ¿Qué problema plantea utilizar un baremo con muchos años de antigüedad?
Los cambios generacionales en escolarización, familiaridad con el formato u otras variables desplazan la distribución de referencia, de modo que un baremo antiguo puede sobreestimar o subestimar la posición relativa de la persona. Fuente: consenso establecido en psicometría.
23. ¿Qué expresa el índice de dificultad de un ítem en la teoría clásica?
El índice de dificultad es la proporción de aciertos: valores altos indican un ítem fácil y valores bajos un ítem difícil. La denominación resulta contraintuitiva y es una fuente frecuente de confusión. Fuente: consenso establecido en psicometría.
24. ¿Qué expresa el índice de discriminación de un ítem?
La discriminación se estima habitualmente por la correlación entre la respuesta al ítem y la puntuación total corregida. Un ítem con discriminación nula o negativa no aporta información útil sobre el rasgo medido. Fuente: consenso establecido en psicometría.
25. ¿Qué ventaja aporta la teoría de respuesta al ítem frente a la teoría clásica?
La propiedad de invarianza permite estimar los parámetros de los ítems con independencia de la muestra y la posición de la persona con independencia del conjunto de ítems administrado, lo que hace posible la aplicación adaptativa. Fuente: consenso establecido en psicometría moderna.
26. ¿Qué es el funcionamiento diferencial del ítem?
El funcionamiento diferencial existe cuando, igualado el nivel en el rasgo, la probabilidad de responder de una determinada manera difiere entre grupos, lo que señala una fuente de varianza ajena al constructo. Una diferencia de medias no lo demuestra por sí sola. Fuente: consenso establecido en psicometría.
27. ¿Qué distingue el sesgo de la falta de equidad en el uso de una prueba?
El sesgo se demuestra empíricamente, por ejemplo mediante funcionamiento diferencial o diferencias en la predicción; la equidad implica además un juicio valorativo sobre el uso de las puntuaciones y sobre sus consecuencias sociales. Fuente: consenso establecido en estándares de pruebas educativas y psicológicas.
28. ¿Qué expresa la sensibilidad de una prueba de cribado?
La sensibilidad es la proporción de personas con la condición que obtienen un resultado positivo. La proporción de personas sin la condición correctamente clasificadas es la especificidad, y la probabilidad de que un positivo sea un caso real es el valor predictivo positivo. Fuente: consenso establecido en psicometría aplicada.
29. ¿De qué depende el valor predictivo positivo de una prueba, además de sus propiedades?
Con sensibilidad y especificidad constantes, el valor predictivo positivo desciende cuando la condición es poco frecuente, porque los falsos positivos superan en número a los verdaderos. Es la razón por la que el cribado exige confirmación. Fuente: consenso establecido en psicometría aplicada.
30. ¿Qué efecto tiene desplazar el punto de corte de una prueba hacia una mayor sensibilidad?
Sensibilidad y especificidad se compensan: bajar el umbral identifica más casos verdaderos y también más falsos positivos. La elección del punto de corte depende del coste relativo de cada tipo de error en el contexto de uso. Fuente: consenso establecido en psicometría aplicada.
31. ¿Qué muestra la investigación sobre la comparación entre predicción clínica y estadística?
Las revisiones acumuladas muestran que la combinación mecánica y explícita de la información iguala o supera a la integración intuitiva, sin que ello niegue el papel del juicio profesional en la selección de la información y en la decisión final. Fuente: consenso establecido en evaluación psicológica.
32. ¿Qué efecto produce la restricción del rango sobre un coeficiente de correlación?
Cuando la muestra abarca solo una parte del rango de una variable, la correlación observada subestima la que existiría en el rango completo. Es un problema habitual en estudios de validez predictiva con personas ya seleccionadas. Fuente: consenso establecido en psicometría.
33. ¿Qué describe el fenómeno de atenuación de la correlación por error de medida?
La falta de fiabilidad de las medidas reduce la correlación observada respecto de la que existe entre los constructos. Existen fórmulas de corrección por atenuación, cuyo uso exige cautela porque puede producir estimaciones infladas. Fuente: consenso establecido en psicometría.
34. ¿Por qué es esencial respetar las condiciones estandarizadas de aplicación?
Las normas describen el rendimiento bajo unas condiciones concretas de instrucciones, tiempo y materiales; alterarlas compromete la comparabilidad con el grupo normativo. Cuando la adaptación es necesaria, debe documentarse y advertirse en el informe. Fuente: consenso establecido en estándares de pruebas educativas y psicológicas.
35. ¿Qué debe hacerse cuando se aplican adaptaciones a una prueba estandarizada?
Las adaptaciones necesarias por razones sensoriales, motoras o lingüísticas deben describirse en el informe junto con su posible efecto sobre la interpretación, sin corregir puntuaciones de forma improvisada ni renunciar a la evaluación. Fuente: consenso establecido en evaluación con acomodos.