Aunque un test muestre «media 100», «científico» o «preciso», esas palabras no bastan para conocer su calidad psicométrica. Hay que comprobar con quién compara, qué capacidades mide y con cuánto error estima el resultado.
No trates como una cifra precisa el CI de un test que no publica las pruebas necesarias para evaluarlo. Los anuncios, la posición en buscadores, una pantalla de resultados cuidada o un certificado de CI no demuestran su calidad psicométrica. Para valorar también el precio y las condiciones de contratación, consulta cómo elegir un test de CI online fiable.
Los cuatro elementos que determinan la calidad de un test de CI
| Elemento | Qué hay que comprobar | Qué ocurre si falta |
|---|---|---|
| Estandarización | Si las condiciones de aplicación y puntuación son las mismas | Las diferencias de dispositivo, tiempo o corrección se mezclan con la puntuación |
| Baremos | Con qué personas se compara el resultado | Un CI de 100 o el 2 % superior dejan de tener un referente claro |
| Fiabilidad | Hasta qué punto la puntuación es consistente | Unos pocos aciertos fortuitos pueden cambiar demasiado la cifra |
| Validez | Si el resultado puede interpretarse como la capacidad que afirma medir | Un resultado de razonamiento con figuras se extiende indebidamente al CI total |
Ningún elemento permite juzgar por sí solo la calidad del test. Un baremo grande no sirve para comparar si las condiciones de aplicación varían demasiado. Una puntuación puede ser muy fiable, pero si solo mide razonamiento con figuras, no es válida como CI total que incluya comprensión verbal, razonamiento fluido, procesamiento visoespacial, memoria de trabajo y velocidad de procesamiento.
Estandarización y baremos
La estandarización consiste en mantener iguales las instrucciones, los límites de tiempo, la presentación de las tareas, la corrección, qué ocurre cuando se agota el tiempo y el tratamiento de las interrupciones. En un test online también forman parte de las condiciones las diferencias de visualización entre el móvil y el ordenador, la latencia de la conexión, los intentos repetidos y el uso de búsquedas o notas. Si dos personas con la misma capacidad obtienen puntuaciones muy distintas solo por el dispositivo utilizado o por haber repetido el test, el resultado no funciona como una escala comparable.
Los baremos definen con quién se compara el CI. Cualquier conjunto de datos puede transformarse en una escala con media 100 y desviación típica 15. Sin embargo, hacer que la media de las personas que visitaron una web sea 100 no significa que el resultado sitúe a alguien respecto a la población adulta general de España.
Como mínimo, hay que comprobar:
- No solo el tamaño de la muestra, sino también la edad, el idioma, la región y el método de captación
- Cómo se trataron las primeras aplicaciones, los intentos repetidos, las respuestas inusuales y los abandonos
- Cuántas personas había en cada franja de edad y cómo se aplicó el ajuste por edad
- En qué año se recogieron los datos y si corresponden a las tareas y al sistema de puntuación actuales
- Si el test se realiza en español de España, si los baremos se elaboraron con esa versión lingüística y con personas que la completaron
Aunque se anuncien «100.000 participantes», no se puede valorar el baremo si no se sabe si incluye varios intentos de una misma persona, qué edades están representadas o cuándo se recogieron los datos. Tampoco se puede aplicar sin más a una traducción al español el baremo construido para otra versión lingüística. Las directrices internacionales alojadas por la Comisión de Tests del Consejo General de la Psicología exigen que la documentación técnica permita evaluar la adecuación del grupo normativo, la precisión y fiabilidad, y la validez para la población y el uso previstos.
Fiabilidad, error de medición e intervalo de confianza
La fiabilidad expresa, mediante un coeficiente de 0 a 1, cuánta información consistente contiene una puntuación. La consistencia interna del conjunto de tareas y la estabilidad al repetir la prueba otro día responden a preguntas distintas. No basta con escribir «fiabilidad 0,90»: hay que indicar qué tipo de coeficiente se calculó, con qué personas y para qué puntuación.
A partir de la fiabilidad puede calcularse el error típico de medida (SEM) de una puntuación individual. En una escala de CI con desviación típica 15 y fiabilidad 0,90, el SEM es de unos 4,7 puntos. Si se utiliza un intervalo de confianza del 95 % calculado como ± 1,96 × SEM, un CI de 130 se situaría aproximadamente entre 121 y 139. Una fiabilidad de 0,90 no significa que la puntuación tenga una precisión de un punto.
Ese intervalo representa el error de medición presente en una puntuación individual. No corrige un sesgo en la muestra del baremo ni resuelve si un resultado de razonamiento con figuras puede llamarse CI total. Un intervalo estrecho no arregla un problema de validez.
Validez y amplitud de las capacidades medidas
La validez determina si una puntuación puede interpretarse como una medida de la capacidad que el test afirma medir. Hay que comprobar si el contenido de las tareas cubre esa capacidad, si los datos confirman la estructura propuesta y si la puntuación se relaciona como se esperaba con pruebas de inteligencia o tareas afines ya existentes.
Las matrices y otros problemas visuales pueden formar un buen test de razonamiento con figuras o razonamiento fluido. Sin embargo, aunque 30 problemas de figuras produzcan una fiabilidad alta, eso no significa que también se hayan medido vocabulario, conocimientos, memoria de trabajo y velocidad de procesamiento. Para mostrar un CI total hacen falta tareas que midan varias capacidades y pruebas que permitan combinarlas en una puntuación global.
Una «correlación de 0,70 con un test de CI existente» tampoco significa que el resultado sea un 70 % exacto. La correlación indica hasta qué punto dos puntuaciones suben y bajan juntas. Si se sumaran 10 puntos a todas las puntuaciones de una prueba, la correlación con el resultado original seguiría siendo 1, aunque todas las cifras estuvieran desplazadas 10 puntos. Para decidir si pueden tratarse como el mismo CI hay que conocer la prueba y la edición comparadas, la muestra, la diferencia media y las diferencias según el tramo de puntuación.
Las tareas y los baremos necesarios para medir un CI alto
Para distinguir un CI de 130 de uno de 140 hay que superar dos techos.
| Techo | Qué hace falta | Qué ocurre si no se alcanza |
|---|---|---|
| Techo de las tareas | Problemas que sigan diferenciando entre personas de capacidad alta | Muchas personas de la parte superior aciertan casi todo y dejan de observarse sus diferencias |
| Techo del baremo | Datos suficientes en el tramo superior y un método de conversión adecuado | No se pueden estimar con estabilidad cifras de CI muy próximas a partir del mismo número de aciertos |
Aunque la muestra total sea grande, en los extremos de la distribución hay pocas personas. Si se asume una distribución normal con media 100 y desviación típica 15, una muestra de 2.000 personas contendría unas 8 con un CI de 140 o más. Con esos datos no es razonable distinguir con detalle entre CI 140, 142 y 145. En qué significan las puntuaciones de CI se ve por qué resulta más difícil reunir datos a medida que aumenta la puntuación.
De las 2.200 personas de la muestra normativa habitual del WISC-V, solo 16 menores obtuvieron 150 o más en alguna puntuación compuesta. Por eso se elaboraron baremos ampliados para el tramo superior y se validaron además con una muestra separada de 108 menores de alta capacidad. Incluso las pruebas más consolidadas necesitan tareas y datos específicos para medir con precisión el extremo superior.
La información pública necesaria para valorar la calidad psicométrica
La información pública debe relacionar cada afirmación con las pruebas que permiten evaluarla.
| Afirmación mostrada | Información necesaria para valorarla |
|---|---|
| CI 100 o 2 % superior | Población de referencia, composición de la muestra, fecha de recogida y método de conversión |
| CI total | Capacidades medidas, composición de las tareas y estructura de las puntuaciones |
| Fiabilidad 0,90 | Tipo de coeficiente, muestra analizada, SEM y precisión según el tramo de puntuación |
| Alta correlación con una prueba existente | Nombre y edición de la prueba, muestra, correlación y diferencia media |
| Medición por encima de CI 140 | Tareas para capacidad alta, número de participantes en el tramo superior y método de extrapolación o validación |
| Científico o preciso | Qué afirmación concreta respalda cada método y resultado |
No es necesario publicar todos los datos brutos, el algoritmo de puntuación ni las tareas reales. Basta con que se conozcan la población objetivo, la muestra, las condiciones de aplicación, el método de conversión, la fiabilidad y el error, los principales resultados de validez y la correspondencia entre la información técnica y la versión actual.
Cuando esa información no permite evaluar las afirmaciones, una cifra detallada como CI 137 no tiene un significado ni una precisión comprobables. No trates como una cifra precisa el CI de un test que no publica sus fundamentos de medición. Esa es la conclusión práctica.
BrainTypeIQ explica por qué utiliza 9 tareas y cómo corresponden a cinco áreas, y cómo construye el CI total y las cinco áreas a partir de esas 9 tareas. También publica la conversión a puntuaciones estandarizadas y el método de composición, el baremo de la versión japonesa basado en 841 primeras aplicaciones completadas y una fiabilidad de 0,929 con un SEM aproximado de 4,0 puntos para el CI total. Si necesitas una evaluación formal o un resultado para terceros, elige a partir de las diferencias de función entre WAIS y un test de CI online.
La versión en español utiliza actualmente puntuaciones provisionales mientras acumula datos por país.