Les mentions « moyenne 100 », « scientifique » ou « précis » ne suffisent pas à connaître la qualité de mesure d'un test de QI. Il faut vérifier à qui le score est comparé, quelles aptitudes sont mesurées et avec quelle marge d'erreur.
Lorsqu'un test ne publie pas les éléments nécessaires à cette évaluation, ne considérez pas son QI comme une mesure précise. La publicité, la position dans les résultats de recherche, la qualité graphique du rapport ou un certificat de QI ne prouvent rien sur la qualité de mesure. Pour choisir un service en examinant aussi son prix et ses conditions contractuelles, consultez comment choisir un test de QI en ligne fiable.
Les quatre éléments qui déterminent la qualité d'un test de QI
| Élément | Ce qu'il faut vérifier | Conséquence s'il manque |
|---|---|---|
| Standardisation | Les conditions de passation et de cotation sont-elles identiques ? | Les différences d'appareil, de temps ou de cotation se mélangent au score |
| Normes | À quelles personnes les résultats sont-ils comparés ? | Un QI de 100 ou un rang dans les 2 % les plus élevés ne peut pas être interprété |
| Fiabilité | Dans quelle mesure le score est-il cohérent ? | Quelques bonnes ou mauvaises réponses fortuites font fortement varier le résultat |
| Validité | Le score peut-il être interprété comme l'aptitude annoncée ? | Un résultat de raisonnement visuel est interprété à tort comme un QI global |
Aucun de ces quatre éléments ne suffit à lui seul. Un vaste échantillon normatif ne rend pas les scores comparables si les conditions de passation varient. Une forte fiabilité ne suffit pas non plus à justifier un QI global incluant le langage, la mémoire et la vitesse si le test ne mesure que le raisonnement visuel.
Standardisation et normes
La standardisation consiste à uniformiser les consignes, les limites de temps, la présentation des items, la cotation et la gestion des interruptions ou du temps écoulé. En ligne, les différences d'affichage entre un téléphone intelligent et un ordinateur, les délais de connexion, les nouvelles passations, l'utilisation d'un moteur de recherche et la prise de notes font également partie des conditions de mesure. Si deux personnes ayant les mêmes aptitudes peuvent obtenir des QI très différents à cause de leur appareil ou du nombre de passations, les scores ne sont plus comparables.
Les normes définissent le groupe auquel le QI est comparé. N'importe quelle distribution de scores bruts peut être transformée pour afficher une moyenne de 100 et un écart-type de 15. Donner une moyenne de 100 aux seuls visiteurs d'un site ne situe pas pour autant le résultat parmi l'ensemble de la population adulte canadienne.
Vérifiez au minimum les informations suivantes :
- l'âge, la langue, la région et le mode de recrutement, en plus de la taille de l'échantillon ;
- le traitement des premières passations, des nouvelles passations, des réponses atypiques et des abandons ;
- le nombre de personnes par âge et la méthode de correction liée à l'âge ;
- l'année de collecte et la correspondance entre ces données, les items actuels et la méthode de cotation ;
- pour un test passé en français canadien, l'utilisation d'items et d'un groupe de référence adaptés à cette version.
Même si un service annonce « 100 000 participants », il est impossible d'évaluer la qualité des normes sans savoir si les nouvelles passations d'une même personne sont incluses, combien de participants appartiennent à chaque groupe d'âge et quand les données ont été recueillies. Les normes établies dans une autre langue ne peuvent pas non plus être appliquées telles quelles à un test simplement traduit en français. Les recommandations de l'International Test Commission sur l'utilisation des tests indiquent que les preuves de fiabilité et de validité doivent être accessibles, que les caractéristiques du groupe normatif doivent être connues et que la passation repose sur des conditions standardisées. Pour évaluer concrètement ces éléments, il faut donc pouvoir identifier le groupe normatif et son échantillon, les procédures de standardisation et les principaux résultats statistiques.
Fiabilité, erreur de mesure et intervalle de confiance
La fiabilité, exprimée par un coefficient compris entre 0 et 1, indique la quantité d'information cohérente contenue dans le score. La cohérence de l'ensemble des items et la stabilité d'une nouvelle passation à une autre date répondent à des questions différentes. Il ne suffit pas d'afficher « fiabilité 0,90 » : il faut préciser le type de coefficient, les données utilisées et le score concerné.
La fiabilité permet de calculer l'erreur standard de mesure, ou SEM, d'un score individuel. Sur une échelle de QI d'écart-type 15, une fiabilité de 0,90 produit une SEM d'environ 4,7 points. Avec une méthode qui calcule l'intervalle de confiance à 95 % par ±1,96 SEM, un QI de 130 se lit dans une plage d'environ 121 à 139. Une fiabilité de 0,90 ne signifie donc pas que le score est exact au point près.
Cette plage représente l'erreur de mesure contenue dans un score individuel. Elle ne corrige ni un échantillon normatif biaisé ni une interprétation trop large qui présenterait le raisonnement visuel comme un QI global.
Validité et étendue des aptitudes mesurées
La validité détermine si le score peut être interprété comme l'aptitude annoncée. Il faut vérifier si les items couvrent suffisamment cette aptitude, si la structure attendue des scores est observée dans les données et si le résultat entretient les relations prévues avec les tests d'intelligence ou les tâches apparentées.
Des exercices composés de figures ou de matrices peuvent former un bon test de raisonnement visuel ou de raisonnement fluide. Même avec une forte fiabilité sur 30 matrices, ils ne mesurent pas pour autant le vocabulaire, les connaissances, la mémoire de travail et la vitesse de traitement. Pour afficher un QI global, un test doit mesurer plusieurs aptitudes et disposer d'éléments justifiant leur combinaison en un score général.
La mention « corrélation de 0,70 avec un test de QI existant » ne signifie pas non plus que le résultat est exact à 70 %. Une corrélation indique dans quelle mesure deux scores évoluent ensemble. Si l'on ajoutait uniformément 10 points à tous les résultats d'un test, la corrélation avec les scores d'origine resterait de 1, alors que chaque nombre serait décalé de 10 points. Pour déterminer si les deux résultats peuvent être lus comme le même QI, il faut connaître le test de comparaison et son édition, l'échantillon, l'écart moyen et les différences selon les zones de scores.
Les items et les normes nécessaires pour mesurer un QI élevé
Distinguer un QI de 130 d'un QI de 140 suppose de dépasser deux plafonds.
| Plafond | Ce qu'il faut | Conséquence s'il manque |
|---|---|---|
| Plafond des items | Des items qui distinguent encore les personnes aux aptitudes élevées | Les meilleurs participants réussissent presque tout et leurs différences ne sont plus observables |
| Plafond des normes | Assez de données et une méthode de conversion adaptée aux scores élevés | Un même score brut ne permet pas d'estimer précisément des QI voisins |
Même dans un grand échantillon, peu de personnes se trouvent aux extrémités de la distribution. Sous l'hypothèse d'une distribution normale de moyenne 100 et d'écart-type 15, un échantillon de 2 000 personnes ne compte qu'environ 8 personnes ayant un QI de 140 ou plus. Il est difficile d'en déduire des distinctions fines entre 140, 142 et 145. Le tableau des scores de QI et des proportions de la population montre pourquoi les données deviennent plus difficiles à réunir à mesure que le score augmente.
Parmi les 2 200 enfants de l'échantillon normatif habituel de la WISC-V, 16 seulement avaient obtenu au moins un score composite de 150 ou plus. Des normes étendues ont donc été créées pour les scores élevés, puis vérifiées sur un échantillon distinct de 108 enfants aux aptitudes élevées. Même pour un test reconnu, la mesure dans la zone supérieure demande des items et des données conçus à cette fin.
Les informations publiques nécessaires pour juger la qualité de mesure
Dans les informations publiées, reliez chaque promesse aux éléments qui permettent de l'évaluer.
| Promesse affichée | Informations nécessaires pour la juger |
|---|---|
| QI de 100 ou les 2 % les plus élevés | Population visée, composition de l'échantillon, année de collecte, méthode de conversion |
| QI global | Aptitudes mesurées, composition des items, structure des scores |
| Fiabilité de 0,90 | Type de coefficient, échantillon analysé, SEM, précision selon les zones de scores |
| Forte corrélation avec un test existant | Nom et édition du test, échantillon, corrélation, écart moyen |
| Mesure des QI supérieurs à 140 | Items adaptés aux aptitudes élevées, nombre de personnes dans cette zone, méthode d'extrapolation ou de validation |
| Scientifique ou précis | Méthodes et résultats qui soutiennent chaque promesse |
Un test n'a pas besoin de publier ses données brutes, son algorithme de cotation et ses items réels. Les utilisateurs peuvent évaluer ses affirmations si la population, l'échantillon, les conditions de passation, la conversion, la fiabilité et l'erreur, les principaux résultats de validité et la correspondance entre la documentation technique et la version actuelle sont connus.
À l'inverse, si ces informations ne permettent pas d'évaluer la mesure, un nombre précis comme 137 ne peut pas être interprété aussi précisément. Ne considérez pas comme précis le QI d'un test qui ne publie pas ses fondements. C'est la conclusion pratique.
BrainTypeIQ explique pourquoi ses neuf épreuves ont été choisies et comment elles correspondent aux cinq domaines, ainsi que la manière dont elles composent le QI global et le profil cognitif. La conversion sur une échelle standard et la méthode de composition, les normes de la version japonaise fondées sur 841 premières passations et la fiabilité de 0,929 du QI global, avec une SEM d'environ 4,0 points, sont également publiées. La version destinée aux francophones du Canada utilise actuellement une cotation provisoire pendant que ses propres données s'accumulent. Si votre objectif est une évaluation formelle ou la remise d'un résultat à un tiers, choisissez en tenant compte des rôles respectifs de la WAIS et des tests de QI en ligne.