判断に必要な根拠が公開されていないテストのIQは、精密な数値として信用しないでください。広告や検索順位、整った結果画面、IQ認定証は、測定品質の根拠にはなりません。料金や契約条件も含めた選び方は、信頼できるオンラインIQテストの選び方で確認できます。
IQテストの測定品質を決める4つの要素
| 要素 | 確認すること | 欠けた場合 |
|---|---|---|
| 標準化 | 実施と採点の条件が揃っているか | 端末や時間、採点方法の違いが得点に混ざる |
| ノルム | 誰のデータと比較しているか | IQ100や上位2%の意味が決まらない |
| 信頼性 | 得点がどの程度一貫するか | 偶然の正誤で数値が大きく動く |
| 妥当性 | 表示した能力として読めるか | 図形推理の結果を総合IQへ広げすぎる |
この4つのどれか一つだけで、IQの測定品質は判断できません。たとえば、信頼性が高くても、測っている範囲が図形推理だけなら、言語、記憶、処理速度まで含む総合IQとしては妥当ではありません。
標準化とノルム
標準化とは、説明、制限時間、出題、採点、時間切れや中断の扱いを揃えることです。オンラインでは、スマートフォンとPCの表示差、通信遅延、再受検、検索やメモの扱いも得点条件に含まれます。同じ能力の人が、使った端末や受けた回数だけで大きく違うIQになるなら、比較可能な尺度にはなりません。
ノルムはIQの比較相手です。正答数を平均100・標準偏差15へ変換するだけなら、どんな集団のデータでもできます。サイトを訪れた人だけの平均を100にしても、日本の一般成人の中での位置を表すことにはなりません。
ノルムは人数だけでなく、年齢、言語、地域、募集方法、再受検や不自然な回答・途中離脱の扱い、年齢補正、収集年と現行の問題・採点方法との対応まで見ます。
「受検者10万人」でも、同じ人の再受検を含むのか、どの年齢が何人いるのか、いつ集めたのかが不明なら、ノルムの質は判断できません。日本語へ翻訳しただけのテストに、外国語版のノルムをそのまま当てはめることもできません。日本テスト学会の基本条項でも、規準集団、標本、標準化手続、統計情報を記録・公開することが求められています。
信頼性・測定誤差・信頼区間
信頼性は、得点にどの程度一貫した情報があるかを0〜1の係数で表します。項目全体のまとまりを見る信頼性と、別日に受けたときの安定性を見る再検査信頼性では、答えている問いが違います。「信頼性.90」と書くだけでなく、どの種類を、誰のデータで、どの得点について計算したかが必要です。
信頼性からは、個人得点の測定標準誤差(SEM)を計算できます。標準偏差15のIQ尺度で信頼性が.90なら、SEMは約4.7点です。95%信頼区間を±1.96SEMで計算する方式では、IQ130の範囲は約121〜139になります。信頼性.90は、1点単位で正確という意味ではありません。
ここで表すのは、一回の個人得点に含まれる測定誤差です。ノルム標本の偏りや、図形推理を総合IQと呼んでよいかという妥当性は、狭い信頼区間では解決しません。
妥当性と測定する能力の範囲
妥当性は、その得点を表示された能力として読めるかを決めます。確認するのは、問題内容が能力の範囲を覆っているか、想定した得点構造がデータで確かめられているか、既存の知能検査や関連課題と予測どおりに関係するかです。
図形問題や行列推理は、図形推理や流動性推理を測る良質なテストになり得ます。ただし、30問の図形問題で高い信頼性が出ても、語彙、知識、ワーキングメモリ、処理速度を測ったことにはなりません。総合IQと表示するなら、複数の能力を測る問題構成と、それらを総合得点へまとめられる根拠が必要です。
「既存のIQ検査と相関.70」も、70%正確という意味ではありません。相関は二つの得点が一緒に上下する程度です。仮に全員へ一律10点を加えた得点を作れば、元の得点との相関は1になりますが、数値は全員10点ずれます。比較対象の検査名と版、標本、平均差、得点帯ごとの差まで見なければ、同じIQとして扱えるかは判断できません。
高いIQを測るための問題とノルム
IQ130と140を区別するには、二つの天井を越える必要があります。
| 天井 | 必要なもの | 不足すると起きること |
|---|---|---|
| 問題の天井 | 高能力者の間でも差がつく問題 | 上位者がほぼ全問正解になり、能力差を観測できない |
| ノルムの天井 | 高得点帯を支える十分なデータと換算方法 | 同じ正答数から細かなIQを安定して推定できない |
標本全体が多くても、分布の端にいる人は少数です。平均100・標準偏差15の正規分布を前提にすると、2,000人の標本に含まれるIQ140以上は約8人です。これだけでIQ140、142、145を細かく分けるのは無理があります。IQ得点と人口割合を見ると、得点が高くなるほど必要なデータを集めにくくなる理由が分かります。
WISC-Vの通常ノルム標本2,200人のうち、いずれかの合成得点が150以上だった子どもは16人でした。そのため、高得点域用の拡張ノルムを作り、高能力児108人の別標本でも検証しています。著名な検査でも、上位域には専用の問題設計とデータが必要です。
測定品質の判断に必要な公開情報
公開情報では、宣伝文句ではなく次の対応を見ます。
| 判断すること | 必要な公開情報 |
|---|---|
| 誰を基準にした数値か | 対象集団、標本構成、収集年、換算方法 |
| 何の能力を測った数値か | 問題構成、得点構造、妥当性を確かめた方法と結果 |
| どの程度の誤差を含む数値か | 実施条件、信頼性の種類、SEM、高得点帯の検証方法 |
生データ、採点アルゴリズム、実際の問題をすべて公開する必要はありません。対象、標本、実施条件、換算方法、信頼性と誤差、妥当性の主な結果、技術情報と現行版の対応が分かれば、利用者は主張を評価できます。
反対に、これらを評価できる情報がないなら、IQ137のように細かな数字が表示されても、その意味と精度は確認できません。根拠を公開していないテストのIQは、精密な数値として信用しない。これが実用上の結論です。
BrainTypeIQが公開している測定根拠
BrainTypeIQは、9科目を選んだ理由と5領域への対応を示し、9科目から総合IQと5領域を構成しています。
標準得点への換算と合成方法、日本語版の初回完了者841人によるノルム、総合IQの信頼性.929・SEM約4.0点も公開しています。正式な評価や外部提出が目的なら、オンラインテストの品質比較ではなく、WAISとオンラインIQテストの役割の違いから選んでください。