即使測驗標示平均 100、科學、準確,也不能只靠這些字眼判斷 IQ 的測量品質。需要確認數值以甚麼人作為比較基準、測量哪些能力,以及誤差有多大。
如果測驗沒有公開足夠資料供使用者判斷,就不應把它顯示的 IQ 視為精確數字。廣告、搜尋排名、設計完整的結果頁面或 IQ 證書,都不是測量品質的證據。如何連同收費和合約條件選擇測驗,可參閱如何選擇可信的網上 IQ 測驗。
決定 IQ 測驗品質的四項要素
| 要素 | 要確認的內容 | 欠缺時會發生甚麼 |
|---|---|---|
| 標準化 | 施測和計分條件是否一致 | 裝置、作答時間和計分方法的差異會影響得分 |
| 常模 | 以哪些人的數據作比較 | 無法確定 IQ 100 或最高 2% 的意思 |
| 信度 | 得分有多一致 | 偶然答對或答錯會令數值大幅變動 |
| 效度 | 得分能否按所標示的能力來解讀 | 把圖形推理結果過度延伸成綜合 IQ |
不能只靠其中一項判斷 IQ 的測量品質。即使常模樣本很大,如果施測條件不一致,比較仍會失去意義。即使信度很高,如果測量範圍只有圖形推理,也不足以作為涵蓋語言、記憶和處理速度的綜合 IQ。
標準化與常模
標準化是統一測驗說明、時間限制、出題和計分方式,以及超時或中斷時的處理方法。在網上測驗中,手機和電腦的顯示差異、網絡延誤、重複受測、可否搜尋或使用筆記,也屬於得分條件。如果能力相若的人只因裝置不同或重複受測,就得到差距很大的 IQ,這個尺度便失去可比性。
常模決定 IQ 與誰比較。只要進行數值轉換,任何群體的數據都可換算為平均 100、標準差 15。即使把網站訪客的平均分定為 100,也不代表結果顯示一個人在香港一般成人中的位置。
最低限度要確認以下資料:
- 除了樣本人數,亦要知道年齡、語言、地區和招募方法
- 如何處理首次和重複受測、不自然回答及中途退出
- 各年齡的人數和校正方法
- 數據收集年份,以及是否對應目前的題目和計分方法
- 如果使用香港繁體中文版,基準是否由該版本的題目和受測者建立
即使標示「10 萬名受測者」,如果不知道是否包含同一人重複受測、每個年齡有多少人或數據在何時收集,仍無法判斷常模品質。把測驗翻譯成香港繁體中文後,也不能直接套用其他語言版本的常模。日本測驗學會的基本條款亦要求記錄和公開常模群體、樣本、標準化程序及統計資料。
信度、測量誤差與置信區間
信度以 0 至 1 的係數表示得分的一致程度。衡量所有題目整體一致性的信度,和衡量相隔一段時間再次受測是否穩定的重測信度,回答的是不同問題。不能只寫「信度 .90」,還要說明係數種類、採用哪些人的數據,以及針對哪項得分計算。
信度可以用來計算個人得分的測量標準誤(SEM)。在標準差 15 的 IQ 尺度中,如果信度為 .90,SEM 約為 4.7 分。如果用 ±1.96 SEM 計算 95% 置信區間,IQ 130 的範圍約為 121 至 139。信度 .90 不代表得分精確至 1 分。
這裏談的是單次個人得分所包含的測量誤差。常模樣本的偏差,或圖形推理能否稱為綜合 IQ 的效度問題,都不會因置信區間較窄而得到解決。
效度與測量能力的範圍
效度決定得分能否按所標示的能力來解讀。要確認題目內容是否涵蓋該能力的範圍、數據是否支持預期的得分結構,以及結果與既有智力測驗和相關任務的關係是否符合預期。
圖形題和矩陣推理可以是質素良好的圖形推理或流體推理測驗。不過,即使由 30 題圖形題組成的測驗有很高信度,也不代表已經測量詞彙、知識、工作記憶和處理速度。如果要顯示綜合 IQ,題目組合就要涵蓋多項能力,並有根據把它們合成綜合分數。
「與既有 IQ 測驗相關 .70」也不代表準確度是 70%。相關只表示兩項得分一同升跌的程度。假設把所有人的原有得分一律加 10 分,新得分與原得分的相關仍會是 1,但每個人的數值都相差 10 分。要判斷能否視為相同 IQ,還要查看比較測驗的名稱和版本、樣本、平均差異,以及不同得分範圍的差異。
測量高 IQ 所需的題目與常模
要區分 IQ 130 和 140,必須克服兩種天花板。
| 天花板 | 需要甚麼 | 不足時會發生甚麼 |
|---|---|---|
| 題目天花板 | 即使在高能力受測者之間也能分出差異的題目 | 高分受測者幾乎全部答對,無法觀察能力差異 |
| 常模天花板 | 足以支撐高分範圍的數據和換算方法 | 無法從同一答對題數穩定推算細微 IQ 差異 |
即使整體樣本很大,處於分布兩端的人仍然很少。假設平均 100、標準差 15 的正態分布,2,000 人的樣本中,IQ 140 或以上大約只有 8 人。單靠這些數據,很難把 IQ 140、142、145 細緻分開。從 IQ 得分與人口比例可以看到,得分愈高,收集所需數據便愈困難。
在 WISC-V 標準常模的 2,200 人樣本中,任何一項合成分數達 150 或以上的兒童只有 16 人。因此,研究另外建立了高分範圍的延伸常模,並以 108 名高能力兒童的獨立樣本作驗證。即使是廣泛使用的測驗,高分範圍仍需要專門設計的題目和數據。
判斷測量品質所需的公開資料
查看公開資料時,重點不是宣傳字眼,而是每項主張是否有相應根據。
| 顯示的主張 | 判斷所需的資料 |
|---|---|
| IQ 100、最高 2% | 對象群體、樣本組成、收集年份、換算方法 |
| 綜合 IQ | 測量的能力、題目組成、得分結構 |
| 信度 .90 | 係數種類、分析樣本、SEM、不同得分範圍的精確度 |
| 與既有測驗高度相關 | 測驗名稱和版本、樣本、相關、平均差異 |
| 可測量 IQ 140 或以上 | 高能力範圍的題目、高分受測者人數、外推或驗證方法 |
| 科學、準確 | 哪項主張由甚麼方法和結果支持 |
測驗不需要公開所有原始數據、計分演算法和實際題目。只要能確認對象、樣本、施測條件、換算方法、信度和誤差、主要效度結果,以及技術資料是否對應現行版本,使用者便可以評估相關主張。
相反,如果公開資料不足以作出上述判斷,即使測驗顯示 IQ 137 這類精細數字,也無法確認其意思和精確度。沒有公開根據的測驗,不應把它顯示的 IQ 視為精確數字。這是選擇測驗時最實用的判斷原則。
BrainTypeIQ 公開了九個分項的選擇理由及與五個範疇的對應,並說明如何從九個分項組成綜合 IQ 與五個範疇及如何換算和合成標準分數。日文版以符合條件的 841 名初次完成者建立常模,並公開綜合 IQ 的信度 .929 和約 4.0 分的 SEM。香港版本目前使用暫定計分,並持續累積本地數據。如果目的是正式評估或提交外部文件,應按 WAIS 與網上 IQ 測驗的用途分別作出選擇。