BrainTypeIQ
測驗腦型報告資料
文章·2026-08-29

IQ 測驗的測量品質是甚麼

IQ 測驗的品質,不是由有沒有顯示平均 100 決定,而是取決於標準化、用作比較的常模、結果的信度,以及結果能否有效反映所聲稱的能力。本文說明如何從公開資料判斷測量誤差和高分範圍的精確度。

即使測驗標示平均 100、科學、準確,也不能只靠這些字眼判斷 IQ 的測量品質。需要確認數值以甚麼人作為比較基準、測量哪些能力,以及誤差有多大。

如果測驗沒有公開足夠資料供使用者判斷,就不應把它顯示的 IQ 視為精確數字。廣告、搜尋排名、設計完整的結果頁面或 IQ 證書,都不是測量品質的證據。如何連同收費和合約條件選擇測驗,可參閱如何選擇可信的網上 IQ 測驗。

決定 IQ 測驗品質的四項要素

要素要確認的內容欠缺時會發生甚麼
標準化施測和計分條件是否一致裝置、作答時間和計分方法的差異會影響得分
常模以哪些人的數據作比較無法確定 IQ 100 或最高 2% 的意思
信度得分有多一致偶然答對或答錯會令數值大幅變動
效度得分能否按所標示的能力來解讀把圖形推理結果過度延伸成綜合 IQ
可左右滑動查看

不能只靠其中一項判斷 IQ 的測量品質。即使常模樣本很大,如果施測條件不一致,比較仍會失去意義。即使信度很高,如果測量範圍只有圖形推理,也不足以作為涵蓋語言、記憶和處理速度的綜合 IQ。

標準化與常模

標準化是統一測驗說明、時間限制、出題和計分方式,以及超時或中斷時的處理方法。在網上測驗中,手機和電腦的顯示差異、網絡延誤、重複受測、可否搜尋或使用筆記,也屬於得分條件。如果能力相若的人只因裝置不同或重複受測,就得到差距很大的 IQ,這個尺度便失去可比性。

常模決定 IQ 與誰比較。只要進行數值轉換,任何群體的數據都可換算為平均 100、標準差 15。即使把網站訪客的平均分定為 100,也不代表結果顯示一個人在香港一般成人中的位置。

最低限度要確認以下資料:

  • 除了樣本人數,亦要知道年齡、語言、地區和招募方法
  • 如何處理首次和重複受測、不自然回答及中途退出
  • 各年齡的人數和校正方法
  • 數據收集年份,以及是否對應目前的題目和計分方法
  • 如果使用香港繁體中文版,基準是否由該版本的題目和受測者建立

即使標示「10 萬名受測者」,如果不知道是否包含同一人重複受測、每個年齡有多少人或數據在何時收集,仍無法判斷常模品質。把測驗翻譯成香港繁體中文後,也不能直接套用其他語言版本的常模。日本測驗學會的基本條款亦要求記錄和公開常模群體、樣本、標準化程序及統計資料。

信度、測量誤差與置信區間

信度以 0 至 1 的係數表示得分的一致程度。衡量所有題目整體一致性的信度,和衡量相隔一段時間再次受測是否穩定的重測信度,回答的是不同問題。不能只寫「信度 .90」,還要說明係數種類、採用哪些人的數據,以及針對哪項得分計算。

信度可以用來計算個人得分的測量標準誤(SEM)。在標準差 15 的 IQ 尺度中,如果信度為 .90,SEM 約為 4.7 分。如果用 ±1.96 SEM 計算 95% 置信區間,IQ 130 的範圍約為 121 至 139。信度 .90 不代表得分精確至 1 分。

這裏談的是單次個人得分所包含的測量誤差。常模樣本的偏差,或圖形推理能否稱為綜合 IQ 的效度問題,都不會因置信區間較窄而得到解決。

效度與測量能力的範圍

效度決定得分能否按所標示的能力來解讀。要確認題目內容是否涵蓋該能力的範圍、數據是否支持預期的得分結構,以及結果與既有智力測驗和相關任務的關係是否符合預期。

圖形題和矩陣推理可以是質素良好的圖形推理或流體推理測驗。不過,即使由 30 題圖形題組成的測驗有很高信度,也不代表已經測量詞彙、知識、工作記憶和處理速度。如果要顯示綜合 IQ,題目組合就要涵蓋多項能力,並有根據把它們合成綜合分數。

「與既有 IQ 測驗相關 .70」也不代表準確度是 70%。相關只表示兩項得分一同升跌的程度。假設把所有人的原有得分一律加 10 分,新得分與原得分的相關仍會是 1,但每個人的數值都相差 10 分。要判斷能否視為相同 IQ,還要查看比較測驗的名稱和版本、樣本、平均差異,以及不同得分範圍的差異。

測量高 IQ 所需的題目與常模

要區分 IQ 130 和 140,必須克服兩種天花板。

天花板需要甚麼不足時會發生甚麼
題目天花板即使在高能力受測者之間也能分出差異的題目高分受測者幾乎全部答對,無法觀察能力差異
常模天花板足以支撐高分範圍的數據和換算方法無法從同一答對題數穩定推算細微 IQ 差異
可左右滑動查看

即使整體樣本很大,處於分布兩端的人仍然很少。假設平均 100、標準差 15 的正態分布,2,000 人的樣本中,IQ 140 或以上大約只有 8 人。單靠這些數據,很難把 IQ 140、142、145 細緻分開。從 IQ 得分與人口比例可以看到,得分愈高,收集所需數據便愈困難。

在 WISC-V 標準常模的 2,200 人樣本中,任何一項合成分數達 150 或以上的兒童只有 16 人。因此,研究另外建立了高分範圍的延伸常模,並以 108 名高能力兒童的獨立樣本作驗證。即使是廣泛使用的測驗,高分範圍仍需要專門設計的題目和數據。

判斷測量品質所需的公開資料

查看公開資料時,重點不是宣傳字眼,而是每項主張是否有相應根據。

顯示的主張判斷所需的資料
IQ 100、最高 2%對象群體、樣本組成、收集年份、換算方法
綜合 IQ測量的能力、題目組成、得分結構
信度 .90係數種類、分析樣本、SEM、不同得分範圍的精確度
與既有測驗高度相關測驗名稱和版本、樣本、相關、平均差異
可測量 IQ 140 或以上高能力範圍的題目、高分受測者人數、外推或驗證方法
科學、準確哪項主張由甚麼方法和結果支持
可左右滑動查看

測驗不需要公開所有原始數據、計分演算法和實際題目。只要能確認對象、樣本、施測條件、換算方法、信度和誤差、主要效度結果,以及技術資料是否對應現行版本,使用者便可以評估相關主張。

相反,如果公開資料不足以作出上述判斷,即使測驗顯示 IQ 137 這類精細數字,也無法確認其意思和精確度。沒有公開根據的測驗,不應把它顯示的 IQ 視為精確數字。這是選擇測驗時最實用的判斷原則。

BrainTypeIQ 公開了九個分項的選擇理由及與五個範疇的對應,並說明如何從九個分項組成綜合 IQ 與五個範疇及如何換算和合成標準分數。日文版以符合條件的 841 名初次完成者建立常模,並公開綜合 IQ 的信度 .929 和約 4.0 分的 SEM。香港版本目前使用暫定計分,並持續累積本地數據。如果目的是正式評估或提交外部文件,應按 WAIS 與網上 IQ 測驗的用途分別作出選擇。

相關文章

測量 IQ 的意義›成人 IQ 測驗的選擇方法›可否在網上或免費接受 WAIS›BrainTypeIQ 的運作方式›BrainTypeIQ 的 9 個分項與 5 項認知能力›

測量 IQ 與各項認知能力的差異

約 30 分鐘、9 個分項的網上 IQ 測驗,可查看綜合 IQ 與腦型報告。

免費開始 IQ 測驗
← 文章列表