如果一项测试没有公开判断测量质量所需的依据,就不要把它给出的 IQ 当作精确数值。广告、搜索排名、制作精美的结果页面或 IQ 证书,都不是测量质量的证据。包括收费和订阅条件在内的选择方法,可以阅读如何选择可信的在线 IQ 测试。
决定 IQ 测试测量质量的4个要素
| 要素 | 需要确认什么 | 缺少时会发生什么 |
|---|---|---|
| 标准化 | 实施和计分条件是否一致 | 设备、时间或计分方式的差异会混入分数 |
| 常模 | 分数与谁的数据比较 | IQ 100或前2%的含义无法确定 |
| 信度 | 分数在多大程度上保持一致 | 偶然答对或答错就会让数值大幅变化 |
| 效度 | 分数能否按所标示的能力来解读 | 把图形推理的结果过度扩大为综合 IQ |
仅凭其中一个要素,无法判断 IQ 的测量质量。例如,即使信度很高,如果测量范围只有图形推理,它作为包含语言、记忆和加工速度的综合 IQ 仍然缺乏效度。
标准化与常模
标准化是指统一说明方式、时间限制、题目呈现、计分规则,以及超时和中断的处理方式。在线测试还需要考虑手机与电脑的显示差异、网络延迟、重复测试,以及搜索和记笔记的处理规则。如果能力相同的人仅仅因为使用的设备或测试次数不同,就得到明显不同的 IQ,分数就不具备可比性。
常模是 IQ 分数的比较对象。只要把原始分数转换成平均数100、标准差15,任何群体的数据都能产生一套 IQ 数值。但即使把网站访问者的平均数设为100,也不能代表一个人在一般成年人中的位置。
判断常模时,不能只看人数,还要看年龄、语言、地区、招募方式,如何处理重复测试、异常作答和中途退出,如何进行年龄校正,以及数据收集年份是否与当前题目和计分方式对应。
即使宣称“10万名测试者”,如果不说明是否包含同一人的重复测试、各年龄段分别有多少人、数据是什么时候收集的,也无法判断常模的质量。只把测试翻译成另一种语言,也不能直接沿用原语言版本的常模。日本测验学会的基本条款同样要求记录并公开常模群体、样本、标准化程序和统计信息。
信度、测量误差与置信区间
信度通常用 0 到 1 之间的系数表示,反映测验分数的一致性程度。考察所有题目整体一致性的信度,与考察不同日期再次测试时稳定性的重测信度,回答的是不同问题。不能只写“信度为 .90”,还需要说明信度的种类、使用了谁的数据,以及针对哪个分数计算。
根据信度可以计算个人分数的测量标准误(SEM)。在标准差为15的 IQ 量尺上,如果信度为 .90,SEM 约为4.7分。如果用 ±1.96 SEM 计算95%置信区间,IQ 130的区间约为121至139。信度 .90并不意味着分数可以精确到1分。
这里表示的是单次个人分数中包含的测量误差。常模样本的偏差,以及能否把图形推理称作综合 IQ 的效度问题,并不会因为置信区间较窄而得到解决。
效度与所测能力的范围
效度决定一个分数能否按照它所标示的能力来解读。需要确认题目内容是否覆盖该能力的范围,理论设定的分数结构是否得到数据支持,以及该分数是否按预期与已有智力测验或相关任务表现出相关性。
图形题或矩阵推理可以成为测量图形推理、流体推理的优质测试。不过,即使30道图形题的信度很高,也不等于测量了词汇、知识、工作记忆和加工速度。如果要显示为综合 IQ,就需要由多种能力构成的题目设计,以及把这些能力合成为综合分数的依据。
“与既有 IQ 测验的相关系数为 .70”也不表示70%准确。相关系数表示两个分数共同升降的程度。假如给所有人的原分数统一加10分,新分数与原分数的相关系数仍会是1,但每个人的数值都偏高10分。如果不看对照测验的名称和版本、样本、平均差异以及不同分数区间的差异,就无法判断两者能否作为同一种 IQ 来解读。
测量高 IQ 所需的题目与常模
要区分 IQ 130和140,必须跨过两种天花板。
| 天花板 | 需要具备什么 | 不足时会发生什么 |
|---|---|---|
| 题目天花板 | 能在高能力者之间拉开差异的题目 | 高分者几乎全部答对,无法观察能力差异 |
| 常模天花板 | 足以支撑高分区间的数据量和换算方法 | 无法根据相同的原始分数稳定估计细微的 IQ 差异 |
即使总样本很大,位于分布两端的人仍然很少。假设平均数为100、标准差为15的正态分布,一个2,000人的样本中,IQ 140以上的人约有8名。仅凭这些数据,很难细分 IQ 140、142和145。阅读IQ 分数与人群比例,可以理解分数越高,收集足够数据就越困难的原因。
在 WISC-V 的2,200人常模样本中,任一综合分数达到150以上的儿童只有16名。因此,WISC-V 建立了专门用于高分区间的扩展常模,并用另一组108名高能力儿童的样本进行了验证。即使是知名测验,高分区间也需要专门的题目设计和数据。
判断测量质量需要哪些公开信息
判断公开信息时,要看宣传用语背后的对应依据。
| 要判断什么 | 需要公开的信息 |
|---|---|
| 数值以谁为参照 | 目标群体、样本构成、收集年份、换算方法 |
| 数值测量了什么能力 | 题目构成、分数结构、验证效度的方法和结果 |
| 数值包含多大误差 | 实施条件、信度种类、SEM、高分区间的验证方法 |
测试不需要公开所有原始数据、计分算法和实际题目。只要能够了解目标群体、样本、实施条件、换算方法、信度和误差、效度的主要结果,以及技术信息与当前版本的对应关系,使用者就能评估这些主张。
相反,如果没有足以评估这些内容的信息,即使显示出 IQ 137这样的精细数字,也无法确认其含义和精度。没有公开依据的测试,其 IQ 不应被当作精确数值来相信。这就是实际选择时的结论。
BrainTypeIQ 公开的测量依据
BrainTypeIQ 公开了9项分测验的选择理由及其与5个领域的对应关系,并说明了如何用9项分测验构成综合 IQ 和5个领域。
我们还公开了标准分数的转换与合成方法、基于日语版841名首次完成者建立的常模,以及综合 IQ 的信度 .929与约4.0分的 SEM。如果目的是获得正式评估或对外提交的材料,应根据WAIS 与在线 IQ 测试的用途差异进行选择,而不是只比较在线测试的测量质量。