BrainTypeIQ
IQ 测试脑类型报告资源
文章·2026-09-21

什么决定 IQ 测试的测量质量

IQ 测试的质量不取决于是否显示平均数100,而取决于标准化、用于比较的常模、结果的信度,以及能否测到目标能力的效度。公开信息还应说明测量误差和高分区间的精度。

目录
  1. 01决定 IQ 测试测量质量的4个要素
  2. 02标准化与常模
  3. 03信度、测量误差与置信区间
  4. 04效度与所测能力的范围
  5. 05测量高 IQ 所需的题目与常模
  6. 06判断测量质量需要哪些公开信息
  7. 07BrainTypeIQ 公开的测量依据
  8. 08使用 BrainTypeIQ 测量 IQ,了解认知能力差异

如果一项测试没有公开判断测量质量所需的依据,就不要把它给出的 IQ 当作精确数值。广告、搜索排名、制作精美的结果页面或 IQ 证书,都不是测量质量的证据。包括收费和订阅条件在内的选择方法,可以阅读如何选择可信的在线 IQ 测试。

决定 IQ 测试测量质量的4个要素

要素需要确认什么缺少时会发生什么
标准化实施和计分条件是否一致设备、时间或计分方式的差异会混入分数
常模分数与谁的数据比较IQ 100或前2%的含义无法确定
信度分数在多大程度上保持一致偶然答对或答错就会让数值大幅变化
效度分数能否按所标示的能力来解读把图形推理的结果过度扩大为综合 IQ
可左右滑动查看表格

仅凭其中一个要素,无法判断 IQ 的测量质量。例如,即使信度很高,如果测量范围只有图形推理,它作为包含语言、记忆和加工速度的综合 IQ 仍然缺乏效度。

标准化与常模

标准化是指统一说明方式、时间限制、题目呈现、计分规则,以及超时和中断的处理方式。在线测试还需要考虑手机与电脑的显示差异、网络延迟、重复测试,以及搜索和记笔记的处理规则。如果能力相同的人仅仅因为使用的设备或测试次数不同,就得到明显不同的 IQ,分数就不具备可比性。

常模是 IQ 分数的比较对象。只要把原始分数转换成平均数100、标准差15,任何群体的数据都能产生一套 IQ 数值。但即使把网站访问者的平均数设为100,也不能代表一个人在一般成年人中的位置。

判断常模时,不能只看人数,还要看年龄、语言、地区、招募方式,如何处理重复测试、异常作答和中途退出,如何进行年龄校正,以及数据收集年份是否与当前题目和计分方式对应。

即使宣称“10万名测试者”,如果不说明是否包含同一人的重复测试、各年龄段分别有多少人、数据是什么时候收集的,也无法判断常模的质量。只把测试翻译成另一种语言,也不能直接沿用原语言版本的常模。日本测验学会的基本条款同样要求记录并公开常模群体、样本、标准化程序和统计信息。

信度、测量误差与置信区间

信度通常用 0 到 1 之间的系数表示,反映测验分数的一致性程度。考察所有题目整体一致性的信度,与考察不同日期再次测试时稳定性的重测信度,回答的是不同问题。不能只写“信度为 .90”,还需要说明信度的种类、使用了谁的数据,以及针对哪个分数计算。

根据信度可以计算个人分数的测量标准误(SEM)。在标准差为15的 IQ 量尺上,如果信度为 .90,SEM 约为4.7分。如果用 ±1.96 SEM 计算95%置信区间,IQ 130的区间约为121至139。信度 .90并不意味着分数可以精确到1分。

这里表示的是单次个人分数中包含的测量误差。常模样本的偏差,以及能否把图形推理称作综合 IQ 的效度问题,并不会因为置信区间较窄而得到解决。

效度与所测能力的范围

效度决定一个分数能否按照它所标示的能力来解读。需要确认题目内容是否覆盖该能力的范围,理论设定的分数结构是否得到数据支持,以及该分数是否按预期与已有智力测验或相关任务表现出相关性。

图形题或矩阵推理可以成为测量图形推理、流体推理的优质测试。不过,即使30道图形题的信度很高,也不等于测量了词汇、知识、工作记忆和加工速度。如果要显示为综合 IQ,就需要由多种能力构成的题目设计,以及把这些能力合成为综合分数的依据。

“与既有 IQ 测验的相关系数为 .70”也不表示70%准确。相关系数表示两个分数共同升降的程度。假如给所有人的原分数统一加10分,新分数与原分数的相关系数仍会是1,但每个人的数值都偏高10分。如果不看对照测验的名称和版本、样本、平均差异以及不同分数区间的差异,就无法判断两者能否作为同一种 IQ 来解读。

测量高 IQ 所需的题目与常模

要区分 IQ 130和140,必须跨过两种天花板。

天花板需要具备什么不足时会发生什么
题目天花板能在高能力者之间拉开差异的题目高分者几乎全部答对,无法观察能力差异
常模天花板足以支撑高分区间的数据量和换算方法无法根据相同的原始分数稳定估计细微的 IQ 差异
可左右滑动查看表格

即使总样本很大,位于分布两端的人仍然很少。假设平均数为100、标准差为15的正态分布,一个2,000人的样本中,IQ 140以上的人约有8名。仅凭这些数据,很难细分 IQ 140、142和145。阅读IQ 分数与人群比例,可以理解分数越高,收集足够数据就越困难的原因。

在 WISC-V 的2,200人常模样本中,任一综合分数达到150以上的儿童只有16名。因此,WISC-V 建立了专门用于高分区间的扩展常模,并用另一组108名高能力儿童的样本进行了验证。即使是知名测验,高分区间也需要专门的题目设计和数据。

判断测量质量需要哪些公开信息

判断公开信息时,要看宣传用语背后的对应依据。

要判断什么需要公开的信息
数值以谁为参照目标群体、样本构成、收集年份、换算方法
数值测量了什么能力题目构成、分数结构、验证效度的方法和结果
数值包含多大误差实施条件、信度种类、SEM、高分区间的验证方法
可左右滑动查看表格

测试不需要公开所有原始数据、计分算法和实际题目。只要能够了解目标群体、样本、实施条件、换算方法、信度和误差、效度的主要结果,以及技术信息与当前版本的对应关系,使用者就能评估这些主张。

相反,如果没有足以评估这些内容的信息,即使显示出 IQ 137这样的精细数字,也无法确认其含义和精度。没有公开依据的测试,其 IQ 不应被当作精确数值来相信。这就是实际选择时的结论。

BrainTypeIQ 公开的测量依据

BrainTypeIQ 公开了9项分测验的选择理由及其与5个领域的对应关系,并说明了如何用9项分测验构成综合 IQ 和5个领域。

我们还公开了标准分数的转换与合成方法、基于日语版841名首次完成者建立的常模,以及综合 IQ 的信度 .929与约4.0分的 SEM。如果目的是获得正式评估或对外提交的材料,应根据WAIS 与在线 IQ 测试的用途差异进行选择,而不是只比较在线测试的测量质量。

相关文章

测量 IQ 的意义›成人注意缺陷多动障碍、孤独症谱系障碍与智力测验›WAIS能在线免费做吗?›

测量 IQ 与认知能力差异

通过包含 9 个分测验、约需 30 分钟的在线 IQ 测试,可查看综合 IQ 与脑类型报告。

开始 IQ 测试
← 文章列表