Не считайте IQ точным числом, если тест не публикует данные, необходимые для оценки его качества. Реклама, высокое место в поиске, аккуратный экран результатов и сертификат IQ ничего не говорят о качестве измерения. Как оценить тест с учётом цены и условий оплаты, рассказано в статье «Как выбрать надёжный онлайн-тест на IQ».
Четыре составляющие качества теста на IQ
| Составляющая | Что нужно проверить | Что происходит без неё |
|---|---|---|
| Стандартизация | Одинаковы ли условия проведения и подсчёта баллов | На результат влияют устройство, время и способ подсчёта |
| Нормы | С чьими данными сравнивается результат | Значения IQ 100 и верхних 2% остаются неопределёнными |
| Надёжность | Насколько последователен результат | Случайные правильные и неправильные ответы сильно меняют число |
| Валидность | Можно ли интерпретировать результат как заявленную способность | Результат по фигурам необоснованно распространяют на общий IQ |
Качество теста на IQ нельзя определить только по одной из этих составляющих. Например, даже при высокой надёжности тест, состоящий лишь из задач на фигуры, не будет валидной оценкой общего IQ, включающей вербальные способности, память и скорость обработки информации.
Стандартизация и нормы
Стандартизация означает одинаковые инструкции, ограничения времени, задания, подсчёт баллов и правила для случаев, когда время истекло или тест был прерван. В онлайн-тесте к условиям относятся также различия отображения на смартфоне и компьютере, задержка соединения, повторное прохождение, использование поиска и заметок. Если люди с одинаковыми способностями получают существенно разный IQ только из-за устройства или количества попыток, результаты нельзя сравнивать на общей шкале.
Нормы определяют, с кем сравнивается результат IQ. Любые исходные баллы можно преобразовать в шкалу со средним 100 и стандартным отклонением 15. Но если средним 100 сделать результат только посетителей сайта, это не покажет положение человека среди взрослого населения России.
В нормативных данных важен не только объём выборки. Нужно знать возраст, язык, регион и способ набора участников, правила учёта повторных прохождений, аномальных или недостоверных схем ответов и незавершённых тестов, возрастную корректировку, год сбора данных и соответствие между выборкой, действующими заданиями и способом подсчёта.
Даже формулировка «100 000 участников» не позволяет судить о качестве норм, если неизвестно, входят ли в это число повторные попытки одних и тех же людей, сколько участников было в каждой возрастной группе и когда собирались данные. Нельзя также просто перевести тест на русский язык и применить к нему нормы версии на другом языке. В основных положениях Японского общества тестирования также требуется документировать и раскрывать нормативную совокупность, выборку, процедуру стандартизации и статистические сведения.
Надёжность, погрешность измерения и доверительный интервал
Надёжность выражается коэффициентом от 0 до 1 и показывает, насколько согласованны и воспроизводимы результаты теста. Внутренняя согласованность заданий и стабильность результата при повторном тестировании в другой день отвечают на разные вопросы. Поэтому недостаточно написать «надёжность 0,90»: нужно указать её вид, выборку и показатель, для которого она рассчитана.
По надёжности можно рассчитать стандартную ошибку измерения (SEM) индивидуального результата. При надёжности 0,90 на шкале IQ со стандартным отклонением 15 SEM составляет около 4,7 балла. Если 95-процентный доверительный интервал рассчитывается как ±1,96 SEM, диапазон для IQ 130 составит примерно 121–139. Надёжность 0,90 не означает точность до одного балла.
Этот интервал описывает погрешность одного индивидуального результата. Узкий доверительный интервал не устраняет смещение нормативной выборки и не решает вопрос валидности — например, можно ли называть результат по матрицам общим IQ.
Валидность и диапазон измеряемых способностей
Валидность определяет, можно ли интерпретировать балл как заявленную способность. Для этого проверяют, охватывают ли задания нужный диапазон способности, подтверждается ли предполагаемая структура результатов данными и связаны ли баллы с существующими тестами интеллекта и смежными задачами ожидаемым образом.
Задачи на фигуры и матрицы могут составлять качественный тест зрительного или гибкого мышления. Но даже высокая надёжность 30 задач на фигуры не означает, что тест измерил словарный запас, знания, рабочую память и скорость обработки информации. Чтобы показывать общий IQ, тест должен включать задания на несколько способностей и иметь основания для объединения их результатов в общий балл.
Фраза «корреляция с существующим тестом на IQ — 0,70» также не означает точность 70%. Корреляция показывает, насколько два результата повышаются и снижаются вместе. Если взять исходные баллы и прибавить к каждому 10, корреляция новых баллов с исходными будет равна 1, хотя все числовые значения окажутся выше на 10. Чтобы понять, можно ли считать шкалы одинаковыми, нужно знать название и версию теста для сравнения, состав выборки, среднюю разницу и различия в разных диапазонах баллов.
Для измерения высокого IQ нужны подходящие задания и нормы
Чтобы различать IQ 130 и 140, тест должен преодолеть два потолка.
| Потолок | Что необходимо | Что происходит при недостатке |
|---|---|---|
| Потолок заданий | Задания, различающие людей с высокими способностями | Участники верхнего диапазона отвечают почти на всё верно, и различия между ними не наблюдаются |
| Потолок норм | Достаточно данных и подходящий способ пересчёта для высоких результатов | По одному исходному баллу нельзя стабильно оценить точное значение IQ |
Даже в большой выборке мало людей находится на краях распределения. Если принять нормальное распределение со средним 100 и стандартным отклонением 15, среди 2 000 участников будет около 8 человек с IQ 140 и выше. По этим данным нельзя уверенно различать IQ 140, 142 и 145. Таблица соотношения IQ и доли населения показывает, почему для высоких результатов особенно трудно собрать достаточное количество данных.
В обычную нормативную выборку WISC-V из 2 200 человек вошли 16 детей, у которых хотя бы один составной показатель был не ниже 150. Поэтому для высоких баллов создали расширенные нормы и дополнительно проверили их на отдельной выборке из 108 одарённых детей. Даже известным тестам необходимы специальные задания и данные для верхней области шкалы.
Какие открытые данные нужны для оценки качества
В опубликованных материалах нужно искать не рекламные формулировки, а соответствие между заявлением и доказательствами.
| Что оценивается | Какие данные должны быть открыты |
|---|---|
| С кем сравнивается результат | Целевая группа, состав выборки, год сбора данных и способ пересчёта |
| Какая способность измеряется | Состав заданий, структура показателей, метод и результаты проверки валидности |
| Какова погрешность результата | Условия проведения, вид надёжности, SEM и способ проверки высоких баллов |
Необязательно раскрывать все исходные данные, алгоритм подсчёта и реальные задания. Пользователь может оценить заявленные свойства, если известны целевая группа, выборка, условия проведения, способ пересчёта, надёжность и погрешность, основные результаты проверки валидности и соответствие технических данных действующей версии.
Если этой информации нет, значение и точность результата вроде IQ 137 нельзя проверить. Не считайте IQ точным числом, если тест не раскрывает измерительные основания. Это главный практический вывод.
Какие измерительные основания публикует BrainTypeIQ
BrainTypeIQ объясняет, почему выбраны девять субтестов и как они соотносятся с пятью областями, а также как из девяти субтестов строятся общий IQ и пять областей.
Измерительные основания BrainTypeIQ включают преобразование в стандартные баллы и способ их объединения, нормирование японской версии на данных 841 человека, впервые завершивших тест, а также надёжность общего IQ 0,929 и SEM около 4,0 балла. Сейчас баллы теста на русском языке рассчитываются по предварительной схеме на основе данных японской версии; собственная нормативная база ещё формируется. Если нужен официальный результат для диагностики или предъявления в организацию, пройдите тест Векслера у специалиста. Различия в назначении теста Векслера и онлайн-теста на IQ помогут выбрать подходящий вариант.