Якщо тест не публікує даних, потрібних для оцінювання якості, його результат IQ не слід сприймати як точне число. Реклама, висока позиція в пошуку, охайна сторінка результатів чи сертифікат IQ не підтверджують якість вимірювання. Як обирати тест з урахуванням ціни й умов оплати, пояснено у статті Як обрати надійний онлайн-тест на IQ.
Чотири складники якості вимірювання тесту на IQ
| Складник | Що перевіряти | Що стається, якщо його бракує |
|---|---|---|
| Стандартизація | Чи однакові умови проходження й оцінювання | На результат впливають відмінності пристрою, часу або способу оцінювання |
| Норми | З чиїми даними порівнюють результат | Незрозуміло, що означають IQ 100 чи належність до верхніх 2% |
| Надійність | Наскільки послідовним є результат | Випадкові правильні чи неправильні відповіді сильно змінюють число |
| Валідність | Чи можна тлумачити результат як заявлену здібність | Результат завдань на матричне мислення безпідставно поширюють на загальний IQ |
Жоден із цих чотирьох складників окремо не визначає якість вимірювання IQ. Наприклад, тест може мати високу надійність, але якщо він вимірює лише матричне мислення, його не можна вважати валідним показником загального IQ, що охоплює також мовні здібності, пам’ять і швидкість обробки.
Стандартизація й норми
Стандартизація означає однакові інструкції, обмеження часу, подання завдань, оцінювання та правила на випадок, коли відведений час сплив або тест перервано. В онлайн-тестуванні до умов отримання результату також належать відмінності відображення на смартфоні й комп’ютері, затримка з’єднання, повторне проходження, використання пошуку й нотаток. Якщо люди з однаковими здібностями отримують суттєво різний IQ лише через пристрій або кількість спроб, така шкала не дає коректного порівняння.
Норми визначають, з ким порівнюють результат IQ. Будь-які дані можна перетворити так, щоб середнє дорівнювало 100, а стандартне відхилення — 15. Але якщо за 100 узяти середній результат лише відвідувачів сайту, це не покаже положення людини серед дорослого населення загалом.
Для оцінювання норм важлива не лише кількість людей. Потрібно знати їхній вік, мову, регіон, спосіб залучення, правила врахування повторних спроб, неприродних відповідей і незавершених тестів, вікове коригування, рік збирання даних та відповідність цих даних поточним завданням і способу оцінювання.
Навіть фраза «100 000 учасників» нічого не говорить про якість норм, якщо невідомо, чи враховано повторні спроби тих самих людей, скільки було учасників кожного віку й коли зібрано дані. Так само не можна просто перекласти тест українською та застосувати до нього норми іншомовної версії. Щоб якість норм можна було оцінити, потрібно документувати й оприлюднювати нормативну групу, вибірку, процедуру стандартизації та статистичні відомості.
Надійність, похибка вимірювання й довірчий інтервал
Надійність — це коефіцієнт від 0 до 1, який показує, наскільки послідовну інформацію містить результат. Внутрішня узгодженість усіх завдань і ретестова надійність, що характеризує стабільність результату в інший день, відповідають на різні запитання. Тому недостатньо написати «надійність 0,90»: потрібно вказати її вид, дані учасників і показник, для якого її обчислено.
На основі надійності можна розрахувати стандартну похибку вимірювання (SEM) індивідуального результату. Для шкали IQ зі стандартним відхиленням 15 і надійністю 0,90 SEM становить приблизно 4,7 бала. Якщо 95-відсотковий довірчий інтервал обчислюють як ±1,96 SEM, діапазон для IQ 130 становитиме приблизно 121–139. Надійність 0,90 не означає точності до одного бала.
Цей діапазон відображає похибку одного індивідуального результату. Вузький довірчий інтервал не усуває упередженість нормативної вибірки й не відповідає на питання, чи можна називати результат матричного мислення загальним IQ.
Валідність і діапазон вимірюваних здібностей
Валідність визначає, чи можна тлумачити результат як показник заявленої здібності. Для цього перевіряють, чи охоплюють завдання потрібний діапазон здібності, чи підтверджується даними передбачена структура показників і чи пов’язані результати з усталеними тестами інтелекту та спорідненими завданнями у прогнозований спосіб.
Завдання з фігурами або матрицями можуть бути якісними тестами зорового чи гнучкого мислення. Але висока надійність 30 завдань із фігурами не означає, що тест виміряв словниковий запас, знання, робочу пам’ять і швидкість обробки. Щоб називати результат загальним IQ, потрібна сукупність завдань для кількох здібностей і підстава об’єднувати їх в один загальний показник.
Фраза «кореляція 0,70 з усталеним тестом IQ» також не означає «точність 70%». Кореляція показує, наскільки два результати зростають і знижуються разом. Якщо до результату кожної людини просто додати 10 балів, кореляція з початковим результатом дорівнюватиме 1, хоча кожне число буде завищене на 10 балів. Щоб вирішити, чи можна трактувати їх як той самий IQ, потрібно знати назву й версію порівнюваного тесту, характеристики вибірки, середню різницю та відмінності в різних діапазонах результатів.
Завдання й норми для вимірювання високого IQ
Щоб розрізнити IQ 130 та 140, тест має уникати ефекту стелі у двох місцях — у завданнях і нормах.
| Де виникає ефект стелі | Що потрібно | Що стається, якщо цього бракує |
|---|---|---|
| Стеля завдань | Завдання, що розрізняють людей із високими здібностями | Найсильніші учасники відповідають правильно майже на все, тому різницю між їхніми здібностями неможливо спостерігати |
| Стеля норм | Достатньо даних і належний спосіб перерахунку у верхньому діапазоні | За однаковою кількістю правильних відповідей неможливо стабільно оцінити точний IQ |
Навіть у великій загальній вибірці мало людей на краях розподілу. Якщо припустити нормальний розподіл із середнім 100 і стандартним відхиленням 15, серед 2 000 учасників буде приблизно 8 людей з IQ 140 або вище. Цього недостатньо, щоб точно розрізняти IQ 140, 142 та 145. Співвідношення результатів IQ і часток населення пояснює, чому зі зростанням результату потрібні для цього дані дедалі важче збирати.
У звичайній нормативній вибірці WISC-V із 2 200 дітей лише 16 мали хоча б один композитний показник 150 або вище. Тому для діапазону високих результатів створили розширені норми й додатково перевірили їх на окремій вибірці зі 108 дітей із високими здібностями. Навіть відомі тести потребують спеціально розроблених завдань і даних для верхнього діапазону.
Відкрита інформація, потрібна для оцінювання якості вимірювання
У відкритих матеріалах потрібно зіставити характеристики тесту й оприлюднені дані:
| Що потрібно визначити | Яка відкрита інформація потрібна |
|---|---|
| З ким порівнюють результат | Цільова група, склад вибірки, рік збирання даних, спосіб перерахунку |
| Яку здібність вимірює результат | Склад завдань, структура показників, методи й результати перевірки валідності |
| Яку похибку містить результат | Умови проведення, вид надійності, SEM, метод перевірки діапазону високих результатів |
Не обов’язково оприлюднювати всі сирі дані, алгоритм оцінювання й справжні завдання. Користувач може оцінити заявлені властивості тесту, якщо відомі цільова група, вибірка, умови проведення, спосіб перерахунку, надійність і похибка, основні результати перевірки валідності та відповідність технічної інформації поточній версії.
Якщо ж інформації для такої оцінки немає, неможливо перевірити значення й точність навіть настільки конкретного числа, як IQ 137. Не сприймайте IQ з тесту, який не публікує доказів якості, як точний результат. Це практичний висновок.
Які докази якості вимірювання публікує BrainTypeIQ
BrainTypeIQ пояснює, чому обрано саме дев’ять субтестів і як вони відповідають п’ятьом сферам, а також як із дев’яти субтестів формуються загальний IQ і п’ять сфер.
Також оприлюднено перерахунок у стандартизовані бали та спосіб формування композитних показників, норми японської версії, побудовані за даними першого завершеного проходження 841 учасника, а для загального IQ — надійність 0,929 і SEM приблизно 4,0 бала. Ці числа та аналіз стосуються японської версії. Для української версії поки застосовується попередня система оцінювання, створена на основі японської; збір даних української версії триває. Якщо вам потрібне офіційне оцінювання або результат для подання до установи, обирайте між варіантами за статтею Відмінності між WAIS та онлайн-тестами на IQ, а не лише за порівнянням якості онлайн-тестів.