Huwag ituring na eksaktong numero ang IQ mula sa test na hindi naglalathala ng ebidensiyang kailangan upang suriin ito. Hindi patunay ng measurement quality ang ads, mataas na search ranking, magandang result screen, o IQ certificate. Para sa pagpili na kasama ang presyo at subscription terms, tingnan ang paano pumili ng maaasahang online IQ test.
Apat na salik na tumutukoy sa measurement quality ng IQ test
| Salik | Dapat suriin | Kapag wala ito |
|---|---|---|
| Standardization | Pare-pareho ba ang mga kondisyon ng pagsusulit at scoring? | Nahahalo sa score ang pagkakaiba sa device, oras, o scoring method |
| Norm | Kaninong data inihahambing ang score? | Walang malinaw na kahulugan ang IQ 100 o top 2% |
| Reliability | Gaano ka-consistent ang score? | Malaki ang pagbabago ng numero dahil sa tsambang tama o maling sagot |
| Validity | Maaari bang bigyang-kahulugan ang score bilang kakayahang ipinapangalan dito? | Napapalawak ang resulta ng figure reasoning tungo sa pangkalahatang IQ nang walang sapat na batayan |
Hindi matutukoy ang measurement quality ng IQ mula sa isa lamang sa apat. Halimbawa, kahit mataas ang reliability, hindi valid bilang pangkalahatang IQ ang test na figure reasoning lamang ang saklaw dahil hindi nito sinusukat ang wika, memory, at processing speed.
Standardization at norm
Ang standardization ay pagpapanatiling pare-pareho ng instructions, time limit, tanong, scoring, at paghawak sa timeout o interruption. Sa online test, kasama rin sa mga kondisyon ng pagsusulit ang pagkakaiba ng display sa smartphone at PC, network delay, retake, at paggamit ng search o notes. Kung malaki ang ipinagbabago sa IQ ng isang taong pareho ang kakayahan dahil lamang sa device o dami ng pagkuha, hindi ito maihahambing na scale.
Ang norm ang comparison group ng IQ. Maaaring i-convert ang kahit anong raw-score distribution upang magkaroon ng mean na 100 at standard deviation na 15. Ngunit kung ang average ng mga bumisita lamang sa isang site ang gagawing 100, hindi nito awtomatikong ipinapakita ang posisyon sa pangkalahatang adult population.
Hindi lang dami ng tao ang dapat tingnan sa norm. Mahalaga rin ang edad, wika, rehiyon, recruitment method, paghawak sa retake, di-karaniwang pattern ng sagot at dropout, age adjustment, collection year, at pagkakatugma ng data sa kasalukuyang questions at scoring method.
Kahit sabihing “100,000 test takers,” hindi masusuri ang kalidad ng norm kung hindi malinaw kung kasama ang retakes ng iisang tao, ilan ang nasa bawat age group, at kailan kinuha ang data. Hindi rin puwedeng ilapat nang walang pagbabago ang norm ng ibang language version sa test na isinalin sa Filipino. Bilang isang konkretong halimbawa ng documentation standard, hinihingi rin ng basic clauses ng Japanese Association for Research on Testing ang pagtatala at paglalathala ng norm group, sample, standardization procedure, at statistical information.
Reliability, measurement error, at confidence interval
Ang reliability ay coefficient mula 0 hanggang 1 na nagpapakita kung gaano karaming consistent information ang nasa score. Magkaibang tanong ang sinasagot ng internal reliability, na tumitingin sa pagkakaugnay ng items, at test-retest reliability, na tumitingin sa stability kapag muling kinuha sa ibang araw. Hindi sapat ang linyang “reliability .90”; kailangang malinaw kung anong uri, kaninong data, at aling score ang kinalkula.
Mula sa reliability, makakalkula ang standard error of measurement o SEM ng individual score. Sa IQ scale na may standard deviation na 15, ang reliability na .90 ay may SEM na humigit-kumulang 4.7 points. Sa paraang gumagamit ng ±1.96 SEM para sa 95% confidence interval, ang IQ 130 ay nasa humigit-kumulang 121–139. Ang reliability na .90 ay hindi nangangahulugang eksakto ang score hanggang sa bawat isang point.
Measurement error sa isang individual score ang inilalarawan nito. Hindi naaayos ng makitid na confidence interval ang bias sa norm sample o ang tanong sa validity kung maaari bang bigyang-kahulugan bilang pangkalahatang IQ ang score mula sa figure reasoning lamang.
Validity at saklaw ng kakayahang sinusukat
Tinutukoy ng validity kung maaari bang bigyang-kahulugan ang score bilang kakayahang ipinapangalan dito. Sinusuri kung saklaw ng question content ang kakayahan, kung sinusuportahan ng data ang inaasahang score structure, at kung may inaasahang kaugnayan ito sa umiiral na intelligence tests at kaugnay na tasks.
Maaaring maging mahusay na test ng figure reasoning o fluid reasoning ang figure problems at matrix reasoning. Ngunit kahit magkaroon ng mataas na reliability ang 30 figure problems, hindi ibig sabihin na nasukat na rin ang vocabulary, knowledge, working memory, at processing speed. Para magpakita ng pangkalahatang IQ, kailangan ng question design na sumusukat ng maraming kakayahan at ebidensiyang puwedeng pagsamahin ang mga ito sa isang composite score.
Ang “correlation .70 sa isang umiiral na IQ test” ay hindi nangangahulugang 70% accurate. Ipinapakita ng correlation kung gaano kasabay tumataas at bumababa ang dalawang score. Kung magdadagdag ng 10 points sa score ng bawat tao, magiging 1 pa rin ang correlation sa orihinal na score kahit 10 points nang mali ang lahat ng numero. Kailangang tingnan ang pangalan at version ng comparison test, sample, average difference, at pagkakaiba sa bawat score range bago ituring ang dalawa bilang magkaparehong IQ.
Questions at norm para sukatin ang mataas na IQ
Upang pag-ibahin ang IQ 130 at 140, kailangang malampasan ang dalawang ceiling.
| Ceiling | Kailangan | Kapag kulang |
|---|---|---|
| Question ceiling | Questions na nakapaghihiwalay kahit sa mga taong may mataas na kakayahan | Halos lahat ng may mataas na kakayahan ay nakasasagot nang tama sa lahat, kaya hindi makikita ang pagkakaiba nila |
| Norm ceiling | Sapat na data at conversion method para sa high-score range | Hindi matatag ang pagtatantiya ng maliliit na IQ differences mula sa parehong raw score |
Kahit marami ang kabuuang sample, kakaunti ang nasa dulo ng distribution. Kung ipagpapalagay ang normal distribution na may mean na 100 at standard deviation na 15, humigit-kumulang 8 lamang sa sample na 2,000 ang may IQ 140 pataas. Hindi makatuwirang hatiin nang pino ang IQ 140, 142, at 145 mula rito lamang. Ipinapakita ng IQ score at population share kung bakit mas mahirap mangalap ng sapat na data habang tumataas ang score.
Sa regular norm sample ng WISC-V na 2,200 bata, 16 lamang ang may alinmang composite score na 150 pataas. Dahil dito, gumawa ng extended norms para sa high-score range at sinuri rin ito sa hiwalay na sample ng 108 batang may mataas na kakayahan. Kahit sa kilalang test, kailangan ng espesyal na question design at data para sa upper range.
Public information na kailangan upang suriin ang measurement quality
Sa public information, tingnan ang ugnayan ng claim at ebidensiya, hindi ang marketing language.
| Dapat malaman | Kailangang public information |
|---|---|
| Kaninong population inihahambing ang numero | Target population, sample composition, collection year, at conversion method |
| Anong kakayahan ang sinusukat ng numero | Question design, score structure, at paraan at resulta ng validity testing |
| Gaano kalaki ang error ng numero | Mga kondisyon ng pagsusulit, uri ng reliability, SEM, at validation method sa high-score range |
Hindi kailangang ilathala ang lahat ng raw data, scoring algorithm, o aktuwal na questions. Sapat nang malinaw ang target population, sample, mga kondisyon ng pagsusulit, conversion method, reliability at error, pangunahing validity results, at pagkakatugma ng technical information sa kasalukuyang version upang masuri ng user ang claim.
Kung walang impormasyong sapat upang suriin ang mga ito, hindi matitiyak ang kahulugan o precision kahit magpakita ang site ng detalyadong numerong gaya ng IQ 137. Huwag ituring na eksaktong numero ang IQ ng test na hindi naglalathala ng measurement basis. Ito ang praktikal na konklusyon.
Measurement basis na inilalathala ng BrainTypeIQ
Ipinapakita ng BrainTypeIQ ang dahilan sa pagpili ng 9 na subtest at pag-uugnay ng mga ito sa 5 cognitive area, at ipinapaliwanag kung paano binubuo ang pangkalahatang IQ at 5 cognitive area mula sa 9 na subtest. Inilalathala rin nito ang conversion sa standardized scores at paraan ng pagbuo ng composite scores.
Para sa Japanese version, ginawa ang norm mula sa 841 unang kumumpleto na tumugon sa pare-parehong analysis conditions. Sa parehong 841 tao, nakumpirma ang model-based reliability na .929 at SEM na humigit-kumulang 4.0 points para sa pangkalahatang IQ. Ang Filipino version ay kasalukuyang gumagamit ng provisional scoring na iniangkop mula sa Japanese version, at patuloy na nangongolekta ng data.
Kung ang layunin ay pormal na assessment o pagsusumite ng resulta sa ibang institusyon, gamitin ang pagkakaiba ng papel ng WAIS at online IQ test upang pumili ng test na isinasagawa ng qualified professional sa halip na ihambing lamang ang mga online IQ test.