Karar vermek için gereken kanıtları yayımlanmayan bir testin IQ sonucuna hassas bir sayıymış gibi güvenmeyin. Reklam, arama sırası, şık bir sonuç ekranı veya IQ sertifikası ölçüm kalitesinin kanıtı değildir. Ücret ve sözleşme koşullarını da kapsayan seçim ölçütleri güvenilir online IQ testi sayfasında açıklanır.
IQ testinin ölçüm kalitesini belirleyen 4 unsur
| Unsur | Kontrol edilecek nokta | Eksikliğinde ne olur? |
|---|---|---|
| Standardizasyon | Uygulama ve puanlama koşulları aynı mı? | Cihaz, süre veya puanlama farkı sonuca karışır |
| Norm | Sonuç kimin verisiyle karşılaştırılıyor? | IQ 100’ün veya üst %2’nin anlamı belirlenemez |
| Güvenirlik | Puan ne ölçüde tutarlı? | Rastlantısal doğru ve yanlışlar sayıyı fazla oynatır |
| Geçerlik | Puan, adı verilen yetenek olarak okunabilir mi? | Şekil akıl yürütme sonucu genel IQ’ya gereğinden fazla genişletilir |
Bu dört unsurdan yalnızca biri, ölçüm kalitesini belirlemeye yetmez. Örneğin bir test çok güvenilir olabilir; ancak yalnızca şekil akıl yürütmesini ölçüyorsa sözel yetenek, bellek ve işlemleme hızını kapsayan genel IQ sonucu olarak geçerli değildir.
Standardizasyon ve norm
Standardizasyon; yönerge, süre sınırı, soru sunumu, puanlama, süre aşımı ve kesintilerin aynı biçimde ele alınmasıdır. Online uygulamada telefonla bilgisayar arasındaki görüntü farkı, bağlantı gecikmesi, tekrar test, arama yapma ve not kullanma da koşulların parçasıdır. Aynı yetenekteki kişiler yalnızca cihaz veya deneme sayısı yüzünden çok farklı IQ alıyorsa sonuç karşılaştırılabilir bir ölçek değildir.
Norm, IQ puanının karşılaştırıldığı gruptur. Doğru sayısını ortalaması 100, standart sapması 15 olan bir ölçeğe dönüştürmek her veri grubu için mümkündür. Ancak yalnızca bir siteyi ziyaret edenlerin ortalamasını 100 yapmak, genel yetişkin nüfusu içindeki konumu göstermez.
Norm değerlendirilirken kişi sayısının yanında yaş, dil, bölge, katılımcıların nasıl toplandığı, tekrar testlerin, olağandışı yanıtların ve yarım bırakmaların nasıl işlendiği, yaş düzeltmesi ile verinin mevcut soru ve puanlama sürümüne ait olup olmadığı da incelenir.
“100 bin katılımcı” denmesi tek başına yeterli değildir. Aynı kişilerin tekrarları, yaş dağılımı ve verinin toplandığı dönem bilinmiyorsa normun kalitesi değerlendirilemez. Başka bir dilin normunu yalnızca metni Türkçeye çevirerek kullanmak da doğru değildir. Türk Psikologlar Derneğinin Etik Yönetmeliği, değerlendirme araçlarının amacına, normuna, geçerlik ve güvenirliğine, uygulama koşullarına uygun kullanılmasını gerektirir.
Güvenirlik, ölçme hatası ve güven aralığı
Güvenirlik, bir puanın ne ölçüde tutarlı bilgi içerdiğini 0 ile 1 arasında bir katsayıyla gösterir. Maddelerin aynı yapıda ne ölçüde birleştiğini gösteren iç tutarlılıkla, farklı günlerdeki kararlılığı gösteren test-tekrar test güvenirliği farklı sorulara cevap verir. “Güvenirlik 0,90” ifadesi; hangi türün, hangi kişilerde ve hangi puan için hesaplandığı belirtilmeden yeterli değildir.
Güvenirlikten bireysel puandaki ölçmenin standart hatası (SEM) hesaplanabilir. Standart sapması 15 olan IQ ölçeğinde güvenirlik 0,90 ise SEM yaklaşık 4,7 puandır. %95 güven aralığını ±1,96 SEM ile hesaplayan yöntemde IQ 130’un aralığı yaklaşık 121–139 olur. 0,90 güvenirlik, puanın 1 puan hassasiyetinde kesin olduğu anlamına gelmez.
Bu hata, tek bir kişinin tek uygulamadaki puanında bulunan ölçme hatasıdır. Norm örnekleminin yanlı olması veya yalnızca şekil akıl yürütmesini genel IQ olarak adlandırma sorunu, dar bir güven aralığıyla çözülmez.
Geçerlik ve ölçülen yeteneklerin kapsamı
Geçerlik, puanın adı verilen yetenek olarak okunup okunamayacağını belirler. Soruların yeteneğin kapsamını temsil edip etmediği, öngörülen puan yapısının veride doğrulanıp doğrulanmadığı ve mevcut zekâ testleri ve ilişkili görevlerle beklenen düzeyde bağlantı gösterip göstermediği incelenir.
Şekil ve matris soruları, şekil akıl yürütmesi veya akıcı akıl yürütme için nitelikli bir test oluşturabilir. Fakat 30 şekil sorusunda yüksek güvenirlik elde etmek; sözcük bilgisi, genel bilgi, çalışma belleği veya işlemleme hızının ölçüldüğü anlamına gelmez. Genel IQ gösterilecekse birden fazla yeteneği kapsayan görevler ve bunların tek bir bileşik puanda birleştirilebildiğini gösteren kanıt gerekir.
“Mevcut bir IQ testiyle korelasyon 0,70” ifadesi de “%70 doğru” demek değildir. Korelasyon, iki puanın birlikte yükselip düşme derecesidir. Herkese aynı şekilde 10 puan eklenen bir sonuç, asıl sonuçla 1,00’lık bir korelasyon gösterir; buna rağmen herkesin puanı 10 puan yanlıştır. Aynı IQ ölçeği olarak kabul edilebilmesi için karşılaştırılan test ve sürüm, örneklem, ortalama farkı ve farklı puan aralıklarındaki sonuçlar görülmelidir.
Yüksek IQ’yu ölçmek için hem zor sorular hem yeterli norm verisi gerekir
IQ 130 ile 140’ı ayırmak için iki ayrı tavan aşılmalıdır.
| Tavan | Gereken şey | Eksikliğinde ne olur? |
|---|---|---|
| Soru tavanı | Yüksek yetenek düzeyinde de fark yaratabilen sorular | Üst gruptakiler neredeyse tüm soruları doğru yapar, aralarındaki fark görülemez |
| Norm tavanı | Yüksek puan bölgesini destekleyen yeterli veri ve dönüşüm yöntemi | Aynı doğru sayısından ince IQ farkları kararlı biçimde tahmin edilemez |
Örneklemin tamamı büyük olsa bile dağılımın ucundaki kişi sayısı azdır. Ortalama 100 ve standart sapma 15 olan normal dağılım varsayımında 2.000 kişilik örneklemde IQ 140 ve üzerinde yalnızca yaklaşık 8 kişi bulunur. Bu veriyle 140, 142 ve 145’i güvenilir biçimde ayırmak gerçekçi değildir. IQ puanı ile nüfus oranı, puan yükseldikçe yeterli veri toplamanın neden zorlaştığını gösterir.
WISC-V’nin 2.200 kişilik standart norm örnekleminde herhangi bir bileşik puanı 150 veya üzerinde olan yalnızca 16 çocuk vardı. Bu nedenle yüksek puan bölgesi için genişletilmiş normlar oluşturulmuş ve ayrıca 108 yüksek yetenekli çocukla sınanmıştır. Köklü testlerde bile üst uç için özel soru tasarımı ve veri gerekir.
Ölçüm kalitesini değerlendirmek için yayımlanması gereken bilgiler
Tanıtım cümleleri yerine şu eşleşmeleri arayın.
| Değerlendirilen konu | Gereken kamuya açık bilgi |
|---|---|
| Puan kime göre hesaplanıyor? | Hedef nüfus, örneklem yapısı, veri yılı, dönüştürme yöntemi |
| Puan hangi yeteneği ölçüyor? | Görev kapsamı, puan yapısı, geçerliğin nasıl sınandığı ve sonuçları |
| Puan ne kadar hata içeriyor? | Uygulama koşulları, güvenirlik türü, SEM, yüksek puanların doğrulanma yöntemi |
Ham verinin, puanlama algoritmasının ve gerçek soruların tamamının yayımlanması gerekmez. Hedef grup, örneklem, uygulama koşulları, dönüşüm yöntemi, güvenirlik ve hata, başlıca geçerlik sonuçları ve teknik bilginin güncel sürümle ilişkisi açıklanırsa kullanıcı iddiaları değerlendirebilir.
Bunları değerlendirecek bilgi yoksa ekranda IQ 137 gibi ayrıntılı bir sayı görünse bile anlamı ve hassasiyeti doğrulanamaz. Kanıtlarını yayımlamayan bir testin IQ sonucuna hassas bir sayı gibi güvenmeyin. Uygulanabilir sonuç budur.
BrainTypeIQ’nun yayımladığı ölçüm kanıtları
BrainTypeIQ, 9 görevin neden seçildiğini ve 5 alanla ilişkisini, 9 görevden genel IQ ve 5 alanın nasıl oluşturulduğunu ve standart görev puanlarından bileşik puanların nasıl hesaplandığını açıklar.
Japonca sürümün normu, aynı analiz koşullarında her katılımcının ilk tamamlamasından elde edilen 841 kişilik veriyle oluşturulmuştur; genel IQ’nun model temelli güvenirliği 0,929, SEM’i yaklaşık 4,0 puandır. Türkçe sürüm, Japonca sürüm temelinde uyarlanmış geçici puanlamayla çalışır ve kendi karşılaştırma verisini toplamaktadır.
Resmî değerlendirme veya dışarıya sunulacak rapor gerekiyorsa yalnızca online testlerin kalitesini karşılaştırmak yerine WAIS ile online IQ testinin farklı rollerinden yola çıkın.