אל תסמכו על ציון IQ כעל מספר מדויק אם המבחן אינו מפרסם את הראיות הדרושות להערכתו. פרסום, מיקום בתוצאות החיפוש, מסך תוצאות מעוצב ותעודת IQ אינם ראיות לאיכות המדידה. לבחירת מבחן, כולל המחיר ותנאי ההתקשרות, ראו איך לבחור מבחן IQ מקוון אמין.
ארבעת הגורמים שקובעים את איכות המדידה של מבחן IQ
| גורם | מה בודקים | מה קורה כשהוא חסר |
|---|---|---|
| סטנדרטיזציה | האם תנאי ההעברה והניקוד אחידים | הבדלים במכשיר, בזמן או בשיטת הניקוד משפיעים על הציון |
| נורמות | לנתונים של מי משווים | אין משמעות מוגדרת ל־IQ 100 או ל־2% העליונים |
| מהימנות | עד כמה הציונים עקביים | תשובות נכונות או שגויות מקריות משנות מאוד את המספר |
| תוקף | האם אפשר לפרש את הציון כיכולת שמוצגת | תוצאה של הסקה צורנית מורחבת יתר על המידה ל־IQ כולל |
אי אפשר להעריך את איכות המדידה של IQ לפי גורם אחד בלבד. למשל, גם אם המהימנות גבוהה, מבחן שמודד רק הסקה צורנית אינו תקף כמדד IQ כולל שאמור לכלול גם שפה, זיכרון ומהירות עיבוד.
סטנדרטיזציה ונורמות
סטנדרטיזציה פירושה אחידות בהוראות, במגבלות הזמן, בהצגת השאלות, בניקוד ובטיפול בתום הזמן או בהפסקת המבחן. במבחן מקוון, תנאי המדידה כוללים גם הבדלי תצוגה בין טלפון למחשב, עיכובים בתקשורת, היבחנות חוזרת וכללים בנוגע לחיפוש מידע ולרישום הערות. אם אנשים בעלי אותה יכולת מקבלים ציוני IQ שונים מאוד רק בגלל המכשיר שבו השתמשו או מספר הפעמים שנבחנו, הציונים אינם מאפשרים השוואה תקפה.
הנורמות מגדירות למי משווים את ציון ה־IQ. אפשר להמיר את מספר התשובות הנכונות לממוצע 100 ולסטיית תקן 15 על סמך נתונים של כל קבוצה. למשל, אם רוצים להשוות לאוכלוסיית המבוגרים הכללית ביפן, קביעת 100 כממוצע המבקרים באתר בלבד אינה מספקת השוואה כזו.
בהערכת נורמות בודקים לא רק את מספר המשתתפים, אלא גם את גילם, שפתם, אזור מגוריהם ושיטת הגיוס; את הטיפול בהיבחנות חוזרת, בתשובות חריגות ובנשירה באמצע; את תיקון הגיל; ואת שנת האיסוף וההתאמה בין הנתונים לשאלות ולשיטת הניקוד הנוכחיות.
גם ״100 אלף נבחנים״ אינם מספיקים להערכת איכות הנורמות אם לא ברור האם המספר כולל היבחנויות חוזרות של אותם אנשים, כמה נבחנים יש בכל גיל ומתי נאספו הנתונים. אותו עיקרון חל על התאמה לשפה: אי אפשר, למשל, לתרגם מבחן ליפנית ולהחיל עליו ללא שינוי את הנורמות של הגרסה בשפה אחרת. עקרונות היסוד של האגודה היפנית לחקר מבחנים דורשים אף הם לתעד ולפרסם את קבוצת הייחוס, המדגם, הליכי הסטנדרטיזציה והמידע הסטטיסטי.
מהימנות, טעות מדידה ורווח סמך
מהימנות מבטאת, במקדם שבין 0 ל־1, עד כמה הציון מכיל מידע עקבי. מהימנות שבוחנת את העקביות בין פריטי המבחן ומהימנות מבחן חוזר, שבוחנת את יציבות הציון ביום אחר, עונות על שאלות שונות. לכן לא די לכתוב ״מהימנות .90״: צריך לדעת באיזה סוג מהימנות מדובר, על סמך נתונים של מי היא חושבה ולאיזה ציון היא מתייחסת.
מתוך המהימנות אפשר לחשב את טעות התקן של המדידה (SEM) בציון אישי. בסולם IQ שסטיית התקן שלו 15 ומהימנותו .90, ה־SEM הוא כ־4.7 נקודות. בחישוב רווח סמך של 95% לפי ±1.96SEM, ציון IQ 130 מקבל טווח של כ־121–139. מהימנות .90 אינה אומרת שהציון מדויק ברמת הנקודה הבודדת.
הטווח הזה מבטא את טעות המדידה בציון האישי שהתקבל במבחן אחד. רווח סמך צר אינו פותר הטיה במדגם הנורמות או את שאלת התוקף: האם מוצדק לכנות ציון בהסקה צורנית ״IQ כולל״.
תוקף וטווח היכולות שהמבחן מודד
התוקף קובע אם אפשר לפרש את הציון כמדד ליכולת המוצגת. בודקים אם תוכן השאלות מכסה את טווח היכולת, אם מבנה הציונים הצפוי מקבל תמיכה בנתונים, ואם הציונים קשורים למבחני אינטליגנציה קיימים ולמטלות קשורות בהתאם לציפיות.
שאלות צורניות וחשיבה מטריציונית יכולות להיות מבחנים איכותיים להסקה צורנית או להסקה פלואידית. אבל גם מהימנות גבוהה ב־30 שאלות צורניות אינה מעידה שנמדדו אוצר מילים, ידע, זיכרון עבודה ומהירות עיבוד. כדי להציג IQ כולל, צריך מערך שאלות שמודד כמה יכולות, וכן ראיות לכך שאפשר לשלב אותן בציון כולל.
גם ״מתאם .70 עם מבחן IQ קיים״ אינו אומר ״70% דיוק״. מתאם מבטא את המידה שבה שני ציונים עולים ויורדים יחד. אילו הוספנו לכל נבחן 10 נקודות באופן אחיד, המתאם עם הציונים המקוריים היה 1, אף שהמספרים היו שונים ב־10 נקודות אצל כולם. בלי לבחון את שם המבחן וגרסתו, את המדגם, את הפער בין הממוצעים ואת הפערים בטווחי הציונים השונים, אי אפשר לקבוע אם שני הציונים מייצגים את אותו IQ.
השאלות והנורמות הדרושות למדידת IQ גבוה
כדי להבחין בין IQ 130 ל־140, צריך להתגבר על שני סוגים של אפקט תקרה.
| סוג התקרה | מה נדרש | מה קורה כשאין די בכך |
|---|---|---|
| תקרת השאלות | שאלות שמבחינות גם בין בעלי יכולת גבוהה | הנבחנים החזקים עונים נכון כמעט על הכול, ואי אפשר לראות הבדלי יכולת |
| תקרת הנורמות | מספיק נתונים ושיטת המרה שתומכים בטווח הציונים הגבוהים | אי אפשר לאמוד באופן יציב הבדלים קטנים בין ציוני IQ על סמך אותו מספר תשובות נכונות |
גם במדגם גדול, רק מעטים נמצאים בקצות ההתפלגות. בהנחה של התפלגות נורמלית עם ממוצע 100 וסטיית תקן 15, במדגם של 2,000 אנשים יהיו כ־8 בעלי IQ 140 ומעלה. קשה להצדיק הבחנה דקה בין IQ 140, 142 ו־145 על סמך נתונים כאלה בלבד. ציוני IQ ושיעורם באוכלוסייה מבהירים מדוע ככל שהציון גבוה יותר, קשה יותר לאסוף די נתונים.
במדגם הנורמות הרגיל של WISC-V, שכלל 2,200 ילדים, רק 16 ילדים קיבלו לפחות ציון מורכב אחד של 150 ומעלה. לכן פותחו נורמות מורחבות לטווח הגבוה, והן נבדקו גם במדגם נפרד של 108 ילדים בעלי יכולת גבוהה. גם מבחנים מוכרים זקוקים לתכנון שאלות ולנתונים ייעודיים בטווח העליון.
איזה מידע גלוי דרוש להערכת איכות המדידה?
במידע שמפרסם המבחן מחפשים תשובות לשאלות הבאות, ולא סיסמאות פרסום.
| מה רוצים להעריך | המידע הגלוי הנדרש |
|---|---|
| ביחס למי נקבע הציון | אוכלוסיית היעד, הרכב המדגם, שנת האיסוף ושיטת ההמרה |
| איזו יכולת הציון מודד | הרכב השאלות, מבנה הציונים, שיטות בדיקת התוקף ותוצאותיהן |
| כמה טעות מדידה יש בציון | תנאי ההעברה, סוג המהימנות, SEM ושיטת הבדיקה של הטווח הגבוה |
אין צורך לפרסם את כל הנתונים הגולמיים, אלגוריתם הניקוד והשאלות עצמן. אם ידועים אוכלוסיית היעד, המדגם, תנאי ההעברה, שיטת ההמרה, המהימנות וטעות המדידה, ממצאי התוקף המרכזיים וההתאמה בין המידע הטכני לגרסה הנוכחית, המשתמשים יכולים להעריך את הטענות.
לעומת זאת, בלי מידע שמאפשר להעריך את הדברים האלה, גם מספר מפורט כמו IQ 137 אינו מאפשר לדעת מה משמעותו ועד כמה הוא מדויק. אל תסמכו על ציון IQ כעל מספר מדויק אם המבחן אינו מפרסם את הראיות שמאחוריו. זו המסקנה המעשית.
הראיות ש־BrainTypeIQ מפרסם לגבי איכות המדידה
BrainTypeIQ מציג את הסיבות לבחירת 9 המטלות ואת התאמתן ל־5 תחומים, ומשתמש בהן כדי להרכיב ציון IQ כולל וציונים ב־5 תחומים.
אנחנו מפרסמים גם את שיטת ההמרה לציוני תקן וחישוב הציונים המורכבים, את הנורמות של הגרסה היפנית המבוססות על 841 אנשים שהשלימו את המבחן לראשונה, ואת מהימנות ציון ה־IQ הכולל, .929, ו־SEM של כ־4.0 נקודות. הערכה רשמית והגשת תוצאות לגורם חיצוני הן שימושים שונים מהבנה עצמית; ההבחנה מוסברת במאמר על התפקידים של WAIS ומבחני IQ מקוונים.