Một trang có thể ghi “trung bình 100”, “khoa học” hay “chính xác” mà vẫn chưa cho biết chất lượng đo lường của bài IQ. Cần xác định điểm được so với ai, đo những năng lực nào và có sai số khoảng bao nhiêu.
Nếu không công bố đủ căn cứ để đánh giá, đừng tin điểm IQ như một con số chính xác đến từng đơn vị. Quảng cáo, thứ hạng tìm kiếm, giao diện báo cáo đẹp và chứng nhận IQ không phải bằng chứng về chất lượng đo lường. Bài Cách chọn bài kiểm tra IQ trực tuyến đáng tin cậy giải thích thêm cách xem giá và điều kiện hợp đồng.
Bốn yếu tố quyết định chất lượng đo lường của bài kiểm tra IQ
| Yếu tố | Điều cần kiểm tra | Hệ quả khi thiếu |
|---|---|---|
| Chuẩn hóa | Điều kiện thực hiện và chấm điểm có nhất quán không? | Khác biệt về thiết bị, thời gian hoặc cách chấm bị trộn vào điểm |
| Norm | Điểm được so với dữ liệu của ai? | Không xác định được ý nghĩa của IQ 100 hay 2% cao nhất |
| Độ tin cậy | Điểm nhất quán đến mức nào? | Một vài câu đúng hoặc sai do ngẫu nhiên có thể làm điểm thay đổi lớn |
| Độ giá trị | Có đủ căn cứ để hiểu điểm theo đúng năng lực được công bố không? | Kết quả suy luận hình ảnh bị mở rộng quá mức thành IQ tổng quát |
Không thể đánh giá chất lượng chỉ bằng một trong bốn yếu tố. Dù có norm lớn, điểm giữa những người làm vẫn khó so sánh nếu mỗi người thực hiện trong điều kiện khác nhau. Dù độ tin cậy cao, nếu bài chỉ đo suy luận hình ảnh thì vẫn chưa đủ độ giá trị để gọi là IQ tổng quát bao gồm ngôn ngữ, trí nhớ và tốc độ xử lý.
Chuẩn hóa và norm
Chuẩn hóa là giữ nhất quán phần hướng dẫn, giới hạn thời gian, cách ra câu hỏi, chấm điểm, xử lý hết giờ và gián đoạn. Với bài trực tuyến, khác biệt hiển thị giữa điện thoại và máy tính, độ trễ mạng, việc làm lại, tra cứu và dùng ghi chú đều có thể ảnh hưởng đến điều kiện đo. Nếu hai người có cùng năng lực nhưng nhận điểm IQ rất khác chỉ vì thiết bị hoặc số lần làm, điểm đó không còn là thang so sánh phù hợp.
Norm là dữ liệu dùng làm mốc so sánh cho IQ. Có thể lấy bất kỳ tập dữ liệu nào rồi quy đổi số câu đúng về trung bình 100 và độ lệch chuẩn 15. Nếu chỉ đặt trung bình của những người tự tìm đến một trang web thành 100, kết quả không tự động thể hiện vị trí trong dân số trưởng thành Việt Nam.
Tối thiểu cần kiểm tra:
- Không chỉ cỡ mẫu mà cả độ tuổi, ngôn ngữ, khu vực và cách tuyển người tham gia
- Cách xử lý lần làm đầu, lần làm lại, phản hồi bất thường và người bỏ dở
- Số người theo từng nhóm tuổi và cách hiệu chỉnh theo tuổi
- Năm thu thập dữ liệu và việc dữ liệu có tương ứng với bộ câu hỏi, cách chấm hiện tại hay không
- Nếu làm bằng tiếng Việt, norm có được tạo từ chính phiên bản tiếng Việt và người dùng phù hợp hay không
Ngay cả khi ghi “100.000 người đã làm”, ta vẫn không đánh giá được chất lượng norm nếu không biết có tính lần làm lại của cùng một người không, mỗi độ tuổi có bao nhiêu người và dữ liệu được thu khi nào. Số lượng người làm bài từ Việt Nam cũng khác với một mẫu đại diện cho dân số nói tiếng Việt. Tương tự, không thể chỉ dịch một bài sang tiếng Việt rồi mặc nhiên áp norm của bản ngôn ngữ khác.
Độ tin cậy, sai số đo và khoảng tin cậy
Độ tin cậy là hệ số từ 0 đến 1 cho biết điểm số ổn định và nhất quán đến đâu. Mức độ nhất quán giữa các câu hỏi và mức độ ổn định khi làm lại vào ngày khác trả lời hai câu hỏi khác nhau. Vì vậy, ghi “độ tin cậy .90” là chưa đủ; cần biết loại hệ số, mẫu phân tích và điểm nào được tính.
Từ độ tin cậy có thể tính sai số đo chuẩn (SEM) của điểm cá nhân. Trên thang IQ có độ lệch chuẩn 15, nếu độ tin cậy là .90 thì SEM vào khoảng 4,7 điểm. Với cách tính khoảng tin cậy 95% bằng ±1,96 SEM, IQ 130 có khoảng xấp xỉ 121–139. Độ tin cậy .90 không có nghĩa là điểm chính xác đến từng đơn vị.
Con số này chỉ nói về sai số trong điểm của một người ở một lần làm bài. Khoảng tin cậy hẹp không giải quyết được việc mẫu norm bị lệch hoặc câu hỏi hình ảnh có đủ độ giá trị để gọi là IQ tổng quát hay không.
Độ giá trị và phạm vi năng lực được đo
Độ giá trị cho biết điểm số có thực sự phản ánh năng lực mà bài kiểm tra tuyên bố đo hay không. Cần xem nội dung câu hỏi có bao quát năng lực đó không, cấu trúc điểm giả định có được dữ liệu ủng hộ không, và kết quả có liên hệ với bài kiểm tra trí tuệ hoặc nhiệm vụ liên quan theo cách dự kiến hay không.
Câu hỏi hình ảnh và ma trận có thể tạo thành một bài đo tốt về suy luận hình ảnh hoặc suy luận linh hoạt. Nhưng ngay cả khi 30 câu hình có độ tin cậy cao, bài vẫn chưa đo từ vựng, kiến thức, trí nhớ làm việc và tốc độ xử lý. Muốn hiển thị IQ tổng quát, cần có nhiều loại nhiệm vụ và bằng chứng cho thấy có thể tổng hợp các năng lực đó thành điểm chung.
Tuyên bố “tương quan .70 với bài IQ hiện có” cũng không có nghĩa là “chính xác 70%”. Tương quan cho biết hai điểm có xu hướng tăng giảm cùng nhau đến mức nào. Ví dụ, nếu lấy điểm gốc của tất cả người làm rồi cộng thêm 10, tương quan với điểm gốc vẫn là 1 dù ai cũng bị lệch 10 điểm. Muốn biết hai thang có thể được dùng như cùng một IQ hay không, cần xem tên và phiên bản bài đối chiếu, mẫu, chênh lệch trung bình và khác biệt theo từng khoảng điểm.
Một điểm cần chú ý ở các tài liệu kỹ thuật trực tuyến là: nếu nhân tố và điểm cuối cùng đều được tạo từ cùng một bộ câu hỏi, tương quan cao giữa chúng chưa phải là xác nhận độc lập về độ giá trị so với một bài đánh giá chính thức bên ngoài.
Câu hỏi và norm cần thiết để đo IQ cao
Muốn phân biệt IQ 130 với 140, bài kiểm tra phải vượt qua hai loại trần.
| Loại trần | Điều cần có | Điều xảy ra khi thiếu |
|---|---|---|
| Trần của câu hỏi | Câu hỏi vẫn phân biệt được những người có năng lực cao | Nhiều người ở nhóm cao trả lời gần như đúng hết, nên không quan sát được chênh lệch |
| Trần của norm | Đủ dữ liệu và phương pháp quy đổi cho vùng điểm cao | Không thể ước lượng ổn định các mức IQ chi tiết từ cùng số câu đúng |
Dù tổng mẫu lớn, số người ở hai đầu phân phối vẫn ít. Nếu giả định phân phối chuẩn có trung bình 100 và độ lệch chuẩn 15, một mẫu 2.000 người chỉ có khoảng 8 người đạt IQ 140 trở lên. Chừng đó không đủ để phân biệt ổn định IQ 140, 142 và 145. Bài IQ và tỷ lệ dân số cho thấy vì sao càng lên vùng điểm cao, dữ liệu càng khó thu thập.
Trong mẫu norm thông thường 2.200 trẻ của WISC-V, chỉ 16 trẻ có ít nhất một điểm tổng hợp từ 150 trở lên. Vì vậy, nhà phát triển phải xây dựng norm mở rộng cho vùng điểm cao và kiểm tra thêm trên một mẫu riêng gồm 108 trẻ có năng lực cao. Ngay cả bài kiểm tra nổi tiếng cũng cần thiết kế câu hỏi và dữ liệu riêng cho phần trên của phân phối.
Thông tin công khai cần có để đánh giá chất lượng đo lường
Khi xem thông tin công khai, hãy đối chiếu từng tuyên bố quảng cáo với bằng chứng cần thiết.
| Tuyên bố được hiển thị | Thông tin cần để đánh giá |
|---|---|
| IQ 100, thuộc 2% cao nhất | Nhóm mục tiêu, cấu trúc mẫu, năm thu thập, cách quy đổi |
| IQ tổng quát | Những năng lực được đo, cấu trúc câu hỏi, cấu trúc điểm |
| Độ tin cậy .90 | Loại hệ số, mẫu phân tích, SEM, độ chính xác theo khoảng điểm |
| Tương quan cao với bài kiểm tra hiện có | Tên và phiên bản bài đối chiếu, mẫu, tương quan, chênh lệch trung bình |
| Đo được IQ từ 140 trở lên | Câu hỏi cho vùng năng lực cao, số người ở nhóm trên, cách ngoại suy và kiểm tra |
| Khoa học, chính xác | Phương pháp và kết quả nào ủng hộ cho từng tuyên bố |
Không nhất thiết phải công bố toàn bộ dữ liệu thô, thuật toán chấm điểm hoặc câu hỏi thật. Nhưng người dùng cần biết đối tượng, mẫu, điều kiện thực hiện, cách quy đổi, độ tin cậy và sai số, kết quả chính về độ giá trị, cùng việc tài liệu kỹ thuật có tương ứng với phiên bản hiện tại hay không.
Nếu không có đủ thông tin để đánh giá, một con số chi tiết như IQ 137 vẫn không cho biết rõ ý nghĩa và độ chính xác. Đừng tin IQ từ một bài không công bố căn cứ như thể đó là con số chính xác. Đây là kết luận thực tế nhất.
BrainTypeIQ công bố lý do chọn 9 bài kiểm tra và cách chúng liên hệ với 5 lĩnh vực, đồng thời giải thích cách tạo IQ tổng quát và 5 lĩnh vực từ 9 bài và cách quy đổi, tổng hợp điểm chuẩn. Dữ liệu norm từ 841 người hoàn thành lần đầu, độ tin cậy .929 và SEM khoảng 4,0 là bằng chứng đã hoàn tất của bản tiếng Nhật. Bản tiếng Việt dùng thiết kế đo lường này với cách tính điểm tạm thời trong khi tích lũy dữ liệu riêng; không nên diễn giải 841 người như norm đại diện cho Việt Nam. Nếu cần đánh giá chính thức hoặc hồ sơ nộp cho bên thứ ba, hãy chọn theo vai trò khác nhau của WAIS và bài IQ trực tuyến, thay vì chỉ so chất lượng giữa các trang web.