IQ измерение: шкала отклонения и точность теста

Балл IQ выглядит как физическая величина: 118, 92, 134 - числа, которые хочется складывать, вычитать и сравнивать напрямую. На деле измерение IQ устроено иначе: тест не определяет «количество ума», а находит место человека среди сверстников и переводит это место в удобную шкалу. Разберём, как из ответов на задания получается число, откуда взялись 100 и 15, насколько точен единичный результат и почему по одному баллу нельзя сказать больше, чем позволяет ошибка измерения. Калькулятор ниже переводит балл в процентильный ранг и строит доверительный интервал с учётом надёжности методики.
Что на самом деле измеряет тест интеллекта
Испытуемый решает наборы заданий разного типа: словарь, аналогии, арифметика, складывание узоров из кубиков, поиск закономерности в матрице. За каждое верное решение начисляются очки, их сумма даёт сырой балл. Сам по себе этот сырой балл не значит ничего: он зависит от количества заданий, их трудности и правил подсчёта, а не от свойства человека. Смысл появляется только после сравнения с нормативной группой.
Отсюда первая особенность измерения IQ: по происхождению это ранговая величина, показатель относительного положения. Утверждение «у человека IQ 120» означает не «в голове 120 единиц интеллекта», а «результат выше, чем примерно у 91 процента ровесников из выборки стандартизации».
Второй вопрос - что именно ранжируется. Чарльз Спирмен ещё в 1904 году заметил, что любые когнитивные тесты положительно коррелируют между собой: кто лучше решает вербальные задачи, в среднем лучше справляется и с пространственными. Эту общую составляющую он назвал фактором . Современные тесты интеллекта в первую очередь измеряют именно плюс несколько более узких способностей, а не весь спектр человеческих умений. Спор о том, правомерно ли сводить ум к одному числу, ведётся с 1980-х годов и подробно разобран в статье про теорию множественного интеллекта.
От умственного возраста к шкале отклонения
Первый рабочий тест создали Альфред Бине и Теодор Симон в 1905 году, чтобы находить детей, которым нужна дополнительная помощь в школе. Их мерой был умственный возраст: ребёнок получал тот возраст, заданиям которого соответствовал его результат. Уильям Штерн в 1912 году предложил превратить это в коэффициент, а Льюис Термен в 1916-м закрепил привычную форму записи:
где - умственный возраст, - хронологический. Ребёнок восьми лет с умственным возрастом десять лет получал 125.
У формулы отношения обнаружился неустранимый дефект. После подросткового возраста результаты тестов перестают расти с той же скоростью, что и календарный возраст, поэтому у взрослых коэффициент начинает автоматически падать: сорокалетний с тем же уровнем, что и двадцатилетний, получал бы вдвое меньший балл. Дэвид Векслер в 1939 году отказался от отношения возрастов и ввёл шкалу отклонения, которой пользуются до сих пор:
где - сырой балл испытуемого, а и - среднее и стандартное отклонение по его собственной возрастной группе. Величина в дроби - обычная z-оценка, а числа 100 и 15 суть конвенция, а не свойство природы: в старых редакциях Стэнфорд-Бине сигму брали равной 16, а в тестах Кеттелла - 24, и один и тот же человек получал там разные числа.

Стандартизация: откуда берётся сотня
Среднее 100 не измеряется, а назначается: его приравнивают к среднему результату выборки стандартизации. Это большая группа, состав которой по возрасту, полу, образованию и типу населённого пункта воспроизводит популяцию, где тест будет применяться; для тестов интеллекта нормы строят на тысячах протоколов и отдельно для каждой возрастной ячейки. Общая техника перевода сырых баллов в стандартные шкалы описана в материале про тестовые нормы, измерение IQ - её частный случай с и .
Отсюда следует принципиальное ограничение: балл IQ привязан к конкретной норме, то есть к стране и году её сбора. Нормы стареют, и не только из-за изменения состава населения: результаты населения десятилетиями росли примерно на три балла за декаду, этот сдвиг известен как эффект Флинна. Поэтому руководства требуют рестандартизации методики каждые 10-15 лет.
Если в руководстве к тесту не указаны год сбора норм и описание выборки стандартизации, интерпретировать балл нельзя: неизвестно, с кем сравнивается испытуемый.
Нормальное распределение и чтение балла
Распределение баллов IQ имеет колоколообразную форму не потому, что это открытый закон природы, а потому, что шкалу строят такой намеренно: сырые баллы нормализуют, подгоняя под нормальную кривую. Зато после этого работают все её свойства. В интервал от 85 до 115, то есть плюс-минус одна сигма, попадает около 68 процентов людей; в интервал 70-130 - около 95 процентов; за 130 остаётся примерно 2,3 процента.
Точное значение доли даёт функция распределения:
Для балла 115 получаем и : результат выше, чем у 84 процентов популяции, то есть такой или более высокий балл показывает примерно один человек из шести. Для балла 145 доля превосходящих падает до одной тысячной, и на хвостах распределения точность измерения резко снижается: нормативных протоколов там мало, а один-два случайно угаданных ответа двигают балл на несколько единиц.
Надёжность: сколько шума в одном балле
Надёжность показывает, какая доля разброса баллов приходится на устойчивое свойство, а не на случайные факторы: настроение, шум в аудитории, удачную догадку. У качественных тестов интеллекта она составляет 0,90-0,97. Из надёжности выводится главная практическая величина - стандартная ошибка измерения:
При и получаем балла, а 95-процентный доверительный интервал равен . Значит, результат «IQ 115» корректно читается как «истинный балл лежит примерно между 108 и 122». Отсюда правило, которое чаще всего нарушают: разница в три-пять баллов между двумя людьми или между двумя обследованиями одного человека не является различием, интервалы перекрываются.
Есть и второй эффект. Из-за случайной ошибки крайние результаты в среднем завышены или занижены, поэтому истинный балл оценивают с поправкой на регрессию к среднему: . При надёжности 0,95 и наблюдённом балле 130 ожидаемый истинный балл равен 128,5, а при повторном тестировании результат чаще всего окажется чуть ближе к сотне.

Валидность: что балл вообще предсказывает
Надёжность отвечает за стабильность, валидность - за содержание: измеряет ли тест то, ради чего его применяют. Различают содержательную валидность (задания покрывают заявленную область), конструктную (структура результатов согласуется с теорией интеллекта) и критериальную, она же прогностическая (балл предсказывает внешний критерий).
Именно прогностические цифры стоит помнить. Корреляция IQ со школьной успеваемостью держится около 0,5, с профессиональной успешностью в сложных видах труда - в диапазоне 0,3-0,5. Коэффициент 0,5 означает : тест объясняет четверть разброса результатов, а три четверти приходятся на мотивацию, здоровье, качество обучения и обстоятельства. Требования к качеству методик и этике их применения систематизированы в статье про принципы психодиагностики.
За что критикуют измерение IQ
Культурная нагруженность. Вербальные и арифметические субтесты опираются на школьный опыт и язык, поэтому результат смешивает способность и обученность. «Культурно свободные» тесты вроде прогрессивных матриц Равена уменьшают проблему, но не снимают: знакомство с самим форматом задач тоже тренируется.
Узость конструкта. Тест меряет и не претендует на творчество, эмоциональную регуляцию или практическую смекалку, а в житейском употреблении балл незаметно расширяют до оценки человека целиком.
Условия и тренируемость. Повторное прохождение похожего теста добавляет несколько баллов только за счёт знакомства с процедурой; усталость, тревога и ситуация экспертизы дают сдвиг в другую сторону.
Последствия применения. Исторически тесты использовались для сортировки людей при иммиграции и распределении по школьным потокам, и именно эти практики, а не сама психометрика, вызвали основную волну критики.

Частые ошибки
- Считать IQ абсолютной величиной и складывать баллы разных методик. Шкалы отличаются сигмой и годом норм, числа несопоставимы.
- Интерпретировать балл как точку, а не как интервал. Без стандартной ошибки измерения любое сравнение двух близких результатов бессмысленно.
- Применять норму другой страны или норму двадцатилетней давности. Из-за дрейфа норм результат окажется систематически завышен.
- Путать надёжность с валидностью. Тест может давать стабильно один и тот же балл и при этом измерять не то, что нужно для конкретной задачи.
- Делать из коэффициента прогноз для отдельного человека. Корреляция 0,5 описывает группу, а не гарантию для конкретного случая.
FAQ
Что означает IQ 100 и почему именно 100? Это среднее выборки стандартизации, назначенное соглашением: половина людей получает выше, половина ниже. Никакого содержательного эталона за числом нет, оно лишь фиксирует точку отсчёта шкалы отклонения.
Меняется ли IQ с возрастом? Балл рассчитывается внутри своей возрастной группы, поэтому относительное положение у взрослого человека довольно стабильно: корреляция результатов с интервалом в несколько лет держится около 0,8. Абсолютная же продуктивность решения задач с возрастом меняется, но шкала это скрывает, сравнивая испытуемого только с ровесниками.
Можно ли доверять онлайн-тестам на IQ? Как правило, нет: у них отсутствует выборка стандартизации, не опубликованы коэффициенты надёжности и валидности, а результат нередко подгоняется к завышенным значениям. Профессиональные методики вроде шкал Векслера проводит психолог индивидуально, и на их выполнение уходит больше часа.
Коротко
Измерение IQ - это перевод сырого балла в шкалу отклонения со средним 100 и стандартным отклонением 15 через z-оценку по нормам своей возрастной группы. Число говорит о положении человека в распределении, а не о количестве интеллекта, и живёт ровно столько, сколько актуальна выборка стандартизации. Читать его нужно вместе со стандартной ошибкой измерения : для надёжного теста это интервал шириной около 13 баллов, внутри которого различия несущественны. Валидность ограничивает выводы дополнительно: тест объясняет около четверти разброса учебных и профессиональных достижений, всё остальное измеряется другими средствами.
Читайте также

Тестовые нормы: как сырой балл превращается в оценку
Тестовые нормы в психодиагностике: зачем нужна выборка стандартизации, как считают z оценку, Т баллы, стены, станайны и процентили, и почему нормы приходится обновлять.

Адаптация первокурсников к вузу
Адаптация первокурсников к вузу: виды трудностей, этапы вхождения в учебную и социальную среду, роль куратора и тьютора, методы оценки и практические рекомендации.

Адвербиализация: как слова становятся наречиями
Адвербиализация в русском языке: переход существительных, прилагательных и деепричастий в наречия, критерии, спорные случаи и правила слитного написания.

Акт о супрематии 1534: церковь и власть
Акт о супрематии 1534 года: почему Генрих VIII стал главой церкви Англии, как присяга привела к казни Мора и Фишера, роспуску монастырей и появлению англиканства.

Александрийская поэзия: черты и представители
Александрийская поэзия эллинистической эпохи: Мусейон, Каллимах, Феокрит, эпиграмма и учёная работа со старой традицией, повлиявшая на римских поэтов.

Алкеста Еврипида: жертва, долг и возвращение
«Алкеста» Еврипида: почему жена умирает вместо Адмета, как Геракл спорит со Смертью и зачем трагедии счастливый финал. Сюжет, образы и темы для анализа пьесы.