EssayAI
Блог
Блог

Как проверить нормальность распределения: критерий Пирсона

Запрос

Дано: 100 деталей, признак XX - толщина покрытия в мкм; ряд сгруппирован в семь интервалов шириной 2 с частотами 4, 14, 20, 25, 18, 15, 4. Найти: согласуются ли данные с нормальным законом при уровне значимости α=0,05\alpha = 0{,}05.

Работаем критерием согласия хи-квадрат Пирсона: оцениваем параметры нормального закона по выборке, считаем теоретическую частоту каждого интервала и складываем взвешенные квадраты расхождений. Ответ: χнабл2=3,12\chi^2_{\text{набл}} = 3{,}12 при критической точке χкр2=9,488\chi^2_{\text{кр}} = 9{,}488, то есть гипотезу о нормальном распределении отвергать нет оснований. Калькулятор сверху пересчитывает всю таблицу под другие частоты и уровень значимости.

Решение по шагам

Дано. Интервальный вариационный ряд толщины покрытия, объём выборки n=100n = 100:

Интервал, мкм0-22-44-66-88-1010-1212-14
Частота nin_i414202518154

Найти: наблюдаемое значение статистики Пирсона, число степеней свободы, критическую точку и вывод о нормальности при α=0,05\alpha = 0{,}05.

Шаг 1. Перейти к серединам интервалов и найти выборочные характеристики. Внутри интервала все наблюдения условно считаются сосредоточенными в его середине xix_i: 1, 3, 5, 7, 9, 11, 13. Дальше это обычный дискретный ряд:

xˉв=1n∑i=1sxini=4⋅1+14⋅3+20⋅5+25⋅7+18⋅9+15⋅11+4⋅13100=700100=7.\bar{x}_{\text{в}} = \frac{1}{n}\sum_{i=1}^{s} x_i n_i = \frac{4 \cdot 1 + 14 \cdot 3 + 20 \cdot 5 + 25 \cdot 7 + 18 \cdot 9 + 15 \cdot 11 + 4 \cdot 13}{100} = \frac{700}{100} = 7.

Дисперсию удобнее считать через вторые моменты, а не через отклонения:

Dв=1n∑i=1sxi2ni−xˉв2=5804100−72=58,04−49=9,04,σв=9,04≈3,01.D_{\text{в}} = \frac{1}{n}\sum_{i=1}^{s} x_i^2 n_i - \bar{x}_{\text{в}}^2 = \frac{5804}{100} - 7^2 = 58{,}04 - 49 = 9{,}04, \qquad \sigma_{\text{в}} = \sqrt{9{,}04} \approx 3{,}01.

Параметры нормального закона неизвестны, поэтому вместо них берутся эти оценки: a≈xˉв=7a \approx \bar{x}_{\text{в}} = 7, σ≈σв=3,01\sigma \approx \sigma_{\text{в}} = 3{,}01. Позже за такую замену придётся заплатить двумя степенями свободы.

Шаг 2. Нормировать границы интервалов. Каждая граница переводится в единицы стандартного отклонения:

z=x−xˉвσв.z = \frac{x - \bar{x}_{\text{в}}}{\sigma_{\text{в}}}.

Крайние границы заменяются на бесконечности: левый конец первого интервала считается равным −∞-\infty, правый конец последнего +∞+\infty. Иначе сумма теоретических вероятностей окажется меньше единицы, и хвосты нормальной кривой просто потеряются.

Граница, мкм−∞-\infty24681012+∞+\infty
zz−∞-\infty-1,66-1,00-0,330,331,001,66+∞+\infty

Шаг 3. Найти теоретические вероятности. Вероятность попадания в интервал равна разности значений функции Лапласа на его границах:

pi=Φ(zi+1)−Φ(zi),Φ(−∞)=−0,5,Φ(+∞)=0,5.p_i = \Phi(z_{i+1}) - \Phi(z_i), \qquad \Phi(-\infty) = -0{,}5, \quad \Phi(+\infty) = 0{,}5.

По таблице Φ(0,33)=0,1293\Phi(0{,}33) = 0{,}1293, Φ(1,00)=0,3413\Phi(1{,}00) = 0{,}3413, Φ(1,66)=0,4515\Phi(1{,}66) = 0{,}4515; функция нечётна, поэтому для отрицательных аргументов значения берутся со знаком минус. Например, для интервала 6-8:

p4=Φ(0,33)−Φ(−0,33)=2⋅0,1293=0,2586,p_4 = \Phi(0{,}33) - \Phi(-0{,}33) = 2 \cdot 0{,}1293 = 0{,}2586,

а для первого интервала p1=Φ(−1,66)−Φ(−∞)=−0,4515+0,5=0,0485p_1 = \Phi(-1{,}66) - \Phi(-\infty) = -0{,}4515 + 0{,}5 = 0{,}0485.

Шаг 4. Найти теоретические частоты. Умножаем вероятности на объём выборки: niт=npin_i^{\text{т}} = n p_i.

Интервал0-22-44-66-88-1010-1212-14Сумма
pip_i0,04850,11020,21200,25860,21200,11020,04851,0000
npin p_i4,8511,0221,2025,8621,2011,024,85100,00

Контроль здесь обязателен: сумма вероятностей должна дать единицу, а сумма теоретических частот - объём выборки. Расхождение в сотых допустимо, оно набегает от округления таблицы.

Шаг 5. Вычислить наблюдаемую статистику. Складываем взвешенные квадраты расхождений эмпирических и теоретических частот:

χнабл2=∑i=1s(ni−npi)2npi.\chi^2_{\text{набл}} = \sum_{i=1}^{s} \frac{(n_i - n p_i)^2}{n p_i}.
Интервал0-22-44-66-88-1010-1212-14
nin_i414202518154
npin p_i4,8511,0221,2025,8621,2011,024,85
Слагаемое0,1490,8060,0680,0290,4831,4370,149
χнабл2=0,149+0,806+0,068+0,029+0,483+1,437+0,149=3,12.\chi^2_{\text{набл}} = 0{,}149 + 0{,}806 + 0{,}068 + 0{,}029 + 0{,}483 + 1{,}437 + 0{,}149 = 3{,}12.

Основной вклад дал интервал 10-12: наблюдалось 15 деталей против ожидаемых 11, это видно и на графике в калькуляторе, если переключить его на слагаемые.

Шаг 6. Сравнить с критической точкой. Число степеней свободы равно числу интервалов минус единица и минус число оценённых параметров:

k=s−1−r=7−1−2=4.k = s - 1 - r = 7 - 1 - 2 = 4.

По таблице критических точек распределения хи-квадрат при α=0,05\alpha = 0{,}05 и k=4k = 4 получаем χкр2=9,488\chi^2_{\text{кр}} = 9{,}488. Наблюдаемое значение меньше: 3,12<9,4883{,}12 < 9{,}488.

Ответ. χнабл2=3,12<χкр2(0,05; 4)=9,488\chi^2_{\text{набл}} = 3{,}12 < \chi^2_{\text{кр}}(0{,}05;\ 4) = 9{,}488, значит расхождение эмпирических и теоретических частот незначимо и гипотеза о нормальном распределении толщины покрытия не отвергается.

Формула критерия и число степеней свободы

Смысл статистики Пирсона виден из её слагаемых. Разность ni−npin_i - n p_i показывает, насколько реальная частота интервала отошла от предсказанной законом. Квадрат убирает знак, чтобы недоборы и переборы не гасили друг друга. Деление на npin p_i выравнивает вклад интервалов: расхождение в четыре наблюдения при ожидаемых пяти - это грубый промах, а при ожидаемых пятидесяти - мелочь.

Теорема Пирсона утверждает, что при n→∞n \to \infty и верной нулевой гипотезе такая сумма распределена как хи-квадрат - независимо от того, какой именно закон проверяется. Именно поэтому один и тот же критерий годится и для нормального, и для показательного, и для равномерного распределения: меняется только способ расчёта pip_i. Подробности о самой кривой и о том, как искать в таблице нужную ячейку, разобраны в статье про распределение хи-квадрат и таблицу его значений.

Число степеней свободы уменьшают две вещи. Первая единица уходит на условие ∑ni=n\sum n_i = n: частоты не свободны, последняя восстанавливается по остальным. Ещё rr единиц отнимает оценивание параметров по той же выборке. Для нормального закона r=2r = 2 (среднее и отклонение), поэтому k=s−3k = s - 3; для показательного закона оценивается один параметр и k=s−2k = s - 2; если параметры заданы условием заранее, вычитается только единица. Ошибка в rr смещает критическую точку и способна перевернуть вывод.

Если теоретическая частота меньше пяти

Распределение статистики приближается к хи-квадрат тем точнее, чем крупнее ожидаемые частоты. Практическое правило: каждая теоретическая частота должна быть не меньше 5. В нашей задаче крайние интервалы дали 4,85 - почти на грани, и строгий вариант решения объединяет их с соседями.

После объединения остаётся пять интервалов с частотами 18, 20, 25, 18, 19 и теоретическими 15,87; 21,20; 25,86; 21,20; 15,87. Тогда

χнабл2=0,286+0,068+0,029+0,483+0,617=1,48,k=5−3=2,\chi^2_{\text{набл}} = 0{,}286 + 0{,}068 + 0{,}029 + 0{,}483 + 0{,}617 = 1{,}48, \qquad k = 5 - 3 = 2,

а критическая точка при α=0,05\alpha = 0{,}05 и двух степенях свободы равна 5,991. Вывод тот же: 1,48<5,9911{,}48 < 5{,}991, гипотеза не отвергается. Совпадение выводов - хороший признак устойчивости решения; если бы они разошлись, доверять следовало варианту с объединёнными интервалами.

Чем ещё проверяют нормальность

Перед формальным критерием полезна графическая прикидка: по интервальному ряду строят гистограмму, а по серединам интервалов - ломаную, и смотрят, похожа ли она на колокол. Техника построения разобрана в задаче про полигон частот; график не доказывает нормальность, но сразу выдаёт двугорбость, резкую скошенность или выбросы, после которых считать критерий уже нет смысла.

Второй быстрый признак - выборочные асимметрия и эксцесс: у нормального закона обе величины равны нулю, и если их модули не превышают своих стандартных ошибок, отклонение формы несущественно. Наконец, вместо Пирсона применяют критерий согласия Колмогорова-Смирнова: он работает с несгруппированными данными и потому точнее на малых выборках, где группировка съедает информацию. Проверка нормальности почти никогда не самоцель - она предшествует параметрическим процедурам вроде сравнения двух средних, законность которых держится на этом допущении.

Частые ошибки

  • Считают частоты по границам, а не по серединам интервалов. Выборочные среднее и дисперсия интервального ряда находятся по серединам xix_i; подстановка левых границ занижает среднее ровно на половину шага.
  • Не уводят крайние границы в бесконечность. Если оставить 0 и 14, сумма вероятностей окажется около 0,98, теоретические частоты недоберут два наблюдения, а статистика вырастет на пустом месте.
  • Забывают вычесть оценённые параметры из числа степеней свободы. Для нормального закона k=s−3k = s - 3, а не s−1s - 1: при s=7s = 7 это разница между критическими точками 9,488 и 12,592.
  • Путают функцию Лапласа с функцией распределения. Табличная Φ(z)\Phi(z) отсчитывается от нуля и меняется в пределах от -0,5 до 0,5; если таблица даёт F(z)F(z) от 0 до 1, вероятность интервала считается как разность значений FF без всяких добавок в 0,5.
  • Оставляют интервалы с ожидаемой частотой меньше 5. Мелкий знаменатель раздувает слагаемое, и критерий начинает отвергать верную гипотезу; такие интервалы объединяют с соседними, не забывая пересчитать число степеней свободы.
  • Делят на наблюдаемую частоту вместо теоретической. В знаменателе стоит именно npin p_i; замена меняет и величину статистики, и её распределение.

FAQ

Что означает вывод, что гипотеза не отвергается? Только то, что расхождение частот объяснимо случайностью выборки. Это не доказательство нормальности: критерий не принимает нулевую гипотезу, а не находит оснований её отвергнуть. При другом объёме выборки или другой группировке вывод может измениться.

Сколько наблюдений нужно для критерия Пирсона? Практический минимум - около 50 наблюдений, комфортный объём - от 100. Причина не в самой формуле, а в требовании npi⩾5n p_i \geqslant 5: на маленькой выборке интервалы приходится объединять так грубо, что от формы распределения ничего не остаётся.

Сколько интервалов брать при группировке? Обычно от 7 до 12; ориентир даёт формула Стёрджеса s≈1+3,322lg⁡ns \approx 1 + 3{,}322 \lg n, для n=100n = 100 она даёт около 8 интервалов. Слишком мелкое дробление роняет ожидаемые частоты ниже пяти, слишком крупное сглаживает любые отклонения от нормальности.

Что делать, если статистика попала в критическую область? Гипотеза о нормальности отвергается на выбранном уровне значимости, и параметрические методы к таким данным применять нельзя. Дальше либо ищут другой закон, либо преобразуют признак (логарифмирование часто выправляет правостороннюю скошенность), либо переходят к непараметрическим критериям.

Коротко

  1. Перейти к серединам интервалов и найти xˉв\bar{x}_{\text{в}} и σв\sigma_{\text{в}}: в примере 7 и 3,01 при объёме выборки 100.
  2. Нормировать границы по формуле z=(x−xˉв)/σвz = (x - \bar{x}_{\text{в}}) / \sigma_{\text{в}}, крайние заменить на ±∞\pm\infty.
  3. Снять вероятности с таблицы функции Лапласа: pi=Φ(zi+1)−Φ(zi)p_i = \Phi(z_{i+1}) - \Phi(z_i), проверить сумму на единицу; теоретические частоты равны npin p_i.
  4. Сложить слагаемые (ni−npi)2/(npi)(n_i - n p_i)^2 / (n p_i): получилось χнабл2=3,12\chi^2_{\text{набл}} = 3{,}12.
  5. Взять k=s−3=4k = s - 3 = 4, найти χкр2(0,05; 4)=9,488\chi^2_{\text{кр}}(0{,}05;\ 4) = 9{,}488 и сравнить: 3,12<9,4883{,}12 < 9{,}488, гипотеза о нормальности не отвергается.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Матстатистика

Как найти уравнение линейной регрессии: пример решения

Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.

Матстатистика

Как найти критическую область: разбор с примером

Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.

Матстатистика

Как найти несмещённую оценку дисперсии: решение

Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.

Матстатистика

Как вычислить скользящую среднюю: пример расчёта

Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.

Матстатистика

Как составить вариационный ряд: пошаговое решение

Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.

Матстатистика

Как построить гистограмму частот: разбор задачи

Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.