EssayAI
Блог
Блог

Как найти критическую область: разбор с примером

Запрос

Дано: фасовочный автомат настроен на a0=500a_0 = 500 г, генеральное среднее квадратическое отклонение σ=5\sigma = 5 г известно из паспорта линии; контрольная выборка n=100n = 100 пачек дала среднее xˉ=500,9\bar x = 500{,}9 г. Найти: критическую область при уровне значимости α=0,05\alpha = 0{,}05 и проверить гипотезу H0:a=500H_0: a = 500 против альтернативы H1:a≠500H_1: a \neq 500.

Критическая область строится в три хода: по альтернативе определяем, сколько у неё хвостов, по уровню значимости берём критическую точку из таблицы, а затем сравниваем с ней наблюдаемое значение статистики. Здесь альтернатива двусторонняя, поэтому область состоит из двух хвостов по 0,0250{,}025 вероятности в каждом, критическая точка равна zкр=1,96z_{\text{кр}} = 1{,}96, а сама область записывается как (−∞; −1,96)∪(1,96; +∞)(-\infty;\ -1{,}96) \cup (1{,}96;\ +\infty). Наблюдаемое значение zнабл=1,80z_{\text{набл}} = 1{,}80 в неё не попадает, значит оснований отвергнуть H0H_0 нет: отклонение веса на 0,9 г статистически незначимо. Калькулятор сверху показывает эту же картинку: закрашенные хвосты и есть критическая область, синяя линия - наблюдаемая статистика.

Решение по шагам

Шаг 1. Записываем пару гипотез. Нулевая гипотеза всегда утверждает отсутствие сдвига: H0:a=500H_0: a = 500 г. Альтернатива отражает то, что нас насторожило бы: автомат может как недосыпать, так и пересыпать кофе, и оба случая одинаково плохи, поэтому H1:a≠500H_1: a \neq 500 г. Именно этот выбор, сделанный до расчётов, и определит форму критической области. Как ставится эта пара и почему нельзя подбирать H1H_1 после взгляда на данные, подробно разобрано в статье про нулевую и альтернативную гипотезы.

Шаг 2. Считаем наблюдаемое значение статистики. Сигма известна, поэтому работает нормированное отклонение выборочного среднего:

zнабл=xˉ−a0σ/n.z_{\text{набл}} = \frac{\bar x - a_0}{\sigma / \sqrt{n}}.

Стандартная ошибка среднего равна

σn=5100=510=0,5 г,\frac{\sigma}{\sqrt{n}} = \frac{5}{\sqrt{100}} = \frac{5}{10} = 0{,}5 \ \text{г},

тогда

zнабл=500,9−5000,5=0,90,5=1,80.z_{\text{набл}} = \frac{500{,}9 - 500}{0{,}5} = \frac{0{,}9}{0{,}5} = 1{,}80.

Смысл числа простой: выборочное среднее ушло от номинала на 1,8 стандартной ошибки.

Шаг 3. Определяем вид области по альтернативе. Знак ≠\neq означает, что H0H_0 опровергают отклонения в обе стороны, поэтому область двусторонняя и симметричная. Вероятность α=0,05\alpha = 0{,}05 делится поровну между хвостами: по α/2=0,025\alpha / 2 = 0{,}025 слева и справа.

Шаг 4. Ищем критическую точку. Нужна такая точка zкрz_{\text{кр}}, правее которой у стандартного нормального закона остаётся ровно 0,0250{,}025 вероятности. Через табличную (усечённую) функцию Лапласа это условие записывается так:

Φ(zкр)=1−α2=1−0,052=0,475.\Phi(z_{\text{кр}}) = \frac{1 - \alpha}{2} = \frac{1 - 0{,}05}{2} = 0{,}475.

В таблице значению 0,47500{,}4750 отвечает аргумент 1,961{,}96. Это и есть критическая точка: zкр=1,96z_{\text{кр}} = 1{,}96.

Шаг 5. Записываем область и сравниваем. Критическая область складывается из двух лучей:

zнабл∈(−∞; −1,96)∪(1,96; +∞),z_{\text{набл}} \in (-\infty;\ -1{,}96) \cup (1{,}96;\ +\infty),

а промежуток [−1,96; 1,96][-1{,}96;\ 1{,}96] называется областью принятия гипотезы. Наблюдаемое значение 1,801{,}80 меньше 1,961{,}96, то есть лежит в области принятия.

Ответ: критическая область (−∞; −1,96)∪(1,96; +∞)(-\infty;\ -1{,}96) \cup (1{,}96;\ +\infty); так как zнабл=1,80z_{\text{набл}} = 1{,}80 в неё не попадает, гипотеза H0:a=500H_0: a = 500 г на уровне значимости 0,05 не отвергается. Достигнутый уровень значимости p=2(1−F(1,80))=0,0719p = 2\bigl(1 - F(1{,}80)\bigr) = 0{,}0719 больше 0,050{,}05 и подтверждает тот же вывод.

Формула критической точки и откуда она берётся

Критическая область - это множество значений статистики критерия, при которых нулевую гипотезу отвергают. Её задают не произвольно: требуют, чтобы вероятность случайно попасть в неё при верной H0H_0 равнялась заранее выбранному уровню значимости:

P(K∈W∣H0)=α.P\bigl(K \in W \mid H_0\bigr) = \alpha .

Здесь KK - статистика критерия, WW - критическая область. Отсюда и берётся критическая точка: это квантиль распределения статистики уровня 1−α1 - \alpha для одного хвоста или уровня 1−α/21 - \alpha/2 для каждого из двух. Ошибиться в выборе уровня - значит сдвинуть границу и получить другой ответ при тех же данных.

Вероятность α\alpha - это риск ошибки первого рода, то есть отвергнуть верную гипотезу. Чем меньше α\alpha, тем дальше в хвост уезжает критическая точка и тем труднее отвергнуть H0H_0: при α=0,01\alpha = 0{,}01 двусторонняя точка равна уже 2,582{,}58. Обратная сторона такой осторожности - рост вероятности пропустить реальный сдвиг, и об этом размене рассказывает разбор мощности статистического критерия.

Три вида области: как выбрать по альтернативе

Вид области определяется исключительно альтернативной гипотезой, а не данными и не тем, в какую сторону отклонилось выборочное среднее. Сводка для нормальной статистики при α=0,05\alpha = 0{,}05 выглядит так:

АльтернативаВид областиУсловие отверженияТочка при α=0,05\alpha = 0{,}05
H1:a≠a0H_1: a \neq a_0двусторонняя∣zнабл∣>zкр\lvert z_{\text{набл}} \rvert > z_{\text{кр}}1,961{,}96
H1:a>a0H_1: a > a_0правосторонняяzнабл>zкрz_{\text{набл}} > z_{\text{кр}}1,6451{,}645
H1:a<a0H_1: a < a_0левосторонняяzнабл<−zкрz_{\text{набл}} < -z_{\text{кр}}−1,645-1{,}645

Разница принципиальна, и наш пример это показывает. Если бы завод интересовал только перерасход кофе, альтернатива была бы H1:a>500H_1: a > 500, вся вероятность 0,050{,}05 ушла бы в правый хвост, критическая точка нашлась бы из условия Φ(zкр)=0,5−α=0,45\Phi(z_{\text{кр}}) = 0{,}5 - \alpha = 0{,}45 и равнялась 1,6451{,}645. Тогда zнабл=1,80>1,645z_{\text{набл}} = 1{,}80 > 1{,}645, и та же самая выборка привела бы к противоположному выводу: гипотезу пришлось бы отвергнуть.

Отсюда правило, которое экономит баллы на контрольной: альтернатива формулируется из условия задачи до расчётов. Подогнать её под уже посчитанную статистику - методическая ошибка, а не находчивость. Переключи чипы в калькуляторе сверху и посмотри, как при неизменных числах вывод меняется вместе с видом области.

Та же область в единицах выборочного среднего

Критическую область удобно переводить обратно в граммы, килограммы или миллиметры: так она превращается в понятные границы приёмки. Границу получают из равенства xˉ=a0±zкр⋅σ/n\bar x = a_0 \pm z_{\text{кр}} \cdot \sigma / \sqrt{n}:

xˉкр=500±1,96⋅0,5=500±0,98,\bar x_{\text{кр}} = 500 \pm 1{,}96 \cdot 0{,}5 = 500 \pm 0{,}98,

то есть гипотезу отвергают при xˉ<499,02\bar x < 499{,}02 г или xˉ>500,98\bar x > 500{,}98 г. Наблюдённые 500,9500{,}9 г до границы не дотянули четыре сотых грамма - формально автомат настроен верно, хотя запас крошечный.

Такая запись полезна и на производстве: границы 499,02499{,}02 и 500,98500{,}98 сразу ложатся на контрольную карту, и оператору не нужно каждый раз считать zz. Для правосторонней альтернативы граница была бы единственной: 500+1,645⋅0,5=500,82500 + 1{,}645 \cdot 0{,}5 = 500{,}82 г, и среднее 500,9500{,}9 г её уже превысило бы.

Если сигма неизвестна или распределение несимметрично

Когда генеральное среднее квадратическое отклонение по паспорту неизвестно и его заменяют исправленным выборочным ss, нормальный закон сменяется распределением Стьюдента с ν=n−1\nu = n - 1 степенями свободы. Логика построения области не меняется, меняется только таблица: для ν=99\nu = 99 двусторонняя точка равна tкр=1,98t_{\text{кр}} = 1{,}98 вместо 1,961{,}96, и вывод по нашим числам остаётся прежним. А вот на малой выборке разрыв заметен: при ν=15\nu = 15 та же точка равна уже 2,1312{,}131, поэтому переносить 1,961{,}96 на выборку из 16 измерений нельзя. Полный расчёт такой статистики с сырыми данными разобран в задаче про критерий Стьюдента.

Отдельный случай - критерии, у которых статистика неотрицательна и распределена несимметрично: хи-квадрат Пирсона, критерий Фишера. Для них критическая область почти всегда правосторонняя, даже если содержательная альтернатива выглядит двусторонней: большое расхождение с теорией даёт большое значение статистики независимо от знака отклонений. Как такая область работает в проверке согласия, показано в разборе проверки нормальности распределения.

Частые ошибки

  • Вид области выбирают по знаку отклонения, а не по альтернативе. Увидели, что среднее больше номинала, и взяли правостороннюю область. Так уровень значимости незаметно удваивается: фактический риск ошибки становится 0,100{,}10 вместо 0,050{,}05.
  • Уровень значимости не делят пополам. Для двусторонней области ищут точку по α\alpha, а не по α/2\alpha/2, и получают 1,6451{,}645 вместо 1,961{,}96 - гипотеза отвергается там, где оснований нет.
  • Путают аргумент таблицы Лапласа. Таблица усечённая: Φ(x)\Phi(x) меняется от 00 до 0,50{,}5, поэтому искать надо 0,4750{,}475, а не 0,9750{,}975. Число 0,9750{,}975 относится к полной функции распределения.
  • Забывают корень из объёма выборки. Делят разность средних на σ\sigma, а не на σ/n\sigma/\sqrt{n}. При n=100n = 100 статистика занижается в десять раз, и в критическую область не попадёт уже ничего.
  • Сравнивают с критической точкой само среднее. Число 500,9500{,}9 сопоставляют с 1,961{,}96 напрямую. Сравнивать можно либо статистику с точкой, либо среднее с пересчитанной границей 500,98500{,}98, но не смешивать шкалы.
  • Меняют уровень значимости после расчёта. Если при α=0,05\alpha = 0{,}05 гипотеза устояла, то брать α=0,10\alpha = 0{,}10 ради нужного вывода нельзя: уровень фиксируют до эксперимента.

FAQ

Чем критическая область отличается от области принятия? Это дополняющие друг друга множества значений статистики. В критическую область попадают значения, слишком редкие при верной H0H_0: их суммарная вероятность равна α\alpha. Всё остальное - область принятия, где данные не противоречат нулевой гипотезе. Попадание в область принятия не доказывает H0H_0, оно лишь говорит, что доказательств против неё не хватило.

Можно ли обойтись без таблиц и считать по p-value? Да, это тот же критерий в другой записи. Правило «p<αp < \alpha - отвергаем» эквивалентно попаданию статистики в критическую область. В нашей задаче p=0,0719>0,05p = 0{,}0719 > 0{,}05, и вывод совпал с полученным по области. Таблицы нужны, когда в работе требуют показать критическую точку явно.

Как выбрать уровень значимости? По цене ошибки. Стандарт учебных задач и большинства технических приложений - 0,050{,}05; там, где ложная тревога дорого стоит (медицина, приёмочный контроль ответственных изделий), берут 0,010{,}01 или 0,0050{,}005. Уровень назначают до сбора данных и в отчёте указывают явно.

Что делать, если наблюдаемое значение попало ровно на границу? Формально граница относится к области принятия, то есть строгое неравенство zнабл>zкрz_{\text{набл}} > z_{\text{кр}} не выполнено и гипотеза не отвергается. Практически такое совпадение означает, что данных на уверенный вывод не хватает: разумнее увеличить выборку, чем спорить о знаке неравенства.

Коротко

  1. Записать H0H_0 и H1H_1 до расчётов: вид критической области задаёт именно альтернатива, а не знак наблюдённого отклонения.
  2. Посчитать наблюдаемое значение статистики: zнабл=(xˉ−a0)/(σ/n)=(500,9−500)/0,5=1,80z_{\text{набл}} = (\bar x - a_0) / (\sigma / \sqrt{n}) = (500{,}9 - 500)/0{,}5 = 1{,}80.
  3. Разделить уровень значимости по хвостам: для двусторонней области по α/2=0,025\alpha/2 = 0{,}025, для односторонней вся α\alpha в одном хвосте.
  4. Найти критическую точку по таблице: Φ(zкр)=0,475\Phi(z_{\text{кр}}) = 0{,}475 даёт zкр=1,96z_{\text{кр}} = 1{,}96; область равна (−∞; −1,96)∪(1,96; +∞)(-\infty;\ -1{,}96) \cup (1{,}96;\ +\infty), в граммах - вне промежутка от 499,02499{,}02 до 500,98500{,}98.
  5. Сравнить и сделать вывод: 1,801{,}80 в область не попадает, гипотеза H0:a=500H_0: a = 500 г на уровне 0,050{,}05 не отвергается.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Матстатистика

Как найти уравнение линейной регрессии: пример решения

Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.

Матстатистика

Как найти несмещённую оценку дисперсии: решение

Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.

Матстатистика

Как вычислить скользящую среднюю: пример расчёта

Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.

Матстатистика

Как составить вариационный ряд: пошаговое решение

Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.

Матстатистика

Как построить гистограмму частот: разбор задачи

Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.

Матстатистика

Как построить эмпирическую функцию распределения: пример

Как построить эмпирическую функцию распределения выборки: частости, накопленные частости, кусочная запись F*(x), ступенчатый график со скачками, свойства и частые ошибки.