Как найти критическую область: разбор с примером
Дано: фасовочный автомат настроен на г, генеральное среднее квадратическое отклонение г известно из паспорта линии; контрольная выборка пачек дала среднее г. Найти: критическую область при уровне значимости и проверить гипотезу против альтернативы .
Критическая область строится в три хода: по альтернативе определяем, сколько у неё хвостов, по уровню значимости берём критическую точку из таблицы, а затем сравниваем с ней наблюдаемое значение статистики. Здесь альтернатива двусторонняя, поэтому область состоит из двух хвостов по вероятности в каждом, критическая точка равна , а сама область записывается как . Наблюдаемое значение в неё не попадает, значит оснований отвергнуть нет: отклонение веса на 0,9 г статистически незначимо. Калькулятор сверху показывает эту же картинку: закрашенные хвосты и есть критическая область, синяя линия - наблюдаемая статистика.
Решение по шагам
Шаг 1. Записываем пару гипотез. Нулевая гипотеза всегда утверждает отсутствие сдвига: г. Альтернатива отражает то, что нас насторожило бы: автомат может как недосыпать, так и пересыпать кофе, и оба случая одинаково плохи, поэтому г. Именно этот выбор, сделанный до расчётов, и определит форму критической области. Как ставится эта пара и почему нельзя подбирать после взгляда на данные, подробно разобрано в статье про нулевую и альтернативную гипотезы.
Шаг 2. Считаем наблюдаемое значение статистики. Сигма известна, поэтому работает нормированное отклонение выборочного среднего:
Стандартная ошибка среднего равна
тогда
Смысл числа простой: выборочное среднее ушло от номинала на 1,8 стандартной ошибки.
Шаг 3. Определяем вид области по альтернативе. Знак означает, что опровергают отклонения в обе стороны, поэтому область двусторонняя и симметричная. Вероятность делится поровну между хвостами: по слева и справа.
Шаг 4. Ищем критическую точку. Нужна такая точка , правее которой у стандартного нормального закона остаётся ровно вероятности. Через табличную (усечённую) функцию Лапласа это условие записывается так:
В таблице значению отвечает аргумент . Это и есть критическая точка: .
Шаг 5. Записываем область и сравниваем. Критическая область складывается из двух лучей:
а промежуток называется областью принятия гипотезы. Наблюдаемое значение меньше , то есть лежит в области принятия.
Ответ: критическая область ; так как в неё не попадает, гипотеза г на уровне значимости 0,05 не отвергается. Достигнутый уровень значимости больше и подтверждает тот же вывод.
Формула критической точки и откуда она берётся
Критическая область - это множество значений статистики критерия, при которых нулевую гипотезу отвергают. Её задают не произвольно: требуют, чтобы вероятность случайно попасть в неё при верной равнялась заранее выбранному уровню значимости:
Здесь - статистика критерия, - критическая область. Отсюда и берётся критическая точка: это квантиль распределения статистики уровня для одного хвоста или уровня для каждого из двух. Ошибиться в выборе уровня - значит сдвинуть границу и получить другой ответ при тех же данных.
Вероятность - это риск ошибки первого рода, то есть отвергнуть верную гипотезу. Чем меньше , тем дальше в хвост уезжает критическая точка и тем труднее отвергнуть : при двусторонняя точка равна уже . Обратная сторона такой осторожности - рост вероятности пропустить реальный сдвиг, и об этом размене рассказывает разбор мощности статистического критерия.
Три вида области: как выбрать по альтернативе
Вид области определяется исключительно альтернативной гипотезой, а не данными и не тем, в какую сторону отклонилось выборочное среднее. Сводка для нормальной статистики при выглядит так:
| Альтернатива | Вид области | Условие отвержения | Точка при |
|---|---|---|---|
| двусторонняя | |||
| правосторонняя | |||
| левосторонняя |
Разница принципиальна, и наш пример это показывает. Если бы завод интересовал только перерасход кофе, альтернатива была бы , вся вероятность ушла бы в правый хвост, критическая точка нашлась бы из условия и равнялась . Тогда , и та же самая выборка привела бы к противоположному выводу: гипотезу пришлось бы отвергнуть.
Отсюда правило, которое экономит баллы на контрольной: альтернатива формулируется из условия задачи до расчётов. Подогнать её под уже посчитанную статистику - методическая ошибка, а не находчивость. Переключи чипы в калькуляторе сверху и посмотри, как при неизменных числах вывод меняется вместе с видом области.
Та же область в единицах выборочного среднего
Критическую область удобно переводить обратно в граммы, килограммы или миллиметры: так она превращается в понятные границы приёмки. Границу получают из равенства :
то есть гипотезу отвергают при г или г. Наблюдённые г до границы не дотянули четыре сотых грамма - формально автомат настроен верно, хотя запас крошечный.
Такая запись полезна и на производстве: границы и сразу ложатся на контрольную карту, и оператору не нужно каждый раз считать . Для правосторонней альтернативы граница была бы единственной: г, и среднее г её уже превысило бы.
Если сигма неизвестна или распределение несимметрично
Когда генеральное среднее квадратическое отклонение по паспорту неизвестно и его заменяют исправленным выборочным , нормальный закон сменяется распределением Стьюдента с степенями свободы. Логика построения области не меняется, меняется только таблица: для двусторонняя точка равна вместо , и вывод по нашим числам остаётся прежним. А вот на малой выборке разрыв заметен: при та же точка равна уже , поэтому переносить на выборку из 16 измерений нельзя. Полный расчёт такой статистики с сырыми данными разобран в задаче про критерий Стьюдента.
Отдельный случай - критерии, у которых статистика неотрицательна и распределена несимметрично: хи-квадрат Пирсона, критерий Фишера. Для них критическая область почти всегда правосторонняя, даже если содержательная альтернатива выглядит двусторонней: большое расхождение с теорией даёт большое значение статистики независимо от знака отклонений. Как такая область работает в проверке согласия, показано в разборе проверки нормальности распределения.
Частые ошибки
- Вид области выбирают по знаку отклонения, а не по альтернативе. Увидели, что среднее больше номинала, и взяли правостороннюю область. Так уровень значимости незаметно удваивается: фактический риск ошибки становится вместо .
- Уровень значимости не делят пополам. Для двусторонней области ищут точку по , а не по , и получают вместо - гипотеза отвергается там, где оснований нет.
- Путают аргумент таблицы Лапласа. Таблица усечённая: меняется от до , поэтому искать надо , а не . Число относится к полной функции распределения.
- Забывают корень из объёма выборки. Делят разность средних на , а не на . При статистика занижается в десять раз, и в критическую область не попадёт уже ничего.
- Сравнивают с критической точкой само среднее. Число сопоставляют с напрямую. Сравнивать можно либо статистику с точкой, либо среднее с пересчитанной границей , но не смешивать шкалы.
- Меняют уровень значимости после расчёта. Если при гипотеза устояла, то брать ради нужного вывода нельзя: уровень фиксируют до эксперимента.
FAQ
Чем критическая область отличается от области принятия? Это дополняющие друг друга множества значений статистики. В критическую область попадают значения, слишком редкие при верной : их суммарная вероятность равна . Всё остальное - область принятия, где данные не противоречат нулевой гипотезе. Попадание в область принятия не доказывает , оно лишь говорит, что доказательств против неё не хватило.
Можно ли обойтись без таблиц и считать по p-value? Да, это тот же критерий в другой записи. Правило « - отвергаем» эквивалентно попаданию статистики в критическую область. В нашей задаче , и вывод совпал с полученным по области. Таблицы нужны, когда в работе требуют показать критическую точку явно.
Как выбрать уровень значимости? По цене ошибки. Стандарт учебных задач и большинства технических приложений - ; там, где ложная тревога дорого стоит (медицина, приёмочный контроль ответственных изделий), берут или . Уровень назначают до сбора данных и в отчёте указывают явно.
Что делать, если наблюдаемое значение попало ровно на границу? Формально граница относится к области принятия, то есть строгое неравенство не выполнено и гипотеза не отвергается. Практически такое совпадение означает, что данных на уверенный вывод не хватает: разумнее увеличить выборку, чем спорить о знаке неравенства.
Коротко
- Записать и до расчётов: вид критической области задаёт именно альтернатива, а не знак наблюдённого отклонения.
- Посчитать наблюдаемое значение статистики: .
- Разделить уровень значимости по хвостам: для двусторонней области по , для односторонней вся в одном хвосте.
- Найти критическую точку по таблице: даёт ; область равна , в граммах - вне промежутка от до .
- Сравнить и сделать вывод: в область не попадает, гипотеза г на уровне не отвергается.
Похожие задачи
Как найти уравнение линейной регрессии: пример решения
Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.
МатстатистикаКак найти несмещённую оценку дисперсии: решение
Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.
МатстатистикаКак вычислить скользящую среднюю: пример расчёта
Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.
МатстатистикаКак составить вариационный ряд: пошаговое решение
Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.
МатстатистикаКак построить гистограмму частот: разбор задачи
Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.
МатстатистикаКак построить эмпирическую функцию распределения: пример
Как построить эмпирическую функцию распределения выборки: частости, накопленные частости, кусочная запись F*(x), ступенчатый график со скачками, свойства и частые ошибки.