EssayAI
Блог
Блог

Как найти критерий Стьюдента: расчёт по двум выборкам

Запрос

Дано: прочность образцов из двух партий, МПа. Первая партия: 52, 55, 58, 54, 60, 57, 53, 59. Вторая: 49, 51, 54, 50, 55, 53, 52. Найти: наблюдаемое значение критерия Стьюдента, число степеней свободы и вывод о равенстве генеральных средних при уровне значимости 0,05.

Порядок действий такой: сначала по сырым числам считают выборочные средние и исправленные дисперсии, затем объединяют дисперсии в одну оценку и делят разность средних на её стандартную ошибку. Ответ получится такой: tнабл≈2,97t_{\text{набл}} \approx 2{,}97 при k=13k = 13 и tкрит=2,16t_{\text{крит}} = 2{,}16, то есть различие средних значимо и гипотеза о равенстве отвергается. Калькулятор сверху повторит этот расчёт для любых двух рядов чисел: вставь свои значения, и он покажет средние, дисперсии, tнаблt_{\text{набл}}, степени свободы и вывод.

Решение по шагам

Дано. Две независимые выборки:

ПартияЗначения, МПаОбъём
Первая52, 55, 58, 54, 60, 57, 53, 59n1=8n_1 = 8
Вторая49, 51, 54, 50, 55, 53, 52n2=7n_2 = 7

Найти: tнаблt_{\text{набл}}, число степеней свободы kk, критическую точку tкритt_{\text{крит}} и вывод о гипотезе H0:a1=a2H_0: a_1 = a_2 при α=0,05\alpha = 0{,}05.

Шаг 1. Выборочные средние. Складываем значения каждой выборки и делим на её объём:

xˉ=52+55+58+54+60+57+53+598=4488=56,yˉ=49+51+54+50+55+53+527=3647=52.\bar{x} = \frac{52 + 55 + 58 + 54 + 60 + 57 + 53 + 59}{8} = \frac{448}{8} = 56, \qquad \bar{y} = \frac{49 + 51 + 54 + 50 + 55 + 53 + 52}{7} = \frac{364}{7} = 52.

Разность средних равна 4 МПа. Сама по себе она ещё ничего не доказывает: нужно понять, велика ли эта разность на фоне разброса внутри партий.

Шаг 2. Исправленные выборочные дисперсии. Считаем суммы квадратов отклонений от своих средних и делим на n−1n - 1, а не на nn:

∑(xi−xˉ)2=16+1+4+4+16+1+9+9=60,sx2=607≈8,571,∑(yi−yˉ)2=9+1+4+4+9+1+0=28,sy2=286≈4,667.\begin{aligned} \sum (x_i - \bar{x})^2 &= 16 + 1 + 4 + 4 + 16 + 1 + 9 + 9 = 60, &\quad s_x^2 &= \frac{60}{7} \approx 8{,}571, \\ \sum (y_i - \bar{y})^2 &= 9 + 1 + 4 + 4 + 9 + 1 + 0 = 28, &\quad s_y^2 &= \frac{28}{6} \approx 4{,}667. \end{aligned}

Деление на n−1n - 1 здесь принципиально: несмещённая оценка дисперсии нужна, чтобы статистика имела распределение Стьюдента. Подробный разбор этого шага с проверкой по другой формуле есть в разборе про то, как вычислить дисперсию.

Шаг 3. Проверка однородности дисперсий. Классический критерий Стьюдента предполагает, что генеральные дисперсии равны. Отношение большей исправленной дисперсии к меньшей:

Fнабл=sx2sy2=8,5714,667≈1,84.F_{\text{набл}} = \frac{s_x^2}{s_y^2} = \frac{8{,}571}{4{,}667} \approx 1{,}84.

При k1=7k_1 = 7 и k2=6k_2 = 6 критическая точка Fкрит(0,05;7;6)=4,21F_{\text{крит}}(0{,}05; 7; 6) = 4{,}21. Раз 1,84<4,211{,}84 < 4{,}21, различие дисперсий незначимо, и объединять их можно. Сам этот критерий разобран в статье про критерий Фишера.

Шаг 4. Объединённая дисперсия. Усредняем дисперсии с весами по числу степеней свободы каждой выборки:

sоб2=(n1−1)sx2+(n2−1)sy2n1+n2−2=60+288+7−2=8813≈6,769,sоб≈2,602.s_{\text{об}}^2 = \frac{(n_1 - 1)s_x^2 + (n_2 - 1)s_y^2}{n_1 + n_2 - 2} = \frac{60 + 28}{8 + 7 - 2} = \frac{88}{13} \approx 6{,}769, \qquad s_{\text{об}} \approx 2{,}602.

Обрати внимание: в числителе стоят те же суммы квадратов отклонений, что и в шаге 2, поэтому промежуточное деление на n−1n - 1 можно не делать вовсе, если сразу писать суммы.

Шаг 5. Наблюдаемое значение критерия. Разность средних делим на стандартную ошибку этой разности:

tнабл=xˉ−yˉsоб1n1+1n2=56−522,602⋅18+17=42,602⋅0,5175=41,347≈2,97.t_{\text{набл}} = \frac{\bar{x} - \bar{y}}{s_{\text{об}} \sqrt{\dfrac{1}{n_1} + \dfrac{1}{n_2}}} = \frac{56 - 52}{2{,}602 \cdot \sqrt{\dfrac{1}{8} + \dfrac{1}{7}}} = \frac{4}{2{,}602 \cdot 0{,}5175} = \frac{4}{1{,}347} \approx 2{,}97.

Шаг 6. Степени свободы и критическая точка. Число степеней свободы равно суммарному объёму выборок минус два оценённых средних:

k=n1+n2−2=8+7−2=13.k = n_1 + n_2 - 2 = 8 + 7 - 2 = 13.

Гипотеза двусторонняя (заранее не известно, какая партия прочнее), поэтому по таблице критических точек Стьюдента для двусторонней области при α=0,05\alpha = 0{,}05 и k=13k = 13 находим tкрит=2,16t_{\text{крит}} = 2{,}16.

Шаг 7. Вывод. Сравниваем модуль наблюдаемого значения с критическим: ∣tнабл∣=2,97>2,16=tкрит|t_{\text{набл}}| = 2{,}97 > 2{,}16 = t_{\text{крит}}. Наблюдаемое значение попало в критическую область, значит нулевая гипотеза о равенстве генеральных средних отвергается. Достигнутый уровень значимости p≈0,011p \approx 0{,}011, что меньше 0,05 и подтверждает тот же вывод. Полезная деталь: при α=0,01\alpha = 0{,}01 критическая точка равна 3,01, и то же самое значение 2,97 гипотезу уже не отвергло бы, поэтому уровень значимости всегда указывают в ответе.

Ответ. tнабл≈2,97t_{\text{набл}} \approx 2{,}97, k=13k = 13, tкрит=2,16t_{\text{крит}} = 2{,}16 при α=0,05\alpha = 0{,}05; так как ∣tнабл∣>tкрит|t_{\text{набл}}| > t_{\text{крит}}, средняя прочность партий различается значимо, первая партия прочнее на 4±2,914 \pm 2{,}91 МПа (95-процентный доверительный интервал разности от 1,09 до 6,91 МПа).

Формула критерия Стьюдента и откуда она берётся

В числителе стоит разность выборочных средних, в знаменателе - её стандартная ошибка. Если бы генеральная дисперсия σ2\sigma^2 была известна, ошибка разности равнялась бы σ1/n1+1/n2\sigma\sqrt{1/n_1 + 1/n_2}, а статистика имела бы стандартное нормальное распределение. Но σ\sigma неизвестна, вместо неё подставляют оценку sобs_{\text{об}}, и от этой замены распределение «расплывается»: у него более тяжёлые хвосты, чем у нормального.

Это и есть распределение Стьюдента с параметром kk. Чем меньше выборки, тем осторожнее критерий: при k=5k = 5 порог равен 2,571, при k=30k = 30 уже 2,042, а при бесконечно больших выборках он сходится к нормальной квантили 1,96. Откуда берётся сам параметр и как он меняет форму кривой, разобрано в статье про распределение Стьюдента и степени свободы.

Число степеней свободы считается по простому правилу: из общего объёма данных вычитают число оценённых по этим же данным параметров. Здесь оценены два средних, xˉ\bar{x} и yˉ\bar{y}, поэтому k=n1+n2−2k = n_1 + n_2 - 2. В объединённой дисперсии каждая выборка приносит свои ni−1n_i - 1 степеней свободы, и в сумме получается то же самое число.

Таблица критических значений: как выбрать строку и столбец

Строку выбирают по числу степеней свободы, столбец - по уровню значимости и виду критической области. Фрагмент таблицы для двусторонней области:

kkα=0,10\alpha = 0{,}10α=0,05\alpha = 0{,}05α=0,01\alpha = 0{,}01
81,8602,3063,355
101,8122,2283,169
121,7822,1793,055
131,7712,1603,012
151,7532,1312,947
201,7252,0862,845
301,6972,0422,750

Двусторонняя область нужна, когда проверяется гипотеза H1:a1≠a2H_1: a_1 \neq a_2, то есть направление различия заранее не задано. Если по смыслу задачи важно только превышение (H1:a1>a2H_1: a_1 > a_2), критическая область односторонняя, и порог берут мягче: при k=13k = 13 и α=0,05\alpha = 0{,}05 это 1,771 - значение из столбца α=0,10\alpha = 0{,}10 двусторонней таблицы. Отсюда практическое правило: односторонний порог при уровне α\alpha равен двустороннему при 2α2\alpha.

Если таблицы под рукой нет, критическую точку даёт функция СТЬЮДЕНТ.ОБР.2Х в Excel: она принимает вероятность и число степеней свободы и возвращает ровно двустороннее значение. Значение tнаблt_{\text{набл}} при этом всегда сравнивают по модулю: знак зависит лишь от того, какую выборку записали первой.

Одновыборочный и парный критерий Стьюдента

Под названием «критерий Стьюдента» скрываются три разные задачи, и путать их нельзя. Разобранный выше вариант - для двух независимых выборок. Второй вариант, одновыборочный, сравнивает среднее одной выборки с заданным числом a0a_0 (номиналом, нормой, паспортным значением):

tнабл=xˉ−a0s/n,k=n−1.t_{\text{набл}} = \frac{\bar{x} - a_0}{s / \sqrt{n}}, \qquad k = n - 1.

Третий вариант - парный, когда наблюдения связаны попарно: одни и те же объекты измерены до и после воздействия. Тогда считают разности di=xi−yid_i = x_i - y_i, и задача сводится к одновыборочной проверке гипотезы H0:ad=0H_0: a_d = 0:

tнабл=dˉsd/n,k=n−1,t_{\text{набл}} = \frac{\bar{d}}{s_d / \sqrt{n}}, \qquad k = n - 1,

где nn - число пар. Парный вариант чувствительнее независимого: он убирает разброс между объектами и оставляет только эффект воздействия. Применять к парным данным двухвыборочный критерий - грубая ошибка, которая обычно занижает tнаблt_{\text{набл}} и «прячет» реальный эффект.

Условия применимости и что делать при их нарушении

Классический критерий Стьюдента требует трёх вещей: наблюдения независимы, выборки взяты из нормально распределённых совокупностей, генеральные дисперсии равны. Нормальность на малых выборках проверяют критерием согласия - как это делается по шагам, показано в разборе про то, как проверить нормальность распределения.

Если дисперсии заметно различаются (критерий Фишера отверг однородность), объединять их нельзя: вместо этого берут модификацию Уэлча со своей формулой степеней свободы. Разбор этого случая и сравнение двух подходов - в статье про проверку гипотезы о равенстве двух средних. Если же нарушена нормальность, переходят к непараметрическому критерию Манна-Уитни, который работает с рангами и не требует никакого закона распределения.

Частые ошибки

  • Делят сумму квадратов отклонений на nn вместо n−1n - 1. Дисперсия получается смещённой и заниженной, знаменатель критерия уменьшается, а tнаблt_{\text{набл}} раздувается. В критерии Стьюдента используются только исправленные дисперсии.
  • Берут k=n1+n2k = n_1 + n_2 или k=n−1k = n - 1 по одной выборке. Для двух независимых выборок степеней свободы ровно n1+n2−2n_1 + n_2 - 2; здесь это 13, а не 15 и не 7.
  • Путают одностороннюю и двустороннюю критическую область. При k=13k = 13 и α=0,05\alpha = 0{,}05 пороги различаются почти на четверть: 2,160 против 1,771. Вид области определяется формулировкой H1H_1 и выбирается до расчётов, а не после.
  • Сравнивают tнаблt_{\text{набл}} с критической точкой по знаку, а не по модулю. Если первой записать вторую выборку, получится −2,97-2{,}97, и вывод обязан остаться прежним.
  • Считают объединённую дисперсию как простое среднее sx2s_x^2 и sy2s_y^2. При разных объёмах выборок веса ni−1n_i - 1 обязательны, иначе меньшая выборка получает незаслуженно большой вклад.
  • Трактуют «не отвергли H0H_0» как доказательство равенства средних. Это означает лишь, что данных не хватило: при α=0,01\alpha = 0{,}01 та же выборка гипотезу не отвергает, хотя различие никуда не делось.

FAQ

Что делать, если в условии даны не сами числа, а средние и дисперсии? Шаги 1 и 2 просто пропускаются. Суммы квадратов отклонений восстанавливаются как (ni−1)si2(n_i - 1)s_i^2, дальше расчёт идёт с шага 4 без изменений. Если дана не исправленная, а обычная выборочная дисперсия DвD_{\text{в}}, её сначала пересчитывают: s2=nn−1Dвs^2 = \dfrac{n}{n-1} D_{\text{в}}.

Какой уровень значимости брать, если он не указан? Стандарт учебных задач - 0,05. В ответе уровень значимости указывают обязательно, потому что вывод от него зависит: наши 2,97 отвергают гипотезу при 0,05 и не отвергают при 0,01.

Можно ли применять критерий Стьюдента к выборкам разного объёма? Да, формула изначально рассчитана на разные n1n_1 и n2n_2 - именно поэтому в знаменателе стоит 1/n1+1/n2\sqrt{1/n_1 + 1/n_2}, а дисперсии усредняются с весами. Ограничение другое: при сильно разных объёмах и одновременно разных дисперсиях классический вариант становится ненадёжным, и лучше брать модификацию Уэлча.

Как связаны критерий Стьюдента и p-значение? Это два способа сформулировать один вывод. Критическая точка отвечает на вопрос «попало ли значение в критическую область», а pp показывает вероятность получить такое или большее отклонение при верной H0H_0. Условия ∣tнабл∣>tкрит|t_{\text{набл}}| > t_{\text{крит}} и p<αp < \alpha эквивалентны: у нас p≈0,011<0,05p \approx 0{,}011 < 0{,}05.

Коротко

  1. Посчитать выборочные средние xˉ\bar{x} и yˉ\bar{y} и исправленные дисперсии sx2s_x^2, sy2s_y^2 с делением на n−1n - 1: получилось 56 и 52, 8,571 и 4,667.
  2. Проверить однородность дисперсий критерием Фишера: 1,84<4,211{,}84 < 4{,}21, объединять можно.
  3. Найти объединённую дисперсию sоб2=(n1−1)sx2+(n2−1)sy2n1+n2−2=6,769s_{\text{об}}^2 = \dfrac{(n_1-1)s_x^2 + (n_2-1)s_y^2}{n_1+n_2-2} = 6{,}769.
  4. Вычислить tнабл=xˉ−yˉsоб1/n1+1/n2=2,97t_{\text{набл}} = \dfrac{\bar{x}-\bar{y}}{s_{\text{об}}\sqrt{1/n_1 + 1/n_2}} = 2{,}97 и k=n1+n2−2=13k = n_1 + n_2 - 2 = 13.
  5. Сравнить с табличным tкрит(0,05;13)=2,16t_{\text{крит}}(0{,}05; 13) = 2{,}16: модуль больше порога, гипотеза о равенстве средних отвергается, различие прочности партий значимо.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Теория вероятностей

Как найти равномерное распределение: разбор задачи

Как найти равномерное распределение непрерывной величины на отрезке: плотность 1 делить на длину, функция распределения, мат. ожидание и дисперсия, вероятность попадания в интервал.

Теория вероятностей

Как найти квантиль распределения: пример расчёта

Как найти квантиль распределения: определение через функцию F(x), значение z по таблице Лапласа, переход к x = a + sigma z, квантиль Стьюдента и связь с доверительным интервалом.

Теория вероятностей

Как найти показательное распределение: разбор задачи

Как найти показательное распределение по параметру lambda: плотность и функция распределения, математическое ожидание и дисперсия, вероятность попадания в интервал, отсутствие последействия.

Теория вероятностей

Как найти производящую функцию: пример с решением

Разбор задачи: как найти производящую функцию дискретной случайной величины. Биномиальный пример n = 5, p = 0,4, расчёт M(X) и D(X) через производные, частые ошибки и FAQ.

Теория вероятностей

Как построить многоугольник распределения: пример

Как построить многоугольник распределения дискретной случайной величины: ряд распределения, проверка нормировки, точки ломаной, поиск M(X), D(X) и моды, частые ошибки, FAQ.

Теория вероятностей

Как вычислить ковариацию: разбор задачи по таблице

Разбор задачи: как вычислить ковариацию двух дискретных величин по таблице совместного распределения, проверить ответ вторым способом и перейти к коэффициенту корреляции.