EssayAI
Блог
Блог

Как проверить значимость коэффициента регрессии

Запрос

Дано: линейная модель y^=12,4+0,85x\hat{y} = 12{,}4 + 0{,}85x, построенная по n=20n = 20 наблюдениям; стандартная ошибка коэффициента при факторе mb=0,24m_b = 0{,}24; уровень значимости α=0,05\alpha = 0{,}05. Найти: значим ли коэффициент bb.

Проверка делается t-критерием Стьюдента: считаем tнабл=b/mbt_{\text{набл}} = b / m_b и сравниваем с табличным значением при df=n−2df = n - 2 степенях свободы. Ответ: tнабл=3,54t_{\text{набл}} = 3{,}54 против tкр=2,101t_{\text{кр}} = 2{,}101, значит коэффициент значим при уровне 0,05, p-значение равно 0,0023, а доверительный интервал (0,346; 1,354) ноль не накрывает. Калькулятор сверху показывает ту же картину графически: зелёная вертикаль tнаблt_{\text{набл}} уходит в красную критическую область.

Решение по шагам

Дано. b=0,85b = 0{,}85, mb=0,24m_b = 0{,}24, n=20n = 20, α=0,05\alpha = 0{,}05.

Шаг 1. Сформулировать гипотезы. Нулевая гипотеза всегда утверждает, что фактор не влияет на результат, то есть истинный коэффициент при xx равен нулю:

H0: β=0,H1: β≠0.H_0:\ \beta = 0, \qquad H_1:\ \beta \ne 0.

Гипотеза двусторонняя: до расчёта мы не знаем, в какую сторону отклонится оценка, и одинаково готовы к положительному и отрицательному влиянию.

Шаг 2. Посчитать наблюдаемое значение критерия. Оно равно отношению самой оценки к её стандартной ошибке:

tнабл=bmb=0,850,24=3,5417≈3,54.t_{\text{набл}} = \frac{b}{m_b} = \frac{0{,}85}{0{,}24} = 3{,}5417 \approx 3{,}54.

Смысл числа простой: оценка коэффициента удалена от нуля на 3,54 своей стандартной ошибки. Чем больше это расстояние, тем труднее списать полученную связь на случайный разброс выборки.

Шаг 3. Найти число степеней свободы и критическое значение. В парной регрессии по выборке оценены два параметра, aa и bb, поэтому степеней свободы остаётся

df=n−2=20−2=18.df = n - 2 = 20 - 2 = 18.

По таблице Стьюдента для двусторонней критической области при α=0,05\alpha = 0{,}05 и df=18df = 18 получаем tкр=2,101t_{\text{кр}} = 2{,}101.

Шаг 4. Сравнить и сделать вывод. Сопоставляем модуль наблюдаемого значения с табличным:

∣tнабл∣=3,54>tкр=2,101.|t_{\text{набл}}| = 3{,}54 > t_{\text{кр}} = 2{,}101.

Наблюдаемое значение попало в критическую область, поэтому нулевая гипотеза отклоняется.

Шаг 5. Подтвердить выводом по p-значению. Двусторонняя вероятность получить по случайности ∣t∣≥3,54|t| \ge 3{,}54 при 18 степенях свободы равна p=0,0023p = 0{,}0023. Это меньше 0,05, и даже меньше 0,01, так что вывод устойчив и при более строгом уровне.

Шаг 6. Проверить доверительным интервалом. Интервал для коэффициента строится как оценка плюс-минус табличное значение на стандартную ошибку:

b±tкр⋅mb=0,85±2,101⋅0,24=0,85±0,504.b \pm t_{\text{кр}} \cdot m_b = 0{,}85 \pm 2{,}101 \cdot 0{,}24 = 0{,}85 \pm 0{,}504.

Границы: от 0,346 до 1,354. Ноль в интервал не попал, и это тот же вывод, что на шаге 4, только в другой форме. Подробный разбор построения границ есть в материале про доверительный интервал коэффициента регрессии.

Ответ: коэффициент b=0,85b = 0{,}85 статистически значим при уровне 0,05 (tнабл=3,54>tкр=2,101t_{\text{набл}} = 3{,}54 > t_{\text{кр}} = 2{,}101, p=0,0023p = 0{,}0023), фактор xx влияет на yy; с надёжностью 95 % истинный коэффициент лежит в интервале от 0,346 до 1,354.

Формула и откуда она берётся

Расшифруем буквы. Здесь bb - выборочная оценка коэффициента, полученная методом наименьших квадратов; mbm_b - её стандартная ошибка, то есть типичное отклонение оценки от истинного значения при повторных выборках; β\beta - неизвестный истинный коэффициент в генеральной совокупности.

Если ошибки модели нормальны и однородны по дисперсии, то оценка bb распределена нормально вокруг β\beta с разбросом mbm_b. Но истинную дисперсию ошибок мы не знаем и заменяем её выборочной, поэтому нормальное распределение превращается в распределение Стьюдента:

t=b−βmb∼t(n−2).t = \frac{b - \beta}{m_b} \sim t(n - 2).

При справедливости H0H_0 подставляем β=0\beta = 0 и получаем рабочую формулу tнабл=b/mbt_{\text{набл}} = b / m_b. Вычитание нуля и делает критерий таким коротким: в знаменателе остаётся только ошибка оценки.

Само значение mbm_b здесь дано условием, а его расчёт по остаточной дисперсии и размаху фактора разобран отдельно в статье про стандартную ошибку коэффициента регрессии. Число степеней свободы n−2n - 2 появляется потому, что на оценку остаточной дисперсии наложены два ограничения: по выборке уже найдены свободный член и коэффициент наклона. Чем меньше наблюдений, тем толще хвосты распределения Стьюдента и тем выше планка tкрt_{\text{кр}}: при df=18df = 18 она равна 2,101, при df=48df = 48 опускается до 2,011, а при большой выборке стремится к 1,96. Роль этого параметра подробно объясняется в разборе распределения Стьюдента.

Три формы одного вывода

В отчётах по регрессии вывод о значимости записывают тремя способами, и все они дают одинаковый результат для наших данных.

Форма записиЗначениеПорогВывод
t-статистикаtнабл=3,54t_{\text{набл}} = 3{,}54tкр=2,101t_{\text{кр}} = 2{,}101превышает, значим
p-значениеp=0,0023p = 0{,}0023α=0,05\alpha = 0{,}05меньше уровня, значим
Интервал 95 %(0,346; 1,354)нольне накрывает, значим

Совпадение не случайно: интервал строится через то же самое tкрt_{\text{кр}}, а p-значение - это площадь хвостов правее наблюдаемого tt. Если хотя бы один из трёх выводов разошёлся с остальными, где-то ошибка в арифметике или взяты разные степени свободы.

Есть и четвёртая форма. В парной регрессии квадрат t-статистики коэффициента равен F-критерию для всего уравнения: t2=3,542=12,54t^2 = 3{,}54^2 = 12{,}54. В множественной модели тот же квадрат совпадает с частным F-критерием значимости фактора, так что проверять коэффициент дважды разными критериями бессмысленно.

Что меняется при другой ошибке и другой выборке

Поменяем в калькуляторе одно число: пусть стандартная ошибка окажется не 0,24, а 0,45, а всё остальное останется прежним. Тогда tнабл=0,85/0,45=1,89t_{\text{набл}} = 0{,}85 / 0{,}45 = 1{,}89, что меньше того же порога 2,101. P-значение вырастает до 0,075, а интервал раздвигается до (−0,095; 1,795) и накрывает ноль. Вывод переворачивается: коэффициент незначим, хотя сама оценка 0,85 не изменилась ни на сотую.

Отсюда правило: значимость определяет не величина коэффициента, а его отношение к собственной ошибке. Большое по модулю bb при рыхлых данных может оказаться шумом, а маленькое при плотных - надёжным.

Объём выборки действует через две стороны сразу. Он уменьшает mbm_b и одновременно снижает планку tкрt_{\text{кр}}: при n=10n = 10 порог равен 2,306, при n=50n = 50 уже 2,011. Поэтому одна и та же по силе связь на 10 наблюдениях часто незначима, а на 50 значима. Если хочется увидеть, насколько плотно вообще лежат точки вокруг линии, полезно сначала построить корреляционное поле - на нём выброс и слабая связь видны до всяких критериев.

Уровень значимости работает как цена ошибки. Снижая α\alpha с 0,05 до 0,01, мы поднимаем порог с 2,101 до 2,878 и требуем более убедительных данных. В нашей задаче 3,54 проходит и этот рубеж, поэтому вывод о влиянии фактора устойчив.

Частые ошибки

  • Берут df=n−1df = n - 1 вместо n−2n - 2. Формула n−1n - 1 относится к среднему по одной выборке. В парной регрессии оценены два параметра, поэтому степеней свободы ровно n−2n - 2, а в множественной модели с kk факторами это n−k−1n - k - 1.
  • Сравнивают t с 1,96 при маленькой выборке. Значение 1,96 - предел нормального распределения при бесконечном nn. На 20 наблюдениях порог заметно выше, 2,101, и «пограничный» коэффициент с t=2,0t = 2{,}0 на самом деле незначим.
  • Путают одностороннюю и двустороннюю область. В стандартной задаче гипотеза H1:β≠0H_1: \beta \ne 0 двусторонняя, и в таблице берётся столбец для α\alpha двустороннего. Взяли односторонний - порог занижен, и незначимый коэффициент объявят значимым.
  • Делят на остаточную дисперсию вместо стандартной ошибки. В знаменателе стоит именно mbm_b - ошибка конкретного коэффициента, а не стандартная ошибка уравнения SостS_{\text{ост}} и не среднеквадратическое отклонение yy.
  • Значимый коэффициент читают как доказанную причину. Критерий говорит лишь о том, что связь не объясняется случайностью выборки. Направление причинности, пропущенные переменные и качество спецификации он не проверяет.
  • Теряют знак и сравнивают отрицательное t с положительным порогом. При b<0b < 0 сравнивать нужно модуль: t=−3,54t = -3{,}54 так же значим, как +3,54+3{,}54, просто влияние обратное.

FAQ

Что делать, если коэффициент незначим? Сначала проверить данные и спецификацию: возможно, связь нелинейна, есть выбросы или фактор дублирует другой из-за мультиколлинеарности. Если после этого tt по-прежнему мал, фактор из модели убирают и уравнение пересчитывают заново. Автоматически удалять незначимый коэффициент при первом же расчёте не стоит.

Проверять ли значимость свободного члена aa? Формально да, по той же схеме t=a/mat = a / m_a с теми же n−2n - 2 степенями свободы. Но содержательный вес у этой проверки меньше: свободный член часто описывает область значений xx, которых в выборке не было, и его незначимость не повод выбрасывать модель.

Откуда брать tкрt_{\text{кр}}, если таблицы под рукой нет? Критическое значение выдаёт калькулятор сверху для любого dfdf и любого из трёх уровней. В табличных процессорах это функция обратного распределения Стьюдента с двусторонней вероятностью, в статистических пакетах критическое значение и p-значение печатаются в самой сводке регрессии.

Чем эта проверка отличается от проверки значимости коэффициента корреляции? Расчёт похож, но статистики разные: у корреляции t=rn−2/1−r2t = r\sqrt{n-2}/\sqrt{1-r^2}, подробности в разборе значимости коэффициента корреляции. В парной регрессии выводы этих двух проверок совпадают всегда, потому что bb и rr отличаются только масштабным множителем. А вот t-критерий для сравнения двух средних устроен иначе, его схема разобрана в задаче про критерий Стьюдента.

Коротко

  1. Записать гипотезы: H0:β=0H_0: \beta = 0 против H1:β≠0H_1: \beta \ne 0.
  2. Посчитать tнабл=b/mb=0,85/0,24=3,54t_{\text{набл}} = b / m_b = 0{,}85 / 0{,}24 = 3{,}54.
  3. Найти df=n−2=18df = n - 2 = 18 и по таблице Стьюдента tкр=2,101t_{\text{кр}} = 2{,}101 при α=0,05\alpha = 0{,}05.
  4. Сравнить модули: 3,54>2,1013{,}54 > 2{,}101, нулевая гипотеза отклоняется, p-значение 0,0023.
  5. Ответ: коэффициент значим, фактор влияет на результат, доверительный интервал коэффициента от 0,346 до 1,354 ноль не накрывает.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Эконометрика

Как построить корреляционное поле: пример решения

Разбор задачи: строим корреляционное поле по 10 парам наблюдений, подбираем масштаб осей, читаем форму и тесноту связи, находим выброс и считаем коэффициент корреляции до и после его исключения.

Теория вероятностей

Как найти критерий Стьюдента: расчёт по двум выборкам

Разбор задачи на критерий Стьюдента: выборочные средние и дисперсии по сырым данным, объединённая дисперсия, t наблюдаемое, число степеней свободы и сравнение с t критическим по таблице.

Матстатистика

Как найти критическую область: разбор с примером

Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.

Орг./аналит. химия

Окисление перманганатом калия: реакции в трёх средах

Как написать окисление перманганатом калия в кислой, нейтральной и щелочной средах: продукты восстановления марганца, метод электронного баланса, расстановка коэффициентов, расчёт титранта.

Химия (физич./структурная)

Как найти активность иона: расчёт по Дебаю-Хюккелю

Как найти активность иона в растворе: ионная сила по всем ионам, коэффициент активности по предельному закону Дебая-Хюккеля, произведение f на c, разбор с числами и калькулятор.

Генетика

Как найти частоту генотипов: закон Харди-Вайнберга

Разбор задачи по популяционной генетике: как найти частоту генотипов по закону Харди-Вайнберга, формула p2 плюс 2pq плюс q2, расчёт числа особей и калькулятор частот.