EssayAI
Блог
Блог

Как найти несмещённую оценку дисперсии: решение

Запрос

Дано: выборка из n=10n = 10 измерений: 20; 24; 22; 26; 21; 25; 23; 27; 22; 2020;\ 24;\ 22;\ 26;\ 21;\ 25;\ 23;\ 27;\ 22;\ 20. Найти: несмещённую (исправленную) оценку дисперсии s2s^2, смещённую выборочную дисперсию DвD_{\text{в}} и стандартное отклонение ss.

Порядок один и тот же для любой выборки: выборочное среднее, сумма квадратов отклонений, а затем деление этой суммы на nn или на n−1n - 1 в зависимости от того, какую оценку просят. Ответ: Dв=5,4D_{\text{в}} = 5{,}4, s2=6,0s^2 = 6{,}0, s≈2,45s \approx 2{,}45. Калькулятор сверху считает обе оценки одновременно и показывает, из каких квадратов отклонений они собираются.

Решение по шагам

Шаг 1. Выборочное среднее. Дисперсия измеряет разброс вокруг среднего, поэтому среднее находится первым:

xˉ=1n∑i=1nxi=20+24+22+26+21+25+23+27+22+2010=23010=23.\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i = \frac{20 + 24 + 22 + 26 + 21 + 25 + 23 + 27 + 22 + 20}{10} = \frac{230}{10} = 23.

Среднее получилось целым, и это удача: дальше все отклонения будут целыми числами, а значит, округлять до самого конца не придётся.

Шаг 2. Отклонения и их квадраты. Удобнее всего свести расчёт в таблицу: слева значения, дальше отклонение от среднего, затем его квадрат.

xix_i20242226212523272220
xi−xˉx_i - \bar{x}-31-13-2204-1-3
(xi−xˉ)2(x_i - \bar{x})^291194401619

Сумма второй строки обязана быть нулём: −3+1−1+3−2+2+0+4−1−3=0-3 + 1 - 1 + 3 - 2 + 2 + 0 + 4 - 1 - 3 = 0. Это бесплатная проверка среднего, и если ноль не получился, дальше идти бессмысленно.

Шаг 3. Сумма квадратов отклонений. Складываем третью строку:

∑i=1n(xi−xˉ)2=9+1+1+9+4+4+0+16+1+9=54.\sum_{i=1}^{n} (x_i - \bar{x})^2 = 9 + 1 + 1 + 9 + 4 + 4 + 0 + 16 + 1 + 9 = 54.

Эта сумма и есть всё содержательное в задаче. Дальше остаётся только выбрать делитель.

Шаг 4. Смещённая выборочная дисперсия. Делим на объём выборки:

Dв=1n∑i=1n(xi−xˉ)2=5410=5,4.D_{\text{в}} = \frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2 = \frac{54}{10} = 5{,}4.

Шаг 5. Несмещённая (исправленная) оценка. Делим ту же сумму на n−1n - 1:

s2=1n−1∑i=1n(xi−xˉ)2=549=6,0.s^2 = \frac{1}{n - 1}\sum_{i=1}^{n} (x_i - \bar{x})^2 = \frac{54}{9} = 6{,}0.

Шаг 6. Стандартное отклонение. Дисперсия выражена в квадратах исходных единиц, поэтому для интерпретации из неё извлекают корень:

s=s2=6≈2,45.s = \sqrt{s^2} = \sqrt{6} \approx 2{,}45.

Ответ: Dв=5,4D_{\text{в}} = 5{,}4, s2=6,0s^2 = 6{,}0, s≈2,45s \approx 2{,}45.

Формула и откуда она берётся

Если бы истинное среднее aa генеральной совокупности было известно, никакой поправки не понадобилось бы: величина 1n∑(xi−a)2\frac{1}{n}\sum (x_i - a)^2 уже несмещённо оценивает дисперсию. Но aa неизвестно, и вместо него подставляют xˉ\bar{x}, посчитанное по той же самой выборке.

В этом вся суть смещения. Выборочное среднее подогнано под конкретные десять чисел: оно лежит ровно в центре именно этих наблюдений, и сумма квадратов отклонений от него минимальна. Отклонения от любой другой точки, включая истинное aa, дадут сумму больше. Поэтому DвD_{\text{в}} систематически занижает разброс, причём занижает предсказуемо:

M(Dв)=n−1n σ2.M\big(D_{\text{в}}\big) = \frac{n - 1}{n}\,\sigma^2.

Множитель n−1n\frac{n - 1}{n} и есть коэффициент занижения: при n=10n = 10 он равен 0,90{,}9, то есть в среднем смещённая оценка выдаёт лишь девять десятых настоящей дисперсии. Чтобы избавиться от этого множителя, обе части умножают на nn−1\frac{n}{n - 1} и получают оценку, у которой математическое ожидание совпадает с σ2\sigma^2:

s2=nn−1 Dв=1n−1∑i=1n(xi−xˉ)2,M(s2)=σ2.s^2 = \frac{n}{n - 1}\,D_{\text{в}} = \frac{1}{n - 1}\sum_{i=1}^{n} (x_i - \bar{x})^2, \qquad M\big(s^2\big) = \sigma^2.

Это и называют поправкой Бесселя, а саму оценку - исправленной или несмещённой. Формальное объяснение через степени свободы звучит так: из nn отклонений независимы только n−1n - 1, потому что их сумма обязана равняться нулю (мы проверили это на шаге 2). Зная девять отклонений, десятое можно восстановить, поэтому в знаменателе стоит девять, а не десять.

Отдельно стоит развести два свойства оценок, которые студенты обычно путают. Несмещённость - это про отсутствие систематической ошибки при любом фиксированном nn. Состоятельность - это про поведение при n→∞n \to \infty; ей обладают обе оценки, и смещённая тоже, потому что множитель n−1n\frac{n-1}{n} стремится к единице. Именно поэтому на длинных выборках разница между ответами перестаёт быть заметной.

Проверка вторым способом: через сумму квадратов

Считать отклонения по одному долго, и при дробном среднем это ещё и источник ошибок округления. Сумму квадратов отклонений можно получить сразу, одним проходом по данным:

∑i=1n(xi−xˉ)2=∑i=1nxi2−nxˉ2.\sum_{i=1}^{n} (x_i - \bar{x})^2 = \sum_{i=1}^{n} x_i^2 - n\bar{x}^2.

Проверим на нашей выборке. Сумма квадратов самих значений:

∑xi2=400+576+484+676+441+625+529+729+484+400=5344.\sum x_i^2 = 400 + 576 + 484 + 676 + 441 + 625 + 529 + 729 + 484 + 400 = 5344.

Вычитаем поправку на среднее:

∑(xi−xˉ)2=5344−10⋅232=5344−5290=54.\sum (x_i - \bar{x})^2 = 5344 - 10 \cdot 23^2 = 5344 - 5290 = 54.

Число совпало с суммой из таблицы, значит, обе оценки посчитаны верно. У этого способа есть неприятная особенность: 53445344 и 52905290 - крупные близкие числа, и если округлить xˉ\bar{x} хотя бы до десятых, разность поплывёт. На калькуляторе с ограниченной разрядностью первый способ надёжнее, а этот удобен как быстрая проверка.

Когда делить на n, а когда на n минус 1

Выбор делителя определяется не формулой, а формулировкой задания.

  • В условии есть слово «выборка», «оценка параметра», «генеральная дисперсия неизвестна» - нужна исправленная оценка с делителем n−1n - 1. Так же настроены статистические пакеты и функция СТАНДОТКЛОН.В в табличных редакторах.
  • В условии сказано, что данные - это вся генеральная совокупность или сплошное наблюдение, - делят на nn. Оценивать нечего, дисперсия считается точно.
  • В общей теории статистики по умолчанию делят на nn, и на этом же делителе строится коэффициент вариации; в математической статистике по умолчанию делят на n−1n - 1. Один и тот же ряд в двух разных курсах даёт два разных «правильных» ответа.

Разрыв между оценками равен 100n−1\frac{100}{n - 1} процентов: у нас s2s^2 больше DвD_{\text{в}} на 11,1 %11{,}1\ \%, при n=5n = 5 было бы 25 %25\ \%, а при n=100n = 100 - всего один процент. Переключи в калькуляторе сверху готовые наборы разной длины, и обе горизонтали на графике сойдутся.

Если выборка задана не списком, а частотами, схема не меняется: в суммах появляются множители fif_i, а вместо nn берётся ∑fi\sum f_i, то есть общее число наблюдений, а не число различных значений. Собрать такой ряд из сырых данных помогает разбор про вариационный ряд, а если величина задана не выборкой, а рядом распределения с вероятностями, считается уже теоретическая дисперсия случайной величины, и поправка Бесселя там не нужна вовсе.

Частые ошибки

  • Делят на n−1n - 1 сумму самих значений, а не сумму квадратов отклонений. В знаменатель n−1n - 1 попадает только ∑(xi−xˉ)2\sum (x_i - \bar{x})^2; выборочное среднее всегда считается делением на nn.
  • Берут n−1n - 1 вместо числа различных значений в сгруппированном ряду. При частотах nn - это ∑fi\sum f_i. В ряду из четырёх значений с общим числом наблюдений 20 делитель равен 19, а не 3.
  • Округляют xˉ\bar{x} до целых или десятых в середине расчёта. При дробном среднем это искажает сразу все отклонения; округлять нужно только итоговые s2s^2 и ss.
  • Извлекают корень из смещённой оценки, а отвечают про исправленную. 5,4≈2,32\sqrt{5{,}4} \approx 2{,}32 и 6≈2,45\sqrt{6} \approx 2{,}45 - разные числа; стандартное отклонение ss берётся именно из s2s^2.
  • Считают, что ss тоже несмещённая. Несмещённость s2s^2 не переносится на корень: M(s)<σM(s) < \sigma, потому что корень - вогнутая функция. В учебных задачах этим пренебрегают, но утверждать обратное на экзамене не стоит.
  • Теряют знак при возведении в квадрат или забывают проверить ∑(xi−xˉ)=0\sum (x_i - \bar{x}) = 0. Нулевая сумма отклонений - единственная бесплатная проверка среднего в этой задаче.

FAQ

Почему делят именно на n минус 1, а не на n минус 2? Потому что по выборке оценён ровно один параметр - среднее, и на него потрачена одна степень свободы. Отклонения связаны единственным уравнением ∑(xi−xˉ)=0\sum (x_i - \bar{x}) = 0, поэтому независимых среди них n−1n - 1. Делитель n−2n - 2 появляется там, где оценены два параметра, например в остаточной дисперсии парной регрессии.

Чем отличаются обозначения DвD_{\text{в}}, s2s^2 и σ2\sigma^2? σ2\sigma^2 - истинная дисперсия генеральной совокупности, неизвестное число, которое мы оцениваем. DвD_{\text{в}} - смещённая выборочная дисперсия с делителем nn. s2s^2 - исправленная, несмещённая оценка с делителем n−1n - 1. В ответе к задаче про выборку почти всегда ждут s2s^2 и ss.

Можно ли найти несмещённую оценку по выборке из одного значения? Нет. При n=1n = 1 знаменатель n−1n - 1 обращается в ноль, и оценка не определена. Содержательно это верно: одно наблюдение ничего не говорит о разбросе, а смещённая оценка выдала бы обманчивый ноль.

Насколько велика разница на практике? Она равна 100n−1\frac{100}{n - 1} процентов и быстро тает: 25 процентов при n=5n = 5, 11 процентов при n=10n = 10, около одного процента при n=100n = 100. На больших выборках делитель почти не влияет на вывод, но в контрольной по математической статистике за деление на nn снимают баллы.

Коротко

  1. Найди выборочное среднее xˉ=1n∑xi\bar{x} = \frac{1}{n}\sum x_i; в примере xˉ=230/10=23\bar{x} = 230 / 10 = 23.
  2. Посчитай отклонения и их квадраты, проверь, что ∑(xi−xˉ)=0\sum (x_i - \bar{x}) = 0, и сложи квадраты: ∑(xi−xˉ)2=54\sum (x_i - \bar{x})^2 = 54.
  3. Смещённая выборочная дисперсия - та же сумма, делённая на nn: Dв=54/10=5,4D_{\text{в}} = 54 / 10 = 5{,}4.
  4. Несмещённая (исправленная) оценка - делённая на n−1n - 1: s2=54/9=6,0s^2 = 54 / 9 = 6{,}0, она больше смещённой в nn−1\frac{n}{n-1} раз.
  5. Стандартное отклонение - корень из исправленной оценки: s=6≈2,45s = \sqrt{6} \approx 2{,}45. Ответ: Dв=5,4D_{\text{в}} = 5{,}4, s2=6,0s^2 = 6{,}0, s≈2,45s \approx 2{,}45.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Матстатистика

Как найти уравнение линейной регрессии: пример решения

Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.

Матстатистика

Как построить гистограмму частот: разбор задачи

Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.

Матстатистика

Как построить ящик с усами: пример с решением

Как построить ящик с усами по выборке из 12 значений: квартили Q1, Q2 и Q3 как медианы половин ряда, межквартильный размах IQR, границы усов 1,5 IQR, поиск выбросов и разметка чертежа.

Матстатистика

Как найти критическую область: разбор с примером

Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.

Матстатистика

Как вычислить скользящую среднюю: пример расчёта

Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.

Матстатистика

Как составить вариационный ряд: пошаговое решение

Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.