EssayAI
Блог
Блог

Как построить эмпирическую функцию распределения: пример

Запрос

Дано: выборка объёма n=60n = 60, признак XX - число отказов оборудования за смену; варианты xix_i: 1, 3, 6, 10 с частотами nin_i: 9, 21, 18, 12. Найти: эмпирическую функцию распределения F∗(x)F^*(x), её график и значение F∗(5)F^*(5).

Эмпирическая функция распределения - это доля наблюдений выборки, оказавшихся левее точки xx. Строится она в три действия: частоты переводятся в частости, частости накапливаются слева направо, результат записывается по промежуткам между вариантами. Ответ: F∗(x)F^*(x) принимает значения 0; 0,15; 0,50; 0,80 и 1 со скачками в точках 1, 3, 6 и 10, а F∗(5)=0,50F^*(5) = 0{,}50. Калькулятор сверху перестраивает ступеньки под любые частоты и снимает значение функции в выбранной точке.

Решение по шагам

Дано. Наблюдали 60 смен, признак XX - число отказов за смену. Дискретный вариационный ряд:

xix_i13610
nin_i9211812

Найти: F∗(x)F^*(x) в кусочном виде, её график и F∗(5)F^*(5).

Шаг 1. Проверить объём выборки. Сумма частот обязана совпасть с числом наблюдений, иначе все частости уедут:

n=9+21+18+12=60.n = 9 + 21 + 18 + 12 = 60.

Совпало. Этот же контроль пригодится, если объём в условии не дан прямо, а его надо восстановить по ряду: как это делается, разобрано в задаче про объём выборки.

Шаг 2. Перейти к относительным частотам. Частость варианты - это её доля в выборке:

wi=nin.w_i = \frac{n_i}{n}.

Подставляем: w1=9/60=0,15w_1 = 9/60 = 0{,}15, w2=21/60=0,35w_2 = 21/60 = 0{,}35, w3=18/60=0,30w_3 = 18/60 = 0{,}30, w4=12/60=0,20w_4 = 12/60 = 0{,}20. Контроль: 0,15+0,35+0,30+0,20=1,000{,}15 + 0{,}35 + 0{,}30 + 0{,}20 = 1{,}00. Именно частости, а не сами частоты, станут высотами будущих скачков.

Шаг 3. Накопить частости слева направо. Накопленная частость - сумма долей всех вариант, стоящих левее текущей точки и не превосходящих её:

xix_i13610
wiw_i0,150,350,300,20
накопленная0,150,500,801,00

Последнее число обязано равняться единице: вся выборка целиком лежит левее любой точки, взятой правее последней варианты.

Шаг 4. Записать функцию по промежуткам. Между соседними вариантами наблюдений нет, значит доля не меняется и функция там постоянна. Берём накопленные частости из шага 3 и раздаём их промежуткам:

F∗(x)={0,x≤1;0,15,1<x≤3;0,50,3<x≤6;0,80,6<x≤10;1,x>10.F^*(x) = \begin{cases} 0, & x \le 1; \\ 0{,}15, & 1 < x \le 3; \\ 0{,}50, & 3 < x \le 6; \\ 0{,}80, & 6 < x \le 10; \\ 1, & x > 10. \end{cases}

Шаг 5. Построить график. Рисуем пять горизонтальных полок на уровнях 0; 0,15; 0,50; 0,80 и 1. В точках 1, 3, 6 и 10 полки соединяются вертикальными отрезками - скачками; высота каждого скачка равна частости своей варианты: 0,15; 0,35; 0,30 и 0,20. Левый конец графика уходит по оси абсцисс влево на нулевом уровне, правый тянется вправо на уровне единицы.

Кружки на скачках расставляются по определению. Мы считаем долю наблюдений, строго меньших xx, поэтому в самой точке xix_i функция ещё не выросла: закрашенный кружок ставится на нижнем уровне, выколотый - на верхнем. Например, в точке x=3x = 3 закрашена точка (3; 0,15)(3;\ 0{,}15), а (3; 0,50)(3;\ 0{,}50) выколота.

Шаг 6. Снять значение в точке x=5x = 5. Точка 5 попадает в промежуток 3<x≤63 < x \le 6. Проверим по определению: меньше пяти оказались варианты 1 и 3, их суммарная частота 9+21=309 + 21 = 30, значит

F∗(5)=3060=0,50.F^*(5) = \frac{30}{60} = 0{,}50.

Ответ: F∗(x)F^*(x) равна 0 при x≤1x \le 1, затем 0,15; 0,50; 0,80 на промежутках до вариант 3, 6, 10 и единице правее десяти; F∗(5)=0,50F^*(5) = 0{,}50.

Формула и откуда она берётся

Общее определение записывается одной строкой. Пусть nxn_x - число элементов выборки, меньших xx, а nn - объём выборки. Тогда

F∗(x)=nxn.F^*(x) = \frac{n_x}{n}.

Здесь нет ни одной вероятности: всё считается по имеющимся данным. Поэтому F∗(x)F^*(x) и называют статистическим аналогом теоретической функции распределения, а её значение в точке - относительной частотой события «признак принял значение меньше xx».

Из определения сразу следуют четыре свойства, по которым удобно себя проверять. Значения лежат в отрезке от нуля до единицы, потому что nxn_x не может быть ни отрицательным, ни больше nn. Функция не убывает: при движении вправо наблюдения только добавляются. Левее наименьшей варианты она равна нулю, правее наибольшей - единице. Наконец, она кусочно-постоянна и меняется только скачками в самих вариантах.

Скачок в точке xix_i ровно равен wi=ni/nw_i = n_i / n, и это самый быстрый способ восстановить исходный ряд по готовому графику: измерил высоты ступенек, умножил на объём выборки - получил частоты. Обратная задача про теоретическую функцию распределения устроена так же, только там скачки равны вероятностям pip_i из закона распределения, а не долям из данных.

Если выборка задана списком чисел

В контрольных ряд часто не дают готовым, а высыпают сырые наблюдения. Пусть выборка такая: 5, 2, 5, 8, 2, 5, 8, 2. Порядок работы не меняется, добавляется нулевой шаг - ранжирование.

Выписываем различные значения по возрастанию и считаем, сколько раз каждое встретилось: варианта 2 встречается 3 раза, варианта 5 - тоже 3 раза, варианта 8 - 2 раза. Объём выборки n=3+3+2=8n = 3 + 3 + 2 = 8. Частости: 3/8=0,3753/8 = 0{,}375, 3/8=0,3753/8 = 0{,}375, 2/8=0,2502/8 = 0{,}250; накопленные - 0,375; 0,750; 1,000. Функция получается такой:

F∗(x)={0,x≤2;0,375,2<x≤5;0,750,5<x≤8;1,x>8.F^*(x) = \begin{cases} 0, & x \le 2; \\ 0{,}375, & 2 < x \le 5; \\ 0{,}750, & 5 < x \le 8; \\ 1, & x > 8. \end{cases}

Число ступенек равно числу различных значений, а не числу наблюдений: восемь чисел дали три скачка. Если все наблюдения различны, каждый скачок равен 1/n1/n и график выглядит как ровная лесенка.

Интервальный ряд и связь с теоретической функцией

Когда признак непрерывный, данные группируют по интервалам, и точных положений наблюдений внутри интервала мы уже не знаем. Тогда накопленные частости откладывают над правыми границами интервалов, а соседние точки соединяют отрезками - получается не ступенчатая, а ломаная линия, кумулятивная кривая. Промежуточные значения с неё снимают линейной интерполяцией: для интервалов 0-10, 10-20, 20-30, 30-40 с частотами 8, 22, 14, 6 накопленные частости равны 0,16; 0,60; 0,88; 1,00, и F∗(25)F^*(25) читается как 0,60+0,28⋅0,5=0,740{,}60 + 0{,}28 \cdot 0{,}5 = 0{,}74. Соседние графики того же ряда - полигон и кумулята - разобраны в задаче про полигон частот.

Зачем всё это нужно, объясняет теорема Гливенко: с ростом объёма выборки F∗(x)F^*(x) равномерно приближается к настоящей функции распределения F(x)F(x) признака. Отсюда и практический смысл графика - по нему на глаз видно, похожа ли выборка на предполагаемый закон. Строгая проверка того же самого сравнивает максимальное расхождение между F∗(x)F^*(x) и теоретической кривой: так устроен критерий согласия Колмогорова-Смирнова, а альтернативный подход через частоты интервалов - в разборе про проверку нормальности.

Из F∗(x)F^*(x) прямо снимается доля наблюдений, попавших в промежуток: она равна разности значений на концах. Для нашей выборки доля смен, где число отказов от 3 до 10, равна F∗(10)−F∗(3)=0,80−0,15=0,65F^*(10) - F^*(3) = 0{,}80 - 0{,}15 = 0{,}65. Проверка по частотам: 21+18=3921 + 18 = 39, и 39/60=0,6539/60 = 0{,}65 - сошлось.

Эмпирическую функцию строят, чтобы сравнить её с теоретической. Чаще всего в качестве теоретической берут нормальный закон: как по нему считают вероятность попадания в интервал, разобрано в задаче про нормальное распределение.

Частые ошибки

  • Скачки строят по частотам, а не по частостям. График тогда доходит до 60 вместо единицы. Это уже не F∗(x)F^*(x), а кумулята накопленных частот: её ординаты надо разделить на объём выборки.
  • Считают F∗(10)=1F^*(10) = 1. В точке последней варианты функция ещё равна 0,80, единицы она достигает только правее десяти. Ровно там же теряют и F∗(1)=0F^*(1) = 0: в первой варианте функция ещё нулевая.
  • Путают строгое и нестрогое неравенство. По определению через «меньше xx» функция непрерывна слева и закрашенный кружок сидит внизу скачка; по определению через «не больше xx» - наоборот. Между вариантами ответы совпадают, расходятся они только в самих точках скачка, и на экзамене спрашивают именно их. Переключатель в калькуляторе сверху показывает обе версии на одних данных.
  • Забывают отранжировать сырую выборку. Если варианты выписаны в порядке появления, накопление идёт не по возрастанию и функция получается убывающей на части промежутков, чего быть не может.
  • Соединяют ступеньки наклонными линиями. Для дискретного ряда это ошибка: между вариантами наблюдений нет, функция там строго постоянна. Наклонные отрезки уместны только для интервального ряда.
  • Не проверяют сумму частостей. Если она не равна единице, ошибка в частотах или объёме, и вся дальнейшая работа бессмысленна.

FAQ

Чем эмпирическая функция распределения отличается от теоретической? Теоретическая F(x)F(x) описывает саму случайную величину и считается по вероятностям, эмпирическая F∗(x)F^*(x) описывает конкретную выборку и считается по частотам. Первая одна и неизменна, вторая своя у каждой выборки и меняется от опыта к опыту. При больших nn вторая приближает первую.

Сколько ступенек будет на графике? Столько, сколько различных значений в выборке. Повторы не добавляют ступенек, они увеличивают высоту уже существующего скачка.

Обязательно ли рисовать выколотые кружки? В учебной работе - да, именно они показывают, какое из двух определений вы используете. Без кружков график не отличить от чужого, построенного по нестрогому неравенству.

Как по F∗(x)F^*(x) найти медиану выборки? Провести горизонталь на уровне 0,5 и посмотреть, где она пересекает график. Если горизонталь попадает точно на полку, как в нашей задаче на уровне 0,50, медиана размазана по всему промежутку и её берут как середину или как ближайшую варианту - правило зависит от методички.

Коротко

  1. Проверить объём выборки: сумма частот должна дать nn. У нас 9+21+18+12=609 + 21 + 18 + 12 = 60.
  2. Перевести частоты в частости wi=ni/nw_i = n_i / n: 0,15; 0,35; 0,30; 0,20, сумма равна единице.
  3. Накопить частости слева направо: 0,15; 0,50; 0,80; 1,00.
  4. Записать F∗(x)F^*(x) по промежуткам между вариантами и построить ступенчатый график: полки на накопленных уровнях, скачки высотой wiw_i в точках 1, 3, 6 и 10.
  5. Ответ примера: F∗(x)F^*(x) равна 0; 0,15; 0,50; 0,80 и 1 на пяти промежутках, F∗(5)=0,50F^*(5) = 0{,}50.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Матстатистика

Как составить вариационный ряд: пошаговое решение

Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.

Матстатистика

Как построить полигон частот: пример с решением

Как построить полигон частот дискретного вариационного ряда: таблица вариант и частот, построение ломаной по точкам, полигон относительных частот, кумулята, мода и среднее выборки.

Матстатистика

Как найти уравнение линейной регрессии: пример решения

Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.

Матстатистика

Как найти критическую область: разбор с примером

Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.

Матстатистика

Как найти несмещённую оценку дисперсии: решение

Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.

Матстатистика

Как вычислить скользящую среднюю: пример расчёта

Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.