EssayAI
Блог
Блог

Как составить вариационный ряд: пошаговое решение

Запрос

Дано: число звонков за час в 20 наблюдениях: 4, 3, 5, 2, 4, 6, 3, 4, 5, 4, 3, 2, 4, 5, 3, 4, 6, 3, 4, 5. Найти: вариационный ряд с частотами, относительными частотами (частостями) и накопленными частотами.

Ряд составляется в три хода: выборку упорядочивают по возрастанию, одинаковые значения сворачивают в варианту с частотой, затем частоты нормируют и накапливают. Ответ: варианты 2, 3, 4, 5, 6 с частотами 2, 5, 7, 4, 2, частости 0,10; 0,25; 0,35; 0,20; 0,10, накопленные частоты 2, 7, 14, 18, 20. Калькулятор сверху собирает такую таблицу для любой выборки, ниже разобран каждый шаг.

Решение по шагам

Дано. Выборка объёма n=20n = 20, признак XX - число звонков за час. Значения записаны в порядке наблюдения, то есть вразнобой, и по такой записи пока ничего нельзя сказать о распределении.

Шаг 1. Объём выборки и крайние значения. Пересчитываем наблюдения: их 20, значит n=20n = 20. Наименьшее значение xmin⁡=2x_{\min} = 2, наибольшее xmax⁡=6x_{\max} = 6, размах выборки:

R=xmax⁡−xmin⁡=6−2=4.R = x_{\max} - x_{\min} = 6 - 2 = 4.

Шаг 2. Ранжированный ряд. Переписываем все 20 чисел по возрастанию, не выбрасывая повторы:

2, 2, 3, 3, 3, 3, 3, 4, 4, 4, 4, 4, 4, 4, 5, 5, 5, 5, 6, 6.2,\ 2,\ 3,\ 3,\ 3,\ 3,\ 3,\ 4,\ 4,\ 4,\ 4,\ 4,\ 4,\ 4,\ 5,\ 5,\ 5,\ 5,\ 6,\ 6.

Чтобы не сбиться, удобно идти по исходной записи слева направо и ставить чёрточку напротив каждого значения, а потом считать чёрточки. Проверка простая: в ранжированном ряду ровно столько чисел, сколько было в выборке.

Шаг 3. Выбираем вид ряда. Признак дискретный: звонков бывает целое число, а различных значений всего пять. Значит, составляем дискретный ряд. Каждое различное значение становится вариантой xix_i, а число его повторений становится частотой nin_i.

Шаг 4. Частоты. Считаем по ранжированному ряду: двойка встречается 2 раза, тройка 5 раз, четвёрка 7 раз, пятёрка 4 раза, шестёрка 2 раза. Сумма частот обязана дать объём выборки:

2+5+7+4+2=20=n.2 + 5 + 7 + 4 + 2 = 20 = n.

Шаг 5. Относительные частоты. Частость показывает долю наблюдений с данным значением, для неё частоту делят на объём выборки:

wi=nin:220=0,10,520=0,25,720=0,35,420=0,20,220=0,10.w_i = \frac{n_i}{n}: \quad \frac{2}{20} = 0{,}10, \quad \frac{5}{20} = 0{,}25, \quad \frac{7}{20} = 0{,}35, \quad \frac{4}{20} = 0{,}20, \quad \frac{2}{20} = 0{,}10.

Сумма частостей равна единице: 0,10+0,25+0,35+0,20+0,10=10{,}10 + 0{,}25 + 0{,}35 + 0{,}20 + 0{,}10 = 1.

Шаг 6. Накопленные частоты. Накопленная частота SiS_i показывает, сколько наблюдений не превосходят варианту xix_i. Складываем частоты нарастающим итогом:

S1=2,S2=2+5=7,S3=7+7=14,S4=14+4=18,S5=18+2=20.S_1 = 2, \quad S_2 = 2 + 5 = 7, \quad S_3 = 7 + 7 = 14, \quad S_4 = 14 + 4 = 18, \quad S_5 = 18 + 2 = 20.

Последняя накопленная частота совпала с nn, это вторая проверка. Накопленные частости получаем делением на 20: 0,10; 0,35; 0,70; 0,90; 1,00.

Ответ. Вариационный ряд выборки:

xix_i23456Сумма
nin_i2574220
wiw_i0,100,250,350,200,101
SiS_i27141820
Si/nS_i / n0,100,350,700,901,00

По таблице сразу видна мода: наибольшая частота 7 у варианты 4, значит Mo=4Mo = 4. Чаще всего за час поступает четыре звонка.

Формула и откуда она берётся

Вариационный ряд - это таблица «значение признака и сколько раз оно встретилось», где значения стоят по возрастанию. Название идёт от слова «вариация»: ряд показывает, как признак меняется от наблюдения к наблюдению и какие значения встречаются чаще других. Исходная запись из 20 чисел почти ничего не сообщает, а таблица из пяти столбцов сразу показывает центр и разброс.

Если mm - число различных вариант, то все величины ряда связаны четырьмя соотношениями:

∑i=1mni=n,wi=nin,∑i=1mwi=1,Si=∑j=1inj.\sum_{i=1}^{m} n_i = n, \qquad w_i = \frac{n_i}{n}, \qquad \sum_{i=1}^{m} w_i = 1, \qquad S_i = \sum_{j=1}^{i} n_j.

Первое и третье соотношения работают как встроенный контроль: если сумма частот не равна объёму выборки, значит, одно наблюдение потеряно или посчитано дважды. Частости нужны, чтобы сравнивать выборки разного объёма. Частота 7 из 20 и частота 35 из 100 выглядят по-разному, а частость у них одна и та же, 0,35. Кроме того, частость служит выборочной оценкой вероятности P(X=xi)P(X = x_i).

Накопленные частости - это значения эмпирической функции распределения в точках вариант: F∗(xi)=Si/nF^*(x_i) = S_i / n. Поэтому последняя строка таблицы уже наполовину готовый ответ на следующую типовую задачу, разобранную в статье про эмпирическую функцию распределения.

Ранжирование делают первым шагом не для красоты. По упорядоченной выборке частоты считаются без пропусков, крайние значения видны сразу, а медиана находится по номеру наблюдения.

Если значений много: интервальный ряд

Дискретный ряд хорош, пока различных значений немного. Для непрерывного признака (время, масса, доход) почти все значения разные, и дискретный ряд получается таким же длинным, как сама выборка, с частотой 1 у каждой варианты. Тогда значения группируют в интервалы.

Пример: время решения контрольной 20 студентами, мин: 27, 31, 18, 34, 25, 30, 22, 40, 28, 33, 26, 30, 21, 36, 29, 24, 43, 32, 23, 37. Повторяется только значение 30, так что нужен интервальный ряд.

Число интервалов берём по формуле Стёрджесса:

k=1+3,322lg⁡n=1+3,322lg⁡20≈1+3,322⋅1,301≈5,32≈5.k = 1 + 3{,}322 \lg n = 1 + 3{,}322 \lg 20 \approx 1 + 3{,}322 \cdot 1{,}301 \approx 5{,}32 \approx 5.

Ширина интервала. Крайние значения xmin⁡=18x_{\min} = 18 и xmax⁡=43x_{\max} = 43, размах R=25R = 25, поэтому h=R/k=25/5=5h = R / k = 25 / 5 = 5 минут.

Границы и частоты. Интервалы начинаются с 18 и идут с шагом 5. Значения 23, 28 и 33 попали ровно на границу, их относим к правому интервалу. Последний интервал закрыт справа, иначе максимум 43 выпадет из ряда.

Интервал, мин[18; 23)[23; 28)[28; 33)[33; 38)[38; 43]
Середина xi∗x_i^*20,525,530,535,540,5
nin_i35642
wiw_i0,150,250,300,200,10
SiS_i38141820

Середины интервалов нужны для дальнейших расчётов: по ним считают среднее и дисперсию, заменяя каждое значение серединой его интервала. Если ширина интервала выходит дробной, её обычно округляют вверх до удобного числа, а начало первого интервала сдвигают немного левее минимума. Откуда берётся формула Стёрджесса и когда она ошибается, разобрано в статье про формулу Стёрджесса, а правила выбора границ и открытые интервалы описаны в материале о группировке статистических данных.

Проверить этот пример можно в калькуляторе: вставь 20 значений в поле выборки и переключи вид ряда на интервальный. Получится та же таблица с k=5k = 5 и h=5h = 5.

Что делать с готовым рядом

Вариационный ряд - заготовка почти для всех следующих действий с выборкой. Моду ты уже видел в таблице. Медиану удобно искать по накопленным частотам: половина выборки равна 10, первая накопленная частота, которая её достигает, равна 14 у варианты 4, значит Me=4Me = 4. Среднее считается как взвешенное по частотам:

xˉ=∑xinin=2⋅2+3⋅5+4⋅7+5⋅4+6⋅220=7920=3,95.\bar{x} = \frac{\sum x_i n_i}{n} = \frac{2 \cdot 2 + 3 \cdot 5 + 4 \cdot 7 + 5 \cdot 4 + 6 \cdot 2}{20} = \frac{79}{20} = 3{,}95.

Графики строятся тоже по готовой таблице, а не по сырым данным. Дискретный ряд изображают ломаной, это разобрано в задаче про полигон частот. Интервальный ряд изображают столбиками, как в разборе про гистограмму частот.

Частые ошибки

  • Выбрасывают повторы при ранжировании. Ранжированный ряд содержит все nn значений, включая одинаковые. Если записать только 2, 3, 4, 5, 6, пропадёт информация о частотах.
  • Сумма частот не равна объёму выборки. Это признак пропущенного или дважды посчитанного наблюдения. Счёт чёрточками по исходной записи и сверка суммы с nn ловят такую ошибку сразу.
  • Путают частоту и частость. Частота - количество наблюдений (7), частость - доля (0,35). В ответе нужны обе строки, если задача просит относительные частоты.
  • Накапливают не с начала ряда. Накопленная частота складывает все частоты от первой варианты до текущей. Если последняя SiS_i не равна nn, в сложении ошибка.
  • Считают граничное значение дважды. Значение, попавшее на границу интервалов, относят только к одному, обычно правому интервалу. Последний интервал закрывают справа, чтобы в него попал максимум.
  • Строят интервальный ряд для признака с парой значений. Для пяти различных вариант, как в нашей задаче, группировка только сотрёт информацию: оценки или число звонков оформляют дискретным рядом.

FAQ

Чем вариационный ряд отличается от ранжированного? Ранжированный ряд - это все значения выборки, записанные по возрастанию с повторами. Вариационный ряд сворачивает повторы: каждое различное значение записано один раз вместе с частотой. В части учебников вариационным называют и сам ранжированный ряд, поэтому в задаче лучше привести оба.

Как понять, какой ряд составлять: дискретный или интервальный? Смотри на число различных значений. Если их немного (до 10-15) и признак принимает отдельные значения, составляй дискретный ряд. Если признак непрерывный или почти все значения разные, нужен интервальный.

Как округлять результат формулы Стёрджесса? Обычно до ближайшего целого: 5,32 даёт 5 интервалов. Если задача задаёт число интервалов или ширину явно, формулу не применяют. На маленьких выборках часто берут 5-7 интервалов, чтобы ряд оставался читаемым.

Зачем нужны накопленные частоты? По ним находят медиану и квантили, строят кумуляту и эмпирическую функцию распределения. Накопленная частость Si/nS_i / n показывает долю наблюдений, которые не больше варианты xix_i.

Коротко

  1. Посчитай объём выборки nn, найди минимум, максимум и размах RR.
  2. Запиши ранжированный ряд: все значения по возрастанию, с повторами.
  3. Выбери вид ряда: немного различных значений дают дискретный ряд, много разных дают интервальный с числом интервалов по Стёрджессу и шагом h=R/kh = R / k.
  4. Найди частоты nin_i, частости wi=ni/nw_i = n_i / n и накопленные частоты SiS_i, проверь, что сумма частот равна nn, а сумма частостей равна 1.
  5. Ответ примера: варианты 2, 3, 4, 5, 6 с частотами 2, 5, 7, 4, 2, частостями 0,10; 0,25; 0,35; 0,20; 0,10 и накопленными частотами 2, 7, 14, 18, 20.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Матстатистика

Как построить эмпирическую функцию распределения: пример

Как построить эмпирическую функцию распределения выборки: частости, накопленные частости, кусочная запись F*(x), ступенчатый график со скачками, свойства и частые ошибки.

Матстатистика

Как построить гистограмму частот: разбор задачи

Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.

Матстатистика

Как построить полигон частот: пример с решением

Как построить полигон частот дискретного вариационного ряда: таблица вариант и частот, построение ломаной по точкам, полигон относительных частот, кумулята, мода и среднее выборки.

Матстатистика

Как найти уравнение линейной регрессии: пример решения

Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.

Матстатистика

Как найти критическую область: разбор с примером

Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.

Матстатистика

Как найти несмещённую оценку дисперсии: решение

Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.