Как найти объём выборки: формула и пример расчёта
Дано: среднее квадратическое отклонение срока службы детали ч, предельная ошибка ч, доверительная вероятность , объём партии шт. Найти: необходимый объём выборки.
Объём считают из требования к точности: сначала по формуле для повторного отбора, затем вводят поправку на конечную совокупность. Ответ: при повторном отборе нужно 246 деталей, при бесповторном 228. Калькулятор сверху пересчитает объём под другие , и доверительную вероятность, а решение с выкладками идёт ниже.
Решение по шагам
Дано.
| Показатель | Обозначение | Значение |
|---|---|---|
| Среднее квадратическое отклонение | 40 ч | |
| Предельная ошибка выборки | 5 ч | |
| Доверительная вероятность | 0,95 | |
| Объём генеральной совокупности | 3000 шт. |
Найти: для повторного и бесповторного отбора.
Шаг 1. Коэффициент доверия. По доверительной вероятности находим по таблице функции Лапласа: , значит и . Это то же самое число, что стоит в границах 95-процентного доверительного интервала.
Шаг 2. Объём при повторном отборе. Подставляем данные в основную формулу:
Дробное число единиц не бывает, а округление вниз ухудшило бы точность, поэтому округляем вверх: деталей.
Шаг 3. Поправка на бесповторный отбор. В партии всего 3000 деталей, и каждая отобранная деталь уже не вернётся в совокупность. Это уменьшает разброс, а значит и требуемый объём:
Тот же результат даёт развёрнутая запись, которая чаще встречается в учебниках:
Шаг 4. Проверка. Подставим найденный объём обратно в формулу предельной ошибки бесповторной выборки и убедимся, что заданная точность выдержана:
Требование выполнено с небольшим запасом, который и создало округление вверх.
Ответ. При повторном отборе требуется 246 деталей, при бесповторном - 228 деталей. Доля отбора составляет партии.
Формула и откуда она берётся
Формулу объёма не запоминают, а выводят из формулы ошибки выборки за две строки. Средняя ошибка выборочной средней при повторном отборе равна
а предельная ошибка - это средняя, умноженная на коэффициент доверия: . Коэффициент задаёт, с какой вероятностью истинная генеральная средняя попадёт в интервал : при берут , при уже .
Дальше решается обычное неравенство. Требование «ошибка не больше заданной» записывается как , откуда , и после возведения в квадрат получается рабочая формула:
Из неё видно главное свойство задачи: объём зависит от точности не линейно, а квадратично. Чтобы уменьшить ошибку вдвое, с 5 до 2,5 ч, тот же расчёт даёт детали - вчетверо больше. Именно поэтому бессмысленно требовать от исследования «максимальную точность»: цена каждого следующего знака растёт квадратично.
При бесповторном отборе дисперсия выборочной средней меньше в раз, и формула ошибки превращается в . Разрешив неравенство относительно , получаем ту самую поправку . Она заметна, только когда выборка занимает существенную часть совокупности: при порядка процента разница между 246 и 244 не имеет смысла, а при , сопоставимом с , поправка режет объём в разы. Что такое сама генеральная совокупность и чем она отличается от выборки, разобрано в статье про генеральную совокупность и выборку.
Объём выборки для доли признака
Второй тип задачи - оценивается не средняя величина, а доля единиц с признаком: доля брака, доля ответивших «да», доля студентов-отличников. Формула та же, но роль дисперсии играет произведение :
где - ожидаемая доля, а выражена в тех же долях единицы, что и (5 процентных пунктов - это ).
Здесь возникает частный вопрос: что подставлять, если доля до исследования неизвестна. Ответ даёт максимум произведения : оно наибольшее при и равно 0,25. Подставив самый неблагоприятный случай, получаем гарантированный объём:
Такой запас никогда не подведёт: при любой другой доле фактическая ошибка окажется меньше заявленной. Переключатель «Долю признака» в калькуляторе сверху считает именно этот вариант, включая поправку на конечную совокупность.
Где взять сигму до начала исследования
Формула требует , то есть характеристику совокупности, ради изучения которой выборка и делается. Этот замкнутый круг разрывают четырьмя способами, и в условии задачи обычно прямо указано, каким.
Первый - данные прошлых обследований или паспортные данные технологического процесса: если партии однотипны, разброс от партии к партии меняется мало. Второй - пробная (пилотная) выборка на 30-50 единиц, по которой считают выборочную дисперсию и берут корень из неё. Третий - правило размаха: если известны минимальное и максимальное значения признака, для распределения, близкого к нормальному, годится грубая оценка . Четвёртый - задание разброса через коэффициент вариации: если известно, что вариация составляет 20 % при средней 200 ч, то ч.
Важная оговорка: все эти формулы работают только для случайного отбора, при котором у каждой единицы совокупности одинаковый шанс попасть в выборку. Для неслучайных схем, например для квотной выборки, формула объёма формально применима, но заявленная точность уже не гарантирована: у такого отбора есть систематическое смещение, которое не уменьшается с ростом .
Частые ошибки
- Округление вниз или до ближайшего целого. Результат 245,86 округляется только вверх, до 246: при 245 наблюдениях фактическая ошибка превысит заданную, пусть и на сотые доли. Это не арифметическая условность, а требование задачи.
- Подстановка дисперсии вместо сигмы. В формуле стоит , то есть дисперсия. Если в условии дана дисперсия , возводить её в квадрат ещё раз не нужно; если дано , квадрат брать обязательно.
- Ошибка в единицах для доли. Предельная ошибка «3 процентных пункта» - это , а не 3. Подстановка тройки занижает объём в десять тысяч раз.
- Забытая поправка на бесповторный отбор. Если совокупность конечна и в условии указано , а отбор бесповторный, расчёт без поправки завышает объём. При разница между 246 и 228 не критична, а при вместо 246 потребуется всего 165 единиц.
- Обратная ошибка: поправка там, где её быть не должно. При повторном отборе (единица возвращается в совокупность) и при бесконечной или очень большой генеральной совокупности множитель не используется.
- Не тот коэффициент доверия. Значения путают с уровнем значимости: доверительной вероятности 0,95 отвечает , а не 0,95 и не 1,65. Значение 1,645 относится к .
FAQ
Чем повторный отбор отличается от бесповторного? При повторном отобранная единица возвращается в совокупность и может попасть в выборку снова, при бесповторном - не возвращается. На практике почти все обследования бесповторные, но поправку применяют, только если известен объём и доля отбора заметна (больше нескольких процентов).
Почему объём выборки почти не зависит от размера генеральной совокупности? Потому что в формулу входит разброс признака, а не число единиц. Для города с миллионом жителей и для города с сотней тысяч при одинаковых требованиях к точности нужна практически одинаковая выборка: поправка при больших обращается почти в единицу. Размер совокупности начинает влиять только тогда, когда выборка сопоставима с ней по объёму.
Что делать, если по расчёту требуется больше единиц, чем есть в совокупности? Это признак того, что заданная точность недостижима в принципе: даже сплошное обследование даст ошибку выше нужной, если велика, а требования жёсткие. Решения два: смягчить требование к либо снизить доверительную вероятность, например с 0,99 до 0,95, и пересчитать.
Нужно ли брать распределение Стьюдента вместо ? Для расчёта необходимого объёма - нет: планирование ведётся по нормальному распределению, потому что на этом шаге ещё неизвестно. Квантили Стьюдента нужны позже, при построении доверительного интервала по фактической малой выборке, где и оценена по самим данным.
Коротко
- Найти коэффициент доверия по доверительной вероятности: 0,90 даёт 1,645, 0,95 даёт 1,96, 0,954 даёт 2, 0,99 даёт 2,576.
- Посчитать объём для повторного отбора: ; для доли признака вместо подставить , а при неизвестной доле взять .
- Если совокупность конечна и отбор бесповторный, применить поправку .
- Округлить результат строго вверх и проверить его обратной подстановкой в формулу предельной ошибки.
- В разобранном примере: деталей при повторном отборе и деталей при бесповторном для партии в 3000 штук.
Похожие задачи
Как найти уравнение линейной регрессии: пример решения
Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.
МатстатистикаКак найти критическую область: разбор с примером
Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.
МатстатистикаКак найти несмещённую оценку дисперсии: решение
Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.
МатстатистикаКак вычислить скользящую среднюю: пример расчёта
Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.
МатстатистикаКак составить вариационный ряд: пошаговое решение
Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.
МатстатистикаКак построить гистограмму частот: разбор задачи
Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.