EssayAI
Блог
Блог

Как найти объём выборки: формула и пример расчёта

Запрос

Дано: среднее квадратическое отклонение срока службы детали σ=40\sigma = 40 ч, предельная ошибка Δ=5\Delta = 5 ч, доверительная вероятность P=0,95P = 0{,}95, объём партии N=3000N = 3000 шт. Найти: необходимый объём выборки.

Объём считают из требования к точности: сначала по формуле n0=t2σ2/Δ2n_0 = t^2\sigma^2/\Delta^2 для повторного отбора, затем вводят поправку на конечную совокупность. Ответ: при повторном отборе нужно 246 деталей, при бесповторном 228. Калькулятор сверху пересчитает объём под другие σ\sigma, Δ\Delta и доверительную вероятность, а решение с выкладками идёт ниже.

Решение по шагам

Дано.

ПоказательОбозначениеЗначение
Среднее квадратическое отклонениеσ\sigma40 ч
Предельная ошибка выборкиΔ\Delta5 ч
Доверительная вероятностьPP0,95
Объём генеральной совокупностиNN3000 шт.

Найти: nn для повторного и бесповторного отбора.

Шаг 1. Коэффициент доверия. По доверительной вероятности находим tt по таблице функции Лапласа: 2Φ(t)=0,952\Phi(t) = 0{,}95, значит Φ(t)=0,475\Phi(t) = 0{,}475 и t=1,96t = 1{,}96. Это то же самое число, что стоит в границах 95-процентного доверительного интервала.

Шаг 2. Объём при повторном отборе. Подставляем данные в основную формулу:

n0=t2σ2Δ2=1,962⋅40252=3,8416⋅160025=6146,5625=245,86.n_0 = \frac{t^2 \sigma^2}{\Delta^2} = \frac{1{,}96^2 \cdot 40^2}{5^2} = \frac{3{,}8416 \cdot 1600}{25} = \frac{6146{,}56}{25} = 245{,}86.

Дробное число единиц не бывает, а округление вниз ухудшило бы точность, поэтому округляем вверх: n0=246n_0 = 246 деталей.

Шаг 3. Поправка на бесповторный отбор. В партии всего 3000 деталей, и каждая отобранная деталь уже не вернётся в совокупность. Это уменьшает разброс, а значит и требуемый объём:

n=n01+n0N=245,861+245,863000=245,861,0820=227,24≈228.n = \frac{n_0}{1 + \dfrac{n_0}{N}} = \frac{245{,}86}{1 + \dfrac{245{,}86}{3000}} = \frac{245{,}86}{1{,}0820} = 227{,}24 \approx 228.

Тот же результат даёт развёрнутая запись, которая чаще встречается в учебниках:

n=t2σ2NΔ2N+t2σ2=3,8416⋅1600⋅300025⋅3000+3,8416⋅1600=18 439 68081 146,56=227,24.n = \frac{t^2 \sigma^2 N}{\Delta^2 N + t^2 \sigma^2} = \frac{3{,}8416 \cdot 1600 \cdot 3000}{25 \cdot 3000 + 3{,}8416 \cdot 1600} = \frac{18\,439\,680}{81\,146{,}56} = 227{,}24.

Шаг 4. Проверка. Подставим найденный объём обратно в формулу предельной ошибки бесповторной выборки и убедимся, что заданная точность выдержана:

Δ=tσ1−n/Nn=1,96⋅40⋅1−228/3000228=1,96⋅40⋅0,0637=4,99 ч≤5 ч.\Delta = t \sigma \sqrt{\frac{1 - n/N}{n}} = 1{,}96 \cdot 40 \cdot \sqrt{\frac{1 - 228/3000}{228}} = 1{,}96 \cdot 40 \cdot 0{,}0637 = 4{,}99 \ \text{ч} \le 5 \ \text{ч}.

Требование выполнено с небольшим запасом, который и создало округление вверх.

Ответ. При повторном отборе требуется 246 деталей, при бесповторном - 228 деталей. Доля отбора составляет 228/3000=7,6%228/3000 = 7{,}6\% партии.

Формула и откуда она берётся

Формулу объёма не запоминают, а выводят из формулы ошибки выборки за две строки. Средняя ошибка выборочной средней при повторном отборе равна

μ=σn,\mu = \frac{\sigma}{\sqrt{n}},

а предельная ошибка - это средняя, умноженная на коэффициент доверия: Δ=tμ\Delta = t\mu. Коэффициент tt задаёт, с какой вероятностью истинная генеральная средняя попадёт в интервал xˉ±Δ\bar{x} \pm \Delta: при P=0,954P = 0{,}954 берут t=2t = 2, при P=0,997P = 0{,}997 уже t=3t = 3.

Дальше решается обычное неравенство. Требование «ошибка не больше заданной» записывается как tσ/n≤Δt\sigma/\sqrt{n} \le \Delta, откуда n≥tσ/Δ\sqrt{n} \ge t\sigma/\Delta, и после возведения в квадрат получается рабочая формула:

n≥t2σ2Δ2.n \ge \frac{t^2 \sigma^2}{\Delta^2}.

Из неё видно главное свойство задачи: объём зависит от точности не линейно, а квадратично. Чтобы уменьшить ошибку вдвое, с 5 до 2,5 ч, тот же расчёт даёт n0=3,8416⋅1600/6,25=984n_0 = 3{,}8416 \cdot 1600 / 6{,}25 = 984 детали - вчетверо больше. Именно поэтому бессмысленно требовать от исследования «максимальную точность»: цена каждого следующего знака растёт квадратично.

При бесповторном отборе дисперсия выборочной средней меньше в (1−n/N)(1 - n/N) раз, и формула ошибки превращается в μ=σ(1−n/N)/n\mu = \sigma\sqrt{(1 - n/N)/n}. Разрешив неравенство tμ≤Δt\mu \le \Delta относительно nn, получаем ту самую поправку n=n0/(1+n0/N)n = n_0/(1 + n_0/N). Она заметна, только когда выборка занимает существенную часть совокупности: при n0/Nn_0/N порядка процента разница между 246 и 244 не имеет смысла, а при n0n_0, сопоставимом с NN, поправка режет объём в разы. Что такое сама генеральная совокупность и чем она отличается от выборки, разобрано в статье про генеральную совокупность и выборку.

Объём выборки для доли признака

Второй тип задачи - оценивается не средняя величина, а доля единиц с признаком: доля брака, доля ответивших «да», доля студентов-отличников. Формула та же, но роль дисперсии играет произведение p(1−p)p(1-p):

n0=t2p(1−p)Δ2,n_0 = \frac{t^2 p (1-p)}{\Delta^2},

где pp - ожидаемая доля, а Δ\Delta выражена в тех же долях единицы, что и pp (5 процентных пунктов - это Δ=0,05\Delta = 0{,}05).

Здесь возникает частный вопрос: что подставлять, если доля до исследования неизвестна. Ответ даёт максимум произведения p(1−p)p(1-p): оно наибольшее при p=0,5p = 0{,}5 и равно 0,25. Подставив самый неблагоприятный случай, получаем гарантированный объём:

n0=1,962⋅0,250,052=0,96040,0025=384,16≈385.n_0 = \frac{1{,}96^2 \cdot 0{,}25}{0{,}05^2} = \frac{0{,}9604}{0{,}0025} = 384{,}16 \approx 385.

Такой запас никогда не подведёт: при любой другой доле фактическая ошибка окажется меньше заявленной. Переключатель «Долю признака» в калькуляторе сверху считает именно этот вариант, включая поправку на конечную совокупность.

Где взять сигму до начала исследования

Формула требует σ\sigma, то есть характеристику совокупности, ради изучения которой выборка и делается. Этот замкнутый круг разрывают четырьмя способами, и в условии задачи обычно прямо указано, каким.

Первый - данные прошлых обследований или паспортные данные технологического процесса: если партии однотипны, разброс от партии к партии меняется мало. Второй - пробная (пилотная) выборка на 30-50 единиц, по которой считают выборочную дисперсию и берут корень из неё. Третий - правило размаха: если известны минимальное и максимальное значения признака, для распределения, близкого к нормальному, годится грубая оценка σ≈R/6\sigma \approx R/6. Четвёртый - задание разброса через коэффициент вариации: если известно, что вариация составляет 20 % при средней 200 ч, то σ=0,2⋅200=40\sigma = 0{,}2 \cdot 200 = 40 ч.

Важная оговорка: все эти формулы работают только для случайного отбора, при котором у каждой единицы совокупности одинаковый шанс попасть в выборку. Для неслучайных схем, например для квотной выборки, формула объёма формально применима, но заявленная точность уже не гарантирована: у такого отбора есть систематическое смещение, которое не уменьшается с ростом nn.

Частые ошибки

  • Округление вниз или до ближайшего целого. Результат 245,86 округляется только вверх, до 246: при 245 наблюдениях фактическая ошибка превысит заданную, пусть и на сотые доли. Это не арифметическая условность, а требование задачи.
  • Подстановка дисперсии вместо сигмы. В формуле стоит σ2\sigma^2, то есть дисперсия. Если в условии дана дисперсия D=1600D = 1600, возводить её в квадрат ещё раз не нужно; если дано σ=40\sigma = 40, квадрат брать обязательно.
  • Ошибка в единицах для доли. Предельная ошибка «3 процентных пункта» - это Δ=0,03\Delta = 0{,}03, а не 3. Подстановка тройки занижает объём в десять тысяч раз.
  • Забытая поправка на бесповторный отбор. Если совокупность конечна и в условии указано NN, а отбор бесповторный, расчёт без поправки завышает объём. При N=3000N = 3000 разница между 246 и 228 не критична, а при N=500N = 500 вместо 246 потребуется всего 165 единиц.
  • Обратная ошибка: поправка там, где её быть не должно. При повторном отборе (единица возвращается в совокупность) и при бесконечной или очень большой генеральной совокупности множитель (1−n/N)(1 - n/N) не используется.
  • Не тот коэффициент доверия. Значения tt путают с уровнем значимости: доверительной вероятности 0,95 отвечает t=1,96t = 1{,}96, а не 0,95 и не 1,65. Значение 1,645 относится к P=0,90P = 0{,}90.

FAQ

Чем повторный отбор отличается от бесповторного? При повторном отобранная единица возвращается в совокупность и может попасть в выборку снова, при бесповторном - не возвращается. На практике почти все обследования бесповторные, но поправку применяют, только если известен объём NN и доля отбора заметна (больше нескольких процентов).

Почему объём выборки почти не зависит от размера генеральной совокупности? Потому что в формулу входит разброс признака, а не число единиц. Для города с миллионом жителей и для города с сотней тысяч при одинаковых требованиях к точности нужна практически одинаковая выборка: поправка 1/(1+n0/N)1/(1 + n_0/N) при больших NN обращается почти в единицу. Размер совокупности начинает влиять только тогда, когда выборка сопоставима с ней по объёму.

Что делать, если по расчёту требуется больше единиц, чем есть в совокупности? Это признак того, что заданная точность недостижима в принципе: даже сплошное обследование даст ошибку выше нужной, если σ\sigma велика, а требования жёсткие. Решения два: смягчить требование к Δ\Delta либо снизить доверительную вероятность, например с 0,99 до 0,95, и пересчитать.

Нужно ли брать распределение Стьюдента вместо t=1,96t = 1{,}96? Для расчёта необходимого объёма - нет: планирование ведётся по нормальному распределению, потому что nn на этом шаге ещё неизвестно. Квантили Стьюдента нужны позже, при построении доверительного интервала по фактической малой выборке, где n<30n < 30 и σ\sigma оценена по самим данным.

Коротко

  1. Найти коэффициент доверия tt по доверительной вероятности: 0,90 даёт 1,645, 0,95 даёт 1,96, 0,954 даёт 2, 0,99 даёт 2,576.
  2. Посчитать объём для повторного отбора: n0=t2σ2/Δ2n_0 = t^2\sigma^2/\Delta^2; для доли признака вместо σ2\sigma^2 подставить p(1−p)p(1-p), а при неизвестной доле взять p=0,5p = 0{,}5.
  3. Если совокупность конечна и отбор бесповторный, применить поправку n=n0/(1+n0/N)n = n_0/(1 + n_0/N).
  4. Округлить результат строго вверх и проверить его обратной подстановкой в формулу предельной ошибки.
  5. В разобранном примере: n0=1,962⋅402/52=245,86→246n_0 = 1{,}96^2 \cdot 40^2 / 5^2 = 245{,}86 \to 246 деталей при повторном отборе и 228228 деталей при бесповторном для партии в 3000 штук.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Матстатистика

Как найти уравнение линейной регрессии: пример решения

Разбор задачи на парную линейную регрессию: расчётная таблица сумм, коэффициенты a и b по методу наименьших квадратов, корреляция, детерминация, значимость и прогноз.

Матстатистика

Как найти критическую область: разбор с примером

Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.

Матстатистика

Как найти несмещённую оценку дисперсии: решение

Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.

Матстатистика

Как вычислить скользящую среднюю: пример расчёта

Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.

Матстатистика

Как составить вариационный ряд: пошаговое решение

Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.

Матстатистика

Как построить гистограмму частот: разбор задачи

Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.