Гнездовая выборка: когда отбирают группы целиком

Простая случайная выборка красива на бумаге и разорительна в поле: чтобы опросить тысячу человек, случайно рассыпанных по области, интервьюеру придётся объехать полтысячи населённых пунктов ради одной анкеты в каждом. Гнездовая выборка решает эту задачу иначе: единицей отбора становится не человек, а готовая группа людей, и внутри отобранной группы опрашивают всех или почти всех. Экономия огромна, но она оплачивается точностью, и размер этой платы считается заранее, а не обнаруживается по факту. Калькулятор ниже показывает, во что превращается собранная тысяча анкет после поправки на дизайн-эффект.
Что такое гнездовая выборка
Гнездовая (она же кластерная, англ. cluster sampling) выборка - это вероятностный отбор, при котором генеральная совокупность заранее разбита на естественные группы, а случайно отбираются сами группы, а не отдельные респонденты. Такая группа и называется гнездом или кластером: избирательный участок, дом, школьный класс, бригада, вагон поезда, студенческая группа.
Ключевое слово здесь - «естественные». Гнёзда не конструируются исследователем: они уже существуют, у них есть готовые списки состава и понятные границы. Именно поэтому гнездовой отбор так дёшев. Чтобы отобрать 40 избирательных участков, достаточно списка участков по региону, а вот чтобы отобрать 1000 конкретных жителей, нужен поимённый список всего населения области, которого у исследователя обычно нет. Гнездовая выборка позволяет не иметь основы выборки на уровне людей, обходясь основой на уровне групп. Общая рамка понятий - виды отбора, репрезентативность, ошибка - разобрана в статье про выборку в социологии, здесь речь только о кластерном дизайне.
Одноступенчатая и многоступенчатая схема
Одноступенчатая гнездовая выборка - самый простой случай: отобрали гнёзда и опросили в них всех. Если в исследовании удовлетворённости 30 отобранных школьных классов опрашиваются полностью, ступень ровно одна.
Многоступенчатая выборка добавляет уровни: гнёзда отбираются внутри гнёзд. Сначала из списка регионов отбираются регионы, внутри них - населённые пункты, внутри пунктов - избирательные участки, внутри участков - дома, и только на последней ступени отбираются квартиры или люди. Единицы первой ступени называют первичными (ПЕВ), последней - конечными.

Практическое правило одно: основа выборки нужна не для всей страны, а только для отобранных единиц предыдущей ступени. Список домов нужен лишь для тех участков, которые уже попали в выборку, а не для всех участков России. Это и делает всероссийский опрос выполнимым.
Отдельно оговаривается вероятность отбора. Если гнёзда сильно разного размера, отбор с равной вероятностью даёт перекос: житель маленькой деревни получает больший шанс попасть в выборку, чем житель миллионника. Лечится это отбором с вероятностью, пропорциональной размеру гнезда (PPS), и последующим взвешиванием.
Гнездовая и стратифицированная выборка: главное различие
Их путают чаще всего, потому что обе сначала делят совокупность на части. Разница - в том, что делается дальше.
- Стратифицированная выборка: совокупность делится на страты (пол, возраст, курс, тип поселения), и отбор идёт из каждой страты без исключения. Цель деления - добиться, чтобы внутри каждой части люди были похожи между собой, а сами страты различались.
- Гнездовая выборка: совокупность делится на гнёзда, и отбираются целые гнёзда, а большинство гнёзд в выборку не попадает вообще. Цель деления - чтобы каждое гнездо было маленькой копией всей совокупности, а гнёзда между собой не различались.

Требования прямо противоположные. Стратификация повышает точность (она убирает межгрупповую дисперсию из ошибки), гнездование точность понижает. Стратифицируют ради качества оценки, гнездуют ради экономии. В реальных опросах их совмещают: сначала районирование по типу поселения (стратификация), затем отбор участков внутри страт (гнездование).
Третий сосед по этой теме - квотная выборка: там тоже задаются доли групп, но отбор внутри квоты неслучайный, и вероятностные формулы ошибки к ней неприменимы.
Внутриклассовая корреляция: почему гнёзда обедняют выборку
Причина потери точности в одном: люди внутри гнезда похожи друг на друга сильнее, чем случайные люди из совокупности. Соседи по подъезду имеют близкий доход, одноклассники - одного учителя, бригада - общего мастера. Значит, десятый опрошенный в том же гнезде приносит гораздо меньше новой информации, чем десятый опрошенный из десяти разных гнёзд.
Меру этого сходства называют внутриклассовой (внутригрупповой) корреляцией и обозначают . Она равна доле общей дисперсии признака, которая приходится на различия между гнёздами:
При гнёзда - идеальные микрокопии совокупности, и гнездовой отбор ничем не хуже простого случайного. При все внутри гнезда одинаковы, и опрос всего гнезда равносилен опросу одного человека. На практике для территориальных гнёзд обычно лежит в пределах 0,01–0,08, для школьных классов и бригад заметно выше, а для домохозяйств по политическим установкам доходит до 0,3–0,5.
Дизайн-эффект: чем платят за дешевизну
Потеря точности сводится в один множитель - дизайн-эффект:
где - средний размер гнезда, то есть число опрошенных внутри одного кластера. Дизайн-эффект показывает, во сколько раз дисперсия оценки больше, чем была бы при простой случайной выборке того же объёма. Отсюда эффективный объём выборки:
Разберём типовой опрос: отобрано участков, на каждом опрошено человек, всего анкет, . Тогда , а . Тысяча собранных анкет по точности равна четырёмстам пятидесяти пяти при простом случайном отборе - больше половины поля ушло в никуда.
На предельную ошибку доли это действует через корень:
При и ошибка простой случайной выборки составляет процентного пункта, а гнездовой - . Чтобы вернуть точность к трём процентным пунктам, гнездовым отбором пришлось бы собрать 2200 анкет. Как считается сама предельная ошибка и откуда берётся множитель 1,96, показано в разборе про генеральную совокупность и выборку.

Отсюда главный вывод для проектирования: в формуле дизайн-эффекта стоит размер гнезда , а не их число . Увеличение числа гнёзд точность улучшает, увеличение размера гнезда - ухудшает. Двадцать гнёзд по 50 человек и сто гнёзд по 10 человек дают одинаковую тысячу анкет, но при дизайн-эффект в первом случае 3,45, а во втором - 1,45. Отсюда практическое правило поля: больше гнёзд, меньше людей в каждом, ровно настолько крупных, насколько позволяет бюджет на разъезды.
Районированная многоступенчатая выборка в массовом опросе
Типовая схема всероссийского опроса на 1600 человек выглядит так:
- Районирование. Страна делится на страты: федеральные округа, внутри них - типы поселений (миллионники, крупные города, малые города, село). Это стратификация, она обязательна и не случайна.
- Первая ступень. Внутри каждой страты случайно отбираются населённые пункты с вероятностью, пропорциональной числу жителей.
- Вторая ступень. Внутри отобранного пункта случайно отбираются избирательные участки или микрорайоны - это и есть гнёзда.
- Третья ступень. Внутри участка отбираются дома и квартиры по маршрутному листу с шагом.
- Отбор в домохозяйстве. Внутри квартиры респондент выбирается по правилу ближайшего дня рождения - иначе в выборку систематически попадают неработающие и пожилые.
На каждой ступени фиксируется вероятность отбора, а итоговые веса собираются как произведение обратных вероятностей с постстратификационной поправкой по полу, возрасту и образованию. Инструментарий при этом описывается отдельно от схемы отбора - правила составления самой анкеты разобраны в материале про анкетирование.
Когда гнездовая выборка уместна
Гнездовой дизайн оправдан, если совпадают три условия: нет основы выборки на уровне людей, но есть на уровне групп; полевые расходы зависят от географического разброса; гнёзда внутренне разнородны. Классические случаи - территориальные опросы населения, школьные и вузовские исследования, обследования домохозяйств, аудит торговых точек.
Он неуместен, когда гнёзда однородны по изучаемому признаку: опрашивать целиком отделения одной партии, чтобы узнать политические предпочтения, бессмысленно - близка к единице, и сотня анкет даст информации как несколько. Не подходит гнездование и для редких групп: если признак встречается у 2% населения, в случайно отобранном подъезде его носителей просто не окажется.
Частые ошибки
- Считают ошибку по формуле простой случайной выборки. Самая частая ошибка курсовых: собрали кластерную выборку, а доверительный интервал посчитали как . Интервал занижен в раз, а выводы о значимости различий становятся ложноположительными.
- Путают гнездо со стратой. Формулировка «выборка гнездовая, отобрали по 20 человек из каждого факультета» описывает стратификацию: если охвачены все факультеты, гнездования нет.
- Берут мало гнёзд, но крупных. Пять школ по 200 учеников - это выборка, эффективный объём которой измеряется десятками. Минимально приемлемым числом гнёзд обычно считают 30, иначе не оценить межгнездовую дисперсию.
- Отбирают гнёзда с равной вероятностью при разных размерах. Без PPS или последующего взвешивания жители малых населённых пунктов оказываются перепредставлены.
- Опрашивают в гнезде «кто попался». Случайность должна сохраняться на каждой ступени; замена последней ступени удобным отбором превращает вероятностную выборку в стихийную, и формулы ошибки перестают работать.
FAQ
Гнездовая и кластерная выборка - это одно и то же? Да. «Кластерная» - калька с английского cluster sampling, «гнездовая» - термин отечественной традиции. В российских учебниках чаще встречается «гнездовая», в статистических пакетах и статьях - «кластерная». Серийной выборкой обычно называют её же разновидность, где гнездо опрашивается сплошь.
Как узнать внутриклассовую корреляцию до опроса? Точно - никак, она оценивается по данным уже проведённого исследования через дисперсионный анализ. На этапе проектирования берут значение из прошлых волн того же опроса или из литературы по близкой тематике: для территориальных гнёзд обычно закладывают 0,02–0,05, для организаций и учебных групп - 0,1–0,2. Затем расчёт объёма делают с запасом.
Нужно ли увеличивать объём выборки при гнездовом отборе? Да, ровно в раз по сравнению с расчётом для простой случайной выборки. Если формула дала 400 наблюдений, а дизайн-эффект оценён в 1,8, планировать нужно 720 анкет. Именно так поступают в медицинских кластерных испытаниях, где поправка на дизайн-эффект обязательна по протоколу.
Коротко
Гнездовая выборка отбирает не людей, а готовые группы и опрашивает их целиком, за счёт чего резко удешевляет поле и снимает требование иметь список всей совокупности. Платой становится дизайн-эффект : люди внутри гнезда похожи, эффективный объём выборки падает до , а доверительный интервал расширяется в раз. От стратифицированной выборки её отличает то, что гнёзда берутся целиком и большинство из них в выборку не попадает, а требование к делению обратное: гнёзда должны быть разнородными внутри и одинаковыми между собой. Проектируя схему, увеличивают число гнёзд, а не их размер, и обязательно пересчитывают ошибку с поправкой на дизайн-эффект.
Читайте также

Гипотеза в социологии: как сформулировать и проверить
Гипотеза в социологии: место в программе исследования, виды, требования к формулировке, операционализация переменных и связь с анкетой и масштабом выборки.

Адаптация первокурсников к вузу
Адаптация первокурсников к вузу: виды трудностей, этапы вхождения в учебную и социальную среду, роль куратора и тьютора, методы оценки и практические рекомендации.

Адвербиализация: как слова становятся наречиями
Адвербиализация в русском языке: переход существительных, прилагательных и деепричастий в наречия, критерии, спорные случаи и правила слитного написания.

Акт о супрематии 1534: церковь и власть
Акт о супрематии 1534 года: почему Генрих VIII стал главой церкви Англии, как присяга привела к казни Мора и Фишера, роспуску монастырей и появлению англиканства.

Александрийская поэзия: черты и представители
Александрийская поэзия эллинистической эпохи: Мусейон, Каллимах, Феокрит, эпиграмма и учёная работа со старой традицией, повлиявшая на римских поэтов.

Алкеста Еврипида: жертва, долг и возвращение
«Алкеста» Еврипида: почему жена умирает вместо Адмета, как Геракл спорит со Смертью и зачем трагедии счастливый финал. Сюжет, образы и темы для анализа пьесы.