Кризис воспроизводимости: почему наука перепроверяет себя

Научная статья сообщает не только о том, что обнаружил исследователь, но и о том, насколько этот результат можно получить снова. Если другая группа повторяет процедуру и получает сопоставимый эффект, доверие к выводу растёт. Если результат исчезает, это не автоматически означает, что первая работа была мошенничеством. Но это заставляет заново спросить: какие условия породили находку и насколько широко она применима?
Именно этот вопрос называют кризисом воспроизводимости. Особенно громко он прозвучал в психологии после проекта Open Science Collaboration. В 2015 году команда повторила 100 исследований из трёх журналов. В исходной публикации статистически значимый результат был у 97 работ, а в репликациях такой результат получили 36%; по субъективной оценке исследователей, воспроизвёлся эффект примерно в 39% случаев. Средний размер эффекта при повторении оказался примерно вдвое меньше исходного. Эти цифры не означают, что «психология не работает»: они показывают, что единичное открытие нуждается в независимой проверке.
Что именно означает воспроизводимость
Воспроизводимость имеет несколько смыслов. В узком техническом смысле другой исследователь может взять те же данные и код и получить те же таблицы и графики. В экспериментальном смысле он повторяет процедуру на новых участниках и проверяет, возникает ли тот же эффект. Ещё шире стоит вопрос об обобщаемости: сохраняется ли вывод в другой стране, возрастной группе, лаборатории или контексте?
Поэтому репликация не является простым экзаменом с ответом «истина» или «ложь». На исходный результат влияют мощность выборки, точность измерения, различия в протоколах и сам размер эффекта. Нулевая репликация может означать отсутствие эффекта, но может говорить и о том, что эффект слишком мал для данного дизайна. Гипотетико-дедуктивный метод помогает увидеть логику проверки: из гипотезы выводят наблюдаемое следствие, а затем выясняют, выдерживает ли оно независимый тест.
Что показал проект Open Science Collaboration
Проект был устроен как открытая коллективная проверка. Исследователи отобрали сто работ, опубликовали план репликации, по возможности связались с авторами исходных статей, использовали оригинальные материалы и заранее описали анализ. Важна именно эта процедура: результат оценивали не по одному p-значению, а по нескольким признакам - статистической значимости, величине эффекта, интервалам неопределённости и экспертной оценке сходства.
В статье Open Science Collaboration в Science сообщается: 36% репликаций дали статистически значимый результат, 47% исходных эффектов попали в 95%-ный доверительный интервал репликации, а 39% эффектов были оценены как воспроизведённые. Если объединять исходные и повторные данные при предположении об отсутствии смещения исходных результатов, статистическая значимость сохранялась у 68% эффектов. Это важная оговорка: «36%» - не универсальный процент истинных исследований и не приговор всей дисциплине, а итог конкретной выборки, критерия и программы повторений.
Результат проекта изменил разговор о качестве доказательств. Ключевой единицей стала не эффектная публикация, а совокупность независимых проверок. В этом смысле кризис - не только проблема психологии, но и пример научного самоконтроля.

Почему возникают невоспроизводимые находки
Первая причина - малые выборки и низкая статистическая мощность. При малом числе наблюдений оценка эффекта сильно колеблется: случайная удачная выборка может создать большой эффект, а повторная - не обнаружить его. Даже реальный эффект при этом не гарантирует значимости в каждой отдельной работе.
Вторая причина - гибкость анализа, или p-hacking. Исследователь может незаметно для себя выбирать момент остановки сбора данных, исключать неудобные наблюдения, пробовать несколько зависимых переменных или моделей и сообщать только удачный вариант. Каждое решение по отдельности иногда оправдано, но множество решений увеличивает число возможностей случайно получить p < 0,05.
Третья причина - публикационное смещение. Журналам и авторам интереснее положительный и неожиданный результат, чем аккуратный нулевой. Неподтверждённые исследования остаются в «файловом ящике», поэтому опубликованная литература создаёт впечатление, будто эффект встречается чаще и устойчивее, чем на самом деле.
Наконец, есть HARKing - формулирование гипотезы после того, как результаты уже известны. Исследователь может превратить наблюдаемую закономерность в якобы заранее предсказанное следствие. Такая практика смешивает разведку и подтверждение: поиск идеи полезен, но его нельзя выдавать за строгую проверку предварительной гипотезы.
Громкие случаи: эго-истощение и прайминг
Кризис стал заметен широкой публике благодаря эффектам, которые хорошо рассказывались в учебниках. Гипотеза эго-истощения утверждала, что после выполнения требующей самоконтроля задачи у человека временно снижается способность к следующему усилию. Крупные последующие проверки дали более слабую поддержку, чем ожидалось, а интерпретация результатов остаётся предметом спора.
Похожая история произошла с социальным праймингом: предполагалось, что незаметные слова или образы меняют последующее поведение. Ряд известных эффектов оказался трудно воспроизводимым при более строгих протоколах. Здесь полезно различать два тезиса: «конкретный эксперимент не повторился» и «вся область прайминга ложна». Первый может быть обоснован данными одной репликации; второй требует гораздо более широкой совокупности проверок.
Как наука отвечает на кризис
Предрегистрация отделяет подтверждающий анализ от разведочного. До сбора данных исследователь фиксирует гипотезу, выборку, ключевую переменную и план анализа. Отклонения допустимы, но их следует обозначить. Так читатель видит, что было обещано заранее, а что возникло уже при работе с данными.
Открытые данные, код и материалы позволяют проверить вычисления и повторить процедуру. Они не решают проблему автоматически: данные могут содержать чувствительную информацию, код бывает трудно запустить, а одинаковый скрипт не исправит плохой дизайн. Но прозрачность делает ошибки обнаружимыми и снижает зависимость от доверия к авторитету.
Мегаисследования и мультилабораторные проекты увеличивают разнообразие выборок и уменьшают роль случайностей одной лаборатории. Их цена - сложная координация и необходимость заранее определить единый протокол. Полезны и зарегистрированные отчёты: журнал принимает вопрос и метод до получения результата, поэтому отрицательный итог не становится причиной отказа.

Значение для философии науки
Кризис воспроизводимости уточняет простой образ научного метода. Проблема демаркации Поппера спрашивает, что отличает науку от псевдонауки; воспроизводимость показывает, что одного формального критерия мало. Гипотеза может быть фальсифицируема, но плохо измерена, статистически неустойчива или защищена от критики непрозрачной процедурой.
Репликация также напоминает о тезисе Дюэма и Куайна: проверяется не изолированная гипотеза, а связка гипотезы, измерений, статистической модели и фоновых допущений. Неудача повторения не указывает мгновенно, какой элемент оказался слабым. Поэтому научная рациональность состоит не в механическом отказе от первой аномалии, а в сравнении альтернативных объяснений и в улучшении дизайна.
В этом отношении кризис - продуктивная форма критики. Научное знание не обязано быть безошибочным, но оно должно оставлять следы, по которым другие могут проверить ход рассуждения. Нормальная наука Куна описывает работу внутри принятой парадигмы, а открытые репликации показывают, как аномалии становятся коллективным вопросом о стандартах доказательства.
Частые ошибки
- Считать 36% долей «истинной науки». Это результат конкретного проекта, а не перепись всех психологических утверждений.
- Принимать p > 0,05 за доказательство отсутствия эффекта. Нужны размер эффекта, доверительный интервал, мощность и качество дизайна.
- Смешивать воспроизводимость и честность автора. Невоспроизводимость может возникнуть без злого умысла из-за случайности и гибкости решений.
- Думать, что предрегистрация делает исследование истинным. Она повышает прозрачность, но не заменяет хорошую теорию, измерение и достаточную выборку.
- Объявлять всю психологию несостоятельной. Репликационные проекты ограничивают отдельные выводы и одновременно улучшают исследовательские нормы.
FAQ
Кризис воспроизводимости означает, что опубликованным статьям нельзя доверять?
Нет. Доверие должно быть градуированным: сильнее выглядят результаты с независимыми репликациями, открытыми материалами, точными оценками неопределённости и устойчивостью к альтернативным анализам. Одна статья - начало проверки, а не окончательный вердикт.
Чем репликация отличается от повторного анализа?
При повторном анализе используют те же данные и проверяют вычисления или другую модель. Репликация собирает новые данные по исходной или согласованной процедуре. Оба шага важны, но отвечают на разные вопросы.
Можно ли полностью устранить p-hacking и публикационное смещение?
Полностью - вряд ли: исследователь всегда принимает решения, а журналы работают в системе стимулов. Но предрегистрация, открытые отрицательные результаты, registered reports и публикация кода делают смещение заметнее и уменьшают его влияние.
Коротко
Кризис воспроизводимости - это проверка того, насколько научные выводы переживают независимое повторение. Проект Open Science Collaboration 2015 получил 36% статистически значимых репликаций и около 39% субъективно воспроизведённых эффектов, но эти числа нельзя превращать в универсальный приговор. Малые выборки, p-hacking, публикационное смещение и HARKing искажают картину; предрегистрация, открытые данные, код и мегаисследования делают её надёжнее. Философски кризис важен потому, что превращает воспроизводимость из технической детали в условие публичной проверяемости знания.
Читайте также

Эпистемологический анархизм Фейерабенда: суть и критика
Эпистемологический анархизм Фейерабенда: тезис "anything goes", пролиферация теорий, критика Поппера и примеры из истории науки - разбор для студентов философии.

Кумулятивизм в философии науки: модель накопления знания
Кумулятивная модель развития науки: накопление истин, позитивизм и индукция, критика Койре, Куна и Фейерабенда, компромисс Лакатоса и современный взгляд на прогресс.

Неявное знание Полани: что мы знаем молча
Неявное знание Полани: личностное знание, принцип «знаем больше, чем можем сказать», езда на велосипеде, наука, обучение навыкам и управление опытом в организации.

Дискурс-анализ: как исследовать язык, власть и контекст
Дискурс-анализ: понятие дискурса, подходы Харриса, ван Дейка, Фэркло и Фуко, рабочая методика, разбор примера, ограничения вывода и отличие от контент-анализа.

Фаллибилизм: почему знание может ошибаться
Фаллибилизм объясняет, почему любое знание остаётся исправимым: идеи Пирса и Поппера, отличие от скептицизма и применение в этике и праве. Разбираем, как действовать при неполных основаниях.

Гипотетико-дедуктивный метод: гипотеза и проверка
Гипотетико-дедуктивный метод: как выдвинуть гипотезу, вывести проверяемые следствия и отличить подтверждение от опровержения на примере Земмельвейса в научном исследовании.