Режимы подкрепления: четыре схемы и кривые ответов

Режим подкрепления - это правило, связывающее поведение с наградой: после какого числа реакций или после какого срока подкрепление выдают. Чарлз Ферстер и Беррес Скиннер в книге «Схемы подкрепления» (1957) показали неожиданное: от этого правила зависит не столько скорость научения, сколько сама форма поведения - темп ответов, паузы, срывы и то, сколько поведение проживёт после отмены награды. Общая классификация подкрепления по знаку и происхождению стимула разобрана отдельно в материале про виды подкрепления; здесь речь только о расписании выдачи. Калькулятор ниже строит кумулятивную запись выбранного режима и показывает, что происходит с поведением, когда подкрепление отключают.
Режим подкрепления как правило выдачи
Все режимы делятся на два класса. Непрерывное подкрепление (CRF) награждает каждую целевую реакцию: так формируют новый навык, потому что связь «действие - последствие» видна с первого раза. Частичное подкрепляет лишь часть реакций, и именно оно работает в реальной жизни, где награда приходит не всегда.
Частичные режимы задаются пересечением двух оснований:
- что считают - реакции (пропорциональные режимы) или время (интервальные);
- как задано требование - жёстко (фиксированные) или в среднем (переменные).
Отсюда четыре базовых режима: фиксированная пропорция, переменная пропорция, фиксированный интервал, переменный интервал. Разница между классами принципиальна. На пропорциональном режиме плотность подкрепления зависит от самого испытуемого: работая быстрее, он получает больше. На интервальном режиме при интервале секунд потолок жёсткий и от усердия не зависит:
Отсюда общее правило: пропорциональные режимы разгоняют темп, интервальные его ограничивают. Работает это благодаря закону эффекта Торндайка: закрепляется та реакция, за которой последствие следует наиболее надёжно.
Кумулятивная запись: как читать кривую
Скиннер регистрировал поведение кумулятивным самописцем: лента едет с постоянной скоростью, а перо после каждой реакции сдвигается на один шаг вверх и никогда не возвращается назад. Читается такая запись не по высоте, а по наклону.
- Крутой участок - высокий темп ответов.
- Горизонтальная площадка - испытуемый не отвечает вовсе.
- Косые засечки на кривой - моменты выдачи подкрепления.
Кумулятивная запись оказалась инструментом различения режимов: не зная процедуры, по одной форме кривой можно назвать расписание. Именно поэтому в задачах по оперантному обусловливанию просят не «описать награду», а нарисовать характерный профиль.
Фиксированная и переменная пропорция
Фиксированная пропорция (FR) подкрепляет каждую -ю реакцию: FR-1 - это непрерывный режим, FR-50 - награда за полсотни ответов. Профиль узнаваем: очень высокий ровный темп, а сразу после подкрепления - постподкрепляющая пауза, длина которой растёт вместе с требованием. Пауза объясняется не усталостью, а различением: момент после награды надёжнее всего сигнализирует, что до следующей ещё далеко.
Обратная сторона режима - истощение пропорции: если требование поднять резко, скажем с FR-20 сразу до FR-100, поведение не замедляется, а разваливается совсем. Отсюда практическое правило прикладного анализа: пропорцию наращивают мелкими шагами.
Переменная пропорция (VR) задаёт лишь среднее число реакций: при VR-20 награда придёт то после пяти ответов, то после сорока. Паузы исчезают, потому что подкрепление возможно уже на следующей реакции. Такой режим даёт самый высокий и самый ровный темп из всех четырёх - на нём построены игровые автоматы, лотереи, холодные звонки и бесконечная лента социальной сети.

Фиксированный и переменный интервал
Фиксированный интервал (FI) подкрепляет первую реакцию после истечения срока: при FI-60 ответы в первые пятьдесят девять секунд ничего не дают. Организм быстро улавливает регулярность, и кривая приобретает форму фестона: провал сразу после подкрепления, разгон к концу интервала. Это точный портрет студенческой сессии, квартального отчёта и предвыборной активности депутата: работа концентрируется у дедлайна, потому что раньше она не подкрепляется.
Переменный интервал (VI) делает момент готовности непредсказуемым, и фестон исчезает. Темп получается умеренный, зато исключительно ровный и без пауз - так человек проверяет почту или мессенджер, ожидая ответа. За устойчивость и лёгкую управляемость VI стал стандартным фоном экспериментов по выбору: на двух параллельных VI-режимах Ричард Херрнстейн (1961) вывел закон соответствия - доля ответов на альтернативу равна доле получаемых на ней подкреплений:

Устойчивость к угасанию: эффект частичного подкрепления
Угасание - отмена подкрепления при сохранении возможности отвечать. Сравнение режимов даёт эффект частичного подкрепления: поведение, выученное на прореженном расписании, гаснет заметно медленнее, чем выученное на непрерывном.
Объяснение даёт гипотеза различения. Испытуемый на непрерывном режиме мгновенно замечает перемену: первая же неподкреплённая реакция - сигнал, что правила изменились. На переменной пропорции длинная серия без награды ничем не отличается от обычной полосы невезения, поэтому распознать угасание нечем. Отсюда порядок устойчивости: VR держится дольше всех, за ним VI, затем FR, FI и последним CRF.
Два сопутствующих эффекта стоит знать отдельно. Всплеск угасания - кратковременный рост темпа и силы реакций сразу после отмены награды, до начала спада. Спонтанное восстановление - возврат реакции после перерыва, даже если в прошлой сессии она уже угасла. Практический вывод для родителя или педагога: капитуляция на пике всплеска подкрепляет самую интенсивную форму поведения на переменной пропорции, то есть делает его почти неугасимым.

Дифференциальные и составные режимы
Четырьмя базовыми расписаниями набор не исчерпывается. Дифференциальные режимы подкрепляют не количество, а темп ответов: DRL награждает реакцию только после паузы (учит терпению и медленному темпу), DRH - наоборот, лишь при высокой частоте, DRO - за интервал, в котором целевой реакции не было вовсе.
Составные режимы соединяют базовые. В множественном режиме два расписания чередуются, и каждое помечено своим сигналом-стимулом. В цепном подкрепление получают только после последовательного выполнения обоих звеньев. В параллельном испытуемый сам распределяет время между двумя одновременно доступными режимами - именно эта процедура и лежит в основе закона соответствия.
Как подобрать режим на практике
Рабочая схема формирования привычки состоит из трёх шагов.
- Формирование: непрерывное подкрепление каждой правильной реакции, пока навык не станет стабильным.
- Прореживание: постепенный перевод на пропорциональный или интервальный режим мелкими шагами, без скачков, иначе наступит истощение пропорции.
- Поддержание: переменная пропорция или переменный интервал - они дают устойчивость к длинным периодам без награды.
Отдельное требование ко всем трём шагам - немедленность подкрепления: отсроченная награда подкрепляет то, что человек делал в момент её получения, а не целевое действие. На этом принципе построено программированное обучение Скиннера с обратной связью после каждого маленького шага.
Частые ошибки
- Путают пропорцию с интервалом. Проверочный вопрос один: что отсчитывают до подкрепления - реакции или время.
- Считают переменные режимы «случайными». Среднее требование задано строго, случайно лишь конкретное значение вокруг него.
- Приписывают фестон переменному интервалу. Фестон возможен только там, где срок предсказуем, то есть на фиксированном интервале.
- Объясняют паузу после подкрепления усталостью. Она растёт с величиной пропорции, а не с объёмом уже проделанной работы, и исчезает на переменном режиме.
- Наращивают требование скачком. Резкий переход к тощему расписанию вызывает истощение пропорции и полный обрыв поведения.
FAQ
Какой режим подкрепления самый устойчивый к угасанию? Переменная пропорция. Момент награды непредсказуем, поэтому серия неподкреплённых реакций не отличима от обычного невезения, и сигнала о том, что подкрепление отменили, у поведения нет.
Почему после подкрепления на FR возникает пауза? Момент сразу после награды надёжно предсказывает, что до следующей далеко: подкрепление там невозможно в принципе. Длина паузы растёт вместе с требованием пропорции.
Чем режим подкрепления отличается от вида подкрепления? Вид отвечает на вопрос «что и с каким знаком выдают» (положительное или отрицательное, первичное или вторичное), а режим - на вопрос «когда именно выдают». Одно и то же вторичное подкрепление можно выдавать по любому из четырёх расписаний.
Коротко
Режимы подкрепления различаются по двум основаниям: считают реакции или время и задано ли требование жёстко или в среднем. Фиксированная пропорция даёт высокий темп с паузой после награды, переменная - самый высокий и ровный темп, фиксированный интервал даёт фестон с рывком к дедлайну, переменный интервал - ровный умеренный темп. Устойчивость к угасанию убывает от переменных режимов к фиксированным и к непрерывному подкреплению, поэтому навык формируют на непрерывном режиме, а поддерживают на переменном, наращивая требование мелкими шагами.
Читайте также

Подкрепление: виды, схемы и отличие от наказания
Виды подкрепления в психологии: чем положительное отличается от отрицательного, где проходит граница с наказанием, что такое первичные и вторичные стимулы и как устроены схемы подкрепления.

Классическое обусловливание: от Павлова до формулы
Классическое обусловливание простыми словами: четыре элемента схемы, опыты Павлова, приобретение и угасание условного рефлекса, модель Рескорлы Вагнера и отличие от оперантного научения.

Закон эффекта Торндайка: суть, опыты и формулировки
Закон эффекта Торндайка простыми словами: как результат закрепляет или ослабляет реакцию, опыты с проблемным ящиком, кривая научения, ранняя и поздняя формулировки, связь с оперантным обусловливанием.

Программированное обучение Скиннера: принципы и кадры
Программированное обучение Скиннера простыми словами: что такое линейная программа, малые шаги, активный ответ и подкрепление, чем оно отличается от метода Краудера и где применяется сейчас.

Адаптация первокурсников к вузу
Адаптация первокурсников к вузу: виды трудностей, этапы вхождения в учебную и социальную среду, роль куратора и тьютора, методы оценки и практические рекомендации.

Адвербиализация: как слова становятся наречиями
Адвербиализация в русском языке: переход существительных, прилагательных и деепричастий в наречия, критерии, спорные случаи и правила слитного написания.