EssayAI
Блог
Блог
Гуманитарные науки

Режимы подкрепления: четыре схемы и кривые ответов

1 сентября 2026Время чтения: 8 минут
#режимы подкрепления#схемы подкрепления#оперантное обусловливание#кумулятивная кривая#угасание
Режимы подкрепления: четыре схемы и кривые ответов

Режим подкрепления - это правило, связывающее поведение с наградой: после какого числа реакций или после какого срока подкрепление выдают. Чарлз Ферстер и Беррес Скиннер в книге «Схемы подкрепления» (1957) показали неожиданное: от этого правила зависит не столько скорость научения, сколько сама форма поведения - темп ответов, паузы, срывы и то, сколько поведение проживёт после отмены награды. Общая классификация подкрепления по знаку и происхождению стимула разобрана отдельно в материале про виды подкрепления; здесь речь только о расписании выдачи. Калькулятор ниже строит кумулятивную запись выбранного режима и показывает, что происходит с поведением, когда подкрепление отключают.

Режим подкрепления как правило выдачи

Все режимы делятся на два класса. Непрерывное подкрепление (CRF) награждает каждую целевую реакцию: так формируют новый навык, потому что связь «действие - последствие» видна с первого раза. Частичное подкрепляет лишь часть реакций, и именно оно работает в реальной жизни, где награда приходит не всегда.

Частичные режимы задаются пересечением двух оснований:

  • что считают - реакции (пропорциональные режимы) или время (интервальные);
  • как задано требование - жёстко (фиксированные) или в среднем (переменные).

Отсюда четыре базовых режима: фиксированная пропорция, переменная пропорция, фиксированный интервал, переменный интервал. Разница между классами принципиальна. На пропорциональном режиме плотность подкрепления зависит от самого испытуемого: работая быстрее, он получает больше. На интервальном режиме при интервале II секунд потолок жёсткий и от усердия не зависит:

Rmax⁡=3600I подкреплений в час.R_{\max} = \frac{3600}{I}\ \text{подкреплений в час}.

Отсюда общее правило: пропорциональные режимы разгоняют темп, интервальные его ограничивают. Работает это благодаря закону эффекта Торндайка: закрепляется та реакция, за которой последствие следует наиболее надёжно.

Кумулятивная запись: как читать кривую

Скиннер регистрировал поведение кумулятивным самописцем: лента едет с постоянной скоростью, а перо после каждой реакции сдвигается на один шаг вверх и никогда не возвращается назад. Читается такая запись не по высоте, а по наклону.

  • Крутой участок - высокий темп ответов.
  • Горизонтальная площадка - испытуемый не отвечает вовсе.
  • Косые засечки на кривой - моменты выдачи подкрепления.

Кумулятивная запись оказалась инструментом различения режимов: не зная процедуры, по одной форме кривой можно назвать расписание. Именно поэтому в задачах по оперантному обусловливанию просят не «описать награду», а нарисовать характерный профиль.

Фиксированная и переменная пропорция

Фиксированная пропорция (FR) подкрепляет каждую nn-ю реакцию: FR-1 - это непрерывный режим, FR-50 - награда за полсотни ответов. Профиль узнаваем: очень высокий ровный темп, а сразу после подкрепления - постподкрепляющая пауза, длина которой растёт вместе с требованием. Пауза объясняется не усталостью, а различением: момент после награды надёжнее всего сигнализирует, что до следующей ещё далеко.

Обратная сторона режима - истощение пропорции: если требование поднять резко, скажем с FR-20 сразу до FR-100, поведение не замедляется, а разваливается совсем. Отсюда практическое правило прикладного анализа: пропорцию наращивают мелкими шагами.

Переменная пропорция (VR) задаёт лишь среднее число реакций: при VR-20 награда придёт то после пяти ответов, то после сорока. Паузы исчезают, потому что подкрепление возможно уже на следующей реакции. Такой режим даёт самый высокий и самый ровный темп из всех четырёх - на нём построены игровые автоматы, лотереи, холодные звонки и бесконечная лента социальной сети.

Кумулятивные кривые двух пропорциональных режимов: ступеньки с паузами после награды у фиксированной пропорции и сплошной подъём у переменной
Кумулятивные кривые двух пропорциональных режимов: ступеньки с паузами после награды у фиксированной пропорции и сплошной подъём у переменной

Фиксированный и переменный интервал

Фиксированный интервал (FI) подкрепляет первую реакцию после истечения срока: при FI-60 ответы в первые пятьдесят девять секунд ничего не дают. Организм быстро улавливает регулярность, и кривая приобретает форму фестона: провал сразу после подкрепления, разгон к концу интервала. Это точный портрет студенческой сессии, квартального отчёта и предвыборной активности депутата: работа концентрируется у дедлайна, потому что раньше она не подкрепляется.

Переменный интервал (VI) делает момент готовности непредсказуемым, и фестон исчезает. Темп получается умеренный, зато исключительно ровный и без пауз - так человек проверяет почту или мессенджер, ожидая ответа. За устойчивость и лёгкую управляемость VI стал стандартным фоном экспериментов по выбору: на двух параллельных VI-режимах Ричард Херрнстейн (1961) вывел закон соответствия - доля ответов на альтернативу равна доле получаемых на ней подкреплений:

B1B1+B2=R1R1+R2.\frac{B_1}{B_1 + B_2} = \frac{R_1}{R_1 + R_2}.

Фестон фиксированного интервала с провалом после подкрепления и ровная линия переменного интервала
Фестон фиксированного интервала с провалом после подкрепления и ровная линия переменного интервала

Устойчивость к угасанию: эффект частичного подкрепления

Угасание - отмена подкрепления при сохранении возможности отвечать. Сравнение режимов даёт эффект частичного подкрепления: поведение, выученное на прореженном расписании, гаснет заметно медленнее, чем выученное на непрерывном.

Объяснение даёт гипотеза различения. Испытуемый на непрерывном режиме мгновенно замечает перемену: первая же неподкреплённая реакция - сигнал, что правила изменились. На переменной пропорции длинная серия без награды ничем не отличается от обычной полосы невезения, поэтому распознать угасание нечем. Отсюда порядок устойчивости: VR держится дольше всех, за ним VI, затем FR, FI и последним CRF.

Два сопутствующих эффекта стоит знать отдельно. Всплеск угасания - кратковременный рост темпа и силы реакций сразу после отмены награды, до начала спада. Спонтанное восстановление - возврат реакции после перерыва, даже если в прошлой сессии она уже угасла. Практический вывод для родителя или педагога: капитуляция на пике всплеска подкрепляет самую интенсивную форму поведения на переменной пропорции, то есть делает его почти неугасимым.

Кривые угасания: поведение на непрерывном подкреплении обрывается быстро, а сформированное на переменной пропорции держится долго
Кривые угасания: поведение на непрерывном подкреплении обрывается быстро, а сформированное на переменной пропорции держится долго

Дифференциальные и составные режимы

Четырьмя базовыми расписаниями набор не исчерпывается. Дифференциальные режимы подкрепляют не количество, а темп ответов: DRL награждает реакцию только после паузы (учит терпению и медленному темпу), DRH - наоборот, лишь при высокой частоте, DRO - за интервал, в котором целевой реакции не было вовсе.

Составные режимы соединяют базовые. В множественном режиме два расписания чередуются, и каждое помечено своим сигналом-стимулом. В цепном подкрепление получают только после последовательного выполнения обоих звеньев. В параллельном испытуемый сам распределяет время между двумя одновременно доступными режимами - именно эта процедура и лежит в основе закона соответствия.

Как подобрать режим на практике

Рабочая схема формирования привычки состоит из трёх шагов.

  1. Формирование: непрерывное подкрепление каждой правильной реакции, пока навык не станет стабильным.
  2. Прореживание: постепенный перевод на пропорциональный или интервальный режим мелкими шагами, без скачков, иначе наступит истощение пропорции.
  3. Поддержание: переменная пропорция или переменный интервал - они дают устойчивость к длинным периодам без награды.

Отдельное требование ко всем трём шагам - немедленность подкрепления: отсроченная награда подкрепляет то, что человек делал в момент её получения, а не целевое действие. На этом принципе построено программированное обучение Скиннера с обратной связью после каждого маленького шага.

Частые ошибки

  • Путают пропорцию с интервалом. Проверочный вопрос один: что отсчитывают до подкрепления - реакции или время.
  • Считают переменные режимы «случайными». Среднее требование задано строго, случайно лишь конкретное значение вокруг него.
  • Приписывают фестон переменному интервалу. Фестон возможен только там, где срок предсказуем, то есть на фиксированном интервале.
  • Объясняют паузу после подкрепления усталостью. Она растёт с величиной пропорции, а не с объёмом уже проделанной работы, и исчезает на переменном режиме.
  • Наращивают требование скачком. Резкий переход к тощему расписанию вызывает истощение пропорции и полный обрыв поведения.

FAQ

Какой режим подкрепления самый устойчивый к угасанию? Переменная пропорция. Момент награды непредсказуем, поэтому серия неподкреплённых реакций не отличима от обычного невезения, и сигнала о том, что подкрепление отменили, у поведения нет.

Почему после подкрепления на FR возникает пауза? Момент сразу после награды надёжно предсказывает, что до следующей далеко: подкрепление там невозможно в принципе. Длина паузы растёт вместе с требованием пропорции.

Чем режим подкрепления отличается от вида подкрепления? Вид отвечает на вопрос «что и с каким знаком выдают» (положительное или отрицательное, первичное или вторичное), а режим - на вопрос «когда именно выдают». Одно и то же вторичное подкрепление можно выдавать по любому из четырёх расписаний.

Коротко

Режимы подкрепления различаются по двум основаниям: считают реакции или время и задано ли требование жёстко или в среднем. Фиксированная пропорция даёт высокий темп с паузой после награды, переменная - самый высокий и ровный темп, фиксированный интервал даёт фестон с рывком к дедлайну, переменный интервал - ровный умеренный темп. Устойчивость к угасанию убывает от переменных режимов к фиксированным и к непрерывному подкреплению, поэтому навык формируют на непрерывном режиме, а поддерживают на переменном, наращивая требование мелкими шагами.

Доверьте текст нейросети EssayAI

Открыть EssayAI

Бесплатно, на русском языке и без VPN

Читайте также

Подкрепление: виды, схемы и отличие от наказания

Подкрепление: виды, схемы и отличие от наказания

Виды подкрепления в психологии: чем положительное отличается от отрицательного, где проходит граница с наказанием, что такое первичные и вторичные стимулы и как устроены схемы подкрепления.

31 августа 20268 минут
Классическое обусловливание: от Павлова до формулы

Классическое обусловливание: от Павлова до формулы

Классическое обусловливание простыми словами: четыре элемента схемы, опыты Павлова, приобретение и угасание условного рефлекса, модель Рескорлы Вагнера и отличие от оперантного научения.

31 августа 20268 минут
Закон эффекта Торндайка: суть, опыты и формулировки

Закон эффекта Торндайка: суть, опыты и формулировки

Закон эффекта Торндайка простыми словами: как результат закрепляет или ослабляет реакцию, опыты с проблемным ящиком, кривая научения, ранняя и поздняя формулировки, связь с оперантным обусловливанием.

16 июня 20267 минут
Программированное обучение Скиннера: принципы и кадры

Программированное обучение Скиннера: принципы и кадры

Программированное обучение Скиннера простыми словами: что такое линейная программа, малые шаги, активный ответ и подкрепление, чем оно отличается от метода Краудера и где применяется сейчас.

11 июня 20267 минут
Адаптация первокурсников к вузу

Адаптация первокурсников к вузу

Адаптация первокурсников к вузу: виды трудностей, этапы вхождения в учебную и социальную среду, роль куратора и тьютора, методы оценки и практические рекомендации.

29 сентября 20267 минут
Адвербиализация: как слова становятся наречиями

Адвербиализация: как слова становятся наречиями

Адвербиализация в русском языке: переход существительных, прилагательных и деепричастий в наречия, критерии, спорные случаи и правила слитного написания.

29 сентября 20268 минут