EssayAI
Блог
Блог
Гуманитарные науки

Корпусная лингвистика: как изучают язык по корпусам

30 августа 2026Время чтения: 8 минут
#корпусная лингвистика#корпус текстов#конкорданс#коллокации#частотный анализ
Корпусная лингвистика: как изучают язык по корпусам

Корпусная лингвистика это раздел языкознания, который делает выводы о языке не из интуиции исследователя, а из больших собраний реальных текстов. Вместо вопроса «так можно сказать?» здесь задают вопрос «как часто и в каких контекстах так говорят?». Ответ дают три вещи: корпус, поисковый запрос и статистика по выдаче. Ниже разберём устройство корпуса, разметку, конкорданс и меры связи слов, а форма ниже соберёт точный запрос под вашу учебную задачу.

Что такое корпусная лингвистика

Корпус это не просто много текстов, а специально собранное и размеченное электронное собрание, предназначенное для лингвистического анализа. Корпусная лингвистика превращает такое собрание в источник проверяемых данных: любое утверждение о языке подкрепляется числом вхождений, распределением по жанрам и списком контекстов.

Отсчёт принято вести от Брауновского корпуса (1964), где впервые собрали миллион словоупотреблений американского английского по строгой схеме отбора. Дальше размеры росли: Британский национальный корпус это 100 миллионов слов, современные веб-корпуса измеряются миллиардами. Национальный корпус русского языка (НКРЯ) в основном подкорпусе превысил 300 миллионов словоупотреблений и включает отдельные устный, поэтический, диалектный и параллельный подкорпусы.

Внутри направления различают два подхода. Corpus-based проверяет на данных заранее сформулированную гипотезу: например, что вид глагола влияет на выбор союза. Corpus-driven, наоборот, идёт от данных: исследователь смотрит на частотные списки и устойчивые сочетания и уже из них выводит закономерность. В учебной работе чаще применяют первый подход, потому что он даёт понятную структуру рассуждения.

Как устроен корпус: репрезентативность и баланс

Схема сборки корпуса: тексты проходят отбор, затем разметку и попадают в размеченную базу
Схема сборки корпуса: тексты проходят отбор, затем разметку и попадают в размеченную базу

Ключевых свойств у корпуса три. Репрезентативность означает, что материал отражает ту разновидность языка, о которой делается вывод: по газетному подкорпусу нельзя судить о разговорной речи. Сбалансированность это заданные пропорции жанров и типов текста, а не случайная свалка того, что нашлось в сети. Размеченность означает, что к каждому тексту приписаны метаданные (автор, год, жанр, сфера функционирования), а к каждому слову лингвистические признаки.

По устройству корпуса делят на письменные и устные, синхронные и диахронические (следят за изменением языка во времени), одноязычные и параллельные (тексты с выровненными переводами), общие и специализированные. Отдельный класс это учебные корпуса (learner corpora) с текстами изучающих язык: по ним исследуют типичные ошибки.

Объём корпуса измеряют в токенах, то есть словоупотреблениях, а не в уникальных словах. Уникальные единицы называют типами, и их отношение к токенам (type-token ratio) служит грубой мерой лексического разнообразия текста.

Разметка корпуса: токены, леммы, части речи

Разметка это то, что отличает корпус от коллекции файлов. Первый уровень это токенизация: текст разбивается на единицы, а сложные случаи вроде «из-за», «т. е.», «5 кг» решаются правилами. Второй уровень это лемматизация: словоформам «читал», «читаю», «читающий» приписывается лемма читать, благодаря чему поиск по лемме находит все формы сразу.

Третий уровень это морфологическая разметка, или POS-tagging: каждому токену приписывается часть речи и грамматические признаки (падеж, число, вид, время). Для русского это делают анализаторы вроде mystem, pymorphy или UDPipe. Проблема омонимии здесь принципиальна: форма «стали» это и глагол, и существительное. Если корпус снял омонимию вручную или статистически, говорят о снятой омонимии, и такой подкорпус точнее, но обычно меньше.

Выше идут синтаксическая разметка (корпус с деревьями зависимостей называют трибанком), семантическая, а также разметка ошибок и просодии в устных корпусах. Чем богаче разметка, тем более тонкие запросы можно построить: например, найти все случаи, где творительный падеж зависит именно от краткого причастия.

Конкорданс и KWIC: главный инструмент

Конкорданс в формате KWIC: ключевое слово выровнено в центральном столбце
Конкорданс в формате KWIC: ключевое слово выровнено в центральном столбце

Основная форма выдачи корпусного поиска это конкорданс, список всех вхождений искомой единицы вместе с окружением. Стандартный формат называют KWIC (key word in context): ключевое слово выровнено по центру, слева и справа от него показан контекст фиксированной длины.

Ценность конкорданса в сортировке. Отсортировав строки по первому слову справа, исследователь мгновенно видит, какие дополнения и предлоги слово присоединяет чаще всего; сортировка по левому контексту показывает типичные определения и подлежащие. То, что при чтении подряд кажется случайным, в отсортированном конкордансе выстраивается в отчётливые группы.

Конкорданс это ещё и материал для качественного анализа. Из сотен строк формируется выборка (обычно 100 или 200 случайных вхождений), которая размечается вручную по интересующему признаку, и уже эта разметка идёт в подсчёты.

Частотность: почему нужны ipm

Абсолютные числа вхождений сравнивать нельзя: 500 употреблений в корпусе на 5 миллионов слов и в корпусе на 500 миллионов означают совершенно разное. Поэтому частоту нормируют на миллион словоупотреблений, ipm (instances per million):

ipm=fN⋅106\text{ipm} = \frac{f}{N}\cdot 10^{6}

где ff это число вхождений, NN это объём подкорпуса в токенах. Если слово встретилось 250 раз в подкорпусе объёмом 5 млн токенов, то его частота равна 50 ipm, и это число уже сопоставимо с любым другим подкорпусом.

Нормированная частота позволяет строить главный сюжет корпусного исследования: сравнение подкорпусов. Слово с частотой 12 ipm в публицистике и 0,4 ipm в художественной прозе явно закреплено за одной сферой. Сама структура частотного списка при этом устроена не случайно, а подчиняется степенной зависимости частоты от ранга, которую описывает закон Ципфа.

Коллокации и меры связи слов

Узловое слово и его коллокаты: сила связи показана толщиной линий
Узловое слово и его коллокаты: сила связи показана толщиной линий

Коллокация это устойчивое сочетание, встречающееся вместе чаще, чем позволяет случай: «крепкий чай», «оказать влияние», «острая необходимость». Чтобы отделить такие пары от случайного соседства, считают меры ассоциации. Взаимная информация сравнивает наблюдаемую совместную частоту с ожидаемой при независимости:

MI=log⁡2f(x,y)⋅Nf(x)⋅f(y)\mathrm{MI} = \log_2 \frac{f(x,y)\cdot N}{f(x)\cdot f(y)}

t-score отвечает на другой вопрос, насколько мы уверены в связи с учётом объёма данных:

t=f(x,y)−f(x)⋅f(y)Nf(x,y)t = \frac{f(x,y) - \dfrac{f(x)\cdot f(y)}{N}}{\sqrt{f(x,y)}}

Меры дают разные списки, и это не дефект, а разделение труда. MI поднимает наверх редкие, но яркие пары (термины, идиомы), зато шумит на единичных вхождениях, поэтому её применяют с порогом f(x,y)≥5f(x,y)\ge 5. t-score тянет наверх частые сочетания со служебными словами. Компромисс даёт logDice, устойчивая к объёму корпуса мера:

logDice=14+log⁡22f(x,y)f(x)+f(y)\mathrm{logDice} = 14 + \log_2 \frac{2f(x,y)}{f(x)+f(y)}

Списки коллокатов удобно читать как эмпирическую карту сочетаемости слова, а группировка коллокатов по смыслу подводит к тем же построениям, что и семантическое поле в традиционной лексикологии.

Какие корпуса брать для учебной работы

Для русского языка базовый ресурс это НКРЯ: он бесплатен, размечен морфологически и синтаксически, содержит метаданные и позволяет строить сложные запросы с расстоянием между словами. Для больших статистических подсчётов берут веб-корпуса Araneum Russicum и ruTenTen в Sketch Engine, где счёт идёт на миллиарды токенов и есть готовые словесные эскизы (word sketches). Диахронические вопросы решает Google Books Ngram, для английского стандартом остаются BNC и COCA.

Свой корпус собирают, когда нужной коллекции не существует: тексты одного автора, отзывы, студенческие работы. Порядок такой: сбор, очистка от разметки и дублей, приведение к единой кодировке, автоматическая лемматизация и POS-разметка, добавление метаданных. Даже маленький собственный корпус на 200 тысяч токенов даёт защитимые выводы, если честно описаны источники и принцип отбора.

Как построить корпусное исследование

Схема работы почти всегда одна. Сначала формулируется лингвистический вопрос и гипотеза в проверяемом виде. Затем выбирается корпус и подкорпусы, между которыми пойдёт сравнение. Дальше составляется запрос: по лемме, по грамматическим признакам, по расстоянию между элементами. Полученный конкорданс превращают в выборку, вручную размечают её по нужному признаку и сводят в таблицу сопряжённости.

На последнем шаге считают статистику. Для сравнения долей в двух подкорпусах используют критерий хи-квадрат или log-likelihood ratio, а размер эффекта показывают через отношение нормированных частот. Вывод формулируют осторожно: корпус свидетельствует о употреблении в собранном материале, а не о языке вообще.

Частые ошибки

  • Сравнивать абсолютные частоты. Пока числа не приведены к ipm, любое сравнение подкорпусов разного объёма бессмысленно.
  • Делать вывод по десятку примеров. Выборка из 10 строк конкорданса не отличает закономерность от случайности, минимум это 100 размеченных вхождений.
  • Путать словоформы и леммы. Поиск по форме «дела» и по лемме дело даёт принципиально разные множества.
  • Доверять MI на единичных парах. Без порога по совместной частоте наверх списка выходят опечатки и имена собственные.
  • Считать корпус зеркалом языка. Корпус отражает ровно тот материал, который в него отобрали, поэтому состав источников описывают в работе всегда.

FAQ

Чем корпус отличается от обычной коллекции текстов? Корпус специально отобран по схеме (репрезентативность и баланс), снабжён метаданными и лингвистической разметкой и доступен через поисковую систему с выдачей в виде конкорданса. Папка со скачанными файлами всем этим не обладает.

Какой корпус русского языка выбрать для курсовой? Для большинства тем достаточно НКРЯ: он бесплатен, позволяет ограничивать поиск жанром и годом и показывает нормированные частоты. Если нужны миллиарды токенов и словесные эскизы, берут Araneum Russicum или ruTenTen.

Как понять, что сочетание слов это коллокация, а не случайность? Посчитать меру ассоциации: MI выше 3 при совместной частоте не ниже 5 или высокий logDice говорят об устойчивой связи. Дополнительно проверяют, сохраняется ли пара в другом корпусе.

Коротко

Корпусная лингвистика заменяет интуитивные суждения о языке измеримыми: корпус даёт материал, разметка даёт возможность точного запроса, а конкорданс, нормированная частота в ipm и меры коллокаций MI, t-score и logDice превращают выдачу в аргумент. Учебное исследование строится по одной схеме: гипотеза, выбор корпуса и подкорпусов, запрос, размеченная выборка, статистика и осторожно сформулированный вывод о материале, а не о языке в целом.

Доверьте текст нейросети EssayAI

Открыть EssayAI

Бесплатно, на русском языке и без VPN

Читайте также

Стилометрия: как находят автора по стилю

Стилометрия: как находят автора по стилю

Стилометрия измеряет частотные слова, n-граммы и синтаксис, чтобы сравнить тексты и проверить авторство. Разбираем дельту Берроуза, атрибуцию и ограничения метода.

28 сентября 20267 минут
Адаптация первокурсников к вузу

Адаптация первокурсников к вузу

Адаптация первокурсников к вузу: виды трудностей, этапы вхождения в учебную и социальную среду, роль куратора и тьютора, методы оценки и практические рекомендации.

29 сентября 20267 минут
Адвербиализация: как слова становятся наречиями

Адвербиализация: как слова становятся наречиями

Адвербиализация в русском языке: переход существительных, прилагательных и деепричастий в наречия, критерии, спорные случаи и правила слитного написания.

29 сентября 20268 минут
Акт о супрематии 1534: церковь и власть

Акт о супрематии 1534: церковь и власть

Акт о супрематии 1534 года: почему Генрих VIII стал главой церкви Англии, как присяга привела к казни Мора и Фишера, роспуску монастырей и появлению англиканства.

29 сентября 20268 минут
Александрийская поэзия: черты и представители

Александрийская поэзия: черты и представители

Александрийская поэзия эллинистической эпохи: Мусейон, Каллимах, Феокрит, эпиграмма и учёная работа со старой традицией, повлиявшая на римских поэтов.

29 сентября 20268 минут
Алкеста Еврипида: жертва, долг и возвращение

Алкеста Еврипида: жертва, долг и возвращение

«Алкеста» Еврипида: почему жена умирает вместо Адмета, как Геракл спорит со Смертью и зачем трагедии счастливый финал. Сюжет, образы и темы для анализа пьесы.

29 сентября 20269 минут