Стилометрия: как находят автора по стилю

Стилометрия - количественное изучение индивидуальных особенностей письма. Она не пытается угадать автора по одному любимому слову или «ощущению текста»: исследователь сравнивает набор измеряемых признаков на корпусе известных произведений и на спорном фрагменте. Так проверяют атрибуцию анонимного письма, ищут соавторов в пьесе и отделяют авторский почерк от темы. Чтобы превратить общую тему в план реферата или исследование, выберите задачу в форме ниже.
Что именно изучает стилометрия
В литературоведении стиль описывают словами: синтаксис динамичный, лексика архаичная, фразы короткие. Стилометрия переводит часть таких наблюдений в признаки. К ним относятся частоты служебных слов, длина слов и предложений, знаки препинания, последовательности символов или слов (n-граммы), распределение частей речи и формы синтаксических конструкций. Особенно полезны служебные слова: союзы, предлоги и местоимения мало связаны с сюжетом, зато привычки их употребления часто устойчивы.
Это не замена интерпретации. Качественный анализ объясняет, зачем автор выбирает метафору, а стилометрический - насколько распределение выбранных признаков похоже на контрольный корпус. Поэтому стилометрия ближе к методам корпусной лингвистики, чем к чтению текста «по впечатлению».

Как строят корпус для атрибуции
Сначала формулируют задачу. При закрытой атрибуции неизвестный текст сравнивают с несколькими заранее известными авторами и выбирают наиболее близкого. При открытой проверяют, есть ли среди кандидатов вообще подходящий автор. В авторской верификации вопрос другой: похож ли спорный текст на корпус одного конкретного писателя.
Затем собирают сопоставимые образцы. Нельзя честно сравнивать короткое сообщение одного автора с романами другого или пьесу с письмами без оговорки о жанре. Желательно выровнять объём, датировку, редакторскую обработку и язык. Старые тексты требуют решения о нормализации орфографии: разные написания одного слова могут отражать эпоху, наборщика или редактора, а не индивидуальный стиль.
Корпус делят на обучающую и проверочную части. Модель должна увидеть одни тексты автора, а затем получить другой, не использованный при настройке. Иначе исследователь измерит не способность метода, а запоминание примеров. Для небольших корпусов полезны повторные разбиения и проверка устойчивости результата при смене набора признаков.
Частотные слова и «дельта» Берроуза
Один из понятных подходов использует несколько самых частотных слов корпуса. Для каждого текста считают относительную частоту слова, например долю союзов и предлогов от общего числа слов. Затем значения стандартизируют: из частоты вычитают среднее по корпусу и делят на стандартное отклонение. Так «и» в одном тексте и «но» в другом становятся сопоставимыми величинами.
Дельта Берроуза - это среднее расстояние между стандартизированными профилями двух текстов по выбранным частотным словам. В упрощённой записи для текста (x) и профиля автора (a):
[ \Delta(x,a)=\frac{1}{m}\sum_{j=1}^{m}\left|z_{x,j}-z_{a,j}\right|. ]
Чем меньше дельта, тем ближе профили в данной модели. Это мера расстояния, а не процент вероятности и не доказательство личности автора. Результат зависит от числа слов, корпуса, способа токенизации и того, какие признаки включены. Современные исследования отдельно обсуждают, почему такие расстояния работают и когда их нельзя интерпретировать буквально.
Как читают результат, а не только рейтинг
Представим, что спорный текст получил расстояния 0,42 до автора А, 0,57 до автора Б и 0,60 до автора В. Корректный вывод: в выбранном эксперименте он ближе к профилю А. Некорректный: «вероятность авторства А равна 42%». Дельта не является вероятностью, а разница между первым и вторым местом может быть слишком мала, чтобы иметь практический смысл.
Проверяют несколько вещей. Во-первых, меняется ли лидер при удалении самых частотных слов или переходе к символьным n-граммам. Во-вторых, сохраняется ли результат на отложенных текстах. В-третьих, не объясняется ли сходство общим жанром, периодом, переводом или редактором. Наконец, сравнивают метод с простым базовым правилом: иногда «ближайший» текст выбирается потому, что авторы происходят из одного издания, а не потому, что модель уловила почерк.
Атрибуция «Тихого Дона» и других спорных текстов
Вопрос об авторстве «Тихого Дона» часто приводят как пример того, где количественный анализ встречается с историей публикации, свидетельствами современников и экспертизой рукописей. Стилометрия может проверить сходство фрагментов с корпусами кандидатов, но не отменяет вопрос о составе корпуса: ранние и поздние тексты автора могут различаться, а редакторские вмешательства меняют частоты.
Тот же принцип полезен в шекспироведении. Шекспировский вопрос не решается одной таблицей частот: корпус пьес неоднороден, а драматурги сотрудничали. Количественные признаки могут поддержать гипотезу о совместной работе, как в дискуссиях о «Тимоне Афинском», но это не означает автоматического обнаружения «тайного автора». Надёжная атрибуция соединяет вычислительный результат с датировкой, текстологией и документами.
Ограничения метода и роль интерпретации
Стиль меняется со временем, под влиянием жанра и адресата. Автор письма к другу не обязан писать так же, как автор романа. Короткий текст даёт нестабильные частоты; перевод отражает работу переводчика; совместный текст смешивает несколько профилей. OCR-ошибки, разные правила дефисов и пунктуации тоже становятся ложными признаками.

Есть и статистическая ловушка множественных проверок. Если перебрать десятки способов очистки и выбрать только красивый результат, исследователь подгонит метод под желаемый вывод. Поэтому в работе заранее описывают корпус, признаки, метрику и критерий успеха, публикуют ограничения и по возможности повторяют анализ на другом наборе. Для знакомства с уровнями ручного разбора полезен лингвостилистический анализ текста: он помогает понять, какие наблюдения стоят за числовыми признаками.
Стилометрия не распознаёт «истинную индивидуальность» писателя и не выдаёт окончательный приговор. Она создаёт проверяемую модель сходства. Чем прозрачнее выбор данных и чем осторожнее формулировка вывода, тем полезнее результат для гуманитарного исследования.
Как оформить учебное исследование
Работу удобно строить по схеме: вопрос, корпус, предобработка, признаки, метрика, проверка, интерпретация. В разделе о корпусе укажите авторов, жанры, объём и даты. В разделе о методе объясните, что означает частота и почему выбраны служебные слова или n-граммы. В результатах приведите таблицу расстояний и не скрывайте близкие значения. Затем обсудите альтернативное объяснение: общий редактор, жанр или соавторство.
Такой план лучше громкого тезиса «компьютер установил автора». Если нужно сначала разобрать языковые средства без вычислений, сопоставьте количественный подход с планом анализа публицистического текста. А при обсуждении текстов, созданных нейросетью, не переносите выводы о человеческом авторстве механически: вопрос надёжности ИИ-текста требует отдельной проверки источников и контекста, о чём напоминает материал можно ли доверять ИИ-тексту.
Для простого учебного эксперимента достаточно небольшой таблицы: строки - тексты, столбцы - относительные частоты выбранных служебных слов. Но даже здесь полезно сохранить исходные версии, словарь токенизации и дату запуска. Тогда другой исследователь сможет повторить расчёт и увидеть, изменился ли вывод после удаления заголовков, примечаний или прямой речи. Если результаты расходятся, это не обязательно провал: расхождение показывает, какие допущения влияют на модель и какой дополнительный источник нужно проверить.
Частые ошибки
- Считать дельту вероятностью. Расстояние показывает близость профилей, но не даёт процента авторства.
- Смешивать жанры и эпохи. Модель может распознать письмо, пьесу или редактора вместо автора.
- Подбирать признаки после результата. Такой перебор повышает риск подгонки и требует независимой проверки.
- Забывать о длине текста. На малом фрагменте случайные частоты заметно искажают сравнение.
- Выдавать классификатор за доказательство. Вычислительный результат должен согласовываться с текстологическими и историческими данными.
FAQ
Можно ли определить автора по одному любимому слову? Нет. Одно слово зависит от темы и случайности. Нужен набор признаков, сопоставимый корпус и проверка устойчивости результата.
Чем стилометрия отличается от плагиата? Атрибуция ищет сходство с профилем автора, а проверка заимствований - совпадения фрагментов с конкретными источниками. Задачи могут пересекаться, но метрики и выводы различны.
Доказывает ли стилометрия соавторство? Она может обнаружить смену или смешение профилей и поддержать гипотезу о нескольких авторах. Однако окончательный вывод требует анализа рукописной истории, датировок и других свидетельств.
Коротко
Стилометрия сравнивает измеряемые особенности текстов: частотные слова, n-граммы, длину фраз и синтаксис. Дельта Берроуза выражает расстояние между стандартизированными профилями, но не является вероятностью авторства. Надёжное исследование начинается с сопоставимого корпуса, проверяется на новых данных и учитывает жанр, время, редактуру и соавторство. Поэтому количественный результат - сильный аргумент в цепочке доказательств, а не самостоятельный приговор.
Читайте также

Корпусная лингвистика: как изучают язык по корпусам
Корпусная лингвистика изучает язык по большим собраниям текстов. Разбираем устройство и разметку корпуса, конкорданс, частотность в ipm и меры коллокаций MI, t-score, logDice.

Автороведческая экспертиза: как устанавливают автора текста
Автороведческая экспертиза: объекты, признаки письменной речи, образцы, вопросы эксперту, компьютерный анализ и пределы вывода в судебном исследовании текста.

Адаптация первокурсников к вузу
Адаптация первокурсников к вузу: виды трудностей, этапы вхождения в учебную и социальную среду, роль куратора и тьютора, методы оценки и практические рекомендации.

Адвербиализация: как слова становятся наречиями
Адвербиализация в русском языке: переход существительных, прилагательных и деепричастий в наречия, критерии, спорные случаи и правила слитного написания.

Акт о супрематии 1534: церковь и власть
Акт о супрематии 1534 года: почему Генрих VIII стал главой церкви Англии, как присяга привела к казни Мора и Фишера, роспуску монастырей и появлению англиканства.

Александрийская поэзия: черты и представители
Александрийская поэзия эллинистической эпохи: Мусейон, Каллимах, Феокрит, эпиграмма и учёная работа со старой традицией, повлиявшая на римских поэтов.