Акустическая фонетика: форманты и спектрограмма

Речь можно изучать как работу органов артикуляции, но тот же материал можно описать и как физический сигнал. Микрофон не видит язык, губы или голосовые складки: он регистрирует изменения звукового давления во времени. Акустическая фонетика переводит эту запись в измеримые параметры и связывает их с тем, что слышит говорящий. Поэтому она отвечает не только на вопрос «как образован звук», но и на вопрос «какие особенности сигнала делают его узнаваемым».
Что изучает акустическая фонетика
Акустическая фонетика исследует физические свойства речевого сигнала: частоту колебаний, амплитуду, длительность, спектральный состав и изменения этих величин во времени. Это промежуточная область между фонетикой, акустикой и обработкой сигналов. Артикуляционная классификация описывает положение языка и губ, а акустический анализ проверяет, каким следом это положение становится в записи. Например, сдвиг языка вперёд у гласного обычно сопровождается повышением второй форманты, но форманта - не «фотография языка», а резонансная характеристика всего речевого тракта.
Для связи двух описаний важно не путать букву, фонему и акустический отрезок. Одна фонема получает разные реализации в зависимости от ударения и соседей, а одинаковая буква может обозначать разные звуки. В этом смысле акустическая фонетика дополняет разбор артикуляционной классификации гласных: там заданы ряд и подъём, здесь видны их вероятные корреляты в сигнале.
Звук как колебание
В простейшей модели звук - это колебание давления около среднего значения. Если давление меняется почти периодически, слушатель воспринимает устойчивый тон; если изменения нерегулярны, возникает шум. Частота показывает, сколько циклов происходит за секунду, и измеряется в герцах. Период связан с ней так:
Амплитуда связана с размахом изменения давления и субъективно участвует в восприятии громкости, хотя громкость не равна амплитуде напрямую: важны частота, длительность и особенности слуха. Длительность - временной параметр, который измеряют от границы одного сегмента до другой. Его не следует путать с фонологической долготой гласных: акустически любой звук можно произнести чуть дольше, но только в некоторых языках длительность образует смыслоразличительную оппозицию.
Гласный обычно сочетает периодический источник и резонансы. Голосовые складки задают возбуждение, а полости глотки и рта усиливают одни частоты и ослабляют другие. У щелевых согласных источник может быть преимущественно шумовым: турбулентный поток создаёт нерегулярные колебания, поэтому строгого основного периода у такого фрагмента нет.
Основной тон и обертоны
При звонком звуке голосовые складки открываются и смыкаются квазипериодически. Частота повторения импульсов называется частотой основного тона, или . Она связана с воспринимаемой высотой голоса, но не определяет тембр целиком. Мужской, женский и детский голос могут произнести одну и ту же гласную на близкой высоте, сохранив разные спектральные картины.
Периодический сигнал редко состоит только из одной синусоиды. В нём есть основной тон и гармоники, или обертоны, с частотами, близкими к , и так далее. Их относительные амплитуды зависят от формы голосовой щели и фильтрации речевым трактом. Если основной тон меняется, расстояние между гармониками меняется тоже; положение резонансов при той же гласной может оставаться примерно тем же. Поэтому и форманты - разные измерения: первое описывает источник возбуждения, вторые - фильтр.
Форманты гласных: F1 и F2
Форманта - область усиления энергии в спектре, возникающая из-за резонансов речевого тракта. Первую форманту обычно связывают с подъёмом языка и степенью открытости: у более открытых гласных она выше, у более закрытых - ниже. Вторая форманта чувствительна к ряду: у передних гласных она в среднем выше, у задних - ниже. Это удобная учебная тенденция, а не универсальная формула без исключений: на частоты влияют пол говорящего, возраст, соседние звуки и конкретный язык.
Именно поэтому график по вертикали и по горизонтали часто напоминает перевёрнутый артикуляционный четырёхугольник. На нём можно сравнить гласные одного диктора и увидеть, как меняется качество при продвижении языка или его подъёме. Но нельзя читать координаты как точное положение органов речи. Форманты - результат акустики полостей, а не непосредственное измерение расстояния от языка до нёба.

Для корректного сравнения записывают несколько реализаций в сходном контексте, отмечают середину устойчивого участка гласного и используют одинаковые настройки анализа. Сравнивать F1 одного говорящего в начале гласного с F1 другого в конце гласного без оговорок нельзя: часть различия может быть переходом к соседнему согласному.
Осциллограмма и спектрограмма
Осциллограмма показывает сигнал как зависимость амплитуды от времени. На ней видны границы, паузы, всплески смычки, периодические участки и длительность. Для звонкого гласного характерен повторяющийся рисунок, а для шума - более хаотичная мелкая структура. Осциллограмма хороша для временной организации, но по ней трудно надёжно определить, какие частоты образуют тембр.
Спектрограмма раскладывает сигнал по трём измерениям: время по горизонтали, частота по вертикали, энергия кодируется интенсивностью цвета. Горизонтальные полосы в гласном - приблизительные следы формант; вертикальный всплеск может соответствовать краткому переходному событию. Чем темнее полоса, тем больше энергии в соответствующей области, но оттенок зависит и от шкалы отображения. Спектрограмму нельзя читать без указания диапазона частот, шага анализа и типа окна.

Спектр и спектрограмма не одно и то же. Спектр - срез частот для выбранного временного окна, спектрограмма - последовательность таких срезов. Короткое окно лучше показывает изменения во времени, но хуже разделяет близкие частоты; длинное окно повышает частотное разрешение, зато размывает быстрые переходы. Это компромисс времени и частоты, а не ошибка конкретной программы.
Шумы согласных
У согласных акустическая картина зависит от способа образования. Смычные имеют участок смычки с малой энергией и короткий взрыв при раскрытии. Щелевые, например [с] или [ш], дают шумовой участок: энергия распределяется по широкому диапазону частот, а форма спектра зависит от места сужения и объёма передней полости. Сонорные и звонкие согласные объединяют периодический компонент с шумом или изменением амплитуды.
Аффриката соединяет признаки смычного и щелевого: сначала возникает закрытие, затем шумовой этап. Для различения согласных смотрят не на одну «магическую» частоту, а на длительность, спектр шума, наличие голоса, форму перехода к соседнему гласному и момент начала периодичности. Поэтому аудиторный слуховой ярлык «шипящий» полезен как гипотеза, но не заменяет измерения.
Как работать в Praat
Praat - программа для анализа, синтеза и разметки речи; её официальное руководство включает спектральный, тональный и формантный анализ. Базовый учебный маршрут такой: загрузить звуковой файл, открыть объект Sound в редакторе, выделить устойчивый фрагмент и включить отображение спектрограммы, тона и формант. Затем фиксируют настройки и записывают значения , , в выбранных временных точках.
Сначала проверьте качество записи: фон, клиппинг, расстояние до микрофона и частоту дискретизации. Затем отметьте границы слова и сегментов в TextGrid. Для гласного берите несколько точек, а не единственный пик: начало и конец часто искажены переходами. В отчёте укажите диктора, слово, ударение, частоту дискретизации, диапазон спектрограммы, настройки поиска тона и способ выбора участка. Если форманты «прыгают», это не повод выбрать самое красивое значение: сначала проверьте, не ошибся ли алгоритм на шуме или соседнем согласном.
Где применяют акустический анализ
В распознавании речи акустические признаки служат входом для моделей, которые сопоставляют сигнал с фонемами, словами и фразами. Современные системы используют гораздо больше, чем две форманты: спектральные признаки, временную структуру, контекст и выученные представления. В криминалистике сравнивают голосовые признаки и условия записи, но акустический анализ не даёт механической гарантии личности: телефонный канал, стресс, болезнь, микрофон и намеренная маскировка меняют сигнал.
Метод полезен и в исследовании произношения, диалектологии, логопедии, синтезе речи и преподавании фонетики. Для каждой задачи различается критерий: распознаванию важна устойчивость признаков, диалектологии - сопоставимость групп, а синтезу - возможность воспроизвести временной и спектральный рисунок. Общий принцип один: измерение должно быть воспроизводимым, а вывод - скромнее, чем позволяет качество данных.
Частые ошибки
- F0 принимают за первую форманту. Основной тон описывает повторение возбуждения, а F1 - резонанс речевого тракта.
- По одной форманте называют гласный. Для качества обычно нужны как минимум F1 и F2, контекст и сведения о дикторе.
- Спектрограмму считают фотографией артикуляции. Она показывает распределение энергии, а не прямую траекторию языка.
- Сравнивают несопоставимые записи. Разные микрофоны, громкость, окна анализа и позиции в слове меняют картину.
- Шум принимают за отсутствие информации. Шумовой спектр и переходы к гласным тоже несут признаки места и способа образования.
FAQ
Что важнее для гласного: F1 или F2? Они отвечают на разные вопросы. F1 чаще связывают с подъёмом, F2 - с рядом, поэтому для учебной классификации полезно смотреть на обе форманты.
Можно ли определить слово только по спектрограмме? Иногда опытный исследователь узнает характерные участки, но надёжное распознавание требует временной структуры, контекста и модели, обученной на сопоставимых данных.
Почему значения формант у людей различаются? Размеры речевого тракта, возраст, пол, темп, стиль и соседние звуки влияют на резонансы. Поэтому сравнивают нормированные или тщательно подобранные данные, а не универсальные пороги.
Коротко
Акустическая фонетика рассматривает речь как изменяющийся сигнал. Осциллограмма показывает время и амплитуду, спектр - частотный состав, спектрограмма соединяет оба измерения. связан с периодичностью голосового источника, а и помогают описывать качество гласных через резонансы. Шумы, переходы и длительность дополняют картину согласных. Praat превращает эти идеи в воспроизводимый анализ, если фиксировать настройки, сравнивать сопоставимые записи и помнить о пределах интерпретации.
Читайте также

Артикуляционная база языка: как формируется произношение
Артикуляционная база языка: привычные положения языка, губ и гортани, различия русского и английского произношения, акцент и упражнения для тренировки.

Фонетическое членение речи: единицы и границы
Фонетическое членение речи показывает, как поток распадается на фразы, синтагмы, слова, слоги и звуки в живом произношении. Разберём паузы, ударение, интонацию и клитики.

Качественная и количественная редукция гласных
Качественная и количественная редукция гласных в русском языке: что меняется в тембре и длительности, как различать позиции, аканье, иканье и транскрипцию.

Коартикуляция: как звуки влияют друг на друга
Коартикуляция объясняет наложение артикуляций соседних звуков. Разбираем упреждающее и инерционное влияние, лабиализацию, русские и английские примеры, синтез и распознавание речи.

Аффрикаты: ц и ч, МФА и отличие от сочетаний
Аффрикаты это смычно-щелевые согласные. Разбираем, как образуются русские ц и ч, как записать их в МФА, чем они отличаются от двух звуков и где встречаются в других языках.

Долгота гласных: фонема, МФА и примеры языков
Долгота гласных как фонологический признак: чем долгий звук отличается от краткого, как его обозначают в МФА и что произошло с долготой в русском языке.