EssayAI
Блог
Блог

Как вычислить ковариацию: разбор задачи по таблице

Запрос

Дано: двумерная дискретная величина (X,Y)(X, Y), значения XX: 1; 2; 31;\ 2;\ 3, значения YY: 2; 4; 62;\ 4;\ 6, вероятности совместного распределения по строкам 0,20; 0,08; 0,020{,}20;\ 0{,}08;\ 0{,}02, затем 0,08; 0,24; 0,080{,}08;\ 0{,}24;\ 0{,}08, затем 0,02; 0,08; 0,200{,}02;\ 0{,}08;\ 0{,}20. Найти: ковариацию cov(X,Y)\mathrm{cov}(X,Y) и коэффициент корреляции rXYr_{XY}.

Быстрее всего ковариация считается рабочей формулой cov(X,Y)=M(XY)−M(X) M(Y)\mathrm{cov}(X,Y) = M(XY) - M(X)\,M(Y): по таблице находится ожидание произведения, из него вычитается произведение ожиданий. Ответ: cov(X,Y)=0,72\mathrm{cov}(X,Y) = 0{,}72 и rXY=0,6r_{XY} = 0{,}6. Калькулятор сверху пересчитывает то же самое под любую другую таблицу, а переключатель способа показывает, из каких слагаемых собирается ответ в каждой из двух формул.

Решение по шагам

Условие. Совместное распределение задано матрицей вероятностей pij=P(X=xi, Y=yj)p_{ij} = P(X = x_i,\ Y = y_j). В крайнем правом столбце и нижней строке сразу выписаны суммы, они понадобятся на втором шаге:

pijp_{ij}Y=2Y=2Y=4Y=4Y=6Y=6P(X=xi)P(X=x_i)
X=1X=10,200,080,020,30
X=2X=20,080,240,080,40
X=3X=30,020,080,200,30
P(Y=yj)P(Y=y_j)0,300,400,301,00

Шаг 1. Проверяем нормировку. Сумма всех девяти вероятностей обязана равняться единице, иначе распределение задано неверно и считать нечего:

∑i∑jpij=(0,20+0,08+0,02)+(0,08+0,24+0,08)+(0,02+0,08+0,20)=1,00.\sum_{i}\sum_{j} p_{ij} = (0{,}20 + 0{,}08 + 0{,}02) + (0{,}08 + 0{,}24 + 0{,}08) + (0{,}02 + 0{,}08 + 0{,}20) = 1{,}00.

Условие выполнено. Проверка занимает пять секунд и отсекает половину ошибок в контрольных: если сумма не равна единице, в условии потеряна ячейка или переписана не та вероятность.

Шаг 2. Выписываем маргинальные распределения. Сумма по строке даёт вероятность значения XX, сумма по столбцу - вероятность значения YY. Здесь получилось P(X)=0,30; 0,40; 0,30P(X) = 0{,}30;\ 0{,}40;\ 0{,}30 и P(Y)=0,30; 0,40; 0,30P(Y) = 0{,}30;\ 0{,}40;\ 0{,}30. Устройство самой таблицы и условные распределения подробно разобраны в статье про совместное распределение двух случайных величин - для ковариации от неё нужны только эти два ряда и исходные ячейки.

Шаг 3. Находим оба математических ожидания. Считаются они уже не по таблице, а по маргинальным рядам, как у обычной одномерной величины:

M(X)=1⋅0,30+2⋅0,40+3⋅0,30=0,30+0,80+0,90=2,00,M(Y)=2⋅0,30+4⋅0,40+6⋅0,30=0,60+1,60+1,80=4,00.\begin{aligned} M(X) &= 1 \cdot 0{,}30 + 2 \cdot 0{,}40 + 3 \cdot 0{,}30 = 0{,}30 + 0{,}80 + 0{,}90 = 2{,}00, \\ M(Y) &= 2 \cdot 0{,}30 + 4 \cdot 0{,}40 + 6 \cdot 0{,}30 = 0{,}60 + 1{,}60 + 1{,}80 = 4{,}00. \end{aligned}

Техника этого шага со всеми её подводными камнями разобрана в задаче про математическое ожидание, здесь оба числа нужны как заготовка.

Шаг 4. Считаем ожидание произведения. Вот тут маргинали уже не годятся: перемножать надо значения внутри каждой ячейки и брать её собственную вероятность pijp_{ij}. Удобно идти по строкам таблицы:

M(XY)=∑i∑jxiyjpij=(1⋅2⋅0,20+1⋅4⋅0,08+1⋅6⋅0,02)+(2⋅2⋅0,08+2⋅4⋅0,24+2⋅6⋅0,08)+(3⋅2⋅0,02+3⋅4⋅0,08+3⋅6⋅0,20)=0,84+3,20+4,68=8,72.\begin{aligned} M(XY) &= \sum_{i}\sum_{j} x_i y_j p_{ij} \\ &= (1 \cdot 2 \cdot 0{,}20 + 1 \cdot 4 \cdot 0{,}08 + 1 \cdot 6 \cdot 0{,}02) \\ &+ (2 \cdot 2 \cdot 0{,}08 + 2 \cdot 4 \cdot 0{,}24 + 2 \cdot 6 \cdot 0{,}08) \\ &+ (3 \cdot 2 \cdot 0{,}02 + 3 \cdot 4 \cdot 0{,}08 + 3 \cdot 6 \cdot 0{,}20) \\ &= 0{,}84 + 3{,}20 + 4{,}68 = 8{,}72. \end{aligned}

Шаг 5. Подставляем в рабочую формулу. Из ожидания произведения вычитается произведение ожиданий:

cov(X,Y)=M(XY)−M(X) M(Y)=8,72−2,00⋅4,00=8,72−8,00=0,72.\mathrm{cov}(X,Y) = M(XY) - M(X)\,M(Y) = 8{,}72 - 2{,}00 \cdot 4{,}00 = 8{,}72 - 8{,}00 = 0{,}72.

Ответ: cov(X,Y)=0,72\mathrm{cov}(X,Y) = 0{,}72. Знак положительный, значит большим значениям XX в среднем отвечают большие значения YY.

Шаг 6. Проверяем ответ по определению. Второй способ суммирует произведения отклонений от средних. Ненулевой вклад дают только четыре угловые ячейки: в строке X=2X = 2 отклонение xi−M(X)x_i - M(X) равно нулю, в столбце Y=4Y = 4 нулю равно отклонение yj−M(Y)y_j - M(Y), и такие слагаемые пропадают:

cov(X,Y)=∑i∑j(xi−M(X))(yj−M(Y))pij=(−1)(−2)⋅0,20+(−1)(2)⋅0,02+(1)(−2)⋅0,02+(1)(2)⋅0,20=0,40−0,04−0,04+0,40=0,72.\begin{aligned} \mathrm{cov}(X,Y) &= \sum_{i}\sum_{j} \big(x_i - M(X)\big)\big(y_j - M(Y)\big) p_{ij} \\ &= (-1)(-2) \cdot 0{,}20 + (-1)(2) \cdot 0{,}02 + (1)(-2) \cdot 0{,}02 + (1)(2) \cdot 0{,}20 \\ &= 0{,}40 - 0{,}04 - 0{,}04 + 0{,}40 = 0{,}72. \end{aligned}

Числа совпали, арифметика верна. На графике в калькуляторе это те самые зелёные и терракотовые точки: зелёные дают в сумме 0,800{,}80, терракотовые −0,08-0{,}08, а ковариация равна их перевесу.

Шаг 7. Переходим к коэффициенту корреляции. Ковариация зависит от единиц измерения, поэтому её нормируют на произведение средних квадратических отклонений. Сначала дисперсии:

D(X)=M(X2)−(M(X))2=(1⋅0,30+4⋅0,40+9⋅0,30)−2,002=4,60−4,00=0,60,D(Y)=M(Y2)−(M(Y))2=(4⋅0,30+16⋅0,40+36⋅0,30)−4,002=18,40−16,00=2,40.\begin{aligned} D(X) &= M(X^2) - \big(M(X)\big)^2 = (1 \cdot 0{,}30 + 4 \cdot 0{,}40 + 9 \cdot 0{,}30) - 2{,}00^2 = 4{,}60 - 4{,}00 = 0{,}60, \\ D(Y) &= M(Y^2) - \big(M(Y)\big)^2 = (4 \cdot 0{,}30 + 16 \cdot 0{,}40 + 36 \cdot 0{,}30) - 4{,}00^2 = 18{,}40 - 16{,}00 = 2{,}40. \end{aligned}

Отсюда σX=0,60≈0,775\sigma_X = \sqrt{0{,}60} \approx 0{,}775, σY=2,40≈1,549\sigma_Y = \sqrt{2{,}40} \approx 1{,}549, а их произведение равно 0,60⋅2,40=1,44=1,20\sqrt{0{,}60 \cdot 2{,}40} = \sqrt{1{,}44} = 1{,}20 точно. Тогда

rXY=cov(X,Y)σXσY=0,721,20=0,60.r_{XY} = \frac{\mathrm{cov}(X,Y)}{\sigma_X \sigma_Y} = \frac{0{,}72}{1{,}20} = 0{,}60.

Ответ: rXY=0,6r_{XY} = 0{,}6 - прямая линейная связь умеренной силы. Техника расчёта дисперсии по ряду распределения разобрана в задаче про дисперсию.

Формула ковариации и откуда она берётся

Определение ковариации выглядит так: это математическое ожидание произведения отклонений величин от своих средних, то есть cov(X,Y)=M[(X−M(X))(Y−M(Y))]\mathrm{cov}(X,Y) = M\big[(X - M(X))(Y - M(Y))\big]. Смысл прямой: если обе величины одновременно отклоняются вверх или одновременно вниз, произведение отклонений положительно, и ячейка добавляет ковариации плюс. Если одна выше своего среднего, а другая ниже, произведение отрицательно, и ячейка тянет ковариацию вниз.

Рабочая формула получается раскрытием скобок и линейностью ожидания:

M[(X−M(X))(Y−M(Y))]=M(XY)−M(X) M(Y)−M(X) M(Y)+M(X) M(Y)=M(XY)−M(X) M(Y).M\big[(X - M(X))(Y - M(Y))\big] = M(XY) - M(X)\,M(Y) - M(X)\,M(Y) + M(X)\,M(Y) = M(XY) - M(X)\,M(Y).

Считать по ней быстрее: не нужно вычислять отклонения для каждой из девяти ячеек, хватает трёх сумм. Зато вариант с отклонениями устойчивее к округлениям и нагляднее объясняет знак ответа, поэтому в контрольных его часто требуют как проверку.

Единицы измерения у ковариации составные: произведение единиц XX и YY. Если XX измеряется в штуках, а YY в рублях, то ковариация выражена в «штуко-рублях» и сравнивать её с ковариацией другой пары величин бессмысленно. Именно поэтому за ковариацией почти всегда идёт коэффициент корреляции: он безразмерен и всегда лежит в промежутке от минус единицы до единицы.

Ковариация по выборке пар значений

Второй тип условия: распределение не задано, есть только nn пар наблюдений. Тогда вероятности заменяются частотами, а ожидания - средними. Для пяти пар (2; 6)(2;\ 6), (3; 5)(3;\ 5), (5; 9)(5;\ 9), (6; 10)(6;\ 10), (4; 5)(4;\ 5) сначала находятся средние: xˉ=20/5=4\bar{x} = 20/5 = 4 и yˉ=35/5=7\bar{y} = 35/5 = 7. Сумма произведений равна ∑xiyi=152\sum x_i y_i = 152, отсюда

covв=1n∑i=1nxiyi−xˉ yˉ=1525−4⋅7=30,4−28=2,4.\mathrm{cov}_{\text{в}} = \frac{1}{n}\sum_{i=1}^{n} x_i y_i - \bar{x}\,\bar{y} = \frac{152}{5} - 4 \cdot 7 = 30{,}4 - 28 = 2{,}4.

Это смещённая оценка. Исправленная получается делением на n−1n - 1: (152−5⋅28)/4=12/4=3(152 - 5 \cdot 28)/4 = 12/4 = 3. Разница между 2,42{,}4 и 33 на маленькой выборке заметна, поэтому в условии всегда надо смотреть, какой знаменатель требуют: в матстатистике по умолчанию берут n−1n - 1, в задачах по теории вероятностей на готовом распределении вопрос не возникает вовсе. Как выглядят те же пары на диаграмме рассеяния, показано в задаче про корреляционное поле.

Независимость, некоррелированность и свойства ковариации

Если величины независимы, ковариация равна нулю: ожидание произведения распадается на произведение ожиданий. Обратное неверно, и это любимый вопрос на защите. Пусть XX принимает значения −1-1, 00, 11 с вероятностями по 1/31/3, а Y=X2Y = X^2. Тогда M(X)=0M(X) = 0, M(XY)=M(X3)=0M(XY) = M(X^3) = 0, значит ковариация нулевая, хотя YY полностью определяется через XX. Ковариация видит только линейную часть связи, а квадратичную не замечает.

Проверить зависимость в нашей задаче можно прямо по таблице: для независимых величин каждая ячейка равнялась бы произведению маргиналей. Ячейка (1; 2)(1;\ 2) равна 0,200{,}20, а произведение 0,30⋅0,30=0,090{,}30 \cdot 0{,}30 = 0{,}09, числа разные, значит величины зависимы. Ненулевая ковариация это подтверждает, но сама по себе равная нулю ковариация вывод о независимости не даёт.

Три свойства сокращают вычисления. Первое: cov(X,X)=D(X)\mathrm{cov}(X,X) = D(X), то есть дисперсия - частный случай ковариации. Второе: сдвиг не влияет, а множители выносятся, cov(aX+b, cY+d)=ac⋅cov(X,Y)\mathrm{cov}(aX + b,\ cY + d) = ac \cdot \mathrm{cov}(X,Y); для нашей пары cov(2X+3, Y−1)=2⋅0,72=1,44\mathrm{cov}(2X + 3,\ Y - 1) = 2 \cdot 0{,}72 = 1{,}44. Третье: дисперсия суммы равна D(X+Y)=D(X)+D(Y)+2 cov(X,Y)D(X + Y) = D(X) + D(Y) + 2\,\mathrm{cov}(X,Y), здесь это 0,60+2,40+1,44=4,440{,}60 + 2{,}40 + 1{,}44 = 4{,}44. Значимость найденной связи на выборочных данных проверяют отдельно, через t-критерий для коэффициента корреляции.

Частые ошибки

  • Считают M(XY)M(XY) по маргинальным рядам. Произведение берётся внутри ячейки, с вероятностью pijp_{ij}; если перемножить M(X)M(X) и M(Y)M(Y), получится ровно то, что потом вычитается, и ответ выйдет нулевым при любой таблице.
  • Забывают проверить сумму вероятностей. При ∑pij≠1\sum p_{ij} \ne 1 ожидания посчитаны по ненормированному распределению, и все дальнейшие числа неверны.
  • Путают строки и столбцы при сборе маргиналей. Вероятность значения XX - это сумма по строке целиком, а не отдельная ячейка первого столбца.
  • Теряют знак отклонения. В расчёте по определению произведение двух отрицательных отклонений положительно; минус появляется только когда отклонения разного знака.
  • Делят ковариацию на дисперсии вместо СКО. В знаменателе корреляции стоит σXσY=D(X)D(Y)\sigma_X \sigma_Y = \sqrt{D(X) D(Y)}, деление на D(X)D(Y)D(X) D(Y) даёт число вне промежутка от минус единицы до единицы.
  • Из нулевой ковариации делают вывод о независимости. Корректно только обратное направление.

FAQ

Чем ковариация отличается от корреляции? Это одна и та же характеристика связи, но в разных масштабах. Ковариация измеряется в произведении единиц исходных величин и по её модулю нельзя судить о тесноте связи. Коэффициент корреляции - та же ковариация, делённая на σXσY\sigma_X \sigma_Y, он безразмерен и ограничен промежутком от −1-1 до 11.

Может ли ковариация быть больше дисперсии? Нет, её модуль ограничен: ∣cov(X,Y)∣≤σXσY|\mathrm{cov}(X,Y)| \le \sigma_X \sigma_Y, это следствие неравенства Коши-Буняковского. Равенство достигается только при строгой линейной зависимости Y=aX+bY = aX + b, и тогда r=±1r = \pm 1.

Что означает отрицательная ковариация? Величины меняются в противоположных направлениях: большим значениям одной в среднем отвечают меньшие значения другой. Формально это значит, что в таблице перевешивают ячейки с разными знаками отклонений.

Когда делить на nn, а когда на n−1n - 1? При расчёте по заданному распределению делителя нет вообще, там веса задаются вероятностями. По выборке делитель nn даёт смещённую оценку, а n−1n - 1 несмещённую, и именно её просят в задачах математической статистики.

Коротко

  1. Проверить нормировку: сумма всех pijp_{ij} равна единице. Здесь условие выполнено.
  2. Сложить строки и столбцы, получить маргинальные распределения, по ним найти M(X)=2,00M(X) = 2{,}00 и M(Y)=4,00M(Y) = 4{,}00.
  3. Посчитать ожидание произведения по ячейкам: M(XY)=8,72M(XY) = 8{,}72.
  4. Подставить в рабочую формулу: cov(X,Y)=8,72−8,00=0,72\mathrm{cov}(X,Y) = 8{,}72 - 8{,}00 = 0{,}72, и проверить по определению через отклонения - выходит то же 0,720{,}72.
  5. Нормировать на σXσY=1,20\sigma_X \sigma_Y = 1{,}20: коэффициент корреляции rXY=0,6r_{XY} = 0{,}6, связь прямая и умеренная.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Теория вероятностей

Как найти равномерное распределение: разбор задачи

Как найти равномерное распределение непрерывной величины на отрезке: плотность 1 делить на длину, функция распределения, мат. ожидание и дисперсия, вероятность попадания в интервал.

Теория вероятностей

Как найти показательное распределение: разбор задачи

Как найти показательное распределение по параметру lambda: плотность и функция распределения, математическое ожидание и дисперсия, вероятность попадания в интервал, отсутствие последействия.

Теория вероятностей

Как построить многоугольник распределения: пример

Как построить многоугольник распределения дискретной случайной величины: ряд распределения, проверка нормировки, точки ломаной, поиск M(X), D(X) и моды, частые ошибки, FAQ.

Теория вероятностей

Как найти нормальное распределение: разбор задачи

Как найти нормальное распределение и вероятность по нему: плотность с параметрами a = 30 и σ = 10, нормировка границ, значения функции Лапласа по таблице и правило трёх сигм.

Теория вероятностей

Как найти вероятность хотя бы одного: разбор задачи

Как найти вероятность хотя бы одного события через противоположное: формула P = 1 минус произведение q, разбор задачи про три станка, случай одинаковых вероятностей и частые ошибки.

Теория вероятностей

Как решить задачу на встречу: разбор с чертежом

Как решить задачу на встречу через геометрическую вероятность: квадрат моментов прихода, полоса вдоль диагонали, отношение площадей, разные времена ожидания и частые ошибки.