EssayAI
Блог
Блог

Как найти уравнение линейной регрессии: пример решения

Запрос

Дано: по шести предприятиям известны затраты на рекламу xx (млн руб.): 1, 2, 3, 4, 5, 6 и выручка yy (млн руб.): 6, 7, 11, 14, 16, 21. Найти: уравнение парной линейной регрессии y^=a+bx\hat{y} = a + bx, коэффициент корреляции и прогноз выручки при затратах 7 млн руб.

Задача решается методом наименьших квадратов: заполняется расчётная таблица из четырёх сумм, из них по готовым формулам находятся bb и aa. Ответ: уравнение y^=2+3x\hat{y} = 2 + 3x, коэффициент корреляции rxy=0,988r_{xy} = 0{,}988, прогноз y^(7)=23\hat{y}(7) = 23 млн руб. Калькулятор сверху пересчитывает те же показатели под любые свои значения, а ниже идёт полный разбор с арифметикой.

Решение по шагам

Шаг 1. Расчётная таблица. Всё, что нужно для коэффициентов, - четыре суммы: ∑x\sum x, ∑y\sum y, ∑xy\sum xy и ∑x2\sum x^2. Столбцы y2y^2, y^\hat{y} и ee понадобятся дальше для оценки качества модели, поэтому считаем их сразу.

№xxyyxyxyx2x^2y2y^2y^\hat{y}e=y−y^e = y - \hat{y}e2e^2
1166136511
227144498-11
33113391211100
441456161961400
5516802525617-11
6621126364412011
Сумма21753159110997504

Средние: xˉ=21/6=3,5\bar{x} = 21/6 = 3{,}5 и yˉ=75/6=12,5\bar{y} = 75/6 = 12{,}5.

Шаг 2. Коэффициент регрессии bb. Подставляем суммы в формулу метода наименьших квадратов:

b=n∑xy−∑x∑yn∑x2−(∑x)2=6⋅315−21⋅756⋅91−212=1890−1575546−441=315105=3.b = \frac{n\sum xy - \sum x \sum y}{n\sum x^2 - \left(\sum x\right)^2} = \frac{6 \cdot 315 - 21 \cdot 75}{6 \cdot 91 - 21^2} = \frac{1890 - 1575}{546 - 441} = \frac{315}{105} = 3.

Знаменатель здесь - это вариация фактора, умноженная на nn, и он положителен всегда, кроме вырожденного случая, когда все xx равны. Знак дроби целиком задаётся числителем, то есть ковариацией xx и yy.

Шаг 3. Свободный член aa. Прямая МНК обязательно проходит через точку средних (xˉ; yˉ)(\bar{x};\ \bar{y}), отсюда:

a=yˉ−bxˉ=12,5−3⋅3,5=12,5−10,5=2.a = \bar{y} - b\bar{x} = 12{,}5 - 3 \cdot 3{,}5 = 12{,}5 - 10{,}5 = 2.

Шаг 4. Уравнение и его смысл. Собираем модель:

y^=2+3x.\hat{y} = 2 + 3x.

Коэффициент b=3b = 3 читается так: рост затрат на рекламу на 1 млн руб. в среднем по совокупности даёт прирост выручки на 3 млн руб. Свободный член a=2a = 2 - расчётное значение выручки при нулевых затратах; экономического смысла у него обычно нет, потому что точка x=0x = 0 лежит за границами наблюдаемых данных.

Шаг 5. Теснота связи. Считаем линейный коэффициент корреляции по тем же суммам:

rxy=n∑xy−∑x∑y[n∑x2−(∑x)2][n∑y2−(∑y)2]=315105⋅969=315318,97=0,988.r_{xy} = \frac{n\sum xy - \sum x \sum y}{\sqrt{\left[n\sum x^2 - \left(\sum x\right)^2\right]\left[n\sum y^2 - \left(\sum y\right)^2\right]}} = \frac{315}{\sqrt{105 \cdot 969}} = \frac{315}{318{,}97} = 0{,}988.

Значение близко к единице, связь прямая и очень тесная. Коэффициент детерминации R2=rxy2=0,975R^2 = r_{xy}^2 = 0{,}975: вариация затрат на рекламу объясняет 97,5 % вариации выручки, остальные 2,5 % приходятся на неучтённые факторы. О том, почему для парной линейной модели эти два показателя связаны именно квадратом, подробно написано в разборе связи корреляции и детерминации.

Шаг 6. Значимость и прогноз. Остаточная сумма квадратов из таблицы равна ∑e2=4\sum e^2 = 4, число степеней свободы n−2=4n - 2 = 4, поэтому остаточная дисперсия S2=4/4=1S^2 = 4/4 = 1, а стандартная ошибка коэффициента:

Sb=S∑(x−xˉ)2=117,5=0,239,tнабл=bSb=30,239=12,55.S_b = \frac{S}{\sqrt{\sum (x - \bar{x})^2}} = \frac{1}{\sqrt{17{,}5}} = 0{,}239, \qquad t_{\text{набл}} = \frac{b}{S_b} = \frac{3}{0{,}239} = 12{,}55.

Табличное значение tt при уровне 0,05 и четырёх степенях свободы равно 2,776, наблюдаемое больше - коэффициент значим. Подставляем прогнозное значение фактора:

y^(7)=2+3⋅7=23.\hat{y}(7) = 2 + 3 \cdot 7 = 23.

Ответ: y^=2+3x\hat{y} = 2 + 3x; rxy=0,988r_{xy} = 0{,}988; R2=0,975R^2 = 0{,}975; коэффициент значим (t=12,55>2,776t = 12{,}55 > 2{,}776); прогноз выручки при затратах 7 млн руб. равен 23 млн руб.

Формула и откуда она берётся

Метод наименьших квадратов ищет такую прямую, для которой сумма квадратов вертикальных отклонений точек от неё минимальна:

Q(a,b)=∑i=1n(yi−a−bxi)2→min⁡.Q(a, b) = \sum_{i=1}^{n} \left(y_i - a - bx_i\right)^2 \rightarrow \min.

Функция QQ - парабола по каждому из двух аргументов, значит минимум находится приравниванием частных производных к нулю. Получается система из двух линейных уравнений относительно aa и bb, которую называют нормальной системой МНК; её вывод и решение через определители разобраны в статье про нормальную систему метода наименьших квадратов.

Формулы, которыми пользовались выше, - это готовое решение той системы. Поэтому расчёт всегда сводится к одному и тому же: заполнить четыре столбца, сложить, подставить. Важная деталь: минимизируются именно вертикальные отклонения по yy, а не расстояния до прямой. Из-за этого регрессия yy на xx и регрессия xx на yy дают разные прямые, и менять переменные местами нельзя.

Вторая эквивалентная запись формул - через отклонения от средних:

b=∑(x−xˉ)(y−yˉ)∑(x−xˉ)2,a=yˉ−bxˉ.b = \frac{\sum (x - \bar{x})(y - \bar{y})}{\sum (x - \bar{x})^2}, \qquad a = \bar{y} - b\bar{x}.

Эта форма удобнее, когда средние получаются круглыми, и заметно хуже, когда они выходят дробными: округление отклонений на промежуточном шаге искажает результат. В контрольных надёжнее вариант через суммы, где до самого конца идут целые числа.

Оценка качества: какие показатели просят вместе с уравнением

Одного уравнения в задании почти никогда не хватает - к нему требуют набор характеристик. Перечислим те, что считаются по уже готовой таблице.

Средняя ошибка аппроксимации показывает, на сколько процентов в среднем расчётные значения расходятся с фактическими:

Aˉ=1n∑∣y−y^y∣⋅100%=16(16,67+14,29+0+0+6,25+4,76)%=6,99%.\bar{A} = \frac{1}{n}\sum \left|\frac{y - \hat{y}}{y}\right| \cdot 100\% = \frac{1}{6}\left(16{,}67 + 14{,}29 + 0 + 0 + 6{,}25 + 4{,}76\right)\% = 6{,}99\%.

Модель считается хорошей, если ошибка не превышает 8-10 %, так что здесь качество приемлемое.

Коэффициент эластичности переводит связь в проценты: Eˉ=bxˉ/yˉ=3⋅3,5/12,5=0,84\bar{E} = b\bar{x}/\bar{y} = 3 \cdot 3{,}5 / 12{,}5 = 0{,}84. Рост затрат на рекламу на 1 % увеличивает выручку в среднем на 0,84 %.

F-критерий Фишера проверяет модель целиком: F=R21−R2(n−2)=0,9750,025⋅4=157,5F = \dfrac{R^2}{1 - R^2}(n - 2) = \dfrac{0{,}975}{0{,}025} \cdot 4 = 157{,}5 против табличного 7,71 - модель значима. Для парной регрессии F=t2F = t^2, так что оба критерия всегда дают один вывод. Отдельно проверить коэффициент по t-критерию помогает разбор задачи на значимость коэффициента регрессии, а построить интервальную оценку - статья про доверительный интервал коэффициента.

Вариации условия

Даны только суммы. Иногда таблица уже заполнена и в условии приведены ∑x\sum x, ∑y\sum y, ∑xy\sum xy, ∑x2\sum x^2 и nn. Тогда шаги 1 и 2 пропускаются: подставляем числа прямо в формулы. Обратная ситуация - даны средние xˉ\bar{x}, yˉ\bar{y}, xy‾\overline{xy} и x2ˉ\bar{x^2}; формула превращается в b=(xy‾−xˉyˉ)/(x2‾−xˉ2)b = (\overline{xy} - \bar{x}\bar{y}) / (\overline{x^2} - \bar{x}^2).

Связь обратная. Если с ростом фактора результат падает, числитель получается отрицательным, и b<0b < 0. Считать при этом надо ровно так же, знак сам встанет на место. Признак ошибки - отрицательный знаменатель или знак bb, не совпадающий со знаком rxyr_{xy}: у этих величин знаменатели положительные, поэтому знаки обязаны совпадать.

Связь нелинейная. Перед расчётом полезно посмотреть на корреляционное поле: если точки ложатся на дугу, линейная модель занизит качество и её заменяют степенной или показательной с предварительной линеаризацией.

Факторов несколько. При двух и более объясняющих переменных формулы для aa и bb не работают - там решается матричная нормальная система, как в разборе множественной регрессии.

Частые ошибки

  • Путают местами xx и yy. Результативный признак всегда идёт в левую часть уравнения. Если в условии спрашивают зависимость выручки от рекламы, то yy - выручка, и менять их местами нельзя: получится другая прямая.
  • Считают ∑x2\sum x^2 как (∑x)2(\sum x)^2. В знаменателе стоят обе величины: 6⋅91=5466 \cdot 91 = 546 и 212=44121^2 = 441. Перепутать их - значит получить ноль или отрицательное число вместо 105.
  • Округляют bb до подстановки в формулу для aa. При b=3b = 3 разницы нет, но при b=0,8347b = 0{,}8347 округление до 0,8 сместит свободный член на несколько единиц. Округлять нужно только конечный ответ.
  • Берут среднюю арифметическую отклонений вместо суммы квадратов. Сумма остатков ∑e\sum e в правильно посчитанной модели всегда равна нулю - это проверка, а не показатель качества. Качество показывает ∑e2\sum e^2.
  • Считают ошибку аппроксимации без модуля. Плюсы и минусы взаимно уничтожатся, и получится около нуля при любой, даже негодной модели.
  • Прогнозируют далеко за пределами данных. Модель построена по диапазону от 1 до 6, прогноз при x=7x = 7 уже экстраполяция, а при x=60x = 60 он теряет смысл полностью.

FAQ

Обязательно ли строить график перед расчётом? Формально нет, но поле корреляции за полминуты показывает форму связи и выбросы. Одна аномальная точка способна развернуть прямую, а по числам это будет незаметно: коэффициент детерминации останется высоким.

Чем отличается коэффициент регрессии от коэффициента корреляции? Коэффициент регрессии bb именованный: он измеряется в единицах yy на единицу xx и показывает, на сколько изменится результат. Коэффициент корреляции безразмерный, лежит в границах от минус единицы до единицы и измеряет только тесноту связи. Связаны они через отношение средних квадратических отклонений: rxy=b⋅σx/σyr_{xy} = b \cdot \sigma_x / \sigma_y.

Что делать, если R2R^2 получился низким? Низкая детерминация означает, что выбранный фактор объясняет мало. Варианты: проверить форму связи на графике, добавить второй фактор, убрать ошибочные наблюдения. Искусственно улучшать R2R^2 отбрасыванием неудобных точек нельзя - это подгонка.

Сколько наблюдений нужно для парной регрессии? Формулы работают начиная с трёх точек, но статистические выводы на такой выборке пустые: число степеней свободы n−2n - 2 слишком мало, и критическое tt огромно. Практический минимум для учебных задач - 6-8 наблюдений, для содержательных выводов желательно от 20.

Коротко

  1. Заполнить расчётную таблицу и найти четыре суммы: ∑x=21\sum x = 21, ∑y=75\sum y = 75, ∑xy=315\sum xy = 315, ∑x2=91\sum x^2 = 91.
  2. Посчитать коэффициент регрессии: b=(6⋅315−21⋅75)/(6⋅91−441)=3b = (6 \cdot 315 - 21 \cdot 75) / (6 \cdot 91 - 441) = 3.
  3. Найти свободный член через средние: a=12,5−3⋅3,5=2a = 12{,}5 - 3 \cdot 3{,}5 = 2, уравнение y^=2+3x\hat{y} = 2 + 3x.
  4. Оценить связь: rxy=0,988r_{xy} = 0{,}988, R2=0,975R^2 = 0{,}975, средняя ошибка аппроксимации 6,99 %, коэффициент значим по t-критерию (12,55>2,77612{,}55 > 2{,}776).
  5. Подставить прогнозное значение фактора: при x=7x = 7 выручка составит 23 млн руб.
Задача в тетради или методичке? Сфотографируйте условие - сервис распознает его и решит по шагам с пояснениями.

Похожие задачи

Матстатистика

Как найти несмещённую оценку дисперсии: решение

Разбор задачи: как найти несмещённую оценку дисперсии по выборке из 10 значений, чем она отличается от смещённой, почему делитель равен n минус 1 и откуда берётся стандартное отклонение.

Матстатистика

Как построить гистограмму частот: разбор задачи

Как построить гистограмму частот интервального ряда: число интервалов по формуле Стёрджесса, ширина интервала, плотность частоты как высота столбика и проверка площади фигуры.

Матстатистика

Как построить ящик с усами: пример с решением

Как построить ящик с усами по выборке из 12 значений: квартили Q1, Q2 и Q3 как медианы половин ряда, межквартильный размах IQR, границы усов 1,5 IQR, поиск выбросов и разметка чертежа.

Матстатистика

Как найти критическую область: разбор с примером

Как найти критическую область при проверке гипотезы: вид области по альтернативе, критическая точка по таблице Лапласа, запись неравенством и проверка выборки из 100 пачек кофе.

Матстатистика

Как вычислить скользящую среднюю: пример расчёта

Как вычислить скользящую среднюю: расчёт трёхчленной и четырёхчленной центрированной средней по ряду из 12 месяцев, выбор длины интервала сглаживания и проверка ответа.

Матстатистика

Как составить вариационный ряд: пошаговое решение

Как составить вариационный ряд по сырой выборке: ранжированный ряд, дискретный ряд с частотами, частостями и накопленными частотами, интервальный ряд и число интервалов по Стёрджессу.