Регрессионный анализ является одним из наиболее распространенных инструментов эконометрического анализа. Он позволяет проанализировать и оценить связи между зависимой (объясняемой) и независимыми (объясняющими) переменными. Зависимую переменную иногда называют результативным признаком, а объясняющие переменные - предикторами, регрессорами или факторами. Как это часто бывает, название этого метода не связано с его сутью, а имеет исторические корни. Термин "регрессия" ввел лорд Ф. Гальтон (1822-1911), исследуя связь между ростом родителей и детей. Он установил, что хотя у высоких родителей - высокие дети, а у невысоких чаще рождаются маленькие дети, рост детей имеет тенденцию к постепенному выравниванию, т.е. стремится к средним значениям. Будучи аристократом, Ф. Гальтон к такой тенденции относился негативно и потому назвал ее регрессией (упадком).
Обозначим зависимую (объясняемую) переменную как $$y$$, а независимые (объясняющие) переменные как $$x_{1}, x_{2}, \dots, x_{k}$$. Если $$k = 1$$ и есть только одна независимая переменная $$x_{1}$$ (которую обозначим $$x$$), то регрессия называется простой (simple), или парной. Если $$k = 2, 3, \dots$$ то регрессия называется множественной.
Теперь обратимся к вопросам, связанным с априорными предположениями, оценкой коэффициентов и доверительными интервалами для прогноза парной регрессии.
Начнем с построения простейшей модели
| $$Y = \alpha + \beta x + \varepsilon,$$ | (2.1) |
где $$Y$$ - зависимая переменная, состоящая из двух слагаемых: 1) неслучайной составляющей $$Y_{1} = \alpha + \beta x$$ ($$x$$ - независимая переменная, $$\alpha$$ и $$\beta$$ - постоянные числа - параметры уравнения); 2) случайного члена $$\varepsilon$$.
Допустим, мы имеем данные, представленные в двух видах: табличном (табл. 2.1) и графическом (рис. 2.1). Предположим, что истинная зависимость между $$x$$ и $$y$$ - линейная, т.е. существует некая прямая $$Y_{1} = \alpha + \beta x$$, отражающая "истинную" зависимость. Задача регрессионного анализа состоит в получении оценок $$\alpha , \beta$$, а следовательно, и положения прямой. На рисунке 2.2 такое уравнение построено с помощью пакета STATISTICA.
Таблица 2.1
(рис 2.1)
(рис 2.2)
Существование отклонений от прямой регрессии, т.е. случайных слагаемых $$\varepsilon$$, объясняется рядом причин. К ним относятся:
Вид зависимости выбирают либо графически, либо проверяя качество моделей на контрольной выборке, либо используя априорные экономические соображения. Например, валовой выпуск продукции $$Y$$ в зависимости от числа занятых в производстве работников $$x$$ может быть описан уравнением $$Y = ax^{b}$$, где $$0 < b < 1$$. Разделив уравнение слева и справа на $$x$$, получим зависимость производительности труда от числа работников в производстве: $$Y_{1} = a/x^{1 - b }= a/x^{c}$$, где $$0 < c < 1$$;
Для оценки параметров $$\alpha , \beta$$ обычно применяют метод наименьших квадратов (МНК). Существуют и другие методы оценки параметров, например: метод моментов, метод наименьших модулей, метод максимального правдоподобия.
Если имеется n наблюдений, уравнение (2.1) можно представить в следующем виде:
$$Y_{i} = \alpha + \beta x_{i} + \varepsilon _{i},_{i} = 1, 2, 3, \dots , n.$$Случайное слагаемое $$\varepsilon$$ можно рассматривать как последовательность $$n$$ случайных величин $$\varepsilon _{i}, i = 1, 2, 3, \dots , n$$.
Метод наименьших квадратов позволяет получить такие оценки $$\alpha$$ и $$\beta$$ параметров $$\alpha$$ и $$\beta$$, при которых сумма квадратов отклонений $$\varepsilon$$ фактических значений признака $$Y_{i}$$ от расчетных (теоретических) $$\tilde{Y}1_i$$ является минимальной:
|
(2.2) |
Найдем минимум функции $$Q(a,b)$$, приравняв производные по каждой переменной $$a, b$$ к нулю:
|
(2.3) |
После преобразований получаем систему уравнений
|
(2.4) |
Система уравнений (2.4) представляет собой систему нормальных уравнений МНК.
Решая систему уравнений (2.4), находим $$a$$ и $$b$$
|
(2.5) |
где
Коэффициент $$b$$ при $$x$$ называется выборочным коэффициентом регрессии. Если переменную $$x$$ изменить на единицу, т.е. взять за $$x$$ величину $$x + 1$$, то новое значение $$Y_{1}(x + 1)$$ будет равно $$Y_{1}(x) + b$$. Следовательно, коэффициент регрессии показывает среднее изменение результата $$Y$$ при изменении фактора $$x$$ на единицу.
Коэффициент $$a$$ указывает на значение результирующего признака при нулевом значении фактора. Это важный индикатор для выбора вида уравнения регрессии. Например, если в результате вычислений коэффициент $$a$$ оказался отрицательным, а экономический смысл задачи диктует положительность или равенство нулю показателя $$a$$, значит, выбор вида уравнения был неудачен.
Произведем расчеты для данных, представленных в табл. 2.1.
Систему уравнений (2.4) для данных табл. 2.2 представим в виде
Таблица 2.2
Решив последнюю систему уравнений, получим $$a = 0,924; b = 0,658$$. Построим таблицу (табл. 2.3), содержащую исходные данные, расчетные значения
и остатки
Таблица 2.3
Метод наименьших квадратов предполагает ряд ограничений на поведение случайного слагаемого $$\varepsilon$$ - условия Гаусса - Маркова:
Одним из показателей качества построенного уравнения регрессии является коэффициент детерминации $$R^{2}$$. По определению
|
(2.6) |
В свою очередь,
$$D(Y) = D(Y1) + D(\varepsilon )$$. Действительно, $$DY = D(Y1 + \varepsilon ) = D(Y1) + D(\varepsilon ) + 2cov(Y1, \varepsilon )$$
Однако $$cov(Y1, \varepsilon ) = \beta cov(x, \varepsilon ) = 0$$. Что и требовалось. Отсюда
|
(2.7) |
Таким образом, коэффициент детерминации можно интерпретировать как часть общей дисперсии $$Y$$, которая объяснена с помощью уравнения регрессии, точнее, с помощью расчетной переменной $$Y1$$ уравнения регрессии. Максимальное значение коэффициента детерминации $$R^{2}$$ равно $$1$$. Это произойдет тогда, когда все остатки $$\varepsilon _{i} = 0$$, а уравнение прямой регрессии ляжет точно на экспериментальные точки $$Y_{i}$$. Таким образом, при построении регрессии коэффициент детерминации $$R^{2}$$ желательно максимизировать. Именно это и делается при применении МНК, так как из формулы (2.7) вытекает, что максимум $$R^{2}$$ достигается при минимуме $$D(\varepsilon )$$.
Проведем дисперсионный анализ уравнения регрессии, построенного выше:
. По данным табл. 2.3, используя возможности пакета STATISTICA, получаем следующее (табл. 2.4).
Таблица 2.4
Итак,
.
Отсюда
Значение $$\tilde{R}^{2}$$ близко к единице. Это указывает на хорошее (адекватное) описание объясняемой переменной $$Y$$ полученным уравнением регрессии.
Следует признать, что определить истинные значения коэффициентов $$\alpha$$ и $$\beta$$ модели никогда не удастся. Найденные по МНК коэффициенты являются лишь выборочными оценками истинных коэффициентов. Исходя из этого, в отличие от параметров $$\alpha$$ и $$\beta$$, мы их обозначили $$\alpha$$ и $$\beta$$. Выборочные оценки $$\alpha$$ и $$\beta$$ являются случайными величинами, так как зависят от выборки $$x_{i}$$ и $$Y_{i}$$, а также от метода расчета. Поэтому, как это принято в математической статистике, необходимо решить вопрос о несмещенности, эффективности и состоятельности оценок $$\alpha$$ и $$\beta$$, полученных по МНК. Следует также рассмотреть вопрос о построении доверительных интервалов для $$\alpha$$ и $$\beta$$.
Из формул системы уравнений (2.5) теперь следует, что
|
(2.8) |
Поскольку $$Y = \alpha + \beta x + \varepsilon$$,
$$cov(x, Y) = cov(x, \alpha + \beta x + \varepsilon ) = cov(x, \beta x) + cov(x, \varepsilon ) =$$
$$= bcov(x, x) + cov(x, \varepsilon ) = \beta D(x) + cov(x, \varepsilon ).$$
Следовательно,
|
(2.9) |
Итак, выборочный коэффициент регрессии представлен в виде суммы истинного значения $$\beta$$ и случайной составляющей, зависящей от $$cov(x, \varepsilon )$$. Аналогично коэффициент $$a$$ можно разложить на сумму истинного коэффициента $$a$$ и случайной составляющей
|
(2.10) |
где
Из формул (2.9) и (2.10) следует: если случайную ошибку $$\varepsilon$$ увеличить в $$k$$ раз, т.е. заменить ошибкой $$k\varepsilon$$, то при определении параметров $$\alpha$$ и $$\beta$$ она тоже увеличится в $$k$$ раз. Это вытекает из соотношения $$cov(x, k\varepsilon ) = k cov(x, \varepsilon )$$.
Если нет возможности проверить качество полученного уравнения регрессии на независимой выборке, то проводят оценку значимости уравнения регрессии по $$F$$-критерию Фишера. Выдвигается нулевая гипотеза, что коэффициент регрессии $$\beta = 0$$, т.е. $$Y$$ и $$x$$ независимы. Конкурирующая гипотеза: $$\beta \ne 0$$. Обратимся к равенству
| $$D(Y) = D(\alpha + \beta x) + D(\varepsilon ).$$ | (2.11) |
В условиях нулевой гипотезы $$D(Y) = D(\alpha ) + \beta ^{2}D(\varepsilon ) + D(\varepsilon ) = D(\varepsilon )$$. Следовательно, нулевая гипотеза эквивалентна гипотезе $$R^{2} = 0$$.
Рассмотрим линейное уравнение регрессии МНК $$\tilde{Y} = a+bx_{i}$$, используя формулы (2.8),
$$\tilde{Y} 1_{i} = a + bx_{i}$$, или $$\tilde{Y1}_i - Y = b(x_{i} - x)$$
Последнее равенство возведем в квадрат и просуммируем по всем наблюдениям $$i = 1, 2, \dots , n$$. Получаем
|
(2.12) |
Из формулы (2.12) вытекает, что расчетное значение $$\tilde{Y1}_i$$ является функцией единственного параметра $$b$$ - коэффициента регрессии. Это означает, что сумма квадратов $$\sum (\tilde{Y} 1_{i} - Y)^{2}$$ стоящая в числителе $$D(\tilde{Y} 1)$$ имеет одну степень свободы.
Известно, что число степеней свободы для суммы квадратов, стоящей в числителе дисперсии $$n$$ независимых наблюдений, равно $$n - 1$$. Согласно теории дисперсионного анализа разложение суммы квадратов на слагаемые влечет соответствующее разложение для степеней свободы слагаемых. Поэтому число степеней свободы суммы квадратов, стоящей в числителе $$D(\hat{\varepsilon})$$, равно $$n - 1 - 1 = n - 2$$. Далее используем обычную процедуру сравнения дисперсий с различными степенями свободы по $$F$$-критерию Фишера, строим исправленные суммы квадратов:
|
(2.13) |
|
(2.14) |
По таблице критических значений Фишера (Приложение 5) находим критическое значение критерия $$F_{крит} = F(\gamma , 1, n - 2)$$, где $$\gamma$$ - выбранный заранее уровень значимости критерия (т.е. вероятность признания регрессии значимой, в то время как она незначима). Если регрессия значима, то $$F_{набл} > F_{крит}$$; в противном случае $$F_{набл} < F_{крит}$$. Уровень значимости $$\gamma$$ обычно выбирают равным 0,1; 0,05; 0,01; 0,001. При использовании компьютерных расчетов удобнее не выбирать фиксированное значение $$\gamma$$, а произвести расчет вероятности ошибочного признания регрессии значимой при данном значении $$F_{набл}$$. Так, в табл. 2.4 посчитаны значения $$S^{2}_{фактор}= 35,7; S^{2}_{ост} = 0,316; F_{набл} = 113, 097$$ и вероятность того, что регрессия незначима $$P = 0,000005$$. Поэтому вывод о значимости уравнения регрессии можно считать вполне обоснованным.
Как известно из курса математической статистики, несмещенность выборочной оценки $$\theta _{выб}$$ параметра генеральной совокупности $$\theta _{ген}$$ означает, что математическое ожидание $$\theta _{выб}$$ равно $$\theta _{ген}$$. Докажем несмещенность МНК-оценок коэффициентов $$a$$ и $$b$$. Необходимо показать, что$$ М(a) = \alpha и М(b) = \beta$$. Исходя из формул (2.9), (2.10), свойств математического ожидания и первого условия Гаусса - Маркова, получаем
Что, собственно, и требовалось.
В курсе математической статистики определяется теоретический коэффициент корреляции, являющийся мерой линейной связи между случайными величинами $$x$$ и $$y$$,
|
(2.15) |
Аналогично определяется выборочный коэффициент корреляции:
|
(2.16) |
Из формул (2.8) следует, что
|
(2.17) |
а уравнение линейной регрессии можно записать в таком виде:
|
(2.18) |
Покажем, что теоретический коэффициент детерминации равен квадрату теоретического коэффициента корреляции между фактическими $$Y$$ и теоретическими прогнозными значениями $$Y1 = \alpha + \beta x = M(\tilde{Y} 1)$$ :
В целях построения доверительных интервалов для коэффициентов $$\alpha$$ и $$\beta$$ воспользуемся формулами расчета дисперсий коэффициентов модели $$a$$ и $$b$$. Имеем
Но
Следовательно,
Окончательно,
|
(2.19) |
Аналогично получаем, что
Но
Наконец, ранее было доказано, что
поэтому
Окончательно получаем
|
(2.20) |
Из формул (2.19) и (2.20) можно заключить, что теоретическая дисперсия коэффициентов регрессии зависит от отношения дисперсий случайных ошибок и фактора $$x$$. С ростом числа наблюдений $$n$$ бесконечности дисперсии коэффициентов стремятся к нулю, что вместе с доказанной выше несмещенностью оценок $$a$$ и $$b$$ свидетельствует о состоятельности МНК-коэффициентов регрессии.
В теории регрессионного анализа также доказывается, что $$a$$ и $$b$$ в условиях Гаусса - Маркова являются эффективными оценками, т.е. имеют минимальную дисперсию.
На практике теоретическую оценку дисперсии коэффициентов $$a$$ и $$b$$ получить невозможно, так как неизвестно точное значение дисперсии случайной ошибки $$\sigma ^{2}(\varepsilon )$$. Однако, оценив дисперсию остатков, можно получить выборочную дисперсию случайных ошибок.
Как было отмечено, число степеней свободы суммы квадратов, стоящей в числителе $$D(\varepsilon )$$, равно $$n - 2$$. Следовательно, исправленная выборочная дисперсия случайных ошибок равна
Из формул (2.19), (2.20) получаем исправленные выборочные оценки стандартных отклонений (ошибок) МНК-коэффициентов регрессии:
|
(2.21) |
Если бы были известны стандартные отклонения $$\sigma (a)$$ и $$\sigma (b)$$, то величины $$Z_{a} = (a - \alpha )/\sigma (a)$$ и $$Zb = (b - \beta )/\sigma (b)$$ были бы распределены по нормальному закону с нулевым математическим ожиданием и единичной дисперсией: $$Z_{a} ~ N(0, 1); Z_{b} ~ N(0, 1)$$. Но поскольку нам известны только выборочные значения стандартных отклонений (стандартные ошибки) $$S(b)$$ и $$S(a)$$, соответствующие соотношения $$t_{a} = (a - \alpha )/S(a)$$ и $$t_{b} = (b - \beta )/S(b)$$ распределены по закону Стьюдента с числом степеней свободы $$\nu = n - 2$$.
Заметим, что при $$\nu > 30$$ распределение Стьюдента практически не отличается от нормального распределения (Приложение 4). С учетом сказанного можно построить доверительные интервалы для коэффициентов $$\alpha$$ и $$\beta$$, и если окажется, что в доверительный интервал попадает 0, то соответствующий коэффициент регрессии объявляется незначимым.
Незначимые коэффициенты обычно исключают из уравнения регрессии. При расчете уравнения регрессии на компьютере для проверки значимости коэффициентов регрессии вычисляют наблюдаемые значения критерия Стьюдента $$t_{a}$$ и $$t_{b}$$ при $$\alpha = 0; \beta = 0$$ и вероятности $$p_{a}, p_{b}$$ того, что случайная величина, распределенная по критерию Стьюдента, превысит наблюдаемые значения $$t_{a}$$ и $$t_{b}$$ по абсолютной величине. Если эти вероятности малы (меньше выбранного уровня значимости, например 0,05), то коэффициенты считаются значимыми. В противном случае - незначимыми. Так, построив регрессию $$\tilde{Y} 1 = 0,924 + 0,658x_{i}$$ по данным табл. 2.1, получаем табл. 2.5.
Таблица 2.5
Итак, $$S(b) = 0,061856; t_{b} = 10,63472, p_{b} = 0,000005; S(a) = 0,383809; t_{a} = 2,40696; p_{a} = 0,04271$$.
Из полученных результатов следует значимость коэффициентов $$a$$ и $$b$$ при уровне значимости 0,05. Как правило, в уравнении регрессии значения стандартных ошибок $$S(a)$$ и $$S(b)$$ записывают в скобках под соответствующими коэффициентами, иногда под ними указывают значения $$t$$-критерия. В результате уравнение принимает следующий вид:
$$\tilde{Y} 1 = 0,924 + 0,658x$$ $$S (0,383809) (0,061856)$$ $$t (2,40696) (10,63472)$$Для получения интервалов прогноза по линейному уравнению регрессии преобразуем с учетом формул (2.5) уравнение
| $$\tilde{Y} 1_{x} - a + bx$$ | (2.22) |
в уравнение
| $$\tilde{Y} 1_{x} - Y + b(x-x)$$ | (2.23) |
Из формулы (2.1) вытекает, что $$D(Y) = \sigma ^{2}(\varepsilon )$$, из свойств дисперсии среднего имеем
Следовательно,
|
(2.24) |
Перейдя от стандартного теоретического отклонения к стандартной выборочной ошибке, получаем
|
(2.25) |
Выберем некоторый уровень надежности \gamma , например, равный 0,95, т.е. 95%-ный уровень надежности прогноза. Тогда доверительный интервал для расчета прогноза $$\tilde{Y} 1_{x^*}$$ при данном значении $$x^*$$ рассчитывается по формуле
|
(2.26) |
где $$t_{\gamma }$$ находят по таблицам Стьюдента (Приложение 4) для заданного $$\gamma$$ и $$\nu = n - 2$$ (в случае парной регрессии). Например, при $$n = 10$$ и $$\gamma = 0,95$$ получаем $$t_{\gamma } = 2,306$$. В нашем примере $$S^{2}_{ост} - 0,316$$. Следовательно, $$S_{ост }- \sqrt{S^{2}_{ост}} - \sqrt{0,316} - 0,5621$$. Далее
Получаем окончательную формулу для интервала прогноза $$\tilde{Y} 1_{x^*}$$:
Построим соответствующие графики, используя возможности пакета STATISTICA, на участке [0; 16] (рис. 2.3).
(рис 2.3)
| Вариант № | Y1 | Y2 | Y3 | Y4 | Y5 | Y6 | Y7 | Y8 | Y9 | Y10 |
| 1 | 1,26 | 1,73 | 1,34 | 1,48 | 0,34 | 2,26 | 3,82 | 1,34 | 0,678 | 2,41 |
| 2 | 2,16 | 1,87 | 1,65 | 1,53 | 1,54 | 2,38 | 4,11 | 3,08 | 0,78 | 2,48 |
| 3 | 2,17 | 2,54 | 2,67 | 2,34 | 1,65 | 2,95 | 5,48 | 2,64 | 0,83 | 3,33 |
| 4 | 2,68 | 2,88 | 2,75 | 3,33 | 2,68 | 4,23 | 6,77 | 4,26 | 1,71 | 4,45 |
| 5 | 3,17 | 2,47 | 3,16 | 3,38 | 2,77 | 4,81 | 7,48 | 4,78 | 1,38 | 5,12 |
| 6 | 3,81 | 3,40 | 3,87 | 4,40 | 2,89 | 6,04 | 8,04 | 5,49 | 1,98 | 6,46 |
| 7 | 3,59 | 3,64 | 3,95 | 4,79 | 3,50 | 6,21 | 8,79 | 6,84 | 1,67 | 7,15 |
| 8 | 4,02 | 4,00 | 4,88 | 5,03 | 2,96 | 7,02 | 9,62 | 7,48 | 1,99 | 7,74 |
| 9 | 4,43 | 3,87 | 4,49 | 6,02 | 3,16 | 7,70 | 10,54 | 9,57 | 2,18 | 8,50 |
| 10 | 4,90 | 4,53 | 4,62 | 6,65 | 2,94 | 8,77 | 11,48 | 9,19 | 2,55 | 9,29 |
| 11 | 5,701 | 4,76 | 5,91 | 8,01 | 3,21 | 9,06 | 12,81 | 9,91 | 2,87 | 10,33 |
| 12 | 6,02 | 5,07 | 7,29 | 7,22 | 4,28 | 10,05 | 13,28 | 12,29 | 2,85 | 10,89 |
| 13 | 5,92 | 5,04 | 7,26 | 7,92 | 4,20 | 10,97 | 14,42 | 12,39 | 3,24 | 12,35 |
| 14 | 6,42 | 5,64 | 6,92 | 9,23 | 5,35 | 12,61 | 15,28 | 11,67 | 3,30 | 12,46 |
| 15 | 7,32 | 5,72 | 7,85 | 9,43 | 5,38 | 12,88 | 16,14 | 13,23 | 3,16 | 13,07 |
| 16 | 7,44 | 5,75 | 8,15 | 10,37 | 5,93 | 13,35 | 17,79 | 14,38 | 3,52 | 13,48 |
| 17 | 8,44 | 6,32 | 8,63 | 10,56 | 5,45 | 14,98 | 17,45 | 16,06 | 3,88 | 14,98 |
| 18 | 8,34 | 6,75 | 9,59 | 11,25 | 5,44 | 15,38 | 19,26 | 16,42 | 3,97 | 15,72 |
| 19 | 9,06 | 6,88 | 10,23 | 11,68 | 6,52 | 16,04 | 19,59 | 17,44 | 4,64 | 16,02 |
| 20 | 9,19 | 7,42 | 10,97 | 12,15 | 7,20 | 16,80 | 20,60 | 18,46 | 4,72 | 16,83 |
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.