Пусть дана система случайных величин $$(X_{1}, X_{2}, \dots, X_{n})$$. Для простоты будем считать, что все случайные величины центрированы, т.е.$$ М(X_{i}) = 0$$.
Рассмотрим случайный вектор
а также матрицу
Математическим ожиданием матрицы, элементами которой являются случайные величины, назовем матрицу, составленную из математических ожиданий элементов исходной матрицы.
Тогда, учитывая, что
$$M(X_{i}X_{j}) = cov(X_{i},X_{j}),$$получаем матрицу
Она называется ковариационной матрицей случайного вектора$$ Х$$.
Если случайные величины $$X_{i}$$ не только центрированы, но и нормированы, т.е. если $$M(X_{i}) = 0, D(X_{i}) = 1 (i = 1, 2, \dots , n)$$, то $$cov(X_{i}, X_{j}) = r_{ij}$$, где $$r_{ij}$$ - коэффициенты корреляции для случайных величин $$X_{i}, X_{j}$$.
Ковариационная матрица в этом случае равна
и называется корреляционной матрицей.
Ранее отмечалось, что регрессионный анализ заключается в построении математических зависимостей на основе экспериментальных данных и статистическом анализе результатов.
Рассмотрим линейную модель регрессии, использующую $$k$$-факторы,
![]() |
(3.1) |
где
| $$u$$ | - | номер наблюдения ($$u = 1, 2, \dots , N$$); |
| $$x_{i} = (x_{il}, x_{i2}, \dots , x_{iN})^{T}$$ | - | вектор-столбец, состоящий из значений $$i$$-й переменной в $$N$$ наблюдениях; |
| $$b_{i} (i = 0, 1, \dots , k)$$ | - | теоретические значения коэффициентов модели; |
| $$\varepsilon _{u}$$ | - | ошибка в $$u$$-м наблюдении. |
Данные в $$N$$ наблюдениях удобно записывать в табличном виде. Заметим, что $$x_{0}$$ обычно считают фиктивной переменной, тождественно равной единице, $$x_{0j }= 1 (j = 1, 2, \dots , N)$$.
Таким образом, $$\beta _{0}$$ - свободный член в уравнении (3.1), а число реальных переменных, включенных в уравнение (3.1), равно $$k$$.
Стандартная процедура регрессионного анализа, выполняемого на основе метода наименьших квадратов, требует выполнения условий Гаусса - Маркова, сформулированных в главе 2.
При этих условиях, в частности, случайные ошибки eu имеют нулевое математическое ожидание, т.е.$$ М(\varepsilon _{u}) = 0 (u = 1, 2, \dots, n)$$, не коррелируют друг с другом и имеют одинаковые дисперсии. Другими словами,$$ М(\varepsilon \varepsilon ^{T}) = \sigma ^{2}I$$, где $$\varepsilon = (\varepsilon _{1}, \varepsilon _{2}, \dots, \varepsilon _{n})^{T}$$, а $$I$$ - единичная матрица.
Представим матрицу исходных данных в виде таблицы (табл. 3.1).
Таблица 3.1
Обозначим
тогда $$y_{u} = \eta _{u} + \varepsilon _{u}$$, где $$\eta _{u}$$ - неслучайная величина. Исходя из этого,
| $$\sigma ^{2}(y_{u}) = \sigma ^{2}(\eta _{u} + \varepsilon _{u}) = \sigma ^{2}(\varepsilon _{u}) = \sigma ^{2}.$$ | (3.2) |
Последнее условие является условием однородности (гомоскедастичности) наблюдений.
В дальнейшем мы используем часть табл. 3.1, а именно матрицу $$X$$
![]() |
(3.3) |
которая называется информационной матрицей или матрицей плана эксперимента.
Расчетную модель запишем в виде
![]() |
(3.4) |
Как было сказано, при использовании метода наименьших квадратов (МНК) минимизируется сумма квадратов остатков модели:
![]() |
(3.5) |
Для нахождения минимума вычисляются частные производные $$Q_{b_{i}}$$ функции $$Q$$ по переменным $$b_{i}$$, затем $$Q_{b_{i}}$$ приравнивают нулю. Получаем систему нормальных МНК-уравнений для определения оценок коэффициентов $$b_{0}, b_{1}, b_{2}, \dots, b_{k}$$:
![]() |
(3.6) |
Примем за $$b$$ вектор-столбец ($$b_{0}, b_{1}, \dots, b_{k})^{T}$$, а за y вектор-столбец $$(y_{1}, y_{2}, \dots, y_{n})^{T}$$. Тогда систему уравнений (3.6) можно представить в матричном виде
| $$X^{T}Xb = X^{T}y.$$ | (3.7) |
Используя скалярные произведения векторов-столбцов $$x_{i}$$ матрицы X, матрицу $$X^{T}X$$ можно также записать в виде
Предположим, что $$X^{T}X$$ имеет обратную матрицу $$C = (X^{T}X)^{-1}$$. Она называется матрицей дисперсий-ковариаций или просто ковариационной матрицей. Умножив уравнение (3.7) слева на матрицу $$C$$, получим
$$C(X^{T}X)b = (X^{T}X)^{-1}(X^{T}X)b = (X^{T}X)^{-1}X^{T}y.$$Поскольку ($$X^{T}X)^{-1}(X^{T}X) = I$$, формула для решения системы нормальных уравнений МНК принимает вид
| $$b = (X^{T}X)^{-1}X^{T}y.$$ | (3.8) |
(Геометрическую интерпретацию метода наименьших квадратов см. в Приложении 3.)
Докажем несмещенность МНК-оценок, используя матричное представление (3.8). Запишем уравнение (3.1) в виде
| $$y = X \beta + \varepsilon .$$ | (3.9) |
Отсюда
| $$My = M(X\beta + \varepsilon ) = M(X\beta ) + M(\varepsilon ) = M(X\beta ) = X\beta .$$ | (3.10) |
Наконец,
$$M\beta = M((X^{T}X)^{-1}X^{T}y) = (X^{T}X)^{-1}X^{T}My = (X^{T}X)-^{1}X^{T}X\beta = \beta ,$$что и требовалось.
Рассмотрим матрицу ковариаций оценок $$bi$$ коэффициентов модели:
Для $$cov(b_{i}, b_{j})$$ получаем равенство:
$$cov(b_{i}, b_{j}) = M{(b_{i} - M(b_{i}))(b_{j} - M(b_{j}))} = M{(b_{i} - \beta _{i})(b_{j} - \beta _{j})}.$$Аналогично имеем $$\sigma ^{2}(bi) = M{(b_{i} - b_{i})^{2}}$$. Отсюда
В матричной форме последнее равенство имеет следующий вид:
| $$V(b) = M[(b - \beta )(b - \beta )^{T}].$$ | (3.11) |
Из выражения (3.8) следует, что
| $$b - b = b - M(b) = (X^{T}X)^{-1}X^{T}y - M[(X^{T}X)^{-1}X^{T}y] = \\ = (X^{T}X)^{-1}X^{T}y - (X^{T}X)^{-1}X^{T}My =\\ = (X^{T}X)^{-1}X^{T}(y - M(y)) = (X^{T}X)^{-1}X^{T}\varepsilon .$$ | (3.12) |
Следовательно,
| $$(b - \beta )^{T} = \varepsilon ^{T}X(X^{T}X)^{-1}.$$ | (3.12) |
Отметим, что в формуле (3.13) использовано свойство симметричной матрицы ($$X^{T}X)^{-1}$$ не изменяться при транспонировании. Перемножая равенства (3.12) и (3.13), получаем
$$(b - \beta )(b - \beta )^{T} = (X^{T}X)^{-1}X^{T}\varepsilon \cdot \varepsilon ^{T}X(X^{T}X)^{-1}.$$Но из свойств налагаемых на вектор случайных ошибок $$\varepsilon$$ вытекает, что
| $$M[(b - \beta )(b - \beta )^{T}] = (X^{T}X)^{-1}X^{T}M(\varepsilon \cdot \varepsilon ^{T})X(X^{T}X)^{-1} =\\ = (X^{T}X)^{-1}X^{T}\sigma ^{2}IX(X^{T}X)^{-1} = \sigma ^{2}(X^{T}X)^{-1}X^{T} X(X^{T}X)^{-1}I =\\ = \sigma ^{2}(X^{T}X)^{-1}= \sigma 2C.$$ | (3.12) |
Элементы матрицы $$C$$ обозначим$$ с_{ij}$$. Тогда $$\sigma ^{2}(b_{i}) = с_{ii}\sigma ^{2}$$, а $$cov(b_{i}, b_{j}) = с_{ij}\sigma ^{2}$$. Переходя к выборочным оценкам $$\sigma ^{2},$$ получаем
| $$S^{2}(b_{i}) - c_{ij}S^{2}_{ост}, cov(b_{i},b_{j}) - c_{ij}S^{2}_{ост}.$$ | (3.15) |
Заметим без доказательства, что оценки $$b_{i}$$, полученные по МНК, оказываются эффективными и состоятельными.
Отклонения
называют абсолютной ошибкой аппроксимации в $$i$$-м наблюдении, а величину
- относительной ошибкой аппроксимации. О$$ качестве модели$$ судят по средней относительной ошибке аппроксимации 
Считается, что ошибка в 4-9% на контрольной выборке свидетельствует о хорошем качестве построенной модели. О качестве модели судят также и по результатам дисперсионного анализа модели.
Рассмотрим, как и для случая парной регрессии
![]() |
(3.16) |
![]() |
(3.17) |
![]() |
(3.18) |
Можно показать, что
| $$Q_{общ} = Q_{ост} + Q_{регр}$$ | (3.19) |
Докажем это равенство:
$$Q_{общ} = (Y - Y)^{T}(Y - Y) =\\ = (Y - Y1 + Y1 - Y)^{T}(Y - Y1 + Y1 - Y) =\\ =Q_{регл} + Q_{ост} + (Y - Y1)^{T}(Y1 - Y) + (Y1 - Y)^{T}(Y - Y1).$$Докажем, что две последние суммы равны нулю:
$$(Y - Y1)^{T}(Y1 - Y) = (Y^{T}Y1 - Y1^{T}Y1) + (Y1^{T }Y - Y^{T}Y);\\ Y^{T}Y1 = Y^{T}Xb = Y^{T}X(X^{T}X)^{-1}X^{T}Y;\\ Y1^{T}Y1 = b^{T}X^{T}Xb = Y^{T}X(X^{T}X)^{-1}X^{T}X(X^{T}X)^{-1}X^{T}Y =\\ = Y^{T}X(X^{T}X)^{-1}X^{T}Y = Y^{T}Y^{1}$$Равенство $$Y1^{T }Y - Y^{T }Y = 0$$ эквивалентно равенству $$\sum Y_{i}Y - \sum Y1_{i}Y$$, или $$\sum Y1_{i} - \sum Y_{i}$$. Последнее равенство является первым равенством нормальной системы уравнений МНК (с учетом того, что $$x_{0j} = 1, j = 1, 2, \dots , N$$). Таким образом, равенство (3.19) доказано.
С вопросом об оценке качества модели тесно связано понятие коэффициента множественной корреляции. В главе 2 рассматривался коэффициент детерминации
Он показывает, насколько предсказания по уравнению регрессии лучше, чем по среднему значению отклика $$Y$$. Число $$R=\sqrt{R^{2}}$$ называют коэффициентом множественной корреляции. Оказывается, это число совпадает с коэффициентом корреляции между $$Y1$$ и $$Y$$, который отражает тесноту линейной связи между значениями выхода $$Y$$ и их расчетными значениями $$Y1$$. Докажем этот факт. Необходимо установить равенство
![]() |
(3.20) |
Для этого достаточно показать, что числитель равен $$Q_{регр}$$, а знаменатель равен $$\sqrt{Q_{общ}Q_{регл}}$$. Прежде всего заметим, что в силу ранее доказанного равенства $$\sum Y1_{i} - \sum Y_{i}$$ получаем $$Y - Y1$$. Отсюда вытекает требуемое соотношение для знаменателя. Далее
Итак, из (3.6) последнее слагаемое равно нулю, что и требовалось.
Дисперсионный анализ для случая многих факторов проводится так же, как и для парной регрессии. Сделаем только замечания по поводу подсчета степеней свободы для $$Q_{ост}$$ и $$Q_{регр}$$.
Обозначим $$\nu _{ост} = N - k - 1$$. Это число степеней свободы остаточной суммы квадратов $$Q_{ост}$$. Оно равно разности между числом наблюдений и числом линейных связей между ними, участвующими в определении $$Q_{ост}$$ (в сумме участвуют значения $$Y1_{i}$$, которые, в свою очередь, зависят от вектора коэффициентов $$b = b_{0}, b_{1}, \dots , b_{k})$$.
Несмещенная оценка дисперсии $$\sigma ^{2 }$$ ошибок наблюдений задается в этом случае формулой
![]() |
(3.21) |
Аналогично сумма $$Q_{общ}$$ имеет число степеней свободы $$\nu _{общ}$$, равное $$N - 1,$$ так как в этой сумме все наблюдения связаны одной связью (участвует одно значение $$Y$$). Наконец, для суммы $$Q_{регр }$$ число степеней свободы $$\nu _{регр} = (k + 1) - 1 = k$$, так как в выражение $$Q_{регр}$$ входят $$k + 1$$ оценок $$b_{0}, b_{1}, \dots, b_{k}$$ и одна линейная связь, определяемая $$Y$$. Очевидно, что $$\nu _{общ},= \nu _{ост}+\nu _{регр}$$.
Проверку значимости уравнения регрессии проводим по уже знакомой нам схеме. Находим
и наблюдаемое значение критерия Фишера
. Если уравнение регрессии незначимо, то в условиях Гаусса - Маркова числитель и знаменатель дроби являются несмещенными оценками для $$\sigma^{2}$$ и дробь подчиняется распределению Фишера - Снедекора. Затем по заданной надежности $$g = 1 - \alpha$$, где $$\alpha$$ - уровень значимости, по таблицам данного распределения находим критическое значение $$F_{krit}(\alpha ,\nu _{регр}., \nu _{ост})$$. Если $$F_{набл} > F_{krit}(\alpha , \nu _{регр}., \nu _{ост}))$$, то нулевая гипотеза о незначимости уравнения регрессии отвергается и принимается гипотеза о значимости уравнения регрессии.
Формула (3.20) дает выборочное значение коэффициента множественной корреляции, являющейся оценкой фактического его значения $$\rho$$. Иногда возникает необходимость проверить значимость этого коэффициента, т.е. проверить нулевую гипотезу: $$\rho = 0$$. Это равнозначно проверке значимости уравнения регрессии. Для этого составляют соотношение
![]() |
Далее проверка значимости коэффициента полностью совпадает с проверкой значимости уравнения регрессии.
В случае когда наблюдения проводятся с повторениями, т.е. при некотором наборе $$x^{o}_{i} = (x^{0}_{il}, x^{0}_{i2},\dots ,x^{0}_{iN})^{T}$$ проводится $$n$$ дополнительных повторных опытов, появляется возможность проверить качество выбора модели, т.е. ее адекватность опытным данным. Пусть в дополнительной точке $$x^{o}_{i} = (x^{0}_{il}, x^{0}_{i2},\dots ,x^{0}_{iN})^{T}$$ получены $$\tilde{Y} _{1}, \tilde{Y} _{2},\dots ,\tilde{Y}_{n }$$ значения которые отражают лишь влияние случайных ошибок или в худшем случае влияние неучтенных факторов на результаты наблюдений. Оценим дисперсию ошибок по этим данным:
Если регрессия адекватна наблюдениям, то $$S^{2}_{ош}$$ и $$S^{2}_{ост}$$ являются несмещенными оценками одной и той же дисперсии случайных ошибок $$\sigma ^{2}$$.
Итак, нулевая гипотеза в этом случае имеет вид
| $$M(S^{2}_{ост}) = M(S^{2}_{ош}) = \sigma ^{2}.$$ | (3.21) |
Согласно конкурирующей гипотезе, равенство (3.21) не выполняется, т.е. остатки модели слишком велики по сравнению с ошибками наблюдений, а следовательно, модель (3.1) неадекватна. Это позволяет использовать критерий Фишера для проверки адекватности регрессионной модели. Сначала выберем уровень значимости a в пределах от 0,01 до 0,1. Из таблиц распределения Фишера необходимо найти величину $$F_{krit}(\alpha , \nu _{ост}, \nu _{ош})$$. Затем находят
. Если $$F_{набл} < F_{krit}$$, оснований отвергнуть гипотезу об адекватности нет. Если $$F_{набл }> F_{krit}$$, гипотеза об адекватности модели отвергается.
В условиях Гаусса - Маркова оценки $$b_{i}$$имеют нормальное распределение и, как установлено ранее, $$M(b_{i}) = \beta _{i}$$. Обозначим дисперсию этих оценок $$\sigma ^{2}(b_{i})$$. Тогда случайная величина
является нормированной нормально распределенной величиной, т.е. имеет нулевое математическое ожидание и единичную дисперсию. Вместе с тем можно показать, что отношение
имеет распределение $$\chi^{2}$$. Поэтому выражение
![]() |
(3.22) |
имеет распределение Стьюдента с числом степеней свободы $$\nu (b_{i})$$. Если $$\alpha$$ выбранный уровень значимости, то по таблицам распределения определяем значение $$t_{krit}$$, для которого неравенство $$-t_{krit} <= t_{i} <= t_{krit}$$ справедливо с вероятностью $$1 - \alpha$$. Из равенства (3.21) и последнего неравенства получаем
| $$b_{i} - t_{krit}S(b_{i}) <= b_{i} <= b_{i} + t_{krit}S(b_{i}).$$ | (3.23) |
Учитывая соотношение (3.15), окончательно имеем
| $$b_{i} - t_{krit}\sqrt{ciiSост} <= \beta _{i} <=b_{i} +t_{krit}\sqrt{ciiSост}.$$ | (3.24) |
Оценка неравенства (3.24) позволяет проверить гипотезу о равенстве нулю неизвестного параметра $$\beta _{i}$$. Если эта гипотеза справедлива, то выборочная оценка $$\beta _{i}$$ может отличаться от нуля лишь за счет случSайных возмущений. Рассмотрим выражение (3.22) при
. Определив по таблицам распределения $$t_{krit}$$ по заданному уровню значимости a и известному числу степеней свободы $$\nu _{ост} = N - k - 1$$, соответствующему $$S_{ост}$$, делаем вывод:
В предыдущей главе нами был получен доверительный интервал для уравнения парной регрессии. К сожалению, полученная нами формула (2.25) допускает тривиальное обобщение на случай многих переменных только для ортогональных факторов$$ Х_{0}, Х_{1}, \dots , Х_{k}$$. Дело в том, что информационную матрицу$$ Х$$ в случае парного регрессионного анализа всегда можно ортогонализовать, перейдя от вектора$$ Х_{1}$$ к вектору $$\tilde{X} _{1} = X_{1} - X$$. Тем не менее оценка расчетного значения зависимой переменной при некотором фиксированном наборе исходных данных$$ Х_{0}$$ приводит к следующей расчетной формуле:
| $$[Y1_{x^*} - t \gamma (n - k - 1)S(Y1_{x^*}); Y1_{x^*} + t \gamma (n - k - 1)S(Y1_{x^*})],$$ | (3.25) |
где
![]() |
(3.26) |
Из равенства $$Y_{x^* }= Y1_{x^*} + \varepsilon _{x^*}$$ и независимости случайных величин $$Y1_{x^*}, \varepsilon _{x^*}$$ получаем аналогичный доверительный интервал для индивидуальных (исходных) значений зависимой переменной $$Y_{x^*}$$:
| $$[Y_{x^*} - t \gamma (n - k - 1)S(Y_{x^*}); Y_{x^*} + t \gamma (n - k - 1)S(Y_{x^*})],$$ | (3.27) |
где
![]() |
(3.28) |
Опыт использования методов регрессионного анализа показывает, что адекватность описания объекта исследования зависит от выбора предсказывающих переменных. Например, для успешного прогнозирования урожайности нужно выбрать наиболее информативные агрометеорологические, почвенные и социально-технологические факторы. Обычно у исследователя имеется в распоряжении несколько десятков факторов, реально влияющих на сельскохозяйственные культуры. Но модель, построенная по всем факторам, как правило, имеет плохие прогнозирующие свойства.
Ранее отмечалось, что для оценки качества модели можно использовать коэффициент детерминации $$R^{2}$$, который численно выражает долю дисперсии переменной выхода, объясненную с помощью регрессионного уравнения. Однако для получения наилучшего набора переменных этот коэффициент мало пригоден.
Во-первых, при включении новой переменной в модель коэффициент детерминации $$R^{2}$$ либо остается практически неизменным, либо увеличивается. Во-вторых, $$R^{2}$$ зависит от крутизны поверхности регрессии. В одномерном случае при увеличении угла наклона прямой регрессии к оси абсцисс величина $$R^{2}$$ может быть близка к единице при плохом качестве прогноза по уравнению регрессии. Наконец, $$R^{2}_{выб}$$ является смещенной оценкой для $$R^{2}_{ист}$$. При $$R^{2}_{ист}$$ математическое ожидание $$R^{2}_{выб}$$ равно
![]() |
где
| $$k$$ | - | число переменных в регрессионной модели, |
| $$N$$ | - | число наблюдений. |
Поэтому при значениях $$k$$, близких к объему выборки $$N$$, можно получить значение $$R^{2}_{выб}$$, близкое к единице, хотя $$R^{2}_{ист} = 0$$. Все это заставляет искать другие критерии для поиска наилучшего набора переменных регрессионной модели.
Рассмотрим показатель статистической связи между двумя переменными, называемый частным коэффициентом корреляции. Во многих задачах, в том числе экономических, агрометеорологических факторы, как правило, сильно коррелируют, и выделить "чистое" влияние на переменную выхода каждой независимой переменной трудно. С целью выделения этого влияния и вычисляют частный коэффициент корреляции как меру линейной связи между зависимой переменной $$Y$$ и какой-либо одной из переменных $$x_{0}, x_{1}, \dots, x_{k}$$ после удаления влияния на эту связь всех остальных переменных.
Рассмотрим один из способов построения частного коэффициента корреляции. Допустим, изучается линейная связь между переменными $$x_{1}, x_{2}, y$$ и требуется найти коэффициент корреляции между зависимой переменной $$y$$ и независимой переменной $$x_{1}$$, "очищенный" от влияния переменной $$x_{2}$$.
Вычислим парные коэффициенты корреляции $$r_{yx1}, r_{yx2}, r_{x1x2}$$ и рассмотрим разность
| $$\eta = r _{yx1} - r _{yx2}r_{x1x2}$$. | (3.29) |
Если переменные $$y$$ и $$x_{1}$$ не коррелируют с $$x_{2}$$, то $$\eta = r_{yx1}$$. Оценивать зависимость с помощью разности (3.29) неудобно. Поэтому ее нормируют так, чтобы получившийся коэффициент был в пределах от -1 до +1. В этом случае получаем выражение
![]() |
(3.30) |
Величина $$R_{yx_{1} \cdot x_{2}}$$ - частный коэффициент корреляции величин $$y$$ и $$x_{1}$$ без учета влияния $$x_{2}$$. Если требуется устранить влияние на y двух переменных $$x_{2}$$ и $$x_{3}$$, то по формуле (3.30) вычисляем предварительно коэффициенты $$r_{yx_{1}\cdotx_{2}}, r_{yx_{3}\cdotx_{2}}, r_{yx_{1}x_{3}\cdotx_{2}}$$, а затем коэффициент
![]() |
(3.31) |
который отражает зависимость между $$y$$ и $$x_{1}$$ без учета влияния $$x_{2 }$$ и $$x_{3}.$$ Аналогично поступают в случае любого числа переменных. Можно показать, что коэффициент частной корреляции показывает тесноту связи результирующего признака с одним из факторов при неизменном уровне других факторов. Если оценивается теснота связи между $$y$$ и $$xi$$ без учета влияния $$x_{1}, x_{2}, \dots , x_{i} - 1, x_{i} + 1, \dots x_{k}$$, то коэффициент частной корреляции может быть рассчитан по формуле
![]() |
(3.32) |
где
![]() |
- | множественный коэффициент детерминации всех факторов с результатом; |
![]() |
- | множественный коэффициент детерминации модели без $$i$$-го фактора. |
Рассмотрим еще один способ расчета частных коэффициентов корреляции, основанный на вычислении корреляционной матрицы выборочных коэффициентов корреляции
![]() |
(3.33) |
Выборочным частным коэффициентом корреляции между $$y$$ и $$x_{i}$$ без учета влияния $$x_{1}, x_{2}, \dots , x_{i} - 1, x_{i} + 1, \dots , x_{k}$$, является выражение
| где | $$Q_{yxi}, Q_{yy}, Q_{ii}$$ | - | алгебраические дополнения элементов $$r_{yxi}, r_{yy} = 1, r_{ii} = 1$$ матрицы $$Q_{k}$$. |
Частные коэффициенты корреляции имеют те же свойства, что и обычные. При выборе наилучшей модели с их помощью определяют, какая переменная оказывает на переменную выхода наибольшее влияние. Для того чтобы выяснить, существенно ли это влияние, используют различные критерии проверки гипотезы о равенстве нулю некоторых коэффициентов регрессии. Можно, например, воспользоваться $$F$$-критерием, который в данном случае называют частным $$F$$-критерием. Если изучается влияние переменной $$x_{i}$$, входящей в модель с коэффициентом $$b_{i}$$, то основная гипотеза имеет следующий вид: $$H_{0}/\beta _{i} = 0$$.
Частный $$F$$-критерий, предназначенный для включения фактора в модель, позволяет сравнить прирост факторной дисперсии за счет дополнительно включенного фактора с остаточной дисперсией, приходящейся на одну степень свободы по регрессионной модели в целом,
![]() |
(3.34) |
где
-
- доля вариации $$y$$, объясненная регрессией за счет введения фактора $$x_{i}$$;
- доля остаточной вариации модели, включающей полный набор факторов.
Если числитель и знаменатель формулы (3.34) умножить на $$\sum (y - y)^{2}$$, то получим отношение не долей, а отношение прироста факторной объясняющей суммы квадратов отклонений к остаточной сумме квадратов. Так как прирост факторной суммы квадратов обусловлен включением в модель одного фактора, число степеней свободы для него равно $$\nu = (n - k - 1) - (n - k) = 1$$.
Для остаточной суммы квадратов $$\nu _{ост} = n - k - 1$$. Фактическое значение частного $$F$$-критерия сравнивается с табличным при некотором уровне значимости $$\alpha$$. Если наблюдаемый $$F$$-критерий превышает табличное значение, то фактор признают значимым и оставляют в модели, если наблюдаемый $$F$$-критерий меньше табличного, то фактор признается незначимым и принимается гипотеза $$H_{0}/\beta _{i} = 0$$.
Аналогичную процедуру можно применять и для усложнения модели путем решения вопроса о включении в нее нового фактора. В пакетах прикладных программ, например в пакете STATISTICA, реализованы как процедура включения, так и процедура исключения фактора из модели. Критические значения критериев для включения и исключения факторов $$F_{вкл}$$ и $$F_{искл}$$ пользователь определяет самостоятельно.
В методе исключения анализ начинается с включения в регрессионную модель всех переменных. Затем для каждой переменной вычисляют частную $$F$$-статистику и ту переменную, для которой $$F$$-статистика минимальна, исключают из рассмотрения. Затем строят новую модель по оставшимся переменным и после вычисления частных $$F$$-статистик вновь удаляют одну из переменных. И так до тех пор, пока не будет достигнуто заранее заданное число переменных в модели или все $$F$$-статистики не станут больше заданного порога.
В методе включения начинают с построения модели, включающей лишь одну переменную, имеющую наибольший по абсолютной величине парный коэффициент корреляции с переменной выхода. Затем вычисляют частные $$F$$-статистики для всех оставшихся переменных и включают в модель переменную с наибольшей $$F$$-статистикой. Это эквивалентно включению переменной, имеющей наибольший частный коэффициент корреляции с переменной выхода. Процесс продолжают до тех пор, пока в модели не наберется определенное число переменных или $$F$$-статистики не станут меньше заданного порога.
Более сложной процедурой является . Обычно задают уровень допуска -$$ Т_{доп} = 0,01$$, а $$F_{вкл}$$ и $$F_{искл}$$ подбирают в ходе решения задачи. Переменную с максимальным значением $$F$$ включают в модель при условии, что значения$$ Т$$ не превышают$$ Т_{доп }$$ (степень коррелированности системы не должна быть слишком большой), но при этом $$F > F_{вкл}$$. Если оказывается, что $$F < F_{искл}$$, то переменную исключают из модели.
Преимуществами шаговых методов являются простота алгоритмов, автоматизация выбора наилучшей модели, быстрота вычислений; недостатком - раздельный анализ переменных (по отдельности переменные могут не являться значимыми, но их совместное использование может улучшить показатели регрессионной модели).
Другой способ пошагового отбора факторов состоит в использовании скорректированного коэффициента детерминации, определяемого по формуле
![]() |
(3.35) |
В отличие от обычного коэффициента детерминации $$R^{2}$$, который всегда увеличивается при добавлении новых факторов, скорректированный коэффициент детерминации может уменьшаться при добавлении новых переменных, не оказывающих существенного влияния на выходную переменную $$y$$. Однако даже увеличение скорректированного коэффициента детерминации не всегда означает, что вводимый в модель фактор значим. Поэтому описанный выше метод шаговой регрессии, основанный на использовании $$F_{вкл}$$ и $$F_{искл}$$, предпочтительнее.
Рассмотрим пример. В таблице 3.2 представлены данные для исследования зависимости урожайности семян люцерны от следующих факторов:
Представленные данные получены в результате 12 опытов, проведенных в 1986-1989 гг. в учебном хозяйстве "Березовский" Воронежского аграрного университета.
| Номер опыта | $$x_{1}$$ | $$x_{2}$$ | $$x_{3}$$ | $$x_{4}$$ | $$x_{5}$$ | $$x_{6}$$ | $$x_{7}$$ |
| 1 | 282 | 30 | 17,3 | 65,3 | 65,4 | 20 | 50 |
| 2 | 326 | 80 | 20,2 | 61,0 | 43,0 | 17 | 80 |
| 3 | 374 | 76 | 18,9 | 73,0 | 131,6 | 17 | 46 |
| 4 | 374 | 109 | 18,8 | 66,0 | 55,1 | 17 | 40 |
| 5 | 424 | 104 | 18,1 | 72,0 | 171,9 | 11 | 84 |
| 6 | 522 | 99 | 22,0 | 62,1 | 46,6 | 14 | 61 |
| 7 | 212 | 30 | 19,0 | 73,2 | 95,7 | 20 | 50 |
| 8 | 411 | 50 | 17,3 | 66,3 | 119,7 | 14 | 52 |
| 9 | 164 | 30 | 17,3 | 65,3 | 65,4 | 20 | 50 |
| 10 | 411 | 50 | 17,3 | 66,3 | 149,1 | 14 | 52 |
| 11 | 438 | 102 | 18,0 | 69,3 | 63,0 | 21 | 65 |
| 12 | 364 | 69 | 22,0 | 76,0 | 219,0 | 12 | 70 |
С целью выбора наилучшего варианта набора переменных применим комбинированный вариант включения и исключения неизвестных в процедуре шаговой регрессии, реализованный в модуле "Множественная регрессия" пакета STATISTICA.
Дополним наше множество следующими переменными:
$$x_{9 }= x_{1} \cdot x_{2}, x_{10} = x_{2} \cdot x_{3}, x_{11} = x_{3} \cdot x_{4}, x_{12} = x_{4} \cdot x_{5}, x_{13} = x_{5} \cdot x_{6}, x_{14} = x_{6} \cdot x_{7}.$$Матрицу данных зададим в табл. 3.3.
Таблица 3.3
Рассчитаем частные коэффициенты корреляции (Partial Correlations) и значения частной $$F$$-статистики ($$F-to\ enter/to\ remove$$) на каждом шаге регрессии. Всего было задано пять шагов регрессии при $$F_{вкл} = 1,15$$ и $$F_{искл} = 1$$. Результаты расчетов представлены в табл. 3.4-3.6.
Таблица 3.4
Таблица 3.5
Таблица 3.6
Результаты расчетов показывают, что хотя некоторые переменные $$x_{5}, x_{5}x_{6}$$ имеют незначимые уровни значимости ($$p-level > 0,05$$), их желательно оставить в уравнении регрессии, так как при их включении прирост коэффициента детерминации $$R^{2 }$$ составил 0,193364, т.е. 20% всего возможного диапазона изменения $$R^{2}$$.
Выпишем полученное уравнение, сначала используя исходные переменные:
| $$y = 41,58457 - 0,06971x_{7} + 0,07299x_{2} - 0,68161x_{4} + 0,00919x_{5}x_{6} - 0,0603_{4}x_{5}.$$ | (3.36) |
Составим таблицу наблюдаемых, расчетных значений и остатков урожайности семян люцерны (табл. 3.7).
Качество предсказания получилось посредственное: средняя абсолютная ошибка предсказания равна 1,0; средняя относительная ошибка равна почти 30%.
Рассмотрим вопрос о ранжировании факторов по силе их влияния на формирование урожая. Для этого необходимо переписать уравнение (3.36) через стандартизированные факторы вида
.
Таблица 3.7
Кроме того, следует отметить, что в пакете STATISTICA коэффициенты модели со стандартизированными факторами приводятся в графе BETA таблицы REGRESSION SUMMARY (см. табл. 3.6). Стандартизированный коэффициент регрессии $$\beta _{i}$$показывает, на сколько величин $$S_{y}$$ изменится в среднем зависимая переменная y при увеличении переменной $$x_{i}$$ на $$S_{xi}$$. Имеем
| $$Y_{станд }= -0,39681x_{7} + 0,92041x_{2 }- 1,31915x_{4} + 2,34582x_{5}x_{6} - 1,40422x_{5}.$$ | (3.37) |
Из свойств уравнения в стандартизированных переменных заключаем, что наибольшее влияние на выходную переменную при изменении каждого фактора $$xi$$ на величину $$S_{xi}$$ окажет фактор $$x_{5}$$ в отдельности и в сочетании факторов $$x_{5}x_{6}$$. Следующий по силе влияния - фактор $$x_{4}$$, затем фактор $$x_{2 }$$ и, наконец, фактор $$x_{7}$$.
По уравнению (3.37) можно ранжировать факторы по силе влияния на $$y$$. Количественно сравнить силу этого влияния можно, используя коэффициенты эластичности модели
. Коэффициенты эластичности показывают, на сколько процентов от среднего значения изменится зависимая переменная $$y$$ при увеличении переменной $$x_{i}$$ на 1%. Вычислим коэффициенты эластичности каждого фактора. Для этого вычислим в модуле Basic Statistic пакета STATISTICA средние факторов и зависимой переменной y (табл. 3.8).
| Факторы | Средние | Факторы | Средние |
| $$x_{1}$$ | 358,50 | $$x_{1}x_{2}$$ | 26 806,33 |
| $$x_{2}$$ | 69,08 | $$x_{2}x_{3}$$ | 1 321,17 |
| $$x_{3i}$$ | 18,85 | $$x_{3}x_{4}$$ | 1 282,14 |
| $$x_{4}$$ | 67,98 | $$x_{4}x_{5}$$ | 7 126,24 |
| $$x_{5}$$ | 102,13 | $$x_{5}x_{6}$$ | 1 557,70 |
| $$x_{6}$$ | 16,42 | $$x_{6}x_{7}$$ | 938,42 |
| $$x_{7}$$ | 58,33 | $$y$$ | 4,37 |
Отсюда:
Под мультиколлинеарностью понимается высокая степень коррелированности объясняющих переменных. Крайний случай мультиколлинеарности - линейная зависимость между столбцами информационной матрицы$$ Х$$. При этом определитель матрицы$$ Х^{T}Х$$ равен нулю и не существует обратной матрицы$$ С = (Х^{T}Х)^{-1}$$. Расчет коэффициентов модели по МНК в этом случае невозможен. Гораздо чаще в экономических исследованиях встречается стохастическая мультиколлинеарность. В этом случае корреляционная связь между факторами высокая, определитель матрицы$$ Х^{T}Х$$ мал, а следовательно, велики элементы, в том числе диагональные, матрицы$$ С = (Х^{T}Х)^{-1}$$. Эти элементы входят в формулы для расчета дисперсии коэффициентов модели и дисперсии расчетного и наблюдаемого значений зависимой переменной. Качество модели падает, так как модель становится чувствительной к незначительным изменениям в величине и объеме данных. Прогноз по такой модели теряет смысл, а коэффициенты могут не отвечать требованиям теоретических предпосылок.
Рассмотрим пример: Пусть точное уравнение, связывающее зависимую переменную с тремя объясняющими переменными, имеет вид
| $$\hat{y} = 15 + x_{1} + 3x_{2} + 5x_{3}$$. | (3.38) |
Прибавим к точным значениям $$\hat{y}$$ ошибку наблюдения $$\delta$$, получим наблюдаемые значения зависимой переменной $$y = \hat{y} + \delta$$. Данные наблюдений отражает табл. 3.9.
| $$x_{1}$$ | $$x_{2}$$ | $$x_{3}$$ | $$\hat{y}$$ | $$\delta$$ | $$y$$ |
| 1,1 | 1,1 | 1,2 | 25,40 | 0,8 | 26,20 |
| 1,4 | 1,5 | 1,1 | 26,40 | -0,5 | 25,90 |
| 1,7 | 1,8 | 2,0 | 32,10 | 0,4 | 32,50 |
| 1,7 | 1,7 | 1,8 | 30,80 | -0,5 | 30,30 |
| 1,8 | 1,9 | 1,8 | 31,50 | 0,2 | 31,70 |
| 1,8 | 1,8 | 1,9 | 31,70 | 1,9 | 33,60 |
| 1,9 | 1,8 | 2,0 | 32,30 | 1,9 | 34,20 |
| 2,0 | 2,1 | 2,1 | 33,80 | 0,6 | 34,40 |
| 2,3 | 2,4 | 2,5 | 37,00 | -1,5 | 35,50 |
| 2,5 | 2,5 | 2,4 | 37,00 | 0,5 | 36,50 |
Переменные $$x_{1}, x_{2}, x_{3}$$ сильно коррелируют друг с другом
$$(r_{x_{1}x_{2}} = 0,985; r_{x_{1}x_{1}} = 0,931; r_{x_{1}x_{2}} = 0,915).$$Метод наименьших квадратов для наблюдаемой переменной y приводит к уравнению
| $$y = 17,112 + 7,266_{x_{1}} - 5,517_{x_{2}} + 6,39_{x_{3}}.$$ | (3.39) |
Различие в моделях (3.38) и (3.39) очевидно. Поменялся даже знак коэффициента при $$x_{2}$$, что приводит к неверным выводам не только в количественном описании взаимодействия факторов с выходной переменной, но и в качественном. Использовать модель (3.39) невозможно.
Существуют различные методы, которые могут быть использованы для смягчения мультиколлинеарности. Прежде всего к ним относятся методы, уменьшающие дисперсию оценок. К таким методам относятся: радикальное увеличение числа опытов; отбор из множества объясняющих переменных тех переменных, которые имеют наиболее низкие взаимные коэффициенты корреляции; на стадии подготовки данных максимизация дисперсии наблюдений независимых переменных путем расслоения выборки; уменьшение дисперсии остатков путем введения упущенной в первоначальной модели важной переменной.
Кроме того, для смягчения мультиколлинеарности используют внешнюю информацию о структуре модели, ввод ограничений на величину оценок или связи между коэффициентами модели.
Еще одним способом устранения мультиколлинеарности является переход от несмещенных оценок МНК с большой дисперсией к смещенным оценкам, но с гораздо меньшей дисперсией. В результате доверительный интервал той же длины для смещенного коэффициента будет с большей вероятностью накрывать истинный коэффициент. Метод построения модели, использующий эту идею, называется методом гребневой регрессии (ридж-регрессии). При этом расчет коэффициентов модели проводят по формуле
$$\beta _{гр} = (Х^{T}Х + \Delta _{гр}I_{k + 1})^{-1}Х^{T}Y,$$где
| $$\Delta _{гр}$$ | - | некоторое подбираемое исследователем положительное число, называемое гребнем; |
| $$I_{k + 1}$$ | - | единичная матрица $$(k + 1)$$-го порядка. |
Величина $$\Delta _{гр}$$ выбирается исходя из условий компромисса между желанием уменьшить $$\Delta _{гр}$$ - смещенность оценки $$\beta$$ - и стремлением уменьшить ее дисперсию за счет увеличения определителя матрицы$$ Х^{T}Х + \Delta _{гр}I_{k + 1}.$$
Наконец, можно провести преобразование исходных данных, задействовать новые ортогональные факторы, называемые главными компонентами, и получить уравнение регрессии. Этот метод называется регрессией на главные компоненты.
Основная идея метода заключается в замене сильно коррелированных переменных совокупностью новых переменных, между которыми корреляция отсутствует. При этом новые переменные являются линейными комбинациями исходных переменных
Переменные $$z_{1}, z_{2}, \dots, z_{m}$$ называют главными компонентами. Будем подбирать их так, чтобы $$z_{1}$$ имела наибольшую дисперсию. Для каждой следующей компоненты дисперсия убывает, а последняя компонента будет иметь наименьшую дисперсию. Предположим, исходные переменные $$x_{1}, x_{2}, \dots , x_{m}$$ уже стандартизированы так, что все переменные имеют нулевое математическое ожидание и единичную дисперсию. При этом матрица $$V = X^{T}X$$ является корреляционной матрицей для исходных данных.
Для первой главной компоненты
где $$a_{1} = a_{11}, a_{12}, \dots , a_{1m}$$, справедливы равенства
Как известно из теории положительно определенных симметричных матриц, невырожденная корреляционная матрица $$V = X^{T}X$$имеет $$m$$ положительных собственных значений и $$m$$ соответствующих им ортогональных собственных векторов.
Пусть $$a_{1}$$ собственный вектор матрицы $$V = X^{T}X, а \lambda _{1}$$ соответствующее ему собственное значение, т.е. $$Va_{1} = \lambda _{1}a_{1}$$. Умножив последнее равенство слева на $$a_{1}^{T}$$ получаем $$a_{1}^{T}Va_{1} = \lambda _{1}a_{1}$$. Чтобы однозначно определить вектор $$a_{1}$$, введем дополнительное требование: $$a_{1}^{T}a_{1} = 1$$. Тогда $$D(z_{1}) = a_{1}^{T}Va_{1} = \lambda _{1}$$ и проблема нахождения первой главной компоненты с максимальной дисперсией решается путем нахождения наибольшего собственного значения $$\lambda _{1}$$ и соответствующего ему собственного вектора $$a_{1}$$ корреляционной матрицы $$V = X^{T}X$$.
Аналогично находим вторую главную компоненту
при условии нормировки $$a_{2}^{T}a_{2} = 1$$ и линейной независимости (ортогональности векторов) $$a_{2}^{T}a_{2} = 0$$. Дисперсия второй главной компоненты $$z_{2}$$ будет равна второму по величине собственному значению $$\lambda _{2}$$ матрицы $$V = X^{T}X$$. Убедимся, что главные компоненты $$z_{1}$$ и $$z_{2}$$ не коррелируют между собой. Действительно,
Продолжая процесс построения, получаем систему главных компонент, не коррелирующих друг с другом, с дисперсиями, равными собственным числам корреляционной матрицы $$V$$. Исходные переменные были сильно коррелированны, поэтому матрица $$V = X^{T}X$$ плохо обусловлена, т.е. ее определитель близок к нулю. Вместе с тем можно показать, что определитель $$V = \lambda _{1} \cdot \lambda _{2} \cdot \dots \cdot \lambda _{m}$$. Следовательно, одно или несколько последних собственных значений матрицы могут оказаться достаточно малы. Отбросив соответствующие главные компоненты, мы получаем возможность сократить размерность задачи, уменьшить число факторов в модели.
Применим метод главных компонент к рассмотренному выше примеру (см. табл. 3.4).
Составим корреляционную матрицу С и определим ее собственные векторы и собственные значения, используя, например, пакет МАТКАД.
Первая главная компонента имеет вид
| $$z_{1} = 0,5832x_{1} + 0,58x_{2} + 0,569x_{3}.$$ | (3.40) |
Аналогично вычисляются остальные главные компоненты. Коэффициенты корреляции между $$y$$ и главными компонентами $$z_{1}, z_{2}, z_{3}$$ равны $$r_{yz}1 = 0,956; r_{yz}2 = -0,185; r_{yz}3 = - 0,1$$. Это еще раз подтверждает, что почти вся информация о линейной связи между $$y$$ и $$x_{1}, x_{2}, x_{3}$$ сводится к информации о связи между $$y$$ и первой главной компонентой $$z1$$. Если написать уравнение регрессии, связывающее переменную $$y$$ и $$z_{1}$$, а затем, используя уравнение (3.40), перейти к исходным переменным $$x_{1}, x_{2}, x_{3}$$ в естественной, а не в стандартизированной форме, то получим окончательное уравнение
| $$y = 16,542 + 4,841z_{1} = 16,542 + 2,822x_{1} + 2,808x_{2} + 2,755x_{3}.$$ | (3.41) |
Уравнение (3.41) правильно отражает качественные свойства зависимостей и значительно ближе к точному уравнению (3.39), чем классическое МНК-уравнение (3.40).
Выше мы исходили из того, что объясняющие переменные модели могут принимать любые значения в некотором интервале данных. Будем называть их количественными переменными. Однако может возникнуть необходимость включить в модель качественный фактор, принимающий два или несколько фиксированных значений-уровней.
Например, можно предположить, что уровень зарплаты в регионе зависит от уровня образования или пола. Или, проводя количественный прогноз урожайности, включить в уравнение результаты проведенного на предыдущем этапе качественного прогноза (спад, подъем урожая). В моделях, связанных с торговлей и маркетингом, при расчете объемов продаж товара часто фигурирует фактор сезонности (зима, весна, лето, осень). В принципе можно строить отдельные модели для каждого уровня качественного признака, а затем изучать различия между ними. Однако есть подход, позволяющий использовать одно регрессионное уравнение, но с дополнительными фиктивными (структурными, манекенными) переменными.
Часто используют модели с бинарными переменными, принимающими два значения: 0 и 1. Конечно, можно вводить и переменные, принимающие несколько значений, но в этом случае возникают проблемы с интерпретацией коэффициентов модели. Поэтому если есть переменная, принимающая $$k$$ значений, то ее заменяют $$(k - 1)$$-й бинарной переменной. Например, если предварительный качественный прогноз урожая может быть сформулирован трояко: 1) спад; 2) практически останется на прежнем уровне; 3) подъем, то в модель вводится две бинарные переменные:
![]() |
(3.42) |
Исходя из этого строим модель вида
| $$y_{t} + 1 = \beta _{0} + \beta _{1}y_{t} +\beta _{21}z_{1} + \beta _{22}z_{2} + \varepsilon _{t} + 1$$ | (3.43) |
где
| $$y_{t}, y_{t} + 1$$ | - | урожайность сельскохозяйственной культуры в текущем и будущем году. |
Принимая модель (3.43), мы предполагаем, что средняя сила влияния $$\beta _{1}$$ урожая текущего года на урожай будущего года одинакова для всех трех случаев прогноза, а переменные $$z_{1}$$ и $$z_{2}$$ отражают особенности агрометеоситуации в неблагоприятные и благоприятные годы для данной сельскохозяйственной культуры.
Фиктивные переменные позволяют строить модели для исследования структурных изменений. При этом мы получаем кусочно-линейные модели.
Пусть $$y_{t}$$ - зависимая переменная, например урожайность сельскохозяйственной культуры, $$t = 1, 2, \dots , t^*, t^* + 1, \dots , n$$ - период наблюдения. Предположим, исследователь считает, что с начала 90-х гг. в сельском хозяйстве произошли структурные изменения и линия регрессии будет отличаться от той, что была при $$t < t^*$$. Чтобы оценить такую модель, введем бинарную переменную $$d$$, полагая, что $$d_{t} = 0$$ при $$t < t^* и d_{t} = 1 при t >= t^*$$. Пусть $$x_{t}$$ - некоторая объясняющая переменная, например фондовооруженность отрасли.
Запишем следующее регрессионное уравнение:
| $$y_{t} = \beta _{0} + \beta _{1}x_{t} + \beta _{2}(x_{t} - x_{t*})d_{t }+ \varepsilon _{t}.$$ | (3.44) |
Линия регрессии (3.44) имеет коэффициент наклона $$\beta _{1}$$ при $$t < t^* и \beta _{1} + \beta _{2}$$ при $$t >= t^*$$. Отметим, что разрыва при $$t = t^*$$ не происходит. Оценка значимости коэффициента $$\beta _{2}$$ означает проверку нулевой гипотезы $$H_{0}$$ (структурных изменений в сельском хозяйстве не произошло).
В случае включения в модель нескольких качественных факторов необходимо следить за тем, чтобы включаемые факторы были линейно независимы, т.е. чтобы в информационной матрице $$X$$ скалярные произведения столбцов, отвечающих за качественные переменные, были равны нулю.
Рассмотрим пример использования фиктивной переменной для повышения качества прогнозов при использовании оперативной информации в период уборки урожая. Оперативные данные наблюдений за ходом уборки представлены в табл. 3.10.
| Год | Оперативные данные урожайности зерновых культур в РФ с указанием даты, ц/га | ||||||
| 1992 | 10 августа 23,8 | 31 августа 21,7 | 14 сентября 20,6 | 28 сентября 20 | 5 октября 19,9 | 12 октября 19,7 | 1 ноября 19,7 |
| 1993 | 9 августа 27,5 | 30 августа 22,8 | 13 сентября 21,4 | 27 сентября 20,4 | 4 октября 19,9 | 11 октября 19,4 | 1 ноября 18,9 |
| 1994 | 8 августа 23,4 | 29 августа 20,9 | 12 сентября 19,1 | 26 сентября 18 | 3 октября 17,5 | 10 октября 17,3 | 31 октября 17,3 |
| 1995 | 7 августа 14,8 | 28 августа 14,5 | 11 сентября 14,5 | 25 сентября 14,6 | 2 октября 14,6 | 9 октября 14,6 | 30 октября 14,6 |
| 1996 | 12 августа 17,5 | 2 сентября 16,7 | 16 сентября 16,6 | 30 сентября 16,5 | 7 октября 16,4 | 14 октября 16,3 | 4 ноября 16,4 |
| 1997 | 11 августа 22,1 | 1 сентября 20,1 | 15 сентября 19,7 | 29 сентября 19,5 | 6 октября 19,4 | 13 октября 19,4 | 3 ноября 19,5 |
| 1998 | 10 августа 16,5 | 31 августа 14,2 | 14 сентября 13,9 | 28 сентября 14 | 6 октября 14 | 12 октября 14,1 | 2 ноября 14,3 |
| 1999 | 9 августа 219,4 | 30 августа 15,7 | 13 сентября 15,1 | 27 сентября 14,9 | 4 октября 15,2 | 11 октября 15,3 | 1 ноября 15,2 |
Прогноз знака колебаний урожайности был составлен по методу "ЗОНТ" на основе данных прошлых лет. Рассмотрим некоторые результаты по построению регрессионных зависимостей для прогноза зерновых в целом по России (табл. 3.11).
Пусть $$Y_{1 }$$- данные урожайности зерновых культур в целом на 12 сентября; $$Y$$ - бункерная урожайность на 14-15 октября; $$Y_{2}$$ - фиктивная переменная, принимающая значение 1 при прогнозируемом подъеме и значение -1 при прогнозируемом спаде урожайности в текущем году.
| Модель без учета глобального прогноза $$Y = 5,52 + 0,6267Y_{1}$$ | |||
| Сумма квадратов, объясняемая уравнением регрессии, равна 32,357. Сумма квадратов остатков равна 4,092. Общая сумма квадратов составляет 36,45 | |||
| Год | Исходные данные урожайности | Расчетные значения | Остатки |
| 1992 | 19,7 | 19,12 | 0,56 |
| 1993 | 19,4 | 19,81 | -0,41 |
| 1994 | 17,3 | 18,63 | -1,32 |
| 1995 | 14,6 | 14,62 | -0,02 |
| 1996 | 16,3 | 15,99 | 0,3 |
| 1997 | 19,4 | 18,12 | 1,28 |
| 1998 | 14,1 | 14,43 | -0,32 |
| 1999 | 15,3 | 15,37 | -0,07 |
| Сумма модулей ошибок равна 4,29. Средняя абсолютная ошибка равна 0,53. $$R_{2} = 0,8877; R = 0,9422; F(1,6) = 47,446; p < 0,00046.$$ Критерий Стьюдента для свободного члена = 3,27; р = 0,017.Критерий Стьюдента для коэффициента при $$Y_{1} = 6,89; p = 0,00046.$$ | |||
Так выглядит регрессионная модель без учета глобального прогноза для оперативного прогноза урожайности зерновых в России по данным на 12-14 сентября (см. табл. 3.11).
Теперь перейдем к уравнению, использующему глобальный прогноз урожайности зерновых в России (табл. 3.12).
| Модель c учетом глобального прогноза $$Y = 5,7374 + 0,6153Y_{1} + 0,524Y_{2}$$ | |||
| Сумма квадратов, объясняемая уравнением регрессии, равна 34,54. Сумма квадратов остатков равна 1,9. Общая сумма квадратов составляет 36,45 | |||
| Год | Исходные данные урожайности | Расчетные значения | Остатки |
| 1992 | 19,7 | 19,61 | 0,09 |
| 1993 | 19,4 | 19,24 | 0,16 |
| 1994 | 17,3 | 18,07 | -0,77 |
| 1995 | 14,6 | 14,13 | 0,47 |
| 1996 | 16,3 | 16,53 | 0,24 |
| 1997 | 19,4 | 18,62 | 0,77 |
| 1998 | 14,1 | 13,95 | 0,15 |
| 1999 | 15,3 | 15,92 | -0,62 |
| Сумма модулей ошибок равна 3,27. Средняя абсолютная ошибка равна 0,41. $$R_{2} = 0,948; R = 0,973; F(2,5) = 45,32; p < 0,00062.$$ Критерий Стьюдента для свободного члена равен 4,523; р = 0,0063. Критерий Стьюдента для коэффициента при $$Y_{1} = 9,024; p = 0,00047$$. Критерий Стьюдента для коэффициента при $$Y_{2} = 2,4; p = 0,062$$ | |||
Результаты расчетов по последней модели, по нашему мнению, практически не могут быть улучшены, так как средняя абсолютная ошибка находится в пределах ошибки сбора данных. Уравнение полностью адекватно исходным данным.
Таковы модели, где фиктивные переменные являются объясняющими переменными, т.е. факторами. Однако может возникнуть необходимость строить модели, в которых качественный признак играет роль результирующей переменной. Подобные задачи возникают при обработке данных социологических опросов, прогнозировании подъемов и спадов (например, урожайностей сельскохозяйственных культур). Кроме того, если результирующий признак является некоторой вероятностью (например, вероятностью наступления некоторого события), то результирующая переменная должна принимать значения хотя и в непрерывном, но в ограниченном отрезком [0; 1] диапазоне значений. Для оценки параметров таких моделей применяются методы логистической регрессии, Logit-, Probit-, Tobit-анализа.
Например, логистическая регрессия используется, когда зависимая переменная - дихотомия, т.е. может принимать только два значения, например 0 и 1. При этом независимые переменные могут быть непрерывными или категориальными переменными.
Пусть зависимая переменная принимает значение 1 при появлении некоторого события$$ А$$ и 0, если событие$$ А$$ не появилось. При каждом наблюдаемом фиксированном наборе факторов вычисляется
, где $$p$$ - число появлений единиц, а 1 - $$p$$ - число появлений нулей в наблюдениях.
Логистическая регрессия имеет много аналогий с обычной МНК-регрессией, хотя для оценки коэффициентов регрессии используется метод максимального правдоподобия, а не метод наименьших квадратов. В отличие от МНК-регрессии логистическая регрессия оценивает нелинейную связь между независимыми переменными и зависимой. При этом не возникает проблем гетероскедастичности, а требования менее строгие. Успех логистической регрессии может быть оценен по таблице числа правильных и неправильных классификаций дихотомической, зависимой переменной. Для проверки адекватности модели можно использовать критерии согласия, например критерий $$\chi^{2},$$ а проверку значимости коэффициентов можно проводить обычным способом.
Если исследователь предполагает, что за время наблюдений произошли резкие структурные изменения в виде связей между зависимой и независимыми переменными, то для проверки этой гипотезы используют тест Чоу. В этом случае строятся три регрессионные модели: первая по наблюдениям, проведенным до изменений, вторая по наблюдениям после происшедших изменений в структуре связей, а третья по всей выборке наблюдений. Нулевая гипотеза состоит в предположении о равенстве истинных соответствующих параметров регрессии для всех моделей. Нулевая гипотеза отвергается при уровне значимости \alpha , если наблюдаемая $$F$$-статистика
где
| $$p$$ | - | число переменных в модели; |
![]() |
- | суммы квадратов остатков моделей, построенных по наблюдениям, проведенным до изменений, после изменений и по всей выборке. |
Рассмотрим пример. Пусть $$Y(t)$$ временной ряд урожайности зерновых культур в России, график которого представлен на рис. 3.1.
(рис 3.1)
Следует проверить гипотезу об изменении в тенденции поведения ряда, которое произошло после распада СССР, т.е. после 1991 г., вследствие ухудшения снабжения сельскохозяйственного производства горюче-смазочными материалами (ГСМ), удобрениями, сельскохозяйственной техникой.
Первая выборка включает все наблюдения за период 1948-2001 гг. При этом уравнение регрессии имеет вид $$Y(t) = 7,68 + 0,18t$$. То есть в среднем урожайность зерновых в России повышалась на 0,18 ц/га в год. Сумма квадратов остатков для этого уравнения равна
О качестве модели можно судить по табл. 3.13.
Таблица 3.13
Вторая выборка состоит из наблюдений за 1948-1991 гг. Уравнение регрессии на этом участке имеет следующий вид: $$Y(t) = 6,49 + 0,254t$$ (табл. 3.14).
Таблица 3.14
Сумма квадратов остатков при этом равна $$\sum^{44}_{i=1} e_{i}^{2} = 138,2942.$$
Получим уравнение для оставшейся части наблюдений за 1991-2001 гг. (табл. 3.15). Имеем $$Y(t) = 31,66 - 0,32t$$.
Таблица 3.15
Сумма квадратов остатков при этом равна
Наблюдаемая $$F$$-статистика Чоу равна
При $$\alpha = 0,01$$
$$F_{krit}(\alpha ; p + 1; n - 2p - 2) = F_{krit}(0,01; 2; 50) = 5,057.$$Нулевая гипотеза об отсутствии изменения в тенденции поведения ряда урожайности в России после распада СССР уверенно опровергается на 1%-ном уровне значимости.
При построении модели, адекватно описывающей изучаемый процесс в экономике, очень важную роль играет анализ правильности ее спецификации. Отрицательно на объясняющих свойствах модели сказывается как отсутствие значимой переменной, так и избыточное присутствие незначимой объясняющей переменной.
В случае когда в модель не включена существенная переменная (существенной называют переменную, которая должна быть в модели согласно правильной теории), наблюдаются следующие последствия:
Предположим, к примеру, что из модели $$Y = \alpha + \beta _{1}X_{1i} + \beta _{2}X_{2i} + \varepsilon _{i}$$ исключена переменная $$X_{2}$$. Тогда в новой спецификации фактически рассматривается модель $$Y_{i} = \alpha + \beta _{1}X_{1i} + u_{i}, где u_{i} = \beta _{2}X_{2i} + \varepsilon _{i}$$.
Если объясняющие переменные$$ Х_{1}$$ и$$ Х_{2}$$ коррелированы, то нарушается предпосылка теоремы Гаусса - Маркова о некоррелированности случайного члена и регрессоров, поскольку в этом случае между$$ Х_{1}$$ и $$u$$ существует ненулевая корреляция. Оценки, полученные по методу наименьших квадратов для данной модели, уже не являются эффективными среди линейных оценок.
Они даже не являются несмещенными, поскольку для МНК-оценки коэффициента $$\beta _{1}$$ в этом случае получаем:
.
Наблюдается смещение, равное
Включение несущественной переменной в модель не приводит к смещению оценок коэффициентов, но появляется другой недостаток - растут стандартные ошибки коэффициентов. Оценки становятся статистически незначимыми.
Если точная спецификация модели неизвестна (что практически всегда и бывает), то пользуются критериями, позволяющими выбирать из некоторого множества моделей наилучшую модель.
Наиболее распространенными являются критерий Шварца и критерий Акайке. Они позволяют выбирать наилучшую модель из множества различных спецификаций и численно построены так, чтобы учесть влияние на качество подгонки модели двух противоположных тенденций.
При добавлении переменных в модель качество подгонки в общем случае увеличивается. Заметим, что число регрессоров должно быть разумным, чтобы не вызвать "искусственной подгонки" зависимой переменной. Вместе с тем недостаточное количество переменных, включаемых в модель, дает большую стандартную ошибку, что ведет к снижению качества подгонки.
Рассматриваемые критерии находят по формулам
где
![]() |
- | выборочная дисперсия остатков; |
| $$К$$ | - | число ограничений на степени свободы. |
Значение$$ К$$ в этом случае равно числу независимых переменных, включая свободный член. Таким образом, если в модели присутствует два регрессора и свободный член, то число ограничений на степени свободы будет равно трем.
Первое слагаемое представляет собой штраф за большую дисперсию, второе - штраф за использование дополнительных переменных. Критерии рассчитываются для каждой рассматриваемой спецификации. При сравнении двух типов моделей предпочтение отдается спецификации, которая имеет наименьшие значения критериев.
Рассмотрим пример использования информационных критериев при выборе наилучшей спецификации модели.
В качестве исходных данных возьмем временной ряд длиной 20 наблюдений. Будем подгонять этот ряд линейными регрессиями, в которых регрессоры являются полиномами различных степеней -$$ Х, Х_{2}, \dots , Х_{7}$$. Наша задача - выбрать оптимальную степень наибольшего полинома. Для сравнения моделей с различными степенями полиномов воспользуемся критериями Акайке и Шварца. Модель, показывающую наименьшие значения критериев, будем считать оптимальной.
Для регрессии $$Y = a_{0} + a_{1}X + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.16, а график наблюдаемых и предсказанных значений для $$n = 1$$ - на рис. 3.2.
Таблица 3.16
(рис 3.2)
Для регрессии $$Y = a_{0} + a_{1}X + а_{2}Х^{2} + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.17, а график наблюдаемых и предсказанных значений для $$n = 2$$ - на рис. 3.3.
Таблица 3.17
(рис 3.3)
Для регрессии $$Y = a_{0} + a_{1}X + а_{2}Х^{2} + а_{3}Х^{3} + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.18, а график наблюдаемых и предсказанных значений для $$n = 3$$ - на рис. 3.4.
Таблица 3.18
(рис 3.4)
Для регрессии $$Y = a_{0} + a_{1}X + а_{2}Х^{2} + а_{3}Х^{3} + а_{4}Х^{4} + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.19, а график наблюдаемых и предсказанных значений для $$n = 4$$ - на рис. 3.5.
Таблица 3.19
(рис 3.5)
Для регрессии $$Y = a_{0} + a_{1}X + а_{2}Х^{2} + а_{3}Х^{3} + а_{4}Х^{4} + а_{5}Х^{5} + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.20, а график наблюдаемых и предсказанных значений для $$n = 5$$ - на рис. 3.6.
Таблица 3.20
(рис 3.6)
Для регрессии $$Y = a_{0} + a_{1}X + а_{2}Х^{2} + а_{3}Х^{3} + а_{4}Х^{4} + а_{5}Х^{5} + а_{6}Х^{6} + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.21, а график наблюдаемых и предсказанных значений для $$n = 6$$ - на рис. 3.7.
Таблица 3.21
(рис 3.7)
Для регрессии $$Y = a_{0} + a_{1}X + а_{2}Х^{2} + а_{3}Х^{3} + а_{4}Х^{4} + а_{5}Х^{5} + а_{6}Х^{6} + а_{7}Х^{7} + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.22, а график наблюдаемых и предсказанных значений для $$n = 7$$ - на рис. 3.8.
Таблица 3.22
(рис 3.8)
Для регрессии $$Y = a_{0} + a_{1}X + а_{2}Х^{2} + а_{3}Х^{3} + а_{4}Х^{4} + а_{5}Х^{5} + а_{6}Х^{6} + а_{7}Х^{7} + + а_{8}Х^{8} + e$$ значения критериев и коэффициенты полинома представлены в табл. 3.23, а график наблюдаемых и предсказанных значений для $$n = 8$$ - на рис. 3.9.
Таблица 3.23. Наблюдаемые и предсказанные(polinom.sta)
(рис 3.9)
Сравнительный график предсказаний для моделей со степенями полиномов $$n = 7$$ и $$n = 8$$ представлен на рис. 3.10.
(рис 3.10)
Результаты показывают, что минимум значений критериев Акайке и Шварца наблюдается при самой высокой степени полинома, равной семи. Отсюда вывод: при подгонке исследуемого ряда целесообразно использовать спецификацию с наивысшей степенью полинома, равной семи.
Дополнительным доводом в пользу такого выбора спецификации может служить значение скорректированного $$R^{2}$$, которое является наибольшим из всех рассматриваемых.
Графический анализ качества подгонки полиномами неизвестной функции дает следующий результат: при повышении степени полинома с $$n = 1$$ до $$n = 7$$ улучшение объясняющих свойств модели можно наблюдать визуально. На изображенных графиках (см. рис. 3.2-3.10) предсказанные значения приближаются к реальным данным с увеличением степени полинома. При использовании полинома восьмой степени качество подгонки практически не улучшается. На приведенном сравнительном графике предсказаний для моделей со степенями полинома $$n = 7$$ и $$n = 8$$ (см. рис. 3.10) графики предсказанных значений сливаются, следовательно, использование полинома восьмой степени избыточно и практически не улучшает прогнозных свойств модели. Этот вывод подтверждается и ростом значения критерия Акайке.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.