В теории вероятностей понятие события является первичным и не определяется через другие более простые понятия. Для описания событий как результатов испытаний (опыта или наблюдения) с неопределенным исходом используется понятие случайности. Под испытанием (экспериментом) понимают любое наблюдение какого-либо явления, которое выполнено в заданном комплексе условий с фиксацией результата и может быть повторено в принципе достаточное число раз.
Испытание, исход которого не может быть определен однозначно до проведения эксперимента, принято называть случайным.
Наряду с событием $$A$$ в рассмотрение вводится противоположное событие $$A$$, которое заключается в том, что событие $$A$$ не происходит.
Событие, которое при случайном испытании происходит всегда, называется достоверным и обозначается $$\Omega$$.
Событие, которое никогда не происходит, т.е. является противоположным достоверному, называется невозможным и обозначается $$\AE$$.
События $$A$$ и $$B$$ называются несовместными, если появление одного из них исключает появление другого. Другими словами, такие события никогда не происходят одновременно.
Предполагается, что на рассматриваемом множестве событий могут быть определены:
Событие эксперимента (испытания) считается элементарным, если его нельзя представить с помощью определенных выше операций, через другие события.
Совокупность всех таких событий $$\{\omega _{1}, \omega _{2}, \dots , \omega _{n}\}$$ образует пространство элементарных исходов.При этом выполняются соотношения
Предполагается, что каждому исходу $$\omega _{i}$$, возможному в данном случайном испытании, может быть приписана некоторым образом неотрицательная числовая функция $$P\{\omega _{i}\} = p_{i} >= 0$$, такая что
.
Значения этой функции, выражающие меру возможности осуществления элементарного события $$\omega i$$, называются его вероятностью. При этом имеют место следующие свойства вероятности: $$0 <= P\{\omega _{i}\} <= 1, P\{\AE\} = 0, P\{\Omega \} = 1$$. В рамках такого подхода любое событие $$A$$, связанное с этим экспериментом, определяется как сумма элементарных исходов, а его вероятность как сумма вероятностей соответствующих элементарных исходов:
Для введенных таким образом понятий событий и их вероятностей справедливы следующие два утверждения, носящих названия теорем:
Если некоторое событие $$A$$ рассматривается не на всем пространстве элементарных исходов, а лишь на некоторой его части, где осуществляется другое событие $$B$$, то имеет смысл перейти к рассмотрению условной вероятности события $$A$$, которая определяется следующим образом:
Из этого определения непосредственно следует теорема умножения вероятностей:
$$P\{AB\} = P\{B\}P\{A|B\}.$$Полагают, что событие $$A$$ не зависит от события $$B$$, если $$P\{A|B\} = P\{A\}$$. Другими словами, события $$A$$ и $$B$$ считаются$$ независимыми$$, если появление одного из них не изменяет вероятности другого события. Для независимых событий теорема умножения вероятностей принимает вид
$$P\{AB\} = P\{A\}P\{B\}.$$Обычно последнее равенство в более общих случаях рассматривают в качестве определения независимости событий $$A$$ и $$B$$.
Независимость случайных событий является очень важным понятием для эконометрических моделей. Достаточно отметить, что многие свойства статистических оценок получаются именно в предположении независимости входящих в них случайных величин. А понятие условной вероятности используется при определении регрессионной модели.
Случайная величина определяется как однозначная действительная функция, заданная на пространстве элементарных событий. Множество значений случайной величины определяется структурой соответствующего пространства элементарных событий. Каждая случайная величина задает распределение вероятностей на множестве своих значений.
Законом распределения случайной величины называется всякое соотношение, устанавливающее связь между возможными значениями случайной величины и соответствующими вероятностями. Случайная величина $$X$$ считается заданной, если известен ее закон распределения. Наиболее общей формой закона распределения является функция распределения вероятностей случайной величины $$F(x)$$, определяемая равенством $$F(x) = P\{x < X\}$$.
Основные свойства функции распределения:
В зависимости от структуры множества значений в практических задачах обычно различают два вида случайных величин: дискретные и непрерывные.
Дискретной называется случайная величина, множество значений которой конечное или счетное. В качестве закона распределения дискретной случайной величины $$X$$ удобно использовать ряд распределения, представляющий собой таблицу вида
где $$P\{X = x_{i}\} = p_{i}, i = 1, \dots , n$$, при этом
Функция распределения дискретной случайной величины будет иметь разрывы первого рода (скачки) в точках, соответствующих значениям случайной величины.
Непрерывной называется случайная величина, имеющая непрерывную и дифференцируемую функцию распределения $$F(x)$$. В качестве закона распределения непрерывной случайной величины обычно используется функция плотности распределения вероятностей, определяемая равенством
Основные свойства функции плотности распределения:


Функции распределения $$F(x)$$ и плотность связаны соотношением
Понятие случайной величины может быть обобщено на случай системы случайных величин: $$X = (X_{1}, X_{2}, \dots , X_{n})^{T}$$, где $$X$$ - n-мерный случайный вектор, $$X_{i}, i = 1, \dots , n$$ — случайные величины, определенные на одном пространстве элементарных событий. Функция распределения n-мерной случайной величины $$X$$ задается равенством
$$F(x_{1}, x_{2}, \dots , x_{n}) = P(X_{1} < x_{1}, X_{2} < x_{2}, \dots , X_{n} < x_{n}).$$Случайный вектор $$X$$ называется непрерывным, если $$F(x_{1}, x_{2}, \dots , x_{n})$$ имеет смешанную частную производную $$n$$-го порядка
которая называется плотностью распределения случайного вектора $$X$$ или совместной плотностью распределения случайных величин $$X_{1}, X_{2}, \dots , X_{n}$$. Свойства совместной плотности вероятности аналогичны свойствам плотности вероятности одномерной случайной величины.
Если рассмотрению подлежит только часть компонент вектора $$(X_{1}, X_{2}, \dots , X_{k})^{T}$$, где $$k < n$$, то используется частная (маргинальная) функция распределения
$$Fk(x_{1}, x_{2}, \dots , x_{k}) = P(X_{1} < x_{1}, \dots , X_{k} < x_{k}) =\\ = P(X_{1} < x_{1}, \dots , X_{k} < x_{k}, X_{k} + 1 < \infty , \dots , Xn <\infty ) = F(x_{1}, x_{2}, \dots , x_{k}, \infty , \infty )$$и, соответственно, частная (маргинальная) плотность распределения
где интегрирование производится по всему множеству возможных значений переменных $$x_{k+1}, x_{k+2}, \dots , x_{n}$$.
Плотность распределения многомерной случайной величины X, определенная при условии, что значения компонент x_{k+1}, x_{k+2}, \dots , x_{n} зафиксированы на уровнях соответственно
определяется формулой
и называется плотностью условного распределения случайной величины X.
Случайные величины X_{1}, X_{2}, \dots , X_{n} называются (стохастически) независимыми, если функция совместного распределения этих величин $$F(x_{1}, x_{2}, \dots , x_{n})$$ представима в виде произведения функций распределения случайных величин
$$F(x_{1}, x_{2}, \dots , x_{n}) = F(x_{1})F(x_{2})\dots F(x_{n}),$$или, в случае непрерывных случайных величин, аналогичным образом может быть представлена совместная плотность
$$f(x_{1}, x_{2}, \dots , x_{n}) = f(x_{1})f(x_{2})\dots f(x_{n}).$$Описание случайной величины с помощью функции распределения $$F(x)$$ является исчерпывающим, но для практических задач излишне подробным и не всегда удобным. Часто в приложениях бывает достаточно характеризовать свойства случайной величины посредством некоторого числа, т.е. перейти к числовым характеристикам.
Математическим ожиданием (средним значением) дискретной случайной величины $$X$$ называется величина
Для непрерывной случайной величины, заданной плотностью распределения, математическое ожидание вычисляется как
Основные свойства математического ожидания:
Математическое ожидание характеризует центр группирования значений случайной величины. Характеристикой рассеяния случайной величины относительно центра распределения служит дисперсия, определяемая как математическое ожидание квадрата отклонения случайной величины: $$D(X) = M(x – M(X))^{2}$$, или после преобразований $$D(X) = M(X^{2}) – M(X)^{2}$$. Для вычисления дисперсии в случае дискретной величины можно использовать, например, формулу
а в случае непрерывной случайной величины —
Основные свойства дисперсии:
Среднеквадратическое (стандартное) отклонение определяется как квадратный корень из дисперсии:
Мерой взаимосвязи двух случайных величин $$X$$ и $$Y$$ может служить коэффициент ковариации, численно равный величине
$$cov(X, Y) = \sigma XY = M[(X - M(X))(Y - M(Y))],$$или аналогично вычислению дисперсии,
$$cov(X, Y) = \sigma XY = M(XY) - M(X)M(Y).$$Основным свойством коэффициента ковариации является его равенство нулю в случае независимости случайных величин $$X$$ и $$Y$$. (При этом обратное утверждение, вообще говоря, неверно!) Однако зависимость величины $$\sigma XY$$ от масштаба измерения величин $$X$$ и $$Y$$ делает неудобным его использование в практических приложениях. Поэтому в качестве меры связи признаков обычно используют другую числовую характеристику $$\rho XY$$, называемую коэффициентом корреляции
Следующие свойства коэффициента корреляции являются наиболее существенными:
В случае многомерных случайных величин в рассмотрение вводятся соответствующие аналоги. Так, если $$X = (X_{1}, X_{2}, \dots , X_{k})^{T}$$, то вектором средних значений называют вектор $$M(X) = (M(X_{1}), M(X_{2}), \dots , M(X_{n}))^{T}$$, который является характеристикой центра группирования. В качестве меры рассеяния компонент и их взаимосвязи используют матрицу ковариаций
элементы которой определяются равенством $$\sigma _{ij} = cov(X_{i}, X_{j}), (i, j = 1, \dots , n)$$. Определитель этой матрицы $$det \sum$$ называется обобщенной дисперсией. По причине, указанной выше, в практических приложениях предпочитают использовать матрицу, составленную из коэффициентов корреляции, $$R = (\rho _{i}_{j})$$, — корреляционную матрицу. Аналогичным образом определяется взаимосвязь многомерных случайных величин $$X$$ и $$Y$$.
Нормальное распределение. Это распределение полностью определяется математическим ожиданием m и средним квадратичным отклонением $$s$$. Плотность нормального распределения записывается в виде
где $$\pi \approx 3,1415926, exp \approx 2,71828$$.
Кривая плотности нормального распределения имеет форму симметричного колокола (рис. 1); в данном случае $$\mu = 1$$ и $$\sigma = 0,8$$.
(рис 1)
Логнормальное распределение. Переменная называется логнормально распределенной, если ее логарифм нормально распределен. Такая ситуация возникает, когда рассматривают распределение произведения большого числа случайных, одинаково распределенных независимых величин. Обозначим за m математическое ожидание и за $$s$$ среднее квадратическое отклонение логарифма логнормального распределения. Тогда математическое ожидание и дисперсия самого логнормального распределения вычисляются по формулам
Из определения вытекает, что для плотности логнормального распределения справедливо соотношение
На рисунке 2 отражены кривые плотности и интегральной функции логнормального распределения при $$\mu = 1 и \sigma = 0,8$$.
(рис 2)
Распределение c 2-квадрат. Пусть $$X_{i} \grave I N(0, 1) (i = 1, \dots , n)$$ - нормальные независимые случайные величины с нулевым математическим ожиданием и единичной дисперсией. Тогда сумма квадратов этих величин
имеет распределение $$x^{2}$$ с $$n$$ степенями свободы. Плотность $$x^{2}$$-распределения выражается формулой
где
— гамма-функция, в частности$$ Г(n + 1) = n!$$.
На рисунке 3 изображены кривые плотности и интегральной функции $$x^{2}$$ распределения при $$n = 10$$.
(рис 3)
распределена по закону Стьюдента ($$t$$-распределение) с $$k$$ степенями свободы. На рисунке 4 представлены графики кривых плотности и интегральной функции $$t$$-распределения при $$k = 5$$.
(рис 4)
$$Распределение Фишера$$. Если $$U$$ и $$V$$ независимые c 2-распределенные случайные величины со степенями свободы $$n_{1}$$ и $$n_{2}$$, то величина
является распределением Фишера со степенями свободы $$n_{1}$$ и $$n_{2}$$.
На рисунке 5 представлены кривая плотности и интегральная кривая $$F$$-распределения при $$n_{1} = 5$$ и $$n_{2} = 5$$.
(рис 5)
В математической статистике исследуемую случайную величину, в общем случае - многомерную, принято называть генеральной совокупностью, а ее реализации в последовательности независимых испытаний - выборкой из генеральной совокупности, или коротко - выборкой. Сами значения случайной величины принято называть элементами выборки, а их количество - объемом выборки. Основной задачей статистического исследования является описание генеральной совокупности по имеющейся выборке. Как правило, эта задача сводится к нахождению закона распределения случайной величины $$X$$ или определению ее числовых характеристик.
Статистикой называется любая функция элементов выборки $$X_{1}, X_{2}, \dots , X_{n}$$. Если рассматривать элементы выборки как независимые одинаково распределенные случайные величины, то и статистику следует рассматривать как случайную величину, имеющую свой закон распределения.
Любые характеристики случайной величины, полученные по выборке, называются выборочными, или эмпирическими. Статистической оценкой называется выборочная характеристика, используемая в качестве приближенного значения неизвестной характеристики генеральной совокупности. Так, статистической оценкой плотности распределения непрерывной случайной величины является гистограмма.
Статистическая оценка, представленная в виде числа - точки на числовой прямой, называется точечной. Пригодность использования в приложениях точечной оценки зависит от наличия у нее таких свойств, как несмещенность, состоятельность и эффективность.
Пусть $$X_{1}, X_{2}, \dots , X_{n}$$ - случайная выборка и
— выборочная оценка некоторого параметра $$\theta$$. Оценка $$\theta_{n}^*$$ называется несмещенной, если для любого фиксированного $$n$$ выполняется равенство $$M = (\theta n^*) = \theta$$. Это равенство гарантирует, что использование этой оценки не приводит к систематическим ошибкам.
Оценка $$\theta_{n}^*$$ называется для любого $$\varepsilon > 0$$. Выполнение этого условия означает, что с увеличением объема выборки возрастает наша уверенность в малом по абсолютной величине отклонении оценки $$\theta n^*$$ от истинного значения параметра $$\theta$$.
Оценка $$\theta_{n}^*$$ считается эффективной, если она обладает наименьшей дисперсией по сравнению с любыми другими оценками. Эффективная оценка является наилучшей в смысле минимума среднеквадратичного отклонения оценки $$qn^*$$ от истинного значения параметра $$\theta$$.
В качестве оценки математического ожидания принято использовать среднее выборочное
Эта оценка является несмещенной, состоятельной, а в случае нормального распределения генеральной совокупности - эффективной.
Несмещенной, состоятельной оценкой дисперсии является выборочная (исправленная) дисперсия
Выборочная ковариация определяется формулой
где $$X$$ и $$Y$$ — выборочные средние величин $$X$$ и $$Y$$ соответственно;
величина $$sXY$$ - выборочная оценка коэффициента ковариации $$\sigma XY$$.
Оценкой коэффициента корреляции является выборочный коэффициент корреляции
который с заданной вероятностью $$\gamma (\gamma \approx 1)$$ накрывает неизвестное значение $$\theta$$. При этом сам интервал
называется доверительным, а вероятность $$\gamma$$ — доверительной,или уровнем надежности. Величина $$\alpha = 1 - \gamma$$ представляет собой уровень значимости.
Для построения интервальной оценки параметра $$q$$ необходимо знать закон распределения статистики $$\theta_{n}^*$$ и задать уровень надежности $$\gamma$$. Границы доверительного интервала определяются условием
Доверительный интервал для математического ожидания нормально распределенной случайной величины $$X$$, построенный по выборке $$X_{1}, X_{2}, \dots , X_{n}$$ на уровне надежности $$\gamma$$, имеет вид
где
— двусторонняя $$\gamma$$-квантиль распределения Стьюдента с $$(n – 1)$$-й степенью свободы;
— среднеквадратичное отклонение выборочной средней.
Доверительный интервал для дисперсии нормально распределенной случайной величины $$X$$ с заданным уровнем надежности $$\gamma$$определяется следующим образом:
где
— квантили уровней
распределения
, т.е. величины, удовлетворяющие соотношениям
Статистической гипотезой принято считать любое предположение о законе распределения случайной величины генеральной совокупности или о значениях параметров закона распределения. Высказанное предположение, которое подлежит проверке, обозначается $$H_{0}$$ и называется основной, или нулевой, гипотезой. Наряду с основной гипотезой в рассмотрение вводится и противоречащая ей гипотеза $$H_{1}$$, которая называется конкурирующей, или альтернативной. Цель проверки статистической гипотезы заключается в том, чтобы установить, не противоречит ли высказанная гипотеза $$H_{0}$$ имеющимся выборочным данным $$X_{1}, X_{2}, \dots , X_{n}$$.
Для проверки нулевой гипотезы формируется статистический критерий - специальная статистика K = K(X_{1}, X_{2}, \dots , X_{n}), распределение которой в условиях $$H0$$ известно. По известному распределению статистического критерия определяется множество значений, которые величина $$K$$ принимает с вероятностью $$\gamma$$, близкой к единице, т.е. практически достоверно. Это множество называется областью принятия нулевой гипотезы. Дополнение этого множества образует критическую область, или область отвержения $$H_{0}$$.
Проверка нулевой гипотезы осуществляется следующим образом. По выборочным данным вычисляется значение критерия $$K_{расч} = K(X_{1}, X_{2}, \dots , X_{n})$$. Если значение Kрасч принадлежит критической области, то проверяемая гипотеза отвергается как противоречащая выборочным данным и принимается альтернативная гипотеза $$H_{1}$$. Если же $$K_{расч}$$ принадлежит области принятия нулевой гипотезы, то принимается гипотеза $$H_{0}$$ как не противоречащая имеющимся данным. В этом случае говорят, что нулевая гипотеза принимается на уровне значимости $$\alpha = 1 - \gamma$$.
Уровень значимости $$\alpha$$ характеризует вероятность совершить ошибку первого рода, заключающуюся в напрасном отвержении имеющей место нулевой гипотезы - $$P\{H_{0}|H_{1}\} = \alpha$$. Ошибкой второго роданазывается ошибка принятия ложной гипотезы $$H_{0}$$.
В компьютерных системах, в частности в STATISTICA, для выборочного значения критерия $$K_{расч} = K(X_{1}, X_{2}, \dots , X_{n})$$ определяется уровень значимости нулевой гипотезы $$p-level$$ (или $$p-value$$ - $$p$$-значение), величина которого определяется условием $$P\{K > K_{расч}|H_{0}\} = p$$. Это значение характеризует вероятность ошибки, связанной с распространением утверждения нулевой гипотезы на всю генеральную совокупность. Чем меньше $$p$$-значение, тем увереннее происходит отвержение основной гипотезы. В практических задачах в качестве стандартного уровня принят 5%-ный уровень значимости.
В заключение укажем на принцип двойственности теории построения доверительных интервалов и проверки гипотез о значениях параметров распределения. Нетрудно убедиться в том, что при выбранном уровне надежности g доверительный интервал для некоторого параметра \theta составляют те значения параметра, которые совместимы с гипотезой $$H_{0} :\theta = \theta_{n}$$ при уровне значимости $$\alpha = 1 - \gamma$$.
Элементы теории вероятностей и математической статистики: основные понятия и факты
Изучение систематических курсов теории вероятностей и математической статистики является обязательным условием успешного освоения эконометрики. Справочный материал этого Приложения призван напомнить читателю основные понятия и терминологию этих предметов. Материал не претендует на полноту и математическую строгость изложения и никоим образом не подменяет основных учебников в этой области.
В теории вероятностей понятие события является первичным и не определяется через другие более простые понятия. Для описания событий как результатов испытаний (опыта или наблюдения) с неопределенным исходом используется понятие случайности. Под испытанием (экспериментом) понимают любое наблюдение какого-либо явления, которое выполнено в заданном комплексе условий с фиксацией результата и может быть повторено в принципе достаточное число раз.
Испытание, исход которого не может быть определен однозначно до проведения эксперимента, принято называть случайным.
Наряду с событием $$A$$ в рассмотрение вводится противоположное событие $$A$$, которое заключается в том, что событие $$A$$ не происходит.
Событие, которое при случайном испытании происходит всегда, называется достоверным и обозначается $$\Omega$$.
Событие, которое никогда не происходит, т.е. является противоположным достоверному, называется невозможным и обозначается $$\AE$$.
События $$A$$ и $$B$$ называются несовместными, если появление одного из них исключает появление другого. Другими словами, такие события никогда не происходят одновременно.
Предполагается, что на рассматриваемом множестве событий могут быть определены:
Событие эксперимента (испытания) считается элементарным, если его нельзя представить с помощью определенных выше операций, через другие события.
Совокупность всех таких событий $$\{\omega _{1}, \omega _{2}, \dots , \omega _{n}\}$$ образует пространство элементарных исходов.При этом выполняются соотношения
Предполагается, что каждому исходу $$\omega _{i}$$, возможному в данном случайном испытании, может быть приписана некоторым образом неотрицательная числовая функция $$P\{\omega _{i}\} = p_{i} >= 0$$, такая что
.
Значения этой функции, выражающие меру возможности осуществления элементарного события $$\omega i$$, называются его вероятностью. При этом имеют место следующие свойства вероятности: $$0 <= P\{\omega _{i}\} <= 1, P\{\AE\} = 0, P\{\Omega \} = 1$$. В рамках такого подхода любое событие $$A$$, связанное с этим экспериментом, определяется как сумма элементарных исходов, а его вероятность как сумма вероятностей соответствующих элементарных исходов:
Для введенных таким образом понятий событий и их вероятностей справедливы следующие два утверждения, носящих названия теорем:
Если некоторое событие $$A$$ рассматривается не на всем пространстве элементарных исходов, а лишь на некоторой его части, где осуществляется другое событие $$B$$, то имеет смысл перейти к рассмотрению условной вероятности события $$A$$, которая определяется следующим образом:
Из этого определения непосредственно следует теорема умножения вероятностей:
$$P\{AB\} = P\{B\}P\{A|B\}.$$Полагают, что событие $$A$$ не зависит от события $$B$$, если $$P\{A|B\} = P\{A\}$$. Другими словами, события $$A$$ и $$B$$ считаются$$ независимыми$$, если появление одного из них не изменяет вероятности другого события. Для независимых событий теорема умножения вероятностей принимает вид
$$P\{AB\} = P\{A\}P\{B\}.$$Обычно последнее равенство в более общих случаях рассматривают в качестве определения независимости событий $$A$$ и $$B$$.
Независимость случайных событий является очень важным понятием для эконометрических моделей. Достаточно отметить, что многие свойства статистических оценок получаются именно в предположении независимости входящих в них случайных величин. А понятие условной вероятности используется при определении регрессионной модели.
Случайная величина определяется как однозначная действительная функция, заданная на пространстве элементарных событий. Множество значений случайной величины определяется структурой соответствующего пространства элементарных событий. Каждая случайная величина задает распределение вероятностей на множестве своих значений.
Законом распределения случайной величины называется всякое соотношение, устанавливающее связь между возможными значениями случайной величины и соответствующими вероятностями. Случайная величина $$X$$ считается заданной, если известен ее закон распределения. Наиболее общей формой закона распределения является функция распределения вероятностей случайной величины $$F(x)$$, определяемая равенством $$F(x) = P\{x < X\}$$.
Основные свойства функции распределения:
В зависимости от структуры множества значений в практических задачах обычно различают два вида случайных величин: дискретные и непрерывные.
Дискретной называется случайная величина, множество значений которой конечное или счетное. В качестве закона распределения дискретной случайной величины $$X$$ удобно использовать ряд распределения, представляющий собой таблицу вида
где $$P\{X = x_{i}\} = p_{i}, i = 1, \dots , n$$, при этом
Функция распределения дискретной случайной величины будет иметь разрывы первого рода (скачки) в точках, соответствующих значениям случайной величины.
Непрерывной называется случайная величина, имеющая непрерывную и дифференцируемую функцию распределения $$F(x)$$. В качестве закона распределения непрерывной случайной величины обычно используется функция плотности распределения вероятностей, определяемая равенством
Основные свойства функции плотности распределения:


Функции распределения $$F(x)$$ и плотность связаны соотношением
Понятие случайной величины может быть обобщено на случай системы случайных величин: $$X = (X_{1}, X_{2}, \dots , X_{n})^{T}$$, где $$X$$ - n-мерный случайный вектор, $$X_{i}, i = 1, \dots , n$$ — случайные величины, определенные на одном пространстве элементарных событий. Функция распределения n-мерной случайной величины $$X$$ задается равенством
$$F(x_{1}, x_{2}, \dots , x_{n}) = P(X_{1} < x_{1}, X_{2} < x_{2}, \dots , X_{n} < x_{n}).$$Случайный вектор $$X$$ называется непрерывным, если $$F(x_{1}, x_{2}, \dots , x_{n})$$ имеет смешанную частную производную $$n$$-го порядка
которая называется плотностью распределения случайного вектора $$X$$ или совместной плотностью распределения случайных величин $$X_{1}, X_{2}, \dots , X_{n}$$. Свойства совместной плотности вероятности аналогичны свойствам плотности вероятности одномерной случайной величины.
Если рассмотрению подлежит только часть компонент вектора $$(X_{1}, X_{2}, \dots , X_{k})^{T}$$, где $$k < n$$, то используется частная (маргинальная) функция распределения
$$Fk(x_{1}, x_{2}, \dots , x_{k}) = P(X_{1} < x_{1}, \dots , X_{k} < x_{k}) =\\ = P(X_{1} < x_{1}, \dots , X_{k} < x_{k}, X_{k} + 1 < \infty , \dots , Xn <\infty ) = F(x_{1}, x_{2}, \dots , x_{k}, \infty , \infty )$$и, соответственно, частная (маргинальная) плотность распределения
где интегрирование производится по всему множеству возможных значений переменных $$x_{k+1}, x_{k+2}, \dots , x_{n}$$.
Плотность распределения многомерной случайной величины X, определенная при условии, что значения компонент x_{k+1}, x_{k+2}, \dots , x_{n} зафиксированы на уровнях соответственно
определяется формулой
и называется плотностью условного распределения случайной величины X.
Случайные величины X_{1}, X_{2}, \dots , X_{n} называются (стохастически) независимыми, если функция совместного распределения этих величин $$F(x_{1}, x_{2}, \dots , x_{n})$$ представима в виде произведения функций распределения случайных величин
$$F(x_{1}, x_{2}, \dots , x_{n}) = F(x_{1})F(x_{2})\dots F(x_{n}),$$или, в случае непрерывных случайных величин, аналогичным образом может быть представлена совместная плотность
$$f(x_{1}, x_{2}, \dots , x_{n}) = f(x_{1})f(x_{2})\dots f(x_{n}).$$Описание случайной величины с помощью функции распределения $$F(x)$$ является исчерпывающим, но для практических задач излишне подробным и не всегда удобным. Часто в приложениях бывает достаточно характеризовать свойства случайной величины посредством некоторого числа, т.е. перейти к числовым характеристикам.
Математическим ожиданием (средним значением) дискретной случайной величины $$X$$ называется величина
Для непрерывной случайной величины, заданной плотностью распределения, математическое ожидание вычисляется как
Основные свойства математического ожидания:
Математическое ожидание характеризует центр группирования значений случайной величины. Характеристикой рассеяния случайной величины относительно центра распределения служит дисперсия, определяемая как математическое ожидание квадрата отклонения случайной величины: $$D(X) = M(x – M(X))^{2}$$, или после преобразований $$D(X) = M(X^{2}) – M(X)^{2}$$. Для вычисления дисперсии в случае дискретной величины можно использовать, например, формулу
а в случае непрерывной случайной величины —
Основные свойства дисперсии:
Среднеквадратическое (стандартное) отклонение определяется как квадратный корень из дисперсии:
Мерой взаимосвязи двух случайных величин $$X$$ и $$Y$$ может служить коэффициент ковариации, численно равный величине
$$cov(X, Y) = \sigma XY = M[(X - M(X))(Y - M(Y))],$$или аналогично вычислению дисперсии,
$$cov(X, Y) = \sigma XY = M(XY) - M(X)M(Y).$$Основным свойством коэффициента ковариации является его равенство нулю в случае независимости случайных величин $$X$$ и $$Y$$. (При этом обратное утверждение, вообще говоря, неверно!) Однако зависимость величины $$\sigma XY$$ от масштаба измерения величин $$X$$ и $$Y$$ делает неудобным его использование в практических приложениях. Поэтому в качестве меры связи признаков обычно используют другую числовую характеристику $$\rho XY$$, называемую коэффициентом корреляции
Следующие свойства коэффициента корреляции являются наиболее существенными:
В случае многомерных случайных величин в рассмотрение вводятся соответствующие аналоги. Так, если $$X = (X_{1}, X_{2}, \dots , X_{k})^{T}$$, то вектором средних значений называют вектор $$M(X) = (M(X_{1}), M(X_{2}), \dots , M(X_{n}))^{T}$$, который является характеристикой центра группирования. В качестве меры рассеяния компонент и их взаимосвязи используют матрицу ковариаций
элементы которой определяются равенством $$\sigma _{ij} = cov(X_{i}, X_{j}), (i, j = 1, \dots , n)$$. Определитель этой матрицы $$det \sum$$ называется обобщенной дисперсией. По причине, указанной выше, в практических приложениях предпочитают использовать матрицу, составленную из коэффициентов корреляции, $$R = (\rho _{i}_{j})$$, — корреляционную матрицу. Аналогичным образом определяется взаимосвязь многомерных случайных величин $$X$$ и $$Y$$.
Нормальное распределение. Это распределение полностью определяется математическим ожиданием m и средним квадратичным отклонением $$s$$. Плотность нормального распределения записывается в виде
где $$\pi \approx 3,1415926, exp \approx 2,71828$$.
Кривая плотности нормального распределения имеет форму симметричного колокола (рис. 1); в данном случае $$\mu = 1$$ и $$\sigma = 0,8$$.
(рис 1)
Логнормальное распределение. Переменная называется логнормально распределенной, если ее логарифм нормально распределен. Такая ситуация возникает, когда рассматривают распределение произведения большого числа случайных, одинаково распределенных независимых величин. Обозначим за m математическое ожидание и за $$s$$ среднее квадратическое отклонение логарифма логнормального распределения. Тогда математическое ожидание и дисперсия самого логнормального распределения вычисляются по формулам
Из определения вытекает, что для плотности логнормального распределения справедливо соотношение
На рисунке 2 отражены кривые плотности и интегральной функции логнормального распределения при $$\mu = 1 и \sigma = 0,8$$.
(рис 2)
Распределение c 2-квадрат. Пусть $$X_{i} \grave I N(0, 1) (i = 1, \dots , n)$$ - нормальные независимые случайные величины с нулевым математическим ожиданием и единичной дисперсией. Тогда сумма квадратов этих величин
имеет распределение $$x^{2}$$ с $$n$$ степенями свободы. Плотность $$x^{2}$$-распределения выражается формулой
где
— гамма-функция, в частности$$ Г(n + 1) = n!$$.
На рисунке 3 изображены кривые плотности и интегральной функции $$x^{2}$$ распределения при $$n = 10$$.
(рис 3)
распределена по закону Стьюдента ($$t$$-распределение) с $$k$$ степенями свободы. На рисунке 4 представлены графики кривых плотности и интегральной функции $$t$$-распределения при $$k = 5$$.
(рис 4)
$$Распределение Фишера$$. Если $$U$$ и $$V$$ независимые c 2-распределенные случайные величины со степенями свободы $$n_{1}$$ и $$n_{2}$$, то величина
является распределением Фишера со степенями свободы $$n_{1}$$ и $$n_{2}$$.
На рисунке 5 представлены кривая плотности и интегральная кривая $$F$$-распределения при $$n_{1} = 5$$ и $$n_{2} = 5$$.
(рис 5)
В математической статистике исследуемую случайную величину, в общем случае - многомерную, принято называть генеральной совокупностью, а ее реализации в последовательности независимых испытаний - выборкой из генеральной совокупности, или коротко - выборкой. Сами значения случайной величины принято называть элементами выборки, а их количество - объемом выборки. Основной задачей статистического исследования является описание генеральной совокупности по имеющейся выборке. Как правило, эта задача сводится к нахождению закона распределения случайной величины $$X$$ или определению ее числовых характеристик.
Статистикой называется любая функция элементов выборки $$X_{1}, X_{2}, \dots , X_{n}$$. Если рассматривать элементы выборки как независимые одинаково распределенные случайные величины, то и статистику следует рассматривать как случайную величину, имеющую свой закон распределения.
Любые характеристики случайной величины, полученные по выборке, называются выборочными, или эмпирическими. Статистической оценкой называется выборочная характеристика, используемая в качестве приближенного значения неизвестной характеристики генеральной совокупности. Так, статистической оценкой плотности распределения непрерывной случайной величины является гистограмма.
Статистическая оценка, представленная в виде числа - точки на числовой прямой, называется точечной. Пригодность использования в приложениях точечной оценки зависит от наличия у нее таких свойств, как несмещенность, состоятельность и эффективность.
Пусть $$X_{1}, X_{2}, \dots , X_{n}$$ - случайная выборка и
— выборочная оценка некоторого параметра $$\theta$$. Оценка $$\theta_{n}^*$$ называется несмещенной, если для любого фиксированного $$n$$ выполняется равенство $$M = (\theta n^*) = \theta$$. Это равенство гарантирует, что использование этой оценки не приводит к систематическим ошибкам.
Оценка $$\theta_{n}^*$$ называется для любого $$\varepsilon > 0$$. Выполнение этого условия означает, что с увеличением объема выборки возрастает наша уверенность в малом по абсолютной величине отклонении оценки $$\theta n^*$$ от истинного значения параметра $$\theta$$.
Оценка $$\theta_{n}^*$$ считается эффективной, если она обладает наименьшей дисперсией по сравнению с любыми другими оценками. Эффективная оценка является наилучшей в смысле минимума среднеквадратичного отклонения оценки $$qn^*$$ от истинного значения параметра $$\theta$$.
В качестве оценки математического ожидания принято использовать среднее выборочное
Эта оценка является несмещенной, состоятельной, а в случае нормального распределения генеральной совокупности - эффективной.
Несмещенной, состоятельной оценкой дисперсии является выборочная (исправленная) дисперсия
Выборочная ковариация определяется формулой
где $$X$$ и $$Y$$ — выборочные средние величин $$X$$ и $$Y$$ соответственно;
величина $$sXY$$ - выборочная оценка коэффициента ковариации $$\sigma XY$$.
Оценкой коэффициента корреляции является выборочный коэффициент корреляции
который с заданной вероятностью $$\gamma (\gamma \approx 1)$$ накрывает неизвестное значение $$\theta$$. При этом сам интервал
называется доверительным, а вероятность $$\gamma$$ — доверительной,или уровнем надежности. Величина $$\alpha = 1 - \gamma$$ представляет собой уровень значимости.
Для построения интервальной оценки параметра $$q$$ необходимо знать закон распределения статистики $$\theta_{n}^*$$ и задать уровень надежности $$\gamma$$. Границы доверительного интервала определяются условием
Доверительный интервал для математического ожидания нормально распределенной случайной величины $$X$$, построенный по выборке $$X_{1}, X_{2}, \dots , X_{n}$$ на уровне надежности $$\gamma$$, имеет вид
где
— двусторонняя $$\gamma$$-квантиль распределения Стьюдента с $$(n – 1)$$-й степенью свободы;
— среднеквадратичное отклонение выборочной средней.
Доверительный интервал для дисперсии нормально распределенной случайной величины $$X$$ с заданным уровнем надежности $$\gamma$$определяется следующим образом:
где
— квантили уровней
распределения
, т.е. величины, удовлетворяющие соотношениям
Статистической гипотезой принято считать любое предположение о законе распределения случайной величины генеральной совокупности или о значениях параметров закона распределения. Высказанное предположение, которое подлежит проверке, обозначается $$H_{0}$$ и называется основной, или нулевой, гипотезой. Наряду с основной гипотезой в рассмотрение вводится и противоречащая ей гипотеза $$H_{1}$$, которая называется конкурирующей, или альтернативной. Цель проверки статистической гипотезы заключается в том, чтобы установить, не противоречит ли высказанная гипотеза $$H_{0}$$ имеющимся выборочным данным $$X_{1}, X_{2}, \dots , X_{n}$$.
Для проверки нулевой гипотезы формируется статистический критерий - специальная статистика K = K(X_{1}, X_{2}, \dots , X_{n}), распределение которой в условиях $$H0$$ известно. По известному распределению статистического критерия определяется множество значений, которые величина $$K$$ принимает с вероятностью $$\gamma$$, близкой к единице, т.е. практически достоверно. Это множество называется областью принятия нулевой гипотезы. Дополнение этого множества образует критическую область, или область отвержения $$H_{0}$$.
Проверка нулевой гипотезы осуществляется следующим образом. По выборочным данным вычисляется значение критерия $$K_{расч} = K(X_{1}, X_{2}, \dots , X_{n})$$. Если значение Kрасч принадлежит критической области, то проверяемая гипотеза отвергается как противоречащая выборочным данным и принимается альтернативная гипотеза $$H_{1}$$. Если же $$K_{расч}$$ принадлежит области принятия нулевой гипотезы, то принимается гипотеза $$H_{0}$$ как не противоречащая имеющимся данным. В этом случае говорят, что нулевая гипотеза принимается на уровне значимости $$\alpha = 1 - \gamma$$.
Уровень значимости $$\alpha$$ характеризует вероятность совершить ошибку первого рода, заключающуюся в напрасном отвержении имеющей место нулевой гипотезы - $$P\{H_{0}|H_{1}\} = \alpha$$. Ошибкой второго роданазывается ошибка принятия ложной гипотезы $$H_{0}$$.
В компьютерных системах, в частности в STATISTICA, для выборочного значения критерия $$K_{расч} = K(X_{1}, X_{2}, \dots , X_{n})$$ определяется уровень значимости нулевой гипотезы $$p-level$$ (или $$p-value$$ - $$p$$-значение), величина которого определяется условием $$P\{K > K_{расч}|H_{0}\} = p$$. Это значение характеризует вероятность ошибки, связанной с распространением утверждения нулевой гипотезы на всю генеральную совокупность. Чем меньше $$p$$-значение, тем увереннее происходит отвержение основной гипотезы. В практических задачах в качестве стандартного уровня принят 5%-ный уровень значимости.
В заключение укажем на принцип двойственности теории построения доверительных интервалов и проверки гипотез о значениях параметров распределения. Нетрудно убедиться в том, что при выбранном уровне надежности g доверительный интервал для некоторого параметра \theta составляют те значения параметра, которые совместимы с гипотезой $$H_{0} :\theta = \theta_{n}$$ при уровне значимости $$\alpha = 1 - \gamma$$.
Элементы теории вероятностей и математической статистики: основные понятия и факты
Изучение систематических курсов теории вероятностей и математической статистики является обязательным условием успешного освоения эконометрики. Справочный материал этого Приложения призван напомнить читателю основные понятия и терминологию этих предметов. Материал не претендует на полноту и математическую строгость изложения и никоим образом не подменяет основных учебников в этой области.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.