Введение в математику

Элементы теории вероятностей и математической статистики

Разбить на страницы
Показывать лекцию целиком

Элементы теории вероятностей и математической статистики

Пусть задан некоторый статистический ряд из элементов x1, x2,..., xn. Если эти элементы могут принимать все мыслимые допустимые значения, а объект с этими характеристиками рассматривается как единый (как система), то такую совокупность называют генеральной совокупностью ; часто при этом предполагается (как и нами везде ниже), что она является конечной и упорядоченной по возрастанию: $$x_1<x_2<\dotsc <x_n$$.

Любое непустое подмножество генеральной совокупности называется выборкой . Если выборка осуществлена случайным образом, то она называется случайной выборкой. Далее мы часто под выборкой будем понимать ранжированную, упорядоченную выборку.

Средняя величина генеральной совокупности в целом называется общей средней . Она отражает общие черты всей совокупности. Средняя величина для отдельной выборки называется средней по выборке или выборочной средней . Она отражает общие черты группы.

Основная цель статистических расчетов, как правило, состоит в том, чтобы по характеристикам выборки получить достоверную информацию о свойствах исходных генеральных совокупностей.

Пример. Повышение среднемесячной зарплаты, например, от 1200 руб. до 1500 руб. отражает лишь общую тенденцию динамики зарплаты (ее рост) по всем категориям трудящихся. В различных группах средние величины по группе могут сильно различаться, а в некоторых группах и не возрастать. Сравнительный анализ групповых и общих средних может дать информацию для характеристики социально-экономических слоев населения, о наличии и степени расслоения общества, о наличии и силе связей между групповым (факторным) признаком и результативным показателем.

Существуют различные меры средних величин.

Чаще используется средняя арифметическая характеристика:$$\bar x = \frac {\sum\limits^n_{i=1} x_i}{n} = \frac {x_1+x_2+\dotsc+ x_n}{n} .$$

Она называется также выборочной средней или эмпирической средней.

Если измерения были неравноточными, или разной важности, то при вычислении средней арифметической характеристики используются весовые коэффициенты (например, отражающие точность измерения, инструмента) и такая средняя характеристика называется средневзвешенной оценкой . Она применяется также при вычислении общей средней (генеральной выборки) по выборочным средним (средним групп, выборок):$$\bar x = \frac {\sum\limits^n_{i=1} x_i\omega_i} {\sum\limits^n_{i=1} \omega_i},$$ где $$\omega_i$$ - веса (частоты).

При расчете средневзвешенных оценок по выборке важное значение имеет выбор веса и его обоснование. Средняя гармоническая величина, как и средняя арифметическая, может быть простой и взвешенной. Если все веса равны между собой, то можно использовать среднюю гармоническую в виде$$\bar x_{\text{гарм}} = \frac {n}{\sum\limits^n_{i=1}\frac {1}{x_i} }.$$

Средняя квадратичная взвешенная величина вычисляется по формуле$$\bar x_{\text{кв}} = \sqrt {\frac {\sum\limits^n_{i=1} x_i ^2\omega_i } {\sum\limits^n_{i=1} \omega_i } } .$$

Если $$\omega_i=1$$ для всех i=1,2,...,n, то получаем просто среднее квадратичное. Эти величины характеризуют "концентрацию" данных выборки около среднего (или другой характерной тенденции).

К средним величинам, которые характеризуют структурные изменения, относятся мода и медиана. Они определяются лишь структурой распределения, и их часто называют структурными средними (позиционными средними).

Мода - наиболее часто встречающееся значение признака у элементов данной совокупности. Она соответствует определенному значению признака. Мода может быть и не единственной.

Часто важно знать, где у выборки находится "центр" данных.

Медиана - значение признака, которое делит элементы ранжированной выборки на две равные части. Это середина ранжированного ряда. Если число элементов n - четно, то это среднее арифметическое двух средних элементов (хотя это значение может и не быть элементом ряда).

Для данных, имеющих "хорошее поведение", медиана всегда лежит в промежутке между средним арифметическим и модой. Эти величины выстраиваются по возрастанию следующим образом (напомним про упорядоченность по возрастанию выборки, предполагаемую нами для любого статистического ряда): среднее, медиана, мода, или же в обратном порядке. Прямой или обратный порядок их расположения можно определить, вычислив коэффициент асимметрии:$$K= \frac {\frac {1}{n}\sum\limits^n_{i=1} (x_i-\bar x)^3} {\Biggl(\sqrt{\frac {1}{n}\sum\limits^n_{i=1} (x_i-\bar x)^2} \Biggr) ^3}.$$

Этот коэффициент (часто называемый третьим центральным моментом) отражает относительную изменчивость данных, их "поведение".

Группа оценок, называемых мерой рассеяния, разброса или вариацией, часто дает наиболее объективную характеристику.

Мера рассеяния - оценка, показывающая, как остальные элементы совокупности (выборки) группируются около средних величин.

Наиболее часто используются следующие оценки:

  • размах $$r_x=x_{\max} -x_{\min} = x_n-x_1$$ ;
  • среднее абсолютное отклонение $$x_{\text{ср}} = \frac 1n\sum\limits^n_{i=1}|x_i-\bar x|;$$
  • среднеквадратичное отклонение $$\delta x= \sqrt{\frac 1n \sum\limits^n_{i=1} (x_i-\bar x)^2} = \sqrt {\frac 1n \Bigl({\sum\limits^n_{i=1} x^2_i -n\bar x^2}\Bigr)};$$
  • дисперсия$$D=\frac {1}{n-1} \sum\limits^n_{i=1}(x_i-\bar x)^2 = \frac {1}{n-1} \Bigl(\sum\limits^n_{i=1}x^2_i - n\bar x^2\Bigr)$$ (часто вместо n-1 берут значение n );
  • стандартное отклонение: $$\sigma=\sqrt{D}$$ ;
  • коэффициент вариации: $$v=\sigma/\bar x$$ .
  • Группировка - одна из основных операций, позволяющих "сужать" совокупности с необходимой мерой информативности получаемых групп, выборок, без потери информации о генеральной совокупности. Существуют различные методы и приемы группировки. Рассмотрим некоторые из них.

    Пусть задан ряд статистических данных (генеральная совокупность) вида: x1, x2, ..., xn.

    Квантиль - величина, большая части ряда или равная ей. Если в качестве квантиля взять медиану, то часть ряда, которая меньше ее (медианы), равна 1/2. Квантили делят выборку на две части.

    Квартили - величины x(1), x(2), такие, что 1/4 часть всех наблюдений меньше или равны x(1), а 3/4 наблюдений меньше или равны x(2) ( x(2) - это медиана), x(1) - нижний квартиль, x(2) - верхний квартиль, ( x(2)-x(1)) - интерквартильная широта, (x(1)+x(2))/2 - средний квартиль. Квартили делят наблюдения на четыре части.

    Аналогично вводятся децили, которые делят выборку на десять равных частей, и центили ( процентили ), которые делят выборку на 100 частей.

    Для группировки в классы данных в некоторой выборке необходимо задать (определить) число классов ( групп ) N, тогда интервал классов c=(xn-x1)/N и xi будет отнесен в класс номер k=[(xi-x1)/c], i=1, 2, ..., N. Затем находят середину класса ( группы ) - xi=xi-1+c(i+0,5).

    Гистограмма - диаграмма (обычно столбиковая) имеющая специальный метод построения. Изложим его. Для x1, x2, ..., xn находят число интервалов по формуле $$k=1+3,2\lg n$$ и длину интервала h=(xn-x1)/k. Пусть в i -й интервал попали ni элементов. Относительная частота попадания случайной величины в i -й интервал равна p_i. Все точки, попавшие в i -й интервал (класс), считаются эквивалентными середине класса: x_i=(xi-1+xi)/2. Диаграмма, где по оси Ox откладывают значения x1, x2 , ..., xn, а по Oy - значения pi=const для каждого интервала, и представляет собой гистограмму. Она имеет вид, изображенный на рис. 14.1 (по оси абсцисс - классы, точнее, интервалы класса, а по оси ординат - относител ьные частоты).

    (рис 14.1) Вид гистограммы (влияния 11 загрязнителей на человека)

    Определим некоторые базовые понятия теории вероятностей.

    Исход - одно из возможных заключений о рассматриваемом процессе (часто из двух - положительное или отрицательное заключение).

    Выборочное пространство - множество всех исходов.

    Наблюдение - информация, полученная осмотром, измерением, опросом, интервью, тестированием и т.п.

    Событие - любое подмножество выборочного пространства. Пустое событие обозначают, как и в теории множеств, символом $$\emptyset$$. Событием можно считать и все выборочное пространство (универсальное событие).

    Испытание - проверка всевозможных исходов события. В более широком смысле - это выполнение любой процедуры, которой соответствует выборочное пространство более чем из одного исхода.

    Два испытания независимы, если любое событие, определенное на основе только одного из них, не зависит от любого события, определенного на основе другого.

    Так как событие - это множество, то для него должны быть выполнимы основные операции с множествами: объединение, пересечение и дополнение.

    Два события S1 и S2 несовместимы, если $$S_1\cap S_2=\emptyset$$ .

    События S1 и S2 образуют полную группу, если $$S_1\cup S_2=S$$ (всему выборочному пространству).

    События S1 и S2 - противоположны, если они несовместимы и образуют полную группу.

    Пусть S - событие, n(S) - число случаев (исходов), в которых произошло событие S из проведенной серии n испытаний (в выборочном пространстве). Тогда $$\delta =n(S)/n$$ - относительная частота события S.

    При больших n $$(n\to \infty$$ ), $$\delta \to p$$. Эта предельная частота называется вероятностью события S и обозначается как p(S) или просто p . Всегда $$p(S_1)\ge 0$$ $$\forall S_1\subset S$$, а p(S)=1.

    Важно заметить, что указанный предел не может быть вычислен как предел функции (последовательности), так как ее просто нет.

    Пусть имеется некоторое событие с множеством возможных исходов. Если X - множество этих исходов (состояний), то его любое подмножество Y можно отождествить с событием. Каждому событию (множеству) S можно приписывать некоторое число p(S), называемое вероятностью этого события и удовлетворяющее аксиомам алгебры множеств, в частности, следующим соотношениям:

  • $$p(\emptyset)=0$$ ;
  • p(X)=1 ;
  • для любого события S верно неравенство $$0\le p(S)\le 1$$ ;
  • если $$p(S_1\cap S_2)=\emptyset$$, то $$p(S_1\cup S_2)=p(S_1)+p(S_2)$$, $$S_1, S_2 \subset X$$ ;
  • если S1 и S2 - противоположные события из X, то p(S2)+p(S1)=1 ;
  • если событие S1 влечет за собой событие S2, то $$p(S_1)\le p(S_2)$$.
  • Основные правила для вероятностей:

  • правило сложения вероятностей для несовместимых событий S1 и S2:$$p(S_1\cup S_2)=p(S_1)+p(S_2), \quad S_1\cap S_2=\emptyset;$$
  • правило умножения вероятностей для несовместимых событий S1 и S2:$$p(S_1\cap S_2)=p(S_1)p(S_2), \quad S_1\cap S_2=\emptyset;$$
  • условная вероятность события S1 (вероятность появления этого события при условии появления события S2 для каждого события рассматриваемого множества событий) определяется по формуле (Байеса): $$p(S_1/S_2)=p(S_1\cap S_2)/p(S_2);$$
  • общее правило сложения вероятностей:$$p(S_1)+p(S_2)=p(S_1\cup S_2)+p(S_1\cap S_2);$$
  • если S1 и S2 независимы, то $$p(S_1\cup S_2)=p(S_1)+p(S_2)- p(S_1)p(S_2);$$
  • если S1 и S2 образуют полную группу, то $$p(S_1\cap S_2)=p(S_1)+p(S_2)-1$$.
  • Пример. Лотерейные билеты, двузначные, от 10 до 99. Имеется 1 билет с выигрышем 100 руб., 10 - с выигрышем 50 руб., 20 - с выигрышем в 30 руб. Вероятность того, что вытащенный наугад билет лотереи имеет номер 50 (как и любой другой двузначный номер), равна 1/90. Вероятность того, что у такого билета цифра десятков равна 5, будет 1/9. Вероятность выиграть 100 руб. равна 1/90, а вероятность выиграть хотя бы 30 руб. равна 31/90.

    Под случайным событием в теории вероятностей понимается событие, которое в результате испытания может произойти или может не произойти, то есть происходит с некоторой вероятностью, случайно. Случайные события бывают дискретные (принимающие конечные числа, последовательность пронумерованных значений) и непрерывные (принимающие любые значения из некоторого промежутка значений).

    Случайная величина - числовая переменная (числовая функция), определенная на выборочном пространстве (или приписываемая некоторому выборочному пространству) таким образом, что каждой точке выборочного пространства соответствует одно и только одно значение этой переменной.

    Если множество всех теоретически возможных значений величины x конечно или счетно, то ее называют дискретной случайной величиной .

    Пример. Если n - число, выпавшее на игральной кости при ее бросании номер m, то функция n=n(m) - случайная функция. Эта функция имеет выборочное пространство S={1, 2, 3, 4, 5, 6}.

    Функция f(x), которая для каждого возможного значения xi, i=1,2,..., n (или i=1,2,..., n,...) дискретной случайной величины x равна вероятности pi=f(xi) появления этого значения, задает распределение вероятностей случайной величины. Таким образом, эта функция задает множество значений, которые может принимать случайная величина, вместе с соответствующими им вероятностями.

    Величину M(x), определяемую формулой$$M(x) = \sum\limits^n_{i=1} x_ip_i,$$ называют математическим ожиданием дискретной случайной величины $$x$$.

    Величину, определяемую формулой$$D(x)= \sum\limits^n_{i=1} (x_i-M(x))^2 p_i,$$ называют дисперсией этой случайной величины.

    Математическое ожидание характеризует центр распределения (аналог среднего выборки), а дисперсия - степень рассеяния значений случайной величины вокруг центра (аналог рассеяния в выборке). Эти формулы дают возможность получить оценку математического ожидания и дисперсии на основе опытных данных.

    Если случайная величина распределена непрерывно и задана некоторой функцией распределения f(x), то M(x) и D(x) определяются по соответствующим формулам (для ограниченного и бесконечного множества изменения случайной величины):$$M(x) = \int\limits_{a}^{b} xf(x)\,dx, \quad D(x) = \int\limits_{a}^{b} (x-M(x))^2f(x)\,dx, \\ M(x) = \int\limits_{-\infty}^{+\infty} xf(x)\,dx, \quad D(x) = \int\limits_{-\infty}^{+\infty} (x-M(x))^2f(x)\,dx.$$

    Приведем наиболее часто встречающиеся распределения.

  • Распределение Бернулли. Это простейшая форма распределения: случайная величина определена на выборочном пространстве, состоящем из двух только исходов с вероятностями p и q=1-p. Для такой дискретной функции распределения M(x)=p, D(x)=pq=p(1-p).
  • Биноминальное распределение. Пусть случайная величина может принимать целые значения m=0, 1, 2, ..., n. Будем говорить, что эта величина распределена по биноминальному закону, если функция, задающая ее распределение, имеет вид: $$f(m)= C^m_n p^m(1-p)^{n-m}= C^m_n p^mq^{n-m}$$ ( 0<p<1, q=1-p ). Для этого распределения M(x)=np, D(x)=npq.
  • Распределение Пуассона. Пусть случайная величина x может принимать любое целое неотрицательное значение m=0, 1, 2, .... Будем говорить, что эта величина распределена по закону Пуассона, если функция, задающая ее распределение, имеет вид: f(m)=am e-a/m!. Здесь a - некоторое положительное число, называемое параметром закона Пуассона. Для этого распределения: M(x)=a, D(x)=a.
  • Нормальное распределение ( распределение Гаусса ). Это наиболее часто встречающееся непрерывное распределение (точнее было бы сказать, что это распределение, к которому "подгоняется" большинство изучаемых). Такому закону или его различным модификациям подчиняются многие наборы случайных величин. Общий вид нормального распределения задается функцией$$f(x)= \frac {1}{\sqrt{2\pi D(X)}} \exp \bigl[- \frac {(x-M(x))^2}{2D(x)} \bigr].$$
  • Часто используется стандартное нормальное распределение или распределение вероятностей нахождения (попадания) случайной величины в интервал (a;b). Для вычисления значений такой функции используется интеграл (таблица значений этого, не берущегося в квадратурах, интеграла):$$\Phi(x) = \int\limits_{-\infty}^{x} \frac {1}{\sqrt{2\pi}} \exp \bigl(-\frac {z^2}2 \bigr)\,dz.$$

    Если известно среднее уклонение случайной величины (средне квадратичное, например), то можно получить представление о величине уклонения ожидаемых фактических значений. Количественную оценку этого дает неравенство П.Л. Чебышева.

    Рассмотрим дисперсию с весами$$D=\frac {1}{n-1}\sum\limits^n_{i=1} (x_i-\bar x)^2p_i.$$ Пусть a>0 - произвольное число. В сумме D выбросим все слагаемые, которые не превосходят a, тогда получим новую сумму Da: $$D_a\le D$$. Сумма Da - есть сумма вероятностей всех тех значений xi, которые уклоняются от среднего в ту или иную сторону на величину, большую, чем a. По правилу сложения, это будет вероятность того, что величина x получит какое-либо одно из этих значений, то есть вероятность того, что ожидаемое фактическое уклонение окажется больше, чем a. Обозначают эту вероятность так:$$P(|x-\bar x|>a)\le D/(a^2).$$

    Это неравенство называется неравенством Чебышева. Оно позволяет оценить вероятность уклонений, больших, чем любое заданное число a, если известна дисперсия D (среднеквадратичное отклонение).

    Пример. Пусть для заданного ряда чисел имеем: x=100, D=2. Тогда вероятность получения уклонения в измерениях большего, чем 5, будет оцениваться как$$P(|x-100|>5)\le 2/25=0,08.$$

    Пусть имеются n взаимно независимых случайных величин $$x_1, x_2,\dotsc, x_n$$ с одними и теми же средним значением b и средним квадратичным уклонением c. Найдем среднее арифметическое этих величин (используя свойства, рассмотренные выше):$$\bar x = \frac {\overline{x_1+x_2+\dotsc+x_n}}{n} = \frac {\bar x_1+\bar x_2+\dotsc+\bar x_n}{n} = \frac {n\bar x}{n} =\bar x =b .$$ Аналогично можно показать, что дисперсия суммы взаимно независимых случайных величин равна сумме их дисперсий. Имеет место формула$$\sigma =\sqrt{D} = \sqrt{\sum\limits^n_{i=1}D_i} = \frac {c}{\sqrt{n}}.$$ Из неравенства Чебышева получаем$$P(|x-b|>a)\le c/(a^2n).$$

    Для любого малого a можно подобрать такое большое n, что правую часть последнего неравенства можно сделать сколь угодно малой, то есть при достаточно большом значении n можно считать имеющим сколь угодно большую (близкую к 1 ) вероятность неравенства вида $$|x-b|\le a$$.

    Этот закон называется законом больших чисел (в его наиболее простой форме). Он был открыт также П.Л. Чебышевым.

    Пример. Для предыдущего примера найдем такое n для a=0,1. Получаем неравенство$$P(|x- 100|>0,1)\le 2/(0,01n).$$ Например, чтобы сделать правую часть меньше, чем 0,01, необходимо решить неравенство: 2/(0,01n)<0,01, то есть n>2000.

    Располагая каким-то распределением величин опытного происхождения, можно исследовать возможность описания этой совокупности каким-либо распределением, рассмотренным выше (если тип распределения неизвестен) или найти (идентифицировать) неизвестный параметр распределения (если тип распределения выяснен), а также эффективность того или иного описания.

    Такого рода вопросы формируются обычно в виде статистических гипотез - предположений, обосновываемых или опровергаемых далее.

    Пример. Гипотеза первая: данная выборка произведена из нормально распределенной генеральной совокупности. Гипотеза вторая: дисперсии двух рассматриваемых распределений совокупностей равны.

    Есть процедуры, позволяющие отвергнуть проверяемую гипотезу как противоречащую имеющимся данным, либо убедиться в том, что гипотеза этим данным не противоречит.

    Наиболее часто проверяемой гипотезой является гипотеза о нормальности распределения, то есть о подчиненности ряда нормальному распределению (распределению Гаусса).

    Выше, при рассмотрении задачи аппроксимации мы указывали, что экспериментальные данные, по которым отыскивается эмпирическая формула, подвержены ошибкам, например, ошибкам округления. Мы предполагали при этом (правда, неявно), что эти ошибки носят детерминированный характер. Но экспериментальные данные, а также ошибки могут иметь и случайный характер. Такая ситуация встречается чаще. Подход и метод наименьших квадратов, рассмотренные при решении задачи аппроксимации, пригодны и в этих, изменившихся качественно, условиях. Зависимости y=f(x1, x2, ..., xn), определенные для случайных наборов данных и снабженные соответствующими статистическими оценками адекватности, предсказания, как в целом, так и по отдельным факторам xi, i=1,2,...,n, называются регрессионными зависимостями , а сама зависимость - многофакторной регрессионной зависимостью . Возможны и однофакторные зависимости y=f(x). Обычно ищут линейную зависимость вида y=a0+a1x1+a2x2+...+anxn. В других случаях ищут квадратичную многофакторную зависимость. В предыдущем разделе мы рассматривали, как можно методом наименьших квадратов найти однофакторную модель.

    Страницы:

    Элементы теории вероятностей и математической статистики

    Пусть задан некоторый статистический ряд из элементов x1, x2,..., xn. Если эти элементы могут принимать все мыслимые допустимые значения, а объект с этими характеристиками рассматривается как единый (как система), то такую совокупность называют генеральной совокупностью ; часто при этом предполагается (как и нами везде ниже), что она является конечной и упорядоченной по возрастанию: $$x_1<x_2<\dotsc <x_n$$.

    Любое непустое подмножество генеральной совокупности называется выборкой . Если выборка осуществлена случайным образом, то она называется случайной выборкой. Далее мы часто под выборкой будем понимать ранжированную, упорядоченную выборку.

    Средняя величина генеральной совокупности в целом называется общей средней . Она отражает общие черты всей совокупности. Средняя величина для отдельной выборки называется средней по выборке или выборочной средней . Она отражает общие черты группы.

    Основная цель статистических расчетов, как правило, состоит в том, чтобы по характеристикам выборки получить достоверную информацию о свойствах исходных генеральных совокупностей.

    Пример. Повышение среднемесячной зарплаты, например, от 1200 руб. до 1500 руб. отражает лишь общую тенденцию динамики зарплаты (ее рост) по всем категориям трудящихся. В различных группах средние величины по группе могут сильно различаться, а в некоторых группах и не возрастать. Сравнительный анализ групповых и общих средних может дать информацию для характеристики социально-экономических слоев населения, о наличии и степени расслоения общества, о наличии и силе связей между групповым (факторным) признаком и результативным показателем.

    Существуют различные меры средних величин.

    Чаще используется средняя арифметическая характеристика:$$\bar x = \frac {\sum\limits^n_{i=1} x_i}{n} = \frac {x_1+x_2+\dotsc+ x_n}{n} .$$

    Она называется также выборочной средней или эмпирической средней.

    Если измерения были неравноточными, или разной важности, то при вычислении средней арифметической характеристики используются весовые коэффициенты (например, отражающие точность измерения, инструмента) и такая средняя характеристика называется средневзвешенной оценкой . Она применяется также при вычислении общей средней (генеральной выборки) по выборочным средним (средним групп, выборок):$$\bar x = \frac {\sum\limits^n_{i=1} x_i\omega_i} {\sum\limits^n_{i=1} \omega_i},$$ где $$\omega_i$$ - веса (частоты).

    При расчете средневзвешенных оценок по выборке важное значение имеет выбор веса и его обоснование. Средняя гармоническая величина, как и средняя арифметическая, может быть простой и взвешенной. Если все веса равны между собой, то можно использовать среднюю гармоническую в виде$$\bar x_{\text{гарм}} = \frac {n}{\sum\limits^n_{i=1}\frac {1}{x_i} }.$$

    Средняя квадратичная взвешенная величина вычисляется по формуле$$\bar x_{\text{кв}} = \sqrt {\frac {\sum\limits^n_{i=1} x_i ^2\omega_i } {\sum\limits^n_{i=1} \omega_i } } .$$

    Если $$\omega_i=1$$ для всех i=1,2,...,n, то получаем просто среднее квадратичное. Эти величины характеризуют "концентрацию" данных выборки около среднего (или другой характерной тенденции).

    К средним величинам, которые характеризуют структурные изменения, относятся мода и медиана. Они определяются лишь структурой распределения, и их часто называют структурными средними (позиционными средними).

    Мода - наиболее часто встречающееся значение признака у элементов данной совокупности. Она соответствует определенному значению признака. Мода может быть и не единственной.

    Часто важно знать, где у выборки находится "центр" данных.

    Медиана - значение признака, которое делит элементы ранжированной выборки на две равные части. Это середина ранжированного ряда. Если число элементов n - четно, то это среднее арифметическое двух средних элементов (хотя это значение может и не быть элементом ряда).

    Для данных, имеющих "хорошее поведение", медиана всегда лежит в промежутке между средним арифметическим и модой. Эти величины выстраиваются по возрастанию следующим образом (напомним про упорядоченность по возрастанию выборки, предполагаемую нами для любого статистического ряда): среднее, медиана, мода, или же в обратном порядке. Прямой или обратный порядок их расположения можно определить, вычислив коэффициент асимметрии:$$K= \frac {\frac {1}{n}\sum\limits^n_{i=1} (x_i-\bar x)^3} {\Biggl(\sqrt{\frac {1}{n}\sum\limits^n_{i=1} (x_i-\bar x)^2} \Biggr) ^3}.$$

    Этот коэффициент (часто называемый третьим центральным моментом) отражает относительную изменчивость данных, их "поведение".

    Группа оценок, называемых мерой рассеяния, разброса или вариацией, часто дает наиболее объективную характеристику.

    Мера рассеяния - оценка, показывающая, как остальные элементы совокупности (выборки) группируются около средних величин.

    Наиболее часто используются следующие оценки:

  • размах $$r_x=x_{\max} -x_{\min} = x_n-x_1$$ ;
  • среднее абсолютное отклонение $$x_{\text{ср}} = \frac 1n\sum\limits^n_{i=1}|x_i-\bar x|;$$
  • среднеквадратичное отклонение $$\delta x= \sqrt{\frac 1n \sum\limits^n_{i=1} (x_i-\bar x)^2} = \sqrt {\frac 1n \Bigl({\sum\limits^n_{i=1} x^2_i -n\bar x^2}\Bigr)};$$
  • дисперсия$$D=\frac {1}{n-1} \sum\limits^n_{i=1}(x_i-\bar x)^2 = \frac {1}{n-1} \Bigl(\sum\limits^n_{i=1}x^2_i - n\bar x^2\Bigr)$$ (часто вместо n-1 берут значение n );
  • стандартное отклонение: $$\sigma=\sqrt{D}$$ ;
  • коэффициент вариации: $$v=\sigma/\bar x$$ .
  • Группировка - одна из основных операций, позволяющих "сужать" совокупности с необходимой мерой информативности получаемых групп, выборок, без потери информации о генеральной совокупности. Существуют различные методы и приемы группировки. Рассмотрим некоторые из них.

    Пусть задан ряд статистических данных (генеральная совокупность) вида: x1, x2, ..., xn.

    Квантиль - величина, большая части ряда или равная ей. Если в качестве квантиля взять медиану, то часть ряда, которая меньше ее (медианы), равна 1/2. Квантили делят выборку на две части.

    Квартили - величины x(1), x(2), такие, что 1/4 часть всех наблюдений меньше или равны x(1), а 3/4 наблюдений меньше или равны x(2) ( x(2) - это медиана), x(1) - нижний квартиль, x(2) - верхний квартиль, ( x(2)-x(1)) - интерквартильная широта, (x(1)+x(2))/2 - средний квартиль. Квартили делят наблюдения на четыре части.

    Аналогично вводятся децили, которые делят выборку на десять равных частей, и центили ( процентили ), которые делят выборку на 100 частей.

    Для группировки в классы данных в некоторой выборке необходимо задать (определить) число классов ( групп ) N, тогда интервал классов c=(xn-x1)/N и xi будет отнесен в класс номер k=[(xi-x1)/c], i=1, 2, ..., N. Затем находят середину класса ( группы ) - xi=xi-1+c(i+0,5).

    Гистограмма - диаграмма (обычно столбиковая) имеющая специальный метод построения. Изложим его. Для x1, x2, ..., xn находят число интервалов по формуле $$k=1+3,2\lg n$$ и длину интервала h=(xn-x1)/k. Пусть в i -й интервал попали ni элементов. Относительная частота попадания случайной величины в i -й интервал равна p_i. Все точки, попавшие в i -й интервал (класс), считаются эквивалентными середине класса: x_i=(xi-1+xi)/2. Диаграмма, где по оси Ox откладывают значения x1, x2 , ..., xn, а по Oy - значения pi=const для каждого интервала, и представляет собой гистограмму. Она имеет вид, изображенный на рис. 14.1 (по оси абсцисс - классы, точнее, интервалы класса, а по оси ординат - относител ьные частоты).

    (рис 14.1) Вид гистограммы (влияния 11 загрязнителей на человека)

    Определим некоторые базовые понятия теории вероятностей.

    Исход - одно из возможных заключений о рассматриваемом процессе (часто из двух - положительное или отрицательное заключение).

    Выборочное пространство - множество всех исходов.

    Наблюдение - информация, полученная осмотром, измерением, опросом, интервью, тестированием и т.п.

    Событие - любое подмножество выборочного пространства. Пустое событие обозначают, как и в теории множеств, символом $$\emptyset$$. Событием можно считать и все выборочное пространство (универсальное событие).

    Испытание - проверка всевозможных исходов события. В более широком смысле - это выполнение любой процедуры, которой соответствует выборочное пространство более чем из одного исхода.

    Два испытания независимы, если любое событие, определенное на основе только одного из них, не зависит от любого события, определенного на основе другого.

    Так как событие - это множество, то для него должны быть выполнимы основные операции с множествами: объединение, пересечение и дополнение.

    Два события S1 и S2 несовместимы, если $$S_1\cap S_2=\emptyset$$ .

    События S1 и S2 образуют полную группу, если $$S_1\cup S_2=S$$ (всему выборочному пространству).

    События S1 и S2 - противоположны, если они несовместимы и образуют полную группу.

    Пусть S - событие, n(S) - число случаев (исходов), в которых произошло событие S из проведенной серии n испытаний (в выборочном пространстве). Тогда $$\delta =n(S)/n$$ - относительная частота события S.

    При больших n $$(n\to \infty$$ ), $$\delta \to p$$. Эта предельная частота называется вероятностью события S и обозначается как p(S) или просто p . Всегда $$p(S_1)\ge 0$$ $$\forall S_1\subset S$$, а p(S)=1.

    Важно заметить, что указанный предел не может быть вычислен как предел функции (последовательности), так как ее просто нет.

    Пусть имеется некоторое событие с множеством возможных исходов. Если X - множество этих исходов (состояний), то его любое подмножество Y можно отождествить с событием. Каждому событию (множеству) S можно приписывать некоторое число p(S), называемое вероятностью этого события и удовлетворяющее аксиомам алгебры множеств, в частности, следующим соотношениям:

  • $$p(\emptyset)=0$$ ;
  • p(X)=1 ;
  • для любого события S верно неравенство $$0\le p(S)\le 1$$ ;
  • если $$p(S_1\cap S_2)=\emptyset$$, то $$p(S_1\cup S_2)=p(S_1)+p(S_2)$$, $$S_1, S_2 \subset X$$ ;
  • если S1 и S2 - противоположные события из X, то p(S2)+p(S1)=1 ;
  • если событие S1 влечет за собой событие S2, то $$p(S_1)\le p(S_2)$$.
  • Основные правила для вероятностей:

  • правило сложения вероятностей для несовместимых событий S1 и S2:$$p(S_1\cup S_2)=p(S_1)+p(S_2), \quad S_1\cap S_2=\emptyset;$$
  • правило умножения вероятностей для несовместимых событий S1 и S2:$$p(S_1\cap S_2)=p(S_1)p(S_2), \quad S_1\cap S_2=\emptyset;$$
  • условная вероятность события S1 (вероятность появления этого события при условии появления события S2 для каждого события рассматриваемого множества событий) определяется по формуле (Байеса): $$p(S_1/S_2)=p(S_1\cap S_2)/p(S_2);$$
  • общее правило сложения вероятностей:$$p(S_1)+p(S_2)=p(S_1\cup S_2)+p(S_1\cap S_2);$$
  • если S1 и S2 независимы, то $$p(S_1\cup S_2)=p(S_1)+p(S_2)- p(S_1)p(S_2);$$
  • если S1 и S2 образуют полную группу, то $$p(S_1\cap S_2)=p(S_1)+p(S_2)-1$$.
  • Пример. Лотерейные билеты, двузначные, от 10 до 99. Имеется 1 билет с выигрышем 100 руб., 10 - с выигрышем 50 руб., 20 - с выигрышем в 30 руб. Вероятность того, что вытащенный наугад билет лотереи имеет номер 50 (как и любой другой двузначный номер), равна 1/90. Вероятность того, что у такого билета цифра десятков равна 5, будет 1/9. Вероятность выиграть 100 руб. равна 1/90, а вероятность выиграть хотя бы 30 руб. равна 31/90.

    Под случайным событием в теории вероятностей понимается событие, которое в результате испытания может произойти или может не произойти, то есть происходит с некоторой вероятностью, случайно. Случайные события бывают дискретные (принимающие конечные числа, последовательность пронумерованных значений) и непрерывные (принимающие любые значения из некоторого промежутка значений).

    Случайная величина - числовая переменная (числовая функция), определенная на выборочном пространстве (или приписываемая некоторому выборочному пространству) таким образом, что каждой точке выборочного пространства соответствует одно и только одно значение этой переменной.

    Если множество всех теоретически возможных значений величины x конечно или счетно, то ее называют дискретной случайной величиной .

    Пример. Если n - число, выпавшее на игральной кости при ее бросании номер m, то функция n=n(m) - случайная функция. Эта функция имеет выборочное пространство S={1, 2, 3, 4, 5, 6}.

    Функция f(x), которая для каждого возможного значения xi, i=1,2,..., n (или i=1,2,..., n,...) дискретной случайной величины x равна вероятности pi=f(xi) появления этого значения, задает распределение вероятностей случайной величины. Таким образом, эта функция задает множество значений, которые может принимать случайная величина, вместе с соответствующими им вероятностями.

    Величину M(x), определяемую формулой$$M(x) = \sum\limits^n_{i=1} x_ip_i,$$ называют математическим ожиданием дискретной случайной величины $$x$$.

    Величину, определяемую формулой$$D(x)= \sum\limits^n_{i=1} (x_i-M(x))^2 p_i,$$ называют дисперсией этой случайной величины.

    Математическое ожидание характеризует центр распределения (аналог среднего выборки), а дисперсия - степень рассеяния значений случайной величины вокруг центра (аналог рассеяния в выборке). Эти формулы дают возможность получить оценку математического ожидания и дисперсии на основе опытных данных.

    Если случайная величина распределена непрерывно и задана некоторой функцией распределения f(x), то M(x) и D(x) определяются по соответствующим формулам (для ограниченного и бесконечного множества изменения случайной величины):$$M(x) = \int\limits_{a}^{b} xf(x)\,dx, \quad D(x) = \int\limits_{a}^{b} (x-M(x))^2f(x)\,dx, \\ M(x) = \int\limits_{-\infty}^{+\infty} xf(x)\,dx, \quad D(x) = \int\limits_{-\infty}^{+\infty} (x-M(x))^2f(x)\,dx.$$

    Приведем наиболее часто встречающиеся распределения.

  • Распределение Бернулли. Это простейшая форма распределения: случайная величина определена на выборочном пространстве, состоящем из двух только исходов с вероятностями p и q=1-p. Для такой дискретной функции распределения M(x)=p, D(x)=pq=p(1-p).
  • Биноминальное распределение. Пусть случайная величина может принимать целые значения m=0, 1, 2, ..., n. Будем говорить, что эта величина распределена по биноминальному закону, если функция, задающая ее распределение, имеет вид: $$f(m)= C^m_n p^m(1-p)^{n-m}= C^m_n p^mq^{n-m}$$ ( 0<p<1, q=1-p ). Для этого распределения M(x)=np, D(x)=npq.
  • Распределение Пуассона. Пусть случайная величина x может принимать любое целое неотрицательное значение m=0, 1, 2, .... Будем говорить, что эта величина распределена по закону Пуассона, если функция, задающая ее распределение, имеет вид: f(m)=am e-a/m!. Здесь a - некоторое положительное число, называемое параметром закона Пуассона. Для этого распределения: M(x)=a, D(x)=a.
  • Нормальное распределение ( распределение Гаусса ). Это наиболее часто встречающееся непрерывное распределение (точнее было бы сказать, что это распределение, к которому "подгоняется" большинство изучаемых). Такому закону или его различным модификациям подчиняются многие наборы случайных величин. Общий вид нормального распределения задается функцией$$f(x)= \frac {1}{\sqrt{2\pi D(X)}} \exp \bigl[- \frac {(x-M(x))^2}{2D(x)} \bigr].$$
  • Часто используется стандартное нормальное распределение или распределение вероятностей нахождения (попадания) случайной величины в интервал (a;b). Для вычисления значений такой функции используется интеграл (таблица значений этого, не берущегося в квадратурах, интеграла):$$\Phi(x) = \int\limits_{-\infty}^{x} \frac {1}{\sqrt{2\pi}} \exp \bigl(-\frac {z^2}2 \bigr)\,dz.$$

    Если известно среднее уклонение случайной величины (средне квадратичное, например), то можно получить представление о величине уклонения ожидаемых фактических значений. Количественную оценку этого дает неравенство П.Л. Чебышева.

    Рассмотрим дисперсию с весами$$D=\frac {1}{n-1}\sum\limits^n_{i=1} (x_i-\bar x)^2p_i.$$ Пусть a>0 - произвольное число. В сумме D выбросим все слагаемые, которые не превосходят a, тогда получим новую сумму Da: $$D_a\le D$$. Сумма Da - есть сумма вероятностей всех тех значений xi, которые уклоняются от среднего в ту или иную сторону на величину, большую, чем a. По правилу сложения, это будет вероятность того, что величина x получит какое-либо одно из этих значений, то есть вероятность того, что ожидаемое фактическое уклонение окажется больше, чем a. Обозначают эту вероятность так:$$P(|x-\bar x|>a)\le D/(a^2).$$

    Это неравенство называется неравенством Чебышева. Оно позволяет оценить вероятность уклонений, больших, чем любое заданное число a, если известна дисперсия D (среднеквадратичное отклонение).

    Пример. Пусть для заданного ряда чисел имеем: x=100, D=2. Тогда вероятность получения уклонения в измерениях большего, чем 5, будет оцениваться как$$P(|x-100|>5)\le 2/25=0,08.$$

    Пусть имеются n взаимно независимых случайных величин $$x_1, x_2,\dotsc, x_n$$ с одними и теми же средним значением b и средним квадратичным уклонением c. Найдем среднее арифметическое этих величин (используя свойства, рассмотренные выше):$$\bar x = \frac {\overline{x_1+x_2+\dotsc+x_n}}{n} = \frac {\bar x_1+\bar x_2+\dotsc+\bar x_n}{n} = \frac {n\bar x}{n} =\bar x =b .$$ Аналогично можно показать, что дисперсия суммы взаимно независимых случайных величин равна сумме их дисперсий. Имеет место формула$$\sigma =\sqrt{D} = \sqrt{\sum\limits^n_{i=1}D_i} = \frac {c}{\sqrt{n}}.$$ Из неравенства Чебышева получаем$$P(|x-b|>a)\le c/(a^2n).$$

    Для любого малого a можно подобрать такое большое n, что правую часть последнего неравенства можно сделать сколь угодно малой, то есть при достаточно большом значении n можно считать имеющим сколь угодно большую (близкую к 1 ) вероятность неравенства вида $$|x-b|\le a$$.

    Этот закон называется законом больших чисел (в его наиболее простой форме). Он был открыт также П.Л. Чебышевым.

    Пример. Для предыдущего примера найдем такое n для a=0,1. Получаем неравенство$$P(|x- 100|>0,1)\le 2/(0,01n).$$ Например, чтобы сделать правую часть меньше, чем 0,01, необходимо решить неравенство: 2/(0,01n)<0,01, то есть n>2000.

    Располагая каким-то распределением величин опытного происхождения, можно исследовать возможность описания этой совокупности каким-либо распределением, рассмотренным выше (если тип распределения неизвестен) или найти (идентифицировать) неизвестный параметр распределения (если тип распределения выяснен), а также эффективность того или иного описания.

    Такого рода вопросы формируются обычно в виде статистических гипотез - предположений, обосновываемых или опровергаемых далее.

    Пример. Гипотеза первая: данная выборка произведена из нормально распределенной генеральной совокупности. Гипотеза вторая: дисперсии двух рассматриваемых распределений совокупностей равны.

    Есть процедуры, позволяющие отвергнуть проверяемую гипотезу как противоречащую имеющимся данным, либо убедиться в том, что гипотеза этим данным не противоречит.

    Наиболее часто проверяемой гипотезой является гипотеза о нормальности распределения, то есть о подчиненности ряда нормальному распределению (распределению Гаусса).

    Выше, при рассмотрении задачи аппроксимации мы указывали, что экспериментальные данные, по которым отыскивается эмпирическая формула, подвержены ошибкам, например, ошибкам округления. Мы предполагали при этом (правда, неявно), что эти ошибки носят детерминированный характер. Но экспериментальные данные, а также ошибки могут иметь и случайный характер. Такая ситуация встречается чаще. Подход и метод наименьших квадратов, рассмотренные при решении задачи аппроксимации, пригодны и в этих, изменившихся качественно, условиях. Зависимости y=f(x1, x2, ..., xn), определенные для случайных наборов данных и снабженные соответствующими статистическими оценками адекватности, предсказания, как в целом, так и по отдельным факторам xi, i=1,2,...,n, называются регрессионными зависимостями , а сама зависимость - многофакторной регрессионной зависимостью . Возможны и однофакторные зависимости y=f(x). Обычно ищут линейную зависимость вида y=a0+a1x1+a2x2+...+anxn. В других случаях ищут квадратичную многофакторную зависимость. В предыдущем разделе мы рассматривали, как можно методом наименьших квадратов найти однофакторную модель.

    Вернуться к учебному плану