Прикладная статистика

Теоретическая база прикладной статистики

Разбить на страницы
Показывать лекцию целиком

В настоящей лекции собраны основные математико-статистические утверждения, постоянно используемые при математическом обосновании методов прикладной статистики. Эти утверждения отнюдь не всегда легко найти в литературе по теории вероятностей и математической статистике. Например, такие рассматриваемые далее теоремы и методы, как многомерная центральная предельная теорема, теоремы о наследовании сходимости и метод линеаризации, даже не включены в энциклопедию "Вероятность и математическая статистика" [] - наиболее полный свод знаний по этой тематике. Последний факт наглядно демонстрирует разрыв между математической дисциплиной "теория вероятностей и математическая статистика" и потребностями прикладной статистики.

4.1. Законы больших чисел

Законы больших чисел позволяют описать поведение сумм случайных величин. Примером является следующий результат, обобщающий полученный ранее в $$\S$$ 2.2. Там было доказано следующее утверждение.

Теорема Чебышева. Пусть случайные величины $$X_1, X_2,..., X_k$$ попарно независимы и существует число $$C$$ такое, что $$D(X_i)\le C$$ при всех $$i = 1, 2, ..., k$$. Тогда для любого положительного $$\varepsilon$$ выполнено неравенство$$P \left\{ \left| \frac{X_1+X_2+...+X_k}{k}-\frac{M(X_1)+M(X_2)+...+M(X_k)}{k} \right|\ge\varepsilon \right\} \le\frac{C}{k\varepsilon^2}$$

Частным случаем теоремы Чебышева является теорема Бернулли - первый в истории вариант закона больших чисел.

Теорема Бернулли. Пусть $$m$$ - число наступлений события $$A$$ в $$k$$ независимых (попарно) испытаниях, и $$p$$ есть вероятность наступления события $$A$$ в каждом из испытаний. Тогда при любом $$\varepsilon>0$$ справедливо неравенство$$P \left\{ \left| \frac{m}{k}-p \right|\ge\varepsilon \right\} \le\frac{p(1-p)}{k\varepsilon^2}.$$

Ясно, что при росте $$k$$ выражения в правых частях формул (1) и (2) стремятся к 0. Таким образом, среднее арифметическое попарно независимых случайных величин сближается со средним арифметическим их математических ожиданий.

Напомним, что в лекции 2 шла речь лишь о пространствах элементарных событий из конечного числа элементов. Однако приведенные теоремы верны и в общем случае - для произвольных пространств элементарных событий. Однако в условие закона больших чисел необходимо добавить требование существования дисперсий. Легко видеть, что если существуют дисперсии, то существуют и математические ожидания. Закон больших чисел в форме Чебышева приобретает следующий вид.

, с.147]. Если $$X_1,X_2,...,X_k,..$$. - последовательность попарно независимых случайных величин, имеющих конечные дисперсии, ограниченные одной и той же постоянной,$$D(X_1)\le C,D(X_2)\le C,...,D(X_i)\le C,...$$ то, каково бы ни было постоянное $$\varepsilon>0$$,$$\lim_{k\rightarrow\infty}P \left\{ \left| \frac{1}{n}\sum_{j=1}^k X_j-\frac{1}{n}\sum_{j=1}^k MX_j \right|<\varepsilon \right\}=1.$$

С точки зрения прикладной статистики ограниченность дисперсий вполне естественна. Она вытекает, например, из ограниченности диапазона изменения практически всех величин, используемых при реальных расчетах.

В 1923 г. А.Я. Хинчин показал, что если случайные величины не только независимы, но и одинаково распределены, то существование у них математического ожидания является необходимым и достаточным условием для применимости закона больших чисел [, с.150].

Теорема [, с.150-151]. Для того чтобы для последовательности $$X_1,X_2,...,X_k,..$$. (как угодно зависимых) случайных величин при любом положительном $$\varepsilon$$ выполнялось соотношение (3), необходимо и достаточно, чтобы при $$n\rightarrow\infty$$$$M\frac{\left(\sum\limits_{j=1}^n(X_j-MX_j)\right)^2}{n^2+\left(\sum\limits_{j=1}^n(X_j-MX_j)\right)^2}\rightarrow 0.$$

Законы больших чисел для случайных величин служат основой для аналогичных утверждений для случайных элементов в пространствах более сложной природы, в частности, в пространствах произвольной природы (см. п.5.5 далее). Однако здесь мы ограничимся классическими формулировками, служащими основой для современной прикладной статистики.

Смысл классических законов больших чисел состоит в том, что выборочное среднее арифметическое независимых одинаково распределенных случайных величин приближается (сходится) к математическому ожиданию этих величин. Другими словами, выборочные средние сходятся к теоретическому среднему.

Это утверждение справедливо и для других видов средних. Например, выборочная медиана сходится к теоретической медиане. Это утверждение - тоже закон больших чисел, но не классический.

Существенным продвижением в теории вероятностей во второй половине ХХ в. явилось введение средних величин в пространствах произвольной природы и получение для них законов больших чисел, т.е. утверждений, состоящих в том, что эмпирические (т.е. выборочные) средние сходятся к теоретическим средним. Эти результаты будут рассмотрены в п.5.5 ниже.

4.2. Центральные предельные теоремы

В лекции 2 уже был приведен простейший вариант центральной предельной теоремы (ЦПТ) теории вероятностей.

Центральная предельная теорема (для одинаково распределенных слагаемых). Пусть $$X_1,X_2,...,X_n,..$$. - независимые одинаково распределенные случайные величины с математическими ожиданиями $$M(X_i)=m$$ и дисперсиями $$D(X_i)=\sigma^2, i=1,2,...,n,..$$.. Тогда для любого действительного числа $$x$$ существует предел$$\lim_{n\rightarrow\infty}P \left( \frac{X_1,X_2,...,X_n - nm}{\sigma\sqrt{n}}<x \right) =\Phi(x),$$ где $$\Phi(x)$$ - функция стандартного нормального распределения.

Эту теорему иногда называют теоремой Линдеберга-Леви [ $$23$$, с.122].

В ряде прикладных задач не выполнено условие одинаковой распределенности. В таких случаях центральная предельная теорема обычно остается справедливой, однако на последовательность случайных величин приходится накладывать те или иные условия. Суть этих условий состоит в том, что ни одно слагаемое не должно быть доминирующим, вклад каждого слагаемого в среднее арифметическое должен быть пренебрежимо мал по сравнению с итоговой суммой. Наиболее часто используется теорема Ляпунова.

Центральная предельная теорема (для разнораспределенных слагаемых) - теорема Ляпунова. Пусть $$X_1,X_2,...,X_n,..$$. - независимые случайные величины с математическими ожиданиями $$M(X_i)=m_i$$ и дисперсиями $$D(X_i)=\sigma_i^2\ne 0, i=1,2,...,n,..$$.. Пусть при некотором $$\delta>0$$ у всех рассматриваемых случайных величин существуют центральные моменты порядка $$2+\delta$$ и безгранично убывает "дробь Ляпунова":$$\lim_{k\rightarrow\infty}\frac{1}{B_n^{2+\delta}} \sum_{k=1}^n M|X_k-m_k|^{2+\delta} =0,$$ где$$B_k^2=\sum_{i=1}^k\sigma_i^2=D\left(\sum_{i=1}^k X_i\right).$$

Тогда для любого действительного числа $$x$$ существует предел$$\lim_{n\rightarrow\infty}P \left( \frac{X_1+X_2+...+X_n-m_1-m_2-...-m_n}{B_n}< \right) =\Phi(x),$$ где $$\Phi(x)$$ - функция стандартного нормального распределения.

В случае одинаково распределенных случайных слагаемых$$m_1=m_2=...=m_n=m,\; B_n=D(X_1+X_2+...+X_n)=\sigma\sqrt{n},$$ и теорема Ляпунова переходит в теорему Линдеберга-Леви.

История получения центральных предельных теорем для случайных величин растянулась на два века - от первых работ Муавра в 30-х годах XVIII в. до необходимых и достаточных условий, полученных Линдебергом и Феллером в 30-х годах XX в.

Теорема Линдеберга-Феллера. Пусть $$X_1,X_2,...,X_n,..$$. - независимые случайные величины с математическими ожиданиями $$M(X_i)=m_i$$ и дисперсиями $$D(X_i)=\sigma_i^2\ne, i=1,2,...,n,..$$. Предельное соотношение (1), т.е. центральная предельная теорема, выполнено тогда и только тогда, когда при любом $$\tau>0$$$$\lim_{n\rightarrow\infty}\frac{1}{B_n^2}\sum_{k=1}^n\int\limits_{|x-m_k|>\tau B_n}(x-m_k)^2 dF_k(x)=0,$$ где $$F_k(x)$$ обозначает функцию распределения случайной величины $$X_k$$.

Доказательства перечисленных в настоящем подразделе центральных предельных теорем для случайных величин можно найти в классическом курсе теории вероятностей [].

Для прикладной статистики большое значение имеет многомерная центральная предельная теорема. В ней речь идет не о сумме случайных величин, а о сумме случайных векторов.

, с.124]. Пусть $$F_n$$ обозначает совместную функцию распределения $$k$$ -мерного случайного вектора $$(X_n^{(1)},...,X_n^{(k)}), n=1,2,..$$., и $$F_{\lambda n}$$ - функция распределения линейной комбинации $$\lambda_1X_n^{(1)}+\lambda_2X_n^{(2)}+...+\lambda_k X_n^{(k)}$$. Необходимое и достаточное условие для сходимости $$F_n$$ к некоторой $$k$$ -мерной функции распределения $$F$$ состоит в том, что $$F_{\lambda n}$$ имеет предел для любого вектора $$\lambda=(\lambda_1,\lambda_2,...\lambda_k)$$.

Приведенная теорема ценна тем, что сходимость векторов сводитcя к сходимости линейных комбинаций их координат, т.е. к сходимости обычных случайных величин, рассмотренных ранее. Однако она не дает возможности непосредственно указать предельное распределение. Это можно сделать с помощью следующей теоремы.

Теорема о многомерной сходимости. Пусть $$F_n$$ и $$F_{\lambda n}$$ - те же, что в предыдущей теореме. Пусть $$F$$ - совместная функция распределения $$k$$ -мерного случайного вектора $$(X_1,...,X_k)$$. Если функция распределения $$F_{\lambda n}$$ сходится при росте объема выборки к функции распределения $$F_{\lambda}$$ для любого вектора $$\lambda$$, где $$F_{\lambda}$$ - функция распределения линейной комбинации $$\lambda_1X_1+...+\lambda_kX_k$$, то $$F_n$$ сходится к $$F$$.

Здесь сходимость $$F_n$$ к $$F$$ означает, что для любого $$k$$ -мерного вектора $$(x_1,...,x_k)$$ такого, что функция распределения $$F$$ непрерывна в $$(x_1,...,x_k)$$, числовая последовательность $$F_n(x_1,...,x_k)$$ сходится при росте $$n$$ к числу $$F(x_1,...,x_k)$$. Другими словами, сходимость функций распределения понимается ровно также, как при обсуждении предельных теорем для случайных величин выше. Приведем многомерный аналог этих теорем.

]. Рассмотрим независимые одинаково распределенные $$k$$ -мерные случайные векторы$$U'_n(U_{1n},...,U_{kn}), n=1,2,...,$$ где штрих обозначает операцию транспонирования вектора. Предположим, что случайные векторы $$U_n$$ имеют моменты первого и второго порядка, т.е.$$M(U_n)=\mu,\; D(U_n)=\Sigma,$$ где $$\mu$$ - вектор математических ожиданий координат случайного вектора, $$\Sigma$$ - его ковариационная матрица. Введем последовательность средних арифметических случайных векторов:$$\overline{U}_n=(\overline{U}_{1n},...,\overline{U}_{kn}),\; n=1,2,...,\; \overline{U}_{in}=\frac{1}{n}\sum_{j=1}^n U_{ij}.$$

Тогда случайный вектор $$\sqrt{n}(\overline{U}_n-\mu)$$ имеет асимптотическое $$k$$ -мерное нормальное распределение $$N_k(0,\Sigma)$$, т.е. он асимптотически распределен так же, как $$k$$ -мерная нормальная величина с нулевым математическим ожиданием, ковариационной $$\Sigma$$ и плотностью$$N_k(u|0,\Sigma)=(2\pi)^{-k/2}|\Sigma|^{-1/2}\exp\{-\frac12 u'\Sigma^{-1}u\}.$$

Здесь $$|\Sigma|$$ - определитель матрицы $$\Sigma$$. Другими словами, распределение случайного вектора $$\sqrt{n}(\overline{U}_n-\mu)$$ сходится к $$k$$ -мерному нормальному распределению с нулевым математическим ожиданием и ковариационной матрицей $$\Sigma$$.

Напомним, что многомерным нормальным распределением с математическим ожиданием $$\mu$$ и ковариационной матрицей $$\Sigma$$ называется распределение, имеющее плотность$$N_k(u|\mu,\Sigma)=(2\pi)^{-k/2}|\Sigma|^{-1/2} \exp\{-\frac12[(u-\mu)'\Sigma^{-1}(u-\mu)]\}.$$

Многомерная центральная предельная теорема показывает, что распределения сумм независимых одинаково распределенных случайных векторов при большом числе слагаемых хорошо приближаются с помощью нормальных распределений, имеющих такие же первые два момента (вектор математических ожиданий координат случайного вектора и его корреляционную матрицу), как и исходные векторы. От одинаковой распределенности можно отказаться, но это потребует некоторого усложнения символики. В целом из теоремы о многомерной сходимости вытекает, что многомерный случай ничем принципиально не отличается от одномерного.

Пример. Пусть $$X_1,...,X_n,..$$.- независимые одинаково распределенные случайные величины. Рассмотрим $$k$$ -мерные независимые одинаково распределенные случайные векторы$$U'_n=(X_n,X_n^2,X_n^3,...,X_n^k), n=1,2,...$$

Их математическое ожидание - вектор теоретических начальных моментов, а ковариационная матрица составлена из соответствующих центральных моментов. Тогда $$\overline{U}_n$$ - вектор выборочных начальных моментов. Многомерная центральная предельная теорема утверждает, что $$\overline{U}_n$$ имеет асимптотически нормальное распределение. Как вытекает из теорем о наследовании сходимости и о линеаризации (см. ниже), из распределения $$\overline{U}_n$$ можно вывести распределения различных функций от выборочных начальных моментов. А поскольку центральные моменты выражаются через начальные, то аналогичное утверждение верно и для них.

4.3. Теоремы о наследовании сходимости

Суть проблемы наследования сходимости. Пусть распределения случайных величин $$X_n$$ при $$n\rightarrow\infty$$ стремятся к распределению случайной величины $$X$$. При каких функциях $$f$$ можно утверждать, что распределения случайных величин $$f(X_n)$$ сходятся к распределению $$f(X)$$, т.е. наследуется сходимость?

Хорошо известно, что для непрерывных функций $$f$$ сходимость наследуется []. Однако в прикладной статистике используются различные обобщения этого утверждения. Необходимость обобщений связана с тремя обстоятельствами:

  • статистические данные могут моделироваться не только случайными величинами, но и случайными векторами, случайными множествами, случайными элементами произвольной природы (т.е. функциями на вероятностном пространстве со значениями в произвольном множестве);
  • переход к пределу должен рассматриваться не только для случая безграничного возрастания объема выборки, но и в более общих случаях. Например, если в постановке статистической задачи участвуют несколько выборок объемов $$n(1), n(2), ... , n(k)$$, то вполне обычным является предположение о безграничном росте всех этих объемов (что можно описать и как $$\min\{n(1),n(2),...,n(k)\}\rightarrow\infty)$$ ;
  • функция $$f$$ не обязательно является непрерывной. Она может иметь разрывы. Кроме того, она может зависеть от параметров, по которым происходит переход к пределу, например, может зависеть от объемов выборок. Так, в лекции 8 понадобится рассмотреть функцию $$f = f(n(1), n(2), ... , n(k))$$.
  • Расстояние Прохорова и сходимость по направленному множеству. Введем необходимые для дальнейшего изложения понятия.

    Расстояние (метрика) Прохорова. Пусть $$C$$ - некоторое пространство, $$A$$ - его подмножество, $$d$$ - метрика в $$C$$. Введем понятие $$\varepsilon$$ -окрестности множества $$A$$ в метрике $$d$$:$$S(A,\varepsilon)=\{x\in C:d(A,x)<\varepsilon\}.$$

    Таким образом, $$\varepsilon$$ -окрестность множества $$A$$ - это совокупность всех точек пространства $$C$$, отстоящих от $$A$$ не более чем на положительное число $$\varepsilon$$. При этом расстояние от точки $$x$$ до множества $$A$$ - это точная нижняя грань расстояний от $$x$$ до точек множества $$A$$, т.е.$$d(A,x)=\inf\{d(x,y):y\in A\}.$$

    Пусть $$P_1$$ и $$P_2$$ - две вероятностные меры на $$C$$ (т.е. распределения двух случайных элементов со значениями в $$C$$ ). Пусть $$D_{12}$$ - множество чисел $$\varepsilon>0$$ таких, что$$P_1(A)\le P_2(S(A,\varepsilon))+\varepsilon$$ для любого замкнутого подмножества $$A$$ пространства $$C$$ ). Пусть $$D_{21}$$ - множество чисел $$\varepsilon>0$$ таких, что$$P_2(A)\le P_1(S(A,\varepsilon))+\varepsilon$$ для любого замкнутого подмножества $$A$$ пространства $$C$$. Расстояние Прохорова $$L(P_1,P_2)$$ между вероятностными мерами (его можно рассматривать и как расстояние между случайными элементами с распределениями $$P_1$$ и $$P_2$$ соответственно) вводится формулой$$L(P_1,P_2)=\max(\inf D_{12},\inf D_{21}).$$

    С помощью метрики Прохорова формализуется понятие сходимости распределений случайных элементов в произвольном пространстве.

    Расстояние $$L(P_1,P_2)$$ введено академиком РАН Юрием Васильевичем Прохоровым в середине ХХ в. и широко используется в современной теории вероятностей.

    Сходимость по направленному множеству [, с.95 - 96]. Бинарное отношение $$>\ge$$ (упорядочение), заданное на множестве $$B$$, называется направлением на нем, если $$B$$ не пусто и

    (а) если $$m, n$$ и $$p$$ - такие элементы множества $$B$$, что $$m\ge n$$ и $$n\ge p$$, то $$m\ge p$$ ;

    (б) $$m\ge m$$ для любого $$m$$ из $$B$$ ;

    (в) если $$m$$ и $$n$$ принадлежат $$B$$, то найдется элемент $$p$$ из $$B$$ такой, что $$p\ge m $$ и $$p\ge n$$.

    Направленное множество - это пара $$(В, \ge)$$, где $$\ge$$ > - направление на множестве $$B$$. Направленностью (или "последовательностью по направленному множеству") называется пара $$(f,\ge)$$, где $$f$$ - функция, $$\ge$$ - направление на ее области определения. Пусть $$f:B\rightarrow Y$$, где $$Y$$ - топологическое пространство. Направленность $$(f, \ge)$$ сходится в топологическом пространстве $$Y$$ к точке $$y_0$$, если для любой окрестности $$U$$ точки $$y_0$$ найдется $$p$$ из $$B$$ такое, что $$f(q)\in U$$ при любом $$q\ge p$$. В таком случае говорят также о сходимости по направленному множеству.

    Пусть $$B = \{(n(1), n(2), ... , n(k))\}$$ - совокупность векторов, каждый из которых составлен из объемов $$k$$ выборок. Пусть$$(n(1), n(2), ..., n(k)) \ge (n_1(1), n_1(2), ..., n_1(k))$$ тогда и только тогда, когда $$n(_i) \ge n_1(i)$$ при всех $$i=1,2,...,k$$. Тогда $$(B,\ge)$$ - направленное множество, сходимость по которому эквивалентна сходимости при $$\min\{n(1), n(2),...,n(k)\}\rightarrow\infty$$.

    Чтобы охватить различные частные случаи, целесообразно предельные теоремы формулировать в терминах сходимости по направленному множеству. Будем писать $$B=\{\alpha\}$$. Пусть запись $$\alpha\rightarrow\infty$$ обозначает переход к пределу по направленному множеству.

    Формулировка проблемы наследования сходимости. Пусть случайные элементы $$X_{\alpha}$$ со значениями в пространстве $$C$$ сходятся при $$\alpha\rightarrow\infty$$ к случайному элементу $$X$$, где через $$\alpha\rightarrow\infty$$ обозначен переход к пределу по направленному множеству. Сходимость случайных элементов означает, что $$L(X_{\alpha},X)\rifhtarrow 0$$ при $$\alpha\rightarrow\infty$$, где $$L$$ - метрика Прохорова в пространстве $$C$$.

    Пусть $$f_{\alpha}:C\rightarrow Y$$ - некоторые функции. Какие условия надо на них наложить, чтобы из $$L(X_{\alpha},X)\rightarrow 0$$ вытекало, что $$L_1(f_{\alpha}(X_{\alpha}), f_{\alpha}(X))\rightarrow 0$$ при $$\alpha\rightarrow\infty$$, где $$L_1$$ - метрика Прохорова в пространстве $$Y$$? Другими словами, какие условия на функции $$f_{\alpha}:C\rightarrow Y$$ гарантируют наследование сходимости?

    В работах [, ] найдены необходимые и достаточные условия на функции $$f_{\alpha}:C\rightarrow Y$$, гарантирующие наследование сходимости. Описанию этих условий посвящена оставшаяся часть данного пункта.

    Приведем для полноты изложения строгие формулировки математических предположений (в дальнейшем никому, кроме профессиональных математиков, не понадобятся).

    Математические предположения. Пусть $$C$$ и $$Y$$ - полные сепарабельные метрические пространства. Пусть выполнены обычные предположения измеримости: $$X_{\alpha}$$ и $$X$$ - случайные элементы $$C, f_{\alpha}(X_{\alpha})$$ и $$f_{\alpha}(X)$$ - случайные элементы в $$Y$$, рассматриваемые ниже подмножества пространств $$C$$ и $$Y$$ лежат в соответствующих $$\sigma$$ -алгебрах измеримых подмножеств, и т.д.

    Понадобятся некоторые определения. Разбиение $$Т_n = \{C_{1n}, C_{2n}, ..., C_{nn}\}$$ пространства $$C$$ - это такой набор подмножеств $$C_j, j = 1, 2, ..., n$$, этого пространства, что пересечение любых двух из них пусто, а объединение совпадает с $$C$$. Диаметром $$diam(A)$$ подмножества $$A$$ множества $$C$$ называется точная верхняя грань расстояний между элементами $$A$$, т.е.$$diam(A) = \sup \{d(x,y), x\in A, y\in A},$$

    где $$d(x,y)$$ - метрика в пространстве $$C$$. Обозначим $$\partial A$$ границу множества $$A$$, т.е. совокупность точек х таких, что любая их окрестность $$U(x)$$ имеет непустое пересечение как с $$A$$, так и с $$C\A$$. Колебанием $$\delta(f,B)$$ функции $$f$$ на подмножестве $$B$$ множества $$C$$ называется $$\delta(f,B)= \sup\{d(x,y)|x\in B, y\in B}$$.

    Достаточное условие для наследования сходимости. Пусть $$L(X_{\alpha},X)\rightarrow 0$$ при $$\alpha\rightarrow\infty$$. Пусть существует последовательность $$T_n$$ разбиений пространства $$C$$ такая, что $$P(X\in\partial A) = 0$$ для любого $$A$$ из $$T_n$$ и, основное условие, для любого $$\varepsilon> 0$$$$m_{\varepsilon}(\alpha,n)=\sum P(X\in A)\rightarrow 0$$ при $$n\rightarrow\infty$$ и $$\alpha\rightarrow\infty$$, где сумма берется по всем тем $$A$$ из $$T_n$$, для которых колебание функции $$f_{/alpha}$$ на $$A$$ больше $$\varepsilon$$, т.е. $$\delta(f_{\alpha},A)>\varepsilon$$. Тогда $$L_1(f_{alpha}(X_{\alpha}), f_{alpha}(X)) \rightarrow 0$$ при $$\alpha\rightarrow\infty$$.

    Необходимое условие для наследования сходимости. Пусть $$Y$$ - конечномерное линейное пространство, $$Y = R^k$$. Пусть случайные элементы $$f_{}\alpha(X)$$ асимптотически ограничены по вероятности при $$\alpha\rightarrow\infty$$, т.е. для любого $$\varepsilon>0$$ существуют число $$S(\varepsilon)$$ и элемент направленного множества $$\alpha(\varepsilon)$$ такие, что $$P(||f_{\alpha}(X)||>S(\varepsilon))<\varepsilon$$ при $$\alpha\ge\alpha(\epsilon)$$, где $$||f_{alpha}(X)||$$ - норма (длина) вектора $$f_alpha(X)$$. Пусть существует последовательность $$T_n$$ разбиений пространства $$C$$ такая, что$$\lim_{n\rightarrow\infty}\max\{diam(C_{jn}),C_{jn}\in T_n\}=0,$$ т.е. последовательность $$T_n$$ является безгранично измельчающейся. Самое существенное - пусть условие (1) не выполнено для последовательности $$T_n$$. Тогда существует последовательность случайных элементов $$X_{\alpha}$$ такая, что $$L(X_\alpha,X)\rightarrow 0$$ при $$\alpha\rightarrow\infty$$, но $$L_1(f(X_{\alpha}),f_{\alpha}(X))$$ не сходится к 0 при $$\alpha\rightarrow\infty$$.

    Несколько огрубляя, можно сказать, что условие (1) является необходимым и достаточным для наследования сходимости.

    Пример 1. Пусть $$C$$ и $$Y$$ - конечномерные линейные пространства, функции $$f_{\alpha}$$ не зависят от $$\alpha$$, т.е. $$f_{\alpha}\equiv f$$, причем функция $$f$$ ограничена. Тогда условие (1) эквивалентно требованию интегрируемости по Риману-Стилтьесу функции $$f$$ по мере $$G(A)=P(X\in A)$$. В частности, условие (1) выполнено для непрерывной функции $$f$$.

    В конечномерных пространствах $$C$$ вместо сходимости $$L(X_{\alpha},X)\rightarrow 0$$ при $$\alpha\rightarrow\infty$$ можно говорить о слабой сходимости функций распределения случайных векторов $$X_{\alpha}$$ к функции распределения случайного вектора $$X$$. Речь идет о "сходимости по распределению", т.е. о сходимости во всех точках непрерывности функции распределения случайного вектора $$X$$. В этом случае разбиения могут состоять из многомерных параллелепипедов [, гл.2].

    Пример 2. Полученные выше результаты дают обоснование для следующих рассуждений (ср., например, утверждения в лекции 8). Пусть по двум независимым выборкам объемов $$m$$ и $$n$$ соответственно построены статистики $$X_m$$ и $$Y_n$$. Пусть известно, что распределения этих статистик сходятся при безграничном росте объемов выборок к стандартному нормальному распределению с математическим ожиданием 0 и дисперсией 1. Пусть $$a(m, n)$$ и $$b(m, n)$$ - некоторые коэффициенты. Тогда согласно результатам примера 1 распределение случайной величины $$Z(m,n) = a(m,n)X_m + b(m, n)Y_n$$ сближается с распределением нормально распределенной случайной величины с математическим ожиданием 0 и дисперсией $$a^2(m,n)+b^2(m,n)$$. Если же $$a^2(m,n)+b^2(m,n)=1$$, например,$$a(m,n)=\sqrt{\frac{m}{m+n}}.\quad b(m,n)=\sqrt{\frac{n}{m+n}},$$ то распределение $$Z(m,n)$$ сходится при безграничном росте объемов выборок к стандартному нормальному распределению с математическим ожиданием 0 и дисперсией 1.

    4.4. Метод линеаризации

    При разработке методов прикладной статистики часто возникает следующая задача [, с.338]. Имеется последовательность k-мерных случайных векторов $$X_n = (X_{1n}, X_{2n}, ... , X_{kn}), n=1,2,..$$., такая, что $$X_n \rightarrow a=(a_1, a_2,...,a_k)$$ при $$n\rightarrow\infty$$, и последовательность функций $$f_n:R^k\rightarrow R_1$$. Требуется найти распределение случайной величины $$f_n(X_n)$$.

    Основная идея - рассмотреть главный линейный член функции $$f_n$$ в окрестности точки $$a$$. Из математического анализа известно, что$$f_n(X_n)-f_n(a)=\sum_{j=1}^k\frac{\partial f_n(a)}{\partial x_j}(X_{jn}-a_j)+O_n(||X_n-a||^2),$$ где остаточный член является бесконечно малой величиной более высокого порядка малости, чем линейный член. Таким образом, произвольная функция может быть заменена на линейную функцию от координат случайного вектора. Эта замена проводится с точностью до бесконечно малых более высокого порядка. Конечно, должны быть выполнены некоторые математические условия регулярности. Например, функции $$f_n$$ должны быть дважды непрерывно дифференцируемы в окрестности точки $$а$$.

    Если вектор $$X_n$$ является асимптотически нормальным с математическим ожиданием $$а$$ и ковариационной матрицей $$\Sigma/n$$, где $$\Sigma = ||\sigma_{ij}||$$, причем $$\sigma_{ij} = nM(X_i - a_i)(X_j - a_j)$$, то линейная функция от его координат также асимптотически нормальна. Следовательно, при очевидных условиях регулярности $$f_n(X_n)$$ - асимптотически нормальная случайная величина с математическим ожиданием $$f_n(а)$$ и дисперсией$$\frac{1}{n}\sum_{i=1}^k\sum_{j=1}^k \frac{\partial f_n(a)}{\partial x_i}\frac{\partial f_n(a)}{\partial x_j}\sigma_{ij}.$$

    Для практического использования асимптотической нормальности $$f_n(X_n)$$ остается заменить неизвестные моменты $$a$$ и $$\Sigma$$ на их оценки. Например, если $$X_n$$ - это среднее арифметическое независимых одинаково распределенных случайных векторов, то а можно заменить на $$X_n$$, а $$\Sigma$$ - на выборочную ковариационную матрицу.

    Пример. Пусть $$Y_1, Y_2, ..., Y_n$$ - независимые одинаково распределенные случайные величины с математическим ожиданием $$a$$ и дисперсией $$\sigma^2$$. В качестве $$X_n(k=1)$$ рассмотрим выборочное среднее арифметическое$$\overline{Y}=\frac{Y_1+Y_2+...+Y_n}{n}$$

    Как известно, в силу закона больших чисел $$\overline{Y}\rightarrow a=M(Y)$$. Следовательно, для получения распределений функций от выборочного среднего арифметического можно использовать метод линеаризации. В качестве примера рассмотрим $$f_n(y) = f(y) = y^2$$. Тогда$$(\overline{Y})^2-a^2=\frac{df(a)}{dy}(\overline{Y}-a)+O((\overline{Y}-a)^2) =2a(\overline{Y}-a)+O((\overline{Y}-a)^2).$$

    Из этого соотношения следует, что с точностью до бесконечно малых более высокого порядка$$(\overline{Y})^2=a^2+2a(\overline{Y}-a)$$

    Поскольку в соответствии с центральной предельной теоремой выборочное среднее арифметическое является асимптотически нормальной случайной величиной с математическим ожиданием $$a$$ и дисперсией $$\sigma^2/n$$, то квадрат этой статистики является асимптотически нормальной случайной величиной с математическим ожиданием $$a^2$$ и дисперсией $$4a^2\sigma^2/n$$. Для практического использования может оказаться полезной замена параметров (асимптотического нормального распределения) на их оценки, а именно, математического ожидания - на $$(\overline{Y})^2$$, а дисперсии - на $$4(\overline{Y})^2 s^2/n$$, где $$s^2$$ - выборочная дисперсия.

    Большое внимание (целая глава!) уделено методу линеаризации в классическом учебнике Е.С. Вентцель [].

    4.5. Принцип инвариантности

    Пусть $$Y_1, Y_2, ..., Y_n$$ - независимые одинаково распределенные случайные величины с непрерывной функцией распределения $$F(x)$$. Многие используемые в прикладной статистике функции от результатов наблюдений выражаются через эмпирическую функцию распределения $$F_n(x)$$. К ним относятся статистики Колмогорова, Смирнова, омега-квадрат. Отметим, что и другие статистики выражаются через эмпирическую функцию распределения, например:$$\overline{Y}=\int\limits_{-\infty}^{+\infty} xdF_n(x).$$

    Полезным является преобразование Н.В.Смирнова $$t=F(x)$$. Тогда независимые случайные величины $$Z_j=F(Y_j), j=1,2,...,n$$, имеют равномерное распределение на отрезке [0; 1]. Рассмотрим построенную по ним эмпирическую функцию распределения $$F_n(t), 0\le t\le 1$$. Эмпирическим процессом называется случайный процесс$$\xi_n(t)=\sqrt{n}(F_n(t)-t).$$

    Рассмотрим критерии проверки согласия функции распределения выборки с фиксированной функцией распределения $$F(x)$$. Статистика критерия Колмогорова записывается в виде$$K_n=\sup_{0\le t\le 1}|\xi_n(t)|,$$ статистика критерия Смирнова - это$$S_n=\sup_{0\le t\le 1}\xi_n(t),$$ а статистика критерия омега-квадрат (Крамера-Мизеса-Смирнова) имеет вид$$\omega_n^2=\int\limits_0^1 \xi_n^2(t)dt.$$

    Случайный процесс $$\xi_n(t)$$ имеет нулевое математическое ожидание и ковариационную функцию $$М\xi_n(s)\xi_n(t)=\min(s,t)-st$$. Рассмотрим гауссовский случайный процесс $$\xi(t)$$ с такими же математическим ожиданием и ковариационной функцией. Он называется броуновским мостом. (Напомним, что гауссовским процесс именуется потому, что вектор $$(\xi(t1), \xi(t2), ..., \xi(tk))$$ имеет многомерное нормальное распределение при любых наборах моментов времени $$t1, t2, ..., tk$$.)

    Пусть $$f$$ - функционал, определенный на множестве возможных траекторий случайных процессов. ] состоит в том, что последовательность распределений случайных величин $$f(\xi_n)$$ сходится при $$n\rightarrow\infty$$ к распределению случайной величины $$f(\xi)$$. Сходимость по распределению обозначим символом $$\Rightarrow$$. Тогда принцип инвариантности кратко записывается так: $$f(\xi_n)\Rightarrow f(\xi)$$. В частности, согласно принципу инвариантности статистика Колмогорова и статистика омега квадрат сходятся по распределению к распределениям соответствующих функционалов от случайного процесса $$\xi$$:$$K_n=\sup_{0\le t\le 1}|\xi_n(t)|\Rightarrow\sup_{0\le t\le 1}|\xi(t)|, \omega_n^2=\int\limits_0^1\xi_n^2(t)dt\Rightarrow\int\limits_0^1\xi^2(t)dt.$$

    Таким образом, от проблем прикладной статистики сделан переход к теории случайных процессов. Методами этой теории найдены распределения случайных величин

    $$\sup_{0\le t\le 1},\; \int_0^1\xi^2(t)dt.$$

    Принцип инвариантности - инструмент получения предельных распределений функций от результатов наблюдений, используемых в прикладной статистике.

    Обоснование принципу инвариантности может быть дано на основе теории сходимости вероятностных мер в функциональных пространствах []. Более простой подход, позволяющий к тому же получать необходимые и достаточные условия в предельной теории статистик интегрального типа (принцип инвариантности к ним нельзя применить), рассмотрен в лекции 7.

    Почему "принцип инвариантности" так назван? Обратим внимание, что предельные распределения рассматриваемых статистик не зависят от их функции распределения $$F(x)$$. Другими словами, предельное распределение инвариантно относительно выбора $$F(x)$$.

    В более широком смысле термин "принцип инвариантности" применяют тогда, когда предельное распределение не зависит от тех или иных характеристик исходных распределений []. В этом смысле наиболее известный "принцип инвариантности" - это центральная предельная теорема, поскольку предельное стандартное нормальное распределение - одно и то же для всех возможных распределений независимых одинаково распределенных слагаемых (лишь бы слагаемые имели конечные математическое ожидание и дисперсию).

    4.6. Нечеткие множества как проекции случайных множеств

    Нечеткость и случайность. С самого начала появления современной теории нечеткости в 1960-е годы (см. лекцию 1) началось обсуждение ее взаимоотношений с теорией вероятностей. Дело в том, что функция принадлежности нечеткого множества напоминает распределение вероятностей. Отличие состоит только в том, что сумма вероятностей по всем возможным значениям случайной величины (или интеграл, если множество возможных значений неcчетно) всегда равна 1, а сумма $$S$$ значений функции принадлежности (в непрерывном случае - интеграл от функции принадлежности) может быть любым неотрицательным числом. Возникает искушение пронормировать функцию принадлежности, т.е. разделить все ее значения на $$S$$ (при $$S\ne 0$$ ), чтобы свести ее к распределению вероятностей (или к плотности вероятности). Однако специалисты по нечеткости справедливо возражают против такого "примитивного" сведения, поскольку оно проводится отдельно для каждой размытости (нечеткого множества), и определения обычных операций над нечеткими множествами с ним согласовать нельзя. Последнее утверждение означает следующее. Пусть указанным образом преобразованы функции принадлежности нечетких множеств $$A$$ и $$B$$. Как при этом преобразуются функции принадлежности $$A\cap B,A|cup B,A+B,AB$$? Установить это невозможно в принципе. Последнее утверждение становится совершенно ясным после рассмотрения нескольких примеров пар нечетких множеств с одними и теми же суммами значений функций принадлежности, но различными результатами теоретико-множественных операций над ними. Причем и суммы значений соответствующих функций принадлежности для этих результатов теоретико-множественных операций, (например, для пересечений множеств), также различны.

    В работах по нечетким множествам время от времени утверждается, что теория нечеткости является самостоятельным разделом прикладной математики и не имеет отношения к теории вероятностей (см., например, обзор литературы в монографиях [ $$16$$, $$17$$ ]). Некоторые авторы, сравнивавшие теорию нечеткости и теорию вероятностей, подчеркивали различие между этими областями теоретических и прикладных исследований. Обычно сравнивают аксиоматику и сравнивают области приложений. Надо сразу отметить, что аргументы при втором типе сравнений не имеют доказательной силы, поскольку по поводу границ применимости даже такой давно выделившейся научной области, как вероятностно-статистические методы, имеются различные мнения. Напомним, что итог рассуждений одного из наиболее известных французских математиков Анри Лебега по поводу границ применимости арифметики таков: "Арифметика применима тогда, когда она применима" (см. его монографию [ $$12$$, с.21-22]).

    При сравнении различных аксиоматик теории нечеткости и теории вероятностей нетрудно увидеть, что списки аксиом различаются. Из этого, однако, отнюдь не следует, что между указанными теориями нельзя установить связь, типа известного сведения евклидовой геометрии на плоскости к арифметике (точнее к теории числовой системы $$R^2$$ - см., например, монографию []). Напомним, что эти две аксиоматики - евклидовой геометрии и арифметики - на первый взгляд весьма сильно различаются.

    Можно понять желание энтузиастов теории нечеткости подчеркнуть принципиальную новизну своего научного аппарата. Однако не менее важно установить связи этого подхода с ранее известными.

    ] было показано, что нечеткие множества естественно рассматривать как "проекции" случайных множеств. Рассмотрим этот метод сведения теории нечетких множеств к теории случайных множеств.

    Определение 1. Пусть $$A=A(\omega)$$ - случайное подмножество конечного множества $$Y$$. Нечеткое множество $$B$$, определенное на $$Y$$, называется проекцией $$A$$ и обозначается $$Proj A$$, если$$\mu_B(y)=P(y\in A)$$ при всех $$y\in Y$$.

    Очевидно, каждому случайному множеству $$A$$ можно поставить в соответствие с помощью формулы (1) нечеткое множество $$B = Proj A$$. Оказывается, верно и обратное.

    Теорема 1. Для любого нечеткого подмножества $$B$$ конечного множества $$Y$$ существует случайное подмножество $$A$$ множества $$Y$$ такое, что $$B = Proj A$$.

    Доказательство. Достаточно задать распределение случайного множества $$A$$. Пусть $$Y_1$$ - носитель $$B$$ (см. определение 1 в п.1.4). Без ограничения общности можно считать, что $$Y_1=\{y_1,y_2,...,y_m\}$$ при некотором $$m$$ и элементы $$Y_1$$ занумерованы в таком порядке, что$$0<\mu_B(y_1)\le\mu_B(y_2)\le ...\le\mu_B(y_m)$$

    Введем множества$$Y(1)=Y_1,Y(2)=\{y_2,...,y_m\},...,Y(t)=\{y_t,...,y_m\},...,Y(m)=\{y_m\}.$$

    Положим$$\begin{gathered} P(A=Y(1))=\mu_B(y_1),P(A=Y(2))=\mu_B(y_2)-\mu_B(y_1),..., \\ P(A=Y(t))=\mu_B(y_t)-\mu_B(y_{t-1}),...,P(A=Y(m))=\mu_B(y_m)=\mu_B(y_{m-1}), \\ P(A=\varnothing)=1-\mu_B(y_m). \end{gathered}$$

    Для всех остальных подмножеств $$X$$ множества $$Y$$ положим $$P(A=X)=0$$. Поскольку элемент $$y_t$$ входит во множества $$Y(1), Y(2),..., Y(t)$$ и не входит во множества $$Y(t+1),...,Y(m)$$, то из приведенных выше формул следует, что $$P(y_t\in A)=\mu_B(y_t)$$. Если $$y\notin Y_1$$, то, очевидно, $$P(y\in A)=0$$ Теорема 1 доказана.

    Распределение случайного множества с независимыми элементами, как следует из рассмотрений главы 8 монографии [], полностью определяется его проекцией. Для конечного случайного множества общего вида это не так. Для уточнения сказанного понадобится следующая теорема.

    Теорема 2. Для случайного подмножества $$A$$ множества $$Y$$ из конечного числа элементов наборы чисел $$P(A=X),X\subseteq Y $$, и $$P(X\subseteq A),X\subseteq Y$$, выражаются один через другой.

    Доказательство. Второй набор выражается через первый следующим образом:$$P(X\subseteq A)=\sum_{X':X\subseteq X'}P(A=X')$$

    Элементы первого набора выразить через второй можно с помощью формулы включений и исключений из формальной логики, в соответствии с которой$$P(A=X)=P(X\subseteq A)-\sum P(X\bigcup\{y\}\subseteq A)+ \sum P(X\bigcup\{y_1,y_2\}\subseteq A)-...\pm P(Y\subseteq A).$$

    В этой формуле в первой сумме у пробегает все элементы множества $$Y\X$$, во второй сумме переменные суммирования $$y_1$$ и $$y_2$$ не совпадают и также пробегают это множество, и т.д. Ссылка на формулу включений и исключений завершает доказательство теоремы 2.

    В соответствии с теоремой 2 случайное множество $$A$$ можно характеризовать не только распределением, но и набором чисел $$P(X\subseteq A),X\subseteq Y$$. В этом наборе $$P(\varnothing\subseteq A)=1$$, а других связей типа равенств нет. В этот набор входят числа $$P(\{y\}\subseteq A)=P(y\in A)$$, следовательно, фиксация проекции случайного множества эквивалентна фиксации $$k = Card(Y)$$ параметров из $$(2^k-1)$$ параметров, задающих распределение случайного множества $$A$$ в общем случае.

    При доказательстве основных результатов будет использоваться следующая теорема.

    Теорема 3. Если $$Proj A = B$$, то $$Proj \overline{A}=\overline{B}$$.

    Для доказательства достаточно воспользоваться тождеством из теории случайных множеств $$P(\overline{A}=X)=P(A=\overline{X})$$, формулой для вероятности накрытия $$P(y\in A)$$, определением отрицания нечеткого множества и тем, что сумма всех $$P(A=X)$$ равна 1. При этом под формулой для вероятности накрытия имеется в виду следующее утверждение: чтобы найти вероятность накрытия фиксированного элемента $$q$$ случайным подмножеством $$S$$ конечного множества $$Q$$, достаточно вычислить$$P(q\in S)=P(\{\omega:q\in S(\omega)\})= \sum_{A:q\in A,A\subseteq 2^Q}P(S=A,)$$ где суммирование идет по всем подмножествам $$A$$ множества $$Q$$, содержащим $$q$$.

    Пересечения и произведения нечетких и случайных множеств. Выясним, как операции над случайными множествами соотносятся с операциями над их проекциями. В силу законов де Моргана (теорема 1 в п.1.4) и теоремы 3 достаточно рассмотреть операцию пересечения случайных множеств.

    Теорема 4. Если случайные подмножества $$A_1$$ и $$A_2$$ конечного множества $$Y$$ независимы, то нечеткое множество $$Proj (A_1\cap A_2)$$ является произведением нечетких множеств $$Proj A_1$$ и $$Proj A_2$$.

    Доказательство. Надо показать, что для любого $$y\in Y$$$$P(y\in A_1\cap A_2)=P(y\in A_1)P(y\in A_2)$$

    По формуле для вероятности накрытия точки случайным множеством (см. выше)$$P(y\in A_1\cap A_2)=\sum_{X:y\in X}P((A_1\cap A_2)=X).$$

    Легко проверить, что распределение пересечения случайных множеств $$A_1\cap A_2$$ можно выразить через их совместное распределение следующим образом:$$P(A_1\cap A_2=X)=\sum_{X_1,X_2:X_1\cap X_2=X}P(A_1=X_1,A_2=X_2).$$

    Из соотношений (3) и (4) следует, что вероятность накрытия для пересечения случайных множеств можно представить в виде двойной суммы$$P(y\in A_1\cap A_2)=\sum_{X:y\in X}\sum_{X_1,X_2:X_1\cap X_2=X}P(A_1=X_1,A_2=X_2)$$

    Заметим теперь, что правую часть формулы (5) можно переписать следующим образом:$$\sum_{X_1,X_2:y\in X_1,y\in X_2}P(A_1=X_1,A_2=X_2)$$

    Действительно, формула (5) отличается от формулы (6) лишь тем, что в ней сгруппированы члены, в которых пересечение переменных суммирования $$X_1\cap X_2$$ принимает постоянное значение. Воспользовавшись определением независимости случайных множеств и правилом перемножения сумм, получаем, что из (5) и (6) вытекает равенство$$P(y\in A_1\cap A_2)= \left( \sum_{X_1:y\in X_1}P(A_1=X_1) \right) \left( \sum_{X_2:y\in X_2}P(A_2=X_2) \right).$$

    Для завершения доказательства теоремы 4 достаточно еще раз сослаться на формулу для вероятности накрытия точки случайным множеством.

    Определение 2. Носителем случайного множества $$C$$ называется совокупность всех тех элементов $$y\in Y$$, для которых $$P(y\in C)>0$$.

    Теорема 5. Равенство$$Proj(A_1\cap A_2)=(Proj A_1)\cap(Proj A_2)$$ верно тогда и только тогда, когда пересечение носителей случайных множеств $$\overline{A_1}\cap A_2$$ и $$A_1\cap\overline{A_2}$$ пусто.

    Доказательство. Необходимо выяснить условия, при которых$$P(y\in A_1\cap A_2)=\min(P(y\in A_1),P(y\in A_2))$$

    Положим$$p_1=P(y\in A_1\cap A_2),p_2=P(y\in\overline{A_1}\cap A_2), p_3=P(y\in A_1\cap\overline{A_2}).$$

    Тогда равенство (7) сводится к условию$$p_1=\min(p_1+p_2,p_1+p_3)$$

    Ясно, что соотношение (8) выполнено тогда и только тогда, когда $$р_{2р3} = 0$$ при всех $$y\in Y$$, т.е. не существует ни одного элемента $$y_0\in Y$$ такого, что одновременно $$P(y_0\in\overline{A_1}\cap A_2)>0$$ и $$P(y_0\in A_1\cap\overline{A_2}>0)$$, а это эквивалентно пустоте пересечения носителей случайных множеств $$\overline{A_1}\cap A_2$$ и $$A_1\cap\overline{A_2}$$. Теорема 5 доказана.

    ] началось с введения случайных множеств с целью развития и обобщения аппарата нечетких множеств Л. Заде. Дело в том, что математический аппарат нечетких множеств не позволяет в должной мере учитывать различные варианты зависимости между понятиями (объектами), моделируемыми с его помощью, не является достаточно гибким. Так, для описания "общей части" двух нечетких множеств есть лишь две операции - произведение и пересечение. Если применяется первая из них, то фактически предполагается, что множества ведут себя как проекции независимых случайных множеств (см. выше теорему 4). Операция пересечения также накладывает вполне определенные ограничения на вид зависимости между множествами (см. выше теорему 5), причем в этом случае найдены даже необходимые и достаточные условия. Желательно иметь более широкие возможности для моделирования зависимости между множествами (понятиями, объектами). Использование математического аппарата случайных множеств предоставляет такие возможности.

    Цель сведения теории нечетких множеств к теории случайных множеств состоит в том, чтобы за любой конструкцией из нечетких множеств увидеть конструкцию из случайных множеств, определяющую свойства первой, аналогично тому, как за плотностью распределения вероятностей мы видим случайную величину. Рассмотрим результаты по сведению алгебры нечетких множеств к алгебре случайных множеств.

    Определение 3. Вероятностное пространство $$\{\Omega, G, P\}$$ назовем делимым, если для любого измеримого множества $$Х\in G$$ и любого положительного числа $$\alpha$$, меньшего $$Р(Х)$$, можно указать измеримое множество $$Y\subset X$$ такое, что $$P(Y)=\alpha$$.

    Пример. Пусть $$\Omega$$ - единичный куб конечномерного линейного пространства, $$G$$ есть сигма-алгебра борелевских множеств, а $$P$$ - мера Лебега. Тогда $$\{\Omega, G, P\}$$ - делимое вероятностное пространство.

    Таким образом, делимое вероятностное пространство - это не экзотика. Обычный куб является примером такого пространства.

    Доказательство сформулированного в примере утверждения проводится стандартными математическими приемами. Они основаны на том, что измеримое множество можно сколь угодно точно приблизить открытыми множествами, последние представляются в виде суммы не более чем счетного числа открытых шаров, а для шаров делимость проверяется непосредственно (от шара $$X$$ тело объема $$\alpha<P(X)$$ отделяется соответствующей плоскостью).

    Теорема 6. Пусть даны случайное множество $$A$$ на делимом вероятностном пространстве $$\{\Omega, G, P\}$$ со значениями во множестве всех подмножеств множества $$Y$$ из конечного числа элементов, и нечеткое множество $$D$$ на $$Y$$. Тогда существуют случайные множества $$C_1, C_2, C_3, C_4$$ на том же вероятностном пространстве такие, что$$\begin{gathered} Proj(A\bigcap C_1)=B\bigcap D,Proj(A\bigcap C_2)=BD,Proj(A\bigcup C_3)=B\bigcup D,\\ Proj(A\bigcup C_4)=B+D, Proj C_i=D,i=1,2,3,4, \end{gathered}$$ где $$B = Proj A$$.

    Доказательство. В силу справедливости законов де Моргана для нечетких (см. теорему 1 в п.1.4 выше) и для случайных множеств, а также теоремы 3 выше (об отрицаниях) достаточно доказать существование случайных множеств $$C_1$$ и $$C_2$$.

    Рассмотрим распределение вероятностей во множестве всех подмножеств множества $$Y$$, соответствующее случайному множеству $$C$$ такому, что $$Proj C = D$$ (оно существует в силу теоремы 1). Построим случайное множество $$C_2$$ с указанным распределением, независимое от $$A$$. Тогда $$Proj(A\cap C_2)=BD$$ по теореме 4.

    Перейдем к построению случайного множества $$C_1$$. По теореме 5 необходимо и достаточно определить случайное множество $$C_1(\omega)$$ так, чтобы $$Proj C_1 = D$$ и пересечение носителей случайных множеств $$A\cap\overline{C_1}$$ и $$\overline{A}\cap C_1$$ было пусто, т.е.$$p_3=P(y\in A\cap\overline{C_1})=0$$ для $$y\in Y_1=\{y:\mu_B(y)\le\mu_D(y)\}$$ и$$p_2=P(y\in\overline{A}\cap C_1)=0$$ для $$y\in Y_2=\{y:\mu_B(y)\le\mu_D(y)\}$$.

    Построим $$C_1(\omega)$$, исходя из заданного случайного множества A(\omega). Пусть $$y_1\in Y_2$$. Исключим элемент $$y_1$$ из $$A(\omega)$$ для стольких элементарных событий $$\omega$$, чтобы для полученного случайного множества $$A_1(\omega)$$ было справедливо равенство$$P(y_1\in A_1)=\mu_D(y_1)$$ (именно здесь используется делимость вероятностного пространства, на котором задано случайное множество $$A(\omega)$$ ). Для $$y\ne y_1$$, очевидно,$$P(y\in A_1)=P(y\in A).$$

    Аналогичным образом последовательно исключаем $$y$$ из $$A(\omega)$$ для всех $$y\in Y_2$$ и добавляем $$y$$ в $$A(\omega)$$ для всех $$y\in Y_1$$, меняя на каждом шагу $$P(y\in A_i)$$ только для $$y=y_1$$ так, чтобы$$P(y_i)\in A_i=\mu_D(y_i)$$ (ясно, что при рассмотрении $$y_i\in Y_1\cap Y_2$$ случайное множество $$A_i(\omega)$$ не меняется). Перебрав все элементы $$Y$$, получим случайное множество $$A_k(\omega)=C_1(\omega)$$, для которого выполнено требуемое. Теорема 6 доказана.

    Основной результат о сведении теории нечетких множеств к теории случайных множеств дается следующей теоремой.

    Теорема 7. Пусть $$B_1, B_2, B_3, ..., B_t$$ - некоторые нечеткие подмножества множества $$Y$$ из конечного числа элементов. Рассмотрим результаты последовательного выполнения теоретико-множественных операций$$B^m=((...((B_1\circ B_2)\circ B_3)\circ ...)\circB_{m-1})\circ B_m, m=1,2,...,t,$$ где $$\circ$$ - символ одной из следующих теоретико-множественных операций над нечеткими множествами: пересечение, произведение, объединение, сумма (на разных местах могут стоять разные символы). Тогда существуют случайные подмножества $$A_1, A_2, A_3, ..., A_t$$ того же множества $$Y$$ такие, что$$Proj A_j=B_i,i=1,2,...,t,$$ и, кроме того, результаты теоретико-множественных операций связаны аналогичными соотношениями$$Proj\{((...((A_1\otimes A_2)\otimes A_3)\otimes...)\otimes A_{m-1})\otimes A_m\}=B^m, m=1,2,...,t,$$ где знак $$\otimes$$ означает, что на рассматриваемом месте стоит символ пересечения $$\cap$$ случайных множеств, если в определении $$B_m$$ стоит символ пересечения или символ произведения нечетких множеств, и соответственно символ объединения $$\cup$$ случайных множеств, если в $$B_m$$ стоит символ объединения или символ суммы нечетких множеств.

    Комментарий. Поясним содержание теоремы. Например, если$$B^5=(((B_1+B_2)\cap B_3)B_4)\cup B_5,$$ то$$(((A_1\otimes A_2)\otimes A_3)\otimes A_4)\otimes A_5=(((A_1\cup A_2)\cap A_3)\cap A_4)\cup A_5.$$

    Как совместить справедливость дистрибутивного закона для случайных множеств (вытекающего из его справедливости для обычных множеств) с теоремой 2 п.1.4 выше, в которой показано, что для нечетких множеств, вообще говоря, $$(B_1+B_2)B_3\ne B_1B_3+B_2B_3$$? Дело в том, что хотя в соответствии с теоремой 7 для любых трех нечетких множеств $$B_1, B_2$$ и $$B_3$$ можно указать три случайных множества $$A_1, A_2$$ и $$A_3$$ такие, что$$Proj(A_i)=B_i, i=1,2,3, Proj (A_1\cup A_2)=B_1+B_2, Proj((A_1\cup A_2)|cap A_3)=B^3,$$ где$$B^3=(B_1+B_2)B_3,$$ но при этом, вообще говоря,$$Proj(A_1\cup A_3)\ne B_1B_3$$ и, кроме случаев, указанных в теореме 2 п.1.4,$$Proj(A_1\cup A_2)\cap A_3)\ne B_1B_3+B_2B_3.$$

    Доказательство теоремы 7 проводится методом математической индукции. При $$t = 1$$ распределение случайного множества строится с помощью теоремы 1. Затем конструируется само случайное множество $$A_1$$, определенное на делимом вероятностном пространстве (нетрудно проверить, что на делимом вероятностном пространстве можно построить случайное подмножество конечного множества с любым заданным распределением именно в силу делимости пространства). Далее случайные множества $$A_2, A_3, ..., A_t$$ строим по индукции с помощью теоремы 6. Теорема 7 доказана.

    Замечание. Проведенное доказательство теоремы 9 проходит и в случае, когда при определении $$B^m$$ используются отрицания, точнее, кроме $$B^m$$ ранее введенного вида используются также последовательности результатов теоретико-множественных операций, очередной шаг в которых имеет вид$$B_1^m=\overline{B^{m-1}}\circ B_m, B_2^m=B^{m-1}\circ \overline{B_m}, B_3^m=\overline{B^{m-1}}\circ \overline{B_m}.$$

    А именно, сначала при помощи законов де Моргана (теорема 1 п.1.4 выше) проводится преобразование, в результате которого в последовательности $$B^m$$ остаются только отрицания отдельных подмножеств из совокупности $$B_1, B_2, B_3, ..., B_t$$, а затем с помощью теоремы 3 вообще удается избавиться от отрицаний и вернуться к условиям теоремы 7.

    Итак, в настоящем параграфе описаны связи между такими объектами нечисловой природы, как нечеткие и случайные множества, установленные в нашей стране в первой половине 1970-х годов. Через несколько лет, а именно, в начале 1980-х годов, близкие подходы стали развиваться и за рубежом. Одна из работ [] носит примечательное название "Нечеткие множества как классы эквивалентности случайных множеств".

    В прикладной статистике и эконометрике []).

    4.7. Устойчивость выводов и принцип уравнивания погрешностей

    Устойчивость математических моделей. Проблемам познания, в том числе в технических исследованиях, естественно-научных и социально-экономических областях, посвящено огромное количество работ. Однако это не значит, что обо всем в этой области уже все сказано. А о некоторых положениях целесообразно говорить еще и еще раз, пока они ни станут общеизвестными.

    В идеале каждую модель порождения и анализа данных следовало бы рассматривать как аксиоматическую теорию. В этом идеальном случае создание и использование модели происходит в соответствии с известной триадой "практика - теория - практика". А именно, сначала вводятся некоторые математические объекты, соответствующие интересующим исследователя реальным объектам, и на основе представлений о свойствах реальных объектов формулируются необходимые для успешного моделирования свойства математических объектов, которые и принимаются в качестве аксиом. Затем аксиоматическая теория развивается как часть математики, вне связи с представлениями о реальных объектах. На заключительном этапе полученные в математической теории результаты интерпретируются содержательно. Получаются утверждения о реальных объектах, являющиеся следствиями тех и только тех их свойств, которые ранее были аксиоматизированы.

    После построения математической модели реального явления или процесса встает вопрос об ее адекватности. Иногда ответ на этот вопрос может дать эксперимент. Рассогласование модельных и экспериментальных данных следует интерпретировать как признак неадекватности некоторых из принятых аксиом. Однако для проверки адекватности социально-экономических моделей зачастую невозможно поставить решающий эксперимент в отличие, скажем, от физических моделей. С другой стороны, для одного и того же явления или процесса, как правило, можно составить много возможных моделей, если угодно, много разновидностей одной базовой модели. Поэтому необходимы какие-то дополнительные условия, которые позволяли бы из множества возможных моделей и эконометрических методов анализа данных выбрать наиболее подходящие. В качестве одного из подобных условий выдвигается требование устойчивости модели и метода анализа данных относительно допустимых отклонений исходных данных и предпосылок модели или условий применимости метода.

    Отметим, что в большинстве случаев исследователей и практических работников интересуют не столько сами модели и методы, сколько решения, которые с их помощью принимаются. Ведь модели и методы для того и разрабатываются, чтобы подготавливать решения. Вместе с тем очевидно, что решения, как правило, принимаются в условиях неполноты информации. Так, любые числовые параметры известны лишь с некоторой точностью. Введение в рассмотрение возможных неопределенностей исходных данных требует каких-то заключений относительно устойчивости принимаемых решений по отношению к этим допустимым неопределенностям.

    Введем основные понятия согласно монографии []. Будем считать, что имеются исходные данные, на основе которых принимаются решения. Способ переработки (отображения) исходных данных в решение назовем моделью. Таким образом, с общей точки зрения модель - это функция, переводящая исходные данные в решение, т.е. способ перехода значения не имеет. Очевидно, любая рекомендуемая для практического использования модель должна быть исследована на устойчивость относительно допустимых отклонений исходных данных. Укажем некоторые возможные применения результатов подобного исследования:

  • заказчик научно-исследовательской работы получает представление о точности предлагаемого решения;
  • удается выбрать из многих моделей наиболее адекватную;
  • по известной точности определения отдельных параметров модели удается указать необходимую точность нахождения остальных параметров;
  • переход к случаю "общего положения" позволяет получать более сильные с математической точки зрения результаты.
  • , ] приведены различные примеры. В прикладной статистике точность предлагаемого решения связана с разбросом исходных данных и с объемом выборки. Выбору наиболее адекватной модели посвящены темы, рассмотренные в лекциях 8 и 9, связанные с обсуждением моделей однородности и регрессии. Использование рационального объема выборки в статистике интервальных данных (лекция 12) исходит из принципа уравнивания погрешностей. Этот принцип основан на том, что по известной точности определения отдельных параметров модели удается указать необходимую точность нахождения остальных параметров. Другим примером применения принципа уравнивания погрешностей является нахождение необходимой точности оценивания параметров в моделях логистики, рассмотренных в главе 5 монографии []. Наконец, переходом к случаю "общего положения" в прикладной статистике является, в частности, переход к непараметрическим методам, необходимый из-за невозможности обосновать принадлежность результатов наблюдений к тем или иным параметрическим семействам.

    Специалисты по математическому моделированию и теории управления считают устойчивость одной из важных характеристик технических, социально-экономических, медицинских и иных моделей. Достаточно глубокие исследования ведутся по ряду направлений.

    Первоначальное изучение влияния малого изменения одного параметра обычно называют анализом чувствительности. Оно описывается значением частной производной. Если модель задается дифференцируемой функцией, то итог анализа чувствительности - вектор значений частных производных в анализируемой точке.

    Теория устойчивости решений дифференциальных уравнений развивается по крайней мере с XIX в. []. Выработаны соответствующие понятия - устойчивость по Ляпунову, корректность, доказаны глубокие теоремы. Для решения некорректных задач академиком АН СССР А.Н. Тихоновым в начале 1960-х годов был предложен метод регуляризации. Модели явлений и процессов, выражаемые с помощью дифференциальных уравнений, могут быть исследованы на устойчивость путем применения хорошо разработанного математического аппарата.

    Вопросы устойчивости изучались практически во всех направлениях прикладных математических методов - и в математическом программировании, и в теории массового обслуживания (теории очередей), и в эколого-экономических моделях, и в различных областях эконометрики.

    Общая схема устойчивости. Прежде чем переходить к конкретным постановкам, обсудим "общую схему устойчивости", дающую понятийную базу для обсуждения проблем устойчивости в различных предметных областях.

    Определение 1. Общей схемой устойчивости называется объект $$\{A,B,d,f,E\}$$.

    Здесь $$A$$ - множество, интерпретируемое как пространство исходных данных; $$B$$ - множество, называемое пространством решений. Однозначное отображение $$f:A\rightarrow B$$ называется моделью. Об этих трех составляющих общей схемы устойчивости уже шла речь выше.

    Оставшиеся два понятия нужны для уточнения понятий близости в пространстве исходных данных и пространстве решений. Подобные уточнения могут быть сделаны разными способами. Самое "слабое" уточнение - на языке топологических пространств. Тогда возможны качественные выводы (сходится - не сходится), но не количественные расчеты. Самое "сильное" уточнение - на языке метрических пространств. Промежуточный вариант - используются показатели различия (отличаются от метрик тем, что не обязательно выполняются неравенства треугольника) или вводимые ниже понятия.

    Пусть $$d$$ - показатель устойчивости, т.е. неотрицательная функция, определенная на подмножествах $$Y$$ множества $$B$$ и такая, что из $$Y_1\subseteq Y_2$$ вытекает $$d(Y_1)\le d(Y_2)$$. Часто показатель устойчивости $$d(Y)$$ определяется с помощью метрики, псевдометрики или показателя различия (меры близости) $$\rho$$ как диаметр множества $$Y$$, т.е.$$d(Y)=\sup\{\rho(y_1,y_2),y_1\in Y,y_2\in Y\}.$$

    Таким образом, говоря попросту, в пространстве решений с помощью показателя устойчивости вокруг образа исходных данных может быть сформирована система окрестностей. Но сначала надо такую систему сформировать в пространстве исходных данных.

    Пусть $$E=\{E(x,\alpha),x\in A,\alpha\in\Theta\}$$ - совокупность допустимых отклонений. То есть система подмножеств множества $$A$$ такая, что каждому элементу множества исходных данных $$x\in A$$ и каждому значению параметра $$\alpha$$ из некоторого множества параметров $$\Theta$$ соответствует подмножество $$E(x,\alpha)$$ множества исходных данных. Оно называется множеством допустимых отклонений в точке $$x$$ при значении параметра, равном $$\alpha$$. Наглядно можно представить себе, что вокруг точки $$x$$ взята окрестность радиуса $$\alpha$$.

    Определение 2. Показателем устойчивости в точке $$x$$ при значении параметра, равном $$\alpha$$, называется число$$\beta(x,E(x,\alpha))=d(f(E(x,\alpha))).$$

    Другими словами, это - диаметр образа множества допустимых колебаний при рассматриваемом в качестве модели отображении. Очевидно, что этот показатель устойчивости зависит как от исходных данных, так и от диаметра множества возможных отклонений в исходном пространстве. Для непрерывных функций показатель устойчивости обычно называется модулем непрерывности.

    Естественно посмотреть, насколько сузится образ окрестности возможных отклонений при максимально возможном сужении этой окрестности.

    Определение 3. Абсолютным показателем устойчивости в точке $$x$$ называется число$$\beta(x,E)=\inf\{\beta(x,E(x,\alpha)),\alpha\in\Theta\}.$$

    Если функция $$f$$ непрерывна, а окрестности - именно те, о которых идет речь в математическом анализе, то максимальное сужение означает сужение к точке и абсолютный показатель устойчивости равен 0. Но в теории измерений и статистике интервальных данных мы сталкиваемся с совсем иными ситуациями. В теории измерений окрестностью исходных данных являются все те вектора, что получаются из исходного путем преобразования координат с помощью допустимого преобразования шкалы, а допустимое преобразование шкалы берется из соответствующей группы допустимых преобразований. В статистике интервальных данных под окрестностью исходных данных естественно понимать - при описании выборки - куб с ребрами $$2\Delta$$ и центром в исходном векторе. И в том, и в другом случае максимальное сужение не означает сужение к точке.

    Естественным является желание ввести характеристики устойчивости на всем пространстве. Не вдаваясь в математические тонкости (см. о них монографию []), рассмотрим меру $$\mu$$ на пространстве $$A$$ такую, что мера всего пространства равна 1 (т.е. $$\mu(A)=1$$ ).

    Определение 4. Абсолютным показателем устойчивости на пространстве исходных данных $$A$$ по мере $$\mu$$ называется число$$\gamma(\mu)=\int\limits_A\beta(x,E)d\mu$$

    Здесь имеется в виду интеграл Лебега. Интегрирование проводится по (абстрактному) пространству исходных данных $$A$$ по мере $$\mu$$. Естественно, должны быть выполнены некоторые внутриматематические условия. Читателю, незнакомому с интегрированием по Лебегу, достаточно мысленно заменить в предыдущей формуле интеграл на сумму (а пространство $$A$$ считать конечным, хотя и состоящим из большого числа элементов).

    Определение 5. Максимальным абсолютным показателем устойчивости называется$$\gamma=\sup\{\beta(x,E),x\in A\}.$$

    Легко видеть, что $$\gamma=\sup\gamma(\mu)$$ где супремум берется по всем описанным выше мерам.

    Итак, построена иерархия показателей устойчивости математических моделей реальных явлений и процессов. Она с успехом использовалась в различных исследованиях, подробно развивалась, в частности, в монографии []. Приведем еще одно полезное определение.

    Определение 6. Модель $$f$$ называется абсолютно $$\varepsilon$$ -устойчивой, если $$\gamma\le\varepsilon$$ где $$\gamma$$ - максимальный абсолютный показатель устойчивости.

    Пример. Если показатель устойчивости формируется с помощью метрики $$\rho$$, совокупность допустимых отклонений $$E$$ - это совокупность всех окрестностей всех точек пространства исходных данных $$A$$, то 0 - устойчивость модели $$f$$ эквивалентна непрерывности модели $$f$$ на множестве $$A$$.

    Основная проблема в общей схеме устойчивости - проверка $$\varepsilon$$ - устойчивости данной модели $$f$$ относительно данной системы допустимых отклонений $$E$$.

    Часто оказываются полезными следующие два обобщения основной проблемы.

    Проблема А ( характеризации устойчивых моделей ). Даны пространство исходных данных $$A$$, пространство решений $$B$$, показатель устойчивости $$d$$, совокупность допустимых отклонений $$E$$ и неотрицательное число $$\varepsilon$$. Описать достаточно широкий класс $$\varepsilon$$ - устойчивых моделей $$f$$. Или: найти все $$\varepsilon$$ - устойчивые модели среди моделей, обладающих данными свойствами, т.е. входящих в данное множество моделей.

    Проблема Б ( характеризации систем допустимых отклонений ). Даны пространство исходных данных $$A$$, пространство решений $$B$$, показатель устойчивости $$d$$, модель $$f$$ и неотрицательное число $$\varepsilon$$. Описать достаточно широкий класс систем допустимых отклонений $$E$$, относительно которых модель $$f$$ является $$\varepsilon$$ -устойчивой. Или: найти все такие системы допустимых отклонений $$E$$ среди совокупностей допустимых отклонений, обладающих данными свойствами, т.е. входящих в данное множество совокупностей допустимых отклонений.

    Ясно, что проблемы А и Б можно рассматривать не только для показателя устойчивости $$\gamma$$, но и для других только что введенных показателей устойчивости, а именно, $$\gamma(\mu),\beta(x,E),\beta(x,E(x,\alpha))$$.

    Язык общей схемы устойчивости позволяет описывать конкретные задачи специализированных теорий устойчивости в различных областях исследований, выделять основные элементы в них, ставить проблемы типа А и Б. В частности, на этом языке легко формулируются задачи теории устойчивости решений дифференциальных уравнений, теории робастности статистических процедур (см. ]), и т.д.

    Для примера рассмотрим определение устойчивости по Ляпунову решения $$\varphi(t,x)$$ нормальной автономной системы дифференциальных уравнений $$\dot{y}=g(y)$$ с начальными условиями $$\varphi(0,x)=x$$. Здесь пространство исходных данных $$A$$ - конечномерное евклидово пространство, множество допустимых отклонений $$E(x,\alpha)$$ окрестность радиуса $$\alpha$$ точки $$x\in A$$, пространство решений $$B$$ - множество функций на луче $$[0;+\infty)$$ с метрикой $$\rho(y_1,y_2)=\sup_{\ge 0}|y_1(t)-y_2(t)|$$.

    Модель $$f$$ - отображение, переводящее начальные условия $$x$$ в решение системы дифференциальных уравнений с этими начальными условиями $$\varphi(t,x)$$

    В терминах общей схемы устойчивости положение равновесия $$a$$ называется устойчивым по Ляпунову, если $$\beta(a,E)=0$$. Для формулировки определения асимптотической устойчивости по Ляпунову надо ввести в пространстве решений $$B$$ псевдометрику$$\rho_1(y_1,y_2)=\overline{\lim_{t\rightarrow\infty}}|y_1(t)-y_2(t)|.$$

    Положение равновесия $$a$$ называется асимптотически устойчивым, если $$\beta_1(a,E(a,\varepsilon))=0$$ для некоторого $$\varepsilon>0$$ где показатель устойчивости $$\beta_1$$ рассчитан с использованием псевдометрики $$\rho_1$$.

    Таким образом, общая схема устойчивости естественным образом включает в себя классические понятия теории устойчивости по Ляпунову. Вместе с тем стоит отметить, что эта схема дает общий подход к различным проблемам устойчивости. Она дает систему понятий, которые в каждом конкретном случае должны приспосабливаться к решаемой задаче.

    До настоящего момента для определенности речь шла о допустимых отклонениях в пространстве исходных данных. Часто оказывается необходимым говорить и об отклонениях от предпосылок модели. С чисто формальной точки зрения для этого достаточно расширить понятие "исходные данные" до пары $$(x, f)$$, т.е. включив "прежнюю" модель в качестве второго элемента пары. Все остальные определения остаются без изменения. Теперь отклонения в пространстве решений вызываются не только отклонениями в исходных данных $$x$$, но и отклонениями от предпосылок модели, т.е. отклонениями $$f$$. Это соображение нам понадобится в п.6.4, посвященном робастности статистических процедур.

    Устойчивость по отношению к объему выборки. Различные асимптотические постановки в прикладной статистике также естественно рассматривать как задачи устойчивости. Если при безграничном возрастании объема выборки некоторая величина стремится к пределу, то в терминах общей схемы устойчивости это означает, что она 0 - устойчива в соответствующей псевдометрике (см. выше обсуждение асимптотической устойчивости по Ляпунову). С содержательной точки зрения употребление термина "устойчивость" в такой ситуации представляется вполне оправданным, поскольку рассматриваемая величина мало меняется при изменении объема выборки.

    Рассмотрим проблему и методы оценки близости предельных распределений статистик и распределений, соответствующих конечным объемам выборок. При каких объемах выборок уже можно пользоваться предельными распределениями? Каков точный смысл термина "можно" в предыдущей фразе? Основное внимание уделяется переходу от точных формул допредельных распределений к пределу и применению метода статистических испытаний (Монте-Карло).

    Начнем с обсуждения взаимоотношений асимптотической математической статистики и практики анализа статистических данных. Как обычно подходят к обработке реальных данных в конкретной задаче? Первым делом строят статистическую модель. Если хотят перенести выводы с совокупности результатов наблюдений на более широкую совокупность, например, предсказать что-либо, то рассматривают, как правило, вероятностно-статистическую модель. Например, традиционную модель выборки, в которой результаты наблюдений - реализации независимых (в совокупности) одинаково распределенных случайных величин. Очевидно, любая модель лишь приближенно соответствует реальности. В частности, естественно ожидать, что распределения результатов наблюдений несколько отличаются друг от друга, а сами результаты связаны между собой, хотя и слабо.

    Итак, первый этап - переход от реальной ситуации к математической модели. Далее - неожиданность: на настоящем этапе своего развития математическая теория статистики зачастую не позволяет провести необходимые исследования для имеющихся объемов выборок. Более того, отдельные математики пытаются оправдать свой отрыв от практики соображениями о структуре этой теории, на первый взгляд убедительными. Неосторожная давняя фраза Б.В. Гнеденко и А.Н. Колмогорова: "Познавательная ценность теории вероятностей раскрывается только предельными теоремами" (см. классическую монографию [], одну из наиболее ценных математических книг ХХ в.) взята на вооружение и более близкими к нам по времени авторами. Так, И.А. Ибрагимов и Р.З. Хасьминский пишут: "Решение неасимптотических задач оценивания, хотя и весьма важное само по себе, как правило, не может являться объектом достаточно общей математической теории. Более того, соответствующее решение часто зависит от конкретного типа распределения, объема выборки и т.д. Так, теория малых выборок из нормального закона будет отличаться от теории малых выборок из закона Пуассона" (см. напичканную формулами монографию [, с.7]).

    Согласно цитированным и подобным им авторам, основное содержание математической теории статистики - предельные теоремы, полученные в предположении, что объемы рассматриваемых выборок стремятся к бесконечности. Эти теоремы опираются на предельные соотношения теории вероятностей, типа закона больших чисел и Центральной предельной теоремы. Ясно, что сами по себе подобные утверждения относятся к математике, т.е. к сфере чистой абстракции, и не могут быть непосредственно применены для анализа реальных данных. Их практическое использование, о котором "чистые" математики предпочитают не думать, опирается на важное предположение: "При данном объеме выборки достаточно точными являются асимптотические формулы".

    Конечно, в качестве первого приближения представляется естественным воспользоваться асимптотическими формулами, не тратя сил на анализ их точности. Но это - лишь начало долгой цепи исследований. Как же обычно преодолевают разрыв между результатами асимптотической математической статистики и потребностями практики статистического анализа данных? Какие "подводные камни" подстерегают на этом пути?

    Точные формулы и асимптотика. Начнем с наиболее продвинутой в математическом плане ситуации, когда для статистики известны как предельное распределение, так и распределения при конечных объемах выборки.

    Примером является двухвыборочная односторонняя статистика Н.В. Смирнова. Рассмотрим две независимые выборки объемов $$m$$ и $$n$$ из непрерывных функций распределения $$F(x)$$ и $$G(x)$$ соответственно. Для проверки гипотезы однородности двух выборок (ср. лекц. 8), т.е. гипотезы $$H_0:F(x)=G(x)$$ для всех действительных чисел $$x$$, в 1939 г. Н.В. Смирнов в статье [ $$22$$ ] предложил использовать статистику$$D^+(m,n)=\sup(F_m(x)-G_n(x)),$$ где $$F_m(x)$$ - эмпирическая функция распределения, построенная по первой выборке, $$G_n(x)$$ - эмпирическая функция распределения, построенная по второй выборке, супремум берется по всем действительным числам $$x$$. Для обсуждения проблемы соотношения точных и предельных результатов ограничимся случаем равных объемов выборок, т.е. $$m = n$$. Положим$$H(n,t)=P(D^+(n,n)\ge\frac{t}{\sqrt{n}}).$$

    В цитированной статье [] Н.В. Смирнов установил, что при безграничном возрастании объема выборки n вероятность $$H(n,t)$$ стремится к $$\exp(-t^2)$$.

    В работе [] 1951 г. Б.В. Гнеденко и В.С. Королюк показали, что при целом (именно при таких $$t$$ вероятность $$H(n,t)$$ как функция $$t$$ имеет скачки, поскольку статистика Смирнова $$D^+(n,n)$$ кратна $$1/n$$ ) рассматриваемая вероятность $$H(n,t)$$ выражается через биномиальные коэффициенты, а именно,$$H(n,t)={{2n\choose {n-c}}}/{{2n}\choose n}.$$

    К сожалению, непосредственные расчеты по формуле (1) возможны лишь при сравнительно небольших объемах выборок, поскольку величина $$n$$! ( $$n$$ -факториал) уже при $$n=100$$ имеет более 200 цифр и не может быть без преобразований использована в вычислениях. Следовательно, наличие точной формулы для интересующей нас вероятности не снимает необходимости использования предельного распределения и изучения точности приближения с его помощью.

    Широко известная формула Стирлинга для гамма-функции и, в частности, для факториалов позволяет преобразовать последнее выражение в асимптотическое разложение. То есть построить бесконечный степенной ряд (по степеням $$n$$ ) такой, что каждая следующая частичная сумма дает все более точное приближение для интересующей нас вероятности $$H(x,t)$$. Это и было сделано в работе А.А. Боровкова в 1962 г. Большое количество подобных разложений для различных статистических задач приведено в работах В.М. Калинина и О.В. Шалаевского конца 1960-х - начала 1970-х годов. (Интересно отметить, что асимптотические разложения в ряде случаев расходятся, т.е. остаточные члены имеют нетривиальную природу.)

    Затем в работах конца 1970-х годов была сделана попытка теоретически оценить остаточный член второго порядка. Итоги подведены в монографии [, $$\S$$ 2.2, с.37-45]. Справедливо равенство$$H(n,t)=\exp(-t^2)\cdot(1+f(t)/n +g(n,t)/n^2),\text{ где } f(t)=t^2(1/2-t^2/6).$$

    Целью последних из названных работ было получение равномерных по $$n, t$$ оценок остаточного члена второго порядка $$g(n,t)$$ сверху и снизу в области, задаваемой условиями$$0<\frac{t}{\sqrt{n}}<A,0<t<t_{\max},\;,n\ge n_0.$$

    где $$A,t_{\max},n_0$$ - некоторые параметры. С помощью длинных цепочек оценок остаточных членов в формулах, получаемых при преобразовании формулы (1) к предельному виду, сформулированная выше цель была достигнута. Для различных наборов параметров $$A,t_{\max},n_0$$ получены равномерные по $$n, t$$ оценки (сверху и снизу) остаточного члена второго порядка $$g(n,t)$$ в области (2). Так, например, при $$A=0,5, t_{\max}=1,73,n_0=8$$ нижняя граница равна (-0,71), а верхняя - 2,65.

    Основными недостатками такого подхода являются: во-первых, зависимость оценок от параметров $$A,t_{\max},n_0$$, задающих границы областей; во-вторых, завышение оценок, иногда в сотни раз, обусловленное желанием получить равномерные оценки по области (оценкой реальной погрешности в конкретной точке является значение следующего члена асимптотического разложения).

    Поэтому при составлении рассчитанной на практическое использование методики [] проверки однородности двух выборок с помощью статистики Смирнова было решено перейти на несколько другую методологию (назовем ее "методологией заданной точности"), которую кратко можно описать следующим образом:

  • выбирается достаточно малое положительное число $$p$$, например $$p=0,05$$ или $$p=0,20$$ ;
  • приводятся точные значения $$H(n,t)$$ для всех значений $$n$$ таких, что$$|H(n,t)-\exp(-t^2)|>p\exp(-t^2);$$
  • если же последнее неравенство не выполнено, то вместо $$H(n,t)$$ используется предельное значение $$\exp(-t^2)$$.
  • Таким образом, принятая в методике [] методология предполагает интенсивное использование вычислительной техники. Результатами расчетов являются граничные значения объемов выборок $$n(p,t)$$ такие, что при меньших значениях объемов выборок рекомендуется пользоваться точными значениями функции распределения статистики Смирнова, а при больших - предельными. Описывается этот результат таблицей, а не формулой. Отметим, что при построении реальных таблиц не обойтись без выбора того или иного конкретного значения $$p$$, задающего объемы таблиц.

    Оценки скорости сходимости. Теоретические оценки скорости сходимости в различных задачах прикладной математической статистики иногда формулируются в весьма абстрактном виде. Так, в 1960 - 1970-х годах была популярна задача оценки скорости сходимости распределения классической статистики омега-квадрат (Крамера-Мизеса-Смирнова). Для максимума модуля разности допредельной и предельной функций распределения этой статистики различные авторы доказывали, что для любого $$e>0$$ существует константа $$C(e)$$ такая, что он не превосходит $$C(e)n-w+e$$. Прогресс состоял в увеличении константы $$w$$. Сформулированный выше результат был доказан последовательно для $$w$$ = 1/10, 1/6, 1/5, 1/4, 1/3, 1/2 и 1 (подробнее история этих исследований рассказана в $$\S$$ 2.3 монографии []).

    Конечно, все эти исследования не могли дать конкретных практических рекомендаций. Однако необходимой исходной точкой является само существование предельного распределения. Представим себе, что некто, не зная, что у распределения Коши нет математического ожидания, моделирует выборочные средние арифметические результатов наблюдений из этого распределения. Ясно, что его попытки оценить скорость сходимости выборочных средних к пределу обречены на провал.

    Последовательное улучшение теоретических оценок скорости сходимости дает надежду на быструю реальную сходимость. Действительно, численные расчеты показали, что предельным распределением для статистики омега-квадрат (Крамера-Мизеса-Смирнова) можно пользоваться уже при объеме выборки, равном 4.

    Использование датчиков псевдослучайных чисел. Если же предельное распределение известно, то возникает возможность изучить скорость сходимости численно методом статистических испытаний (Монте-Карло). Однако при этом обычно возникают две проблемы.

    Во-первых, откуда известно, что скорость сходимости монотонна? Если при данном объеме выборки различие мало, то будет ли оно мало и при дальнейших объемах? Иногда отклонения допредельного распределения от предельного объясняются довольно сложными причинами. Так, для распределения хи-квадрат они связаны с рядом до сих пор не решенных теоретико-числовых проблем о числе целых точек в эллипсоиде растущего диаметра.

    Во-вторых, с помощью датчиков псевдослучайных чисел получаем допредельные распределения с погрешностью, которая может преуменьшать различие. Поясним мысль аналогией. Растущий сигнал измеряется с погрешностями. Когда можно гарантировать, что его величина наверняка превзошла заданную границу?

    Напомним, что проблема качества датчиков псевдослучайных чисел продолжает оставаться открытой (см. гл.11 в []). Для моделирования в пространствах фиксированной размерности датчики псевдослучайных чисел решают поставленные задачи. Но для рассматриваемых здесь задач размерность не фиксирована - мы не знаем, при каком конкретно объеме выборки можно переходить к предельному распределению согласно "методологии заданной точности".

    Нужны дальнейшие работы по изучению качества датчиков псевдослучайных чисел в задачах неопределенной размерности. Поскольку критиков датчиков обычно обвиняют в том, что они сами их не используют, отметим, что мы применяли этот инструментарий при изучении помех, создаваемых электровозами (см. монографию []), при изучении статистических критериев проверки однородности двух выборок - см. работу []).

    А нужна ли вообще асимптотика? В настоящее время развивается актуальное направление прикладной статистики, связанное с интенсивным использованием вычислительной техники для изучения свойств статистических процедур. Как уже отмечалось, математические методы в статистике обычно позволяют получать лишь асимптотические результаты, и для переноса выводов на конечные объемы выборок приходится применять вычислительные методы. В Новосибирском государственном техническом университете разработан и успешно применяется оригинальный подход, основанный на интенсивном использовании современной вычислительной техники. Основная идея такова: в качестве альтернативы асимптотическим методам математической статистики используется анализ результатов статистического моделирования (порядка 2000 испытаний) выборок конкретных объемов (200, 500, 1000). При этом анализ предельных распределений заменяется на анализ распределений соответствующих статистик при указанных объемах выборок.

    К достоинствам подхода относится возможность замены теоретических исследований расчетами. Разработанная программная система дает (в принципе) возможность численно изучить свойства любого статистического алгоритма для любого конкретного распределения результатов наблюдений и любого конкретного объема выборки. К недостаткам рассматриваемого подхода относится зависимость от свойств датчиков псевдослучайных чисел, а также - что более важно - неизвестность предельного распределения (и даже самого факта его существования), а потому невозможность обоснованного переноса полученных выводов на объемы выборок, отличные от исследованных. Поэтому с точки зрения теории математической статистики полученные рассматриваемым способом результаты следует рассматривать как правдоподобные (а не доказательные, как в классической математической статистике).

    Кроме того, они принципиально неточные. Даже в наиболее благоприятных условиях отклонение (в метрике "супремум разности") смоделированного распределения, построенного по 2000 испытаниям, от теоретического предельного распределения может достигать $$1,358\times (1/2000)^{1/2}=0,030$$ (см. лекцию 2). Это означает, в частности, что процентные точки, соответствующие уровням значимости 0,05 и особенно 0,01, могут сильно отличаться от соответствующих процентных точек предельных распределений. Очевидно, следующий этап работ - изучение точности полученных в рассматриваемом подходе выводов, прежде всего приближений и процентных точек.

    Однако сразу все не сделаешь. Поэтому новосибирцы совершенно правы, развивая новые компьютерные подходы к давним задачам прикладной статистики.

    Стоит сделать два замечания. В работе [] сравниваются два плана контроля надежности технических изделий. Оказывается, что при объемах выборки, меньших 150, лучше первый план, а при объемах, больших 150 - второй. Значит, если бы по новосибирскому методу сравнивались эти планы при достаточно большом объеме выборки $$n = 100$$, то лучшим был бы признан первый план, что неверно - наступит момент (объем выборки), когда лучшим станет второй план.

    Другое относящееся к делу замечание - из весьма содержательной монографии о прикладной математике []. Будем суммировать бесконечный ряд с членами $$z_n=1/n$$. Поскольку члены его убывают, то обычно используемые алгоритмы остановят вычисления на каком-то шагу. А сумма-то - бесконечна!

    Кажется, что компьютер дал универсальную отмычку ко всем проблемам вообще и в области прикладной статистики в частности. Но это только кажется.

    ] выбор числа градаций в социологических анкетах целесообразно проводить на основе уравнивания погрешностей квантования и неопределенности в ответах респондентов. В классической модели управления запасами целесообразно уравнять влияние неточностей в определении параметров на отклонение целевой функции от оптимума. Для этой модели из принципа уравнивания погрешностей следует, что относительные погрешности определения параметров модели должны совпадать. Погрешность, порожденная отклонением спроса от линейного, оценивается по данным об отпуске товаров. Это дает возможность оценить допустимые отклонения для других параметров. В частности, установить, что расхождения между методиками их определения не являются существенными [].

    В терминах общей схемы устойчивости рассмотрим для простоты записи случай двух параметров. Пусть $$A=[0,\infty)\times[0,\infty)$$ и $$E(x,\alpha)=E(x,(\varepsilon,\delta))$$, где $$\varepsilon>0$$ и $$\delta>0$$ задают точность определения соответствующих параметров, так что $$E(x,(\varepsilon_1,\delta_1))\subseteq E(x,(\varepsilon_2,\delta_2))$$ при $$\varepsilon_1\le\varepsilon_2, \delta_1\le\delta_2$$. Пусть $$\varepsilon$$ задано, а $$\delta$$ исследователь может выбрать, причем известно, что уменьшение $$\delta$$ связано с увеличением расходов. Как выбирать $$\delta$$? Представляется естественным "уравнять" отклонения, порожденные различными параметрами, т.е. определить $$\delta$$ из условия$$\beta(x,E(x,(\varepsilon,\delta)))-\beta(x,E(x,(\varepsilon,0)))\approx\beta(x,E(x,(\varepsilon,0))).$$

    Если затраты и полезный эффект точно известны, то $$\delta$$ можно определить путем решения соответствующей оптимизационной задачи. В противном случае соотношение (3) предлагается использовать в качестве эвристического правила.

    Контрольные вопросы и задачи

  • Почему в прикладной статистике необходимо использовать теоремы о наследовании сходимости?
  • Примените метод линеаризации для изучения распределения выборочной дисперсии (исходя из асимптотической нормальности при $$n\rightarrow\infty$$ среднего арифметического двумерных векторов $$(X_k, (X_k)^2), k=1,2,...,n)$$.
  • Как применяется в прикладной статистике принцип инвариантности?
  • Как с точки зрения нечетких множеств можно интерпретировать вероятность накрытия определенной точки случайным множеством?
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,1, \mu_B(y_2)=0,2, \mu_B(y_3)=0,3$$. Постройте случайное множество $$A$$ так, чтобы $$Proj A = B$$.
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,2, \mu_B(y_2)=0,1, \mu_B(y_3)=0,5$$. Постройте случайное множество $$А$$ так, чтобы $$Proj A = B$$.
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,5, \mu_B(y_2)=0,4, \mu_B(y_3)=0,7$$. Постройте случайное множество $$А$$ так, чтобы $$Proj A = B$$.
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,3, \mu_B(y_2)=0,2, \mu_B(y_3)=0,1$$. Постройте случайное множество $$А$$ так, чтобы $$Proj A = B$$.
  • В чем состоит основная идея принципа уравнивания погрешностей?
  • Темы докладов, рефератов, исследовательских работ

  • Законы больших чисел и различные варианты центральной предельной теоремы - основные результаты классической теории вероятностей.
  • Место теорем о наследовании сходимости и метода линеаризации в асимптотической прикладной статистике.
  • Принцип инвариантности для классических непараметрических статистик.
  • Обсудите суждение: "Мы мыслим нечетко" (см. []). Почему нечеткость мышления помогает взаимопониманию?
  • Взаимосвязь теории нечеткости и теории вероятностей.
  • Методы оценивания функции принадлежности.
  • Теория нечеткости и интервальная математика.
  • Описание данных для выборок, элементы которых - нечеткие множества.
  • Регрессионный анализ нечетких переменных (согласно []).
  • Кластерный анализ нечетких данных.
  • Непараметрические оценки плотности распределения вероятностей в пространстве нечетких множеств (согласно подходу лекции 5).
  • Проблема устойчивости в математическом моделировании.
  • Страницы:

    В настоящей лекции собраны основные математико-статистические утверждения, постоянно используемые при математическом обосновании методов прикладной статистики. Эти утверждения отнюдь не всегда легко найти в литературе по теории вероятностей и математической статистике. Например, такие рассматриваемые далее теоремы и методы, как многомерная центральная предельная теорема, теоремы о наследовании сходимости и метод линеаризации, даже не включены в энциклопедию "Вероятность и математическая статистика" [] - наиболее полный свод знаний по этой тематике. Последний факт наглядно демонстрирует разрыв между математической дисциплиной "теория вероятностей и математическая статистика" и потребностями прикладной статистики.

    4.1. Законы больших чисел

    Законы больших чисел позволяют описать поведение сумм случайных величин. Примером является следующий результат, обобщающий полученный ранее в $$\S$$ 2.2. Там было доказано следующее утверждение.

    Теорема Чебышева. Пусть случайные величины $$X_1, X_2,..., X_k$$ попарно независимы и существует число $$C$$ такое, что $$D(X_i)\le C$$ при всех $$i = 1, 2, ..., k$$. Тогда для любого положительного $$\varepsilon$$ выполнено неравенство$$P \left\{ \left| \frac{X_1+X_2+...+X_k}{k}-\frac{M(X_1)+M(X_2)+...+M(X_k)}{k} \right|\ge\varepsilon \right\} \le\frac{C}{k\varepsilon^2}$$

    Частным случаем теоремы Чебышева является теорема Бернулли - первый в истории вариант закона больших чисел.

    Теорема Бернулли. Пусть $$m$$ - число наступлений события $$A$$ в $$k$$ независимых (попарно) испытаниях, и $$p$$ есть вероятность наступления события $$A$$ в каждом из испытаний. Тогда при любом $$\varepsilon>0$$ справедливо неравенство$$P \left\{ \left| \frac{m}{k}-p \right|\ge\varepsilon \right\} \le\frac{p(1-p)}{k\varepsilon^2}.$$

    Ясно, что при росте $$k$$ выражения в правых частях формул (1) и (2) стремятся к 0. Таким образом, среднее арифметическое попарно независимых случайных величин сближается со средним арифметическим их математических ожиданий.

    Напомним, что в лекции 2 шла речь лишь о пространствах элементарных событий из конечного числа элементов. Однако приведенные теоремы верны и в общем случае - для произвольных пространств элементарных событий. Однако в условие закона больших чисел необходимо добавить требование существования дисперсий. Легко видеть, что если существуют дисперсии, то существуют и математические ожидания. Закон больших чисел в форме Чебышева приобретает следующий вид.

    , с.147]. Если $$X_1,X_2,...,X_k,..$$. - последовательность попарно независимых случайных величин, имеющих конечные дисперсии, ограниченные одной и той же постоянной,$$D(X_1)\le C,D(X_2)\le C,...,D(X_i)\le C,...$$ то, каково бы ни было постоянное $$\varepsilon>0$$,$$\lim_{k\rightarrow\infty}P \left\{ \left| \frac{1}{n}\sum_{j=1}^k X_j-\frac{1}{n}\sum_{j=1}^k MX_j \right|<\varepsilon \right\}=1.$$

    С точки зрения прикладной статистики ограниченность дисперсий вполне естественна. Она вытекает, например, из ограниченности диапазона изменения практически всех величин, используемых при реальных расчетах.

    В 1923 г. А.Я. Хинчин показал, что если случайные величины не только независимы, но и одинаково распределены, то существование у них математического ожидания является необходимым и достаточным условием для применимости закона больших чисел [, с.150].

    Теорема [, с.150-151]. Для того чтобы для последовательности $$X_1,X_2,...,X_k,..$$. (как угодно зависимых) случайных величин при любом положительном $$\varepsilon$$ выполнялось соотношение (3), необходимо и достаточно, чтобы при $$n\rightarrow\infty$$$$M\frac{\left(\sum\limits_{j=1}^n(X_j-MX_j)\right)^2}{n^2+\left(\sum\limits_{j=1}^n(X_j-MX_j)\right)^2}\rightarrow 0.$$

    Законы больших чисел для случайных величин служат основой для аналогичных утверждений для случайных элементов в пространствах более сложной природы, в частности, в пространствах произвольной природы (см. п.5.5 далее). Однако здесь мы ограничимся классическими формулировками, служащими основой для современной прикладной статистики.

    Смысл классических законов больших чисел состоит в том, что выборочное среднее арифметическое независимых одинаково распределенных случайных величин приближается (сходится) к математическому ожиданию этих величин. Другими словами, выборочные средние сходятся к теоретическому среднему.

    Это утверждение справедливо и для других видов средних. Например, выборочная медиана сходится к теоретической медиане. Это утверждение - тоже закон больших чисел, но не классический.

    Существенным продвижением в теории вероятностей во второй половине ХХ в. явилось введение средних величин в пространствах произвольной природы и получение для них законов больших чисел, т.е. утверждений, состоящих в том, что эмпирические (т.е. выборочные) средние сходятся к теоретическим средним. Эти результаты будут рассмотрены в п.5.5 ниже.

    4.2. Центральные предельные теоремы

    В лекции 2 уже был приведен простейший вариант центральной предельной теоремы (ЦПТ) теории вероятностей.

    Центральная предельная теорема (для одинаково распределенных слагаемых). Пусть $$X_1,X_2,...,X_n,..$$. - независимые одинаково распределенные случайные величины с математическими ожиданиями $$M(X_i)=m$$ и дисперсиями $$D(X_i)=\sigma^2, i=1,2,...,n,..$$.. Тогда для любого действительного числа $$x$$ существует предел$$\lim_{n\rightarrow\infty}P \left( \frac{X_1,X_2,...,X_n - nm}{\sigma\sqrt{n}}<x \right) =\Phi(x),$$ где $$\Phi(x)$$ - функция стандартного нормального распределения.

    Эту теорему иногда называют теоремой Линдеберга-Леви [ $$23$$, с.122].

    В ряде прикладных задач не выполнено условие одинаковой распределенности. В таких случаях центральная предельная теорема обычно остается справедливой, однако на последовательность случайных величин приходится накладывать те или иные условия. Суть этих условий состоит в том, что ни одно слагаемое не должно быть доминирующим, вклад каждого слагаемого в среднее арифметическое должен быть пренебрежимо мал по сравнению с итоговой суммой. Наиболее часто используется теорема Ляпунова.

    Центральная предельная теорема (для разнораспределенных слагаемых) - теорема Ляпунова. Пусть $$X_1,X_2,...,X_n,..$$. - независимые случайные величины с математическими ожиданиями $$M(X_i)=m_i$$ и дисперсиями $$D(X_i)=\sigma_i^2\ne 0, i=1,2,...,n,..$$.. Пусть при некотором $$\delta>0$$ у всех рассматриваемых случайных величин существуют центральные моменты порядка $$2+\delta$$ и безгранично убывает "дробь Ляпунова":$$\lim_{k\rightarrow\infty}\frac{1}{B_n^{2+\delta}} \sum_{k=1}^n M|X_k-m_k|^{2+\delta} =0,$$ где$$B_k^2=\sum_{i=1}^k\sigma_i^2=D\left(\sum_{i=1}^k X_i\right).$$

    Тогда для любого действительного числа $$x$$ существует предел$$\lim_{n\rightarrow\infty}P \left( \frac{X_1+X_2+...+X_n-m_1-m_2-...-m_n}{B_n}< \right) =\Phi(x),$$ где $$\Phi(x)$$ - функция стандартного нормального распределения.

    В случае одинаково распределенных случайных слагаемых$$m_1=m_2=...=m_n=m,\; B_n=D(X_1+X_2+...+X_n)=\sigma\sqrt{n},$$ и теорема Ляпунова переходит в теорему Линдеберга-Леви.

    История получения центральных предельных теорем для случайных величин растянулась на два века - от первых работ Муавра в 30-х годах XVIII в. до необходимых и достаточных условий, полученных Линдебергом и Феллером в 30-х годах XX в.

    Теорема Линдеберга-Феллера. Пусть $$X_1,X_2,...,X_n,..$$. - независимые случайные величины с математическими ожиданиями $$M(X_i)=m_i$$ и дисперсиями $$D(X_i)=\sigma_i^2\ne, i=1,2,...,n,..$$. Предельное соотношение (1), т.е. центральная предельная теорема, выполнено тогда и только тогда, когда при любом $$\tau>0$$$$\lim_{n\rightarrow\infty}\frac{1}{B_n^2}\sum_{k=1}^n\int\limits_{|x-m_k|>\tau B_n}(x-m_k)^2 dF_k(x)=0,$$ где $$F_k(x)$$ обозначает функцию распределения случайной величины $$X_k$$.

    Доказательства перечисленных в настоящем подразделе центральных предельных теорем для случайных величин можно найти в классическом курсе теории вероятностей [].

    Для прикладной статистики большое значение имеет многомерная центральная предельная теорема. В ней речь идет не о сумме случайных величин, а о сумме случайных векторов.

    , с.124]. Пусть $$F_n$$ обозначает совместную функцию распределения $$k$$ -мерного случайного вектора $$(X_n^{(1)},...,X_n^{(k)}), n=1,2,..$$., и $$F_{\lambda n}$$ - функция распределения линейной комбинации $$\lambda_1X_n^{(1)}+\lambda_2X_n^{(2)}+...+\lambda_k X_n^{(k)}$$. Необходимое и достаточное условие для сходимости $$F_n$$ к некоторой $$k$$ -мерной функции распределения $$F$$ состоит в том, что $$F_{\lambda n}$$ имеет предел для любого вектора $$\lambda=(\lambda_1,\lambda_2,...\lambda_k)$$.

    Приведенная теорема ценна тем, что сходимость векторов сводитcя к сходимости линейных комбинаций их координат, т.е. к сходимости обычных случайных величин, рассмотренных ранее. Однако она не дает возможности непосредственно указать предельное распределение. Это можно сделать с помощью следующей теоремы.

    Теорема о многомерной сходимости. Пусть $$F_n$$ и $$F_{\lambda n}$$ - те же, что в предыдущей теореме. Пусть $$F$$ - совместная функция распределения $$k$$ -мерного случайного вектора $$(X_1,...,X_k)$$. Если функция распределения $$F_{\lambda n}$$ сходится при росте объема выборки к функции распределения $$F_{\lambda}$$ для любого вектора $$\lambda$$, где $$F_{\lambda}$$ - функция распределения линейной комбинации $$\lambda_1X_1+...+\lambda_kX_k$$, то $$F_n$$ сходится к $$F$$.

    Здесь сходимость $$F_n$$ к $$F$$ означает, что для любого $$k$$ -мерного вектора $$(x_1,...,x_k)$$ такого, что функция распределения $$F$$ непрерывна в $$(x_1,...,x_k)$$, числовая последовательность $$F_n(x_1,...,x_k)$$ сходится при росте $$n$$ к числу $$F(x_1,...,x_k)$$. Другими словами, сходимость функций распределения понимается ровно также, как при обсуждении предельных теорем для случайных величин выше. Приведем многомерный аналог этих теорем.

    ]. Рассмотрим независимые одинаково распределенные $$k$$ -мерные случайные векторы$$U'_n(U_{1n},...,U_{kn}), n=1,2,...,$$ где штрих обозначает операцию транспонирования вектора. Предположим, что случайные векторы $$U_n$$ имеют моменты первого и второго порядка, т.е.$$M(U_n)=\mu,\; D(U_n)=\Sigma,$$ где $$\mu$$ - вектор математических ожиданий координат случайного вектора, $$\Sigma$$ - его ковариационная матрица. Введем последовательность средних арифметических случайных векторов:$$\overline{U}_n=(\overline{U}_{1n},...,\overline{U}_{kn}),\; n=1,2,...,\; \overline{U}_{in}=\frac{1}{n}\sum_{j=1}^n U_{ij}.$$

    Тогда случайный вектор $$\sqrt{n}(\overline{U}_n-\mu)$$ имеет асимптотическое $$k$$ -мерное нормальное распределение $$N_k(0,\Sigma)$$, т.е. он асимптотически распределен так же, как $$k$$ -мерная нормальная величина с нулевым математическим ожиданием, ковариационной $$\Sigma$$ и плотностью$$N_k(u|0,\Sigma)=(2\pi)^{-k/2}|\Sigma|^{-1/2}\exp\{-\frac12 u'\Sigma^{-1}u\}.$$

    Здесь $$|\Sigma|$$ - определитель матрицы $$\Sigma$$. Другими словами, распределение случайного вектора $$\sqrt{n}(\overline{U}_n-\mu)$$ сходится к $$k$$ -мерному нормальному распределению с нулевым математическим ожиданием и ковариационной матрицей $$\Sigma$$.

    Напомним, что многомерным нормальным распределением с математическим ожиданием $$\mu$$ и ковариационной матрицей $$\Sigma$$ называется распределение, имеющее плотность$$N_k(u|\mu,\Sigma)=(2\pi)^{-k/2}|\Sigma|^{-1/2} \exp\{-\frac12[(u-\mu)'\Sigma^{-1}(u-\mu)]\}.$$

    Многомерная центральная предельная теорема показывает, что распределения сумм независимых одинаково распределенных случайных векторов при большом числе слагаемых хорошо приближаются с помощью нормальных распределений, имеющих такие же первые два момента (вектор математических ожиданий координат случайного вектора и его корреляционную матрицу), как и исходные векторы. От одинаковой распределенности можно отказаться, но это потребует некоторого усложнения символики. В целом из теоремы о многомерной сходимости вытекает, что многомерный случай ничем принципиально не отличается от одномерного.

    Пример. Пусть $$X_1,...,X_n,..$$.- независимые одинаково распределенные случайные величины. Рассмотрим $$k$$ -мерные независимые одинаково распределенные случайные векторы$$U'_n=(X_n,X_n^2,X_n^3,...,X_n^k), n=1,2,...$$

    Их математическое ожидание - вектор теоретических начальных моментов, а ковариационная матрица составлена из соответствующих центральных моментов. Тогда $$\overline{U}_n$$ - вектор выборочных начальных моментов. Многомерная центральная предельная теорема утверждает, что $$\overline{U}_n$$ имеет асимптотически нормальное распределение. Как вытекает из теорем о наследовании сходимости и о линеаризации (см. ниже), из распределения $$\overline{U}_n$$ можно вывести распределения различных функций от выборочных начальных моментов. А поскольку центральные моменты выражаются через начальные, то аналогичное утверждение верно и для них.

    4.3. Теоремы о наследовании сходимости

    Суть проблемы наследования сходимости. Пусть распределения случайных величин $$X_n$$ при $$n\rightarrow\infty$$ стремятся к распределению случайной величины $$X$$. При каких функциях $$f$$ можно утверждать, что распределения случайных величин $$f(X_n)$$ сходятся к распределению $$f(X)$$, т.е. наследуется сходимость?

    Хорошо известно, что для непрерывных функций $$f$$ сходимость наследуется []. Однако в прикладной статистике используются различные обобщения этого утверждения. Необходимость обобщений связана с тремя обстоятельствами:

  • статистические данные могут моделироваться не только случайными величинами, но и случайными векторами, случайными множествами, случайными элементами произвольной природы (т.е. функциями на вероятностном пространстве со значениями в произвольном множестве);
  • переход к пределу должен рассматриваться не только для случая безграничного возрастания объема выборки, но и в более общих случаях. Например, если в постановке статистической задачи участвуют несколько выборок объемов $$n(1), n(2), ... , n(k)$$, то вполне обычным является предположение о безграничном росте всех этих объемов (что можно описать и как $$\min\{n(1),n(2),...,n(k)\}\rightarrow\infty)$$ ;
  • функция $$f$$ не обязательно является непрерывной. Она может иметь разрывы. Кроме того, она может зависеть от параметров, по которым происходит переход к пределу, например, может зависеть от объемов выборок. Так, в лекции 8 понадобится рассмотреть функцию $$f = f(n(1), n(2), ... , n(k))$$.
  • Расстояние Прохорова и сходимость по направленному множеству. Введем необходимые для дальнейшего изложения понятия.

    Расстояние (метрика) Прохорова. Пусть $$C$$ - некоторое пространство, $$A$$ - его подмножество, $$d$$ - метрика в $$C$$. Введем понятие $$\varepsilon$$ -окрестности множества $$A$$ в метрике $$d$$:$$S(A,\varepsilon)=\{x\in C:d(A,x)<\varepsilon\}.$$

    Таким образом, $$\varepsilon$$ -окрестность множества $$A$$ - это совокупность всех точек пространства $$C$$, отстоящих от $$A$$ не более чем на положительное число $$\varepsilon$$. При этом расстояние от точки $$x$$ до множества $$A$$ - это точная нижняя грань расстояний от $$x$$ до точек множества $$A$$, т.е.$$d(A,x)=\inf\{d(x,y):y\in A\}.$$

    Пусть $$P_1$$ и $$P_2$$ - две вероятностные меры на $$C$$ (т.е. распределения двух случайных элементов со значениями в $$C$$ ). Пусть $$D_{12}$$ - множество чисел $$\varepsilon>0$$ таких, что$$P_1(A)\le P_2(S(A,\varepsilon))+\varepsilon$$ для любого замкнутого подмножества $$A$$ пространства $$C$$ ). Пусть $$D_{21}$$ - множество чисел $$\varepsilon>0$$ таких, что$$P_2(A)\le P_1(S(A,\varepsilon))+\varepsilon$$ для любого замкнутого подмножества $$A$$ пространства $$C$$. Расстояние Прохорова $$L(P_1,P_2)$$ между вероятностными мерами (его можно рассматривать и как расстояние между случайными элементами с распределениями $$P_1$$ и $$P_2$$ соответственно) вводится формулой$$L(P_1,P_2)=\max(\inf D_{12},\inf D_{21}).$$

    С помощью метрики Прохорова формализуется понятие сходимости распределений случайных элементов в произвольном пространстве.

    Расстояние $$L(P_1,P_2)$$ введено академиком РАН Юрием Васильевичем Прохоровым в середине ХХ в. и широко используется в современной теории вероятностей.

    Сходимость по направленному множеству [, с.95 - 96]. Бинарное отношение $$>\ge$$ (упорядочение), заданное на множестве $$B$$, называется направлением на нем, если $$B$$ не пусто и

    (а) если $$m, n$$ и $$p$$ - такие элементы множества $$B$$, что $$m\ge n$$ и $$n\ge p$$, то $$m\ge p$$ ;

    (б) $$m\ge m$$ для любого $$m$$ из $$B$$ ;

    (в) если $$m$$ и $$n$$ принадлежат $$B$$, то найдется элемент $$p$$ из $$B$$ такой, что $$p\ge m $$ и $$p\ge n$$.

    Направленное множество - это пара $$(В, \ge)$$, где $$\ge$$ > - направление на множестве $$B$$. Направленностью (или "последовательностью по направленному множеству") называется пара $$(f,\ge)$$, где $$f$$ - функция, $$\ge$$ - направление на ее области определения. Пусть $$f:B\rightarrow Y$$, где $$Y$$ - топологическое пространство. Направленность $$(f, \ge)$$ сходится в топологическом пространстве $$Y$$ к точке $$y_0$$, если для любой окрестности $$U$$ точки $$y_0$$ найдется $$p$$ из $$B$$ такое, что $$f(q)\in U$$ при любом $$q\ge p$$. В таком случае говорят также о сходимости по направленному множеству.

    Пусть $$B = \{(n(1), n(2), ... , n(k))\}$$ - совокупность векторов, каждый из которых составлен из объемов $$k$$ выборок. Пусть$$(n(1), n(2), ..., n(k)) \ge (n_1(1), n_1(2), ..., n_1(k))$$ тогда и только тогда, когда $$n(_i) \ge n_1(i)$$ при всех $$i=1,2,...,k$$. Тогда $$(B,\ge)$$ - направленное множество, сходимость по которому эквивалентна сходимости при $$\min\{n(1), n(2),...,n(k)\}\rightarrow\infty$$.

    Чтобы охватить различные частные случаи, целесообразно предельные теоремы формулировать в терминах сходимости по направленному множеству. Будем писать $$B=\{\alpha\}$$. Пусть запись $$\alpha\rightarrow\infty$$ обозначает переход к пределу по направленному множеству.

    Формулировка проблемы наследования сходимости. Пусть случайные элементы $$X_{\alpha}$$ со значениями в пространстве $$C$$ сходятся при $$\alpha\rightarrow\infty$$ к случайному элементу $$X$$, где через $$\alpha\rightarrow\infty$$ обозначен переход к пределу по направленному множеству. Сходимость случайных элементов означает, что $$L(X_{\alpha},X)\rifhtarrow 0$$ при $$\alpha\rightarrow\infty$$, где $$L$$ - метрика Прохорова в пространстве $$C$$.

    Пусть $$f_{\alpha}:C\rightarrow Y$$ - некоторые функции. Какие условия надо на них наложить, чтобы из $$L(X_{\alpha},X)\rightarrow 0$$ вытекало, что $$L_1(f_{\alpha}(X_{\alpha}), f_{\alpha}(X))\rightarrow 0$$ при $$\alpha\rightarrow\infty$$, где $$L_1$$ - метрика Прохорова в пространстве $$Y$$? Другими словами, какие условия на функции $$f_{\alpha}:C\rightarrow Y$$ гарантируют наследование сходимости?

    В работах [, ] найдены необходимые и достаточные условия на функции $$f_{\alpha}:C\rightarrow Y$$, гарантирующие наследование сходимости. Описанию этих условий посвящена оставшаяся часть данного пункта.

    Приведем для полноты изложения строгие формулировки математических предположений (в дальнейшем никому, кроме профессиональных математиков, не понадобятся).

    Математические предположения. Пусть $$C$$ и $$Y$$ - полные сепарабельные метрические пространства. Пусть выполнены обычные предположения измеримости: $$X_{\alpha}$$ и $$X$$ - случайные элементы $$C, f_{\alpha}(X_{\alpha})$$ и $$f_{\alpha}(X)$$ - случайные элементы в $$Y$$, рассматриваемые ниже подмножества пространств $$C$$ и $$Y$$ лежат в соответствующих $$\sigma$$ -алгебрах измеримых подмножеств, и т.д.

    Понадобятся некоторые определения. Разбиение $$Т_n = \{C_{1n}, C_{2n}, ..., C_{nn}\}$$ пространства $$C$$ - это такой набор подмножеств $$C_j, j = 1, 2, ..., n$$, этого пространства, что пересечение любых двух из них пусто, а объединение совпадает с $$C$$. Диаметром $$diam(A)$$ подмножества $$A$$ множества $$C$$ называется точная верхняя грань расстояний между элементами $$A$$, т.е.$$diam(A) = \sup \{d(x,y), x\in A, y\in A},$$

    где $$d(x,y)$$ - метрика в пространстве $$C$$. Обозначим $$\partial A$$ границу множества $$A$$, т.е. совокупность точек х таких, что любая их окрестность $$U(x)$$ имеет непустое пересечение как с $$A$$, так и с $$C\A$$. Колебанием $$\delta(f,B)$$ функции $$f$$ на подмножестве $$B$$ множества $$C$$ называется $$\delta(f,B)= \sup\{d(x,y)|x\in B, y\in B}$$.

    Достаточное условие для наследования сходимости. Пусть $$L(X_{\alpha},X)\rightarrow 0$$ при $$\alpha\rightarrow\infty$$. Пусть существует последовательность $$T_n$$ разбиений пространства $$C$$ такая, что $$P(X\in\partial A) = 0$$ для любого $$A$$ из $$T_n$$ и, основное условие, для любого $$\varepsilon> 0$$$$m_{\varepsilon}(\alpha,n)=\sum P(X\in A)\rightarrow 0$$ при $$n\rightarrow\infty$$ и $$\alpha\rightarrow\infty$$, где сумма берется по всем тем $$A$$ из $$T_n$$, для которых колебание функции $$f_{/alpha}$$ на $$A$$ больше $$\varepsilon$$, т.е. $$\delta(f_{\alpha},A)>\varepsilon$$. Тогда $$L_1(f_{alpha}(X_{\alpha}), f_{alpha}(X)) \rightarrow 0$$ при $$\alpha\rightarrow\infty$$.

    Необходимое условие для наследования сходимости. Пусть $$Y$$ - конечномерное линейное пространство, $$Y = R^k$$. Пусть случайные элементы $$f_{}\alpha(X)$$ асимптотически ограничены по вероятности при $$\alpha\rightarrow\infty$$, т.е. для любого $$\varepsilon>0$$ существуют число $$S(\varepsilon)$$ и элемент направленного множества $$\alpha(\varepsilon)$$ такие, что $$P(||f_{\alpha}(X)||>S(\varepsilon))<\varepsilon$$ при $$\alpha\ge\alpha(\epsilon)$$, где $$||f_{alpha}(X)||$$ - норма (длина) вектора $$f_alpha(X)$$. Пусть существует последовательность $$T_n$$ разбиений пространства $$C$$ такая, что$$\lim_{n\rightarrow\infty}\max\{diam(C_{jn}),C_{jn}\in T_n\}=0,$$ т.е. последовательность $$T_n$$ является безгранично измельчающейся. Самое существенное - пусть условие (1) не выполнено для последовательности $$T_n$$. Тогда существует последовательность случайных элементов $$X_{\alpha}$$ такая, что $$L(X_\alpha,X)\rightarrow 0$$ при $$\alpha\rightarrow\infty$$, но $$L_1(f(X_{\alpha}),f_{\alpha}(X))$$ не сходится к 0 при $$\alpha\rightarrow\infty$$.

    Несколько огрубляя, можно сказать, что условие (1) является необходимым и достаточным для наследования сходимости.

    Пример 1. Пусть $$C$$ и $$Y$$ - конечномерные линейные пространства, функции $$f_{\alpha}$$ не зависят от $$\alpha$$, т.е. $$f_{\alpha}\equiv f$$, причем функция $$f$$ ограничена. Тогда условие (1) эквивалентно требованию интегрируемости по Риману-Стилтьесу функции $$f$$ по мере $$G(A)=P(X\in A)$$. В частности, условие (1) выполнено для непрерывной функции $$f$$.

    В конечномерных пространствах $$C$$ вместо сходимости $$L(X_{\alpha},X)\rightarrow 0$$ при $$\alpha\rightarrow\infty$$ можно говорить о слабой сходимости функций распределения случайных векторов $$X_{\alpha}$$ к функции распределения случайного вектора $$X$$. Речь идет о "сходимости по распределению", т.е. о сходимости во всех точках непрерывности функции распределения случайного вектора $$X$$. В этом случае разбиения могут состоять из многомерных параллелепипедов [, гл.2].

    Пример 2. Полученные выше результаты дают обоснование для следующих рассуждений (ср., например, утверждения в лекции 8). Пусть по двум независимым выборкам объемов $$m$$ и $$n$$ соответственно построены статистики $$X_m$$ и $$Y_n$$. Пусть известно, что распределения этих статистик сходятся при безграничном росте объемов выборок к стандартному нормальному распределению с математическим ожиданием 0 и дисперсией 1. Пусть $$a(m, n)$$ и $$b(m, n)$$ - некоторые коэффициенты. Тогда согласно результатам примера 1 распределение случайной величины $$Z(m,n) = a(m,n)X_m + b(m, n)Y_n$$ сближается с распределением нормально распределенной случайной величины с математическим ожиданием 0 и дисперсией $$a^2(m,n)+b^2(m,n)$$. Если же $$a^2(m,n)+b^2(m,n)=1$$, например,$$a(m,n)=\sqrt{\frac{m}{m+n}}.\quad b(m,n)=\sqrt{\frac{n}{m+n}},$$ то распределение $$Z(m,n)$$ сходится при безграничном росте объемов выборок к стандартному нормальному распределению с математическим ожиданием 0 и дисперсией 1.

    4.4. Метод линеаризации

    При разработке методов прикладной статистики часто возникает следующая задача [, с.338]. Имеется последовательность k-мерных случайных векторов $$X_n = (X_{1n}, X_{2n}, ... , X_{kn}), n=1,2,..$$., такая, что $$X_n \rightarrow a=(a_1, a_2,...,a_k)$$ при $$n\rightarrow\infty$$, и последовательность функций $$f_n:R^k\rightarrow R_1$$. Требуется найти распределение случайной величины $$f_n(X_n)$$.

    Основная идея - рассмотреть главный линейный член функции $$f_n$$ в окрестности точки $$a$$. Из математического анализа известно, что$$f_n(X_n)-f_n(a)=\sum_{j=1}^k\frac{\partial f_n(a)}{\partial x_j}(X_{jn}-a_j)+O_n(||X_n-a||^2),$$ где остаточный член является бесконечно малой величиной более высокого порядка малости, чем линейный член. Таким образом, произвольная функция может быть заменена на линейную функцию от координат случайного вектора. Эта замена проводится с точностью до бесконечно малых более высокого порядка. Конечно, должны быть выполнены некоторые математические условия регулярности. Например, функции $$f_n$$ должны быть дважды непрерывно дифференцируемы в окрестности точки $$а$$.

    Если вектор $$X_n$$ является асимптотически нормальным с математическим ожиданием $$а$$ и ковариационной матрицей $$\Sigma/n$$, где $$\Sigma = ||\sigma_{ij}||$$, причем $$\sigma_{ij} = nM(X_i - a_i)(X_j - a_j)$$, то линейная функция от его координат также асимптотически нормальна. Следовательно, при очевидных условиях регулярности $$f_n(X_n)$$ - асимптотически нормальная случайная величина с математическим ожиданием $$f_n(а)$$ и дисперсией$$\frac{1}{n}\sum_{i=1}^k\sum_{j=1}^k \frac{\partial f_n(a)}{\partial x_i}\frac{\partial f_n(a)}{\partial x_j}\sigma_{ij}.$$

    Для практического использования асимптотической нормальности $$f_n(X_n)$$ остается заменить неизвестные моменты $$a$$ и $$\Sigma$$ на их оценки. Например, если $$X_n$$ - это среднее арифметическое независимых одинаково распределенных случайных векторов, то а можно заменить на $$X_n$$, а $$\Sigma$$ - на выборочную ковариационную матрицу.

    Пример. Пусть $$Y_1, Y_2, ..., Y_n$$ - независимые одинаково распределенные случайные величины с математическим ожиданием $$a$$ и дисперсией $$\sigma^2$$. В качестве $$X_n(k=1)$$ рассмотрим выборочное среднее арифметическое$$\overline{Y}=\frac{Y_1+Y_2+...+Y_n}{n}$$

    Как известно, в силу закона больших чисел $$\overline{Y}\rightarrow a=M(Y)$$. Следовательно, для получения распределений функций от выборочного среднего арифметического можно использовать метод линеаризации. В качестве примера рассмотрим $$f_n(y) = f(y) = y^2$$. Тогда$$(\overline{Y})^2-a^2=\frac{df(a)}{dy}(\overline{Y}-a)+O((\overline{Y}-a)^2) =2a(\overline{Y}-a)+O((\overline{Y}-a)^2).$$

    Из этого соотношения следует, что с точностью до бесконечно малых более высокого порядка$$(\overline{Y})^2=a^2+2a(\overline{Y}-a)$$

    Поскольку в соответствии с центральной предельной теоремой выборочное среднее арифметическое является асимптотически нормальной случайной величиной с математическим ожиданием $$a$$ и дисперсией $$\sigma^2/n$$, то квадрат этой статистики является асимптотически нормальной случайной величиной с математическим ожиданием $$a^2$$ и дисперсией $$4a^2\sigma^2/n$$. Для практического использования может оказаться полезной замена параметров (асимптотического нормального распределения) на их оценки, а именно, математического ожидания - на $$(\overline{Y})^2$$, а дисперсии - на $$4(\overline{Y})^2 s^2/n$$, где $$s^2$$ - выборочная дисперсия.

    Большое внимание (целая глава!) уделено методу линеаризации в классическом учебнике Е.С. Вентцель [].

    4.5. Принцип инвариантности

    Пусть $$Y_1, Y_2, ..., Y_n$$ - независимые одинаково распределенные случайные величины с непрерывной функцией распределения $$F(x)$$. Многие используемые в прикладной статистике функции от результатов наблюдений выражаются через эмпирическую функцию распределения $$F_n(x)$$. К ним относятся статистики Колмогорова, Смирнова, омега-квадрат. Отметим, что и другие статистики выражаются через эмпирическую функцию распределения, например:$$\overline{Y}=\int\limits_{-\infty}^{+\infty} xdF_n(x).$$

    Полезным является преобразование Н.В.Смирнова $$t=F(x)$$. Тогда независимые случайные величины $$Z_j=F(Y_j), j=1,2,...,n$$, имеют равномерное распределение на отрезке [0; 1]. Рассмотрим построенную по ним эмпирическую функцию распределения $$F_n(t), 0\le t\le 1$$. Эмпирическим процессом называется случайный процесс$$\xi_n(t)=\sqrt{n}(F_n(t)-t).$$

    Рассмотрим критерии проверки согласия функции распределения выборки с фиксированной функцией распределения $$F(x)$$. Статистика критерия Колмогорова записывается в виде$$K_n=\sup_{0\le t\le 1}|\xi_n(t)|,$$ статистика критерия Смирнова - это$$S_n=\sup_{0\le t\le 1}\xi_n(t),$$ а статистика критерия омега-квадрат (Крамера-Мизеса-Смирнова) имеет вид$$\omega_n^2=\int\limits_0^1 \xi_n^2(t)dt.$$

    Случайный процесс $$\xi_n(t)$$ имеет нулевое математическое ожидание и ковариационную функцию $$М\xi_n(s)\xi_n(t)=\min(s,t)-st$$. Рассмотрим гауссовский случайный процесс $$\xi(t)$$ с такими же математическим ожиданием и ковариационной функцией. Он называется броуновским мостом. (Напомним, что гауссовским процесс именуется потому, что вектор $$(\xi(t1), \xi(t2), ..., \xi(tk))$$ имеет многомерное нормальное распределение при любых наборах моментов времени $$t1, t2, ..., tk$$.)

    Пусть $$f$$ - функционал, определенный на множестве возможных траекторий случайных процессов. ] состоит в том, что последовательность распределений случайных величин $$f(\xi_n)$$ сходится при $$n\rightarrow\infty$$ к распределению случайной величины $$f(\xi)$$. Сходимость по распределению обозначим символом $$\Rightarrow$$. Тогда принцип инвариантности кратко записывается так: $$f(\xi_n)\Rightarrow f(\xi)$$. В частности, согласно принципу инвариантности статистика Колмогорова и статистика омега квадрат сходятся по распределению к распределениям соответствующих функционалов от случайного процесса $$\xi$$:$$K_n=\sup_{0\le t\le 1}|\xi_n(t)|\Rightarrow\sup_{0\le t\le 1}|\xi(t)|, \omega_n^2=\int\limits_0^1\xi_n^2(t)dt\Rightarrow\int\limits_0^1\xi^2(t)dt.$$

    Таким образом, от проблем прикладной статистики сделан переход к теории случайных процессов. Методами этой теории найдены распределения случайных величин

    $$\sup_{0\le t\le 1},\; \int_0^1\xi^2(t)dt.$$

    Принцип инвариантности - инструмент получения предельных распределений функций от результатов наблюдений, используемых в прикладной статистике.

    Обоснование принципу инвариантности может быть дано на основе теории сходимости вероятностных мер в функциональных пространствах []. Более простой подход, позволяющий к тому же получать необходимые и достаточные условия в предельной теории статистик интегрального типа (принцип инвариантности к ним нельзя применить), рассмотрен в лекции 7.

    Почему "принцип инвариантности" так назван? Обратим внимание, что предельные распределения рассматриваемых статистик не зависят от их функции распределения $$F(x)$$. Другими словами, предельное распределение инвариантно относительно выбора $$F(x)$$.

    В более широком смысле термин "принцип инвариантности" применяют тогда, когда предельное распределение не зависит от тех или иных характеристик исходных распределений []. В этом смысле наиболее известный "принцип инвариантности" - это центральная предельная теорема, поскольку предельное стандартное нормальное распределение - одно и то же для всех возможных распределений независимых одинаково распределенных слагаемых (лишь бы слагаемые имели конечные математическое ожидание и дисперсию).

    4.6. Нечеткие множества как проекции случайных множеств

    Нечеткость и случайность. С самого начала появления современной теории нечеткости в 1960-е годы (см. лекцию 1) началось обсуждение ее взаимоотношений с теорией вероятностей. Дело в том, что функция принадлежности нечеткого множества напоминает распределение вероятностей. Отличие состоит только в том, что сумма вероятностей по всем возможным значениям случайной величины (или интеграл, если множество возможных значений неcчетно) всегда равна 1, а сумма $$S$$ значений функции принадлежности (в непрерывном случае - интеграл от функции принадлежности) может быть любым неотрицательным числом. Возникает искушение пронормировать функцию принадлежности, т.е. разделить все ее значения на $$S$$ (при $$S\ne 0$$ ), чтобы свести ее к распределению вероятностей (или к плотности вероятности). Однако специалисты по нечеткости справедливо возражают против такого "примитивного" сведения, поскольку оно проводится отдельно для каждой размытости (нечеткого множества), и определения обычных операций над нечеткими множествами с ним согласовать нельзя. Последнее утверждение означает следующее. Пусть указанным образом преобразованы функции принадлежности нечетких множеств $$A$$ и $$B$$. Как при этом преобразуются функции принадлежности $$A\cap B,A|cup B,A+B,AB$$? Установить это невозможно в принципе. Последнее утверждение становится совершенно ясным после рассмотрения нескольких примеров пар нечетких множеств с одними и теми же суммами значений функций принадлежности, но различными результатами теоретико-множественных операций над ними. Причем и суммы значений соответствующих функций принадлежности для этих результатов теоретико-множественных операций, (например, для пересечений множеств), также различны.

    В работах по нечетким множествам время от времени утверждается, что теория нечеткости является самостоятельным разделом прикладной математики и не имеет отношения к теории вероятностей (см., например, обзор литературы в монографиях [ $$16$$, $$17$$ ]). Некоторые авторы, сравнивавшие теорию нечеткости и теорию вероятностей, подчеркивали различие между этими областями теоретических и прикладных исследований. Обычно сравнивают аксиоматику и сравнивают области приложений. Надо сразу отметить, что аргументы при втором типе сравнений не имеют доказательной силы, поскольку по поводу границ применимости даже такой давно выделившейся научной области, как вероятностно-статистические методы, имеются различные мнения. Напомним, что итог рассуждений одного из наиболее известных французских математиков Анри Лебега по поводу границ применимости арифметики таков: "Арифметика применима тогда, когда она применима" (см. его монографию [ $$12$$, с.21-22]).

    При сравнении различных аксиоматик теории нечеткости и теории вероятностей нетрудно увидеть, что списки аксиом различаются. Из этого, однако, отнюдь не следует, что между указанными теориями нельзя установить связь, типа известного сведения евклидовой геометрии на плоскости к арифметике (точнее к теории числовой системы $$R^2$$ - см., например, монографию []). Напомним, что эти две аксиоматики - евклидовой геометрии и арифметики - на первый взгляд весьма сильно различаются.

    Можно понять желание энтузиастов теории нечеткости подчеркнуть принципиальную новизну своего научного аппарата. Однако не менее важно установить связи этого подхода с ранее известными.

    ] было показано, что нечеткие множества естественно рассматривать как "проекции" случайных множеств. Рассмотрим этот метод сведения теории нечетких множеств к теории случайных множеств.

    Определение 1. Пусть $$A=A(\omega)$$ - случайное подмножество конечного множества $$Y$$. Нечеткое множество $$B$$, определенное на $$Y$$, называется проекцией $$A$$ и обозначается $$Proj A$$, если$$\mu_B(y)=P(y\in A)$$ при всех $$y\in Y$$.

    Очевидно, каждому случайному множеству $$A$$ можно поставить в соответствие с помощью формулы (1) нечеткое множество $$B = Proj A$$. Оказывается, верно и обратное.

    Теорема 1. Для любого нечеткого подмножества $$B$$ конечного множества $$Y$$ существует случайное подмножество $$A$$ множества $$Y$$ такое, что $$B = Proj A$$.

    Доказательство. Достаточно задать распределение случайного множества $$A$$. Пусть $$Y_1$$ - носитель $$B$$ (см. определение 1 в п.1.4). Без ограничения общности можно считать, что $$Y_1=\{y_1,y_2,...,y_m\}$$ при некотором $$m$$ и элементы $$Y_1$$ занумерованы в таком порядке, что$$0<\mu_B(y_1)\le\mu_B(y_2)\le ...\le\mu_B(y_m)$$

    Введем множества$$Y(1)=Y_1,Y(2)=\{y_2,...,y_m\},...,Y(t)=\{y_t,...,y_m\},...,Y(m)=\{y_m\}.$$

    Положим$$\begin{gathered} P(A=Y(1))=\mu_B(y_1),P(A=Y(2))=\mu_B(y_2)-\mu_B(y_1),..., \\ P(A=Y(t))=\mu_B(y_t)-\mu_B(y_{t-1}),...,P(A=Y(m))=\mu_B(y_m)=\mu_B(y_{m-1}), \\ P(A=\varnothing)=1-\mu_B(y_m). \end{gathered}$$

    Для всех остальных подмножеств $$X$$ множества $$Y$$ положим $$P(A=X)=0$$. Поскольку элемент $$y_t$$ входит во множества $$Y(1), Y(2),..., Y(t)$$ и не входит во множества $$Y(t+1),...,Y(m)$$, то из приведенных выше формул следует, что $$P(y_t\in A)=\mu_B(y_t)$$. Если $$y\notin Y_1$$, то, очевидно, $$P(y\in A)=0$$ Теорема 1 доказана.

    Распределение случайного множества с независимыми элементами, как следует из рассмотрений главы 8 монографии [], полностью определяется его проекцией. Для конечного случайного множества общего вида это не так. Для уточнения сказанного понадобится следующая теорема.

    Теорема 2. Для случайного подмножества $$A$$ множества $$Y$$ из конечного числа элементов наборы чисел $$P(A=X),X\subseteq Y $$, и $$P(X\subseteq A),X\subseteq Y$$, выражаются один через другой.

    Доказательство. Второй набор выражается через первый следующим образом:$$P(X\subseteq A)=\sum_{X':X\subseteq X'}P(A=X')$$

    Элементы первого набора выразить через второй можно с помощью формулы включений и исключений из формальной логики, в соответствии с которой$$P(A=X)=P(X\subseteq A)-\sum P(X\bigcup\{y\}\subseteq A)+ \sum P(X\bigcup\{y_1,y_2\}\subseteq A)-...\pm P(Y\subseteq A).$$

    В этой формуле в первой сумме у пробегает все элементы множества $$Y\X$$, во второй сумме переменные суммирования $$y_1$$ и $$y_2$$ не совпадают и также пробегают это множество, и т.д. Ссылка на формулу включений и исключений завершает доказательство теоремы 2.

    В соответствии с теоремой 2 случайное множество $$A$$ можно характеризовать не только распределением, но и набором чисел $$P(X\subseteq A),X\subseteq Y$$. В этом наборе $$P(\varnothing\subseteq A)=1$$, а других связей типа равенств нет. В этот набор входят числа $$P(\{y\}\subseteq A)=P(y\in A)$$, следовательно, фиксация проекции случайного множества эквивалентна фиксации $$k = Card(Y)$$ параметров из $$(2^k-1)$$ параметров, задающих распределение случайного множества $$A$$ в общем случае.

    При доказательстве основных результатов будет использоваться следующая теорема.

    Теорема 3. Если $$Proj A = B$$, то $$Proj \overline{A}=\overline{B}$$.

    Для доказательства достаточно воспользоваться тождеством из теории случайных множеств $$P(\overline{A}=X)=P(A=\overline{X})$$, формулой для вероятности накрытия $$P(y\in A)$$, определением отрицания нечеткого множества и тем, что сумма всех $$P(A=X)$$ равна 1. При этом под формулой для вероятности накрытия имеется в виду следующее утверждение: чтобы найти вероятность накрытия фиксированного элемента $$q$$ случайным подмножеством $$S$$ конечного множества $$Q$$, достаточно вычислить$$P(q\in S)=P(\{\omega:q\in S(\omega)\})= \sum_{A:q\in A,A\subseteq 2^Q}P(S=A,)$$ где суммирование идет по всем подмножествам $$A$$ множества $$Q$$, содержащим $$q$$.

    Пересечения и произведения нечетких и случайных множеств. Выясним, как операции над случайными множествами соотносятся с операциями над их проекциями. В силу законов де Моргана (теорема 1 в п.1.4) и теоремы 3 достаточно рассмотреть операцию пересечения случайных множеств.

    Теорема 4. Если случайные подмножества $$A_1$$ и $$A_2$$ конечного множества $$Y$$ независимы, то нечеткое множество $$Proj (A_1\cap A_2)$$ является произведением нечетких множеств $$Proj A_1$$ и $$Proj A_2$$.

    Доказательство. Надо показать, что для любого $$y\in Y$$$$P(y\in A_1\cap A_2)=P(y\in A_1)P(y\in A_2)$$

    По формуле для вероятности накрытия точки случайным множеством (см. выше)$$P(y\in A_1\cap A_2)=\sum_{X:y\in X}P((A_1\cap A_2)=X).$$

    Легко проверить, что распределение пересечения случайных множеств $$A_1\cap A_2$$ можно выразить через их совместное распределение следующим образом:$$P(A_1\cap A_2=X)=\sum_{X_1,X_2:X_1\cap X_2=X}P(A_1=X_1,A_2=X_2).$$

    Из соотношений (3) и (4) следует, что вероятность накрытия для пересечения случайных множеств можно представить в виде двойной суммы$$P(y\in A_1\cap A_2)=\sum_{X:y\in X}\sum_{X_1,X_2:X_1\cap X_2=X}P(A_1=X_1,A_2=X_2)$$

    Заметим теперь, что правую часть формулы (5) можно переписать следующим образом:$$\sum_{X_1,X_2:y\in X_1,y\in X_2}P(A_1=X_1,A_2=X_2)$$

    Действительно, формула (5) отличается от формулы (6) лишь тем, что в ней сгруппированы члены, в которых пересечение переменных суммирования $$X_1\cap X_2$$ принимает постоянное значение. Воспользовавшись определением независимости случайных множеств и правилом перемножения сумм, получаем, что из (5) и (6) вытекает равенство$$P(y\in A_1\cap A_2)= \left( \sum_{X_1:y\in X_1}P(A_1=X_1) \right) \left( \sum_{X_2:y\in X_2}P(A_2=X_2) \right).$$

    Для завершения доказательства теоремы 4 достаточно еще раз сослаться на формулу для вероятности накрытия точки случайным множеством.

    Определение 2. Носителем случайного множества $$C$$ называется совокупность всех тех элементов $$y\in Y$$, для которых $$P(y\in C)>0$$.

    Теорема 5. Равенство$$Proj(A_1\cap A_2)=(Proj A_1)\cap(Proj A_2)$$ верно тогда и только тогда, когда пересечение носителей случайных множеств $$\overline{A_1}\cap A_2$$ и $$A_1\cap\overline{A_2}$$ пусто.

    Доказательство. Необходимо выяснить условия, при которых$$P(y\in A_1\cap A_2)=\min(P(y\in A_1),P(y\in A_2))$$

    Положим$$p_1=P(y\in A_1\cap A_2),p_2=P(y\in\overline{A_1}\cap A_2), p_3=P(y\in A_1\cap\overline{A_2}).$$

    Тогда равенство (7) сводится к условию$$p_1=\min(p_1+p_2,p_1+p_3)$$

    Ясно, что соотношение (8) выполнено тогда и только тогда, когда $$р_{2р3} = 0$$ при всех $$y\in Y$$, т.е. не существует ни одного элемента $$y_0\in Y$$ такого, что одновременно $$P(y_0\in\overline{A_1}\cap A_2)>0$$ и $$P(y_0\in A_1\cap\overline{A_2}>0)$$, а это эквивалентно пустоте пересечения носителей случайных множеств $$\overline{A_1}\cap A_2$$ и $$A_1\cap\overline{A_2}$$. Теорема 5 доказана.

    ] началось с введения случайных множеств с целью развития и обобщения аппарата нечетких множеств Л. Заде. Дело в том, что математический аппарат нечетких множеств не позволяет в должной мере учитывать различные варианты зависимости между понятиями (объектами), моделируемыми с его помощью, не является достаточно гибким. Так, для описания "общей части" двух нечетких множеств есть лишь две операции - произведение и пересечение. Если применяется первая из них, то фактически предполагается, что множества ведут себя как проекции независимых случайных множеств (см. выше теорему 4). Операция пересечения также накладывает вполне определенные ограничения на вид зависимости между множествами (см. выше теорему 5), причем в этом случае найдены даже необходимые и достаточные условия. Желательно иметь более широкие возможности для моделирования зависимости между множествами (понятиями, объектами). Использование математического аппарата случайных множеств предоставляет такие возможности.

    Цель сведения теории нечетких множеств к теории случайных множеств состоит в том, чтобы за любой конструкцией из нечетких множеств увидеть конструкцию из случайных множеств, определяющую свойства первой, аналогично тому, как за плотностью распределения вероятностей мы видим случайную величину. Рассмотрим результаты по сведению алгебры нечетких множеств к алгебре случайных множеств.

    Определение 3. Вероятностное пространство $$\{\Omega, G, P\}$$ назовем делимым, если для любого измеримого множества $$Х\in G$$ и любого положительного числа $$\alpha$$, меньшего $$Р(Х)$$, можно указать измеримое множество $$Y\subset X$$ такое, что $$P(Y)=\alpha$$.

    Пример. Пусть $$\Omega$$ - единичный куб конечномерного линейного пространства, $$G$$ есть сигма-алгебра борелевских множеств, а $$P$$ - мера Лебега. Тогда $$\{\Omega, G, P\}$$ - делимое вероятностное пространство.

    Таким образом, делимое вероятностное пространство - это не экзотика. Обычный куб является примером такого пространства.

    Доказательство сформулированного в примере утверждения проводится стандартными математическими приемами. Они основаны на том, что измеримое множество можно сколь угодно точно приблизить открытыми множествами, последние представляются в виде суммы не более чем счетного числа открытых шаров, а для шаров делимость проверяется непосредственно (от шара $$X$$ тело объема $$\alpha<P(X)$$ отделяется соответствующей плоскостью).

    Теорема 6. Пусть даны случайное множество $$A$$ на делимом вероятностном пространстве $$\{\Omega, G, P\}$$ со значениями во множестве всех подмножеств множества $$Y$$ из конечного числа элементов, и нечеткое множество $$D$$ на $$Y$$. Тогда существуют случайные множества $$C_1, C_2, C_3, C_4$$ на том же вероятностном пространстве такие, что$$\begin{gathered} Proj(A\bigcap C_1)=B\bigcap D,Proj(A\bigcap C_2)=BD,Proj(A\bigcup C_3)=B\bigcup D,\\ Proj(A\bigcup C_4)=B+D, Proj C_i=D,i=1,2,3,4, \end{gathered}$$ где $$B = Proj A$$.

    Доказательство. В силу справедливости законов де Моргана для нечетких (см. теорему 1 в п.1.4 выше) и для случайных множеств, а также теоремы 3 выше (об отрицаниях) достаточно доказать существование случайных множеств $$C_1$$ и $$C_2$$.

    Рассмотрим распределение вероятностей во множестве всех подмножеств множества $$Y$$, соответствующее случайному множеству $$C$$ такому, что $$Proj C = D$$ (оно существует в силу теоремы 1). Построим случайное множество $$C_2$$ с указанным распределением, независимое от $$A$$. Тогда $$Proj(A\cap C_2)=BD$$ по теореме 4.

    Перейдем к построению случайного множества $$C_1$$. По теореме 5 необходимо и достаточно определить случайное множество $$C_1(\omega)$$ так, чтобы $$Proj C_1 = D$$ и пересечение носителей случайных множеств $$A\cap\overline{C_1}$$ и $$\overline{A}\cap C_1$$ было пусто, т.е.$$p_3=P(y\in A\cap\overline{C_1})=0$$ для $$y\in Y_1=\{y:\mu_B(y)\le\mu_D(y)\}$$ и$$p_2=P(y\in\overline{A}\cap C_1)=0$$ для $$y\in Y_2=\{y:\mu_B(y)\le\mu_D(y)\}$$.

    Построим $$C_1(\omega)$$, исходя из заданного случайного множества A(\omega). Пусть $$y_1\in Y_2$$. Исключим элемент $$y_1$$ из $$A(\omega)$$ для стольких элементарных событий $$\omega$$, чтобы для полученного случайного множества $$A_1(\omega)$$ было справедливо равенство$$P(y_1\in A_1)=\mu_D(y_1)$$ (именно здесь используется делимость вероятностного пространства, на котором задано случайное множество $$A(\omega)$$ ). Для $$y\ne y_1$$, очевидно,$$P(y\in A_1)=P(y\in A).$$

    Аналогичным образом последовательно исключаем $$y$$ из $$A(\omega)$$ для всех $$y\in Y_2$$ и добавляем $$y$$ в $$A(\omega)$$ для всех $$y\in Y_1$$, меняя на каждом шагу $$P(y\in A_i)$$ только для $$y=y_1$$ так, чтобы$$P(y_i)\in A_i=\mu_D(y_i)$$ (ясно, что при рассмотрении $$y_i\in Y_1\cap Y_2$$ случайное множество $$A_i(\omega)$$ не меняется). Перебрав все элементы $$Y$$, получим случайное множество $$A_k(\omega)=C_1(\omega)$$, для которого выполнено требуемое. Теорема 6 доказана.

    Основной результат о сведении теории нечетких множеств к теории случайных множеств дается следующей теоремой.

    Теорема 7. Пусть $$B_1, B_2, B_3, ..., B_t$$ - некоторые нечеткие подмножества множества $$Y$$ из конечного числа элементов. Рассмотрим результаты последовательного выполнения теоретико-множественных операций$$B^m=((...((B_1\circ B_2)\circ B_3)\circ ...)\circB_{m-1})\circ B_m, m=1,2,...,t,$$ где $$\circ$$ - символ одной из следующих теоретико-множественных операций над нечеткими множествами: пересечение, произведение, объединение, сумма (на разных местах могут стоять разные символы). Тогда существуют случайные подмножества $$A_1, A_2, A_3, ..., A_t$$ того же множества $$Y$$ такие, что$$Proj A_j=B_i,i=1,2,...,t,$$ и, кроме того, результаты теоретико-множественных операций связаны аналогичными соотношениями$$Proj\{((...((A_1\otimes A_2)\otimes A_3)\otimes...)\otimes A_{m-1})\otimes A_m\}=B^m, m=1,2,...,t,$$ где знак $$\otimes$$ означает, что на рассматриваемом месте стоит символ пересечения $$\cap$$ случайных множеств, если в определении $$B_m$$ стоит символ пересечения или символ произведения нечетких множеств, и соответственно символ объединения $$\cup$$ случайных множеств, если в $$B_m$$ стоит символ объединения или символ суммы нечетких множеств.

    Комментарий. Поясним содержание теоремы. Например, если$$B^5=(((B_1+B_2)\cap B_3)B_4)\cup B_5,$$ то$$(((A_1\otimes A_2)\otimes A_3)\otimes A_4)\otimes A_5=(((A_1\cup A_2)\cap A_3)\cap A_4)\cup A_5.$$

    Как совместить справедливость дистрибутивного закона для случайных множеств (вытекающего из его справедливости для обычных множеств) с теоремой 2 п.1.4 выше, в которой показано, что для нечетких множеств, вообще говоря, $$(B_1+B_2)B_3\ne B_1B_3+B_2B_3$$? Дело в том, что хотя в соответствии с теоремой 7 для любых трех нечетких множеств $$B_1, B_2$$ и $$B_3$$ можно указать три случайных множества $$A_1, A_2$$ и $$A_3$$ такие, что$$Proj(A_i)=B_i, i=1,2,3, Proj (A_1\cup A_2)=B_1+B_2, Proj((A_1\cup A_2)|cap A_3)=B^3,$$ где$$B^3=(B_1+B_2)B_3,$$ но при этом, вообще говоря,$$Proj(A_1\cup A_3)\ne B_1B_3$$ и, кроме случаев, указанных в теореме 2 п.1.4,$$Proj(A_1\cup A_2)\cap A_3)\ne B_1B_3+B_2B_3.$$

    Доказательство теоремы 7 проводится методом математической индукции. При $$t = 1$$ распределение случайного множества строится с помощью теоремы 1. Затем конструируется само случайное множество $$A_1$$, определенное на делимом вероятностном пространстве (нетрудно проверить, что на делимом вероятностном пространстве можно построить случайное подмножество конечного множества с любым заданным распределением именно в силу делимости пространства). Далее случайные множества $$A_2, A_3, ..., A_t$$ строим по индукции с помощью теоремы 6. Теорема 7 доказана.

    Замечание. Проведенное доказательство теоремы 9 проходит и в случае, когда при определении $$B^m$$ используются отрицания, точнее, кроме $$B^m$$ ранее введенного вида используются также последовательности результатов теоретико-множественных операций, очередной шаг в которых имеет вид$$B_1^m=\overline{B^{m-1}}\circ B_m, B_2^m=B^{m-1}\circ \overline{B_m}, B_3^m=\overline{B^{m-1}}\circ \overline{B_m}.$$

    А именно, сначала при помощи законов де Моргана (теорема 1 п.1.4 выше) проводится преобразование, в результате которого в последовательности $$B^m$$ остаются только отрицания отдельных подмножеств из совокупности $$B_1, B_2, B_3, ..., B_t$$, а затем с помощью теоремы 3 вообще удается избавиться от отрицаний и вернуться к условиям теоремы 7.

    Итак, в настоящем параграфе описаны связи между такими объектами нечисловой природы, как нечеткие и случайные множества, установленные в нашей стране в первой половине 1970-х годов. Через несколько лет, а именно, в начале 1980-х годов, близкие подходы стали развиваться и за рубежом. Одна из работ [] носит примечательное название "Нечеткие множества как классы эквивалентности случайных множеств".

    В прикладной статистике и эконометрике []).

    4.7. Устойчивость выводов и принцип уравнивания погрешностей

    Устойчивость математических моделей. Проблемам познания, в том числе в технических исследованиях, естественно-научных и социально-экономических областях, посвящено огромное количество работ. Однако это не значит, что обо всем в этой области уже все сказано. А о некоторых положениях целесообразно говорить еще и еще раз, пока они ни станут общеизвестными.

    В идеале каждую модель порождения и анализа данных следовало бы рассматривать как аксиоматическую теорию. В этом идеальном случае создание и использование модели происходит в соответствии с известной триадой "практика - теория - практика". А именно, сначала вводятся некоторые математические объекты, соответствующие интересующим исследователя реальным объектам, и на основе представлений о свойствах реальных объектов формулируются необходимые для успешного моделирования свойства математических объектов, которые и принимаются в качестве аксиом. Затем аксиоматическая теория развивается как часть математики, вне связи с представлениями о реальных объектах. На заключительном этапе полученные в математической теории результаты интерпретируются содержательно. Получаются утверждения о реальных объектах, являющиеся следствиями тех и только тех их свойств, которые ранее были аксиоматизированы.

    После построения математической модели реального явления или процесса встает вопрос об ее адекватности. Иногда ответ на этот вопрос может дать эксперимент. Рассогласование модельных и экспериментальных данных следует интерпретировать как признак неадекватности некоторых из принятых аксиом. Однако для проверки адекватности социально-экономических моделей зачастую невозможно поставить решающий эксперимент в отличие, скажем, от физических моделей. С другой стороны, для одного и того же явления или процесса, как правило, можно составить много возможных моделей, если угодно, много разновидностей одной базовой модели. Поэтому необходимы какие-то дополнительные условия, которые позволяли бы из множества возможных моделей и эконометрических методов анализа данных выбрать наиболее подходящие. В качестве одного из подобных условий выдвигается требование устойчивости модели и метода анализа данных относительно допустимых отклонений исходных данных и предпосылок модели или условий применимости метода.

    Отметим, что в большинстве случаев исследователей и практических работников интересуют не столько сами модели и методы, сколько решения, которые с их помощью принимаются. Ведь модели и методы для того и разрабатываются, чтобы подготавливать решения. Вместе с тем очевидно, что решения, как правило, принимаются в условиях неполноты информации. Так, любые числовые параметры известны лишь с некоторой точностью. Введение в рассмотрение возможных неопределенностей исходных данных требует каких-то заключений относительно устойчивости принимаемых решений по отношению к этим допустимым неопределенностям.

    Введем основные понятия согласно монографии []. Будем считать, что имеются исходные данные, на основе которых принимаются решения. Способ переработки (отображения) исходных данных в решение назовем моделью. Таким образом, с общей точки зрения модель - это функция, переводящая исходные данные в решение, т.е. способ перехода значения не имеет. Очевидно, любая рекомендуемая для практического использования модель должна быть исследована на устойчивость относительно допустимых отклонений исходных данных. Укажем некоторые возможные применения результатов подобного исследования:

  • заказчик научно-исследовательской работы получает представление о точности предлагаемого решения;
  • удается выбрать из многих моделей наиболее адекватную;
  • по известной точности определения отдельных параметров модели удается указать необходимую точность нахождения остальных параметров;
  • переход к случаю "общего положения" позволяет получать более сильные с математической точки зрения результаты.
  • , ] приведены различные примеры. В прикладной статистике точность предлагаемого решения связана с разбросом исходных данных и с объемом выборки. Выбору наиболее адекватной модели посвящены темы, рассмотренные в лекциях 8 и 9, связанные с обсуждением моделей однородности и регрессии. Использование рационального объема выборки в статистике интервальных данных (лекция 12) исходит из принципа уравнивания погрешностей. Этот принцип основан на том, что по известной точности определения отдельных параметров модели удается указать необходимую точность нахождения остальных параметров. Другим примером применения принципа уравнивания погрешностей является нахождение необходимой точности оценивания параметров в моделях логистики, рассмотренных в главе 5 монографии []. Наконец, переходом к случаю "общего положения" в прикладной статистике является, в частности, переход к непараметрическим методам, необходимый из-за невозможности обосновать принадлежность результатов наблюдений к тем или иным параметрическим семействам.

    Специалисты по математическому моделированию и теории управления считают устойчивость одной из важных характеристик технических, социально-экономических, медицинских и иных моделей. Достаточно глубокие исследования ведутся по ряду направлений.

    Первоначальное изучение влияния малого изменения одного параметра обычно называют анализом чувствительности. Оно описывается значением частной производной. Если модель задается дифференцируемой функцией, то итог анализа чувствительности - вектор значений частных производных в анализируемой точке.

    Теория устойчивости решений дифференциальных уравнений развивается по крайней мере с XIX в. []. Выработаны соответствующие понятия - устойчивость по Ляпунову, корректность, доказаны глубокие теоремы. Для решения некорректных задач академиком АН СССР А.Н. Тихоновым в начале 1960-х годов был предложен метод регуляризации. Модели явлений и процессов, выражаемые с помощью дифференциальных уравнений, могут быть исследованы на устойчивость путем применения хорошо разработанного математического аппарата.

    Вопросы устойчивости изучались практически во всех направлениях прикладных математических методов - и в математическом программировании, и в теории массового обслуживания (теории очередей), и в эколого-экономических моделях, и в различных областях эконометрики.

    Общая схема устойчивости. Прежде чем переходить к конкретным постановкам, обсудим "общую схему устойчивости", дающую понятийную базу для обсуждения проблем устойчивости в различных предметных областях.

    Определение 1. Общей схемой устойчивости называется объект $$\{A,B,d,f,E\}$$.

    Здесь $$A$$ - множество, интерпретируемое как пространство исходных данных; $$B$$ - множество, называемое пространством решений. Однозначное отображение $$f:A\rightarrow B$$ называется моделью. Об этих трех составляющих общей схемы устойчивости уже шла речь выше.

    Оставшиеся два понятия нужны для уточнения понятий близости в пространстве исходных данных и пространстве решений. Подобные уточнения могут быть сделаны разными способами. Самое "слабое" уточнение - на языке топологических пространств. Тогда возможны качественные выводы (сходится - не сходится), но не количественные расчеты. Самое "сильное" уточнение - на языке метрических пространств. Промежуточный вариант - используются показатели различия (отличаются от метрик тем, что не обязательно выполняются неравенства треугольника) или вводимые ниже понятия.

    Пусть $$d$$ - показатель устойчивости, т.е. неотрицательная функция, определенная на подмножествах $$Y$$ множества $$B$$ и такая, что из $$Y_1\subseteq Y_2$$ вытекает $$d(Y_1)\le d(Y_2)$$. Часто показатель устойчивости $$d(Y)$$ определяется с помощью метрики, псевдометрики или показателя различия (меры близости) $$\rho$$ как диаметр множества $$Y$$, т.е.$$d(Y)=\sup\{\rho(y_1,y_2),y_1\in Y,y_2\in Y\}.$$

    Таким образом, говоря попросту, в пространстве решений с помощью показателя устойчивости вокруг образа исходных данных может быть сформирована система окрестностей. Но сначала надо такую систему сформировать в пространстве исходных данных.

    Пусть $$E=\{E(x,\alpha),x\in A,\alpha\in\Theta\}$$ - совокупность допустимых отклонений. То есть система подмножеств множества $$A$$ такая, что каждому элементу множества исходных данных $$x\in A$$ и каждому значению параметра $$\alpha$$ из некоторого множества параметров $$\Theta$$ соответствует подмножество $$E(x,\alpha)$$ множества исходных данных. Оно называется множеством допустимых отклонений в точке $$x$$ при значении параметра, равном $$\alpha$$. Наглядно можно представить себе, что вокруг точки $$x$$ взята окрестность радиуса $$\alpha$$.

    Определение 2. Показателем устойчивости в точке $$x$$ при значении параметра, равном $$\alpha$$, называется число$$\beta(x,E(x,\alpha))=d(f(E(x,\alpha))).$$

    Другими словами, это - диаметр образа множества допустимых колебаний при рассматриваемом в качестве модели отображении. Очевидно, что этот показатель устойчивости зависит как от исходных данных, так и от диаметра множества возможных отклонений в исходном пространстве. Для непрерывных функций показатель устойчивости обычно называется модулем непрерывности.

    Естественно посмотреть, насколько сузится образ окрестности возможных отклонений при максимально возможном сужении этой окрестности.

    Определение 3. Абсолютным показателем устойчивости в точке $$x$$ называется число$$\beta(x,E)=\inf\{\beta(x,E(x,\alpha)),\alpha\in\Theta\}.$$

    Если функция $$f$$ непрерывна, а окрестности - именно те, о которых идет речь в математическом анализе, то максимальное сужение означает сужение к точке и абсолютный показатель устойчивости равен 0. Но в теории измерений и статистике интервальных данных мы сталкиваемся с совсем иными ситуациями. В теории измерений окрестностью исходных данных являются все те вектора, что получаются из исходного путем преобразования координат с помощью допустимого преобразования шкалы, а допустимое преобразование шкалы берется из соответствующей группы допустимых преобразований. В статистике интервальных данных под окрестностью исходных данных естественно понимать - при описании выборки - куб с ребрами $$2\Delta$$ и центром в исходном векторе. И в том, и в другом случае максимальное сужение не означает сужение к точке.

    Естественным является желание ввести характеристики устойчивости на всем пространстве. Не вдаваясь в математические тонкости (см. о них монографию []), рассмотрим меру $$\mu$$ на пространстве $$A$$ такую, что мера всего пространства равна 1 (т.е. $$\mu(A)=1$$ ).

    Определение 4. Абсолютным показателем устойчивости на пространстве исходных данных $$A$$ по мере $$\mu$$ называется число$$\gamma(\mu)=\int\limits_A\beta(x,E)d\mu$$

    Здесь имеется в виду интеграл Лебега. Интегрирование проводится по (абстрактному) пространству исходных данных $$A$$ по мере $$\mu$$. Естественно, должны быть выполнены некоторые внутриматематические условия. Читателю, незнакомому с интегрированием по Лебегу, достаточно мысленно заменить в предыдущей формуле интеграл на сумму (а пространство $$A$$ считать конечным, хотя и состоящим из большого числа элементов).

    Определение 5. Максимальным абсолютным показателем устойчивости называется$$\gamma=\sup\{\beta(x,E),x\in A\}.$$

    Легко видеть, что $$\gamma=\sup\gamma(\mu)$$ где супремум берется по всем описанным выше мерам.

    Итак, построена иерархия показателей устойчивости математических моделей реальных явлений и процессов. Она с успехом использовалась в различных исследованиях, подробно развивалась, в частности, в монографии []. Приведем еще одно полезное определение.

    Определение 6. Модель $$f$$ называется абсолютно $$\varepsilon$$ -устойчивой, если $$\gamma\le\varepsilon$$ где $$\gamma$$ - максимальный абсолютный показатель устойчивости.

    Пример. Если показатель устойчивости формируется с помощью метрики $$\rho$$, совокупность допустимых отклонений $$E$$ - это совокупность всех окрестностей всех точек пространства исходных данных $$A$$, то 0 - устойчивость модели $$f$$ эквивалентна непрерывности модели $$f$$ на множестве $$A$$.

    Основная проблема в общей схеме устойчивости - проверка $$\varepsilon$$ - устойчивости данной модели $$f$$ относительно данной системы допустимых отклонений $$E$$.

    Часто оказываются полезными следующие два обобщения основной проблемы.

    Проблема А ( характеризации устойчивых моделей ). Даны пространство исходных данных $$A$$, пространство решений $$B$$, показатель устойчивости $$d$$, совокупность допустимых отклонений $$E$$ и неотрицательное число $$\varepsilon$$. Описать достаточно широкий класс $$\varepsilon$$ - устойчивых моделей $$f$$. Или: найти все $$\varepsilon$$ - устойчивые модели среди моделей, обладающих данными свойствами, т.е. входящих в данное множество моделей.

    Проблема Б ( характеризации систем допустимых отклонений ). Даны пространство исходных данных $$A$$, пространство решений $$B$$, показатель устойчивости $$d$$, модель $$f$$ и неотрицательное число $$\varepsilon$$. Описать достаточно широкий класс систем допустимых отклонений $$E$$, относительно которых модель $$f$$ является $$\varepsilon$$ -устойчивой. Или: найти все такие системы допустимых отклонений $$E$$ среди совокупностей допустимых отклонений, обладающих данными свойствами, т.е. входящих в данное множество совокупностей допустимых отклонений.

    Ясно, что проблемы А и Б можно рассматривать не только для показателя устойчивости $$\gamma$$, но и для других только что введенных показателей устойчивости, а именно, $$\gamma(\mu),\beta(x,E),\beta(x,E(x,\alpha))$$.

    Язык общей схемы устойчивости позволяет описывать конкретные задачи специализированных теорий устойчивости в различных областях исследований, выделять основные элементы в них, ставить проблемы типа А и Б. В частности, на этом языке легко формулируются задачи теории устойчивости решений дифференциальных уравнений, теории робастности статистических процедур (см. ]), и т.д.

    Для примера рассмотрим определение устойчивости по Ляпунову решения $$\varphi(t,x)$$ нормальной автономной системы дифференциальных уравнений $$\dot{y}=g(y)$$ с начальными условиями $$\varphi(0,x)=x$$. Здесь пространство исходных данных $$A$$ - конечномерное евклидово пространство, множество допустимых отклонений $$E(x,\alpha)$$ окрестность радиуса $$\alpha$$ точки $$x\in A$$, пространство решений $$B$$ - множество функций на луче $$[0;+\infty)$$ с метрикой $$\rho(y_1,y_2)=\sup_{\ge 0}|y_1(t)-y_2(t)|$$.

    Модель $$f$$ - отображение, переводящее начальные условия $$x$$ в решение системы дифференциальных уравнений с этими начальными условиями $$\varphi(t,x)$$

    В терминах общей схемы устойчивости положение равновесия $$a$$ называется устойчивым по Ляпунову, если $$\beta(a,E)=0$$. Для формулировки определения асимптотической устойчивости по Ляпунову надо ввести в пространстве решений $$B$$ псевдометрику$$\rho_1(y_1,y_2)=\overline{\lim_{t\rightarrow\infty}}|y_1(t)-y_2(t)|.$$

    Положение равновесия $$a$$ называется асимптотически устойчивым, если $$\beta_1(a,E(a,\varepsilon))=0$$ для некоторого $$\varepsilon>0$$ где показатель устойчивости $$\beta_1$$ рассчитан с использованием псевдометрики $$\rho_1$$.

    Таким образом, общая схема устойчивости естественным образом включает в себя классические понятия теории устойчивости по Ляпунову. Вместе с тем стоит отметить, что эта схема дает общий подход к различным проблемам устойчивости. Она дает систему понятий, которые в каждом конкретном случае должны приспосабливаться к решаемой задаче.

    До настоящего момента для определенности речь шла о допустимых отклонениях в пространстве исходных данных. Часто оказывается необходимым говорить и об отклонениях от предпосылок модели. С чисто формальной точки зрения для этого достаточно расширить понятие "исходные данные" до пары $$(x, f)$$, т.е. включив "прежнюю" модель в качестве второго элемента пары. Все остальные определения остаются без изменения. Теперь отклонения в пространстве решений вызываются не только отклонениями в исходных данных $$x$$, но и отклонениями от предпосылок модели, т.е. отклонениями $$f$$. Это соображение нам понадобится в п.6.4, посвященном робастности статистических процедур.

    Устойчивость по отношению к объему выборки. Различные асимптотические постановки в прикладной статистике также естественно рассматривать как задачи устойчивости. Если при безграничном возрастании объема выборки некоторая величина стремится к пределу, то в терминах общей схемы устойчивости это означает, что она 0 - устойчива в соответствующей псевдометрике (см. выше обсуждение асимптотической устойчивости по Ляпунову). С содержательной точки зрения употребление термина "устойчивость" в такой ситуации представляется вполне оправданным, поскольку рассматриваемая величина мало меняется при изменении объема выборки.

    Рассмотрим проблему и методы оценки близости предельных распределений статистик и распределений, соответствующих конечным объемам выборок. При каких объемах выборок уже можно пользоваться предельными распределениями? Каков точный смысл термина "можно" в предыдущей фразе? Основное внимание уделяется переходу от точных формул допредельных распределений к пределу и применению метода статистических испытаний (Монте-Карло).

    Начнем с обсуждения взаимоотношений асимптотической математической статистики и практики анализа статистических данных. Как обычно подходят к обработке реальных данных в конкретной задаче? Первым делом строят статистическую модель. Если хотят перенести выводы с совокупности результатов наблюдений на более широкую совокупность, например, предсказать что-либо, то рассматривают, как правило, вероятностно-статистическую модель. Например, традиционную модель выборки, в которой результаты наблюдений - реализации независимых (в совокупности) одинаково распределенных случайных величин. Очевидно, любая модель лишь приближенно соответствует реальности. В частности, естественно ожидать, что распределения результатов наблюдений несколько отличаются друг от друга, а сами результаты связаны между собой, хотя и слабо.

    Итак, первый этап - переход от реальной ситуации к математической модели. Далее - неожиданность: на настоящем этапе своего развития математическая теория статистики зачастую не позволяет провести необходимые исследования для имеющихся объемов выборок. Более того, отдельные математики пытаются оправдать свой отрыв от практики соображениями о структуре этой теории, на первый взгляд убедительными. Неосторожная давняя фраза Б.В. Гнеденко и А.Н. Колмогорова: "Познавательная ценность теории вероятностей раскрывается только предельными теоремами" (см. классическую монографию [], одну из наиболее ценных математических книг ХХ в.) взята на вооружение и более близкими к нам по времени авторами. Так, И.А. Ибрагимов и Р.З. Хасьминский пишут: "Решение неасимптотических задач оценивания, хотя и весьма важное само по себе, как правило, не может являться объектом достаточно общей математической теории. Более того, соответствующее решение часто зависит от конкретного типа распределения, объема выборки и т.д. Так, теория малых выборок из нормального закона будет отличаться от теории малых выборок из закона Пуассона" (см. напичканную формулами монографию [, с.7]).

    Согласно цитированным и подобным им авторам, основное содержание математической теории статистики - предельные теоремы, полученные в предположении, что объемы рассматриваемых выборок стремятся к бесконечности. Эти теоремы опираются на предельные соотношения теории вероятностей, типа закона больших чисел и Центральной предельной теоремы. Ясно, что сами по себе подобные утверждения относятся к математике, т.е. к сфере чистой абстракции, и не могут быть непосредственно применены для анализа реальных данных. Их практическое использование, о котором "чистые" математики предпочитают не думать, опирается на важное предположение: "При данном объеме выборки достаточно точными являются асимптотические формулы".

    Конечно, в качестве первого приближения представляется естественным воспользоваться асимптотическими формулами, не тратя сил на анализ их точности. Но это - лишь начало долгой цепи исследований. Как же обычно преодолевают разрыв между результатами асимптотической математической статистики и потребностями практики статистического анализа данных? Какие "подводные камни" подстерегают на этом пути?

    Точные формулы и асимптотика. Начнем с наиболее продвинутой в математическом плане ситуации, когда для статистики известны как предельное распределение, так и распределения при конечных объемах выборки.

    Примером является двухвыборочная односторонняя статистика Н.В. Смирнова. Рассмотрим две независимые выборки объемов $$m$$ и $$n$$ из непрерывных функций распределения $$F(x)$$ и $$G(x)$$ соответственно. Для проверки гипотезы однородности двух выборок (ср. лекц. 8), т.е. гипотезы $$H_0:F(x)=G(x)$$ для всех действительных чисел $$x$$, в 1939 г. Н.В. Смирнов в статье [ $$22$$ ] предложил использовать статистику$$D^+(m,n)=\sup(F_m(x)-G_n(x)),$$ где $$F_m(x)$$ - эмпирическая функция распределения, построенная по первой выборке, $$G_n(x)$$ - эмпирическая функция распределения, построенная по второй выборке, супремум берется по всем действительным числам $$x$$. Для обсуждения проблемы соотношения точных и предельных результатов ограничимся случаем равных объемов выборок, т.е. $$m = n$$. Положим$$H(n,t)=P(D^+(n,n)\ge\frac{t}{\sqrt{n}}).$$

    В цитированной статье [] Н.В. Смирнов установил, что при безграничном возрастании объема выборки n вероятность $$H(n,t)$$ стремится к $$\exp(-t^2)$$.

    В работе [] 1951 г. Б.В. Гнеденко и В.С. Королюк показали, что при целом (именно при таких $$t$$ вероятность $$H(n,t)$$ как функция $$t$$ имеет скачки, поскольку статистика Смирнова $$D^+(n,n)$$ кратна $$1/n$$ ) рассматриваемая вероятность $$H(n,t)$$ выражается через биномиальные коэффициенты, а именно,$$H(n,t)={{2n\choose {n-c}}}/{{2n}\choose n}.$$

    К сожалению, непосредственные расчеты по формуле (1) возможны лишь при сравнительно небольших объемах выборок, поскольку величина $$n$$! ( $$n$$ -факториал) уже при $$n=100$$ имеет более 200 цифр и не может быть без преобразований использована в вычислениях. Следовательно, наличие точной формулы для интересующей нас вероятности не снимает необходимости использования предельного распределения и изучения точности приближения с его помощью.

    Широко известная формула Стирлинга для гамма-функции и, в частности, для факториалов позволяет преобразовать последнее выражение в асимптотическое разложение. То есть построить бесконечный степенной ряд (по степеням $$n$$ ) такой, что каждая следующая частичная сумма дает все более точное приближение для интересующей нас вероятности $$H(x,t)$$. Это и было сделано в работе А.А. Боровкова в 1962 г. Большое количество подобных разложений для различных статистических задач приведено в работах В.М. Калинина и О.В. Шалаевского конца 1960-х - начала 1970-х годов. (Интересно отметить, что асимптотические разложения в ряде случаев расходятся, т.е. остаточные члены имеют нетривиальную природу.)

    Затем в работах конца 1970-х годов была сделана попытка теоретически оценить остаточный член второго порядка. Итоги подведены в монографии [, $$\S$$ 2.2, с.37-45]. Справедливо равенство$$H(n,t)=\exp(-t^2)\cdot(1+f(t)/n +g(n,t)/n^2),\text{ где } f(t)=t^2(1/2-t^2/6).$$

    Целью последних из названных работ было получение равномерных по $$n, t$$ оценок остаточного члена второго порядка $$g(n,t)$$ сверху и снизу в области, задаваемой условиями$$0<\frac{t}{\sqrt{n}}<A,0<t<t_{\max},\;,n\ge n_0.$$

    где $$A,t_{\max},n_0$$ - некоторые параметры. С помощью длинных цепочек оценок остаточных членов в формулах, получаемых при преобразовании формулы (1) к предельному виду, сформулированная выше цель была достигнута. Для различных наборов параметров $$A,t_{\max},n_0$$ получены равномерные по $$n, t$$ оценки (сверху и снизу) остаточного члена второго порядка $$g(n,t)$$ в области (2). Так, например, при $$A=0,5, t_{\max}=1,73,n_0=8$$ нижняя граница равна (-0,71), а верхняя - 2,65.

    Основными недостатками такого подхода являются: во-первых, зависимость оценок от параметров $$A,t_{\max},n_0$$, задающих границы областей; во-вторых, завышение оценок, иногда в сотни раз, обусловленное желанием получить равномерные оценки по области (оценкой реальной погрешности в конкретной точке является значение следующего члена асимптотического разложения).

    Поэтому при составлении рассчитанной на практическое использование методики [] проверки однородности двух выборок с помощью статистики Смирнова было решено перейти на несколько другую методологию (назовем ее "методологией заданной точности"), которую кратко можно описать следующим образом:

  • выбирается достаточно малое положительное число $$p$$, например $$p=0,05$$ или $$p=0,20$$ ;
  • приводятся точные значения $$H(n,t)$$ для всех значений $$n$$ таких, что$$|H(n,t)-\exp(-t^2)|>p\exp(-t^2);$$
  • если же последнее неравенство не выполнено, то вместо $$H(n,t)$$ используется предельное значение $$\exp(-t^2)$$.
  • Таким образом, принятая в методике [] методология предполагает интенсивное использование вычислительной техники. Результатами расчетов являются граничные значения объемов выборок $$n(p,t)$$ такие, что при меньших значениях объемов выборок рекомендуется пользоваться точными значениями функции распределения статистики Смирнова, а при больших - предельными. Описывается этот результат таблицей, а не формулой. Отметим, что при построении реальных таблиц не обойтись без выбора того или иного конкретного значения $$p$$, задающего объемы таблиц.

    Оценки скорости сходимости. Теоретические оценки скорости сходимости в различных задачах прикладной математической статистики иногда формулируются в весьма абстрактном виде. Так, в 1960 - 1970-х годах была популярна задача оценки скорости сходимости распределения классической статистики омега-квадрат (Крамера-Мизеса-Смирнова). Для максимума модуля разности допредельной и предельной функций распределения этой статистики различные авторы доказывали, что для любого $$e>0$$ существует константа $$C(e)$$ такая, что он не превосходит $$C(e)n-w+e$$. Прогресс состоял в увеличении константы $$w$$. Сформулированный выше результат был доказан последовательно для $$w$$ = 1/10, 1/6, 1/5, 1/4, 1/3, 1/2 и 1 (подробнее история этих исследований рассказана в $$\S$$ 2.3 монографии []).

    Конечно, все эти исследования не могли дать конкретных практических рекомендаций. Однако необходимой исходной точкой является само существование предельного распределения. Представим себе, что некто, не зная, что у распределения Коши нет математического ожидания, моделирует выборочные средние арифметические результатов наблюдений из этого распределения. Ясно, что его попытки оценить скорость сходимости выборочных средних к пределу обречены на провал.

    Последовательное улучшение теоретических оценок скорости сходимости дает надежду на быструю реальную сходимость. Действительно, численные расчеты показали, что предельным распределением для статистики омега-квадрат (Крамера-Мизеса-Смирнова) можно пользоваться уже при объеме выборки, равном 4.

    Использование датчиков псевдослучайных чисел. Если же предельное распределение известно, то возникает возможность изучить скорость сходимости численно методом статистических испытаний (Монте-Карло). Однако при этом обычно возникают две проблемы.

    Во-первых, откуда известно, что скорость сходимости монотонна? Если при данном объеме выборки различие мало, то будет ли оно мало и при дальнейших объемах? Иногда отклонения допредельного распределения от предельного объясняются довольно сложными причинами. Так, для распределения хи-квадрат они связаны с рядом до сих пор не решенных теоретико-числовых проблем о числе целых точек в эллипсоиде растущего диаметра.

    Во-вторых, с помощью датчиков псевдослучайных чисел получаем допредельные распределения с погрешностью, которая может преуменьшать различие. Поясним мысль аналогией. Растущий сигнал измеряется с погрешностями. Когда можно гарантировать, что его величина наверняка превзошла заданную границу?

    Напомним, что проблема качества датчиков псевдослучайных чисел продолжает оставаться открытой (см. гл.11 в []). Для моделирования в пространствах фиксированной размерности датчики псевдослучайных чисел решают поставленные задачи. Но для рассматриваемых здесь задач размерность не фиксирована - мы не знаем, при каком конкретно объеме выборки можно переходить к предельному распределению согласно "методологии заданной точности".

    Нужны дальнейшие работы по изучению качества датчиков псевдослучайных чисел в задачах неопределенной размерности. Поскольку критиков датчиков обычно обвиняют в том, что они сами их не используют, отметим, что мы применяли этот инструментарий при изучении помех, создаваемых электровозами (см. монографию []), при изучении статистических критериев проверки однородности двух выборок - см. работу []).

    А нужна ли вообще асимптотика? В настоящее время развивается актуальное направление прикладной статистики, связанное с интенсивным использованием вычислительной техники для изучения свойств статистических процедур. Как уже отмечалось, математические методы в статистике обычно позволяют получать лишь асимптотические результаты, и для переноса выводов на конечные объемы выборок приходится применять вычислительные методы. В Новосибирском государственном техническом университете разработан и успешно применяется оригинальный подход, основанный на интенсивном использовании современной вычислительной техники. Основная идея такова: в качестве альтернативы асимптотическим методам математической статистики используется анализ результатов статистического моделирования (порядка 2000 испытаний) выборок конкретных объемов (200, 500, 1000). При этом анализ предельных распределений заменяется на анализ распределений соответствующих статистик при указанных объемах выборок.

    К достоинствам подхода относится возможность замены теоретических исследований расчетами. Разработанная программная система дает (в принципе) возможность численно изучить свойства любого статистического алгоритма для любого конкретного распределения результатов наблюдений и любого конкретного объема выборки. К недостаткам рассматриваемого подхода относится зависимость от свойств датчиков псевдослучайных чисел, а также - что более важно - неизвестность предельного распределения (и даже самого факта его существования), а потому невозможность обоснованного переноса полученных выводов на объемы выборок, отличные от исследованных. Поэтому с точки зрения теории математической статистики полученные рассматриваемым способом результаты следует рассматривать как правдоподобные (а не доказательные, как в классической математической статистике).

    Кроме того, они принципиально неточные. Даже в наиболее благоприятных условиях отклонение (в метрике "супремум разности") смоделированного распределения, построенного по 2000 испытаниям, от теоретического предельного распределения может достигать $$1,358\times (1/2000)^{1/2}=0,030$$ (см. лекцию 2). Это означает, в частности, что процентные точки, соответствующие уровням значимости 0,05 и особенно 0,01, могут сильно отличаться от соответствующих процентных точек предельных распределений. Очевидно, следующий этап работ - изучение точности полученных в рассматриваемом подходе выводов, прежде всего приближений и процентных точек.

    Однако сразу все не сделаешь. Поэтому новосибирцы совершенно правы, развивая новые компьютерные подходы к давним задачам прикладной статистики.

    Стоит сделать два замечания. В работе [] сравниваются два плана контроля надежности технических изделий. Оказывается, что при объемах выборки, меньших 150, лучше первый план, а при объемах, больших 150 - второй. Значит, если бы по новосибирскому методу сравнивались эти планы при достаточно большом объеме выборки $$n = 100$$, то лучшим был бы признан первый план, что неверно - наступит момент (объем выборки), когда лучшим станет второй план.

    Другое относящееся к делу замечание - из весьма содержательной монографии о прикладной математике []. Будем суммировать бесконечный ряд с членами $$z_n=1/n$$. Поскольку члены его убывают, то обычно используемые алгоритмы остановят вычисления на каком-то шагу. А сумма-то - бесконечна!

    Кажется, что компьютер дал универсальную отмычку ко всем проблемам вообще и в области прикладной статистики в частности. Но это только кажется.

    ] выбор числа градаций в социологических анкетах целесообразно проводить на основе уравнивания погрешностей квантования и неопределенности в ответах респондентов. В классической модели управления запасами целесообразно уравнять влияние неточностей в определении параметров на отклонение целевой функции от оптимума. Для этой модели из принципа уравнивания погрешностей следует, что относительные погрешности определения параметров модели должны совпадать. Погрешность, порожденная отклонением спроса от линейного, оценивается по данным об отпуске товаров. Это дает возможность оценить допустимые отклонения для других параметров. В частности, установить, что расхождения между методиками их определения не являются существенными [].

    В терминах общей схемы устойчивости рассмотрим для простоты записи случай двух параметров. Пусть $$A=[0,\infty)\times[0,\infty)$$ и $$E(x,\alpha)=E(x,(\varepsilon,\delta))$$, где $$\varepsilon>0$$ и $$\delta>0$$ задают точность определения соответствующих параметров, так что $$E(x,(\varepsilon_1,\delta_1))\subseteq E(x,(\varepsilon_2,\delta_2))$$ при $$\varepsilon_1\le\varepsilon_2, \delta_1\le\delta_2$$. Пусть $$\varepsilon$$ задано, а $$\delta$$ исследователь может выбрать, причем известно, что уменьшение $$\delta$$ связано с увеличением расходов. Как выбирать $$\delta$$? Представляется естественным "уравнять" отклонения, порожденные различными параметрами, т.е. определить $$\delta$$ из условия$$\beta(x,E(x,(\varepsilon,\delta)))-\beta(x,E(x,(\varepsilon,0)))\approx\beta(x,E(x,(\varepsilon,0))).$$

    Если затраты и полезный эффект точно известны, то $$\delta$$ можно определить путем решения соответствующей оптимизационной задачи. В противном случае соотношение (3) предлагается использовать в качестве эвристического правила.

    Контрольные вопросы и задачи

  • Почему в прикладной статистике необходимо использовать теоремы о наследовании сходимости?
  • Примените метод линеаризации для изучения распределения выборочной дисперсии (исходя из асимптотической нормальности при $$n\rightarrow\infty$$ среднего арифметического двумерных векторов $$(X_k, (X_k)^2), k=1,2,...,n)$$.
  • Как применяется в прикладной статистике принцип инвариантности?
  • Как с точки зрения нечетких множеств можно интерпретировать вероятность накрытия определенной точки случайным множеством?
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,1, \mu_B(y_2)=0,2, \mu_B(y_3)=0,3$$. Постройте случайное множество $$A$$ так, чтобы $$Proj A = B$$.
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,2, \mu_B(y_2)=0,1, \mu_B(y_3)=0,5$$. Постройте случайное множество $$А$$ так, чтобы $$Proj A = B$$.
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,5, \mu_B(y_2)=0,4, \mu_B(y_3)=0,7$$. Постройте случайное множество $$А$$ так, чтобы $$Proj A = B$$.
  • На множестве $$Y=\{y_1,y_2,y_3\}$$ задано нечеткое множество $$B$$ с функцией принадлежности $$\mu_B(y)$$, причем $$\mu_B(y_1)=0,3, \mu_B(y_2)=0,2, \mu_B(y_3)=0,1$$. Постройте случайное множество $$А$$ так, чтобы $$Proj A = B$$.
  • В чем состоит основная идея принципа уравнивания погрешностей?
  • Темы докладов, рефератов, исследовательских работ

  • Законы больших чисел и различные варианты центральной предельной теоремы - основные результаты классической теории вероятностей.
  • Место теорем о наследовании сходимости и метода линеаризации в асимптотической прикладной статистике.
  • Принцип инвариантности для классических непараметрических статистик.
  • Обсудите суждение: "Мы мыслим нечетко" (см. []). Почему нечеткость мышления помогает взаимопониманию?
  • Взаимосвязь теории нечеткости и теории вероятностей.
  • Методы оценивания функции принадлежности.
  • Теория нечеткости и интервальная математика.
  • Описание данных для выборок, элементы которых - нечеткие множества.
  • Регрессионный анализ нечетких переменных (согласно []).
  • Кластерный анализ нечетких данных.
  • Непараметрические оценки плотности распределения вероятностей в пространстве нечетких множеств (согласно подходу лекции 5).
  • Проблема устойчивости в математическом моделировании.
  • Вернуться к учебному плану