Прикладная статистика

Описание данных

Разбить на страницы
Показывать лекцию целиком

5.1. Модели порождения данных

Детерминированный и модельно-вероятностный подходы. В прикладной статистике есть два подхода к исходным данным - детерминированный и модельно-вероятностный. В первом из них данные рассматриваются сами по себе, без попыток связать их с какой-либо более общей ситуацией. Например, при анализе данных о производственной деятельности конкретного предприятия за конкретный период времени подсчитывается процент брака по конкретным технологическим процессам, число работников на различных должностях, объем реализованной продукции по месяцам. К этой же категории данных относятся различные виды отчетности - бухгалтерская, налоговая, статистическая (для органов Росстата). Преимуществом детерминированного подхода является отсутствие каких-либо дополнительных предположений о данных. Недостаток состоит в невозможности обоснованного переноса выводов с конкретной ситуации на другие, ей аналогичные. Например, на другие периоды времени или на другие предприятия. При детерминированном подходе невозможно также оценить погрешность рассчитанных характеристик.

Чтобы выйти за пределы конкретной ситуации, необходимо использовать модельно-вероятностный подход, согласно которому основой алгоритмов расчетов является вероятностная модель порождения данных. При этом конкретные данные рассматриваются как реализации случайных величин, векторов, более общо - случайных элементов, т.е. как значения задающих их функций, определенных на вероятностном пространстве, в конкретной точке (элементарном событии $$\omega$$ ).

Наиболее распространенная вероятностная модель порождения данных - это модель случайной выборки. Согласно этой модели данные $$x_1, x_2, ... , x_n$$ рассматриваются как реализации независимых одинаково распределенных случайных элементов (величин, векторов, множеств и других объектов нечисловой природы) $$X_1 = X_1(\omega), X_2 = X_2(\omega), ..., X_n = X_n(\omega)$$, т.е. $$x_1= X_1(\omega_0), x_2 = X_2(\omega_0), ..., x_n = X_n(\omega_0)$$ при некотором $$\omega_0$$ из пространства элементарных событий $$\Omega$$. Модель выборки обычно используется для описания результатов независимых наблюдений, измерений, анализов, опытов.

В некоторых случаях используют более специальные модели порождения данных. Например, при проведении испытаний на надежность используют план испытаний, согласно которому испытания прекращаются через время $$T$$. Это значит, что фиксируются только моменты отказа изделий, которые произошли до момента $$T$$. Пусть $$x_1, x_2, ..., x_n$$ - наработки на отказ $$n$$ изделий. Статистику доступны только значения $$y_1, y_2, ..., y_n$$, где $$y_j = x_j$$ при $$x_j<T$$ и $$y_j=T$$ при $$x_j\ge T$$. Такая выборка, в которой часть описывающих реальное явление случайных величин заменена на граничное значение, называется цензурированной. Иногда используются и более сложные модели порождения данных. Например, если аппаратурой не фиксируются значения, меньшие некоторого порога, то выборка не только цензурирована, но и состоит из случайного числа элементов. Бывают и процедуры, когда минимальный и максимальный элементы выборки отбрасываются, а остальные предоставляются статистику, и т.д.

Параметрические и непараметрические модели случайной выборки. Рассмотрим ситуацию, когда элементы выборки - числа. Модель описывается функцией распределения элементов выборки. Можно ли что-либо сказать об этой функции?

В учебных курсах по теории вероятностей и математической статистике обычно рассматривают различные параметрические семейства распределений числовых случайных величин. А именно - изучают семейства нормальных распределений, логарифмически нормальных, экспоненциальных, гамма-распределений, распределений Вейбулла-Гнеденко и др. Все они зависят от одного, двух или трех параметров. Поэтому для полного описания распределения достаточно знать или оценить одно, два или три числа. Очень удобно. Поэтому широко развита и представлена в литературе параметрическая теория математической статистики, в которой предполагается, что распределения результатов наблюдений принадлежат тем или иным параметрическим семействам.

К сожалению, параметрические семейства существуют лишь в головах авторов учебников по теории вероятностей и математической статистике. В реальной жизни их нет. Поэтому прикладная статистика использует в основном непараметрические методы, в которых распределения результатов наблюдений могут иметь произвольный вид. В настоящем подразделе на примере нормального распределения подробно обсудим невозможность практического использования параметрических семейств для описания распределений конкретных данных.

В лекции 7 разобраны параметрические методы отбраковки резко выделяющихся наблюдений и продемонстрирована невозможность практического использования ряда методов параметрической статистики, ошибочность выводов, к которым они приводят. В лекции 8 рассмотрены непараметрические методы доверительного оценивания основных характеристик числовых случайных величин - математического ожидания, медианы, дисперсии, среднего квадратического отклонения, коэффициента вариации.

К настоящему времени непараметрические методы полностью покрывают область задач, которые ранее решались с помощью параметрической статистики. Поэтому можно порекомендовать использовать только непараметрическую статистику. Однако в литературе много внимания уделяется параметрическим методам, поэтому игнорировать в настоящем учебнике параметрическую статистику было признано нецелесообразным.

Часто ли распределение результатов наблюдений является нормальным? В эконометрических и экономико-математических моделях, применяемых, в частности, при изучении и оптимизации процессов маркетинга и менеджмента в целом, управления предприятием и регионом, точности и стабильности технологических процессов, в задачах надежности, обеспечения безопасности, в том числе экологической, функционирования технических устройств и объектов, разработки организационных схем часто применяют понятия и результаты теории вероятностей и математической статистики. При этом зачастую используют те или иные параметрические семейства распределений вероятностей. Наиболее популярно нормальное распределение. Используют также логарифмически нормальное распределение, экспоненциальное распределение, гамма-распределение, распределение Вейбулла-Гнеденко и т.д.

Очевидно, всегда необходимо проверять соответствие моделей реальности. Возникают два вопроса. Отличаются ли реальные распределения от используемых в модели? Насколько это отличие влияет на выводы?

Ниже на примере нормального распределения показано, что реальные распределения практически всегда отличаются от включенных в классические параметрические семейства. Имеющиеся отклонения от заданных семейств делают неверными выводы, основанные на использовании этих семейств. Например, выводы об отбраковке резко отличающихся наблюдений (выбросов).

Есть ли основания априори предполагать нормальность результатов измерений?

Иногда утверждают, что в случае, когда погрешность измерения (или иная случайная величина) определяется в результате совокупного действия многих малых факторов, то в силу центральной предельной теоремы (ЦПТ) теории вероятностей эта величина хорошо приближается (по распределению) нормальной случайной величиной. Такое утверждение справедливо, если малые факторы действуют аддитивно и независимо друг от друга. Если же они действуют мультипликативно, то в силу той же ЦПТ аппроксимировать надо логарифмически нормальным распределением. В прикладных задачах обосновать аддитивность, а не мультипликативность действия малых факторов обычно не удается. Если же зависимость имеет общий характер, не приводится к аддитивному или мультипликативному виду, а также нет оснований принимать модели, дающие экспоненциальное, Вейбулла-Гнеденко, гамма или иные распределения, то о распределении итоговой случайной величины практически ничего не известно, кроме внутриматематических свойств типа регулярности.

Экспериментальное изучение распределений погрешностей. При обработке конкретных данных иногда считают, что погрешности измерений имеют нормальное распределение. На предположении нормальности построены классические модели регрессионного, дисперсионного, факторного анализов, метрологические модели, которые еще продолжают встречаться как в отечественной ноpмативно-технической документации, так и в международных стандартах. На то же предположение опираются модели расчетов максимально достигаемых уровней тех или иных характеристик, применяемые при проектировании систем обеспечения безопасности функционирования экономических структур, технических устройств и объектов. Однако теоретических оснований для такого предположения нет. Необходимо экспериментально изучать распределения погрешностей.

Что же показывают результаты экспериментов? Сводка, данная в монографии [], позволяет утверждать, что в большинстве случаев распределение погрешностей измерений отличается от нормального. Так, в Машинно-электротехническом институте (г. Варна в Болгарии) было исследовано распределение погрешностей градуировки шкал аналоговых электроизмерительных приборов. Изучались приборы, изготовленные в Чехословакии, СССР и Болгарии. Закон распределения погрешностей оказался одним и тем же. Он имеет плотность$$f(x)=0,534\exp(1-|x|^7).$$

Были проанализированы данные о параметрах 219 фактических распределений погрешностей, исследованных разными авторами, при измерении как электрических, так и не электрических величин самыми разнообразными (электрическими) приборами. В результате этого исследования оказалось, что 111 распределений, т.е. примерно 50%, принадлежат классу распределений с плотностью$$f(x;\alpha,b.\sigma)=\frac{\alpha}{2\lambda\sigma\Gamma(1/\alpha)}\exp \left( -|\frac{x-b}{\lambda\sigma}|^{\alpha} \right),$$ где $$\alpha$$ - параметр степени (формы); $$b$$ - параметр сдвига; $$\sigma$$ - параметр масштаба; $$\Gamma(\beta)$$ - гамма-функция от аргумента $$\beta$$ ;$$\lambda=\sqrt{\frac{\Gamma(1/\alpha)}{\Gamma(3/\alpha)}}$$ (см. [, с.56]); 63 распределения, т.е. 30%, имеют плотности с плоской вершиной и пологими длинными спадами и не могут быть описаны как нормальные или, например, экспоненциальные. Оставшиеся 45 распределений оказались двухмодальными.

В книге известного метролога проф. П. В. Новицкого [] приведены результаты исследования законов распределения различного рода погрешностей измерения. Он изучил распределения погрешностей электромеханических приборов на кернах, электронных приборов для измерения температур и усилий, цифровых приборов с ручным уравновешиванием. Объем выборок экспериментальных данных для каждого экземпляра составлял 100-400 отсчетов. Оказалось, что 46 из 47 распределений значимо отличались от нормального. Исследована форма распределения погрешностей у 25 экземпляров цифровых вольтметров Щ-1411 в 10 точках диапазона. Результаты аналогичны. Дальнейшие сведения содержатся в монографии [].

В лаборатории прикладной математики Тартуского государственного университета проанализировано 2500 выборок из архива реальных статистических данных. В 92% случаев гипотезу нормальности пришлось отвергнуть.

Приведенные описания экспериментальных данных показывают, что погрешности измерений в большинстве случаев имеют распределения, отличные от нормальных. Это означает, в частности, что большинство применений критерия Стьюдента, классического регрессионного анализа и других статистических методов, основанных на нормальной теории, строго говоря, не является обоснованным, поскольку неверна лежащая в их основе аксиома нормальности распределений соответствующих случайных величин.

Очевидно, для оправдания или обоснованного изменения существующей практики анализа статистических данных требуется изучить свойства процедур анализа данных при "незаконном" применении. Изучение процедур отбраковки показало, что они крайне неустойчивы к отклонениям от нормальности, а потому применять их для обработки реальных данных нецелесообразно (см. лекцию 7); поэтому нельзя утверждать, что произвольно взятая процедура устойчива к отклонениям от нормальности.

Иногда предлагают перед применением, например, критерия Стьюдента однородности двух выборок проверять нормальность. Хотя для этого имеется много критериев, но проверка нормальности - более сложная и трудоемкая статистическая процедура, чем проверка однородности (как с помощью статистик типа Стьюдента, так и с помощью непараметрических критериев). Для достаточно надежного установления нормальности требуется весьма большое число наблюдений. Так, чтобы гарантировать, что функция распределения результатов наблюдений отличается от некоторой нормальной не более, чем на 0,01 (при любом значении аргумента), требуется порядка 2500 наблюдений. В большинстве экономических, технических, медико-биологических и других прикладных исследований число наблюдений существенно меньше. Особенно это справедливо для данных, используемых при изучении проблем, связанных с обеспечением безопасности функционирования экономических структур и технических объектов.

ЦПТ и нормальность. Иногда пытаются использовать ЦПТ для приближения распределения погрешности к нормальному, включая в технологическую схему измерительного прибора специальные сумматоры. Оценим полезность этой меры. Пусть $$Z_1,Z_2,...,Z_k$$ - независимые одинаково распределенные случайные величины с функцией распределения $$H=H(x)$$ такие, что $$M(Z_1)=0,D(Z_1)=1,M|Z_1|^3=\rho<+\infty$$. Рассмотрим$$w=\frac{Z_1,Z_2,...,Z_k}{\sqrt{k}}.$$

Показателем обеспечиваемой сумматором близости к нормальности является$$C=\sup_H\sup_x|P(w<x)-\Phi(x)|.$$ Тогда$$0,3989\frac{\rho}{\sqrt{k}}\le C\le 0,7975\frac{\rho}{\sqrt{k}}.$$

Правое неравенство в последнем соотношении вытекает из оценок константы в неравенстве Берри-Эссеена, полученном в книге [ $$1$$, с.172], а левое - из примера в монографии [ $$23$$, с.140-141]. Для нормального закона $$\rho=1,6$$, для равномерного $$\rho=1,3$$, для двухточечного $$\rho=1$$ (это - нижняя граница для $$\rho$$ ). Следовательно, для обеспечения расстояния (в метрике Колмогорова) до нормального распределения не более 0,01 для "неудачных" распределений необходимо не менее $$k_0$$ слагаемых, где$$0,4\sqrt{k_0}<0,01, k_0>1600.$$

В обычно используемых сумматорах слагаемых значительно меньше.

Сужая класс возможных распределений $$H$$, можно получить, как показано в монографии [], более быструю сходимость, но теория здесь еще не смыкается с практикой. Кроме того, не ясно, обеспечивает ли близость распределения к нормальному (в определенной метрике) также и близость распределений статистик. Речь идет о сравнении распределения статистики, построенной по случайным величинам, полученным суммированием, к распределению статистики, соответствующей нормальным результатам наблюдений. Видимо, для каждой конкретной статистики необходимы специальные теоретические исследования. Именно к такому выводу приходит автор монографии []. В задачах отбраковки выбросов ответ: "не обеспечивает" (см. ниже).

Отметим, что результат любого реального измерения записывается с помощью конечного числа десятичных знаков, обычно небольшого (2-5), так что любые реальные данные целесообразно моделировать лишь с помощью дискретных случайных величин, принимающих сравнительно небольшое число значений. Нормальное распределение - лишь аппроксимация реального распределения. Так, например, данные конкретного исследования, приведенные в работе [], принимают значения от 1,0 до 2,2, т.е. всего 13 возможных значений. Из принципа Дирихле следует, что в какой-то точке построенная по данным работы [] функция распределения отличается от ближайшей функции нормального распределения не менее чем на 1/26, т.е. на 0,04. Кроме того, очевидно, что для нормального распределения случайной величины вероятность попасть в дискретное множество десятичных чисел с заданным числом знаков после запятой равна 0.

Из сказанного выше следует, что результаты измерений и вообще статистические данные имеют свойства, приводящие к тому, что моделировать их следует случайными величинами с распределениями, более или менее отличными от нормальных. В большинстве случаев распределения существенно отличаются от нормальных. В других ситуациях нормальные распределения могут, видимо, рассматриваться как некоторая аппроксимация. Но никогда нет полного совпадения. Отсюда вытекает необходимость изучения свойств классических статистических процедур в неклассических вероятностных моделях (подобно тому, как это сделано в лекции 8 для критерия Стьюдента). А также целесообразность разработки устойчивых (учитывающих наличие отклонений от нормальности) и непараметрических, в том числе свободных от распределения процедур, их широкого внедрения в практику статистической обработки данных.

Опущенные здесь рассмотрения для других параметрических семейств приводят к аналогичным выводам. Итог можно сформулировать так. Распределения реальных данных практически никогда не входят в какое-либо конкретное параметрическое семейство. Реальные распределения всегда отличаются от тех, которые включены в параметрические семейства. Отличия могут быть большими или меньшими, но они всегда есть.

5.2. Таблицы и выборочные характеристики

Исходные статистические данные могут быть достаточно обширными. В качестве примера приведем результаты экспертного опроса, проведенного Институтом высоких статистических технологий и эконометрики в 1994 г. (табл.5.1). В первом столбце приведены номера экспертов, в остальных четырех - четыре прогнозных значения, полученных от каждого эксперта. Отметим, что эксперт № 28 не ответил на вопрос об инфляции. В таблицах реальных данных приходится сталкиваться с пропусками.

Описание данных - это первичное сжатие информации с целью сделать ее более обозримой, легкой для восприятия. Самый древний способ - это составление различных таблиц, вторичных по отношению к таблицам исходных данных.

Прогнозы экспертов на 8 декабря 1994 г. (сделаны 19.10.1994)
№ п/п Курс доллара США, руб. Инфляция (%) за период прогноза Цена батона белого хлеба, руб. Цена 1 л молока, руб.
1 4185 4,0 800 1305
2 4270 2,8 1028 1322
3 3200 17,0 760 755
4 4000 16,0 950 1000
5 3500 16,0 820 800
6 3800 5,0 1000 1000
7 3500 3,5 500 1500
8 3300 62,0 800 780
9 4100 54,0 900 899
10 3560 10,0 870 1050
11 4000 54,0 1000 1000
12 5200 54,0 1500 1500
13 4000 9,0 830 1300
14 6000 54,0 2000 2000
15 4000 40,0 950 1200
16 3400 13,0 750 900
17 3500 15,0 1000 1250
18 4200 2,5 1000 1500
19 3560 200,0 940 1200
20 4300 6,0 950 1570
21 4000 3,0 1000 1100
22 4500 12,0 950 1100
23 4200 11,0 890 1100
24 3900 54,0 1000 1000
25 5500 62,0 1000 1400
26 5000 73,0 1000 1200
27 5600 54,0 1200 2000
28 3900 - 1500 1400
29 4200 38,0 950 1100
30 3680 38,0 850 1100
31 4000 2,0 840 1100
32 4600 46,0 1000 1100
33 4560 92,0 1300 1400

Например, рассмотрим последний столбец табл.5.1. Для лучшего восприятия прогнозов экспертов о цене 1 л молока сгруппируем данные по интервалам, как это сделано в табл.5.2.

Прогнозируемая цена молока
№ п/п Интервал, руб. Число ответов
1 700-799 2
2 800-899 2
3 900-999 1
4 1000-1099 5
5 1100-1199 7
6 1200-1299 4
7 1300-1399 3
8 1400-1499 3
9 1500-1599 4
10 2000 2
Всего 33

Группировка данных в табл.5.2 по 10 интервалам может показаться слишком дробной. Нетрудно объединить градации и получить следующее (см. табл.5.3).

Прогнозируемая цена молока (крупные градации)
№ п/п Интервал, руб. Число ответов
1 700-999 5
2 1000-1299 16
3 1300-1599 10
4 2000 2
5 Всего 33

Сколько использовать градаций (т.е. строк в таблице)? Общих рекомендаций дать нельзя. Ответ зависит от цели статистического исследования, от структуры конкретных данных.

Табличный материал может быть выражен в виде различных диаграмм, в том числе круговых и столбчатых. Несколько десятков лет назад были популярны гистограммы - столбчатые диаграммы, для которых интервалы группирования имеют одинаковую длину.

В настоящее время гистограммы рассматривают как устаревшие инструменты статистического анализа. Для описания массива данных рекомендуется использовать вариационные ряды, эмпирические функции распределения (см. лекцию 2) и - особенно настоятельно - непараметрические оценки плотности (см. п.5.6). Кроме того, целесообразно рассчитывать и приводить в документации в разделе "Описание данных" выборочные характеристики:

  • выборочное среднее арифметическое;
  • выборочную дисперсию;
  • выборочное среднее квадратическое отклонение;
  • коэффициент вариации;
  • медиану;
  • минимум (первый член вариационного ряда);
  • максимум (последний член вариационного ряда);
  • размах;
  • моду и амплитуду моды;
  • верхний квартиль;
  • нижний квартиль;
  • межквартильное расстояние.
  • Определения всех этих выборочных характеристик даны выше в лекции 2. В настоящем подразделе сведены вместе наиболее распространенные приемы описания числовых данных.

    5.3. Шкалы измерения, инвариантные алгоритмы и средние величины

    Инвариантные алгоритмы и средние величины. Основное требование к алгоритмам анализа данных формулируется в теории измерений (см. лекцию 1) так: выводы, сделанные на основе данных, измеренных в шкале определенного типа, не должны меняться при допустимом преобразовании шкалы измерения этих данных. Другими словами, выводы должны быть инвариантны по отношению к допустимым преобразованиям шкалы.

    Таким образом, одна из основных целей теории измерений - борьба с субъективизмом исследователя при приписывании численных значений реальным объектам. Так, расстояния можно измерять в аршинах, метрах, микронах, милях, парсеках и других единицах измерения. Массу (вес) - в пудах, килограммах, фунтах и др. Цены на товары и услуги можно указывать в юанях, рублях, тенге, гривнах, латах, кронах, марках, долларах США и других валютах (при фиксированных курсах пересчета). Подчеркнем очень важное, хотя и вполне очевидное обстоятельство: выбор единиц измерения зависит от исследователя, т.е. субъективен. Статистические выводы могут быть адекватны реальности только тогда, когда они не зависят от того, какую единицу измерения предпочтет исследователь, т.е. когда они инвариантны относительно допустимого преобразования шкалы.

    Оказывается, сформулированное условие является достаточно сильным. Из многих алгоритмов анализа статистических данных ему удовлетворяют лишь некоторые. Покажем это на примере сравнения средних величин.

    Пусть $$X_1,X_2,...,X_n$$ - выборка объема $$n$$. Часто используют среднее арифметическое$$X_{cp}=\frac{X_1,X_2,...,X_n}{n}.$$ Использование среднего арифметического настолько привычно, что второе слово в термине часто опускают. И говорят о средней заработной плате, среднем доходе и других средних для конкретных экономических данных, подразумевая под "средним" среднее арифметическое. Такая традиция может приводить к ошибочным выводам. Покажем это на примере расчета средней заработной платы (среднего дохода) работников условного предприятия (табл.5.4).

    Численность работников различных категорий, их заработная плата и суммарные доходы (в усл. ед.)
    № п/п Категория работников Число работников Заработная плата Суммарные доходы
    1 Низкоквалифицированные рабочие 40 100 4000
    2 Высококвалифицированные рабочие 30 200 6000
    3 Инженеры и служащие 25 300 7500
    4 Менеджеры 4 1000 4000
    5 Генеральный директор (владелец) 1 18500 18500
    6 Всего 100 40000

    Первые три строки в табл.5.4 вряд ли требуют пояснений. Менеджеры - это директора по направлениям, а именно по производству (главный инженер), по финансам, по маркетингу и сбыту, по персоналу (по кадрам). Владелец сам руководит предприятием в качестве генерального директора. В столбце "заработная плата" указаны доходы одного работника соответствующей категории, а в столбце "суммарные доходы" - доходы всех работников соответствующей категории.

    Фонд оплаты труда составляет 40000 единиц, работников всего 100, следовательно, средняя заработная плата составляет 40000/100 = 400 единиц. Однако эта средняя арифметическая величина явно не соответствует интуитивному представлению о "средней заработной плате". Из 100 работников лишь 5 имеют заработную плату, ее превышающую, а зарплата остальных 95 существенно меньше средней арифметической. Причина очевидна: заработная плата одного человека - генерального директора - превышает заработную плату 95 работников - низкоквалифицированных и высококвалифицированных рабочих, инженеров и служащих.

    Ситуация напоминает описанную в известном рассказе о больнице, в которой 10 больных, из них у 9 температура 40 $$\deg$$ С, а один уже отмучился, лежит в морге с температурой 0 $$\deg$$ С. Между тем средняя температура по больнице равна 36 $$\deg$$ С - лучше не бывает!

    Сказанное показывает, что среднее арифметическое можно использовать лишь для достаточно однородных совокупностей (без больших выбросов в ту или иную сторону). А какие средние целесообразно использовать для описания заработной платы? Вполне естественно использовать медиану. Для данных табл.5.4 медиана - среднее арифметическое зарплат 50-го и 51-го работника, если заработные платы всех 100 работников расположены в порядке неубывания. Сначала идут заработные платы 40 низкоквалифицированных рабочих, а затем - с 41-го до 70-го работника - заработные платы высококвалифицированных рабочих. Следовательно, медиана попадает именно на них и равна 200. У 50-ти работников заработная плата не превосходит 200, и у 50-ти - не менее 200, поэтому медиана показывает "центр", около которого группируется основная масса исследуемых величин. Еще одна средняя величина - мода, наиболее часто встречающееся значение. В рассматриваемом случае это заработная плата низкоквалифицированных рабочих, т.е. 100. Таким образом, для описания заработной платы имеем три средние величины - моду (100 ед.), медиану (200 ед.) и среднее арифметическое (400 ед.). Для наблюдающихся в реальной жизни распределений доходов и заработной платы справедлива та же закономерность: мода меньше медианы, а медиана меньше среднего арифметического.

    Для чего в технических, экономических, медицинских и иных исследованиях используются средние величины? Обычно для того, чтобы заменить совокупность чисел одним числом, чтобы сравнивать совокупности с помощью средних.

    Пусть, например, $$Y_1,Y_2,...,Y_n$$ - совокупность оценок экспертов, "выставленных" одному объекту экспертизы (например, одному из вариантов стратегического развития фирмы), $$Z_1,Z_2,...,Z_n$$ - второму (другому варианту такого развития). Как сравнивать эти совокупности? Очевидно, самый простой способ - по средним значениям.

    А как вычислять средние? Известны различные виды средних величин: среднее арифметическое, медиана, мода, среднее геометрическое, среднее гармоническое, среднее квадратическое. Напомним, что общее понятие средней величины введено французским математиком первой половины ХIХ в. академиком О. Коши. Оно таково: средней величиной является любая функция $$f(X_1,X_2,...,X_n)$$ такая, что при всех возможных значениях аргументов значение этой функции не меньше, чем минимальное из чисел $$(X_1,X_2,...,X_n)$$, и не больше, чем максимальное из этих чисел. Все перечисленные выше виды средних являются средними по Коши.

    При допустимом преобразовании шкалы значение средней величины, очевидно, меняется. Но выводы о том, для какой совокупности среднее больше, а для какой - меньше, не должны меняться (в соответствии с требованием инвариантности выводов, принятом как основное требование в теории измерений). Сформулируем соответствующую математическую задачу поиска вида средних величин, результат сравнения которых устойчив относительно допустимых преобразований шкалы.

    Пусть $$f(X_1,X_2,...,X_n)$$ - среднее по Коши. Пусть среднее по первой совокупности меньше среднего по второй совокупности:$$f(Y_1,Y_2,...,Y_n)<f(Z_1,Z_2,...,Z_n).$$

    Тогда согласно теории измерений для устойчивости результата сравнения средних необходимо, чтобы для любого допустимого преобразования $$g$$ из группы допустимых преобразований в соответствующей шкале было справедливо также неравенство$$f(g(Y_1),g(Y_2),...,g(Y_n))<f(g(Z_1),g(Z_2),...,g(Z_n)),$$ т.е. среднее преобразованных значений из первой совокупности также было меньше среднего преобразованных значений для второй совокупности. Причем сформулированное условие должно быть верно для любых двух совокупностей $$Y_1,Y_2,...,Y_n$$ и $$Z_1,Z_2,...,Z_n$$. И, напомним, для любого допустимого преобразования. Средние величины, удовлетворяющие сформулированному условию, назовем допустимыми (в соответствующей шкале). Согласно теории измерений только такими средними можно пользоваться при анализе мнений экспертов и иных данных, измеренных в рассматриваемой шкале.

    С помощью математической теории, развитой в монографии [], удается описать вид допустимых средних в основных шкалах. Сразу ясно, что для данных, измеренных в шкале наименований, в качестве среднего годится только мода.

    Средние величины в порядковой шкале. Рассмотрим обработку, для определенности, мнений экспертов, измеренных в порядковой шкале. Справедливо следующее утверждение.

    Теорема 1. Из всех средних по Коши допустимыми средними в порядковой шкале являются только члены вариационного ряда (порядковые статистики).

    Теорема 1 справедлива при условии, что среднее $$f(X_1,X_2,...,X_n)$$ является непрерывной (по совокупности переменных) и симметрической функцией. Последнее означает, что при перестановке аргументов значение функции $$f(X_1,X_2,...,X_n)$$ не меняется. Это условие является вполне естественным, ибо среднюю величину мы находим для совокупности (множества), а не для последовательности. Множество не меняется в зависимости от того, в какой последовательности мы перечисляем его элементы.

    Согласно теореме 1 в качестве среднего для данных, измеренных в порядковой шкале, можно использовать, в частности, медиану (при нечетном объеме выборки). При четном же объеме следует применять один из двух центральных членов вариационного ряда - как их иногда называют, левую медиану или правую медиану. Моду тоже можно использовать - она всегда является членом вариационного ряда. Но никогда нельзя рассчитывать среднее арифметическое, среднее геометрическое и т.д.

    Приведем численный пример, показывающий некорректность использования среднего арифметического $$f(X_1, X_2)=(X_1+X_2)/2$$ в порядковой шкале. Пусть $$Y_1=1, Y_2=11, Z_1=6, Z_2=8$$. Тогда $$f(Y_1, Y_2)=6$$, что меньше, чем $$f(Z_1,Z_2)=7$$. Пусть строго возрастающее преобразование $$g$$ таково, что $$g(1)=1, g(6)=6, g(8)=8, g(11)=99$$. Таких преобразований много. Например, можно положить $$g(x)=x$$ при $$x$$, не превосходящих 8, и $$g(x)=99(x-8)/3+8$$ для $$x$$, больших 8. Тогда $$(g(Y_1),g(Y_2))=50$$, что больше, чем $$f(g(Z_1),g(Z_2))=7$$. Как видим, в результате допустимого, т.е. строго возрастающего преобразования шкалы упорядоченность средних величин изменилась.

    Таким образом, теория измерений выносит жесткий приговор среднему арифметическому - использовать его в порядковой шкале нельзя. Однако же те, кто не знает теории измерений, используют его. Всегда ли они ошибаются? Оказывается, можно в какой-то мере реабилитировать среднее арифметическое, если перейти к вероятностной постановке и к тому же удовлетвориться результатами для больших объемов выборок. В монографии [] получено также следующее утверждение.

    Теорема 2. Пусть $$Y_1,Y_2,...,Y_m$$ - независимые одинаково распределенные случайные величины с функцией распределения $$F(x)$$, а $$Z_1,Z_2,...,Z_n$$ - независимые одинаково распределенные случайные величины с функцией распределения $$H(x)$$, причем выборки $$Y_1,Y_2,...,Y_m$$ и $$Z_1,Z_2,...,Z_n$$ независимы между собой и $$MY_1>MZ_1$$. Для того, чтобы вероятность события$$\left\{ \omega: \frac{g(Y_1)+g(Y_2)+...+g(Y_m)}{m}> \frac{g(Z_1)+g(Z_2)+...+g(Z_n)}{n} \right\}$$ стремилась к 1 при $$\min(m,n)\rightarrow\infty$$ для любой строго возрастающей непрерывной функции $$g$$, удовлетворяющей условию$$\overline{\lim_{|x|\rightarrow\infty}} \left| \frac{g(x)}{x} \right| <\infty,$$ необходимо и достаточно, чтобы при всех $$x$$ выполнялось неравенство $$F(x)\le H(x)$$, причем существовало число $$x_0$$, для которого $$F(x_0)<H(x_0)$$.

    Примечание. Условие с верхним пределом носит чисто внутриматематический характер. Фактически функция $$g$$ - произвольное допустимое преобразование в порядковой шкале.

    Согласно теореме 2 средним арифметическим можно пользоваться и в порядковой шкале, если сравниваются выборки из двух распределений, удовлетворяющих приведенному в теореме неравенству. Проще говоря, одна из функций распределения должна всегда лежать над другой. Функции распределения не могут пересекаться, им разрешается только касаться друг друга. Это условие выполнено, например, если функции распределения отличаются только сдвигом, т.е.$$F(x) = H(x+b)$$ при некотором $$b$$. Последнее условие выполняется, если два значения некоторой величины измеряются с помощью одного и того же средства измерения, у которого распределение погрешностей не меняется при переходе от измерения одного значения рассматриваемой величины к измерению другого.

    Средние по Колмогорову. Естественная система аксиом (требований к средним величинам) приводит к так называемым ассоциативным средним. Их общий вид нашел в 1930 г. А.Н.Колмогоров []. Теперь их называют "средними по Колмогорову". Они являются обобщением нескольких из перечисленных выше средних.

    Для чисел $$X_1,X_2,...,X_n$$ среднее по Колмогорову вычисляется по формуле$$G\{(F(X_1)+F(X_2)+...+F(X_n))/n\},$$ где $$F$$ - строго монотонная функция (т.е. строго возрастающая или строго убывающая), $$G$$ - функция, обратная к $$F$$. Среди средних по Колмогорову - много хорошо известных персонажей. Так, если $$F(x)=x$$, то среднее по Колмогорову - это среднее арифметическое, если $$F(x)=\ln x$$ - среднее геометрическое, если $$F(x)=1/x$$ - среднее гармоническое, если $$F(x)=x^2$$ - среднее квадратическое, и т.д. (в последних трех случаях усредняются положительные величины). Среднее по Колмогорову - частный случай среднего по Коши. С другой стороны, такие популярные средние, как медиана и мода, нельзя представить в виде средних по Колмогорову. В монографии [] доказаны следующие утверждения.

    Теорема 3. При справедливости некоторых внутриматематических условий регулярности в шкале интервалов из всех средних по Колмогорову допустимым является только среднее арифметическое.

    Таким образом, среднее геометрическое или среднее квадратическое температур (в шкале Цельсия), потенциальных энергий или координат точек не имеют смысла. В качестве среднего надо применять среднее арифметическое. А также можно использовать медиану или моду.

    Теорема 4. При справедливости некоторых внутриматематических условий регулярности в шкале отношений из всех средних по Колмогорову допустимыми являются только степенные средние с $$F(x)=x^c, c\ne 0$$ и среднее геометрическое.

    Замечание. Среднее геометрическое является пределом степенных средних при $$c\to 0$$.

    Есть ли средние по Колмогорову, которыми нельзя пользоваться в шкале отношений? Конечно, есть. Например, с $$F(x)=e^x$$.

    Аналогично средним величинам могут быть изучены и другие статистические характеристики - показатели разброса, связи, расстояния и др. (см., например, []). Нетрудно показать, например, что коэффициент корреляции не меняется при любом допустимом преобразовании в шкале интервалов, как и отношение дисперсий. Дисперсия не меняется в шкале разностей, коэффициент вариации - в шкале отношений, и т.д.

    Приведенные выше результаты о средних величинах широко применяются, причем не только в экономике, менеджменте, теории экспертных оценок или социологии, но и в инженерном деле, например, для анализа методов агрегирования датчиков в АСУ ТП доменных печей. Велико прикладное значение теории измерений в задачах стандартизации и управления качеством, в частности, в квалиметрии. Здесь есть и интересные теоретические результаты. Так, например, любое изменение коэффициентов весомости единичных показателей качества продукции приводит к изменению упорядочения изделий по средневзвешенному показателю (эта теорема доказана проф. В.В. Подиновским).

    При подготовке и принятии решений необходимо использовать только инвариантные алгоритмы обработки данных. В настоящем подразделе показано, что требование инвариантности выделяет из многих алгоритмов усреднения лишь некоторые, соответствующие используемым шкалам измерения. Инвариантные алгоритмы в общем случае рассматриваются в математической теории измерений []. Нацеленное на прикладные исследования изложение теории измерений дается в монографиях [, ].

    5.4. Вероятностные модели порождения нечисловых данных

    Рассмотрим основные вероятностные модели порождения нечисловых данных. А именно, дихотомических данных, результатов парных сравнений, бинарных отношений, рангов, объектов общей природы. Обсудим различные варианты вероятностных моделей и их практическое использование (см. также обзор []).

    ] - люсиан ), т.е. конечную последовательность $$X=(X_1,X_2,...,X_n)$$ независимых испытаний Бернулли $$X_i$$, для которых $$P(X_i=1)=p_i$$ и $$P(X_i=0)=p_i, i=1.2....,k$$ причем вероятности $$p_i$$ могут быть различны.

    Бернуллиевские векторы часто применяются при практическом использовании эконометрических методов. Так, они использованы в монографии [] для описания равномерно распределенных случайных толерантностей. Как известно, толерантность на множестве из $$m$$ элементов можно задать симметричной матрицей $$||\delta_{ij}||$$ из 0 и 1, на главной диагонали которой стоят 1. Тогда случайная толерантность описывается распределением $$m(m-1)/2$$ дихотомических случайных величин $$\delta_{ij}, 1\le i<j\le m$$, а для равномерно распределенной (на множестве всех толерантностей) толерантности эти случайные величины, как можно доказать, оказываются независимыми и принимают значения 0 и 1 с равными вероятностями 1/2. Записав элементы $$\delta_{ij}$$ задающей такую толерантность матрицы в строку, получим бернуллиевский вектор с $$k=m(m-1)/2$$ и $$p_i=1/2, i=1,2,...,k$$.

    В связи с оцениванием по статистическим данным функции принадлежности нечеткой толерантности в 1970-е годы была построена теория случайных толерантностей с такими независимыми $$\delta_{ij}$$, что вероятности $$P(\delta_{ij}=1)=p_{ij}$$ произвольны []. Случайные множества с независимыми элементами использовались как общий язык для описания парных сравнений и случайных толерантностей. В некоторых публикациях термин "люсиан" применялся как сокращение для выражения "случайные множества с независимыми элементами".

    Был выявлен ряд областей, в которых полезен математический аппарат решения различных статистических задач, связанных с бернуллиевскими векторами. Перечислим эти области, включая ранее названные: анализ случайных толерантностей; случайные множества с независимыми элементами; обработка результатов независимых парных сравнений; статистические методы анализа точности и стабильности технологического процесса, а также анализ и синтез планов статистического приемочного контроля (по альтернативным, т.е. дихотомическим, признакам); обработка маркетинговых и социологических анкет (с закрытыми вопросами типа "да" - "нет"); обработка социально-психологических и медицинских данных, в частности, ответов на психологические тесты типа MMPI (используемых в задачах управления персоналом), топографических карт (применяемых для анализа и прогноза зон поражения при заболеваниях, технологических авариях, распространении коррозии, распространении экологически вредных загрязнений в других ситуациях) и т.д.

    Теорию бернуллиевских векторов можно выразить в терминах любой из этих теоретических и прикладных областей. Однако терминология одной из этих областей "режет слух" и приводит к недоразумениям в другой из них. Поэтому целесообразно использовать термин "бернуллиевский вектор" в указанном выше значении, не связанном ни с какой из перечисленных областей приложения этой теории (в ряде публикаций в том же значении использовался термин "люсиан").

    Распределение бернуллиевского вектора $$X$$ полностью описывается вектором $$P=(p_1,p_2,...,p_k)$$, т.е. нечетким подмножеством множества $$\{1,2,...,k\}$$. Действительно, для любого детерминированного вектора $$x=(x_1,x_2,...,x_k)$$ из 0 и 1 имеем$$P(X=x)=\Pi_{1\le j\le k}h(x_j,p_j),$$ где $$h(x,p)=p$$ при $$х=1$$ и $$h(х,p)=1-p$$ при $$х=0$$.

    Теперь можно уточнить способы использования люсианов в прикладной статистике. Бернуллиевскими векторами можно моделировать: результаты статистического контроля (0 - годное изделие, 1 - дефектное); результаты маркетинговых и социологических опросов (0 - опрашиваемый выбрал первую из двух подсказок, 1 - вторую); распределение посторонних включений в материале (0 - нет включения в определенном объеме материала, 1 - есть); результаты испытаний и анализов (0 - нет нарушений требований нормативно-технической документации, 1 - есть такие нарушения); процессы распространения, например, пожаров (0 - нет загорания, 1 - есть; подробнее см. [, с.215-223]); технологические процессы (0 - процесс находится в границах допуска, 1 - вышел из них); ответы экспертов (опрашиваемых) о сходстве объектов (проектов, образцов) и т.д.

    Парные сравнения. Общую модель парных сравнений опишем согласно монографии Г. Дэвида [ $$3$$, с.9]. Предположим, что $$t$$ объектов $$A_1,A_2,...,A_t$$ сравниваются попарно каждым из $$n$$ экспертов. Всего возможных пар для сравнения имеется $$s=t(t-1)/2$$. Эксперт с номером $$\gamma$$ делает $$r_{\gamma}$$ повторных сравнений для каждой из $$s$$ возможностей. Пусть $$X(i,j,\gamma,\delta), i,j=1,2,...,t, i\ne j, \gamma=1,2,...,n; \delta=1,2,...,r_{\gamma}$$, - случайная величина, принимающая значение 1 или 0 в зависимости от того, предпочитает ли эксперт $$\gamma$$ объект $$A_i$$ или объект $$A_j$$ в $$\delta$$ -м сравнении двух объектов. Предполагается, что все сравнения проводятся независимо друг от друга, так что случайные величины $$X(i,j,\gamma,\delta)$$ независимы в совокупности, если не считать того, что $$X(i,j,\gamma,\delta)+X(j,i,\gamma,\delta)=1$$. Положим$$P(X(i,j,\gamma,\delta)=1)=\pi(i,j,\gamma,\delta).$$

    Ясно, что описанная модель парных сравнений представляет собой частный случай бернуллиевского вектора. В этой модели число наблюдений равно числу неизвестных параметров, поэтому для получения статистических выводов необходимо наложить априорные условия на $$\pi(i,j,\gamma,\delta)$$, например [, c.9]:

    $$\pi(i,j,\gamma,\delta)=\pi(i,j,\gamma)$$ (нет эффекта от повторений);

    $$\pi(i,j,\gamma,\delta)=\pi(i,j)$$ (нет эффекта от повторений и от экспертов).

    Теорию независимых парных сравнений целесообразно разделить на две части - непараметрическую, в которой статистические задачи ставятся непосредственно в терминах $$\pi(i,j,\gamma,\delta)$$, и параметрическую, в которой вероятности $$\pi(i,j,\gamma,\delta)$$ выражаются через меньшее число иных параметров. Ряд результатов непараметрической теории парных сравнений непосредственно вытекает из теории бернуллиевских векторов.

    В параметрической теории парных сравнений наиболее популярна так называемая линейная модель [, c.11], в которой предполагается, что каждому объекту $$A_i$$ можно сопоставить некоторую "ценность" $$V_i$$ так, что вероятность предпочтения $$\pi(i,j)$$ (т.е. предполагается дополнительно, что эффект от повторений и от экспертов отсутствует) выражается следующим образом:$$\pi(i,j)=H(V_i-V_j),$$ где $$H(x)$$ - функция распределения, симметричная относительно 0, т.е.$$H(-x)=1-H(x)$$ при всех $$x$$.

    Широко применяются модели Терстоуна-Мостеллера и Бредли-Терри, в которых $$H(x)$$ - соответственно функции нормального и логистического распределений. Поскольку функция $$\Phi(x)$$ стандартного нормального распределения с математическим ожиданием 0 и дисперсией 1 и функция$$\Psi(x)=e^x(1+e^x)^{-1}$$ стандартного логистического распределения удовлетворяют (см., например, []) соотношению$$\sup_{x\in R^1}|\Phi(x)-\Psi(1,7x)|<0,01,$$ то для обоснованного выбора по статистическим данным между моделями Терстоуна-Мостеллера и Бредли-Терри необходимо не менее тысячи наблюдений.

    Соотношение (1) вытекает из следующей модели поведения эксперта: он измерят "ценность" $$V_i$$ и $$V_j$$ объектов $$A_i$$ и $$A_j$$, но с ошибками $$\varepsilon_i$$ и $$\varepsilon_j$$ соответственно, а затем сравнивает свои оценки ценности объектов $$y_i-V_i+\varepsilon_i$$ и $$y_i=V_j+\varepsilon_j$$. Если $$y_i>y_j$$ то он предпочитает $$A_i$$, в противном случае - $$A_j$$. Тогда$$\pi(i,j)=P(\varepsilon_j-\varepsilon_i<V_i-V_j)=H(V_i-V_j).$$

    Обычно предполагают, что субъективные ошибки эксперта $$\varepsilon_i$$ и $$\varepsilon_j$$ независимы и имеют одно и то же непрерывное распределение. Тогда функция распределения $$H(x)$$ из соотношения (3) непрерывна и удовлетворяет функциональному уравнению (2).

    Существует много разновидностей моделей парных сравнений, постоянно предполагаются новые. В качестве примера опишем модель парных сравнений, основанную не на процедуре упорядочения, а на определении сходства объектов. Пусть каждому объекту $$A_i$$ соответствует точка $$a_i$$ в $$r$$ -мерном евклидовом пространстве $$R^r$$. Эксперт "измеряет" $$a_i$$ и $$a_j$$ с ошибками $$\varepsilon_i$$ и $$\varepsilon_j$$ соответственно и в случае, если евклидово расстояние между $$a_i+\varepsilon_i$$ и $$a_j+\varepsilon_j$$ меньше 1, заявляет о сходстве объектов $$A_i$$ и $$A_j$$, в противном случае - об их различии. Предполагается, что ошибки $$\varepsilon_i$$ и $$\varepsilon_j$$ независимы и имеют одно и то же распределение, например, круговое нормальное распределение с нулевым математическим ожиданием и дисперсией координат $$\sigma^2$$. Целью статистической обработки является определение по результатам парных сравнений оценок параметров $$a_1, a_2,...,a_r$$, и $$\sigma^2$$, а также проверка согласия опытных данных с моделью.

    Рассмотренные модели парных сравнений могут быть обобщены в различных направлениях. Так, можно ввести понятие "ничья" - ситуации, когда эксперт оценивает объекты одинаково. Модели с учетом "ничьих" предполагают, что эксперт может отказаться от выбора одного из объектов и заявить об их эквивалентности, т. е. число возможных ответов увеличивается с 2 до 3. В моделях множественных сравнений эксперту представляется не два объекта , а три или большее число.

    Модели, учитывающие "ничьи", строятся обычно с помощью используемых в психофизике "порогов чувствительности": если $$|y_i-y_j|\le r$$ (где $$r$$ - порог чувствительности), то объекты $$A_i$$ и $$A_j$$ эксперт объявляет неразличимыми. Приведем пример модели с "ничьими", основанной на другом принципе. Пусть каждому объекту $$A_i$$ соответствует точка $$a_i$$ в $$r$$ -мерном линейном пространстве. Как и прежде, эксперт "измеряет" объектные точки $$a_i$$ и $$a_j$$ с ошибками $$\varepsilon_i$$ и $$\varepsilon_j$$ соответственно, т.е. принимает решение на основе $$y_i=a_i+\varepsilon_i$$ и $$y_j=a_j+\varepsilon_j$$. Если все координаты $$y_i$$ больше соответствующих координат $$y_j$$, то $$A_i$$ предпочитается $$A_j$$. Соответственно, если каждая координата $$y_i$$ меньше координаты $$y_j$$ с тем же номером, то эксперт считает наилучшим объект $$A_j$$. Во всех остальных случаях эксперт объявляет о ничейной ситуации. Эта модель при $$r = 1$$ переходит в описанную выше линейную модель. Она связана с принципом Парето в теории группового выбора и предусматривает выбор оптимального по Парето объекта, если он существует (роль согласуемых критериев играют процедуры сравнения значений отдельных координат), и отказ от выбора, если такого объекта нет.

    Можно строить модели, учитывающие порядок предъявления объектов при сравнении, зависимость результата сравнения от результатов предшествующих сравнений. Опишем одну из подобных моделей.

    Пусть эксперт сравнивает три объекта - $$A, B, C$$, причем сначала сравниваются $$A$$ и $$B$$, потом - $$B$$ и $$C$$ и, наконец, $$A$$ и $$C$$. Для определенности пусть $$A>B$$ будет означать, что $$A$$ более предпочтителен, чем $$B$$. Пусть при предъявлении двух объектов$$P(A>B)=\pi_{AB}, P(B>C)=\pi_{BC}, P(A>C)=\pi_{AC}.$$

    Теперь пусть пара $$B, C$$ предъявляется после пары $$A, B$$. Естественно предположить, что высокая оценка $$B$$ в первом сравнении повышает вероятность предпочтения $$B$$ и во втором, и, наоборот, отрицательное мнение о $$B$$ в первом сравнении сохраняется и при проведении второго сравнения. Это предположение проще всего учесть в модели следующим образом:$$P(B>C|B>A)=\pi_{BC}+\delta,\quad P(B>C|A>B)=\pi_{BC}-\delta,$$ где $$\delta$$ - некоторое положительное число, показывающее степень влияния первого сравнения на второе. По аналогичным причинам вероятности исхода третьего сравнения в зависимости от результатов первых двух можно описать так:$$\begin{gathered} P(A>C|A>B,B>C)=\pi_{AC}+2\delta,P(A>C|A>B,B<C)=\pi_{AC}, \\ P(A>C|A<B,B>C)=\pi_{AC}, P(A>C|A<B,B<C)=\pi_{AC}-2\delta. \end{gathered}$$

    Статистическая задача состоит в определении параметров $$\pi_{AB},\pi_{BC},\pi_{AC}$$ и $$\delta$$ по результатам сравнений, проведенных n экспертами, и в проверке адекватности модели.

    Ясно, что можно рассматривать и другие модели, в частности, учитывающие тягу экспертов к транзитивности ответов. Очевидно, что проблемы построения моделей парных сравнений относятся не к прикладной статистике, а к тем прикладным областям, для решения задач которых развиваются методы парных сравнений, например, к экономике предприятия, стратегическому менеджменту, производственной психологии, изучению поведения потребителей, экспертным оценкам и т. д.

    Метод парных сравнений был введен в 1860 г. Г.Т. Фехнером для решения задач психофизики. Расскажем об этом несколько подробнее. Как известно, основателем психофизики по праву считается Густав Теодор Фехнер (1801-1887), а год выхода в свет его фундаментальной работы "Элементы психофизики" (1860) - датой рождения новой науки. В этой работе широко применялся предложенный Г.Т. Фехнером метод парных сравнений (обсуждение событий тех лет с современных позиций дано в монографии [, c.14-16]).

    С точки зрения математической статистики приведенные выше модели не представляют большого теоретического интереса: оценки параметров находятся обычно методом максимального правдоподобия, а проверка согласия проводится по критерию отношения правдоподобия или асимптотически эквивалентными ему критериями типа хи-квадрат []. Вычислительные процедуры обычно сложны и плохо исследованы; их можно упростить и одновременно повысить обоснованность, перейдя от оценок максимального правдоподобия к одношаговым оценкам (см. лекцию 6).

    Отметим некоторые сложности при обосновании возможности использовании линейных моделей типа (1) - (3). Вероятностно-статистическая теория достаточно проста, когда предполагается, что каждому отдельному сравнению двух объектов соответствуют свои собственные ошибки экспертов, причем все ошибки независимы в совокупности. Однако это предположение отнюдь не очевидно с содержательной точки зрения. В качестве примера рассмотрим три объекта $$A, B$$ и $$C$$, которые сравнивают попарно: $$A$$ и $$B$$, $$B$$ и $$C$$, $$A$$ и $$C$$. В соответствии со сказанным, в рассмотрение вводят 6 ошибок одного и того же эксперта: $$\varepsilon_A$$ и $$\varepsilon_B$$ - в первом сравнении, $$\varepsilon'_B$$ и $$\varepsilon_C$$ - во втором, $$\varepsilon'_A$$ и $$\varepsilon'_C$$ - в третьем, причем все эти 6 случайных величин независимы в совокупности. Между тем естественно думать, что мнения эксперта об одном и том же объекте связаны между собой, т. е. $$\varepsilon_A$$ и $$\varepsilon'_A$$ зависимы, равно как $$\varepsilon_B$$ и $$\varepsilon'_B$$, а также $$\varepsilon_C$$ и $$\varepsilon'_C$$. Более того, если принять, что точка зрения эксперта полностью определена для него самого, то следует положить $$\varepsilon_A=\varepsilon'_A$$ и соответственно $$\varepsilon_B=\varepsilon'_B$$ и $$\varepsilon_C=\varepsilon'_C$$. При этом напомним, что случайные величины $$\varepsilon_A, \varepsilon_B$$ и др. интерпретируются как отклонения мнений отдельных экспертов от истины. Видимо, ошибку эксперта целесообразно считать состоящей из двух слагаемых, а именно: отклонения от истины, вызванного внутренними особенностями эксперта (систематическая погрешность) и колебания мнения эксперта в связи с очередным парным сравнением (случайная погрешность). Игнорирование систематической погрешности облегчает развитие математико-статистической теории, а ее учет приводит к необходимости изучения зависимых парных сравнений.

    При обработке результатов парных сравнений первый этап - проверка согласованности. Понятие согласованности уточняется различными способами, но все они имеют один и тот же смысл проверки однородности обрабатываемого материала, т.е. того, что целесообразно агрегировать мнения отдельных экспертов, объединить данные и совместно их обрабатывать. При отсутствии однородности данные разбиваются на группы (классы, кластеры, таксоны) с целью обеспечения однородности внутри отдельных групп. Естественно, согласованность целесообразно проверять, вводя возможно меньше гипотез о структуре данных. Следовательно, целесообразно пользоваться для этого непараметрической теорией парных сравнений, основанной на теории бернуллиевских векторов.

    Хорошо известно, что модели парных сравнений с успехом применяются в экспертных и экспериментальных процедурах упорядочивания и выбора. В частности, для анализа голосований, турниров, выбора наилучшего объекта (проекта, образца, кандидатуры); в планировании и анализе сравнительных экспериментов и испытаний; в органолептической экспертизе (в частности, дегустации); при изучении поведения потребителей; визуальной колоритмии, определении индивидуальных рейтингов и вообще изучении предпочтений при выборе и т. д. (подробнее см. [,]).

    Бинарные отношения. Теорию ранговой корреляции (см. ], оказалась адекватной следующая так называемая $$T$$ -модель ранжирования.

    Пусть имеется $$t$$ объектов $$A_1,A_2,...,A_t$$ причем каждому объекту $$A_i$$ соответствует число $$a_i$$, описывающее его положение на шкале изучаемого признака. Испытуемый упорядочивает объекты так, как если бы оценивал соответствующие им значения с ошибками, т.е. находил $$y_i=a_i+\varepsilon_i, i=1,2,...,n$$, где $$\varepsilon_i$$ - ошибка при рассмотрении $$i$$ -го объекта, а затем располагал бы объекты в том порядке, в каком располагаются $$y_1,y_2,...,y_t$$. В этом случае вероятность появления упорядочения $$A_{i1},A_{i2},...,A_{it}$$ есть $$P(y_{i1}<y_{i2}<...<y_{it})$$, а ранги $$R_1,R_2,...,R_t$$ объектов являются рангами случайных величин $$y_1,y_2,...,y_t$$, полученными при их упорядочении в порядке возрастания. Кроме того, для простоты расчетов в модели предполагается, что ошибки испытуемого $$\varepsilon_1, \varepsilon_2, ...,\varepsilon_t$$ независимы и имеют нормальное распределение с математическим ожиданием 0 и дисперсией $$\sigma^2$$.

    Как уже отмечалось в лекции 1, бинарное отношение на множестве из $$t$$ элементов полностью описывается матрицей из 0 и 1 порядка $$t\times t$$. Поэтому задать распределение случайного бинарного отношения - это то же самое, что задать распределение вероятностей на множестве всех матриц описанного вида, состоящем из $$2^{t^2}$$ элементов. Пространства ранжировок, разбиений, толерантностей зачастую удобно считать подпространствами пространства всех бинарных отношений, тогда распределения вероятностей на них - частные случаи описанного выше распределения, выделенные тем, что вероятности принадлежности соответствующим подпространствам равны 1. Распределение произвольного бинарного отношения описывается $$2^{t^2}-1$$ параметрами, распределение случайной ранжировки (без связей) - $$(t! - 1)$$ параметрами, а описанная выше $$T$$ -модель ранжирования - $$(t + 1)$$ параметром. При $$t = 4$$ эти числа равны соответственно 65535, 23 и 5. Первое из этих чисел показывает практическую невозможность использования в вероятностно-статистических моделях произвольных бинарных отношений, поскольку по имеющимся данным невозможно оценить столь большое число параметров. Приходится ограничиваться теми или иными семействами бинарных отношений - ранжировками, разбиениями, толерантностями и др. Модель произвольной случайной ранжировки при $$t = 5$$ описывается 119 параметрами, при $$t = 6$$ - уже 719 параметрами, при $$t = 7$$ число параметров достигает 5049, что уже явно находится за пределами возможности оценивания. В то же время $$T$$ -модель ранжирования при $$t = 7$$ описывается всего 8-ю параметрами, а потому может быть кандидатом для практического использования.

    Что естественно предположить относительно распределения случайного элемента со значениями в том или ином пространстве бинарных отношений? Зачастую целесообразно считать, что распределение имеет некий центр, попадание в который наиболее вероятно, а по мере удаления от центра вероятности убывают. Это соответствует естественной модели измерения с ошибкой; в классическом одномерном случае результат подобного измерения обычно описывается унимодальной симметричной плотностью, монотонно возрастающей слева от модального значения, в котором плотность максимальна, и монотонно убывающей справа от него. Чтобы ввести понятие монотонного распределения в пространстве бинарных отношений, будем исходить из метрики в этом пространстве. Воспользовавшись тем, что бинарные отношения $$C$$ и $$D$$ однозначно описываются матрицами $$||c_{ij}||$$ и $$||d_{ij}||$$ порядка $$t\times t$$ соответственно, рассмотрим расстояние (в несколько другой терминологии - метрику) в пространстве бинарных отношений$$d(C,D)=\sum_{1\le i,j\le t}|c_{ij}-d_{ij}|.$$

    Метрика (4) в различных пространствах бинарных отношений - ранжировок, разбиений, толерантностей - может быть введена с помощью соответствующих систем аксиом (см. лекцию 1). В настоящее время метрику (4) обычно называют расстоянием Кемени в честь американского исследователя Джона Кемени, впервые получившего эту метрику исходя из предложенной им системы аксиом для расстояния между упорядочениями (ранжировками).

    В статистике нечисловых данных используются и иные метрики, отличающиеся от расстояния Кемени. Более того, для использования понятия монотонного распределения, о котором сейчас идет речь, нет необходимости требовать выполнения неравенства треугольника, а достаточно, чтобы $$d(C,D)$$ можно было рассматривать как показатель различия. Под показателем различия понимаем такую функцию $$d(C,D)$$ двух бинарных отношений $$C$$ и $$D$$, что $$d(C,D) = 0$$ при $$C = D$$ и увеличение $$d(C,D)$$ интерпретируется как возрастание различия между $$C$$ и $$D$$.

    Определение 1. Распределение бинарного отношения $$X$$ называется монотонным с центром в $$C_0$$ относительно расстояния (показателя различия) $$d$$, если из $$d(C,C_0) < d(D,C_0)$$ следует, что $$P(X=C) > P(X=D)$$.

    Это определение впервые введено в монографии [, c.196]. Оно может использоваться в любых пространствах бинарных отношений и, более того, в любых пространствах из конечного числа элементов, лишь бы в них была введена функция $$d(C,D)$$ - показатель различия элементов $$C$$ и $$D$$ этого пространства. Монотонное распределение унимодально, мода находится в $$C_0$$.

    Определение 2. Распределение бинарного отношения $$X$$ называется симметричным относительно расстояния $$d$$ с центром в $$C_0$$, если существует такая функция $$f:R_+^1\rightarrow[0,1]$$ что$$P(X=C)=f(d(C,C_0)).$$

    Если распределение $$X$$ монотонно и таково, что из $$d(C,C_0)=d(D,C_0)$$ следует $$P(X=C)=P(X=D)$$, то оно симметрично. Если функция $$f$$ в формуле (5) монотонно строго убывает, то соответствующее распределение монотонно в смысле определения 1.

    Поскольку толерантность на множестве из $$t$$ элементов задается $$0,5t(t-1)$$ элементами $$\delta_{ij}$$ матрицы из 0 и 1 порядка $$t\times t$$, лежащими выше главной диагонали, то распределение на множестве толерантностей задается в общем случае $$2^{0,5t(t-1)}$$ параметрами. Естественно выделить семейство распределений, соответствующее независимым элементам матрицы. Оно задается бернуллиевским вектором (люсианом) с $$0,5t(t-1)$$ параметрами (выше бернуллиевские вектора рассмотрены подробнее). Математическая техника, необходимая для изучения толерантностей с независимыми элементами, существенно проще, чем в случае ранжировок и разбиений. Здесь легко отказаться от условия равномерности распределения. Этому условию соответствует $$P(\delta_{ij}=1)=p_{ij}\equiv 1/2$$, в то время как статистические методы анализа люсианов, развитые в статистике нечисловых данных (см., например, работы [ $$12$$, $$13$$, $$15$$ ]) не налагают никаких существенных ограничений на $$p_{ij}$$.

    Как уже отмечалось, при обработке мнений экспертов сначала проверяют согласованность. В частности, если мнения экспертов описываются монотонными распределениями, то для согласованности необходимо совпадение центров этих распределений. К сожалению, классические методы проверки согласованности для ранжировок, основанные на коэффициентах ранговой корреляции и конкордации, позволяют лишь отвергнуть гипотезу о равнораспределенности. Но не установить, можно ли считать, что центры соответствующих экспертам распределений совпадают или же, например, существует две группы экспертов, каждая со своим центром. Теория случайных толерантностей лишена этого недостатка. Отсюда вытекают следующие практические рекомендации.

    Пусть цель обработки экспертных данных состоит в получении ранжировки, отражающей групповое мнение. Однако согласно рекомендуемой процедуре экспертного опроса пусть эксперты не упорядочивают объекты, а проводят парные сравнения каждого из рассматриваемых объектов со всеми остальными, причем ровно один раз. Тогда ответ эксперта - толерантность, но, вообще говоря, не ранжировка, поскольку в ответах эксперта может нарушаться транзитивность.

    Возможны два пути обработки данных. Первый - превратить ответ эксперта в ранжировку (тем или иным способом "спроектировав" его на пространство ранжировок), а затем проверять согласованность ранжировок с помощью известных критериев. При этом от толерантности перейти к ранжировке можно, например, так. Будем выбирать ближайшую (в смысле применяемого расстояния) матрицу к матрице ответов эксперта из всех, соответствующих ранжировкам без связей.

    Второй путь - проверить согласованность случайных толерантностей, а групповое мнение искать с помощью медианы Кемени (подробнее см. лекцию 11) непосредственно по исходным данным, т.е. по толерантностям. Групповое мнение при этом может быть найдено в пространстве ранжировок. Второй путь мы считаем более предпочтительным, поскольку при этом обеспечивается более адекватная проверка согласованности и исключается процедура укладывания мнения эксперта в "прокрустово ложе" ранжировки (эта процедура может приводить как к потере информации, так и к принципиально неверным выводам, вызванным искажениями мнений экспертов).

    Области применения статистики бинарных отношений многообразны: ранговая корреляция - оценка величины связи между переменными, измеренными в порядковой шкале; анализ экспертных или экспериментальных упорядочений; анализ разбиений технико-экономических показателей на группы сходных между собой; обработка данных о сходстве (взаимозаменяемости); статистический анализ классификаций; математические вопросы теории менеджмента и др.

    Случайные множества. Будем рассматривать случайные подмножества некоторого множества $$Q$$. Если $$Q$$ состоит из конечного числа элементов, то считаем, что случайное подмножество $$S$$ - это случайный элемент со значениями в $$2^Q$$ - множестве всех подмножеств множества $$Q$$, состоящем из $$2^{card(Q)}$$ элементов. Чтобы удовлетворить математиков, считаем, что все подмножества $$Q$$ измеримы. Тогда распределение случайного подмножества $$S=S(\omega)$$ множества $$Q$$ - это$$P_S(A)=P(S=A)=P(\{\omega:S(\omega)=A\}),A\subseteq Q.$$

    В формуле (6) предполагается, что $$S:\Omega\rightarrow 2^Q$$ где $$(\Omega,F,P)$$ - вероятностное пространство (здесь $$\Omega$$ - пространство элементарных событий, $$F - \sigma$$ - алгебра случайных событий, $$P$$ - вероятностная мера на $$F$$ ), на котором определен случайный элемент $$S(\omega)$$. Через распределение $$PS(A)$$ выражаются вероятности различных событий, связанных с $$S$$. Так, чтобы найти вероятность накрытия фиксированного элемента $$q$$ случайным множеством $$S$$, достаточно вычислить$$P(q\in S)=P(\{\omega:q\in S(\omega)\})= \sum_{A:q\in A, A\subseteq 2^Q} P(S=A),$$ где суммирование идет по всем подмножествам $$A$$ множества $$Q$$, содержащим $$q$$. Пусть $$Q={q_1, q_2, ..., q_k}$$. Рассмотрим случайные величины, определяемые по случайному множеству $$S$$ следующим образом$$\chi_i(\omega)= \left\{ \begin{aligned} 1,q_i\in S(\omega), \\ 0,q_i\notin S(\omega). \end{aligned} \right.$$

    Определение 3. Случайное множество $$S$$ называется случайным множеством с независимыми элементами, если случайные величины $$\chi_i(\omega),i=1,2,...,k$$, независимы (в совокупности).

    Последовательность случайных величин $$\chi_1,\chi_2,...,\chi_k$$ - бернуллиевский вектор с $$X_i=\chi_i$$ и $$p_i=P(q_i\in S(\omega)),i=1,2,...,k$$. Из сказанного выше следует, что распределение случайного множества с независимыми элементами задается формулой$$P(S=A)=\Pi_{q_i\in A} p_i \Pi_{q_i\in Q\backslash A}(1-p_i),$$ т.е. такие распределения образуют $$k = card(Q)$$ - мерное параметрическое семейство, входящее в $$(2^{card(Q)}-1)$$ - мерное семейство всех распределений случайных подмножеств множества $$Q$$.

    При исследовании случайных подмножеств произвольного множества $$Q$$ будем рассматривать их как случайные величины со значениями в некотором пространстве подмножеств множества $$Q$$, например, в пространстве замкнутых подмножеств $$2^Q$$ множества $$Q$$.

    Представляющими интерес лишь для математиков способами введения измеримой структуры в $$2^Q$$ интересоваться не будем. Отсутствие специального интереса к проблеме измеримости связано с тем, что при вероятностно-статистическом моделировании и обработке на ЭВМ все случайные подмножества рассматриваются как конечные (т.е. подмножества конечного множества).

    Случайные множества находят разнообразные применения в многообразных проблемах эконометрики и математической экономики, в том числе в задачах управлении запасами и ресурсами (см. об этом главу 5 в монографии [ $$12$$ ]), в задачах менеджмента и, в частности, маркетинга, в экспертных оценках, например, при анализе мнений голосующих или опрашиваемых, каждый из которых отмечает несколько пунктов из списка и т.д. Кроме того, случайные множества применяются в гранулометрии, при изучении пористых сред и объектов сложной природы в таких областях, как металлография, петрография, биология, в частности, математическая морфология, в изучении структуры веществ и материалов, в исследовании процессов распространения, в том числе просачивания, распространения пожаров, экологических загрязнений, при районировании, в изучении областей поражения, например, поражения металла коррозией и сердечной мышцы при инфаркте миокарда, и т.д., и т.п. Можно вспомнить о компьютерной томографии, о наглядном представлении сложной информации на экране компьютера, об изучении распространения рекламной информации, о картах Кохонена (популярный метод представления информации при применении нейросетей) и т.д.

    Ранговые методы. В лекции 1 установлено, что любой адекватный алгоритм в порядковой шкале является функцией от некоторой матрицы $$C$$. Пусть никакие два из результатов наблюдений $$x_1,x_2,...,x_n$$ не совпадают, а $$r_1,r_2,...,r_n$$ - их ранги. Тогда элементы матрицы $$C$$ и ранги результатов наблюдений связаны взаимно однозначным соответствием:$$r_i=1+\sum_{1\le j\le n}(1-c_{ij}),$$ а $$c_{ij}$$ через ранги выражаются так: $$c_i = 1$$, если $$r_i < r_j$$, и $$c_{ij} = 0$$ в противном случае.

    Сказанное означает, что при обработке данных, измеренных в порядковой шкале, могут применяться только ранговые статистические методы. Отметим, что часто используемое в непараметрической статистике преобразование $$Y=F(X)$$ (здесь $$F(x)$$ - непрерывная функция распределения случайной величины $$X$$, причем $$F$$ предполагается произвольной) фактически означает переход к порядковой шкале, поскольку статистические выводы при этом инвариантны относительно допустимых преобразований в порядковой шкале.

    Разумеется, ранговые статистические методы могут применяться не только при обработке данных, измеренных в порядковой шкале. Так, для проверки независимости двух количественных признаков в случае, когда нет уверенности в нормальности соответствующего двумерного распределения, целесообразно пользоваться коэффициентами ранговой корреляции Кендалла или Спирмена.

    В настоящее время с помощью непараметрических и прежде всего ранговых методов можно решать все те задачи эконометрики и прикладной статистики, что и с помощью параметрических методов, в частности, основанных на предположении нормальности. Однако параметрические методы вошли в массовое сознание исследователей и инженеров и мешают широкому внедрению более обоснованной и прогрессивной ранговой статистики. Так, при проверке однородности двух выборок вместо критерия Стьюдента целесообразно использовать ранговые методы (см. лекцию 8), но пока это делается редко.

    ].

    Из-за имеющего разнобоя в терминологии приведем математические определения из справочника по теории вероятностей академика РАН Ю.В Прохорова и проф. Ю.А. Розанова [].

    Пусть $$(\mathbf{X},\mathbf{B})$$ - некоторое измеримое пространство; $$F,B$$ - измеримая функция $$\xi=\xi(\omega)$$ на пространстве элементарных событий $$(\Omega,F,\mathbf{P})$$ (где $$P$$ - вероятностная мера на $$\sigma$$ - алгебре $$F$$ - измеримых подмножеств $$\Omega$$, называемых событиями) со значениями в $$(\mathbf{X},\mathbf{B})$$ называется случайной величиной (чаще этот математический объект называют случайным элементом, оставляя термин "случайная величина" за частным случаем, когда $$\mathbf{Х}$$ - числовая прямая) в фазовом пространстве $$(\mathbf{X},\mathbf{B})$$. Распределением вероятностей этой случайной величины $$\xi$$ называется функция $$P_{\xi}=P_{\xi}(B)$$ на $$\sigma$$ -алгебре $$\mathbf{B}$$ фазового пространства, определенная как$$P_{\xi}=P\{\xi\in B\}\quad (B\in \mathbf{B})$$ (распределение вероятностей $$P_{\xi}$$ представляет собой вероятностную меру в фазовом пространстве $$(\mathbf{X},\mathbf{B})$$ ) [, с.132].

    Пусть $$\xi_1,\xi_2,...,\xi_n$$ - случайные величины на пространстве случайных событий $$(\Omega,F,\mathbf{P})$$ в соответствующих фазовых пространствах $$\mathbf{X}_k,\mathbf{B}_k$$. Совместным распределением вероятностей этих величин называется функция $$P_{\xi_1,\xi_2,...,\xi_n}= P_{\xi_1,\xi_2,...,\xi_n}(B_1,B_2,...,B_n)$$, определенная на множествах $$B_1\in\mathbf{B}_1, B_2\in\mathbf{B}_2, ..., B_n\in\mathbf{B}_n$$ как$$P_{\xi_1,\xi_2,...,\xi_n}(B_1,B_2,...,B_n)= P_{\xi_1,\xi_2,...,\xi_n}(\xi_1\in B_1, \xi_2\in B_2,...,\xi_n\in B_n).$$

    Распределение вероятностей $$P_{\xi_1,\xi_2,...,\xi_n}$$ как функция на полукольце множеств вида $$B_1\times B_2\times ...\times B_n, B_1\in\mathbf{B}_1, B_2\in\mathbf{B}_2,...,B_n\in\mathbf{B}_n$$, в произведении пространств $$\mathbf{X}_1,\mathbf{X}_2,...,\mathbf{X}_n$$ представляет собой аналог классической функции распределения. Случайные величины $$\xi_1,\xi_2,...,\xi_n$$ называются независимыми, если при любых $$B_1, B_2,...,B_n$$ (см. [, с.133])$$P_{\xi_1,\xi_2,...,\xi_n}(B_1,B_2,...,B_n)= P_{\xi_1}(B_1)P_{\xi_2}(B_2)...P_{\xi_n}(B_n).$$

    Предположим, что совместное распределение вероятностей $$P_{\xi,\eta}(A,B)$$ случайных величин $$\xi$$ и $$\eta$$ абсолютно непрерывно относительно некоторой меры $$Q$$ на произведении пространств $$\mathbf{X}\times\mathbf{Y}$$, являющейся произведением мер $$Q_X$$ и $$Q_Y$$, т.е.:$$P_{\xi,\eta}(A,B)=\int\limits_{A\times B}p(x,y)Q(dx,dy)$$ для любых $$A\in\mathbf{A}$$ и $$B\in\mathbf{B}$$, где $$p(x,y)$$ - соответствующая плотность распределения вероятностей [, с.145].

    В формуле (10) предполагается, что $$\xi-\xi(\omega)$$ и $$\eta=\eta{\omega}$$ - случайные величины на одном и том же пространстве элементарных событий $$\Omega$$ со значениями в фазовых пространствах $$(\mathbf{X},\mathbf{A})$$ и $$(\mathbf{Y},\mathbf{B})$$. Существование плотности $$p(x,y)$$ вытекает из абсолютной непрерывности $$P_{\xi,\eta}(A,B)$$ относительно $$Q$$ в соответствии с теоремой Радона-Никодима.

    Условное распределение вероятностей $$P_{\xi}(A|\eta),A\in\mathbf{A}$$ может быть выбрано одинаковым для всех $$\omega\in\Omega$$ при которых случайная величина $$\eta=\eta(\omega)$$ сохраняет одно и то же значение: $$\eta(\omega)=y$$. При почти каждом $$y\in\mathbf{Y}$$ (относительно распределения $$P_{\eta}$$ в фазовом пространстве $$(\mathbf{Y},\mathbf{B})$$ ) условное распределение вероятностей $$P_{\xi}(A|y)=P_{\omega,\xi}(A)$$, где $$\omega\in\{\eta=y\}$$ и $$A\in\mathbf{A}$$ будет абсолютно непрерывно относительно меры $$Q_X$$:$$Q_X(A)-\int_{A\times X}Q(dx,dy).$$

    Причем соответствующая плотность условного распределения вероятностей будет иметь вид (см. [, с.145-146]):$$p_{\xi}(x|y)=\frac{p_{\xi}(dx|y)}{Q_X(dx)}=\frac{p(x,y)}{\int\limits_X p(x,y)Q_X(dx)}.$$

    При построении вероятностных моделей реальных явлений важны вероятностные пространства из конечного числа элементарных событий. Для них перечисленные выше общие понятия становятся более прозрачными, в частности, снимаются вопросы измеримости (все подмножества конечного множества обычно считаются измеримыми). Вместо плотностей и условных плотностей рассматриваются вероятности и условные вероятности. Отметим, что вероятности можно рассматривать как плотности относительно меры, приписывающей каждому элементу пространства элементарных событий вес 1, т.е. считающей меры$$Q(A)=Card(A)$$ (мера каждого множества равна числу его элементов). В целом ясно, что определения основных понятий теории вероятностей в общей ситуации практически не отличаются от таковых в элементарных курсах, во всяком случае с идейной точки зрения.

    За последние десятилетия в прикладной статистике сформировалась новая область - статистика нечисловых данных, она же - статистика объектов нечисловой природы. К настоящему времени она развита не менее, чем ранее выделенные статистика случайных величин, многомерный статистический анализ, статистика временных рядов и случайных процессов. Краткая сводка основных постановок и результатов прикладной статистики в пространствах нечисловой природы приведены ниже в данном параграфе и в лекции 11.

    Теория, построенная для результатов наблюдений, лежащих в пространствах общей природы, является центральным стержнем в статистике нечисловой природы. В ее рамках удалось разработать и изучить методы оценивания параметров и характеристик, проверки гипотез (в частности, с помощью статистик интегрального типа), параметрической и непараметрической регрессии (восстановления зависимостей), непараметрического оценивания плотности, дискриминантного и кластерного анализов и т.д.

    Вероятностно-статистические методы, развитые для результатов наблюдений из пространств произвольного вида, позволяют единообразно проводить анализ данных из любого конкретного пространства. Так, в монографии [] они применены к конечным случайным множествам, в работе [] - к нечетким множествам. С их помощью установлено поведение обобщенного мнения экспертной комиссии (медианы Кемени) при увеличении числа экспертов, когда ответы экспертов лежат в том или ином пространстве бинарных отношений. Методы классификации могут быть основаны на непараметрических оценках плотности распределения вероятностей в пространстве общей природы. Такие методы были применены для медицинской диагностики в пространстве разнотипных данных, когда часть координат вектора измерена по количественным шкалам, а часть - по качественным, и т.д.

    5.5. Средние и законы больших чисел

    Законы больших чисел состоят в том, что эмпирические средние сходятся к теоретическим. В классическом варианте: выборочное среднее арифметическое при определенных условиях сходится по вероятности при росте числа слагаемых к математическому ожиданию. На основе законов больших чисел обычно доказывают состоятельность различных статистических оценок. В целом эта тематика занимает заметное место в теории вероятностей и математической статистике.

    Однако математический аппарат при этом основан на свойствах сумм случайных величин (векторов, элементов линейных пространств). Следовательно, он не пригоден для изучения вероятностных и статистических проблем, связанных со случайными объектами нечисловой природы. Это такие объекты, как бинарные отношения, нечеткие множества, вообще элементы пространств без векторной структуры. Объекты нечисловой природы все чаще встречаются в прикладных исследованиях. Много конкретных примеров приведено выше в настоящей лекции. Поэтому представляется полезным получение законов больших чисел в пространствах нечисловой природы. Необходимо решить следующие задачи:

  • определить понятие эмпирического среднего;
  • определить понятие теоретического среднего;
  • ввести понятие сходимости эмпирических средних к теоретическому;
  • доказать при тех или иных комплексах условий сходимость эмпирических средних к теоретическому;
  • получить метод обоснования состоятельности различных статистических оценок, обобщив это доказательство;
  • описать способы применения полученных результатов при решении конкретных задач.
  • Ввиду принципиальной важности рассматриваемых результатов приводим доказательство закона больших чисел, а также результаты компьютерного анализа множества эмпирических средних.

    Определения средних величин. Пусть $$X$$ - пространство произвольной природы, $$x_1, x_2, x_3,...,x_n$$ - его элементы. Чтобы ввести эмпирическое среднее для $$x_1, x_2, x_3,...,x_n$$ будем использовать действительнозначную (т.е. с числовыми значениями) функцию $$f(x,y)$$ двух переменных со значениями в $$X$$. В стандартных математических обозначениях: $$f:X^2\rightarrow R^1$$. Величина $$f(x,y)$$ интерпретируется как показатель различия между $$x$$ и $$y$$: чем $$f(x,y)$$ больше, тем $$x$$ и $$y$$ сильнее различаются. В качестве $$f$$ можно использовать расстояние в $$Х$$, квадрат расстояния и т.п.

    Определение 1. Средней величиной для совокупности $$x_1, x_2, x_3,...,x_n$$ (относительно меры различия $$f$$ ), обозначаемой любым из трех способов:$$x_{cp}=E_n(f)=E_n(x_1, x_2, x_3,...,x_n;f),$$ называем решение оптимизационной задачи$$\sum_{i=1}^n f(x_i,y)\rightarrow \min,y\in X.$$

    Это определение согласуется с классическим: если $$Х = R^1, f(x,y) = (x - y)^2$$, то $$х_{ср}$$ - выборочное среднее арифметическое. Если же $$Х = R^1, f(x,y) = |x - y|$$, то при $$n = 2k+1$$ имеем $$х_{ср} = x(k+1)$$, при $$n= 2k$$ эмпирическое среднее является отрезком $$[x(k), x(k+1)]$$. Здесь через $$x(i)$$ обозначен $$i$$ -ый член вариационного ряда, построенного по $$x_1, x_2, x_3,...,x_n$$, т.е. $$i$$ -я порядковая статистика. Таким образом, при $$Х = R^1, f(x,y) = |x - y|$$ решение задачи (1) дает естественное определение выборочной медианы. Правда, несколько отличающееся от определения, предлагаемого в курсе "Общей теории статистики", в котором при $$n = 2k$$ медианой называют полусумму двух центральных членов вариационного ряда $$(x(k) + x(k+1))/2$$. Иногда $$x(k)$$ называют левой медианой, а $$х(k+1)$$ - правой [].

    Решением задачи (1) является множество $$E_n(f)$$, которое может быть пустым, состоять из одного или многих элементов. Выше приведен пример, когда решением является отрезок. Если $$Х = R^1\backslash\{х_0\}, f(x,y) = (x - y)^2$$, а среднее арифметическое выборки равно $$х_0$$, то $$E_n(f)$$ пусто.

    При моделировании реальных ситуаций часто можно принять, что $$Х$$ состоит из конечного числа элементов. Тогда множество $$E_n(f)$$ непусто - минимум на конечном множестве всегда достигается.

    Понятия случайного элемента $$x=x(\omega)$$ со значениями в $$Х$$, его распределения, независимости случайных элементов используем согласно предыдущему пункту настоящей лекции, т.е. каноническому справочнику Ю.В. Прохорова и Ю.А. Розанова []. Будем считать, что функция $$f$$ измерима относительно $$\sigma$$ -алгебры, участвующей в определении случайного элемента $$x=x(\omega)$$. Тогда $$f(x(\omega),y)$$ при фиксированном y является действительнозначной случайной величиной. Предположим, что она имеет математическое ожидание.

    Определение 2. Теоретическим средним $$E(x,f)$$ (другими словами, математическим ожиданием) случайного элемента $$x=x(\omega)$$ относительно меры различия $$f$$ называется решение оптимизационной задачи$$Mf(x(\omega),y)\rightarrow\min, y\in X.$$

    Это определение, как и для эмпирических средних, согласуется с классическим. Если $$Х=R^1, f(x,y) = (x-y)^2$$, то $$Е(x,f) = М(x(\omega))$$ - обычное математическое ожидание. При этом $$Mf(x(\omega),E(x,f))$$ - дисперсия случайной величины $$x=x(\omega)$$. Если же $$Х=R^1, f(x,y) = |x-y|$$, то $$E(x,f) = [a,b]$$, где $$a = \sup\{t: F(t)\le 0,5\}, b=\inf{t: F(t)\ge 0,5\}$$, где $$F(t)$$ - функция распределения случайной величины $$x=x(\omega)$$. Если график $$F(t)$$ имеет плоский участок на уровне $$F(t) = 0,5$$, то медиана - теоретическое среднее в смысле определения 2 - является отрезком. В классическом случае обычно говорят, что каждый элемент отрезка $$[a; b]$$ является одним из возможных значений медианы. Поскольку наличие указанного плоского участка - исключительный случай, то обычно решением задачи (2) является множество из одного элемента $$a = b$$ - классическая медиана распределения случайной величины $$x=x(\omega)$$.

    Теоретическое среднее $$E(x, f)$$ можно определить лишь тогда, когда $$Mf(x(\omega),y)$$ существует при всех $$y\in X$$. Оно может быть пустым множеством, например, если $$X=R^1\backslash\{x_0\}, f(x,y) = (x-y)^2, x_0=М(x(\omega))$$. И то, и другое исключается, если $$Х$$ конечно. Однако и для конечных $$X$$ теоретическое среднее может состоять не из одного, а из многих элементов. Отметим, однако, что в множестве всех распределений вероятностей на $$X$$ подмножество тех распределений, для которых $$E(x,f)$$ состоит более чем из одного элемента, имеет коразмерность 1, поэтому основной является ситуация, когда множество $$E(x,f)$$ содержит единственный элемент [].

    Существование средних величин. Под существованием средних величин будем понимать непустоту множеств решений соответствующих оптимизационных задач.

    Если $$Х$$ состоит из конечного числа элементов, то минимум в задачах (1) и (2) берется по конечному множеству. А потому, как уже отмечалось, эмпирические и теоретические средние существуют.

    Ввиду важности обсуждаемой темы приведем доказательства. Для строгого математического изложения нам понадобятся термины из раздела математики под названием "общая топология". Топологические термины и результаты будем использовать в соответствии с классической монографией []. Так, топологическое пространство называется бикомпактным в том и только в том случае, когда из каждого его открытого покрытия можно выбрать конечное подпокрытие [, с.183].

    Теорема 1. Пусть $$X$$ - бикомпактное пространство, функция $$f$$ непрерывна на $$X^2$$ (в топологии произведения). Тогда эмпирическое и теоретическое средние существуют.

    Доказательство. Функция $$f(x_i, y)$$ от y непрерывна, сумма непрерывных функций непрерывна, непрерывная функция на бикомпакте достигает своего минимума, откуда и следует заключение теоремы относительно эмпирического среднего.

    Перейдем к теоретическому среднему. По теореме Тихонова [, с.194] из бикомпактности $$X$$ вытекает бикомпактность $$X^2$$. Для каждой точки $$(x, y)$$ из $$X^2$$ рассмотрим $$\varepsilon/2$$ - окрестность в $$X^2$$ в смысле показателя различия $$f$$, т.е. множество U(x,y)=\{(x',y'):|f(x,y)-f(x',y')|<\varepsilon/2\}.

    Поскольку $$f$$ непрерывна, то множества $$U(x,y)$$ открыты в рассматриваемой топологии в $$X^2$$. По теореме Уоллеса [, с.193] существуют открытые (в $$X$$ ) множества $$V(x)$$ и $$W(y)$$, содержащие $$x$$ и $$y$$ соответственно и такие, что их декартово произведение $$V(x)\times W(y)$$ целиком содержится внутри $$U(x, y)$$.

    Рассмотрим покрытие $$X^2$$ открытыми множествами $$V(x)\times W(y)$$. Из бикомпактности $$X^2$$ вытекает существование конечного подпокрытия $$\{V(x_i)\times W(y_i), i=1,2,...,m}$$. Для каждого $$x$$ из $$X$$ рассмотрим все декартовы произведения $$V(x_i)\times W(y_i)$$, куда входит точка $$(x,y)$$ при каком-либо $$y$$. Таких декартовых произведений и их первых множителей $$V(x_i)$$ конечное число. Возьмем пересечение таких первых множителей $$V(x_i)$$ и обозначим его $$Z(x)$$. Это пересечение открыто, как пересечение конечного числа открытых множеств, и содержит точку $$x$$. Из покрытия бикомпактного пространства $$X$$ открытыми множествами $$Z(x)$$ выберем открытое подпокрытие $$Z_1, Z_2, ..., Z_k$$.

    Покажем, что если $$x'_1$$ и $$x'_2$$ принадлежат одному и тому же $$Z_j$$ при некотором $$j$$, то$$\sup\{|f(x'_1,y)-f(x'_2,y)|,y\in X\}<\varepsilon.$$

    Пусть $$Z_j = Z(x_0)$$ при некотором $$x_0$$. Пусть $$V(x_i)\times W(y_i), i\in I$$, - совокупность всех тех исходных декартовых произведений из системы $$\{V(x_i)\times W(y_i), i=1,2,...,m\}$$, куда входят точки $$(x_0,y)$$ при различных $$y$$. Покажем, что их объединение содержит также точки $$(x'_1,y)$$ и $$(x'_2,y)$$ при всех $$y$$. Действительно, если $$(х_0,y)$$ входит в $$V(x_i)\times W(y_i)$$, то y входит в $$W(y_i)$$, а $$x'_1$$ и $$x'_2$$ вместе с $$x_0$$ входят в $$V(x_i)$$, поскольку $$x'_1, x'_2$$ и $$x_0$$ входят в $$Z(x_0)$$. Таким образом, $$(x'_1,y)$$ и $$(x'_2,y)$$ принадлежат $$V(x_i)\times W(y_i)$$, а потому согласно определению $$V(x_i)\times W(y_i)$$$$|f(x'_1,y)-f(x_i,y_i)|<\varepsilon/2, |f((x'_2,y))-f(x_i,y_i)|<\varepsilon/2,$$ откуда и следует неравенство (3).

    Поскольку $$X^2$$ - бикомпактное пространство, то функция $$f$$ ограничена на $$X^2$$, а потому существует математическое ожидание $$Mf(x(\omega),y)$$ для любого случайного элемента $$x(\omega)$$, удовлетворяющего приведенным выше условиям согласования топологии, связанной с $$f$$, и измеримости, связанной с $$x(\omega)$$. Если $$x_1$$ и $$x_2$$ принадлежат одному открытому множеству $$Z_j$$, то$$|Mf(x_1,y)-Mf(x_2,y)|<\varepsilon,$$ а потому функция$$g(y)=Mf(x(\omega),y)$$ непрерывна на $$X$$. Поскольку непрерывная функция на бикомпактном множестве достигает своего минимума, т.е. существуют такие точки $$z$$, на которых $$g(z) = \inf\{g(y),y\in X\}$$, то теорема 1 доказана.

    В ряде интересных для приложений ситуаций $$X$$ не является бикомпактным пространством. Например, если $$X = R^1$$. В этих случаях приходится наложить на показатель различия $$f$$ некоторые ограничения, например, так, как это сделано в теореме 2.

    Теорема 2. Пусть $$X$$ - топологическое пространство, непрерывная (в топологии произведения) функция $$f:X^2\rightarrow R^1$$ неотрицательна, симметрична (т.е. $$f(x,y) = f(y,x)$$ для любых $$x$$ и $$y$$ из $$X$$ ), существует число $$D>0$$ такое, что при всех $$x, y, z$$ из $$X$$$$f(x,y)\le D\{f(x,z)+f(z,y)\}.$$

    Пусть в $$X$$ существует точка $$x_0$$ такая, что при любом положительном $$R$$ множество $$\{x:f(x,x_0)\le R\}$$ является бикомпактным. Пусть для случайного элемента $$x(\omega)$$, согласованного с топологией в рассмотренном выше смысле, существует $$g(x_0)=Mf(x(\omega),x_0)$$.

    Тогда существуют (т.е. непусты) математическое ожидание $$E(x,f)$$ и эмпирические средние $$E_n(f)$$.

    Замечание. Условие (5) - некоторое обобщение неравенства треугольника. Например, если $$g$$ - метрика в $$X$$, а $$f = g^p$$ при некотором натуральном $$p$$, то для $$f$$ выполнено соотношение (5) с $$D=2^p$$.

    Доказательство. Рассмотрим функцию $$g(y)$$, определенную формулой (4). Имеем$$f(x(\omega),y)\le D\{f(x(\omega),x_0)+f(x_0,y)\}.$$

    Поскольку по условию теоремы $$g(x_0)$$ существует, а потому конечно, то из оценки (6) следует существование и конечность $$g(y)$$ при всех $$y$$ из $$X$$. Докажем непрерывность этой функции.

    Рассмотрим шар (в смысле меры различия $$f$$ ) радиуса $$R$$ с центром в $$x_0$$:$$K(R)=\{x:f(x,x_0)\le R\},R>0.$$

    В соответствии с условием теоремы $$K(R)$$ как подпространство топологического пространства $$X$$ является бикомпактным. Рассмотрим произвольную точку $$x$$ из $$X$$. Справедливо разложение$$f(x(\omega),y)=f(x(\omega),y)\chi(x(\omega)\in K(R))+f(x(\omega),y)\chi(x(\omega)\notin K(R)),$$ где $$\chi(C)$$ - индикатор множества $$C$$. Следовательно,$$g(y)=Mf(x(\omega),y)\chi(x(\omega)\in K(R))+Mf(x(\omega),y)\chi(x(\omega)\notin K(R)).$$

    Рассмотрим второе слагаемое в (7). В силу (5)$$\begin{aligned} f(x(\omega),y)\chi(x(\omega)\notin K(R))\le f(x(\omega),x_0)\chi(x(\omega)\notin K(R)) + \\ +f(x_0,y)\chi(x(\omega)\notin K(R)). \end{aligned}$$

    Возьмем математическое ожидание от обеих частей (8):$$\begin{gathered} Mf(x(\omega),y)\chi(x(\omega)\notin K(R))\le D\int\limits_R^{+\infty}tdP\{f(x(\omega),x_0)\le t\}+\\ +Df(x_0,y)P(x(\omega)\notin K(R)). \end{gathered}$$

    В правой части (9) оба слагаемых стремятся к 0 при безграничном возрастании $$R$$: первое - в силу того, что$$g(x_0)=Mf(x(\omega),x_0)=\int\limits_0^{+\infty}tdP(f(x(\omega),x_0)\le t)<\infty,$$ второе - в силу того, что распределение случайного элемента $$x(\omega)$$ сосредоточено на $$X$$ и$$X\backslash\bigcup_{R>0}K(R)=\varnothing.$$

    Пусть $$U(x)$$ - такая окрестность $$x$$ (т.е. открытое множество, содержащее $$x$$ ), для которой$$\sup\{f(y,x),y\in U(x)\}<+\infty.$$

    Имеем$$f(y,x_0)\le D(f(x_0,x)+f(x,y)).$$

    В силу (9) и (10) при безграничном возрастании $$R$$$$Mf(x(\omega),y)\chi(x(\omega)\notin K(R))\rightarrow 0$$ равномерно по $$y\in U(x)$$. Пусть $$R(0)$$ таково, что левая часть (11) меньше $$\varepsilon>0$$ при $$R>R(0)$$ и, кроме того, $$y\in U(x)\subseteq K(R(0))$$. Тогда при $$R>R(0)$$$$|g(y)-g(x)|\le |Mf(x(\omega),y)\chi(x(\omega)\in K(R))-Mf(x(\omega),x)\chi(x(\omega)\in K(R))|+2\varepsilon.$$

    Нас интересует поведение выражения в правой части формулы (12) при $$y\in U(x)$$. Рассмотрим $$f_1$$ - сужение функции $$f$$ на замыкание декартова произведения множеств $$U(x)\times K(R)$$, и случайный элемент $$x_1(\omega)=x(\omega)\chi(x(\omega)\in K(R))$$. Тогда$$Mf(x(\omega),y)\chi(x(\omega)\in K(R))=Mf_1(x_1(\omega),y)$$ при $$y\in U(x)$$, а непрерывность функции $$g_1(y)=Mf_1(x_1(\omega),y)$$ была доказана в теореме 1. Последнее означает, что существует окрестность $$U_1(x)$$ точки x такая, что$$|Mf_1(x_1(\omega),y)-Mf_1(x_1(\omega),x)|<\varepsilon$$ при $$y\in U_1(x)$$. Из (12) и (13) вытекает, что при $$y\in U(x)\bigcap U_1(x)$$$$|g(y)-g(x)|<3\varepsilon,$$ что и доказывает непрерывность функции $$g(x)$$.

    Докажем существование математического ожидания $$E(x,f)$$. Пусть $$R(0)$$ таково, что$$P(x(\omega)\in K(R(0)))>1/2.$$

    Пусть $$H$$ - некоторая константа, значение которой будет выбрано позже. Рассмотрим точку $$x$$ из множества $$K(HR(0))^С$$ - дополнения $$K(HR(0))$$, т.е. из внешности шара радиуса $$HR(0)$$ с центром в $$x_0$$. Пусть $$x(\omega)\in K(R(0))$$. Тогда имеем$$f(x_0,x)\leD\{f(x_0,x(\omega))+f(x(\omega),x)\},$$ откуда$$f(x(\omega),x)\ge\frac{1}{D}f(x_0,x)-f(x_0,x(\omega))\ge\frac{HR(0)}{D}-R(0).$$

    Выбирая $$H$$ достаточно большим, получим с учетом условия (14), что при $$x\in K(HR(0))^С$$ справедливо неравенство$$Mf(c(\omega),x)\ge\frac12\left(\frac{HR(0)}{D}-R(0)\right).$$

    Можно выбрать $$H$$ так, чтобы правая часть (16) превосходила $$g(x_0)=Mf(x(\omega),x_0)$$.

    Сказанное означает, что $$\text{Argmin}\ g(x)$$ достаточно искать внутри бикомпактного множества $$K(HR(0))$$. Из непрерывности функции $$g$$ вытекает, что ее минимум достигается на указанном бикомпактном множестве, а потому - и на всем $$X$$. Существование (непустота) теоретического среднего $$E(x,f)$$ доказана.

    Докажем существование эмпирического среднего $$E_n(f)$$. Есть искушение проводить его дословно так же, как и доказательство существования математического ожидания $$E(x,f)$$, лишь с заменой 1/2 в формуле (16) на частоту попадания элементов выборки $$x_i$$ в шар $$K(R(0))$$. Эта частота, очевидно, стремится к вероятности попадания случайного элемента $$x=x(\omega)$$ в $$K(R(0))$$, большей 1/2 в соответствии с (14). Однако это рассуждение показывает лишь, что вероятность непустоты $$E_n(f)$$ стремится к 1 при безграничном росте объема выборки. Точнее, оно показывает, что$$\lim_{n\rightarrow\infty}P\{E_n(f)\ne\varnothing\wedgeE_n(f)\subseteq K(HR(0))\}=1.$$

    Поэтому пойдем другим путем, не опирающимся к тому же на вероятностную модель выборки. Положим$$R(1)=\max\{f(x_i,x_0),i=1,2,...,n\}.$$

    Если $$x$$ входит в дополнение шара $$K(HR(1))$$, то аналогично (15) имеем$$f(x_i,x_0)\ge\frac{HR(1)}{D}-R(1).$$

    При достаточно большом $$H$$ из (17) и (18) следует, что$$\sum_{i=1}^n f(x_i,x_0)\le nR(1)<\sum_{i=1}^n f(x_i,x),x\in\{K(HR(1))\}^C.$$

    Следовательно, $$\text{Argmin}$$ достаточно искать на $$K(HR(1))$$. Заключение теоремы 2 следует из того, что на бикомпактном пространстве $$K(HR(1))$$ минимизируется непрерывная функция.

    Теорема 2 полностью доказана.

    О формулировках законов больших чисел. Пусть $$x, x_1, x_2, ..., x_n$$ - независимые одинаково распределенные случайные элементы со значениями в $$X$$. Закон больших чисел - это утверждение о сходимости эмпирических средних к теоретическому среднему (математическому ожиданию) при росте объема выборки $$n$$, т.е. утверждение о том, что$$E_n(f)=E_n(x_1,x_2,x_3,...,x_n;f)\rightarrow E(x,f)$$ при $$n\rightarrow\infty$$. Однако и слева, и справа в формуле (19) стоят, вообще говоря, множества. Поэтому понятие сходимости в (19) требует обсуждения и определения.

    В силу классического закона больших чисел при $$n\rightarrow\infty$$$$\frac{1}{n}\sum_{i=1}^n f(x_i,y)\rightarrow Mf(x,y)$$ в смысле сходимости по вероятности, если правая часть существует (теорема А.Я. Хинчина, 1923 г.).

    Если пространство $$X$$ состоит из конечного числа элементов, то из соотношения (20) легко вытекает (см., например, [, с.192-193]), что$$\lim_{n\rightarrow\infty}P\{E_n(f)\subseteq E(x,f)\}=1.$$

    Другими словами, $$E_n(f)$$ является состоятельной оценкой $$E(x, f)$$.

    Если $$E(x, f)$$ состоит из одного элемента, $$E(x,f)={x_0}$$, то соотношение (21) переходит в следующее:$$\lim_{n\rightarrow\infty}P\{E_n(f)=\{x_0\}\}=1.$$

    Однако с прикладной точки зрения доказательство соотношений (21) - (22) не дает достаточной уверенности в возможности использования $$E_n(f)$$ в качестве оценки $$E(x,f)$$. Причина в том, что в процессе доказательства объем выборки предполагается настолько большим, что при всех $$y\in X$$ одновременно левые части соотношений (20) сосредотачиваются в непересекающихся окрестностях правых частей.

    , с.193-194]. Согласно этой теореме с вероятностью 1 эмпирическое среднее $$E_n(f)$$ входит в теоретическое среднее $$E(x,f)$$, начиная с некоторого объема выборки $$n$$, вообще говоря, случайного, $$n=n(\omega)$$. Мы не будем останавливаться на сходимости с вероятностью 1, поскольку в соответствующих постановках, подробно разобранных в монографии [], нет принципиальных отличий от случая сходимости по вероятности.

    Если $$X$$ не является конечным, например, $$X = R^1,$$ то соотношения (21) и (22) неверны. Поэтому необходимо искать иные формулировки закона больших чисел. В классическом случае сходимости выборочного среднего арифметического к математическому ожиданию, т.е. $$\overline{x}\rightarrow M(x)$$, можно записать закон больших чисел так: для любого $$\varepsilon>0$$ справедливо предельное соотношение$$\lim_{n\rightarrow\infty}P\{\overline{x}\in(M(x)-\varepsilon;M(x)+\varepsilon)\}=1.$$

    В этом соотношении в отличие от (21) речь идет о попадании эмпирического среднего $$E_n(f)=\overline{x}$$ не непосредственно внутрь теоретического среднего $$E(x,f)$$, а в некоторую окрестность теоретического среднего.

    Обобщим эту формулировку. Как задать окрестность теоретического среднего в пространстве произвольной природы? Естественно взять его окрестность, определенную с помощью какой-либо метрики. Однако полезно обеспечить на ее дополнении до $$X$$ отделенность множества значений $$Мf(x(\omega),y)$$ как функции $$y$$ от минимума этой функции на всем $$X$$.

    Поэтому мы сочли целесообразным определить такую окрестность с помощью самой функции $$Мf(x(\omega),y)$$.

    Определение 3. Для любого $$\varepsilon>0$$ назовем $$\varepsilon$$ -пяткой функции $$g(x)$$ множество$$K_{\varepsilon}(g)=\{x:g(x)<\inf\{d(y),y\in X\}+\varepsilon,x\in X\}.$$

    Таким образом, в $$\varepsilon$$ -пятку входят все те $$x$$, для которых значение $$g(x)$$ либо минимально, либо отличается от минимального (или от инфимума - точной нижней грани) не более чем на $$\varepsilon$$. Так, для $$X = R^1$$ и функции $$g(x) = х^2$$ минимум равен 0, а $$\varepsilon$$ -пятка имеет вид интервала $$(-\sqrt{\varepsilon};\sqrt{\varepsilon})$$. В формулировке (23) классического закона больших чисел утверждается, что при любом $$\varepsilon>0$$ вероятность попадания среднего арифметического в $$\sqrt{\varepsilon}$$ -пятку математического ожидания стремится к 1. Поскольку $$\varepsilon>0$$ произвольно, то вместо $$\sqrt{\varepsilon}$$ -пятки можно говорить о $$\varepsilon$$ -пятке, т.е. перейти от (23) к эквивалентной записи$$\lim_{n\rightarrow\infty}P\{\overline(x)\in K_{\varepsilon}(M(x(\omega)-x)^2)\}=1.$$

    Соотношение (24) допускает непосредственное обобщение на общий случай пространств произвольной природы.

    Схема закона больших чисел. Пусть $$x,x_1,x_2,x_3,...,x_n$$ - независимые одинаково распределенные случайные элементы со значениями в пространстве произвольной природы $$X$$ с показателем различия $$f: X^2\rightarrow R^1$$. Пусть выполнены некоторые математические условия регулярности. Тогда для любого $$\varepsilon>0$$ справедливо предельное соотношение$$\lim_{n\rightarrow\infty}P\{E_n(f)\subseteq K_{\varepsilon}(E(x,f))\}=1.$$

    Аналогичным образом может быть сформулирована и общая идея усиленного закона больших чисел. Ниже приведены две конкретные формулировки "условий регулярности".

    Законы больших чисел. Начнем с рассмотрения естественного обобщения конечного множества - бикомпактного пространства $$X$$.

    Теорема 3. В условиях теоремы 1 справедливо соотношение (25).

    Доказательство. Воспользуемся построенным при доказательстве теоремы 1 конечным открытым покрытием $${Z_1, Z_2, ..., Z_k}$$ пространства $$X$$ таким, что для него выполнено соотношение (3). Построим на его основе разбиение $$X$$ на непересекающиеся множества $$W_1, W_2, ..., W_m$$ (объединение элементов разбиения $$W_1, W_2, ..., W_m$$ составляет $$X$$ ). Это можно сделать итеративно. На первом шаге из $$Z_1$$ следует вычесть $$Z_2, ..., Z_k$$ - это и будет $$W_1$$. Затем в качестве нового пространства надо рассмотреть разность $$X$$ и $$W_1$$, а покрытием его будет $$\{Z_2, ..., Z_k}$$. И так до $$k$$ -го шага, когда последнее из рассмотренных покрытий будет состоять из единственного открытого множества $$Z_k$$. Остается из построенной последовательности $$W_1, W_2, ..., W_k$$ вычеркнуть пустые множества, которые могли быть получены при осуществлении описанной процедуры (поэтому, вообще говоря, $$m$$ может быть меньше $$k$$ ).

    В каждом из элементов разбиения $$W_1, W_2, ..., W_m$$ выберем по одной точке, которые назовем центрами разбиения и соответственно обозначим $$w_1, w_2, ..., w_m$$. Это и есть то конечное множество, которым можно аппроксимировать бикомпактное пространство $$X$$. Пусть $$y$$ входит в $$W_j$$. Тогда из соотношения (3) вытекает, что$$\left| \frac{1}{n}\sum_{i=1}^n f(x_i,y)-\frac{1}{n}\sum_{i=1}^n f(x_i,w_y) \right| <\varepsilon.$$

    Перейдем к доказательству соотношения (25). Возьмем произвольное $$\delta>0$$. Рассмотрим некоторую точку $$b$$ из $$E(x,f)$$. Доказательство будет основано на том, что с вероятностью, стремящейся к 1, для любого $$y$$ вне $$K_{\delta}(E(x,f))$$ выполнено неравенство$$\frac{1}{n}\sum_{i=1}^n f(x_i,y)>\frac{1}{n}\sum_{i=1}^n f(x_i,b).$$

    Для обоснования этого неравенства рассмотрим все элементы разбиения $$W_1, W_2, ..., W_m$$, имеющие непустое пересечение с внешностью $$\delta$$ -пятки $$K_{\delta}(E(x,f))$$. Из неравенства (26) следует, что для любого $$y$$ вне $$K_{\delta}(E(x,f))$$ левая часть неравенства (27) не меньше$$\min_j \left( \frac(1)(n)\sum_{i=1}^n f(x_i,w_j) \right) -\varepsilon,$$

    где минимум берется по центрам всех элементов разбиения, имеющим непустое пересечение с внешностью $$\delta$$ -пятки. Возьмем теперь в каждом таком разбиении точку $$v_i$$, лежащую вне $$\delta$$ -пятки $$K_{\delta}(E(x,f))$$. Тогда из неравенств (3) и (28) следует, что левая часть неравенства (27) не меньше$$\min_j \left( \frac(1)(n)\sum_{i=1}^n f(x_i,w_j) \right) -2\varepsilon,$$

    В силу закона больших чисел для действительнозначных случайных величин каждая из участвующих в соотношениях (27) и (29) средних арифметических имеет своими пределами соответствующие математические ожидания, причем в соотношении (29) эти пределы не менее$$Mf(x(\omega),b)+\delta-2\varepsilon,$$ поскольку точки $$v_i$$ лежат вне $$\delta$$ -пятки $$K_{\delta}(E(x,f))$$. Следовательно, при$$\delta-2\varepsilon>0$$

    и достаточно большом $$n$$, обеспечивающем необходимую близость рассматриваемого конечного числа средних арифметических к их математическим ожиданиям, справедливо неравенство (27).

    Из неравенства (27) следует, что пересечение $$E_n(f)$$ с внешностью $$K_{\delta}(E(x,f))$$ пусто. При этом точка $$b$$ может входить в $$E_n(f)$$, а может и не входить. Во втором случае $$E_n(f)$$ состоит из иных точек, входящих в $$K_{\delta}(E(x,f))$$. Теорема 3 доказана.

    Если $$X$$ не является бикомпактным пространством, то необходимо суметь оценить рассматриваемые суммы "на периферии", вне бикомпактного ядра, которое обычно выделяется естественным путем. Один из возможных комплексов условий сформулирован выше в теореме 2.

    Теорема 4. В условиях теоремы 2 справедлив закон больших чисел, т.е. соотношение (25).

    Доказательство. Будем использовать обозначения, введенные в теореме 2 и при ее доказательстве. Пусть $$r$$ и $$R$$, $$r<R$$ - положительные числа. Рассмотрим точку $$x$$ в шаре $$K(r)$$ и точку $$y$$ вне шара $$K(R)$$. Поскольку$$f(x_0,y)\le D\{f(x_0,x)+f(x,y)\},$$ то$$f(x,y)\ge\frac{1}{D}f(x_0,y)-f(x_0,x)\ge\frac{R}{D}-r.$$

    Положим$$g_n(x)=g_n(x,\omega)=\frac{1}{n}\sum_{i=1}^n f(x_i,x).$$

    Сравним $$g_n(x_0)$$ и $$g_n(y)$$. Выборку $$x_1,x_2,...,x_n$$ разобьем на две части. В первую часть включим те элементы выборки, которые входят в $$K(r)$$, во вторую - все остальные (т.е. лежащие вне $$K(r)$$ ). Множество индексов элементов первой части обозначим $$I = I(n,r)$$. Тогда в силу неотрицательности $$f$$ имеем$$g_n(y)\ge\frac{1}{n}\sum_{i\in I} f(x_i,y),$$ а в силу неравенства (30)$$\sum_{i\in I}f(x_i,y)\ge\left(\frac{R}{D}-r\right)CardI(n,r),$$ где $$Card I(n,r)$$ - число элементов в множестве индексов $$I(n,r)$$. Следовательно,$$g_n(y)\ge\frac{1}{n}\left(\frac{R}{D}-r\right)J,$$ где $$J = Card I(n,r)$$ - биномиальная случайная величина $$B(n,p)$$ с вероятностью успеха $$p=P\{x_i(\omega)\in K(r)\}$$. По теореме Хинчина для $$g_n(x_0)$$ справедлив классический закон больших чисел. Пусть $$\varepsilon>0$$. Выберем $$n_1=n_1(\varepsilon)$$ так, чтобы при $$n>n_1$$ было выполнено сооxтношение$$P\{g_n(x_0)-g(x_0)>\varepsilon\}<\varepsilon,$$ где $$g(x_0)=Mf(x_1,x_0)$$. Выберем $$r$$ так, чтобы вероятность успеха $$p>0,6$$. По теореме Бернулли можно выбрать $$n_2=n_2(\varepsilon)$$ так, чтобы при $$n>n_2$$$$P\{J>0,5n\}>1-\varepsilon.$$

    Выберем $$R$$ так, чтобы$$\frac12\left(\frac{R}{D}-r\right)>g(x_0)+\varepsilon.$$

    Тогда$$K_{\varepsilon}(g)\subseteq k(R)$$ и согласно (31), (32) и (33) при $$n>n_3=\max(n_1,n_2)$$ с вероятностью не менее $$1-\varepsilon$$ имеем$$g_n(y)^gt;g_n(x_0)$$ для любого $$y$$ вне $$K(R)$$. Из (34) следует, что минимизировать $$g_n$$ достаточно внутри бикомпактного шара $$K(R)$$, при этом $$E_n(f)$$ не пусто и$$E_n(f)\subseteq K(R)$$ с вероятностью не менее $$1-2\varepsilon$$.

    Пусть $$g'_n$$ и $$g'$$ - сужения $$g_n$$ и $$g(x)=Mf(x(\omega),x)$$ соответственно на $$K(R)$$ как функций от $$x$$. В силу (34) справедливо равенство $$K_{\varepsilon}(g')=K_{\varepsilon}(f)$$. Согласно доказанной выше теореме 3 найдется $$n_4=n_4(\omega)$$ такое, что$$P(K_0(g'_n)\subseteq K_{\varepsilon}(g))>1-\varepsilon.$$

    Согласно (36) с вероятностью не менее $$1-2\varepsilon$$$$K_0(g'_n)=E_n(f)$$ при $$n>n_3$$. Следовательно, при $$n>n_5(\varepsilon)=\max(n_3,n_4)$$ имеем$$P(E_n(f)\subseteq K_{\varepsilon}(g))>1-3\varepsilon,$$ что и завершает доказательство теоремы 4.

    Справедливы и иные варианты законов больших чисел, полученные, в частности, в статье [].

    Медиана Кемени и экспертные оценки. Рассмотрим на основе развитой выше теории частный случай пространств нечисловой природы - пространство бинарных отношений на конечном множестве $$Q=\{q_1,q_2,...,q_k\}$$ и его подпространства. Как известно, каждое бинарное отношение $$A$$ можно описать матрицей $$||a(i,j)||$$ из 0 и 1, причем $$a(i,j) = 1$$ тогда и только тогда $$q_i$$ и $$q_j$$ находятся в отношении $$A$$, и $$a(i,j) = 0$$ в противном случае.

    Определение 4. Расстоянием Кемени между бинарными отношениями $$A$$ и $$B$$, описываемыми матрицами $$||a(i,j)||$$ и $$||b(i,j)||$$ соответственно, называется$$d(A,B)=\sum_{i,j=1}^k|a(i,j)-b(i,j)|.$$

    Замечание. Иногда в определение расстояния Кемени вводят множитель, зависящий от $$k$$.

    Определение 5. Медианой Кемени для выборки, состоящей из бинарных отношений, называется эмпирическое среднее, построенное с помощью расстояния Кемени.

    Поскольку число бинарных отношений на конечном множестве конечно, то эмпирические и теоретические средние для произвольных показателей различия существуют и справедливы законы больших чисел, описанные формулами (21) и (22) выше.

    Бинарные отношения (в частности, упорядочения) часто используются для описания мнений экспертов. Тогда расстояние Кемени измеряет близость мнений экспертов, а медиана Кемени позволяет находить итоговое усредненное мнение комиссии экспертов. Расчет медианы Кемени обычно включают в информационное обеспечение систем принятия решений с использованием оценок экспертов. Речь идет, например, о математическом обеспечении автоматизированного рабочего места "Математика в экспертизе" (АРМ "МАТЭК"), предназначенного, в частности, для использования при проведении экспертиз в задачах экологического страхования. Поэтому представляет большой практический интерес численное изучение свойств медианы Кемени при конечном объеме выборки. Такое изучение дополняет описанную выше асимптотическую теорию, в которой объем выборки предполагается безгранично возрастающим $$(n\rightarrow\infty)$$.

    ]. В каждой серии методом статистических испытаний определенное число раз моделировался случайный и независимый выбор экспертных ранжировок, а затем находились все медианы Кемени для смоделированного набора мнений экспертов. При этом в сериях 1-5 распределение ответа эксперта предполагалось равномерным на множестве всех ранжировок. В серии 6 это распределение являлось монотонным относительно расстояния Кемени с некоторым центром (о понятии монотонности см. выше), т.е. вероятность выбора определенной ранжировки убывала с увеличением расстояния Кемени этой ранжировки от центра. Таким образом, серии 1-5 соответствуют ситуации, когда у экспертов нет почвы для согласия, нет группировки их мнений относительно некоторого единого среднего группового мнения, в то время как в серии 6 есть единое мнение - описанный выше центр, к которому тяготеют ответы экспертов.

    Результаты, приведенные в табл.5.5, можно комментировать разными способами. Неожиданным явилось большое число элементов в выборочной медиане Кемени - как среднее, так и особенно максимальное. Одновременно обращает на себя внимание убывание этих чисел при росте числа экспертов и особенно при переходе к ситуации реального существования группового мнения (серия 6). Достаточно часто один из ответов экспертов входит в медиану Кемени (т.е. пересечение множества ответов экспертов и медианы Кемени непусто), а диаметр медианы как множества в пространстве ранжировок заметно меньше диаметра множества ответов экспертов. По этим показателям - наилучшее положение в серии 6. Грубо говоря, всяческие "патологии" в поведении медианы Кемени наиболее резко проявляются в ситуации, когда ее применение не имеет содержательного обоснования, т.е. когда у экспертов нет основы для согласия, их ответы равномерно распределены на множестве ранжировок.

    Вычислительный эксперимент по изучению свойств медианы Кемени
    Номер серии 1 2 3 4 5 6
    Число испытаний 100 1000 50 50 1000 1000
    Количество объектов 5 5 7 7 5 5
    Количество экспертов 10 30 10 30 10 10
    Частота непустого пересечения 0,85 0,58 0,52 0,2 0,786 0,911
    Среднее отношение диаметров 0,283 0,124 0,191 0,0892 0,202 0,0437
    Средняя мощность медианы 5,04 2,41 6,4 2,88 3,51 1,35
    Максимальная мощность медианы 30 14 19 11 40 12

    Увеличение числа испытаний в 10 раз при переходе от серии 1 к серии 5 не очень сильно повлияло на приведенные в таблице характеристики, поэтому представляется, что суть дела выявляется при числе испытаний (в методе Монте-Карло), равном 100 или даже 50. Увеличение числа объектов или экспертов увеличивает число элементов в рассматриваемом пространстве ранжировок, а потому уменьшается частота попадания какого-либо из мнений экспертов внутрь медианы Кемени, а также отношение диаметра медианы к диаметру множества экспертов и число элементов медианы Кемени (среднее и максимальное). Можно сказать, что увеличение числа объектов или экспертов уменьшает степень дискретности задачи, приближает ее к непрерывному случаю, а потому уменьшает выраженность различных "патологий".

    Есть много интересных результатов, которые здесь не рассматриваются. Они связаны, в частности, со сравнением медианы Кемени с другими методами усреднения мнений экспертов, например, с нахождением итогового упорядочения по методу средних рангов [], а также с использованием малых окрестностей ответов экспертов для поиска входящих в медиану ранжировок, с теоретической и численной оценкой скорости сходимости в законах больших чисел.

    5.6. Непараметрические оценки плотности

    Эмпирическая функция распределения - это состоятельная непараметрическая оценка функции распределения числовой случайной величины. А как оценить плотность? Если продифференцировать эмпирическую функцию распределения, то получим бесконечности в точках, соответствующих элементам выборки, и 0 во всех остальных. Ясно, что это не оценка плотности.

    Как же действовать? Каждому элементу выборки соответствует в эмпирическом распределении вероятность $$1/n$$, где $$n$$ - объем выборки. Целесообразно эту вероятность не помещать в одну точку, а "размазать" вокруг нее, построив "холмик". Если "холмики" налегают друг на друга, то получаем положительную плотность на всей прямой. Чтобы получить состоятельную оценку плотности, необходимо выбирать ширину "холмика" в зависимости от объема выборки. При этом число "холмиков", покрывающих фиксированную точку, должно безгранично расти. Но одновременно доле таких "холмиков" следует убывать, поскольку покрывающие "холмики" должны быть порождены лишь ближайшими членами вариационного ряда.

    Реализация описанной идеи привела к различным вариантам непараметрических оценок плотности. Основополагающей является работа Н.В.Смирнова 1951 г. []. Вначале рассматривались непараметрические оценки плотности распределения числовых случайных величин и конечномерных случайных векторов. В 1980-х годах удалось сконструировать такие оценки в пространствах произвольной природы [], а затем и для конкретных видов нечисловых данных [].

    Сначала рассмотрим непараметрические оценки плотности в наиболее общей ситуации. В статистике нечисловых данных выделяют общую теорию и статистику в конкретных пространствах нечисловой природы (например, статистику ранжировок). В общей теории есть два основных сюжета. Один связан со средними величинами и асимптотическим поведением решений экстремальных статистических задач, второй - с непараметрическими оценками плотности. Первый сюжет только что рассмотрен, второму посвящена заключительная часть настоящей лекции.

    Понятие плотности в пространстве произвольной природы $$X$$ требует специального обсуждения. В пространстве $$X$$ должна быть выделена некоторая специальная мера $$\mu$$, относительно которой будут рассматриваться плотности, соответствующие другим мерам, например, мере $$\nu$$, задающей распределение вероятностей некоторого случайного элемента $$\xi$$. В таком случае $$\nu(A)=Р(\xi\in A)$$ для любого случайного события $$A$$. Плотность $$f(x)$$, соответствующая мере $$\nu$$ - это такая функция, что$$\nu(A)=\int\limits_A f(x)s\mu$$

    для любого случайного события $$A$$. Для случайных величин и векторов мера $$\mu$$ - это объем множества $$A$$, в математических терминах - мера Лебега. Для дискретных случайных величин и элементов со значениями в конечном множестве $$X$$ в качестве меры $$\mu$$ естественно использовать считающую меру, которая событию $$A$$ ставит в соответствие число его элементов. Используют также нормированную случайную меру, когда число точек в множестве $$A$$ делят на число точек во всем пространстве $$X$$. В случае считающей меры значение плотности в точке $$x$$ совпадает с вероятностью попасть в точку $$x$$, т.е. $$f(x)=P(\xi=x)$$. Таким образом, с рассматриваемой точки зрения стирается грань между понятиями "плотность вероятности" и "вероятность (попасть в точку)".

    Как могут быть использованы непараметрические оценки плотности распределения вероятностей в пространствах нечисловой природы? Например, для решения задач классификации (диагностики, распознавания образов - см. лекцию 9). Зная плотности распределения классов, можно решать основные задачи диагностики - как задачи выделения кластеров, так и задачи отнесения вновь поступающего объекта к одному из диагностических классов. В задачах кластер-анализа можно находить моды плотности и принимать их за центры кластеров или за начальные точки итерационных методов типа $$k$$ -средних или динамических сгущений. В задачах собственно диагностики (дискриминации, распознавания образов с учителем) можно принимать решения о диагностике объектов на основе отношения плотностей, соответствующих классам. При неизвестных плотностях представляется естественным использовать их состоятельные оценки.

    Методы оценивания плотности вероятности в пространствах общего вида предложены и первоначально изучены в работе []. В частности, в задачах диагностики объектов нечисловой природы предлагаем использовать непараметрические ядерные оценки плотности типа Парзена-Розенблатта (этот вид оценок и его название впервые были введены в статье [] ). Они имеют вид:$$f_n(x)=\frac{1}{\eta_n(h_n,x)}\sum_{1\le i\le n}K(\frac{d(x_i,x)}{h_n}),$$ где $$K:R_+^1\rightarrow R^1$$ - так называемая ядерная функция, $$x_1, x_2, ..., x_n\in X$$ - выборка, по которой оценивается плотность, $$d(x_i,x)$$ - показатель различия (метрика, расстояние, мера близости) между элементом выборки $$x_i$$ и точкой $$x$$, в которой оценивается плотность, последовательность $$h_n$$ показателей размытости такова, что $$h_n\rightarrow 0$$ и $$nh_n\rightarrow\infty$$ при $$n\rightarrow\infty$$, а $$\eta_n(h_n,x)$$ - нормирующий множитель, обеспечивающий выполнение условия нормировки (интеграл по всему пространству от непараметрической оценки плотности $$f_n(x)$$ по мере $$\mu$$ должен равняться 1). Ранее американские исследователи Парзен и Розенблатт использовали подобные статистики в случае $$X=R^1$$ с $$d(x_i,x)=|x_i-x|$$.

    Введенные описанным образом ядерные оценки плотности - частный случай так называемых линейных оценок, также впервые предложенных в работе []. В теоретическом плане они выделяются тем, что удается получать результаты такого же типа, что в классическом одномерном случае, но, разумеется, с помощью совсем иного математического аппарата.

    Свойства непараметрических ядерных оценок плотности. Рассмотрим выборку со значениями в некотором пространстве произвольного вида. В этом пространстве предполагаются заданными показатель различия $$d$$ и мера $$\mu$$. Одна из основных идей рассматриваемого подхода состоит в том, чтобы согласовать их между собой. А именно, на их основе построим новый показатель различия $$d_1$$, так называемый "естественный", в терминах которого проще формулируются свойства непараметрической оценки плотности. Для этого рассмотрим шары $$L_t(x)=\{y\in X:d(y,x)\le t\}$$ радиуса $$t\ge 0$$ и их меры $$F_x(t)=\mu(L_t(x))$$. Предположим, что $$F_x(t)$$ как функция $$t$$ при фиксированном $$x$$ непрерывна и строго возрастает. Введем функцию $$d_1(x,y)=F_x(d(x,y))$$. Это - монотонное преобразование показателя различия или расстояния, а потому $$d_1(x,y)$$ - также показатель различия (даже если $$d$$ - метрика, для $$d_1$$ неравенство треугольника может быть не выполнено). Другими словами, $$d_1(x,y)$$, как и $$d(x,y)$$, можно рассматривать как показатель различия (меру близости) между $$x$$ и $$y$$.

    Для вновь введенного показателя различия $$d_1(x,y)$$ введем соответствующие шары $$L_{1t}= \{y\in X:d_1(y,x)\le t\}$$. Поскольку обратная функция $$F^{-1}_x(t)$$ определена однозначно, то$$L_{1t}(x)=\{y\in X:d_1(y,x)\le F_x^{-1}(t)\}=L_T(x),$$ где $$T = F^{-1}_x(t)$$. Следовательно, справедлива цепочка равенств $$F^1_х(t) = \mu(L_{1t}(x)) = \mu(L_T(x)) = F_x(F^{-1}_x(t))=t$$ (для всех тех значений параметра $$t$$, для которых определены все участвующие в записи математические объекты).

    Переход от $$d$$ к $$d_1$$ напоминает классическое преобразование, использованное Н.В. Смирновым при изучении непараметрических критериев согласия и однородности, а именно, преобразование $$\eta=F(\xi)$$, переводящее случайную величину $$\xi$$ с непрерывной функцией распределения $$F(x)$$ в случайную величину $$\eta$$, равномерно распределенную на отрезке [0,1]. Оба рассматриваемых преобразования существенно упрощают дальнейшие рассмотрения. Преобразование $$d_1= F_x(d)$$ зависит от точки $$x$$, что не влияет на дальнейшие рассуждения, поскольку ограничиваемся изучением сходимости в отдельно взятой точке.

    Функцию $$d_1(x,y)$$, для которой мера шара радиуса $$t$$ равна $$t$$, называем в соответствии с работой [] "естественным показателем различия" или "естественной метрикой". В случае конечномерного пространства $$R^k$$ и евклидовой метрики $$d$$ имеем $$d_1(x,y) = c_k d^k(x,y)$$, где $$c_k$$ - объем шара единичного радиуса в $$R^k$$.

    Поскольку можно записать, что$$K \left( \frac{d(x_i,x)}{h_n} \right)= K_1 \left( \frac{d_1(x_i,x)}{h_n} \right), \text{ где } K_1(u)=K \left( \frac{F_x^{-1}(uh_n)}{h_n} \right),$$ то переход от одного показателя различия к другому, т.е. от $$d$$ к $$d_1$$, соответствует переходу от одной ядерной функции к другой, т.е. от $$K$$ к $$K_1$$. Выгода от такого перехода заключается в том, что утверждения о поведении непараметрических оценок плотности приобретают более простую формулировку.

    Теорема 5. Пусть $$d$$ - естественная метрика, плотность $$f$$ непрерывна в точке $$x$$ и ограничена на всем пространстве $$X$$, причем $$f(x)>0$$, ядерная функция $$K(u)$$ удовлетворяет простым условиям регулярности$$\int\limits_0^1 K(u)du=1, \int\limits_0^{infty} (|K(u)|+K^2(u))du<\infty.$$

    Тогда $$\eta_n(h_n,x)=nh_n$$, оценка $$f_n(x)$$ является состоятельной, т.е. $$f_n(x)\rightarrow f(x)$$ по вероятности при $$n\rightarrow\infty$$ и, кроме того,$$\lim_{n\rightarrow\infty}(nh_nDf_n(x))=f(x)\int\limits_0^{+\infty}K^2(u)du.$$

    Теорема 5 доказывается методами, развитыми в работе []. Однако остается открытым вопрос о скорости сходимости ядерных оценок, в частности, о поведении величины $$\alpha_n= M(f_n(x)-f(x))^2$$ - среднего квадрата ошибки, и об оптимальном выборе показателей размытости $$h_n$$. Для того, чтобы продвинуться в решении этого вопроса, введем новые понятия. Для случайного элемента $$X(\omega)$$ со значениями в $$X$$ рассмотрим так называемое круговое распределение $$G(x,t) = P\{d(X(\omega),x)\le t\}$$ и круговую плотность $$g(x,t)= G'_t(x,t)$$.

    Теорема 6. Пусть ядерная функция $$K(u)$$ непрерывна и финитна, т.е. существует число $$E$$ такое, что $$K(u)=0$$ при $$u>E$$. Пусть круговая плотность является достаточно гладкой, т.е. допускает разложение$$g(x,t)=f(x)+tg'_t(x,0)+\frac{t^2}{2}g''_{tt}(x,0)+\frac{t^3}{3!}g'''_{ttt}(x,0)+...+\frac{t^k}{k!}g_{t^{(k)}}^{(k)}(x,0)+o(h_n^k)$$ при некотором $$k$$, причем остаточный член равномерно ограничен на $$[0,hE]$$.

    Пусть$$\int\limits_0^E u^i K(u)du=0,i=1,2,...,k-1.$$

    Тогда$$\begin{gathered} \alpha_n=[Mf_n(x)-f(x)]^2+Df_n(x)= \\ =h_n^{2k}\left(\int\limits_0^E u^k K(u)du\right)^2 (g_{t^{(k)}}^k(x,0))^2+\frac{f(x)}{nh_n}\int\limits_0^E K^2(u)du+\\ +o\left(h_n^{2k}+\frac{1}{nh_n}\right). \end{gathered}$$

    Доказательство теоремы 6 проводится с помощью разработанной в статистике объектов нечисловой природы математической техники, образцы которой представлены, в частности, в работе []. Если коэффициенты при основных членах в правой части последней формулы не равны 0, то величина $$\alpha n$$ достигает минимума, равного $$\alpha_n=O\left(n^{-1+\frac{1}{2k+1}}\right)$$ при $$h_n=n^{-\frac{1}{2k+1}}$$. Эти выводы совпадают с классическими результатами, полученными ранее рядом авторов для весьма частного случая прямой $$X = R^1$$ (см., например, монографию [, с.316]). Заметим, что для уменьшения смещения оценки приходится применять знакопеременные ядра $$K(u)$$.

    Непараметрические оценки плотности в конечных пространствах []. В случае пространств из конечного числа элементов естественных метрик не существует. Однако можно получить аналоги теорем 5 и 6, переходя к пределу не только по объему выборки $$n$$, но и по новому параметру дискретности $$m$$.

    Рассмотрим некоторую последовательность $$Xm, m=1,2,..$$., конечных пространств. Пусть в $$X_m$$ заданы показатели различия $$d_m$$. Будем использовать нормированные считающие меры ставящие в соответствие каждому подмножеству $$A$$ долю элементов всего пространства $$X_m$$, входящих в $$A$$. Как и ранее, рассмотрим как функцию $$t$$ объем шара радиуса $$t$$, т.е.$$F_{mx}(t)=\mu_m(\{y\in X_m:d_m(x,y)\le t\}).$$

    Введем аналог естественного показателя различия $$d_{1m}(x,y)=F_{mx}(d_m(x,y))$$. Наконец, рассмотрим аналоги преобразования Смирнова $$F_{mx}^1(t)=\mu_m(\{y\in X_m:d_{1m}(x,y)\le t\})$$. Функции $$F_{mx}^1(t)$$, в отличие от ранее рассмотренной ситуации, уже не совпадают тождественно с $$t$$, они кусочно-постоянны и имеют скачки в некоторых точках $$t_i, i=1,2,..$$., причем в этих точках $$F_{mx}^1(t_i)=t_i$$.

    Теорема 7. Пусть точки скачков равномерно сближаются, т.е. $$\max(t_i-t_{i-1}) \rightarrow 0$$ при $$m\rightarrow\infty$$ (другими словами, $$\sup|F_{mx}^1(t)-t| \rightarrow 0$$ при $$m\rightarrow\infty$$ ). Тогда существует последовательность параметров дискретности $$m_n$$ такая, что при предельном переходе $$n\rightarrow\infty, m\rightarrow\infty, m\ge m_n$$ справедливы заключения теорем 5 и 6.

    ]) аксиоматическое введение метрики $$d(A,B)=card(A\Delta B)/2^m$$ где $$\Delta$$ - символ симметрической разности множеств. Рассмотрим непараметрическую ядерную оценку плотности типа Парзена-Розенблатта$$f_{nm}(A)=\frac{1}{nh_n}\sum_{i=1}^n K \left( \frac{1}{h_n}\Phi \left( \frac{2card(A\Delta X_i)-m}{\sqrt{m}} \right) \right),$$ где $$\Phi(\cdot)$$ - функция нормального стандартного распределения. Можно показать, что эта оценка удовлетворяет условиям теоремы 7 с $$m_n=(\ln n)^6$$.

    Пример 2. Рассмотрим пространство функций $$f:Y_r\rightarrow Z_q$$ определенных на конечном множестве $$Y_r=\{1/r,2/r,...,(r-1)/r,\;1\}$$, со значениями в конечном множестве $$Z_q=\{0,1/q,2/q,...,(q-1)/q,1\}$$. Это пространство можно интерпретировать как пространство нечетких множеств (см. лекцию 1), а именно, $$Y_r$$ - носитель нечеткого множества, а $$Z_q$$ - множество значений функции принадлежности. Очевидно, число элементов пространства $$X_m$$ равно $$(q+1)^r$$. Будем использовать расстояние $$d(f,g)=\sup|f(y)-g(y)|$$. Непараметрическая оценка плотности имеет вид:$$f_{nm}(x)=\frac{1}{nh_n}\sum_{i=1}^n K \left( \frac{[2\sup_y|x(y)-x_i(y)|+1/q]^r}{h_n(1+1/q)^r} \right).$$

    Если $$r=n^\alpha, q=n^{\beta}$$, то при $$\beta>\alpha$$ выполнены условия теоремы 7, а потому справедливы теоремы 5 и 6.

    Пример 3. Рассматривая пространства ранжировок $$m$$ объектов, в качестве расстояния $$d(A,B)$$ между ранжировками $$A$$ и $$B$$ примем минимальное число инверсий, необходимых для перехода от $$A$$ к $$B$$. Тогда $$\max(t_i - t_{i-1})$$ не стремится к 0 при $$m\rightarrow\infty$$, условия теоремы 7 не выполнены.

    Пример 4. В прикладных работах наиболее распространенный пример объектов нечисловой природы - вектор разнотипных данных: реальный объект описывается вектором, часть координат которого - значения количественных признаков, а часть - качественных (номинальных и порядковых). Для пространств разнотипных признаков, т.е. декартовых произведений непрерывных и дискретных пространств, возможны различные постановки. Пусть, например, число градаций качественных признаков остается постоянным. Тогда непараметрическая оценка плотности сводится к произведению двух величин - частоты попадания в точку в пространстве качественных признаков и классической оценки типа Парзена-Розенблатта в пространстве количественных переменных. В общем случае расстояние $$d(x,y)$$ можно, например, рассматривать как сумму трех расстояний. А именно, евклидова расстояния $$d_1$$ между количественными факторами, расстояния $$d_2$$ между номинальными признаками $$(d_2(x,y) = 0$$, если $$x = y$$, и $$d_2(x,y) = 1$$, если $$x\ne y$$ ) и расстояния $$d_3$$ между порядковыми переменными (если $$x$$ и $$y$$ - номера градаций, то $$d3(x,y)=|x-y|)$$. Наличие количественных факторов приводит к непрерывности и строгому возрастанию функции $$F_{mx}(t)$$, а потому для непараметрических оценок плотности в пространствах разнотипных признаков верны теоремы 5 - 6.

    Программная реализация описания числовых данных с помощью непараметрических оценок плотности включена в ряд программных продуктов по прикладной статистике, в частности, в пакет программ анализа данных ППАНД [].

    Контрольные вопросы и задачи

  • Часто ли результаты измерений имеют нормальное распределение?
  • По выборке фактических данных о величине годового дохода (в тыс. долл.), взятых на конец 1970-х гг. (США), постройте вариационный ряд, гистограмму (группируя данные по 6-ти равным интервалам); определите выборочные среднее арифметическое, медиану и моду:$$\begin{gathered} 2,0; 13,4; 2,2; 6,7; 11,1; 10,0; 2,6; 12,9; 10,5; 9,2; 11,1; \\ 14,0; 26,0; 17,5; 7,2; 18,7; 9,9; 7,6; 11,7;11,3; 6,5. \end{gathered}$$
  • Дано распределение по градациям (табл.1) почасовой заработной платы 303 рабочих, занятых в промышленности ( $$f_i$$ - число рабочих, имеющих почасовую заработную плату $$x_i$$ ). Постройте эмпирическую функцию распределения, найдите выборочные медиану, моду и среднее арифметическое.
    Распределение рабочих по ставкам почасовой оплаты
    $$x_i$$ 2,5 2,6 2,7 2,8 2,9 3,0 3,1 3,2 3,3 3,4
    $$f_i$$ 10 25 41 74 58 34 17 14 11 3
  • Какие средние величины целесообразно использовать при расчете средней заработной платы (или среднего дохода)?
  • Постройте пример, показывающий некорректность использования среднего арифметического $$f(X_1, X_2) = (X_1 + X_2)/2$$ в порядковой шкале, используя допустимое преобразование $$g(x) = x^2$$ (при положительных усредняемых величинах $$x$$ ).
  • Постройте пример, показывающий некорректность использования среднего геометрического в порядковой шкале. Другими словами, приведите пример чисел $$x_1, x_2, y_1, y_2$$ и строго возрастающего преобразования $$f:R^1\rightarrow R^1$$ таких, что$$(x_1x_2)^{1/2}<(y_1y_2)^{1/2},[f(x_1)f(x_2)]^{1/2}>[f(y_1)f(y_2)]^{1/2}.$$
  • Приведите пример чисел $$x_1, x_2, y_1, y_2$$ и строго возрастающего преобразования $$f: R^1 \rightarrow R^1$$ таких, что$$\begin{gathered} {[}(x_1)^2+(x_2)^2]^{1/2}<[(y_1)^2+(y_2)^2]^{1/2}, \\ [(f(x_1))^2+(f(x_2))^2]^{1/2}>[(y(y_1))^2+(f(y_2))^2]^{1/2}. \end{gathered}$$
  • Какая математическая модель используется для описания случайного множества?
  • Как соотносятся эмпирические и теоретические средние для числовых данных и в пространствах произвольной природы?
  • Почему описание числовых данных с помощью непараметрических оценок плотности предпочтительнее их описания с помощью гистограмм?
  • Темы докладов, рефератов, исследовательских работ

  • Проведите описание данных, приведенных в табл.5.1 (п.5.2). Постройте таблицы (типа табл.5.2 и 5.3 там же), рассчитайте выборочные характеристики.
  • Показатели разброса, связи, показатели различия (в том числе метрики) в порядковой шкале.
  • Ранговые методы математической статистики как инвариантные методы анализа порядковых данных.
  • Показатели разброса, связи, показатели различия (в том числе метрики) в шкале интервалов.
  • Показатели разброса, связи, показатели различия (в том числе метрики) в шкале отношений.
  • Теорема В.В. Подиновского: любое изменение коэффициентов весомости единичных показателей качества продукции приводит к изменению упорядочения изделий по средневзвешенному показателю.
  • Вероятностные модели бинарных отношений.
  • Вероятностные модели парных сравнений.
  • Средние и законы больших чисел в пространстве упорядочений.
  • Непараметрические оценки плотности в непрерывных и дискретных пространствах.
  • Страницы:

    5.1. Модели порождения данных

    Детерминированный и модельно-вероятностный подходы. В прикладной статистике есть два подхода к исходным данным - детерминированный и модельно-вероятностный. В первом из них данные рассматриваются сами по себе, без попыток связать их с какой-либо более общей ситуацией. Например, при анализе данных о производственной деятельности конкретного предприятия за конкретный период времени подсчитывается процент брака по конкретным технологическим процессам, число работников на различных должностях, объем реализованной продукции по месяцам. К этой же категории данных относятся различные виды отчетности - бухгалтерская, налоговая, статистическая (для органов Росстата). Преимуществом детерминированного подхода является отсутствие каких-либо дополнительных предположений о данных. Недостаток состоит в невозможности обоснованного переноса выводов с конкретной ситуации на другие, ей аналогичные. Например, на другие периоды времени или на другие предприятия. При детерминированном подходе невозможно также оценить погрешность рассчитанных характеристик.

    Чтобы выйти за пределы конкретной ситуации, необходимо использовать модельно-вероятностный подход, согласно которому основой алгоритмов расчетов является вероятностная модель порождения данных. При этом конкретные данные рассматриваются как реализации случайных величин, векторов, более общо - случайных элементов, т.е. как значения задающих их функций, определенных на вероятностном пространстве, в конкретной точке (элементарном событии $$\omega$$ ).

    Наиболее распространенная вероятностная модель порождения данных - это модель случайной выборки. Согласно этой модели данные $$x_1, x_2, ... , x_n$$ рассматриваются как реализации независимых одинаково распределенных случайных элементов (величин, векторов, множеств и других объектов нечисловой природы) $$X_1 = X_1(\omega), X_2 = X_2(\omega), ..., X_n = X_n(\omega)$$, т.е. $$x_1= X_1(\omega_0), x_2 = X_2(\omega_0), ..., x_n = X_n(\omega_0)$$ при некотором $$\omega_0$$ из пространства элементарных событий $$\Omega$$. Модель выборки обычно используется для описания результатов независимых наблюдений, измерений, анализов, опытов.

    В некоторых случаях используют более специальные модели порождения данных. Например, при проведении испытаний на надежность используют план испытаний, согласно которому испытания прекращаются через время $$T$$. Это значит, что фиксируются только моменты отказа изделий, которые произошли до момента $$T$$. Пусть $$x_1, x_2, ..., x_n$$ - наработки на отказ $$n$$ изделий. Статистику доступны только значения $$y_1, y_2, ..., y_n$$, где $$y_j = x_j$$ при $$x_j<T$$ и $$y_j=T$$ при $$x_j\ge T$$. Такая выборка, в которой часть описывающих реальное явление случайных величин заменена на граничное значение, называется цензурированной. Иногда используются и более сложные модели порождения данных. Например, если аппаратурой не фиксируются значения, меньшие некоторого порога, то выборка не только цензурирована, но и состоит из случайного числа элементов. Бывают и процедуры, когда минимальный и максимальный элементы выборки отбрасываются, а остальные предоставляются статистику, и т.д.

    Параметрические и непараметрические модели случайной выборки. Рассмотрим ситуацию, когда элементы выборки - числа. Модель описывается функцией распределения элементов выборки. Можно ли что-либо сказать об этой функции?

    В учебных курсах по теории вероятностей и математической статистике обычно рассматривают различные параметрические семейства распределений числовых случайных величин. А именно - изучают семейства нормальных распределений, логарифмически нормальных, экспоненциальных, гамма-распределений, распределений Вейбулла-Гнеденко и др. Все они зависят от одного, двух или трех параметров. Поэтому для полного описания распределения достаточно знать или оценить одно, два или три числа. Очень удобно. Поэтому широко развита и представлена в литературе параметрическая теория математической статистики, в которой предполагается, что распределения результатов наблюдений принадлежат тем или иным параметрическим семействам.

    К сожалению, параметрические семейства существуют лишь в головах авторов учебников по теории вероятностей и математической статистике. В реальной жизни их нет. Поэтому прикладная статистика использует в основном непараметрические методы, в которых распределения результатов наблюдений могут иметь произвольный вид. В настоящем подразделе на примере нормального распределения подробно обсудим невозможность практического использования параметрических семейств для описания распределений конкретных данных.

    В лекции 7 разобраны параметрические методы отбраковки резко выделяющихся наблюдений и продемонстрирована невозможность практического использования ряда методов параметрической статистики, ошибочность выводов, к которым они приводят. В лекции 8 рассмотрены непараметрические методы доверительного оценивания основных характеристик числовых случайных величин - математического ожидания, медианы, дисперсии, среднего квадратического отклонения, коэффициента вариации.

    К настоящему времени непараметрические методы полностью покрывают область задач, которые ранее решались с помощью параметрической статистики. Поэтому можно порекомендовать использовать только непараметрическую статистику. Однако в литературе много внимания уделяется параметрическим методам, поэтому игнорировать в настоящем учебнике параметрическую статистику было признано нецелесообразным.

    Часто ли распределение результатов наблюдений является нормальным? В эконометрических и экономико-математических моделях, применяемых, в частности, при изучении и оптимизации процессов маркетинга и менеджмента в целом, управления предприятием и регионом, точности и стабильности технологических процессов, в задачах надежности, обеспечения безопасности, в том числе экологической, функционирования технических устройств и объектов, разработки организационных схем часто применяют понятия и результаты теории вероятностей и математической статистики. При этом зачастую используют те или иные параметрические семейства распределений вероятностей. Наиболее популярно нормальное распределение. Используют также логарифмически нормальное распределение, экспоненциальное распределение, гамма-распределение, распределение Вейбулла-Гнеденко и т.д.

    Очевидно, всегда необходимо проверять соответствие моделей реальности. Возникают два вопроса. Отличаются ли реальные распределения от используемых в модели? Насколько это отличие влияет на выводы?

    Ниже на примере нормального распределения показано, что реальные распределения практически всегда отличаются от включенных в классические параметрические семейства. Имеющиеся отклонения от заданных семейств делают неверными выводы, основанные на использовании этих семейств. Например, выводы об отбраковке резко отличающихся наблюдений (выбросов).

    Есть ли основания априори предполагать нормальность результатов измерений?

    Иногда утверждают, что в случае, когда погрешность измерения (или иная случайная величина) определяется в результате совокупного действия многих малых факторов, то в силу центральной предельной теоремы (ЦПТ) теории вероятностей эта величина хорошо приближается (по распределению) нормальной случайной величиной. Такое утверждение справедливо, если малые факторы действуют аддитивно и независимо друг от друга. Если же они действуют мультипликативно, то в силу той же ЦПТ аппроксимировать надо логарифмически нормальным распределением. В прикладных задачах обосновать аддитивность, а не мультипликативность действия малых факторов обычно не удается. Если же зависимость имеет общий характер, не приводится к аддитивному или мультипликативному виду, а также нет оснований принимать модели, дающие экспоненциальное, Вейбулла-Гнеденко, гамма или иные распределения, то о распределении итоговой случайной величины практически ничего не известно, кроме внутриматематических свойств типа регулярности.

    Экспериментальное изучение распределений погрешностей. При обработке конкретных данных иногда считают, что погрешности измерений имеют нормальное распределение. На предположении нормальности построены классические модели регрессионного, дисперсионного, факторного анализов, метрологические модели, которые еще продолжают встречаться как в отечественной ноpмативно-технической документации, так и в международных стандартах. На то же предположение опираются модели расчетов максимально достигаемых уровней тех или иных характеристик, применяемые при проектировании систем обеспечения безопасности функционирования экономических структур, технических устройств и объектов. Однако теоретических оснований для такого предположения нет. Необходимо экспериментально изучать распределения погрешностей.

    Что же показывают результаты экспериментов? Сводка, данная в монографии [], позволяет утверждать, что в большинстве случаев распределение погрешностей измерений отличается от нормального. Так, в Машинно-электротехническом институте (г. Варна в Болгарии) было исследовано распределение погрешностей градуировки шкал аналоговых электроизмерительных приборов. Изучались приборы, изготовленные в Чехословакии, СССР и Болгарии. Закон распределения погрешностей оказался одним и тем же. Он имеет плотность$$f(x)=0,534\exp(1-|x|^7).$$

    Были проанализированы данные о параметрах 219 фактических распределений погрешностей, исследованных разными авторами, при измерении как электрических, так и не электрических величин самыми разнообразными (электрическими) приборами. В результате этого исследования оказалось, что 111 распределений, т.е. примерно 50%, принадлежат классу распределений с плотностью$$f(x;\alpha,b.\sigma)=\frac{\alpha}{2\lambda\sigma\Gamma(1/\alpha)}\exp \left( -|\frac{x-b}{\lambda\sigma}|^{\alpha} \right),$$ где $$\alpha$$ - параметр степени (формы); $$b$$ - параметр сдвига; $$\sigma$$ - параметр масштаба; $$\Gamma(\beta)$$ - гамма-функция от аргумента $$\beta$$ ;$$\lambda=\sqrt{\frac{\Gamma(1/\alpha)}{\Gamma(3/\alpha)}}$$ (см. [, с.56]); 63 распределения, т.е. 30%, имеют плотности с плоской вершиной и пологими длинными спадами и не могут быть описаны как нормальные или, например, экспоненциальные. Оставшиеся 45 распределений оказались двухмодальными.

    В книге известного метролога проф. П. В. Новицкого [] приведены результаты исследования законов распределения различного рода погрешностей измерения. Он изучил распределения погрешностей электромеханических приборов на кернах, электронных приборов для измерения температур и усилий, цифровых приборов с ручным уравновешиванием. Объем выборок экспериментальных данных для каждого экземпляра составлял 100-400 отсчетов. Оказалось, что 46 из 47 распределений значимо отличались от нормального. Исследована форма распределения погрешностей у 25 экземпляров цифровых вольтметров Щ-1411 в 10 точках диапазона. Результаты аналогичны. Дальнейшие сведения содержатся в монографии [].

    В лаборатории прикладной математики Тартуского государственного университета проанализировано 2500 выборок из архива реальных статистических данных. В 92% случаев гипотезу нормальности пришлось отвергнуть.

    Приведенные описания экспериментальных данных показывают, что погрешности измерений в большинстве случаев имеют распределения, отличные от нормальных. Это означает, в частности, что большинство применений критерия Стьюдента, классического регрессионного анализа и других статистических методов, основанных на нормальной теории, строго говоря, не является обоснованным, поскольку неверна лежащая в их основе аксиома нормальности распределений соответствующих случайных величин.

    Очевидно, для оправдания или обоснованного изменения существующей практики анализа статистических данных требуется изучить свойства процедур анализа данных при "незаконном" применении. Изучение процедур отбраковки показало, что они крайне неустойчивы к отклонениям от нормальности, а потому применять их для обработки реальных данных нецелесообразно (см. лекцию 7); поэтому нельзя утверждать, что произвольно взятая процедура устойчива к отклонениям от нормальности.

    Иногда предлагают перед применением, например, критерия Стьюдента однородности двух выборок проверять нормальность. Хотя для этого имеется много критериев, но проверка нормальности - более сложная и трудоемкая статистическая процедура, чем проверка однородности (как с помощью статистик типа Стьюдента, так и с помощью непараметрических критериев). Для достаточно надежного установления нормальности требуется весьма большое число наблюдений. Так, чтобы гарантировать, что функция распределения результатов наблюдений отличается от некоторой нормальной не более, чем на 0,01 (при любом значении аргумента), требуется порядка 2500 наблюдений. В большинстве экономических, технических, медико-биологических и других прикладных исследований число наблюдений существенно меньше. Особенно это справедливо для данных, используемых при изучении проблем, связанных с обеспечением безопасности функционирования экономических структур и технических объектов.

    ЦПТ и нормальность. Иногда пытаются использовать ЦПТ для приближения распределения погрешности к нормальному, включая в технологическую схему измерительного прибора специальные сумматоры. Оценим полезность этой меры. Пусть $$Z_1,Z_2,...,Z_k$$ - независимые одинаково распределенные случайные величины с функцией распределения $$H=H(x)$$ такие, что $$M(Z_1)=0,D(Z_1)=1,M|Z_1|^3=\rho<+\infty$$. Рассмотрим$$w=\frac{Z_1,Z_2,...,Z_k}{\sqrt{k}}.$$

    Показателем обеспечиваемой сумматором близости к нормальности является$$C=\sup_H\sup_x|P(w<x)-\Phi(x)|.$$ Тогда$$0,3989\frac{\rho}{\sqrt{k}}\le C\le 0,7975\frac{\rho}{\sqrt{k}}.$$

    Правое неравенство в последнем соотношении вытекает из оценок константы в неравенстве Берри-Эссеена, полученном в книге [ $$1$$, с.172], а левое - из примера в монографии [ $$23$$, с.140-141]. Для нормального закона $$\rho=1,6$$, для равномерного $$\rho=1,3$$, для двухточечного $$\rho=1$$ (это - нижняя граница для $$\rho$$ ). Следовательно, для обеспечения расстояния (в метрике Колмогорова) до нормального распределения не более 0,01 для "неудачных" распределений необходимо не менее $$k_0$$ слагаемых, где$$0,4\sqrt{k_0}<0,01, k_0>1600.$$

    В обычно используемых сумматорах слагаемых значительно меньше.

    Сужая класс возможных распределений $$H$$, можно получить, как показано в монографии [], более быструю сходимость, но теория здесь еще не смыкается с практикой. Кроме того, не ясно, обеспечивает ли близость распределения к нормальному (в определенной метрике) также и близость распределений статистик. Речь идет о сравнении распределения статистики, построенной по случайным величинам, полученным суммированием, к распределению статистики, соответствующей нормальным результатам наблюдений. Видимо, для каждой конкретной статистики необходимы специальные теоретические исследования. Именно к такому выводу приходит автор монографии []. В задачах отбраковки выбросов ответ: "не обеспечивает" (см. ниже).

    Отметим, что результат любого реального измерения записывается с помощью конечного числа десятичных знаков, обычно небольшого (2-5), так что любые реальные данные целесообразно моделировать лишь с помощью дискретных случайных величин, принимающих сравнительно небольшое число значений. Нормальное распределение - лишь аппроксимация реального распределения. Так, например, данные конкретного исследования, приведенные в работе [], принимают значения от 1,0 до 2,2, т.е. всего 13 возможных значений. Из принципа Дирихле следует, что в какой-то точке построенная по данным работы [] функция распределения отличается от ближайшей функции нормального распределения не менее чем на 1/26, т.е. на 0,04. Кроме того, очевидно, что для нормального распределения случайной величины вероятность попасть в дискретное множество десятичных чисел с заданным числом знаков после запятой равна 0.

    Из сказанного выше следует, что результаты измерений и вообще статистические данные имеют свойства, приводящие к тому, что моделировать их следует случайными величинами с распределениями, более или менее отличными от нормальных. В большинстве случаев распределения существенно отличаются от нормальных. В других ситуациях нормальные распределения могут, видимо, рассматриваться как некоторая аппроксимация. Но никогда нет полного совпадения. Отсюда вытекает необходимость изучения свойств классических статистических процедур в неклассических вероятностных моделях (подобно тому, как это сделано в лекции 8 для критерия Стьюдента). А также целесообразность разработки устойчивых (учитывающих наличие отклонений от нормальности) и непараметрических, в том числе свободных от распределения процедур, их широкого внедрения в практику статистической обработки данных.

    Опущенные здесь рассмотрения для других параметрических семейств приводят к аналогичным выводам. Итог можно сформулировать так. Распределения реальных данных практически никогда не входят в какое-либо конкретное параметрическое семейство. Реальные распределения всегда отличаются от тех, которые включены в параметрические семейства. Отличия могут быть большими или меньшими, но они всегда есть.

    5.2. Таблицы и выборочные характеристики

    Исходные статистические данные могут быть достаточно обширными. В качестве примера приведем результаты экспертного опроса, проведенного Институтом высоких статистических технологий и эконометрики в 1994 г. (табл.5.1). В первом столбце приведены номера экспертов, в остальных четырех - четыре прогнозных значения, полученных от каждого эксперта. Отметим, что эксперт № 28 не ответил на вопрос об инфляции. В таблицах реальных данных приходится сталкиваться с пропусками.

    Описание данных - это первичное сжатие информации с целью сделать ее более обозримой, легкой для восприятия. Самый древний способ - это составление различных таблиц, вторичных по отношению к таблицам исходных данных.

    Прогнозы экспертов на 8 декабря 1994 г. (сделаны 19.10.1994)
    № п/п Курс доллара США, руб. Инфляция (%) за период прогноза Цена батона белого хлеба, руб. Цена 1 л молока, руб.
    1 4185 4,0 800 1305
    2 4270 2,8 1028 1322
    3 3200 17,0 760 755
    4 4000 16,0 950 1000
    5 3500 16,0 820 800
    6 3800 5,0 1000 1000
    7 3500 3,5 500 1500
    8 3300 62,0 800 780
    9 4100 54,0 900 899
    10 3560 10,0 870 1050
    11 4000 54,0 1000 1000
    12 5200 54,0 1500 1500
    13 4000 9,0 830 1300
    14 6000 54,0 2000 2000
    15 4000 40,0 950 1200
    16 3400 13,0 750 900
    17 3500 15,0 1000 1250
    18 4200 2,5 1000 1500
    19 3560 200,0 940 1200
    20 4300 6,0 950 1570
    21 4000 3,0 1000 1100
    22 4500 12,0 950 1100
    23 4200 11,0 890 1100
    24 3900 54,0 1000 1000
    25 5500 62,0 1000 1400
    26 5000 73,0 1000 1200
    27 5600 54,0 1200 2000
    28 3900 - 1500 1400
    29 4200 38,0 950 1100
    30 3680 38,0 850 1100
    31 4000 2,0 840 1100
    32 4600 46,0 1000 1100
    33 4560 92,0 1300 1400

    Например, рассмотрим последний столбец табл.5.1. Для лучшего восприятия прогнозов экспертов о цене 1 л молока сгруппируем данные по интервалам, как это сделано в табл.5.2.

    Прогнозируемая цена молока
    № п/п Интервал, руб. Число ответов
    1 700-799 2
    2 800-899 2
    3 900-999 1
    4 1000-1099 5
    5 1100-1199 7
    6 1200-1299 4
    7 1300-1399 3
    8 1400-1499 3
    9 1500-1599 4
    10 2000 2
    Всего 33

    Группировка данных в табл.5.2 по 10 интервалам может показаться слишком дробной. Нетрудно объединить градации и получить следующее (см. табл.5.3).

    Прогнозируемая цена молока (крупные градации)
    № п/п Интервал, руб. Число ответов
    1 700-999 5
    2 1000-1299 16
    3 1300-1599 10
    4 2000 2
    5 Всего 33

    Сколько использовать градаций (т.е. строк в таблице)? Общих рекомендаций дать нельзя. Ответ зависит от цели статистического исследования, от структуры конкретных данных.

    Табличный материал может быть выражен в виде различных диаграмм, в том числе круговых и столбчатых. Несколько десятков лет назад были популярны гистограммы - столбчатые диаграммы, для которых интервалы группирования имеют одинаковую длину.

    В настоящее время гистограммы рассматривают как устаревшие инструменты статистического анализа. Для описания массива данных рекомендуется использовать вариационные ряды, эмпирические функции распределения (см. лекцию 2) и - особенно настоятельно - непараметрические оценки плотности (см. п.5.6). Кроме того, целесообразно рассчитывать и приводить в документации в разделе "Описание данных" выборочные характеристики:

  • выборочное среднее арифметическое;
  • выборочную дисперсию;
  • выборочное среднее квадратическое отклонение;
  • коэффициент вариации;
  • медиану;
  • минимум (первый член вариационного ряда);
  • максимум (последний член вариационного ряда);
  • размах;
  • моду и амплитуду моды;
  • верхний квартиль;
  • нижний квартиль;
  • межквартильное расстояние.
  • Определения всех этих выборочных характеристик даны выше в лекции 2. В настоящем подразделе сведены вместе наиболее распространенные приемы описания числовых данных.

    5.3. Шкалы измерения, инвариантные алгоритмы и средние величины

    Инвариантные алгоритмы и средние величины. Основное требование к алгоритмам анализа данных формулируется в теории измерений (см. лекцию 1) так: выводы, сделанные на основе данных, измеренных в шкале определенного типа, не должны меняться при допустимом преобразовании шкалы измерения этих данных. Другими словами, выводы должны быть инвариантны по отношению к допустимым преобразованиям шкалы.

    Таким образом, одна из основных целей теории измерений - борьба с субъективизмом исследователя при приписывании численных значений реальным объектам. Так, расстояния можно измерять в аршинах, метрах, микронах, милях, парсеках и других единицах измерения. Массу (вес) - в пудах, килограммах, фунтах и др. Цены на товары и услуги можно указывать в юанях, рублях, тенге, гривнах, латах, кронах, марках, долларах США и других валютах (при фиксированных курсах пересчета). Подчеркнем очень важное, хотя и вполне очевидное обстоятельство: выбор единиц измерения зависит от исследователя, т.е. субъективен. Статистические выводы могут быть адекватны реальности только тогда, когда они не зависят от того, какую единицу измерения предпочтет исследователь, т.е. когда они инвариантны относительно допустимого преобразования шкалы.

    Оказывается, сформулированное условие является достаточно сильным. Из многих алгоритмов анализа статистических данных ему удовлетворяют лишь некоторые. Покажем это на примере сравнения средних величин.

    Пусть $$X_1,X_2,...,X_n$$ - выборка объема $$n$$. Часто используют среднее арифметическое$$X_{cp}=\frac{X_1,X_2,...,X_n}{n}.$$ Использование среднего арифметического настолько привычно, что второе слово в термине часто опускают. И говорят о средней заработной плате, среднем доходе и других средних для конкретных экономических данных, подразумевая под "средним" среднее арифметическое. Такая традиция может приводить к ошибочным выводам. Покажем это на примере расчета средней заработной платы (среднего дохода) работников условного предприятия (табл.5.4).

    Численность работников различных категорий, их заработная плата и суммарные доходы (в усл. ед.)
    № п/п Категория работников Число работников Заработная плата Суммарные доходы
    1 Низкоквалифицированные рабочие 40 100 4000
    2 Высококвалифицированные рабочие 30 200 6000
    3 Инженеры и служащие 25 300 7500
    4 Менеджеры 4 1000 4000
    5 Генеральный директор (владелец) 1 18500 18500
    6 Всего 100 40000

    Первые три строки в табл.5.4 вряд ли требуют пояснений. Менеджеры - это директора по направлениям, а именно по производству (главный инженер), по финансам, по маркетингу и сбыту, по персоналу (по кадрам). Владелец сам руководит предприятием в качестве генерального директора. В столбце "заработная плата" указаны доходы одного работника соответствующей категории, а в столбце "суммарные доходы" - доходы всех работников соответствующей категории.

    Фонд оплаты труда составляет 40000 единиц, работников всего 100, следовательно, средняя заработная плата составляет 40000/100 = 400 единиц. Однако эта средняя арифметическая величина явно не соответствует интуитивному представлению о "средней заработной плате". Из 100 работников лишь 5 имеют заработную плату, ее превышающую, а зарплата остальных 95 существенно меньше средней арифметической. Причина очевидна: заработная плата одного человека - генерального директора - превышает заработную плату 95 работников - низкоквалифицированных и высококвалифицированных рабочих, инженеров и служащих.

    Ситуация напоминает описанную в известном рассказе о больнице, в которой 10 больных, из них у 9 температура 40 $$\deg$$ С, а один уже отмучился, лежит в морге с температурой 0 $$\deg$$ С. Между тем средняя температура по больнице равна 36 $$\deg$$ С - лучше не бывает!

    Сказанное показывает, что среднее арифметическое можно использовать лишь для достаточно однородных совокупностей (без больших выбросов в ту или иную сторону). А какие средние целесообразно использовать для описания заработной платы? Вполне естественно использовать медиану. Для данных табл.5.4 медиана - среднее арифметическое зарплат 50-го и 51-го работника, если заработные платы всех 100 работников расположены в порядке неубывания. Сначала идут заработные платы 40 низкоквалифицированных рабочих, а затем - с 41-го до 70-го работника - заработные платы высококвалифицированных рабочих. Следовательно, медиана попадает именно на них и равна 200. У 50-ти работников заработная плата не превосходит 200, и у 50-ти - не менее 200, поэтому медиана показывает "центр", около которого группируется основная масса исследуемых величин. Еще одна средняя величина - мода, наиболее часто встречающееся значение. В рассматриваемом случае это заработная плата низкоквалифицированных рабочих, т.е. 100. Таким образом, для описания заработной платы имеем три средние величины - моду (100 ед.), медиану (200 ед.) и среднее арифметическое (400 ед.). Для наблюдающихся в реальной жизни распределений доходов и заработной платы справедлива та же закономерность: мода меньше медианы, а медиана меньше среднего арифметического.

    Для чего в технических, экономических, медицинских и иных исследованиях используются средние величины? Обычно для того, чтобы заменить совокупность чисел одним числом, чтобы сравнивать совокупности с помощью средних.

    Пусть, например, $$Y_1,Y_2,...,Y_n$$ - совокупность оценок экспертов, "выставленных" одному объекту экспертизы (например, одному из вариантов стратегического развития фирмы), $$Z_1,Z_2,...,Z_n$$ - второму (другому варианту такого развития). Как сравнивать эти совокупности? Очевидно, самый простой способ - по средним значениям.

    А как вычислять средние? Известны различные виды средних величин: среднее арифметическое, медиана, мода, среднее геометрическое, среднее гармоническое, среднее квадратическое. Напомним, что общее понятие средней величины введено французским математиком первой половины ХIХ в. академиком О. Коши. Оно таково: средней величиной является любая функция $$f(X_1,X_2,...,X_n)$$ такая, что при всех возможных значениях аргументов значение этой функции не меньше, чем минимальное из чисел $$(X_1,X_2,...,X_n)$$, и не больше, чем максимальное из этих чисел. Все перечисленные выше виды средних являются средними по Коши.

    При допустимом преобразовании шкалы значение средней величины, очевидно, меняется. Но выводы о том, для какой совокупности среднее больше, а для какой - меньше, не должны меняться (в соответствии с требованием инвариантности выводов, принятом как основное требование в теории измерений). Сформулируем соответствующую математическую задачу поиска вида средних величин, результат сравнения которых устойчив относительно допустимых преобразований шкалы.

    Пусть $$f(X_1,X_2,...,X_n)$$ - среднее по Коши. Пусть среднее по первой совокупности меньше среднего по второй совокупности:$$f(Y_1,Y_2,...,Y_n)<f(Z_1,Z_2,...,Z_n).$$

    Тогда согласно теории измерений для устойчивости результата сравнения средних необходимо, чтобы для любого допустимого преобразования $$g$$ из группы допустимых преобразований в соответствующей шкале было справедливо также неравенство$$f(g(Y_1),g(Y_2),...,g(Y_n))<f(g(Z_1),g(Z_2),...,g(Z_n)),$$ т.е. среднее преобразованных значений из первой совокупности также было меньше среднего преобразованных значений для второй совокупности. Причем сформулированное условие должно быть верно для любых двух совокупностей $$Y_1,Y_2,...,Y_n$$ и $$Z_1,Z_2,...,Z_n$$. И, напомним, для любого допустимого преобразования. Средние величины, удовлетворяющие сформулированному условию, назовем допустимыми (в соответствующей шкале). Согласно теории измерений только такими средними можно пользоваться при анализе мнений экспертов и иных данных, измеренных в рассматриваемой шкале.

    С помощью математической теории, развитой в монографии [], удается описать вид допустимых средних в основных шкалах. Сразу ясно, что для данных, измеренных в шкале наименований, в качестве среднего годится только мода.

    Средние величины в порядковой шкале. Рассмотрим обработку, для определенности, мнений экспертов, измеренных в порядковой шкале. Справедливо следующее утверждение.

    Теорема 1. Из всех средних по Коши допустимыми средними в порядковой шкале являются только члены вариационного ряда (порядковые статистики).

    Теорема 1 справедлива при условии, что среднее $$f(X_1,X_2,...,X_n)$$ является непрерывной (по совокупности переменных) и симметрической функцией. Последнее означает, что при перестановке аргументов значение функции $$f(X_1,X_2,...,X_n)$$ не меняется. Это условие является вполне естественным, ибо среднюю величину мы находим для совокупности (множества), а не для последовательности. Множество не меняется в зависимости от того, в какой последовательности мы перечисляем его элементы.

    Согласно теореме 1 в качестве среднего для данных, измеренных в порядковой шкале, можно использовать, в частности, медиану (при нечетном объеме выборки). При четном же объеме следует применять один из двух центральных членов вариационного ряда - как их иногда называют, левую медиану или правую медиану. Моду тоже можно использовать - она всегда является членом вариационного ряда. Но никогда нельзя рассчитывать среднее арифметическое, среднее геометрическое и т.д.

    Приведем численный пример, показывающий некорректность использования среднего арифметического $$f(X_1, X_2)=(X_1+X_2)/2$$ в порядковой шкале. Пусть $$Y_1=1, Y_2=11, Z_1=6, Z_2=8$$. Тогда $$f(Y_1, Y_2)=6$$, что меньше, чем $$f(Z_1,Z_2)=7$$. Пусть строго возрастающее преобразование $$g$$ таково, что $$g(1)=1, g(6)=6, g(8)=8, g(11)=99$$. Таких преобразований много. Например, можно положить $$g(x)=x$$ при $$x$$, не превосходящих 8, и $$g(x)=99(x-8)/3+8$$ для $$x$$, больших 8. Тогда $$(g(Y_1),g(Y_2))=50$$, что больше, чем $$f(g(Z_1),g(Z_2))=7$$. Как видим, в результате допустимого, т.е. строго возрастающего преобразования шкалы упорядоченность средних величин изменилась.

    Таким образом, теория измерений выносит жесткий приговор среднему арифметическому - использовать его в порядковой шкале нельзя. Однако же те, кто не знает теории измерений, используют его. Всегда ли они ошибаются? Оказывается, можно в какой-то мере реабилитировать среднее арифметическое, если перейти к вероятностной постановке и к тому же удовлетвориться результатами для больших объемов выборок. В монографии [] получено также следующее утверждение.

    Теорема 2. Пусть $$Y_1,Y_2,...,Y_m$$ - независимые одинаково распределенные случайные величины с функцией распределения $$F(x)$$, а $$Z_1,Z_2,...,Z_n$$ - независимые одинаково распределенные случайные величины с функцией распределения $$H(x)$$, причем выборки $$Y_1,Y_2,...,Y_m$$ и $$Z_1,Z_2,...,Z_n$$ независимы между собой и $$MY_1>MZ_1$$. Для того, чтобы вероятность события$$\left\{ \omega: \frac{g(Y_1)+g(Y_2)+...+g(Y_m)}{m}> \frac{g(Z_1)+g(Z_2)+...+g(Z_n)}{n} \right\}$$ стремилась к 1 при $$\min(m,n)\rightarrow\infty$$ для любой строго возрастающей непрерывной функции $$g$$, удовлетворяющей условию$$\overline{\lim_{|x|\rightarrow\infty}} \left| \frac{g(x)}{x} \right| <\infty,$$ необходимо и достаточно, чтобы при всех $$x$$ выполнялось неравенство $$F(x)\le H(x)$$, причем существовало число $$x_0$$, для которого $$F(x_0)<H(x_0)$$.

    Примечание. Условие с верхним пределом носит чисто внутриматематический характер. Фактически функция $$g$$ - произвольное допустимое преобразование в порядковой шкале.

    Согласно теореме 2 средним арифметическим можно пользоваться и в порядковой шкале, если сравниваются выборки из двух распределений, удовлетворяющих приведенному в теореме неравенству. Проще говоря, одна из функций распределения должна всегда лежать над другой. Функции распределения не могут пересекаться, им разрешается только касаться друг друга. Это условие выполнено, например, если функции распределения отличаются только сдвигом, т.е.$$F(x) = H(x+b)$$ при некотором $$b$$. Последнее условие выполняется, если два значения некоторой величины измеряются с помощью одного и того же средства измерения, у которого распределение погрешностей не меняется при переходе от измерения одного значения рассматриваемой величины к измерению другого.

    Средние по Колмогорову. Естественная система аксиом (требований к средним величинам) приводит к так называемым ассоциативным средним. Их общий вид нашел в 1930 г. А.Н.Колмогоров []. Теперь их называют "средними по Колмогорову". Они являются обобщением нескольких из перечисленных выше средних.

    Для чисел $$X_1,X_2,...,X_n$$ среднее по Колмогорову вычисляется по формуле$$G\{(F(X_1)+F(X_2)+...+F(X_n))/n\},$$ где $$F$$ - строго монотонная функция (т.е. строго возрастающая или строго убывающая), $$G$$ - функция, обратная к $$F$$. Среди средних по Колмогорову - много хорошо известных персонажей. Так, если $$F(x)=x$$, то среднее по Колмогорову - это среднее арифметическое, если $$F(x)=\ln x$$ - среднее геометрическое, если $$F(x)=1/x$$ - среднее гармоническое, если $$F(x)=x^2$$ - среднее квадратическое, и т.д. (в последних трех случаях усредняются положительные величины). Среднее по Колмогорову - частный случай среднего по Коши. С другой стороны, такие популярные средние, как медиана и мода, нельзя представить в виде средних по Колмогорову. В монографии [] доказаны следующие утверждения.

    Теорема 3. При справедливости некоторых внутриматематических условий регулярности в шкале интервалов из всех средних по Колмогорову допустимым является только среднее арифметическое.

    Таким образом, среднее геометрическое или среднее квадратическое температур (в шкале Цельсия), потенциальных энергий или координат точек не имеют смысла. В качестве среднего надо применять среднее арифметическое. А также можно использовать медиану или моду.

    Теорема 4. При справедливости некоторых внутриматематических условий регулярности в шкале отношений из всех средних по Колмогорову допустимыми являются только степенные средние с $$F(x)=x^c, c\ne 0$$ и среднее геометрическое.

    Замечание. Среднее геометрическое является пределом степенных средних при $$c\to 0$$.

    Есть ли средние по Колмогорову, которыми нельзя пользоваться в шкале отношений? Конечно, есть. Например, с $$F(x)=e^x$$.

    Аналогично средним величинам могут быть изучены и другие статистические характеристики - показатели разброса, связи, расстояния и др. (см., например, []). Нетрудно показать, например, что коэффициент корреляции не меняется при любом допустимом преобразовании в шкале интервалов, как и отношение дисперсий. Дисперсия не меняется в шкале разностей, коэффициент вариации - в шкале отношений, и т.д.

    Приведенные выше результаты о средних величинах широко применяются, причем не только в экономике, менеджменте, теории экспертных оценок или социологии, но и в инженерном деле, например, для анализа методов агрегирования датчиков в АСУ ТП доменных печей. Велико прикладное значение теории измерений в задачах стандартизации и управления качеством, в частности, в квалиметрии. Здесь есть и интересные теоретические результаты. Так, например, любое изменение коэффициентов весомости единичных показателей качества продукции приводит к изменению упорядочения изделий по средневзвешенному показателю (эта теорема доказана проф. В.В. Подиновским).

    При подготовке и принятии решений необходимо использовать только инвариантные алгоритмы обработки данных. В настоящем подразделе показано, что требование инвариантности выделяет из многих алгоритмов усреднения лишь некоторые, соответствующие используемым шкалам измерения. Инвариантные алгоритмы в общем случае рассматриваются в математической теории измерений []. Нацеленное на прикладные исследования изложение теории измерений дается в монографиях [, ].

    5.4. Вероятностные модели порождения нечисловых данных

    Рассмотрим основные вероятностные модели порождения нечисловых данных. А именно, дихотомических данных, результатов парных сравнений, бинарных отношений, рангов, объектов общей природы. Обсудим различные варианты вероятностных моделей и их практическое использование (см. также обзор []).

    ] - люсиан ), т.е. конечную последовательность $$X=(X_1,X_2,...,X_n)$$ независимых испытаний Бернулли $$X_i$$, для которых $$P(X_i=1)=p_i$$ и $$P(X_i=0)=p_i, i=1.2....,k$$ причем вероятности $$p_i$$ могут быть различны.

    Бернуллиевские векторы часто применяются при практическом использовании эконометрических методов. Так, они использованы в монографии [] для описания равномерно распределенных случайных толерантностей. Как известно, толерантность на множестве из $$m$$ элементов можно задать симметричной матрицей $$||\delta_{ij}||$$ из 0 и 1, на главной диагонали которой стоят 1. Тогда случайная толерантность описывается распределением $$m(m-1)/2$$ дихотомических случайных величин $$\delta_{ij}, 1\le i<j\le m$$, а для равномерно распределенной (на множестве всех толерантностей) толерантности эти случайные величины, как можно доказать, оказываются независимыми и принимают значения 0 и 1 с равными вероятностями 1/2. Записав элементы $$\delta_{ij}$$ задающей такую толерантность матрицы в строку, получим бернуллиевский вектор с $$k=m(m-1)/2$$ и $$p_i=1/2, i=1,2,...,k$$.

    В связи с оцениванием по статистическим данным функции принадлежности нечеткой толерантности в 1970-е годы была построена теория случайных толерантностей с такими независимыми $$\delta_{ij}$$, что вероятности $$P(\delta_{ij}=1)=p_{ij}$$ произвольны []. Случайные множества с независимыми элементами использовались как общий язык для описания парных сравнений и случайных толерантностей. В некоторых публикациях термин "люсиан" применялся как сокращение для выражения "случайные множества с независимыми элементами".

    Был выявлен ряд областей, в которых полезен математический аппарат решения различных статистических задач, связанных с бернуллиевскими векторами. Перечислим эти области, включая ранее названные: анализ случайных толерантностей; случайные множества с независимыми элементами; обработка результатов независимых парных сравнений; статистические методы анализа точности и стабильности технологического процесса, а также анализ и синтез планов статистического приемочного контроля (по альтернативным, т.е. дихотомическим, признакам); обработка маркетинговых и социологических анкет (с закрытыми вопросами типа "да" - "нет"); обработка социально-психологических и медицинских данных, в частности, ответов на психологические тесты типа MMPI (используемых в задачах управления персоналом), топографических карт (применяемых для анализа и прогноза зон поражения при заболеваниях, технологических авариях, распространении коррозии, распространении экологически вредных загрязнений в других ситуациях) и т.д.

    Теорию бернуллиевских векторов можно выразить в терминах любой из этих теоретических и прикладных областей. Однако терминология одной из этих областей "режет слух" и приводит к недоразумениям в другой из них. Поэтому целесообразно использовать термин "бернуллиевский вектор" в указанном выше значении, не связанном ни с какой из перечисленных областей приложения этой теории (в ряде публикаций в том же значении использовался термин "люсиан").

    Распределение бернуллиевского вектора $$X$$ полностью описывается вектором $$P=(p_1,p_2,...,p_k)$$, т.е. нечетким подмножеством множества $$\{1,2,...,k\}$$. Действительно, для любого детерминированного вектора $$x=(x_1,x_2,...,x_k)$$ из 0 и 1 имеем$$P(X=x)=\Pi_{1\le j\le k}h(x_j,p_j),$$ где $$h(x,p)=p$$ при $$х=1$$ и $$h(х,p)=1-p$$ при $$х=0$$.

    Теперь можно уточнить способы использования люсианов в прикладной статистике. Бернуллиевскими векторами можно моделировать: результаты статистического контроля (0 - годное изделие, 1 - дефектное); результаты маркетинговых и социологических опросов (0 - опрашиваемый выбрал первую из двух подсказок, 1 - вторую); распределение посторонних включений в материале (0 - нет включения в определенном объеме материала, 1 - есть); результаты испытаний и анализов (0 - нет нарушений требований нормативно-технической документации, 1 - есть такие нарушения); процессы распространения, например, пожаров (0 - нет загорания, 1 - есть; подробнее см. [, с.215-223]); технологические процессы (0 - процесс находится в границах допуска, 1 - вышел из них); ответы экспертов (опрашиваемых) о сходстве объектов (проектов, образцов) и т.д.

    Парные сравнения. Общую модель парных сравнений опишем согласно монографии Г. Дэвида [ $$3$$, с.9]. Предположим, что $$t$$ объектов $$A_1,A_2,...,A_t$$ сравниваются попарно каждым из $$n$$ экспертов. Всего возможных пар для сравнения имеется $$s=t(t-1)/2$$. Эксперт с номером $$\gamma$$ делает $$r_{\gamma}$$ повторных сравнений для каждой из $$s$$ возможностей. Пусть $$X(i,j,\gamma,\delta), i,j=1,2,...,t, i\ne j, \gamma=1,2,...,n; \delta=1,2,...,r_{\gamma}$$, - случайная величина, принимающая значение 1 или 0 в зависимости от того, предпочитает ли эксперт $$\gamma$$ объект $$A_i$$ или объект $$A_j$$ в $$\delta$$ -м сравнении двух объектов. Предполагается, что все сравнения проводятся независимо друг от друга, так что случайные величины $$X(i,j,\gamma,\delta)$$ независимы в совокупности, если не считать того, что $$X(i,j,\gamma,\delta)+X(j,i,\gamma,\delta)=1$$. Положим$$P(X(i,j,\gamma,\delta)=1)=\pi(i,j,\gamma,\delta).$$

    Ясно, что описанная модель парных сравнений представляет собой частный случай бернуллиевского вектора. В этой модели число наблюдений равно числу неизвестных параметров, поэтому для получения статистических выводов необходимо наложить априорные условия на $$\pi(i,j,\gamma,\delta)$$, например [, c.9]:

    $$\pi(i,j,\gamma,\delta)=\pi(i,j,\gamma)$$ (нет эффекта от повторений);

    $$\pi(i,j,\gamma,\delta)=\pi(i,j)$$ (нет эффекта от повторений и от экспертов).

    Теорию независимых парных сравнений целесообразно разделить на две части - непараметрическую, в которой статистические задачи ставятся непосредственно в терминах $$\pi(i,j,\gamma,\delta)$$, и параметрическую, в которой вероятности $$\pi(i,j,\gamma,\delta)$$ выражаются через меньшее число иных параметров. Ряд результатов непараметрической теории парных сравнений непосредственно вытекает из теории бернуллиевских векторов.

    В параметрической теории парных сравнений наиболее популярна так называемая линейная модель [, c.11], в которой предполагается, что каждому объекту $$A_i$$ можно сопоставить некоторую "ценность" $$V_i$$ так, что вероятность предпочтения $$\pi(i,j)$$ (т.е. предполагается дополнительно, что эффект от повторений и от экспертов отсутствует) выражается следующим образом:$$\pi(i,j)=H(V_i-V_j),$$ где $$H(x)$$ - функция распределения, симметричная относительно 0, т.е.$$H(-x)=1-H(x)$$ при всех $$x$$.

    Широко применяются модели Терстоуна-Мостеллера и Бредли-Терри, в которых $$H(x)$$ - соответственно функции нормального и логистического распределений. Поскольку функция $$\Phi(x)$$ стандартного нормального распределения с математическим ожиданием 0 и дисперсией 1 и функция$$\Psi(x)=e^x(1+e^x)^{-1}$$ стандартного логистического распределения удовлетворяют (см., например, []) соотношению$$\sup_{x\in R^1}|\Phi(x)-\Psi(1,7x)|<0,01,$$ то для обоснованного выбора по статистическим данным между моделями Терстоуна-Мостеллера и Бредли-Терри необходимо не менее тысячи наблюдений.

    Соотношение (1) вытекает из следующей модели поведения эксперта: он измерят "ценность" $$V_i$$ и $$V_j$$ объектов $$A_i$$ и $$A_j$$, но с ошибками $$\varepsilon_i$$ и $$\varepsilon_j$$ соответственно, а затем сравнивает свои оценки ценности объектов $$y_i-V_i+\varepsilon_i$$ и $$y_i=V_j+\varepsilon_j$$. Если $$y_i>y_j$$ то он предпочитает $$A_i$$, в противном случае - $$A_j$$. Тогда$$\pi(i,j)=P(\varepsilon_j-\varepsilon_i<V_i-V_j)=H(V_i-V_j).$$

    Обычно предполагают, что субъективные ошибки эксперта $$\varepsilon_i$$ и $$\varepsilon_j$$ независимы и имеют одно и то же непрерывное распределение. Тогда функция распределения $$H(x)$$ из соотношения (3) непрерывна и удовлетворяет функциональному уравнению (2).

    Существует много разновидностей моделей парных сравнений, постоянно предполагаются новые. В качестве примера опишем модель парных сравнений, основанную не на процедуре упорядочения, а на определении сходства объектов. Пусть каждому объекту $$A_i$$ соответствует точка $$a_i$$ в $$r$$ -мерном евклидовом пространстве $$R^r$$. Эксперт "измеряет" $$a_i$$ и $$a_j$$ с ошибками $$\varepsilon_i$$ и $$\varepsilon_j$$ соответственно и в случае, если евклидово расстояние между $$a_i+\varepsilon_i$$ и $$a_j+\varepsilon_j$$ меньше 1, заявляет о сходстве объектов $$A_i$$ и $$A_j$$, в противном случае - об их различии. Предполагается, что ошибки $$\varepsilon_i$$ и $$\varepsilon_j$$ независимы и имеют одно и то же распределение, например, круговое нормальное распределение с нулевым математическим ожиданием и дисперсией координат $$\sigma^2$$. Целью статистической обработки является определение по результатам парных сравнений оценок параметров $$a_1, a_2,...,a_r$$, и $$\sigma^2$$, а также проверка согласия опытных данных с моделью.

    Рассмотренные модели парных сравнений могут быть обобщены в различных направлениях. Так, можно ввести понятие "ничья" - ситуации, когда эксперт оценивает объекты одинаково. Модели с учетом "ничьих" предполагают, что эксперт может отказаться от выбора одного из объектов и заявить об их эквивалентности, т. е. число возможных ответов увеличивается с 2 до 3. В моделях множественных сравнений эксперту представляется не два объекта , а три или большее число.

    Модели, учитывающие "ничьи", строятся обычно с помощью используемых в психофизике "порогов чувствительности": если $$|y_i-y_j|\le r$$ (где $$r$$ - порог чувствительности), то объекты $$A_i$$ и $$A_j$$ эксперт объявляет неразличимыми. Приведем пример модели с "ничьими", основанной на другом принципе. Пусть каждому объекту $$A_i$$ соответствует точка $$a_i$$ в $$r$$ -мерном линейном пространстве. Как и прежде, эксперт "измеряет" объектные точки $$a_i$$ и $$a_j$$ с ошибками $$\varepsilon_i$$ и $$\varepsilon_j$$ соответственно, т.е. принимает решение на основе $$y_i=a_i+\varepsilon_i$$ и $$y_j=a_j+\varepsilon_j$$. Если все координаты $$y_i$$ больше соответствующих координат $$y_j$$, то $$A_i$$ предпочитается $$A_j$$. Соответственно, если каждая координата $$y_i$$ меньше координаты $$y_j$$ с тем же номером, то эксперт считает наилучшим объект $$A_j$$. Во всех остальных случаях эксперт объявляет о ничейной ситуации. Эта модель при $$r = 1$$ переходит в описанную выше линейную модель. Она связана с принципом Парето в теории группового выбора и предусматривает выбор оптимального по Парето объекта, если он существует (роль согласуемых критериев играют процедуры сравнения значений отдельных координат), и отказ от выбора, если такого объекта нет.

    Можно строить модели, учитывающие порядок предъявления объектов при сравнении, зависимость результата сравнения от результатов предшествующих сравнений. Опишем одну из подобных моделей.

    Пусть эксперт сравнивает три объекта - $$A, B, C$$, причем сначала сравниваются $$A$$ и $$B$$, потом - $$B$$ и $$C$$ и, наконец, $$A$$ и $$C$$. Для определенности пусть $$A>B$$ будет означать, что $$A$$ более предпочтителен, чем $$B$$. Пусть при предъявлении двух объектов$$P(A>B)=\pi_{AB}, P(B>C)=\pi_{BC}, P(A>C)=\pi_{AC}.$$

    Теперь пусть пара $$B, C$$ предъявляется после пары $$A, B$$. Естественно предположить, что высокая оценка $$B$$ в первом сравнении повышает вероятность предпочтения $$B$$ и во втором, и, наоборот, отрицательное мнение о $$B$$ в первом сравнении сохраняется и при проведении второго сравнения. Это предположение проще всего учесть в модели следующим образом:$$P(B>C|B>A)=\pi_{BC}+\delta,\quad P(B>C|A>B)=\pi_{BC}-\delta,$$ где $$\delta$$ - некоторое положительное число, показывающее степень влияния первого сравнения на второе. По аналогичным причинам вероятности исхода третьего сравнения в зависимости от результатов первых двух можно описать так:$$\begin{gathered} P(A>C|A>B,B>C)=\pi_{AC}+2\delta,P(A>C|A>B,B<C)=\pi_{AC}, \\ P(A>C|A<B,B>C)=\pi_{AC}, P(A>C|A<B,B<C)=\pi_{AC}-2\delta. \end{gathered}$$

    Статистическая задача состоит в определении параметров $$\pi_{AB},\pi_{BC},\pi_{AC}$$ и $$\delta$$ по результатам сравнений, проведенных n экспертами, и в проверке адекватности модели.

    Ясно, что можно рассматривать и другие модели, в частности, учитывающие тягу экспертов к транзитивности ответов. Очевидно, что проблемы построения моделей парных сравнений относятся не к прикладной статистике, а к тем прикладным областям, для решения задач которых развиваются методы парных сравнений, например, к экономике предприятия, стратегическому менеджменту, производственной психологии, изучению поведения потребителей, экспертным оценкам и т. д.

    Метод парных сравнений был введен в 1860 г. Г.Т. Фехнером для решения задач психофизики. Расскажем об этом несколько подробнее. Как известно, основателем психофизики по праву считается Густав Теодор Фехнер (1801-1887), а год выхода в свет его фундаментальной работы "Элементы психофизики" (1860) - датой рождения новой науки. В этой работе широко применялся предложенный Г.Т. Фехнером метод парных сравнений (обсуждение событий тех лет с современных позиций дано в монографии [, c.14-16]).

    С точки зрения математической статистики приведенные выше модели не представляют большого теоретического интереса: оценки параметров находятся обычно методом максимального правдоподобия, а проверка согласия проводится по критерию отношения правдоподобия или асимптотически эквивалентными ему критериями типа хи-квадрат []. Вычислительные процедуры обычно сложны и плохо исследованы; их можно упростить и одновременно повысить обоснованность, перейдя от оценок максимального правдоподобия к одношаговым оценкам (см. лекцию 6).

    Отметим некоторые сложности при обосновании возможности использовании линейных моделей типа (1) - (3). Вероятностно-статистическая теория достаточно проста, когда предполагается, что каждому отдельному сравнению двух объектов соответствуют свои собственные ошибки экспертов, причем все ошибки независимы в совокупности. Однако это предположение отнюдь не очевидно с содержательной точки зрения. В качестве примера рассмотрим три объекта $$A, B$$ и $$C$$, которые сравнивают попарно: $$A$$ и $$B$$, $$B$$ и $$C$$, $$A$$ и $$C$$. В соответствии со сказанным, в рассмотрение вводят 6 ошибок одного и того же эксперта: $$\varepsilon_A$$ и $$\varepsilon_B$$ - в первом сравнении, $$\varepsilon'_B$$ и $$\varepsilon_C$$ - во втором, $$\varepsilon'_A$$ и $$\varepsilon'_C$$ - в третьем, причем все эти 6 случайных величин независимы в совокупности. Между тем естественно думать, что мнения эксперта об одном и том же объекте связаны между собой, т. е. $$\varepsilon_A$$ и $$\varepsilon'_A$$ зависимы, равно как $$\varepsilon_B$$ и $$\varepsilon'_B$$, а также $$\varepsilon_C$$ и $$\varepsilon'_C$$. Более того, если принять, что точка зрения эксперта полностью определена для него самого, то следует положить $$\varepsilon_A=\varepsilon'_A$$ и соответственно $$\varepsilon_B=\varepsilon'_B$$ и $$\varepsilon_C=\varepsilon'_C$$. При этом напомним, что случайные величины $$\varepsilon_A, \varepsilon_B$$ и др. интерпретируются как отклонения мнений отдельных экспертов от истины. Видимо, ошибку эксперта целесообразно считать состоящей из двух слагаемых, а именно: отклонения от истины, вызванного внутренними особенностями эксперта (систематическая погрешность) и колебания мнения эксперта в связи с очередным парным сравнением (случайная погрешность). Игнорирование систематической погрешности облегчает развитие математико-статистической теории, а ее учет приводит к необходимости изучения зависимых парных сравнений.

    При обработке результатов парных сравнений первый этап - проверка согласованности. Понятие согласованности уточняется различными способами, но все они имеют один и тот же смысл проверки однородности обрабатываемого материала, т.е. того, что целесообразно агрегировать мнения отдельных экспертов, объединить данные и совместно их обрабатывать. При отсутствии однородности данные разбиваются на группы (классы, кластеры, таксоны) с целью обеспечения однородности внутри отдельных групп. Естественно, согласованность целесообразно проверять, вводя возможно меньше гипотез о структуре данных. Следовательно, целесообразно пользоваться для этого непараметрической теорией парных сравнений, основанной на теории бернуллиевских векторов.

    Хорошо известно, что модели парных сравнений с успехом применяются в экспертных и экспериментальных процедурах упорядочивания и выбора. В частности, для анализа голосований, турниров, выбора наилучшего объекта (проекта, образца, кандидатуры); в планировании и анализе сравнительных экспериментов и испытаний; в органолептической экспертизе (в частности, дегустации); при изучении поведения потребителей; визуальной колоритмии, определении индивидуальных рейтингов и вообще изучении предпочтений при выборе и т. д. (подробнее см. [,]).

    Бинарные отношения. Теорию ранговой корреляции (см. ], оказалась адекватной следующая так называемая $$T$$ -модель ранжирования.

    Пусть имеется $$t$$ объектов $$A_1,A_2,...,A_t$$ причем каждому объекту $$A_i$$ соответствует число $$a_i$$, описывающее его положение на шкале изучаемого признака. Испытуемый упорядочивает объекты так, как если бы оценивал соответствующие им значения с ошибками, т.е. находил $$y_i=a_i+\varepsilon_i, i=1,2,...,n$$, где $$\varepsilon_i$$ - ошибка при рассмотрении $$i$$ -го объекта, а затем располагал бы объекты в том порядке, в каком располагаются $$y_1,y_2,...,y_t$$. В этом случае вероятность появления упорядочения $$A_{i1},A_{i2},...,A_{it}$$ есть $$P(y_{i1}<y_{i2}<...<y_{it})$$, а ранги $$R_1,R_2,...,R_t$$ объектов являются рангами случайных величин $$y_1,y_2,...,y_t$$, полученными при их упорядочении в порядке возрастания. Кроме того, для простоты расчетов в модели предполагается, что ошибки испытуемого $$\varepsilon_1, \varepsilon_2, ...,\varepsilon_t$$ независимы и имеют нормальное распределение с математическим ожиданием 0 и дисперсией $$\sigma^2$$.

    Как уже отмечалось в лекции 1, бинарное отношение на множестве из $$t$$ элементов полностью описывается матрицей из 0 и 1 порядка $$t\times t$$. Поэтому задать распределение случайного бинарного отношения - это то же самое, что задать распределение вероятностей на множестве всех матриц описанного вида, состоящем из $$2^{t^2}$$ элементов. Пространства ранжировок, разбиений, толерантностей зачастую удобно считать подпространствами пространства всех бинарных отношений, тогда распределения вероятностей на них - частные случаи описанного выше распределения, выделенные тем, что вероятности принадлежности соответствующим подпространствам равны 1. Распределение произвольного бинарного отношения описывается $$2^{t^2}-1$$ параметрами, распределение случайной ранжировки (без связей) - $$(t! - 1)$$ параметрами, а описанная выше $$T$$ -модель ранжирования - $$(t + 1)$$ параметром. При $$t = 4$$ эти числа равны соответственно 65535, 23 и 5. Первое из этих чисел показывает практическую невозможность использования в вероятностно-статистических моделях произвольных бинарных отношений, поскольку по имеющимся данным невозможно оценить столь большое число параметров. Приходится ограничиваться теми или иными семействами бинарных отношений - ранжировками, разбиениями, толерантностями и др. Модель произвольной случайной ранжировки при $$t = 5$$ описывается 119 параметрами, при $$t = 6$$ - уже 719 параметрами, при $$t = 7$$ число параметров достигает 5049, что уже явно находится за пределами возможности оценивания. В то же время $$T$$ -модель ранжирования при $$t = 7$$ описывается всего 8-ю параметрами, а потому может быть кандидатом для практического использования.

    Что естественно предположить относительно распределения случайного элемента со значениями в том или ином пространстве бинарных отношений? Зачастую целесообразно считать, что распределение имеет некий центр, попадание в который наиболее вероятно, а по мере удаления от центра вероятности убывают. Это соответствует естественной модели измерения с ошибкой; в классическом одномерном случае результат подобного измерения обычно описывается унимодальной симметричной плотностью, монотонно возрастающей слева от модального значения, в котором плотность максимальна, и монотонно убывающей справа от него. Чтобы ввести понятие монотонного распределения в пространстве бинарных отношений, будем исходить из метрики в этом пространстве. Воспользовавшись тем, что бинарные отношения $$C$$ и $$D$$ однозначно описываются матрицами $$||c_{ij}||$$ и $$||d_{ij}||$$ порядка $$t\times t$$ соответственно, рассмотрим расстояние (в несколько другой терминологии - метрику) в пространстве бинарных отношений$$d(C,D)=\sum_{1\le i,j\le t}|c_{ij}-d_{ij}|.$$

    Метрика (4) в различных пространствах бинарных отношений - ранжировок, разбиений, толерантностей - может быть введена с помощью соответствующих систем аксиом (см. лекцию 1). В настоящее время метрику (4) обычно называют расстоянием Кемени в честь американского исследователя Джона Кемени, впервые получившего эту метрику исходя из предложенной им системы аксиом для расстояния между упорядочениями (ранжировками).

    В статистике нечисловых данных используются и иные метрики, отличающиеся от расстояния Кемени. Более того, для использования понятия монотонного распределения, о котором сейчас идет речь, нет необходимости требовать выполнения неравенства треугольника, а достаточно, чтобы $$d(C,D)$$ можно было рассматривать как показатель различия. Под показателем различия понимаем такую функцию $$d(C,D)$$ двух бинарных отношений $$C$$ и $$D$$, что $$d(C,D) = 0$$ при $$C = D$$ и увеличение $$d(C,D)$$ интерпретируется как возрастание различия между $$C$$ и $$D$$.

    Определение 1. Распределение бинарного отношения $$X$$ называется монотонным с центром в $$C_0$$ относительно расстояния (показателя различия) $$d$$, если из $$d(C,C_0) < d(D,C_0)$$ следует, что $$P(X=C) > P(X=D)$$.

    Это определение впервые введено в монографии [, c.196]. Оно может использоваться в любых пространствах бинарных отношений и, более того, в любых пространствах из конечного числа элементов, лишь бы в них была введена функция $$d(C,D)$$ - показатель различия элементов $$C$$ и $$D$$ этого пространства. Монотонное распределение унимодально, мода находится в $$C_0$$.

    Определение 2. Распределение бинарного отношения $$X$$ называется симметричным относительно расстояния $$d$$ с центром в $$C_0$$, если существует такая функция $$f:R_+^1\rightarrow[0,1]$$ что$$P(X=C)=f(d(C,C_0)).$$

    Если распределение $$X$$ монотонно и таково, что из $$d(C,C_0)=d(D,C_0)$$ следует $$P(X=C)=P(X=D)$$, то оно симметрично. Если функция $$f$$ в формуле (5) монотонно строго убывает, то соответствующее распределение монотонно в смысле определения 1.

    Поскольку толерантность на множестве из $$t$$ элементов задается $$0,5t(t-1)$$ элементами $$\delta_{ij}$$ матрицы из 0 и 1 порядка $$t\times t$$, лежащими выше главной диагонали, то распределение на множестве толерантностей задается в общем случае $$2^{0,5t(t-1)}$$ параметрами. Естественно выделить семейство распределений, соответствующее независимым элементам матрицы. Оно задается бернуллиевским вектором (люсианом) с $$0,5t(t-1)$$ параметрами (выше бернуллиевские вектора рассмотрены подробнее). Математическая техника, необходимая для изучения толерантностей с независимыми элементами, существенно проще, чем в случае ранжировок и разбиений. Здесь легко отказаться от условия равномерности распределения. Этому условию соответствует $$P(\delta_{ij}=1)=p_{ij}\equiv 1/2$$, в то время как статистические методы анализа люсианов, развитые в статистике нечисловых данных (см., например, работы [ $$12$$, $$13$$, $$15$$ ]) не налагают никаких существенных ограничений на $$p_{ij}$$.

    Как уже отмечалось, при обработке мнений экспертов сначала проверяют согласованность. В частности, если мнения экспертов описываются монотонными распределениями, то для согласованности необходимо совпадение центров этих распределений. К сожалению, классические методы проверки согласованности для ранжировок, основанные на коэффициентах ранговой корреляции и конкордации, позволяют лишь отвергнуть гипотезу о равнораспределенности. Но не установить, можно ли считать, что центры соответствующих экспертам распределений совпадают или же, например, существует две группы экспертов, каждая со своим центром. Теория случайных толерантностей лишена этого недостатка. Отсюда вытекают следующие практические рекомендации.

    Пусть цель обработки экспертных данных состоит в получении ранжировки, отражающей групповое мнение. Однако согласно рекомендуемой процедуре экспертного опроса пусть эксперты не упорядочивают объекты, а проводят парные сравнения каждого из рассматриваемых объектов со всеми остальными, причем ровно один раз. Тогда ответ эксперта - толерантность, но, вообще говоря, не ранжировка, поскольку в ответах эксперта может нарушаться транзитивность.

    Возможны два пути обработки данных. Первый - превратить ответ эксперта в ранжировку (тем или иным способом "спроектировав" его на пространство ранжировок), а затем проверять согласованность ранжировок с помощью известных критериев. При этом от толерантности перейти к ранжировке можно, например, так. Будем выбирать ближайшую (в смысле применяемого расстояния) матрицу к матрице ответов эксперта из всех, соответствующих ранжировкам без связей.

    Второй путь - проверить согласованность случайных толерантностей, а групповое мнение искать с помощью медианы Кемени (подробнее см. лекцию 11) непосредственно по исходным данным, т.е. по толерантностям. Групповое мнение при этом может быть найдено в пространстве ранжировок. Второй путь мы считаем более предпочтительным, поскольку при этом обеспечивается более адекватная проверка согласованности и исключается процедура укладывания мнения эксперта в "прокрустово ложе" ранжировки (эта процедура может приводить как к потере информации, так и к принципиально неверным выводам, вызванным искажениями мнений экспертов).

    Области применения статистики бинарных отношений многообразны: ранговая корреляция - оценка величины связи между переменными, измеренными в порядковой шкале; анализ экспертных или экспериментальных упорядочений; анализ разбиений технико-экономических показателей на группы сходных между собой; обработка данных о сходстве (взаимозаменяемости); статистический анализ классификаций; математические вопросы теории менеджмента и др.

    Случайные множества. Будем рассматривать случайные подмножества некоторого множества $$Q$$. Если $$Q$$ состоит из конечного числа элементов, то считаем, что случайное подмножество $$S$$ - это случайный элемент со значениями в $$2^Q$$ - множестве всех подмножеств множества $$Q$$, состоящем из $$2^{card(Q)}$$ элементов. Чтобы удовлетворить математиков, считаем, что все подмножества $$Q$$ измеримы. Тогда распределение случайного подмножества $$S=S(\omega)$$ множества $$Q$$ - это$$P_S(A)=P(S=A)=P(\{\omega:S(\omega)=A\}),A\subseteq Q.$$

    В формуле (6) предполагается, что $$S:\Omega\rightarrow 2^Q$$ где $$(\Omega,F,P)$$ - вероятностное пространство (здесь $$\Omega$$ - пространство элементарных событий, $$F - \sigma$$ - алгебра случайных событий, $$P$$ - вероятностная мера на $$F$$ ), на котором определен случайный элемент $$S(\omega)$$. Через распределение $$PS(A)$$ выражаются вероятности различных событий, связанных с $$S$$. Так, чтобы найти вероятность накрытия фиксированного элемента $$q$$ случайным множеством $$S$$, достаточно вычислить$$P(q\in S)=P(\{\omega:q\in S(\omega)\})= \sum_{A:q\in A, A\subseteq 2^Q} P(S=A),$$ где суммирование идет по всем подмножествам $$A$$ множества $$Q$$, содержащим $$q$$. Пусть $$Q={q_1, q_2, ..., q_k}$$. Рассмотрим случайные величины, определяемые по случайному множеству $$S$$ следующим образом$$\chi_i(\omega)= \left\{ \begin{aligned} 1,q_i\in S(\omega), \\ 0,q_i\notin S(\omega). \end{aligned} \right.$$

    Определение 3. Случайное множество $$S$$ называется случайным множеством с независимыми элементами, если случайные величины $$\chi_i(\omega),i=1,2,...,k$$, независимы (в совокупности).

    Последовательность случайных величин $$\chi_1,\chi_2,...,\chi_k$$ - бернуллиевский вектор с $$X_i=\chi_i$$ и $$p_i=P(q_i\in S(\omega)),i=1,2,...,k$$. Из сказанного выше следует, что распределение случайного множества с независимыми элементами задается формулой$$P(S=A)=\Pi_{q_i\in A} p_i \Pi_{q_i\in Q\backslash A}(1-p_i),$$ т.е. такие распределения образуют $$k = card(Q)$$ - мерное параметрическое семейство, входящее в $$(2^{card(Q)}-1)$$ - мерное семейство всех распределений случайных подмножеств множества $$Q$$.

    При исследовании случайных подмножеств произвольного множества $$Q$$ будем рассматривать их как случайные величины со значениями в некотором пространстве подмножеств множества $$Q$$, например, в пространстве замкнутых подмножеств $$2^Q$$ множества $$Q$$.

    Представляющими интерес лишь для математиков способами введения измеримой структуры в $$2^Q$$ интересоваться не будем. Отсутствие специального интереса к проблеме измеримости связано с тем, что при вероятностно-статистическом моделировании и обработке на ЭВМ все случайные подмножества рассматриваются как конечные (т.е. подмножества конечного множества).

    Случайные множества находят разнообразные применения в многообразных проблемах эконометрики и математической экономики, в том числе в задачах управлении запасами и ресурсами (см. об этом главу 5 в монографии [ $$12$$ ]), в задачах менеджмента и, в частности, маркетинга, в экспертных оценках, например, при анализе мнений голосующих или опрашиваемых, каждый из которых отмечает несколько пунктов из списка и т.д. Кроме того, случайные множества применяются в гранулометрии, при изучении пористых сред и объектов сложной природы в таких областях, как металлография, петрография, биология, в частности, математическая морфология, в изучении структуры веществ и материалов, в исследовании процессов распространения, в том числе просачивания, распространения пожаров, экологических загрязнений, при районировании, в изучении областей поражения, например, поражения металла коррозией и сердечной мышцы при инфаркте миокарда, и т.д., и т.п. Можно вспомнить о компьютерной томографии, о наглядном представлении сложной информации на экране компьютера, об изучении распространения рекламной информации, о картах Кохонена (популярный метод представления информации при применении нейросетей) и т.д.

    Ранговые методы. В лекции 1 установлено, что любой адекватный алгоритм в порядковой шкале является функцией от некоторой матрицы $$C$$. Пусть никакие два из результатов наблюдений $$x_1,x_2,...,x_n$$ не совпадают, а $$r_1,r_2,...,r_n$$ - их ранги. Тогда элементы матрицы $$C$$ и ранги результатов наблюдений связаны взаимно однозначным соответствием:$$r_i=1+\sum_{1\le j\le n}(1-c_{ij}),$$ а $$c_{ij}$$ через ранги выражаются так: $$c_i = 1$$, если $$r_i < r_j$$, и $$c_{ij} = 0$$ в противном случае.

    Сказанное означает, что при обработке данных, измеренных в порядковой шкале, могут применяться только ранговые статистические методы. Отметим, что часто используемое в непараметрической статистике преобразование $$Y=F(X)$$ (здесь $$F(x)$$ - непрерывная функция распределения случайной величины $$X$$, причем $$F$$ предполагается произвольной) фактически означает переход к порядковой шкале, поскольку статистические выводы при этом инвариантны относительно допустимых преобразований в порядковой шкале.

    Разумеется, ранговые статистические методы могут применяться не только при обработке данных, измеренных в порядковой шкале. Так, для проверки независимости двух количественных признаков в случае, когда нет уверенности в нормальности соответствующего двумерного распределения, целесообразно пользоваться коэффициентами ранговой корреляции Кендалла или Спирмена.

    В настоящее время с помощью непараметрических и прежде всего ранговых методов можно решать все те задачи эконометрики и прикладной статистики, что и с помощью параметрических методов, в частности, основанных на предположении нормальности. Однако параметрические методы вошли в массовое сознание исследователей и инженеров и мешают широкому внедрению более обоснованной и прогрессивной ранговой статистики. Так, при проверке однородности двух выборок вместо критерия Стьюдента целесообразно использовать ранговые методы (см. лекцию 8), но пока это делается редко.

    ].

    Из-за имеющего разнобоя в терминологии приведем математические определения из справочника по теории вероятностей академика РАН Ю.В Прохорова и проф. Ю.А. Розанова [].

    Пусть $$(\mathbf{X},\mathbf{B})$$ - некоторое измеримое пространство; $$F,B$$ - измеримая функция $$\xi=\xi(\omega)$$ на пространстве элементарных событий $$(\Omega,F,\mathbf{P})$$ (где $$P$$ - вероятностная мера на $$\sigma$$ - алгебре $$F$$ - измеримых подмножеств $$\Omega$$, называемых событиями) со значениями в $$(\mathbf{X},\mathbf{B})$$ называется случайной величиной (чаще этот математический объект называют случайным элементом, оставляя термин "случайная величина" за частным случаем, когда $$\mathbf{Х}$$ - числовая прямая) в фазовом пространстве $$(\mathbf{X},\mathbf{B})$$. Распределением вероятностей этой случайной величины $$\xi$$ называется функция $$P_{\xi}=P_{\xi}(B)$$ на $$\sigma$$ -алгебре $$\mathbf{B}$$ фазового пространства, определенная как$$P_{\xi}=P\{\xi\in B\}\quad (B\in \mathbf{B})$$ (распределение вероятностей $$P_{\xi}$$ представляет собой вероятностную меру в фазовом пространстве $$(\mathbf{X},\mathbf{B})$$ ) [, с.132].

    Пусть $$\xi_1,\xi_2,...,\xi_n$$ - случайные величины на пространстве случайных событий $$(\Omega,F,\mathbf{P})$$ в соответствующих фазовых пространствах $$\mathbf{X}_k,\mathbf{B}_k$$. Совместным распределением вероятностей этих величин называется функция $$P_{\xi_1,\xi_2,...,\xi_n}= P_{\xi_1,\xi_2,...,\xi_n}(B_1,B_2,...,B_n)$$, определенная на множествах $$B_1\in\mathbf{B}_1, B_2\in\mathbf{B}_2, ..., B_n\in\mathbf{B}_n$$ как$$P_{\xi_1,\xi_2,...,\xi_n}(B_1,B_2,...,B_n)= P_{\xi_1,\xi_2,...,\xi_n}(\xi_1\in B_1, \xi_2\in B_2,...,\xi_n\in B_n).$$

    Распределение вероятностей $$P_{\xi_1,\xi_2,...,\xi_n}$$ как функция на полукольце множеств вида $$B_1\times B_2\times ...\times B_n, B_1\in\mathbf{B}_1, B_2\in\mathbf{B}_2,...,B_n\in\mathbf{B}_n$$, в произведении пространств $$\mathbf{X}_1,\mathbf{X}_2,...,\mathbf{X}_n$$ представляет собой аналог классической функции распределения. Случайные величины $$\xi_1,\xi_2,...,\xi_n$$ называются независимыми, если при любых $$B_1, B_2,...,B_n$$ (см. [, с.133])$$P_{\xi_1,\xi_2,...,\xi_n}(B_1,B_2,...,B_n)= P_{\xi_1}(B_1)P_{\xi_2}(B_2)...P_{\xi_n}(B_n).$$

    Предположим, что совместное распределение вероятностей $$P_{\xi,\eta}(A,B)$$ случайных величин $$\xi$$ и $$\eta$$ абсолютно непрерывно относительно некоторой меры $$Q$$ на произведении пространств $$\mathbf{X}\times\mathbf{Y}$$, являющейся произведением мер $$Q_X$$ и $$Q_Y$$, т.е.:$$P_{\xi,\eta}(A,B)=\int\limits_{A\times B}p(x,y)Q(dx,dy)$$ для любых $$A\in\mathbf{A}$$ и $$B\in\mathbf{B}$$, где $$p(x,y)$$ - соответствующая плотность распределения вероятностей [, с.145].

    В формуле (10) предполагается, что $$\xi-\xi(\omega)$$ и $$\eta=\eta{\omega}$$ - случайные величины на одном и том же пространстве элементарных событий $$\Omega$$ со значениями в фазовых пространствах $$(\mathbf{X},\mathbf{A})$$ и $$(\mathbf{Y},\mathbf{B})$$. Существование плотности $$p(x,y)$$ вытекает из абсолютной непрерывности $$P_{\xi,\eta}(A,B)$$ относительно $$Q$$ в соответствии с теоремой Радона-Никодима.

    Условное распределение вероятностей $$P_{\xi}(A|\eta),A\in\mathbf{A}$$ может быть выбрано одинаковым для всех $$\omega\in\Omega$$ при которых случайная величина $$\eta=\eta(\omega)$$ сохраняет одно и то же значение: $$\eta(\omega)=y$$. При почти каждом $$y\in\mathbf{Y}$$ (относительно распределения $$P_{\eta}$$ в фазовом пространстве $$(\mathbf{Y},\mathbf{B})$$ ) условное распределение вероятностей $$P_{\xi}(A|y)=P_{\omega,\xi}(A)$$, где $$\omega\in\{\eta=y\}$$ и $$A\in\mathbf{A}$$ будет абсолютно непрерывно относительно меры $$Q_X$$:$$Q_X(A)-\int_{A\times X}Q(dx,dy).$$

    Причем соответствующая плотность условного распределения вероятностей будет иметь вид (см. [, с.145-146]):$$p_{\xi}(x|y)=\frac{p_{\xi}(dx|y)}{Q_X(dx)}=\frac{p(x,y)}{\int\limits_X p(x,y)Q_X(dx)}.$$

    При построении вероятностных моделей реальных явлений важны вероятностные пространства из конечного числа элементарных событий. Для них перечисленные выше общие понятия становятся более прозрачными, в частности, снимаются вопросы измеримости (все подмножества конечного множества обычно считаются измеримыми). Вместо плотностей и условных плотностей рассматриваются вероятности и условные вероятности. Отметим, что вероятности можно рассматривать как плотности относительно меры, приписывающей каждому элементу пространства элементарных событий вес 1, т.е. считающей меры$$Q(A)=Card(A)$$ (мера каждого множества равна числу его элементов). В целом ясно, что определения основных понятий теории вероятностей в общей ситуации практически не отличаются от таковых в элементарных курсах, во всяком случае с идейной точки зрения.

    За последние десятилетия в прикладной статистике сформировалась новая область - статистика нечисловых данных, она же - статистика объектов нечисловой природы. К настоящему времени она развита не менее, чем ранее выделенные статистика случайных величин, многомерный статистический анализ, статистика временных рядов и случайных процессов. Краткая сводка основных постановок и результатов прикладной статистики в пространствах нечисловой природы приведены ниже в данном параграфе и в лекции 11.

    Теория, построенная для результатов наблюдений, лежащих в пространствах общей природы, является центральным стержнем в статистике нечисловой природы. В ее рамках удалось разработать и изучить методы оценивания параметров и характеристик, проверки гипотез (в частности, с помощью статистик интегрального типа), параметрической и непараметрической регрессии (восстановления зависимостей), непараметрического оценивания плотности, дискриминантного и кластерного анализов и т.д.

    Вероятностно-статистические методы, развитые для результатов наблюдений из пространств произвольного вида, позволяют единообразно проводить анализ данных из любого конкретного пространства. Так, в монографии [] они применены к конечным случайным множествам, в работе [] - к нечетким множествам. С их помощью установлено поведение обобщенного мнения экспертной комиссии (медианы Кемени) при увеличении числа экспертов, когда ответы экспертов лежат в том или ином пространстве бинарных отношений. Методы классификации могут быть основаны на непараметрических оценках плотности распределения вероятностей в пространстве общей природы. Такие методы были применены для медицинской диагностики в пространстве разнотипных данных, когда часть координат вектора измерена по количественным шкалам, а часть - по качественным, и т.д.

    5.5. Средние и законы больших чисел

    Законы больших чисел состоят в том, что эмпирические средние сходятся к теоретическим. В классическом варианте: выборочное среднее арифметическое при определенных условиях сходится по вероятности при росте числа слагаемых к математическому ожиданию. На основе законов больших чисел обычно доказывают состоятельность различных статистических оценок. В целом эта тематика занимает заметное место в теории вероятностей и математической статистике.

    Однако математический аппарат при этом основан на свойствах сумм случайных величин (векторов, элементов линейных пространств). Следовательно, он не пригоден для изучения вероятностных и статистических проблем, связанных со случайными объектами нечисловой природы. Это такие объекты, как бинарные отношения, нечеткие множества, вообще элементы пространств без векторной структуры. Объекты нечисловой природы все чаще встречаются в прикладных исследованиях. Много конкретных примеров приведено выше в настоящей лекции. Поэтому представляется полезным получение законов больших чисел в пространствах нечисловой природы. Необходимо решить следующие задачи:

  • определить понятие эмпирического среднего;
  • определить понятие теоретического среднего;
  • ввести понятие сходимости эмпирических средних к теоретическому;
  • доказать при тех или иных комплексах условий сходимость эмпирических средних к теоретическому;
  • получить метод обоснования состоятельности различных статистических оценок, обобщив это доказательство;
  • описать способы применения полученных результатов при решении конкретных задач.
  • Ввиду принципиальной важности рассматриваемых результатов приводим доказательство закона больших чисел, а также результаты компьютерного анализа множества эмпирических средних.

    Определения средних величин. Пусть $$X$$ - пространство произвольной природы, $$x_1, x_2, x_3,...,x_n$$ - его элементы. Чтобы ввести эмпирическое среднее для $$x_1, x_2, x_3,...,x_n$$ будем использовать действительнозначную (т.е. с числовыми значениями) функцию $$f(x,y)$$ двух переменных со значениями в $$X$$. В стандартных математических обозначениях: $$f:X^2\rightarrow R^1$$. Величина $$f(x,y)$$ интерпретируется как показатель различия между $$x$$ и $$y$$: чем $$f(x,y)$$ больше, тем $$x$$ и $$y$$ сильнее различаются. В качестве $$f$$ можно использовать расстояние в $$Х$$, квадрат расстояния и т.п.

    Определение 1. Средней величиной для совокупности $$x_1, x_2, x_3,...,x_n$$ (относительно меры различия $$f$$ ), обозначаемой любым из трех способов:$$x_{cp}=E_n(f)=E_n(x_1, x_2, x_3,...,x_n;f),$$ называем решение оптимизационной задачи$$\sum_{i=1}^n f(x_i,y)\rightarrow \min,y\in X.$$

    Это определение согласуется с классическим: если $$Х = R^1, f(x,y) = (x - y)^2$$, то $$х_{ср}$$ - выборочное среднее арифметическое. Если же $$Х = R^1, f(x,y) = |x - y|$$, то при $$n = 2k+1$$ имеем $$х_{ср} = x(k+1)$$, при $$n= 2k$$ эмпирическое среднее является отрезком $$[x(k), x(k+1)]$$. Здесь через $$x(i)$$ обозначен $$i$$ -ый член вариационного ряда, построенного по $$x_1, x_2, x_3,...,x_n$$, т.е. $$i$$ -я порядковая статистика. Таким образом, при $$Х = R^1, f(x,y) = |x - y|$$ решение задачи (1) дает естественное определение выборочной медианы. Правда, несколько отличающееся от определения, предлагаемого в курсе "Общей теории статистики", в котором при $$n = 2k$$ медианой называют полусумму двух центральных членов вариационного ряда $$(x(k) + x(k+1))/2$$. Иногда $$x(k)$$ называют левой медианой, а $$х(k+1)$$ - правой [].

    Решением задачи (1) является множество $$E_n(f)$$, которое может быть пустым, состоять из одного или многих элементов. Выше приведен пример, когда решением является отрезок. Если $$Х = R^1\backslash\{х_0\}, f(x,y) = (x - y)^2$$, а среднее арифметическое выборки равно $$х_0$$, то $$E_n(f)$$ пусто.

    При моделировании реальных ситуаций часто можно принять, что $$Х$$ состоит из конечного числа элементов. Тогда множество $$E_n(f)$$ непусто - минимум на конечном множестве всегда достигается.

    Понятия случайного элемента $$x=x(\omega)$$ со значениями в $$Х$$, его распределения, независимости случайных элементов используем согласно предыдущему пункту настоящей лекции, т.е. каноническому справочнику Ю.В. Прохорова и Ю.А. Розанова []. Будем считать, что функция $$f$$ измерима относительно $$\sigma$$ -алгебры, участвующей в определении случайного элемента $$x=x(\omega)$$. Тогда $$f(x(\omega),y)$$ при фиксированном y является действительнозначной случайной величиной. Предположим, что она имеет математическое ожидание.

    Определение 2. Теоретическим средним $$E(x,f)$$ (другими словами, математическим ожиданием) случайного элемента $$x=x(\omega)$$ относительно меры различия $$f$$ называется решение оптимизационной задачи$$Mf(x(\omega),y)\rightarrow\min, y\in X.$$

    Это определение, как и для эмпирических средних, согласуется с классическим. Если $$Х=R^1, f(x,y) = (x-y)^2$$, то $$Е(x,f) = М(x(\omega))$$ - обычное математическое ожидание. При этом $$Mf(x(\omega),E(x,f))$$ - дисперсия случайной величины $$x=x(\omega)$$. Если же $$Х=R^1, f(x,y) = |x-y|$$, то $$E(x,f) = [a,b]$$, где $$a = \sup\{t: F(t)\le 0,5\}, b=\inf{t: F(t)\ge 0,5\}$$, где $$F(t)$$ - функция распределения случайной величины $$x=x(\omega)$$. Если график $$F(t)$$ имеет плоский участок на уровне $$F(t) = 0,5$$, то медиана - теоретическое среднее в смысле определения 2 - является отрезком. В классическом случае обычно говорят, что каждый элемент отрезка $$[a; b]$$ является одним из возможных значений медианы. Поскольку наличие указанного плоского участка - исключительный случай, то обычно решением задачи (2) является множество из одного элемента $$a = b$$ - классическая медиана распределения случайной величины $$x=x(\omega)$$.

    Теоретическое среднее $$E(x, f)$$ можно определить лишь тогда, когда $$Mf(x(\omega),y)$$ существует при всех $$y\in X$$. Оно может быть пустым множеством, например, если $$X=R^1\backslash\{x_0\}, f(x,y) = (x-y)^2, x_0=М(x(\omega))$$. И то, и другое исключается, если $$Х$$ конечно. Однако и для конечных $$X$$ теоретическое среднее может состоять не из одного, а из многих элементов. Отметим, однако, что в множестве всех распределений вероятностей на $$X$$ подмножество тех распределений, для которых $$E(x,f)$$ состоит более чем из одного элемента, имеет коразмерность 1, поэтому основной является ситуация, когда множество $$E(x,f)$$ содержит единственный элемент [].

    Существование средних величин. Под существованием средних величин будем понимать непустоту множеств решений соответствующих оптимизационных задач.

    Если $$Х$$ состоит из конечного числа элементов, то минимум в задачах (1) и (2) берется по конечному множеству. А потому, как уже отмечалось, эмпирические и теоретические средние существуют.

    Ввиду важности обсуждаемой темы приведем доказательства. Для строгого математического изложения нам понадобятся термины из раздела математики под названием "общая топология". Топологические термины и результаты будем использовать в соответствии с классической монографией []. Так, топологическое пространство называется бикомпактным в том и только в том случае, когда из каждого его открытого покрытия можно выбрать конечное подпокрытие [, с.183].

    Теорема 1. Пусть $$X$$ - бикомпактное пространство, функция $$f$$ непрерывна на $$X^2$$ (в топологии произведения). Тогда эмпирическое и теоретическое средние существуют.

    Доказательство. Функция $$f(x_i, y)$$ от y непрерывна, сумма непрерывных функций непрерывна, непрерывная функция на бикомпакте достигает своего минимума, откуда и следует заключение теоремы относительно эмпирического среднего.

    Перейдем к теоретическому среднему. По теореме Тихонова [, с.194] из бикомпактности $$X$$ вытекает бикомпактность $$X^2$$. Для каждой точки $$(x, y)$$ из $$X^2$$ рассмотрим $$\varepsilon/2$$ - окрестность в $$X^2$$ в смысле показателя различия $$f$$, т.е. множество U(x,y)=\{(x',y'):|f(x,y)-f(x',y')|<\varepsilon/2\}.

    Поскольку $$f$$ непрерывна, то множества $$U(x,y)$$ открыты в рассматриваемой топологии в $$X^2$$. По теореме Уоллеса [, с.193] существуют открытые (в $$X$$ ) множества $$V(x)$$ и $$W(y)$$, содержащие $$x$$ и $$y$$ соответственно и такие, что их декартово произведение $$V(x)\times W(y)$$ целиком содержится внутри $$U(x, y)$$.

    Рассмотрим покрытие $$X^2$$ открытыми множествами $$V(x)\times W(y)$$. Из бикомпактности $$X^2$$ вытекает существование конечного подпокрытия $$\{V(x_i)\times W(y_i), i=1,2,...,m}$$. Для каждого $$x$$ из $$X$$ рассмотрим все декартовы произведения $$V(x_i)\times W(y_i)$$, куда входит точка $$(x,y)$$ при каком-либо $$y$$. Таких декартовых произведений и их первых множителей $$V(x_i)$$ конечное число. Возьмем пересечение таких первых множителей $$V(x_i)$$ и обозначим его $$Z(x)$$. Это пересечение открыто, как пересечение конечного числа открытых множеств, и содержит точку $$x$$. Из покрытия бикомпактного пространства $$X$$ открытыми множествами $$Z(x)$$ выберем открытое подпокрытие $$Z_1, Z_2, ..., Z_k$$.

    Покажем, что если $$x'_1$$ и $$x'_2$$ принадлежат одному и тому же $$Z_j$$ при некотором $$j$$, то$$\sup\{|f(x'_1,y)-f(x'_2,y)|,y\in X\}<\varepsilon.$$

    Пусть $$Z_j = Z(x_0)$$ при некотором $$x_0$$. Пусть $$V(x_i)\times W(y_i), i\in I$$, - совокупность всех тех исходных декартовых произведений из системы $$\{V(x_i)\times W(y_i), i=1,2,...,m\}$$, куда входят точки $$(x_0,y)$$ при различных $$y$$. Покажем, что их объединение содержит также точки $$(x'_1,y)$$ и $$(x'_2,y)$$ при всех $$y$$. Действительно, если $$(х_0,y)$$ входит в $$V(x_i)\times W(y_i)$$, то y входит в $$W(y_i)$$, а $$x'_1$$ и $$x'_2$$ вместе с $$x_0$$ входят в $$V(x_i)$$, поскольку $$x'_1, x'_2$$ и $$x_0$$ входят в $$Z(x_0)$$. Таким образом, $$(x'_1,y)$$ и $$(x'_2,y)$$ принадлежат $$V(x_i)\times W(y_i)$$, а потому согласно определению $$V(x_i)\times W(y_i)$$$$|f(x'_1,y)-f(x_i,y_i)|<\varepsilon/2, |f((x'_2,y))-f(x_i,y_i)|<\varepsilon/2,$$ откуда и следует неравенство (3).

    Поскольку $$X^2$$ - бикомпактное пространство, то функция $$f$$ ограничена на $$X^2$$, а потому существует математическое ожидание $$Mf(x(\omega),y)$$ для любого случайного элемента $$x(\omega)$$, удовлетворяющего приведенным выше условиям согласования топологии, связанной с $$f$$, и измеримости, связанной с $$x(\omega)$$. Если $$x_1$$ и $$x_2$$ принадлежат одному открытому множеству $$Z_j$$, то$$|Mf(x_1,y)-Mf(x_2,y)|<\varepsilon,$$ а потому функция$$g(y)=Mf(x(\omega),y)$$ непрерывна на $$X$$. Поскольку непрерывная функция на бикомпактном множестве достигает своего минимума, т.е. существуют такие точки $$z$$, на которых $$g(z) = \inf\{g(y),y\in X\}$$, то теорема 1 доказана.

    В ряде интересных для приложений ситуаций $$X$$ не является бикомпактным пространством. Например, если $$X = R^1$$. В этих случаях приходится наложить на показатель различия $$f$$ некоторые ограничения, например, так, как это сделано в теореме 2.

    Теорема 2. Пусть $$X$$ - топологическое пространство, непрерывная (в топологии произведения) функция $$f:X^2\rightarrow R^1$$ неотрицательна, симметрична (т.е. $$f(x,y) = f(y,x)$$ для любых $$x$$ и $$y$$ из $$X$$ ), существует число $$D>0$$ такое, что при всех $$x, y, z$$ из $$X$$$$f(x,y)\le D\{f(x,z)+f(z,y)\}.$$

    Пусть в $$X$$ существует точка $$x_0$$ такая, что при любом положительном $$R$$ множество $$\{x:f(x,x_0)\le R\}$$ является бикомпактным. Пусть для случайного элемента $$x(\omega)$$, согласованного с топологией в рассмотренном выше смысле, существует $$g(x_0)=Mf(x(\omega),x_0)$$.

    Тогда существуют (т.е. непусты) математическое ожидание $$E(x,f)$$ и эмпирические средние $$E_n(f)$$.

    Замечание. Условие (5) - некоторое обобщение неравенства треугольника. Например, если $$g$$ - метрика в $$X$$, а $$f = g^p$$ при некотором натуральном $$p$$, то для $$f$$ выполнено соотношение (5) с $$D=2^p$$.

    Доказательство. Рассмотрим функцию $$g(y)$$, определенную формулой (4). Имеем$$f(x(\omega),y)\le D\{f(x(\omega),x_0)+f(x_0,y)\}.$$

    Поскольку по условию теоремы $$g(x_0)$$ существует, а потому конечно, то из оценки (6) следует существование и конечность $$g(y)$$ при всех $$y$$ из $$X$$. Докажем непрерывность этой функции.

    Рассмотрим шар (в смысле меры различия $$f$$ ) радиуса $$R$$ с центром в $$x_0$$:$$K(R)=\{x:f(x,x_0)\le R\},R>0.$$

    В соответствии с условием теоремы $$K(R)$$ как подпространство топологического пространства $$X$$ является бикомпактным. Рассмотрим произвольную точку $$x$$ из $$X$$. Справедливо разложение$$f(x(\omega),y)=f(x(\omega),y)\chi(x(\omega)\in K(R))+f(x(\omega),y)\chi(x(\omega)\notin K(R)),$$ где $$\chi(C)$$ - индикатор множества $$C$$. Следовательно,$$g(y)=Mf(x(\omega),y)\chi(x(\omega)\in K(R))+Mf(x(\omega),y)\chi(x(\omega)\notin K(R)).$$

    Рассмотрим второе слагаемое в (7). В силу (5)$$\begin{aligned} f(x(\omega),y)\chi(x(\omega)\notin K(R))\le f(x(\omega),x_0)\chi(x(\omega)\notin K(R)) + \\ +f(x_0,y)\chi(x(\omega)\notin K(R)). \end{aligned}$$

    Возьмем математическое ожидание от обеих частей (8):$$\begin{gathered} Mf(x(\omega),y)\chi(x(\omega)\notin K(R))\le D\int\limits_R^{+\infty}tdP\{f(x(\omega),x_0)\le t\}+\\ +Df(x_0,y)P(x(\omega)\notin K(R)). \end{gathered}$$

    В правой части (9) оба слагаемых стремятся к 0 при безграничном возрастании $$R$$: первое - в силу того, что$$g(x_0)=Mf(x(\omega),x_0)=\int\limits_0^{+\infty}tdP(f(x(\omega),x_0)\le t)<\infty,$$ второе - в силу того, что распределение случайного элемента $$x(\omega)$$ сосредоточено на $$X$$ и$$X\backslash\bigcup_{R>0}K(R)=\varnothing.$$

    Пусть $$U(x)$$ - такая окрестность $$x$$ (т.е. открытое множество, содержащее $$x$$ ), для которой$$\sup\{f(y,x),y\in U(x)\}<+\infty.$$

    Имеем$$f(y,x_0)\le D(f(x_0,x)+f(x,y)).$$

    В силу (9) и (10) при безграничном возрастании $$R$$$$Mf(x(\omega),y)\chi(x(\omega)\notin K(R))\rightarrow 0$$ равномерно по $$y\in U(x)$$. Пусть $$R(0)$$ таково, что левая часть (11) меньше $$\varepsilon>0$$ при $$R>R(0)$$ и, кроме того, $$y\in U(x)\subseteq K(R(0))$$. Тогда при $$R>R(0)$$$$|g(y)-g(x)|\le |Mf(x(\omega),y)\chi(x(\omega)\in K(R))-Mf(x(\omega),x)\chi(x(\omega)\in K(R))|+2\varepsilon.$$

    Нас интересует поведение выражения в правой части формулы (12) при $$y\in U(x)$$. Рассмотрим $$f_1$$ - сужение функции $$f$$ на замыкание декартова произведения множеств $$U(x)\times K(R)$$, и случайный элемент $$x_1(\omega)=x(\omega)\chi(x(\omega)\in K(R))$$. Тогда$$Mf(x(\omega),y)\chi(x(\omega)\in K(R))=Mf_1(x_1(\omega),y)$$ при $$y\in U(x)$$, а непрерывность функции $$g_1(y)=Mf_1(x_1(\omega),y)$$ была доказана в теореме 1. Последнее означает, что существует окрестность $$U_1(x)$$ точки x такая, что$$|Mf_1(x_1(\omega),y)-Mf_1(x_1(\omega),x)|<\varepsilon$$ при $$y\in U_1(x)$$. Из (12) и (13) вытекает, что при $$y\in U(x)\bigcap U_1(x)$$$$|g(y)-g(x)|<3\varepsilon,$$ что и доказывает непрерывность функции $$g(x)$$.

    Докажем существование математического ожидания $$E(x,f)$$. Пусть $$R(0)$$ таково, что$$P(x(\omega)\in K(R(0)))>1/2.$$

    Пусть $$H$$ - некоторая константа, значение которой будет выбрано позже. Рассмотрим точку $$x$$ из множества $$K(HR(0))^С$$ - дополнения $$K(HR(0))$$, т.е. из внешности шара радиуса $$HR(0)$$ с центром в $$x_0$$. Пусть $$x(\omega)\in K(R(0))$$. Тогда имеем$$f(x_0,x)\leD\{f(x_0,x(\omega))+f(x(\omega),x)\},$$ откуда$$f(x(\omega),x)\ge\frac{1}{D}f(x_0,x)-f(x_0,x(\omega))\ge\frac{HR(0)}{D}-R(0).$$

    Выбирая $$H$$ достаточно большим, получим с учетом условия (14), что при $$x\in K(HR(0))^С$$ справедливо неравенство$$Mf(c(\omega),x)\ge\frac12\left(\frac{HR(0)}{D}-R(0)\right).$$

    Можно выбрать $$H$$ так, чтобы правая часть (16) превосходила $$g(x_0)=Mf(x(\omega),x_0)$$.

    Сказанное означает, что $$\text{Argmin}\ g(x)$$ достаточно искать внутри бикомпактного множества $$K(HR(0))$$. Из непрерывности функции $$g$$ вытекает, что ее минимум достигается на указанном бикомпактном множестве, а потому - и на всем $$X$$. Существование (непустота) теоретического среднего $$E(x,f)$$ доказана.

    Докажем существование эмпирического среднего $$E_n(f)$$. Есть искушение проводить его дословно так же, как и доказательство существования математического ожидания $$E(x,f)$$, лишь с заменой 1/2 в формуле (16) на частоту попадания элементов выборки $$x_i$$ в шар $$K(R(0))$$. Эта частота, очевидно, стремится к вероятности попадания случайного элемента $$x=x(\omega)$$ в $$K(R(0))$$, большей 1/2 в соответствии с (14). Однако это рассуждение показывает лишь, что вероятность непустоты $$E_n(f)$$ стремится к 1 при безграничном росте объема выборки. Точнее, оно показывает, что$$\lim_{n\rightarrow\infty}P\{E_n(f)\ne\varnothing\wedgeE_n(f)\subseteq K(HR(0))\}=1.$$

    Поэтому пойдем другим путем, не опирающимся к тому же на вероятностную модель выборки. Положим$$R(1)=\max\{f(x_i,x_0),i=1,2,...,n\}.$$

    Если $$x$$ входит в дополнение шара $$K(HR(1))$$, то аналогично (15) имеем$$f(x_i,x_0)\ge\frac{HR(1)}{D}-R(1).$$

    При достаточно большом $$H$$ из (17) и (18) следует, что$$\sum_{i=1}^n f(x_i,x_0)\le nR(1)<\sum_{i=1}^n f(x_i,x),x\in\{K(HR(1))\}^C.$$

    Следовательно, $$\text{Argmin}$$ достаточно искать на $$K(HR(1))$$. Заключение теоремы 2 следует из того, что на бикомпактном пространстве $$K(HR(1))$$ минимизируется непрерывная функция.

    Теорема 2 полностью доказана.

    О формулировках законов больших чисел. Пусть $$x, x_1, x_2, ..., x_n$$ - независимые одинаково распределенные случайные элементы со значениями в $$X$$. Закон больших чисел - это утверждение о сходимости эмпирических средних к теоретическому среднему (математическому ожиданию) при росте объема выборки $$n$$, т.е. утверждение о том, что$$E_n(f)=E_n(x_1,x_2,x_3,...,x_n;f)\rightarrow E(x,f)$$ при $$n\rightarrow\infty$$. Однако и слева, и справа в формуле (19) стоят, вообще говоря, множества. Поэтому понятие сходимости в (19) требует обсуждения и определения.

    В силу классического закона больших чисел при $$n\rightarrow\infty$$$$\frac{1}{n}\sum_{i=1}^n f(x_i,y)\rightarrow Mf(x,y)$$ в смысле сходимости по вероятности, если правая часть существует (теорема А.Я. Хинчина, 1923 г.).

    Если пространство $$X$$ состоит из конечного числа элементов, то из соотношения (20) легко вытекает (см., например, [, с.192-193]), что$$\lim_{n\rightarrow\infty}P\{E_n(f)\subseteq E(x,f)\}=1.$$

    Другими словами, $$E_n(f)$$ является состоятельной оценкой $$E(x, f)$$.

    Если $$E(x, f)$$ состоит из одного элемента, $$E(x,f)={x_0}$$, то соотношение (21) переходит в следующее:$$\lim_{n\rightarrow\infty}P\{E_n(f)=\{x_0\}\}=1.$$

    Однако с прикладной точки зрения доказательство соотношений (21) - (22) не дает достаточной уверенности в возможности использования $$E_n(f)$$ в качестве оценки $$E(x,f)$$. Причина в том, что в процессе доказательства объем выборки предполагается настолько большим, что при всех $$y\in X$$ одновременно левые части соотношений (20) сосредотачиваются в непересекающихся окрестностях правых частей.

    , с.193-194]. Согласно этой теореме с вероятностью 1 эмпирическое среднее $$E_n(f)$$ входит в теоретическое среднее $$E(x,f)$$, начиная с некоторого объема выборки $$n$$, вообще говоря, случайного, $$n=n(\omega)$$. Мы не будем останавливаться на сходимости с вероятностью 1, поскольку в соответствующих постановках, подробно разобранных в монографии [], нет принципиальных отличий от случая сходимости по вероятности.

    Если $$X$$ не является конечным, например, $$X = R^1,$$ то соотношения (21) и (22) неверны. Поэтому необходимо искать иные формулировки закона больших чисел. В классическом случае сходимости выборочного среднего арифметического к математическому ожиданию, т.е. $$\overline{x}\rightarrow M(x)$$, можно записать закон больших чисел так: для любого $$\varepsilon>0$$ справедливо предельное соотношение$$\lim_{n\rightarrow\infty}P\{\overline{x}\in(M(x)-\varepsilon;M(x)+\varepsilon)\}=1.$$

    В этом соотношении в отличие от (21) речь идет о попадании эмпирического среднего $$E_n(f)=\overline{x}$$ не непосредственно внутрь теоретического среднего $$E(x,f)$$, а в некоторую окрестность теоретического среднего.

    Обобщим эту формулировку. Как задать окрестность теоретического среднего в пространстве произвольной природы? Естественно взять его окрестность, определенную с помощью какой-либо метрики. Однако полезно обеспечить на ее дополнении до $$X$$ отделенность множества значений $$Мf(x(\omega),y)$$ как функции $$y$$ от минимума этой функции на всем $$X$$.

    Поэтому мы сочли целесообразным определить такую окрестность с помощью самой функции $$Мf(x(\omega),y)$$.

    Определение 3. Для любого $$\varepsilon>0$$ назовем $$\varepsilon$$ -пяткой функции $$g(x)$$ множество$$K_{\varepsilon}(g)=\{x:g(x)<\inf\{d(y),y\in X\}+\varepsilon,x\in X\}.$$

    Таким образом, в $$\varepsilon$$ -пятку входят все те $$x$$, для которых значение $$g(x)$$ либо минимально, либо отличается от минимального (или от инфимума - точной нижней грани) не более чем на $$\varepsilon$$. Так, для $$X = R^1$$ и функции $$g(x) = х^2$$ минимум равен 0, а $$\varepsilon$$ -пятка имеет вид интервала $$(-\sqrt{\varepsilon};\sqrt{\varepsilon})$$. В формулировке (23) классического закона больших чисел утверждается, что при любом $$\varepsilon>0$$ вероятность попадания среднего арифметического в $$\sqrt{\varepsilon}$$ -пятку математического ожидания стремится к 1. Поскольку $$\varepsilon>0$$ произвольно, то вместо $$\sqrt{\varepsilon}$$ -пятки можно говорить о $$\varepsilon$$ -пятке, т.е. перейти от (23) к эквивалентной записи$$\lim_{n\rightarrow\infty}P\{\overline(x)\in K_{\varepsilon}(M(x(\omega)-x)^2)\}=1.$$

    Соотношение (24) допускает непосредственное обобщение на общий случай пространств произвольной природы.

    Схема закона больших чисел. Пусть $$x,x_1,x_2,x_3,...,x_n$$ - независимые одинаково распределенные случайные элементы со значениями в пространстве произвольной природы $$X$$ с показателем различия $$f: X^2\rightarrow R^1$$. Пусть выполнены некоторые математические условия регулярности. Тогда для любого $$\varepsilon>0$$ справедливо предельное соотношение$$\lim_{n\rightarrow\infty}P\{E_n(f)\subseteq K_{\varepsilon}(E(x,f))\}=1.$$

    Аналогичным образом может быть сформулирована и общая идея усиленного закона больших чисел. Ниже приведены две конкретные формулировки "условий регулярности".

    Законы больших чисел. Начнем с рассмотрения естественного обобщения конечного множества - бикомпактного пространства $$X$$.

    Теорема 3. В условиях теоремы 1 справедливо соотношение (25).

    Доказательство. Воспользуемся построенным при доказательстве теоремы 1 конечным открытым покрытием $${Z_1, Z_2, ..., Z_k}$$ пространства $$X$$ таким, что для него выполнено соотношение (3). Построим на его основе разбиение $$X$$ на непересекающиеся множества $$W_1, W_2, ..., W_m$$ (объединение элементов разбиения $$W_1, W_2, ..., W_m$$ составляет $$X$$ ). Это можно сделать итеративно. На первом шаге из $$Z_1$$ следует вычесть $$Z_2, ..., Z_k$$ - это и будет $$W_1$$. Затем в качестве нового пространства надо рассмотреть разность $$X$$ и $$W_1$$, а покрытием его будет $$\{Z_2, ..., Z_k}$$. И так до $$k$$ -го шага, когда последнее из рассмотренных покрытий будет состоять из единственного открытого множества $$Z_k$$. Остается из построенной последовательности $$W_1, W_2, ..., W_k$$ вычеркнуть пустые множества, которые могли быть получены при осуществлении описанной процедуры (поэтому, вообще говоря, $$m$$ может быть меньше $$k$$ ).

    В каждом из элементов разбиения $$W_1, W_2, ..., W_m$$ выберем по одной точке, которые назовем центрами разбиения и соответственно обозначим $$w_1, w_2, ..., w_m$$. Это и есть то конечное множество, которым можно аппроксимировать бикомпактное пространство $$X$$. Пусть $$y$$ входит в $$W_j$$. Тогда из соотношения (3) вытекает, что$$\left| \frac{1}{n}\sum_{i=1}^n f(x_i,y)-\frac{1}{n}\sum_{i=1}^n f(x_i,w_y) \right| <\varepsilon.$$

    Перейдем к доказательству соотношения (25). Возьмем произвольное $$\delta>0$$. Рассмотрим некоторую точку $$b$$ из $$E(x,f)$$. Доказательство будет основано на том, что с вероятностью, стремящейся к 1, для любого $$y$$ вне $$K_{\delta}(E(x,f))$$ выполнено неравенство$$\frac{1}{n}\sum_{i=1}^n f(x_i,y)>\frac{1}{n}\sum_{i=1}^n f(x_i,b).$$

    Для обоснования этого неравенства рассмотрим все элементы разбиения $$W_1, W_2, ..., W_m$$, имеющие непустое пересечение с внешностью $$\delta$$ -пятки $$K_{\delta}(E(x,f))$$. Из неравенства (26) следует, что для любого $$y$$ вне $$K_{\delta}(E(x,f))$$ левая часть неравенства (27) не меньше$$\min_j \left( \frac(1)(n)\sum_{i=1}^n f(x_i,w_j) \right) -\varepsilon,$$

    где минимум берется по центрам всех элементов разбиения, имеющим непустое пересечение с внешностью $$\delta$$ -пятки. Возьмем теперь в каждом таком разбиении точку $$v_i$$, лежащую вне $$\delta$$ -пятки $$K_{\delta}(E(x,f))$$. Тогда из неравенств (3) и (28) следует, что левая часть неравенства (27) не меньше$$\min_j \left( \frac(1)(n)\sum_{i=1}^n f(x_i,w_j) \right) -2\varepsilon,$$

    В силу закона больших чисел для действительнозначных случайных величин каждая из участвующих в соотношениях (27) и (29) средних арифметических имеет своими пределами соответствующие математические ожидания, причем в соотношении (29) эти пределы не менее$$Mf(x(\omega),b)+\delta-2\varepsilon,$$ поскольку точки $$v_i$$ лежат вне $$\delta$$ -пятки $$K_{\delta}(E(x,f))$$. Следовательно, при$$\delta-2\varepsilon>0$$

    и достаточно большом $$n$$, обеспечивающем необходимую близость рассматриваемого конечного числа средних арифметических к их математическим ожиданиям, справедливо неравенство (27).

    Из неравенства (27) следует, что пересечение $$E_n(f)$$ с внешностью $$K_{\delta}(E(x,f))$$ пусто. При этом точка $$b$$ может входить в $$E_n(f)$$, а может и не входить. Во втором случае $$E_n(f)$$ состоит из иных точек, входящих в $$K_{\delta}(E(x,f))$$. Теорема 3 доказана.

    Если $$X$$ не является бикомпактным пространством, то необходимо суметь оценить рассматриваемые суммы "на периферии", вне бикомпактного ядра, которое обычно выделяется естественным путем. Один из возможных комплексов условий сформулирован выше в теореме 2.

    Теорема 4. В условиях теоремы 2 справедлив закон больших чисел, т.е. соотношение (25).

    Доказательство. Будем использовать обозначения, введенные в теореме 2 и при ее доказательстве. Пусть $$r$$ и $$R$$, $$r<R$$ - положительные числа. Рассмотрим точку $$x$$ в шаре $$K(r)$$ и точку $$y$$ вне шара $$K(R)$$. Поскольку$$f(x_0,y)\le D\{f(x_0,x)+f(x,y)\},$$ то$$f(x,y)\ge\frac{1}{D}f(x_0,y)-f(x_0,x)\ge\frac{R}{D}-r.$$

    Положим$$g_n(x)=g_n(x,\omega)=\frac{1}{n}\sum_{i=1}^n f(x_i,x).$$

    Сравним $$g_n(x_0)$$ и $$g_n(y)$$. Выборку $$x_1,x_2,...,x_n$$ разобьем на две части. В первую часть включим те элементы выборки, которые входят в $$K(r)$$, во вторую - все остальные (т.е. лежащие вне $$K(r)$$ ). Множество индексов элементов первой части обозначим $$I = I(n,r)$$. Тогда в силу неотрицательности $$f$$ имеем$$g_n(y)\ge\frac{1}{n}\sum_{i\in I} f(x_i,y),$$ а в силу неравенства (30)$$\sum_{i\in I}f(x_i,y)\ge\left(\frac{R}{D}-r\right)CardI(n,r),$$ где $$Card I(n,r)$$ - число элементов в множестве индексов $$I(n,r)$$. Следовательно,$$g_n(y)\ge\frac{1}{n}\left(\frac{R}{D}-r\right)J,$$ где $$J = Card I(n,r)$$ - биномиальная случайная величина $$B(n,p)$$ с вероятностью успеха $$p=P\{x_i(\omega)\in K(r)\}$$. По теореме Хинчина для $$g_n(x_0)$$ справедлив классический закон больших чисел. Пусть $$\varepsilon>0$$. Выберем $$n_1=n_1(\varepsilon)$$ так, чтобы при $$n>n_1$$ было выполнено сооxтношение$$P\{g_n(x_0)-g(x_0)>\varepsilon\}<\varepsilon,$$ где $$g(x_0)=Mf(x_1,x_0)$$. Выберем $$r$$ так, чтобы вероятность успеха $$p>0,6$$. По теореме Бернулли можно выбрать $$n_2=n_2(\varepsilon)$$ так, чтобы при $$n>n_2$$$$P\{J>0,5n\}>1-\varepsilon.$$

    Выберем $$R$$ так, чтобы$$\frac12\left(\frac{R}{D}-r\right)>g(x_0)+\varepsilon.$$

    Тогда$$K_{\varepsilon}(g)\subseteq k(R)$$ и согласно (31), (32) и (33) при $$n>n_3=\max(n_1,n_2)$$ с вероятностью не менее $$1-\varepsilon$$ имеем$$g_n(y)^gt;g_n(x_0)$$ для любого $$y$$ вне $$K(R)$$. Из (34) следует, что минимизировать $$g_n$$ достаточно внутри бикомпактного шара $$K(R)$$, при этом $$E_n(f)$$ не пусто и$$E_n(f)\subseteq K(R)$$ с вероятностью не менее $$1-2\varepsilon$$.

    Пусть $$g'_n$$ и $$g'$$ - сужения $$g_n$$ и $$g(x)=Mf(x(\omega),x)$$ соответственно на $$K(R)$$ как функций от $$x$$. В силу (34) справедливо равенство $$K_{\varepsilon}(g')=K_{\varepsilon}(f)$$. Согласно доказанной выше теореме 3 найдется $$n_4=n_4(\omega)$$ такое, что$$P(K_0(g'_n)\subseteq K_{\varepsilon}(g))>1-\varepsilon.$$

    Согласно (36) с вероятностью не менее $$1-2\varepsilon$$$$K_0(g'_n)=E_n(f)$$ при $$n>n_3$$. Следовательно, при $$n>n_5(\varepsilon)=\max(n_3,n_4)$$ имеем$$P(E_n(f)\subseteq K_{\varepsilon}(g))>1-3\varepsilon,$$ что и завершает доказательство теоремы 4.

    Справедливы и иные варианты законов больших чисел, полученные, в частности, в статье [].

    Медиана Кемени и экспертные оценки. Рассмотрим на основе развитой выше теории частный случай пространств нечисловой природы - пространство бинарных отношений на конечном множестве $$Q=\{q_1,q_2,...,q_k\}$$ и его подпространства. Как известно, каждое бинарное отношение $$A$$ можно описать матрицей $$||a(i,j)||$$ из 0 и 1, причем $$a(i,j) = 1$$ тогда и только тогда $$q_i$$ и $$q_j$$ находятся в отношении $$A$$, и $$a(i,j) = 0$$ в противном случае.

    Определение 4. Расстоянием Кемени между бинарными отношениями $$A$$ и $$B$$, описываемыми матрицами $$||a(i,j)||$$ и $$||b(i,j)||$$ соответственно, называется$$d(A,B)=\sum_{i,j=1}^k|a(i,j)-b(i,j)|.$$

    Замечание. Иногда в определение расстояния Кемени вводят множитель, зависящий от $$k$$.

    Определение 5. Медианой Кемени для выборки, состоящей из бинарных отношений, называется эмпирическое среднее, построенное с помощью расстояния Кемени.

    Поскольку число бинарных отношений на конечном множестве конечно, то эмпирические и теоретические средние для произвольных показателей различия существуют и справедливы законы больших чисел, описанные формулами (21) и (22) выше.

    Бинарные отношения (в частности, упорядочения) часто используются для описания мнений экспертов. Тогда расстояние Кемени измеряет близость мнений экспертов, а медиана Кемени позволяет находить итоговое усредненное мнение комиссии экспертов. Расчет медианы Кемени обычно включают в информационное обеспечение систем принятия решений с использованием оценок экспертов. Речь идет, например, о математическом обеспечении автоматизированного рабочего места "Математика в экспертизе" (АРМ "МАТЭК"), предназначенного, в частности, для использования при проведении экспертиз в задачах экологического страхования. Поэтому представляет большой практический интерес численное изучение свойств медианы Кемени при конечном объеме выборки. Такое изучение дополняет описанную выше асимптотическую теорию, в которой объем выборки предполагается безгранично возрастающим $$(n\rightarrow\infty)$$.

    ]. В каждой серии методом статистических испытаний определенное число раз моделировался случайный и независимый выбор экспертных ранжировок, а затем находились все медианы Кемени для смоделированного набора мнений экспертов. При этом в сериях 1-5 распределение ответа эксперта предполагалось равномерным на множестве всех ранжировок. В серии 6 это распределение являлось монотонным относительно расстояния Кемени с некоторым центром (о понятии монотонности см. выше), т.е. вероятность выбора определенной ранжировки убывала с увеличением расстояния Кемени этой ранжировки от центра. Таким образом, серии 1-5 соответствуют ситуации, когда у экспертов нет почвы для согласия, нет группировки их мнений относительно некоторого единого среднего группового мнения, в то время как в серии 6 есть единое мнение - описанный выше центр, к которому тяготеют ответы экспертов.

    Результаты, приведенные в табл.5.5, можно комментировать разными способами. Неожиданным явилось большое число элементов в выборочной медиане Кемени - как среднее, так и особенно максимальное. Одновременно обращает на себя внимание убывание этих чисел при росте числа экспертов и особенно при переходе к ситуации реального существования группового мнения (серия 6). Достаточно часто один из ответов экспертов входит в медиану Кемени (т.е. пересечение множества ответов экспертов и медианы Кемени непусто), а диаметр медианы как множества в пространстве ранжировок заметно меньше диаметра множества ответов экспертов. По этим показателям - наилучшее положение в серии 6. Грубо говоря, всяческие "патологии" в поведении медианы Кемени наиболее резко проявляются в ситуации, когда ее применение не имеет содержательного обоснования, т.е. когда у экспертов нет основы для согласия, их ответы равномерно распределены на множестве ранжировок.

    Вычислительный эксперимент по изучению свойств медианы Кемени
    Номер серии 1 2 3 4 5 6
    Число испытаний 100 1000 50 50 1000 1000
    Количество объектов 5 5 7 7 5 5
    Количество экспертов 10 30 10 30 10 10
    Частота непустого пересечения 0,85 0,58 0,52 0,2 0,786 0,911
    Среднее отношение диаметров 0,283 0,124 0,191 0,0892 0,202 0,0437
    Средняя мощность медианы 5,04 2,41 6,4 2,88 3,51 1,35
    Максимальная мощность медианы 30 14 19 11 40 12

    Увеличение числа испытаний в 10 раз при переходе от серии 1 к серии 5 не очень сильно повлияло на приведенные в таблице характеристики, поэтому представляется, что суть дела выявляется при числе испытаний (в методе Монте-Карло), равном 100 или даже 50. Увеличение числа объектов или экспертов увеличивает число элементов в рассматриваемом пространстве ранжировок, а потому уменьшается частота попадания какого-либо из мнений экспертов внутрь медианы Кемени, а также отношение диаметра медианы к диаметру множества экспертов и число элементов медианы Кемени (среднее и максимальное). Можно сказать, что увеличение числа объектов или экспертов уменьшает степень дискретности задачи, приближает ее к непрерывному случаю, а потому уменьшает выраженность различных "патологий".

    Есть много интересных результатов, которые здесь не рассматриваются. Они связаны, в частности, со сравнением медианы Кемени с другими методами усреднения мнений экспертов, например, с нахождением итогового упорядочения по методу средних рангов [], а также с использованием малых окрестностей ответов экспертов для поиска входящих в медиану ранжировок, с теоретической и численной оценкой скорости сходимости в законах больших чисел.

    5.6. Непараметрические оценки плотности

    Эмпирическая функция распределения - это состоятельная непараметрическая оценка функции распределения числовой случайной величины. А как оценить плотность? Если продифференцировать эмпирическую функцию распределения, то получим бесконечности в точках, соответствующих элементам выборки, и 0 во всех остальных. Ясно, что это не оценка плотности.

    Как же действовать? Каждому элементу выборки соответствует в эмпирическом распределении вероятность $$1/n$$, где $$n$$ - объем выборки. Целесообразно эту вероятность не помещать в одну точку, а "размазать" вокруг нее, построив "холмик". Если "холмики" налегают друг на друга, то получаем положительную плотность на всей прямой. Чтобы получить состоятельную оценку плотности, необходимо выбирать ширину "холмика" в зависимости от объема выборки. При этом число "холмиков", покрывающих фиксированную точку, должно безгранично расти. Но одновременно доле таких "холмиков" следует убывать, поскольку покрывающие "холмики" должны быть порождены лишь ближайшими членами вариационного ряда.

    Реализация описанной идеи привела к различным вариантам непараметрических оценок плотности. Основополагающей является работа Н.В.Смирнова 1951 г. []. Вначале рассматривались непараметрические оценки плотности распределения числовых случайных величин и конечномерных случайных векторов. В 1980-х годах удалось сконструировать такие оценки в пространствах произвольной природы [], а затем и для конкретных видов нечисловых данных [].

    Сначала рассмотрим непараметрические оценки плотности в наиболее общей ситуации. В статистике нечисловых данных выделяют общую теорию и статистику в конкретных пространствах нечисловой природы (например, статистику ранжировок). В общей теории есть два основных сюжета. Один связан со средними величинами и асимптотическим поведением решений экстремальных статистических задач, второй - с непараметрическими оценками плотности. Первый сюжет только что рассмотрен, второму посвящена заключительная часть настоящей лекции.

    Понятие плотности в пространстве произвольной природы $$X$$ требует специального обсуждения. В пространстве $$X$$ должна быть выделена некоторая специальная мера $$\mu$$, относительно которой будут рассматриваться плотности, соответствующие другим мерам, например, мере $$\nu$$, задающей распределение вероятностей некоторого случайного элемента $$\xi$$. В таком случае $$\nu(A)=Р(\xi\in A)$$ для любого случайного события $$A$$. Плотность $$f(x)$$, соответствующая мере $$\nu$$ - это такая функция, что$$\nu(A)=\int\limits_A f(x)s\mu$$

    для любого случайного события $$A$$. Для случайных величин и векторов мера $$\mu$$ - это объем множества $$A$$, в математических терминах - мера Лебега. Для дискретных случайных величин и элементов со значениями в конечном множестве $$X$$ в качестве меры $$\mu$$ естественно использовать считающую меру, которая событию $$A$$ ставит в соответствие число его элементов. Используют также нормированную случайную меру, когда число точек в множестве $$A$$ делят на число точек во всем пространстве $$X$$. В случае считающей меры значение плотности в точке $$x$$ совпадает с вероятностью попасть в точку $$x$$, т.е. $$f(x)=P(\xi=x)$$. Таким образом, с рассматриваемой точки зрения стирается грань между понятиями "плотность вероятности" и "вероятность (попасть в точку)".

    Как могут быть использованы непараметрические оценки плотности распределения вероятностей в пространствах нечисловой природы? Например, для решения задач классификации (диагностики, распознавания образов - см. лекцию 9). Зная плотности распределения классов, можно решать основные задачи диагностики - как задачи выделения кластеров, так и задачи отнесения вновь поступающего объекта к одному из диагностических классов. В задачах кластер-анализа можно находить моды плотности и принимать их за центры кластеров или за начальные точки итерационных методов типа $$k$$ -средних или динамических сгущений. В задачах собственно диагностики (дискриминации, распознавания образов с учителем) можно принимать решения о диагностике объектов на основе отношения плотностей, соответствующих классам. При неизвестных плотностях представляется естественным использовать их состоятельные оценки.

    Методы оценивания плотности вероятности в пространствах общего вида предложены и первоначально изучены в работе []. В частности, в задачах диагностики объектов нечисловой природы предлагаем использовать непараметрические ядерные оценки плотности типа Парзена-Розенблатта (этот вид оценок и его название впервые были введены в статье [] ). Они имеют вид:$$f_n(x)=\frac{1}{\eta_n(h_n,x)}\sum_{1\le i\le n}K(\frac{d(x_i,x)}{h_n}),$$ где $$K:R_+^1\rightarrow R^1$$ - так называемая ядерная функция, $$x_1, x_2, ..., x_n\in X$$ - выборка, по которой оценивается плотность, $$d(x_i,x)$$ - показатель различия (метрика, расстояние, мера близости) между элементом выборки $$x_i$$ и точкой $$x$$, в которой оценивается плотность, последовательность $$h_n$$ показателей размытости такова, что $$h_n\rightarrow 0$$ и $$nh_n\rightarrow\infty$$ при $$n\rightarrow\infty$$, а $$\eta_n(h_n,x)$$ - нормирующий множитель, обеспечивающий выполнение условия нормировки (интеграл по всему пространству от непараметрической оценки плотности $$f_n(x)$$ по мере $$\mu$$ должен равняться 1). Ранее американские исследователи Парзен и Розенблатт использовали подобные статистики в случае $$X=R^1$$ с $$d(x_i,x)=|x_i-x|$$.

    Введенные описанным образом ядерные оценки плотности - частный случай так называемых линейных оценок, также впервые предложенных в работе []. В теоретическом плане они выделяются тем, что удается получать результаты такого же типа, что в классическом одномерном случае, но, разумеется, с помощью совсем иного математического аппарата.

    Свойства непараметрических ядерных оценок плотности. Рассмотрим выборку со значениями в некотором пространстве произвольного вида. В этом пространстве предполагаются заданными показатель различия $$d$$ и мера $$\mu$$. Одна из основных идей рассматриваемого подхода состоит в том, чтобы согласовать их между собой. А именно, на их основе построим новый показатель различия $$d_1$$, так называемый "естественный", в терминах которого проще формулируются свойства непараметрической оценки плотности. Для этого рассмотрим шары $$L_t(x)=\{y\in X:d(y,x)\le t\}$$ радиуса $$t\ge 0$$ и их меры $$F_x(t)=\mu(L_t(x))$$. Предположим, что $$F_x(t)$$ как функция $$t$$ при фиксированном $$x$$ непрерывна и строго возрастает. Введем функцию $$d_1(x,y)=F_x(d(x,y))$$. Это - монотонное преобразование показателя различия или расстояния, а потому $$d_1(x,y)$$ - также показатель различия (даже если $$d$$ - метрика, для $$d_1$$ неравенство треугольника может быть не выполнено). Другими словами, $$d_1(x,y)$$, как и $$d(x,y)$$, можно рассматривать как показатель различия (меру близости) между $$x$$ и $$y$$.

    Для вновь введенного показателя различия $$d_1(x,y)$$ введем соответствующие шары $$L_{1t}= \{y\in X:d_1(y,x)\le t\}$$. Поскольку обратная функция $$F^{-1}_x(t)$$ определена однозначно, то$$L_{1t}(x)=\{y\in X:d_1(y,x)\le F_x^{-1}(t)\}=L_T(x),$$ где $$T = F^{-1}_x(t)$$. Следовательно, справедлива цепочка равенств $$F^1_х(t) = \mu(L_{1t}(x)) = \mu(L_T(x)) = F_x(F^{-1}_x(t))=t$$ (для всех тех значений параметра $$t$$, для которых определены все участвующие в записи математические объекты).

    Переход от $$d$$ к $$d_1$$ напоминает классическое преобразование, использованное Н.В. Смирновым при изучении непараметрических критериев согласия и однородности, а именно, преобразование $$\eta=F(\xi)$$, переводящее случайную величину $$\xi$$ с непрерывной функцией распределения $$F(x)$$ в случайную величину $$\eta$$, равномерно распределенную на отрезке [0,1]. Оба рассматриваемых преобразования существенно упрощают дальнейшие рассмотрения. Преобразование $$d_1= F_x(d)$$ зависит от точки $$x$$, что не влияет на дальнейшие рассуждения, поскольку ограничиваемся изучением сходимости в отдельно взятой точке.

    Функцию $$d_1(x,y)$$, для которой мера шара радиуса $$t$$ равна $$t$$, называем в соответствии с работой [] "естественным показателем различия" или "естественной метрикой". В случае конечномерного пространства $$R^k$$ и евклидовой метрики $$d$$ имеем $$d_1(x,y) = c_k d^k(x,y)$$, где $$c_k$$ - объем шара единичного радиуса в $$R^k$$.

    Поскольку можно записать, что$$K \left( \frac{d(x_i,x)}{h_n} \right)= K_1 \left( \frac{d_1(x_i,x)}{h_n} \right), \text{ где } K_1(u)=K \left( \frac{F_x^{-1}(uh_n)}{h_n} \right),$$ то переход от одного показателя различия к другому, т.е. от $$d$$ к $$d_1$$, соответствует переходу от одной ядерной функции к другой, т.е. от $$K$$ к $$K_1$$. Выгода от такого перехода заключается в том, что утверждения о поведении непараметрических оценок плотности приобретают более простую формулировку.

    Теорема 5. Пусть $$d$$ - естественная метрика, плотность $$f$$ непрерывна в точке $$x$$ и ограничена на всем пространстве $$X$$, причем $$f(x)>0$$, ядерная функция $$K(u)$$ удовлетворяет простым условиям регулярности$$\int\limits_0^1 K(u)du=1, \int\limits_0^{infty} (|K(u)|+K^2(u))du<\infty.$$

    Тогда $$\eta_n(h_n,x)=nh_n$$, оценка $$f_n(x)$$ является состоятельной, т.е. $$f_n(x)\rightarrow f(x)$$ по вероятности при $$n\rightarrow\infty$$ и, кроме того,$$\lim_{n\rightarrow\infty}(nh_nDf_n(x))=f(x)\int\limits_0^{+\infty}K^2(u)du.$$

    Теорема 5 доказывается методами, развитыми в работе []. Однако остается открытым вопрос о скорости сходимости ядерных оценок, в частности, о поведении величины $$\alpha_n= M(f_n(x)-f(x))^2$$ - среднего квадрата ошибки, и об оптимальном выборе показателей размытости $$h_n$$. Для того, чтобы продвинуться в решении этого вопроса, введем новые понятия. Для случайного элемента $$X(\omega)$$ со значениями в $$X$$ рассмотрим так называемое круговое распределение $$G(x,t) = P\{d(X(\omega),x)\le t\}$$ и круговую плотность $$g(x,t)= G'_t(x,t)$$.

    Теорема 6. Пусть ядерная функция $$K(u)$$ непрерывна и финитна, т.е. существует число $$E$$ такое, что $$K(u)=0$$ при $$u>E$$. Пусть круговая плотность является достаточно гладкой, т.е. допускает разложение$$g(x,t)=f(x)+tg'_t(x,0)+\frac{t^2}{2}g''_{tt}(x,0)+\frac{t^3}{3!}g'''_{ttt}(x,0)+...+\frac{t^k}{k!}g_{t^{(k)}}^{(k)}(x,0)+o(h_n^k)$$ при некотором $$k$$, причем остаточный член равномерно ограничен на $$[0,hE]$$.

    Пусть$$\int\limits_0^E u^i K(u)du=0,i=1,2,...,k-1.$$

    Тогда$$\begin{gathered} \alpha_n=[Mf_n(x)-f(x)]^2+Df_n(x)= \\ =h_n^{2k}\left(\int\limits_0^E u^k K(u)du\right)^2 (g_{t^{(k)}}^k(x,0))^2+\frac{f(x)}{nh_n}\int\limits_0^E K^2(u)du+\\ +o\left(h_n^{2k}+\frac{1}{nh_n}\right). \end{gathered}$$

    Доказательство теоремы 6 проводится с помощью разработанной в статистике объектов нечисловой природы математической техники, образцы которой представлены, в частности, в работе []. Если коэффициенты при основных членах в правой части последней формулы не равны 0, то величина $$\alpha n$$ достигает минимума, равного $$\alpha_n=O\left(n^{-1+\frac{1}{2k+1}}\right)$$ при $$h_n=n^{-\frac{1}{2k+1}}$$. Эти выводы совпадают с классическими результатами, полученными ранее рядом авторов для весьма частного случая прямой $$X = R^1$$ (см., например, монографию [, с.316]). Заметим, что для уменьшения смещения оценки приходится применять знакопеременные ядра $$K(u)$$.

    Непараметрические оценки плотности в конечных пространствах []. В случае пространств из конечного числа элементов естественных метрик не существует. Однако можно получить аналоги теорем 5 и 6, переходя к пределу не только по объему выборки $$n$$, но и по новому параметру дискретности $$m$$.

    Рассмотрим некоторую последовательность $$Xm, m=1,2,..$$., конечных пространств. Пусть в $$X_m$$ заданы показатели различия $$d_m$$. Будем использовать нормированные считающие меры ставящие в соответствие каждому подмножеству $$A$$ долю элементов всего пространства $$X_m$$, входящих в $$A$$. Как и ранее, рассмотрим как функцию $$t$$ объем шара радиуса $$t$$, т.е.$$F_{mx}(t)=\mu_m(\{y\in X_m:d_m(x,y)\le t\}).$$

    Введем аналог естественного показателя различия $$d_{1m}(x,y)=F_{mx}(d_m(x,y))$$. Наконец, рассмотрим аналоги преобразования Смирнова $$F_{mx}^1(t)=\mu_m(\{y\in X_m:d_{1m}(x,y)\le t\})$$. Функции $$F_{mx}^1(t)$$, в отличие от ранее рассмотренной ситуации, уже не совпадают тождественно с $$t$$, они кусочно-постоянны и имеют скачки в некоторых точках $$t_i, i=1,2,..$$., причем в этих точках $$F_{mx}^1(t_i)=t_i$$.

    Теорема 7. Пусть точки скачков равномерно сближаются, т.е. $$\max(t_i-t_{i-1}) \rightarrow 0$$ при $$m\rightarrow\infty$$ (другими словами, $$\sup|F_{mx}^1(t)-t| \rightarrow 0$$ при $$m\rightarrow\infty$$ ). Тогда существует последовательность параметров дискретности $$m_n$$ такая, что при предельном переходе $$n\rightarrow\infty, m\rightarrow\infty, m\ge m_n$$ справедливы заключения теорем 5 и 6.

    ]) аксиоматическое введение метрики $$d(A,B)=card(A\Delta B)/2^m$$ где $$\Delta$$ - символ симметрической разности множеств. Рассмотрим непараметрическую ядерную оценку плотности типа Парзена-Розенблатта$$f_{nm}(A)=\frac{1}{nh_n}\sum_{i=1}^n K \left( \frac{1}{h_n}\Phi \left( \frac{2card(A\Delta X_i)-m}{\sqrt{m}} \right) \right),$$ где $$\Phi(\cdot)$$ - функция нормального стандартного распределения. Можно показать, что эта оценка удовлетворяет условиям теоремы 7 с $$m_n=(\ln n)^6$$.

    Пример 2. Рассмотрим пространство функций $$f:Y_r\rightarrow Z_q$$ определенных на конечном множестве $$Y_r=\{1/r,2/r,...,(r-1)/r,\;1\}$$, со значениями в конечном множестве $$Z_q=\{0,1/q,2/q,...,(q-1)/q,1\}$$. Это пространство можно интерпретировать как пространство нечетких множеств (см. лекцию 1), а именно, $$Y_r$$ - носитель нечеткого множества, а $$Z_q$$ - множество значений функции принадлежности. Очевидно, число элементов пространства $$X_m$$ равно $$(q+1)^r$$. Будем использовать расстояние $$d(f,g)=\sup|f(y)-g(y)|$$. Непараметрическая оценка плотности имеет вид:$$f_{nm}(x)=\frac{1}{nh_n}\sum_{i=1}^n K \left( \frac{[2\sup_y|x(y)-x_i(y)|+1/q]^r}{h_n(1+1/q)^r} \right).$$

    Если $$r=n^\alpha, q=n^{\beta}$$, то при $$\beta>\alpha$$ выполнены условия теоремы 7, а потому справедливы теоремы 5 и 6.

    Пример 3. Рассматривая пространства ранжировок $$m$$ объектов, в качестве расстояния $$d(A,B)$$ между ранжировками $$A$$ и $$B$$ примем минимальное число инверсий, необходимых для перехода от $$A$$ к $$B$$. Тогда $$\max(t_i - t_{i-1})$$ не стремится к 0 при $$m\rightarrow\infty$$, условия теоремы 7 не выполнены.

    Пример 4. В прикладных работах наиболее распространенный пример объектов нечисловой природы - вектор разнотипных данных: реальный объект описывается вектором, часть координат которого - значения количественных признаков, а часть - качественных (номинальных и порядковых). Для пространств разнотипных признаков, т.е. декартовых произведений непрерывных и дискретных пространств, возможны различные постановки. Пусть, например, число градаций качественных признаков остается постоянным. Тогда непараметрическая оценка плотности сводится к произведению двух величин - частоты попадания в точку в пространстве качественных признаков и классической оценки типа Парзена-Розенблатта в пространстве количественных переменных. В общем случае расстояние $$d(x,y)$$ можно, например, рассматривать как сумму трех расстояний. А именно, евклидова расстояния $$d_1$$ между количественными факторами, расстояния $$d_2$$ между номинальными признаками $$(d_2(x,y) = 0$$, если $$x = y$$, и $$d_2(x,y) = 1$$, если $$x\ne y$$ ) и расстояния $$d_3$$ между порядковыми переменными (если $$x$$ и $$y$$ - номера градаций, то $$d3(x,y)=|x-y|)$$. Наличие количественных факторов приводит к непрерывности и строгому возрастанию функции $$F_{mx}(t)$$, а потому для непараметрических оценок плотности в пространствах разнотипных признаков верны теоремы 5 - 6.

    Программная реализация описания числовых данных с помощью непараметрических оценок плотности включена в ряд программных продуктов по прикладной статистике, в частности, в пакет программ анализа данных ППАНД [].

    Контрольные вопросы и задачи

  • Часто ли результаты измерений имеют нормальное распределение?
  • По выборке фактических данных о величине годового дохода (в тыс. долл.), взятых на конец 1970-х гг. (США), постройте вариационный ряд, гистограмму (группируя данные по 6-ти равным интервалам); определите выборочные среднее арифметическое, медиану и моду:$$\begin{gathered} 2,0; 13,4; 2,2; 6,7; 11,1; 10,0; 2,6; 12,9; 10,5; 9,2; 11,1; \\ 14,0; 26,0; 17,5; 7,2; 18,7; 9,9; 7,6; 11,7;11,3; 6,5. \end{gathered}$$
  • Дано распределение по градациям (табл.1) почасовой заработной платы 303 рабочих, занятых в промышленности ( $$f_i$$ - число рабочих, имеющих почасовую заработную плату $$x_i$$ ). Постройте эмпирическую функцию распределения, найдите выборочные медиану, моду и среднее арифметическое.
    Распределение рабочих по ставкам почасовой оплаты
    $$x_i$$ 2,5 2,6 2,7 2,8 2,9 3,0 3,1 3,2 3,3 3,4
    $$f_i$$ 10 25 41 74 58 34 17 14 11 3
  • Какие средние величины целесообразно использовать при расчете средней заработной платы (или среднего дохода)?
  • Постройте пример, показывающий некорректность использования среднего арифметического $$f(X_1, X_2) = (X_1 + X_2)/2$$ в порядковой шкале, используя допустимое преобразование $$g(x) = x^2$$ (при положительных усредняемых величинах $$x$$ ).
  • Постройте пример, показывающий некорректность использования среднего геометрического в порядковой шкале. Другими словами, приведите пример чисел $$x_1, x_2, y_1, y_2$$ и строго возрастающего преобразования $$f:R^1\rightarrow R^1$$ таких, что$$(x_1x_2)^{1/2}<(y_1y_2)^{1/2},[f(x_1)f(x_2)]^{1/2}>[f(y_1)f(y_2)]^{1/2}.$$
  • Приведите пример чисел $$x_1, x_2, y_1, y_2$$ и строго возрастающего преобразования $$f: R^1 \rightarrow R^1$$ таких, что$$\begin{gathered} {[}(x_1)^2+(x_2)^2]^{1/2}<[(y_1)^2+(y_2)^2]^{1/2}, \\ [(f(x_1))^2+(f(x_2))^2]^{1/2}>[(y(y_1))^2+(f(y_2))^2]^{1/2}. \end{gathered}$$
  • Какая математическая модель используется для описания случайного множества?
  • Как соотносятся эмпирические и теоретические средние для числовых данных и в пространствах произвольной природы?
  • Почему описание числовых данных с помощью непараметрических оценок плотности предпочтительнее их описания с помощью гистограмм?
  • Темы докладов, рефератов, исследовательских работ

  • Проведите описание данных, приведенных в табл.5.1 (п.5.2). Постройте таблицы (типа табл.5.2 и 5.3 там же), рассчитайте выборочные характеристики.
  • Показатели разброса, связи, показатели различия (в том числе метрики) в порядковой шкале.
  • Ранговые методы математической статистики как инвариантные методы анализа порядковых данных.
  • Показатели разброса, связи, показатели различия (в том числе метрики) в шкале интервалов.
  • Показатели разброса, связи, показатели различия (в том числе метрики) в шкале отношений.
  • Теорема В.В. Подиновского: любое изменение коэффициентов весомости единичных показателей качества продукции приводит к изменению упорядочения изделий по средневзвешенному показателю.
  • Вероятностные модели бинарных отношений.
  • Вероятностные модели парных сравнений.
  • Средние и законы больших чисел в пространстве упорядочений.
  • Непараметрические оценки плотности в непрерывных и дискретных пространствах.
  • Вернуться к учебному плану