Прикладная статистика

Различные виды статистических данных

Разбить на страницы
Показывать лекцию целиком

1.1. Количественные и категоризованные данные

Методы прикладной статистики - это методы анализа данных, причем обычно достаточно большого их количества. Статистические данные могут иметь различную природу. Исторически самыми ранними были два вида данных - сведения о числе объектов, удовлетворяющих тем или иным условиям, и числовые результаты измерений.

Первый из этих видов до сих пор главенствует в сборниках государственных статистических органов. Такого рода данные часто называют категоризованными, поскольку о каждом из рассматриваемых объектов известно, в какую из нескольких заранее заданных категорий он попадает. Примером является информация Росстата о населении страны, с разделением по возрастным категориям и полу. Часто при составлении таблиц жертвуют информацией, заменяя точное значение измеряемой величины на указание интервала группировки, в которую это значение попадает. Например, вместо точного возраста человека используют лишь один из указанных в таблице возрастных интервалов.

Второй наиболее распространенный вид - количественные данные, рассматриваемые как действительные числа. Таковы результаты измерений, наблюдений, испытаний, опытов, анализов. Количественные данные обычно описываются набором чисел (выборкой), а не таблицей.

Нельзя утверждать, что категоризованные данные соответствуют первому этапу исследования, а числовые - следующему, на котором используются более совершенные методы измерения. Дело в том, что человеку свойственно давать качественные ответы на возникающие в его практической деятельности вопросы. Примером является используемая А.А. Пивнем таблица сильных и слабых сторон внутренней среды конкретной компании (табл.1.1).

Ясно, что вполне можно превратить в числа значения признаков, названия которых приведены в столбце "Показатели компании", однако этот переход будет зависеть от исследователя, носить неизбежный налет субъективизма.

Иногда не удается однозначно отнести данные к категоризованным или количественным. Например, в Ветхом Завете, в Четвертой книге Моисея "Числа" указывается количество воинов в различных коленах. С одной стороны, это типичные категоризованные данные, градациями служат названия колен. С другой стороны, эти данные можно рассматривать как количественные, как выборку, их вполне естественно складывать, вычислять среднее арифметическое и т.п.

Описанная ситуация типична. Существует весьма много различных видов статистических данных. Это связано, в частности, со способами их получения. Например, если испытания некоторых технических устройств продолжаются до определенного момента, то получаем так называемые цензурированные данные, состоящие из набора чисел - продолжительности работы ряда устройств до отказа, и информации о том, что остальные устройства продолжали работать в момент окончания испытания. Такого рода данные часто используются при оценке и контроле надежности технических устройств.

Описание вида данных и, при необходимости, механизма их порождения - начало любого статистического исследования.

В простейшем случае статистические данные - это значения некоторого признака, свойственного изучаемым объектам. Значения могут быть количественными или представлять собой указание на категорию, к которой можно отнести объект. Во втором случае говорят о качественном признаке. Используют и более сложные признаки, перечень которых будет расширяться по мере развертывания изложения в учебнике.

При измерении по нескольким количественным или качественным признакам в качестве статистических данных об объекте получаем вектор. Его можно рассматривать как новый вид данных. В таком случае выборка состоит из набора векторов. Если часть координат - числа, а часть - качественные (категоризованные) данные, то говорим о векторе разнотипных данных.

Одним элементом выборки, т.е. одним измерением, может быть и функция в целом. Например, электрокардиограмма больного или амплитуда биений вала двигателя, или временной ряд, описывающий динамику показателей определенной фирмы. Тогда выборка состоит из набора функций.

Элементами выборки могут быть и бинарные отношения. Например, при опросах экспертов часто используют упорядочения (ранжировки) объектов экспертизы - образцов продукции, инвестиционных проектов, вариантов управленческих решений. В зависимости от регламента экспертного исследования элементами выборки могут быть различные виды бинарных отношений (упорядочения, разбиения, толерантности), множества, нечеткие множества и т.д.

Итак, математическая природа элементов выборки в различных задачах прикладной статистики может быть самой разной. Однако можно выделить два класса статистических данных - числовые и нечисловые. Соответственно прикладная статистика разбивается на две части - числовую и нечисловую.

Числовые статистические данные - это числа, векторы, функции. Их можно складывать, умножать на коэффициенты. Поэтому в числовой статистике большое значение имеют разнообразные суммы. Математический аппарат анализа сумм случайных элементов выборки – это (классические) законы больших чисел и центральные предельные теоремы (см. лекцию 4).

Нечисловые статистические данные - это категоризованные данные, векторы разнотипных признаков, бинарные отношения, множества, нечеткие множества и др. Их нельзя складывать и умножать на коэффициенты. Поэтому не имеет смысла говорить о суммах нечисловых статистических данных. Они являются элементами нечисловых математических пространств (множеств). Математический аппарат анализа нечисловых статистических данных основан на использовании расстояний между элементами (а также мер близости, показателей различия) в таких пространствах. С помощью расстояний определяются эмпирические и теоретические средние, доказываются законы больших чисел, строятся непараметрические оценки плотности распределения вероятностей, решаются задачи диагностики и кластерного анализа, и т.д. (см. лекцию 11).

Сведем информацию об основных областях прикладной статистики в табл.1.2. Отметим, что модели порождения цензурированных данных входят в состав каждой из рассматриваемых областей.

Оценка сильных и слабых сторон внутренней среды компании
Показатели компании Оценка показателя (по отношению к предприятиям отрасли) Важность (вес)
Очень высокая Высокая Средняя Низкая Очень низкая Высокая Средняя Низкая
1 2 3 4 5 6 7 8 9
Финансы
1. Оценка структуры активов Х Х
2. Инвестиционная привлекательность Х Х
3. Доход на активы Х Х
4. Норма прибыли Х Х
5. Доход на вложенный капитал Х Х
Производство
1. Использование оборудования Х Х
2. Производственные мощности Х Х
3. Численность персонала Х Х
4. Система контроля качества Х Х
5. Возможность расширения производства Х Х
6. Износ оборудования Х Х
Организация и управление
1. Численность ИТР и управленческого персонала Х Х
2. Скорость реакции управления на изменения во внешней среде Х Х
3. Четкость разделения полномочий и функций Х Х
4. Качество используемой в управлении информации Х Х
5. Гибкость оргструктуры управления Х Х
Маркетинг
1. Доля рынка Х Х
2. Репутация компании Х Х
3. Престиж торговой марки Х Х
4. Стимулирование сбыта Х Х
5. Численность сбытового персонала Х Х
6. Уровень цен Х Х
7. Уровень сервиса Х Х
8. Число клиентов Х Х
9. Качество поступающей информации Х Х
Кадровый состав
1. Уровень квалификации производственного персонала Х Х
2. Расходы по подготовке и переподготовке персонала Х Х
3. Уровень подготовке сбытового персонала в технической области Х Х
Технология
1. Применяемые стандарты Х Х
2. Новые продукты Х Х
3. Расходы на НИОКР Х Х
Области прикладной статистики
№ п/п Вид статистических данных Область прикладной статистики
1 Числа Статистика (случайных) величин
2 Конечномерные векторы Многомерный статистический анализ
3 Функции Статистика случайных процессов и временных рядов
4 Объекты нечисловой природы Статистика нечисловых данных (статистика объектов нечисловой природы)

1.2. Основные шкалы измерения

Почему необходима теория измерений? Теория измерений (в дальнейшем сокращенно ТИ) является одной из составных частей прикладной статистики. Она входит в состав статистики объектов нечисловой природы.

Использование чисел в жизни и хозяйственной деятельности людей отнюдь не всегда предполагает, что их можно складывать и умножать, производить иные арифметические действия. Что бы вы сказали о человеке, который занимается умножением телефонных номеров? И отнюдь не всегда 2+2=4. Если вы вечером поместите в клетку двух животных, а потом еще двух, то отнюдь не всегда можно утром найти в этой клетке четырех животных. Их может быть и намного больше - если вечером вы загнали в клетку овцематок или беременных кошек. Их может быть и меньше - если к двум волкам вы поместили двух ягнят. Числа используются гораздо шире, чем арифметика.

Так, например, мнения экспертов часто выражены в порядковой шкале (подробнее о шкалах говорится ниже), т.е. эксперт может сказать (и обосновать), что один показатель качества продукции более важен, чем другой, первый технологический объект более опасен, чем второй, и т.д. Но он не в состоянии сказать, во сколько раз или на сколько более важен, соответственно – более опасен. Экспертов часто просят дать ранжировку (упорядочение) объектов экспертизы, т.е. расположить их в порядке возрастания (или убывания) интенсивности интересующей организаторов экспертизы характеристики. Ранг - это номер объекта экспертизы в упорядоченном ряду значений характеристики у различных объектов. Такой ряд в статистике называется вариационным. Формально ранги выражаются числами 1, 2, 3, ..., но с этими числами нельзя совершать привычные арифметические операции. Например, хотя в арифметике 1 + 2 = 3, нельзя утверждать, что для объекта, стоящем на третьем месте в упорядочении, интенсивность изучаемой характеристики равна сумме интенсивностей объектов с рангами 1 и 2. Так, один из видов экспертного оценивания - оценки учащихся. Вряд ли кто-либо будет утверждать, что знания отличника равны сумме знаний двоечника и троечника (хотя 5 = 2 + 3), хорошист соответствует двум двоечникам (2 + 2 = 4), а между отличником и троечником такая же разница, как между хорошистом и двоечником (5 – 3 = 4 – 2). Поэтому очевидно, что для анализа подобного рода качественных данных необходима не всем известная арифметика, а другая теория, дающая базу для разработки, изучения и применения конкретных методов расчета. Это и есть теория измерений (ТИ).

При чтении литературы надо иметь в виду, что в настоящее время термин "теория измерений" применяется для обозначения целого ряда научных дисциплин. А именно – классической метрологии (науки об измерениях физических величин), рассматриваемой здесь ТИ, некоторых других направлений, например, алгоритмической теории измерений. Обычно из контекста понятно, о какой конкретно теории идет речь.

Краткая история теории измерений. Сначала ТИ развивалась как теория психофизических измерений. В послевоенных публикациях американский психолог С.С. Стивенс основное внимание уделял шкалам измерения. Во второй половине ХХ в. сфера применения ТИ стремительно расширяется. Посмотрим, как это происходило. Один из томов выпущенной в США в 1950-х гг. "Энциклопедии психологических наук" назывался "Психологические измерения". Значит, составители этого тома расширили сферу применения РТИ с психофизики на психологию в целом. А в основной статье в этом сборнике под названием, обратите внимание, "Основы теории измерений", изложение шло на абстрактно-математическом уровне, без привязки к какой-либо конкретной области применения. В этой статье [] упор был сделан на "гомоморфизмах эмпирических систем с отношениями в числовые" (в эти математические термины здесь вдаваться нет необходимости), и математическая сложность изложения возросла по сравнению с работами С.С. Стивенса.

Уже в одной из первых отечественных статей по РТИ (конец 1960-х гг.) было установлено, что баллы, присваиваемые экспертами при оценке объектов экспертизы, измерены, как правило, в порядковой шкале. Отечественные работы, появившиеся в начале 1970-х гг., привели к существенному расширению области использования РТИ. Ее применяли в педагогической квалиметрии (измерении качества знаний учащихся), в системных исследованиях, в различных задачах теории экспертных оценок, для агрегирования показателей качества продукции, в социологических исследованиях, и др.

Итоги этого этапа были подведены в монографии []. В качестве двух основных проблем РТИ наряду с установлением типа шкалы измерения конкретных данных был выдвинут поиск алгоритмов анализа данных, результат работы которых не меняется при любом допустимом преобразовании шкалы (т.е. является инвариантным относительно этого преобразования).

Метрологи вначале резко возражали против использования термина "измерение" для качественных признаков. Однако постепенно возражения сошли на нет, и к концу ХХ в. ТИ стала рассматриваться как общенаучная теория.

Шесть типов шкал. В соответствии с ТИ при математическом моделировании реального явления или процесса следует прежде всего установить типы шкал, в которых измерены те или иные переменные. Тип шкалы задает группу допустимых преобразований шкалы. Допустимые преобразования не меняют соотношений между объектами измерения. Например, при измерении длины переход от аршинов к метрам не меняет интересующих исследователя соотношений между длинами рассматриваемых объектов - если первый объект длиннее второго, то это будет установлено и при измерении в аршинах, и при измерении в метрах. Обратите внимание, что при этом численное значение длины в аршинах отличается от численного значения длины в метрах - не меняется лишь результат сравнения длин двух объектов.

Укажем основные виды шкал измерения и соответствующие группы допустимых преобразований.

В шкале наименований (другое название этой шкалы - номинальная - переписанное русскими буквами английское название шкалы) допустимыми являются все взаимно-однозначные преобразования. В этой шкале числа используются лишь как метки. Примерно так же, как при сдаче белья в прачечную, т.е. лишь для различения объектов. В шкале наименований измерены, например, номера телефонов, автомашин, паспортов, студенческих билетов, страховых свидетельств государственного пенсионного страхования, медицинского страхования, ИНН (индивидуальный номер налогоплательщика). Пол людей также измерен в шкале наименований, результат измерения принимает два значения - мужской, женский. Раса, национальность, цвет глаз, волос - номинальные признаки. Номера букв в алфавите - тоже измерения в шкале наименований. Никому в здравом уме не придет в голову складывать или умножать номера телефонов, такие операции не имеют смысла. Сравнивать буквы и говорить, например, что буква П лучше буквы С, также никто не будет. Единственное, для чего годятся измерения в шкале наименований - это различать объекты. Во многих случаях только это от них и требуется. Например, шкафчики в раздевалках для взрослых различают по номерам, т.е. числам, а в детских садах используют рисунки, поскольку дети еще не знают чисел.

В порядковой шкале числа используются не только для различения объектов, но и для установления порядка между ними. Простейшим примером являются оценки знаний учащихся. Символично, что в средней школе применяются оценки 2, 3, 4, 5, а в высшей школе ровно тот же смысл выражается словесно - неудовлетворительно, удовлетворительно, хорошо, отлично. Этим подчеркивается "нечисловой" характер оценок знаний учащихся. В порядковой шкале допустимыми являются все строго возрастающие преобразования.

Установление типа шкалы, т.е. задания группы допустимых преобразований шкалы измерения - дело специалистов соответствующей прикладной области. Так, оценки привлекательности профессий мы, выступая в качестве социологов [], считали измеренными в порядковой шкале. Однако отдельные социологи не соглашались с нами, полагая, что выпускники школ пользуются шкалой с более узкой группой допустимых преобразований, например, интервальной шкалой. Очевидно, эта проблема относится не к математике, а к наукам о человеке. Для ее решения должен быть проведен достаточно трудоемкий эксперимент. В настоящее же время целесообразно принимать порядковую шкалу, так как это гарантирует от возможных ошибок.

Почему мнения экспертов естественно выражать именно в порядковой шкале? Как показали многочисленные опыты, человек более правильно (и с меньшими затруднениями) отвечает на вопросы качественного, например, сравнительного, характера, чем количественного. Так, ему легче сказать, какая из двух гирь тяжелее, чем указать их примерный вес в граммах.

В различных областях человеческой деятельности применяется много других видов порядковых шкал. Так, например, в минералогии используется шкала Мооса, по которому минералы классифицируются согласно критерию твердости. А именно: тальк имеет балл 1, гипс - 2, кальций - 3, флюорит - 4, апатит - 5, ортоклаз - 6, кварц - 7, топаз - 8, корунд - 9, алмаз - 10. Минерал с большим номером является более твердым, чем минерал с меньшим номером, и при нажатии царапает его.

Порядковыми шкалами в географии являются: бофортова шкала ветров ("штиль", "слабый ветер", "умеренный ветер" и т.д.), шкала силы землетрясений. Очевидно, нельзя утверждать, что землетрясение в 2 балла (лампа качнулась под потолком - такое бывает и в Москве) ровно в 5 раз слабее, чем землетрясение в 10 баллов (полное разрушение всего на поверхности земли).

В медицине: шкала стадий гипертонической болезни (по Мясникову), шкала степеней сердечной недостаточности (по Стражеско-Василенко-Лангу), шкала степени выраженности коронарной недостаточности (по Фогельсону) и т.д. Все эти шкалы построены по схеме: заболевание не обнаружено; первая стадия заболевания; вторая стадия; третья стадия... Иногда выделяют стадии 1а, 1б и др. Каждая из них имеет свойственную только ей медицинскую характеристику. При описании групп инвалидности числа используются в противоположном порядке: самая тяжелая - первая группа инвалидности, затем - вторая, самая легкая - третья.

Номера домов также измерены в порядковой шкале - они показывают, в каком порядке стоят дома вдоль улицы. Номера томов в собрании сочинений писателя или номера дел в архиве предприятия обычно связаны с хронологическим порядком их создания.

При оценке качества продукции и услуг, в так называемой квалиметрии (буквальный перевод: измерение качества) популярны порядковые шкалы. А именно, единица продукции оценивается как годная или не годная. При более тщательном анализе используется шкала с тремя градациями: есть значительные дефекты - присутствуют только незначительные дефекты - нет дефектов. Иногда применяют четыре градации: имеются критические дефекты (делающие невозможным использование) - есть значительные дефекты - присутствуют только незначительные дефекты - нет дефектов. Аналогичный смысл имеет сортность продукции - высший сорт, первый сорт, второй сорт,...

При оценке экологических воздействий первая, наиболее обобщенная оценка - обычно порядковая, например: природная среда стабильна - природная среда угнетена (деградирует). Аналогично в эколого-медицинской шкале: нет выраженного воздействия на здоровье людей - отмечается отрицательное воздействие на здоровье.

Порядковая шкала используется и во многих иных областях. В эконометрике это прежде всего различные методы экспертных оценок (см. лекцию 3).

Все шкалы измерения делят на две группы - шкалы качественных и количественных признаков.

Порядковая шкала и шкала наименований - основные шкалы качественных признаков. Поэтому во многих конкретных областях результаты качественного анализа можно рассматривать как измерения по этим шкалам.

Шкалы количественных признаков - это шкалы интервалов, отношений, разностей, абсолютная. По шкале интервалов измеряют величину потенциальной энергии или координату точки на прямой. В этих случаях на шкале нельзя отметить ни естественное начало отсчета, ни естественную единицу измерения. Исследователь должен сам задать точку отсчета и сам выбрать единицу измерения. Допустимыми преобразованиями в шкале интервалов являются линейные возрастающие преобразования, т.е. линейные функции. Температурные шкалы Цельсия и Фаренгейта связаны именно такой зависимостью: $$^\circ C$$ = 5/9 ( $$^\circ F$$ - 32), где $$^\circ C$$ - температура (в градусах) по шкале Цельсия, а $$^\circ F$$ - температура по шкале Фаренгейта.

Из количественных шкал наиболее распространенными в науке и практике являются шкалы отношений. В них есть естественное начало отсчета - ноль, т.е. отсутствие величины, но нет естественной единицы измерения. По шкале отношений измерены большинство физических единиц: масса тела, длина, заряд, а также цены в экономике. Допустимыми преобразованиями в шкале отношений являются подобные (изменяющие только масштаб). Другими словами – линейные возрастающие преобразования без свободного члена. Примером является пересчет цен из одной валюты в другую по фиксированному курсу. Предположим, мы сравниваем экономическую эффективность двух инвестиционных проектов, используя цены в рублях. Пусть первый проект оказался лучше второго. Теперь перейдем на валюту самой экономически мощной державы мира - юани, используя фиксированный курс пересчета. Очевидно (исходя из общих соображений), что первый проект должен опять оказаться более выгодным. Однако алгоритмы расчета не обеспечивают автоматически выполнения этого очевидного условия. Надо проверять, что оно выполнено. Результаты подобной проверки для средних величин описаны ниже (см. 5.3).

В шкале разностей есть естественная единица измерения, но нет естественного начала отсчета. Время измеряется по шкале ], разработанной группой известного математика акад. РАН А.Т. Фоменко, Господь Иисус Христос родился примерно в 1054 г. по принятому ныне летоисчислению в Стамбуле (он же - Царьград, Византия, Троя, Иерусалим, Рим).

Только для абсолютной шкалы результаты измерений - числа в обычном смысле слова. Примером является число людей в комнате. Для абсолютной шкалы допустимым является только тождественное преобразование.

В процессе развития соответствующей области знания тип шкалы может меняться. Так, сначала температура измерялась по порядковой шкале (холоднее - теплее). Затем - по интервальной (шкалы Цельсия, Фаренгейта, Реомюра). Наконец, после открытия абсолютного нуля температуру можно считать измеренной по шкале отношений (шкала Кельвина). Надо отметить, что среди специалистов иногда имеются разногласия по поводу того, по каким шкалам следует считать измеренными те или иные реальные величины. Другими словами, процесс измерения включает в себя и определение типа шкалы (вместе с обоснованием выбора). Кроме перечисленных шести основных типов шкал иногда используют и другие.

Обсуждение шкал измерения будет продолжено далее в более широком контексте - как одного из понятий статистики нечисловых данных.

1.3. Нечисловые данные

Статистика нечисловых данных - это направление в прикладной статистике, в котором в качестве исходных статистических данных (результатов наблюдений) рассматриваются объекты нечисловой природы. Так принято называть объекты, которые нельзя складывать и умножать на числа, в частности, элементы нелинейных пространств. Примерами являются бинарные отношения (ранжировки, разбиения, толерантности и др.), результаты парных и множественных сравнений, множества, нечеткие множества, измерение в шкалах, отличных от абсолютных. Этот перечень примеров не претендует на законченность. Он складывался постепенно, по мере того, как развивались теоретические исследования в области статистики нечисловых данных и расширялся опыт применений этого направления прикладной статистики.

Объекты нечисловой природы широко используются в теоретических и прикладных исследованиях по экономике, менеджменту и другим проблемам управления, в частности, управления качеством продукции, в технических науках, социологии, психологии, медицине и т.д., а также практически во всех отраслях народного хозяйства.

Начнем с первоначального знакомства с основными видами объектов нечисловой природы.

] использовалось среднее арифметическое баллов, выставленных профессии опрошенными школьниками. В частности, физика получила средний балл 7,69, а математика - 7,50. Поскольку 7,69 больше, чем 7,50, был сделан вывод, что физика более предпочтительна для школьников, чем математика.

Однако этот вывод противоречит данным работы [], согласно которым ленинградские школьники средних классов больше любят математику, чем физику. Обсудим одно из возможных объяснений этого противоречия, которое сводится к указанию на неадекватность (с точки зрения теории измерений) методики обработки эконометрических данных, примененной в работе [].

Дело в том, что баллы 1,2,...,10 введены конкретными исследователями, т.е. субъективно. Если одна профессия оценена в 10 баллов, а вторая - в 2, то из этого нельзя заключить, что первая ровно в 5 раз привлекательней второй. Другой коллектив социологов мог бы принять иную систему баллов, например 1,4,9,16,...,100. Естественно предположить, что упорядочивание профессий по привлекательности, присущее школьникам, не зависит от того, какой системой баллов им предложит пользоваться маркетолог. Раз так, то распределение профессий по градациям десятибалльной системы не изменится, если перейти к другой системе баллов с помощью любого допустимого преобразования в порядковой шкале, т.е. с помощью строго возрастающей функции $$g:R^1\rightarrow R^1$$. Если $$Y_1, Y_2,...,Y_n$$ - ответы $$n$$ выпускников школ, касающихся математики, а $$Z_1, Z_2,...,Z_n$$ - физики, то после перехода к новой системе баллов ответы относительно математики будут иметь вид $$g(Y_1), g(Y_2),...,g(Y_n)$$, а относительно физики - $$g(Z_1), g(Z_2),...,g(Z_n)$$.

Пусть единая оценка привлекательности профессии вычисляется с помощью функции $$f(X_1, X_2,...,X_n)$$. Какие требования естественно наложить на функцию $$f:R^n\rightarrow R^1$$, чтобы полученные с ее помощью выводы не зависели от того, какой именно системой баллов пользовался специалист по маркетингу образовательных услуг?

Замечание. Обсуждение можно вести в терминах экспертных оценок. Тогда вместо сравнения математики и физики $$n$$ экспертов (а не выпускников школ) оценивают по конкурентоспособности на мировом рынке, например, две марки стали. Однако в настоящее время маркетинговые и социологические исследования более привычны, чем экспертные.

Единая оценка вычислялась для того, чтобы сравнивать профессии по привлекательности. Пусть $$f(X_1, X_2,...,X_n)$$ - среднее по Коши. Пусть среднее по первой совокупности меньше среднего по второй совокупности:

$$f(Y_1, Y_2,...,Y_n) < f(Z_1, Z_2,...,Z_n ).$$

Тогда согласно теории измерений необходимо потребовать, чтобы для любого допустимого преобразования $$g$$ из группы допустимых преобразований в порядковой шкале было справедливо также неравенство

$$f(g(Y_1), g(Y_2),...,g(Y_n)) < f(g(Z_1), g(Z_2),...,g(Z_n)),$$

т.е. среднее преобразованных значений из первой совокупности также было меньше среднего преобразованных значений для второй совокупности. Причем сформулированное условие должно быть верно для любых двух совокупностей $$Y_1, Y_2,...,Y_n$$ и $$Z_1, Z_2,...,Z_n$$ и, напомним, любого допустимого преобразования. Средние величины, удовлетворяющие сформулированному условию, называют допустимыми (в порядковой шкале). Согласно теории измерений только такими средними можно пользоваться при анализе мнений выпускников школ, экспертов и иных данных, измеренных в порядковой шкале.

Какие единые оценки привлекательности профессий $$f(X_1, X_2,...,X_n)$$ устойчивы относительно сравнения? Ответ на этот вопрос дается ниже в ] новосибирских специалистов по маркетингу образовательных услуг, пользоваться нельзя, а порядковыми статистиками, т.е. членами вариационного ряда (и только ими) - можно.

Методы анализа конкретных экономических данных, измеренных в шкалах, отличных от абсолютной, являются предметом изучения в статистике нечисловых данных как части прикладной статистики. Как известно, основные шкалы измерения делятся на качественные (шкалы наименований и порядка) и количественные (шкалы интервалов, отношений, разностей, абсолютная). Методы анализа статистических данных в количественных шкалах сравнительно мало отличаются от таковых в абсолютной шкале. Добавляется только требование инвариантности относительно преобразований сдвига и/или масштаба. Методы анализа качественных данных - принципиально иные.

Напомним, что исходным понятием теории измерений является совокупность $$\Phi=\{\varphi\}$$ допустимых преобразований шкалы (обычно $$\Phi$$ - группа), $$\varphi:R^1\rightarrow R^1$$. Алгоритм обработки данных $$W$$, т.е. функция $$W:R^n\rightarrow A$$ (здесь $$A$$ -множество возможных результатов работы алгоритма) называется адекватным в шкале с совокупностью допустимых преобразований $$\Phi$$, если

$$W(x_1,x_2,...,x_n)=W(\varphi(x_1),\varphi(x_2),...,\varphi(x_n))$$

для всех $$x_i\in R^1, i=1,2,...,n$$ и всех $$\varphi\in\Phi$$. Таким образом, теорию измерений рассматриваем как теорию инвариантов относительно различных совокупностей допустимых преобразований $$\Phi$$. Интерес вызывают две задачи:

  • дана группа допустимых преобразований $$\Phi$$ (т.е. задана шкала). Какие алгоритмы анализа данных $$W$$ из определенного класса являются адекватными?
  • дан алгоритм анализа данных $$W$$. Для каких шкал (т.е. групп допустимых преобразований $$\Phi$$ ) он является адекватным?
  • В ,,].

    Бинарные отношения. Пусть $$W:R^n\rightarrow A$$ - адекватный алгоритм в шкале наименований. Можно показать, что этот алгоритм задается некоторой функцией от матрицы $$B=||b_{ij}||=B(x_1,x_2,...,x_n)$$ где

    $$b_{ij}= \left\{ \begin{gathered} 1,x_i=x_j, i, j=1,2,...,n, \\ 0,x_i\ne x_j, i, j=1,2,...,n. \end{gathered} \right.$$

    Если $$W:R^n\rightarrow A$$ - адекватный алгоритм в порядковой шкале, то этот алгоритм задается некоторой функцией от матрицы $$C=||c_{ij}||=C(x_1,x_2,...,x_n)$$ порядка $$n \times n$$, где

    $$c_{ij}= \left \{ \begin{gathered} 1,x_i\leq x_j, i, j=1,2,...,n, \\ 0,x_i > x_j, i, j=1,2,...,n. \end{gathered} \right.$$

    Матрицы $$B$$ и $$C$$ можно проинтерпретировать в терминах бинарных отношений. Пусть некоторая характеристика измеряется у $$n$$ объектов $$q_1,q_2,...,q_n$$, причем $$x_i$$ - результат ее измерения у объекта $$q_i$$. Тогда матрицы $$B$$ и $$C$$ задают бинарные отношения на множестве объектов $$Q ={q_1,q_2,...,q_n}$$. Поскольку бинарное отношение можно рассматривать как подмножество декартова квадрата $$Q \times Q$$, то любой матрице $$D = ||d_{ij}||$$ порядка $$n \times n$$ из 0 и 1 соответствует бинарное отношение $$R(D)$$, определяемое следующим образом: $$(q_i,q_i)\in R(D)$$ тогда и только тогда, когда $$d_{ij} = 1$$.

    Бинарное отношение $$R(B)$$ - отношение эквивалентности, т.е. симметричное рефлексивное транзитивное отношение. Оно задает разбиение $$Q$$ на классы эквивалентности. Два объекта $$q_i$$ и $$q_j$$ входят в один класс эквивалентности тогда и только тогда, когда $$x_i = x_j, b_{ij} = 1$$.

    Выше показано, как разбиения возникают в результате измерений в шкале наименований. Разбиения могут появляться и непосредственно. Так, при оценке качества промышленной продукции эксперты дают разбиение показателей качества на группы. Для изучения психологического состояния людей их просят разбить предъявленные рисунки на группы сходных между собой. Аналогичная методика применяется и в иных экспериментальных психологических исследованиях, необходимых для оптимизации управления персоналом.

    Во многих эконометрических задачах разбиения получаются "на выходе" (например, в кластерном анализе) или же используются на промежуточных этапах анализа данных (например, сначала проводят классификацию с целью выделения однородных групп, а затем в каждой группе строят регрессионную зависимость).

    Бинарное отношение $$R(С)$$ задает разбиение $$Q$$ на классы эквивалентности, между которыми введено отношение строгого порядка. Два объекта $$q_i$$ и $$q_j$$ входят в один класс тогда и только тогда, когда $$c_{ij}= 1 и c_{ji}= 1$$, т.е. $$x_i = x_j$$. Класс эквивалентности $$Q_1$$ предшествует классу эквивалентности $$Q_2$$ тогда и только тогда, когда для любых $$q_i\in Q_1,q_j\in Q_2$$ имеем $$c_{ij} = 1, c_{ji}= 0$$, т.е. $$x_i < x_j$$. Такое бинарное отношение в статистике часто называют ранжировкой со связями; связанными считаются объекты, входящие в один класс эквивалентности. В литературе встречаются и другие названия: линейный квазипорядок, упорядочение, квазисерия, ранжирование. Если каждый из классов эквивалентности состоит только из одного элемента, то имеем обычную ранжировку (другими словами, линейный порядок).

    Как известно, ранжировки возникают в результате измерений в порядковой шкале. Так, при описанном выше опросе ответ выпускника школы - это ранжировка (со связями) профессий по привлекательности. Ранжировки часто возникают и непосредственно, без промежуточного этапа - приписывания объектам квазичисловых оценок - баллов. Многочисленные примеры тому приведены английским статистиком М. Кендэлом []. При оценке качества промышленной продукции широко применяемые нормативные и методические документы предусматривают использование ранжировок.

    Для прикладных областей, кроме ранжировок и разбиений, представляют интерес толерантности, т.е. рефлексивные симметричные отношения. Толерантность - математическая модель для выражения представлений о сходстве (похожести, близости). Разбиения - частный вид толерантностей. Толерантность, обладающая свойством транзитивности - это разбиение. Однако в общем случае толерантность не обязана быть транзитивной. Толерантности появляются во многих постановках теории экспертных оценок, например, как результат парных сравнений (см. ниже).

    Напомним, что любое бинарное отношение на конечном множестве может быть описано матрицей из 0 и 1.

    Дихотомические (бинарные) данные. Это данные, которые могут принимать одно из двух значений (0 или 1), т.е. результаты измерений значений альтернативного признака. Как уже было показано, измерения в шкале наименований и порядковой шкале приводят к бинарным отношениям, а те могут быть выражены, как результаты измерений по нескольким альтернативным признакам, соответствующим элементам матриц, описывающих отношения. Дихотомические данные возникают в прикладных исследованиях и многими иными путями.

    В настоящее время в большинстве стандартов, технических условий, технических регламентов, договоров на поставку конкретной продукции предусмотрен контроль по альтернативному признаку. Это означает, что единица продукции относится к одной из двух категорий - "годных" или "дефектных", т.е. соответствующих или не соответствующих требованиям стандарта. Отечественными специалистами проведены обширные теоретические исследования проблем статистического приемочного контроля по альтернативному признаку. Основополагающими в этой области являются работы академика А.Н. Колмогорова. Подход советской вероятностно-статистической школы к проблемам контроля качества продукции отражен в монографиях [,] (см. также лекцию 11).

    Дихотомические данные - давний объект прикладной статистики. Особенно большое применение они имеют в экономических и социологических исследованиях, в которых большинство переменных, интересующих специалистов, измеряется по качественным шкалам. При этом дихотомические данные зачастую являются более адекватными, чем результаты измерений по методикам, использующим большее число градаций. В частности, психологические тесты типа MMPI используют только дихотомические данные. На них опираются и популярные в технико-экономическом анализе методы парных сравнений [].

    Элементарным актом в методе парных сравнений является предъявление эксперту для сравнения двух объектов (сравнение может проводиться также прибором). В одних постановках эксперт должен выбрать из двух объектов лучший по качеству, в других - ответить, похожи объекты или нет. В обоих случаях ответ эксперта можно выразить одной из двух цифр (меток) - 0 или 1. В первой постановке: 0, если лучшим объявлен первый объект; 1 - если второй. Во второй постановке: 0, если объекты похожи, схожи, близки; 1 - в противном случае.

    Подводя итоги изложенному, можно сказать, что рассмотренные выше данные представимы в виде векторов из 0 и 1 (при этом матрицы, очевидно, могут быть записаны в виде векторов). Поскольку все результаты наблюдений имеют лишь несколько значащих цифр, то, используя двоичную систему счисления, любые виды анализируемых статистическими методами данных можно записать в виде векторов конечной длины (размерности) из 0 и 1. Представляется, что эта возможность в большинстве случаев имеет лишь академический интерес, но во всяком случае можно констатировать, что анализ дихотомических данных необходим во многих прикладных постановках.

    Множества. Совокупность $$X^n$$ векторов $$X = (x_1, x_2,...,x_n)$$ из 0 и 1 размерности $$n$$ находится во взаимнооднозначном соответствии с совокупностью из $$2^n$$ всех подмножеств множества $$N = \{1, 2, ..., n\}$$. При этом вектору $$X = (x_1, x_2,...,x_n)$$ соответствует подмножество $$N(X)\subseteq N$$, состоящее из тех и только из тех $$i$$, для которых $$x_i = 1$$. Это объясняет, почему изложение вероятностных и статистических результатов, относящихся к анализу данных, являющихся объектами нечисловой природы перечисленных выше видов, можно вести на языке конечных случайных множеств, как это было сделано в монографии [].

    Множества как исходные данные появляются и в иных постановках. Из геологических задач исходил Ж. Матерон, из электротехнических - Н.Н. Ляшенко и др. Случайные множества применялись для описания процесса случайного распространения, например, распространения информации, слухов, эпидемии или пожара, а также в математической экономике. В монографии [] рассмотрены приложения случайных множеств в теории экспертных оценок и в теории управления запасами и ресурсами (логистике).

    Отметим, что с точки зрения математики реальные объекты можно моделировать случайными множествами как из конечного числа элементов, так и из бесконечного, однако при расчетах на компьютерах неизбежна дискретизация, т.е. переход к первой из названных возможностей.

    Объекты нечисловой природы как статистические данные. В эконометрике и прикладной математической статистике наиболее распространенный объект изучения - выборка $$x1, x2,...,xn$$, т.е. совокупность результатов $$n$$ наблюдений. В различных областях статистики результат наблюдения - это или число, или конечномерный вектор, или функция... Соответственно проводится, как уже отмечалось, деление прикладной математической статистики: одномерная статистика, многомерный статистический анализ, статистика временных рядов и случайных процессов... В статистике нечисловых данных в качестве результатов наблюдений рассматриваются объекты нечисловой природы, в частности, перечисленных выше видов - измерения в шкалах, отличных от абсолютной, бинарные отношения, вектора из 0 и 1, множества, нечеткие множества. Выборка может состоять из $$n$$ ранжировок или $$n$$ толерантностей, или $$n$$ множеств, или $$n$$ нечетких множеств и т.д.

    Отметим необходимость развития методов статистической обработки "разнотипных данных", обусловленную большой ролью в прикладных исследованиях "признаков смешанной природы". Речь идет о том, что результат наблюдения состояния объекта зачастую представляет собой вектор, у которого часть координат измерена по шкале наименований, часть - по порядковой шкале, часть - по шкале интервалов и т.д. Статистические методы ориентированы обычно либо на абсолютную шкалу, либо на шкалу наименований (анализ таблиц сопряженности), а потому зачастую непригодны для обработки разнотипных данных. Есть и более сложные модели разнотипных данных, например, когда некоторые координаты вектора наблюдений описываются нечеткими множествами.

    Для обозначения подобных неклассических результатов наблюдений в 1979 г. в монографии [] предложен собирательный термин - объекты нечисловой природы. Термин "нечисловой" означает, что структура пространства, в котором лежат результаты наблюдений, не является структурой действительных чисел, векторов или функций, она вообще не является структурой линейного (векторного) пространства. При расчетах объекты числовой природы, разумеется, изображаются с помощью чисел, но эти числа нельзя складывать и умножать.

    С целью "стандартизации математических орудий" (выражение группы французских математиков Н. Бурбаки) целесообразно разрабатывать методы статистического анализа данных, пригодные одновременно для всех перечисленных выше видов результатов наблюдений. Кроме того, в процессе развития прикладных исследований выявляется необходимость использования новых видов объектов нечисловой природы, отличных от рассмотренных выше, например, в связи с развитием статистических методов обработки текстовой информации. Поэтому целесообразно ввести еще один вид объектов нечисловой природы - объекты произвольной природы, т.е. элементы множеств, на которые не наложено никаких условий (кроме "условий регулярности", необходимых для справедливости доказываемых теорем). Другими словами, в этом случае предполагается, что результаты наблюдений (элементы выборки) лежат в произвольном пространстве $$X$$. Для получения теорем необходимо потребовать, чтобы $$X$$ удовлетворяло некоторым условиям, например, было так называемым топологическим пространством. Как известно, ряд результатов классической математической статистики получен именно в такой постановке. Так, при изучении оценок максимального правдоподобия элементы выборки могут лежать в пространстве произвольной природы. Это не влияет на рассуждения, поскольку в них рассматривается лишь зависимость плотности вероятности от параметра. Методы классификации, использующие лишь расстояние между классифицируемыми объектами, могут применяться к совокупностям объектов произвольной природы, лишь бы в пространстве, где они лежат, была задана метрика. Цель статистики нечисловых данных (в некоторых литературных источниках используется термин "статистика объектов нечисловой природы") состоит в том, чтобы систематически рассматривать методы статистической обработки данных как произвольной природы, так и относящихся к указанным выше конкретным видам объектов нечисловой природы, т.е. методы описания данных, оценивания и проверки гипотез. Взгляд с общей точки зрения позволяет получить новые результаты и в других областях прикладной статистики.

    Использование объектов нечисловой природы при формировании статистической или математической модели реального явления. Использование объектов нечисловой природы часто порождено желанием обрабатывать более объективную, более освобожденную от погрешностей информацию. Как показали многочисленные опыты, человек более правильно (и с меньшими затруднениями) отвечает на вопросы качественного, например, сравнительного, характера, чем количественного. Так, ему легче сказать, какая из двух гирь тяжелее, чем указать их примерный вес в граммах. Другими словами, использование объектов нечисловой природы - средство повышения устойчивости эконометрических и экономико-математических моделей реальных явлений. Сначала конкретные области статистики объектов нечисловой природы (а именно – прикладная теория измерений, нечеткие и случайные множества) были рассмотрены в монографии [], как частные постановки проблемы устойчивости математических моделей социально-экономических явлений и процессов к допустимым отклонениям исходных данных и предпосылок модели, а затем пришли к пониманию необходимости проведения работ по развитию статистики объектов нечисловой природы как самостоятельного научного направления.

    Обсуждение начнем со шкал измерения. Науку о единстве мер и точности измерений называют метрологией. Таким образом, репрезентативная теория измерений - часть метрологии. Методы обработки данных должны быть адекватны относительно допустимых преобразований шкал измерения в смысле репрезентативной теории измерений. Однако, как было отмечено ранее (см. 1.2), проблема установления типа шкалы, относится, скорее всего, к наукам о человеке и для ее решения необходимо определенное время. Пока же целесообразно в неясных случаях принимать порядковую шкалу, так как это гарантирует от возможных ошибок.

    Порядковые шкалы широко распространены не только в социально-экономических исследованиях. Они применяются в медицине - шкала стадий гипертонической болезни по Мясникову, шкала степеней сердечной недостаточности по Стражеско-Василенко-Лангу, шкала степени выраженности коронарной недостаточности по Фогельсону; в минералогии - шкала Мооса (тальк - 1, гипс - 2, кальций - 3, флюорит - 4, апатит - 5, ортоклаз - 6, кварц - 7, топаз - 8, корунд - 9, алмаз - 10), по которой минералы классифицируются согласно критерию твердости; в географии - бофортова шкала ветров ("штиль", "слабый ветер", "умеренный ветер" и др.) и т.д. Напомним, что по шкале интервалов измеряют величину потенциальной энергии или координату точки на прямой, на которой не отмечены ни начало, ни единица измерения; по шкале отношений - цены в экономике; большинство физических единиц – массу тела, длину, заряд. Время измеряется по шкале разностей, если год принимаем естественной единицей измерения, и по шкале интервалов в общем случае. В процессе развития соответствующей области знания тип шкалы может меняться. Так, сначала температура измерялась по порядковой шкале (холоднее - теплее), затем - по интервальной (шкалы Цельсия, Фаренгейта, Реомюра) и наконец, после открытия абсолютного нуля температур - по шкале отношений (шкала Кельвина). Следует отметить, что среди специалистов иногда имеются разногласия по поводу того, по каким шкалам следует считать измеренными те или иные реальные величины.

    Отметим, что термин "репрезентативная" использовался, чтобы отличить рассматриваемый подход к теории измерений от классической метрологии, а также от работ А.Н. Колмогорова и А. Лебега, связанных с измерением геометрических величин, от "алгоритмической теории измерения" и др.

    Необходимость использования в математических моделях реальных явлений таких объектов нечисловой природы, как бинарные отношения, множества, нечеткие множества, кратко была показана выше. Здесь же обратим внимание, что используемые в классической статистике результаты наблюдений также "не совсем числа". А именно, любая величина $$X$$ измеряется всегда с некоторой погрешностью $$\Delta X$$ и результатом наблюдения является

    $$Y=X+\Delta X$$

    Как уже отмечалось, погрешностями измерений занимается метрология. Отметим справедливость следующих фактов:

  • для большинства реальных измерений невозможно полностью исключить систематическую ошибку, т.е. $$M(\Delta X)\ne 0$$ ;
  • распределение $$\Delta X$$ в подавляющем большинстве случаев не является нормальным (см. лекцию 5);
  • измеряемую величину $$X$$ и погрешность ее измерения $$\Delta X$$ обычно нельзя считать независимыми случайными величинами;
  • распределение погрешностей оценивается по результатам специальных наблюдений, следовательно, полностью известным считать его нельзя; зачастую исследователь располагает лишь границами для систематической погрешности и оценками таких характеристик для случайной погрешности, как дисперсия или размах.
  • Приведенные факты показывают ограниченность области применимости распространенной модели погрешностей, в которой $$X$$ и $$\Delta X$$ рассматриваются как независимые случайные величины, причем $$\Delta X$$ имеет нормальное распределение с нулевым математическим ожиданием.

    Строго говоря, результаты наблюдения всегда имеют дискретное распределение, поскольку описываются числами с небольшим (1 – 5) числом значащих цифр. Возникает дилемма: либо признать, что непрерывные распределения - фикция, и прекратить ими пользоваться, либо считать, что непрерывные распределения имеют "реальные" величины $$X$$, которые мы наблюдаем с принципиально неустранимой погрешностью $$\Delta X$$. Первый выход в настоящее время нецелесообразен, так как потребует отказаться от большей части разработанного математического аппарата. Из второго следует необходимость изучения влияния неустранимых погрешностей на статистические выводы.

    Погрешности $$\Delta X$$ можно учитывать либо с помощью вероятностной модели ( $$\Delta X$$ - случайная величина, имеющая функцию распределения, вообще говоря, зависящую от $$X$$ ), либо с помощью нечетких множеств. Во втором случае приходим к теории нечетких чисел и к ее частному случаю - статистике интервальных данных (см. лекцию 12).

    Другой источник появления погрешности $$\Delta X$$ связан с принятой в конструкторской и технологической документации системой допусков на контролируемые параметры изделий и деталей, с использованием шаблонов при проверке контроля качества продукции []. В этих случаях характеристики $$\Delta X$$ определяются не свойствами средств измерения, а применяемой технологией проектирования и производства. В терминах прикладной статистики сказанному соответствует группировка данных, при которой мы знаем, какому из заданных интервалов принадлежит наблюдение, но не знаем точного значения результата наблюдения. Применение группировки может дать экономический эффект, поскольку зачастую легче (в среднем) установить, к какому интервалу относится результат наблюдения, чем точно измерить его.

    Объекты нечисловой природы как результат статистической обработки данных. Объекты нечисловой природы появляются не только на "входе" статистической процедуры, но и в процессе обработки данных, и на "выходе" в качестве итога статистического анализа.

    Рассмотрим простейшую прикладную постановку задачи регрессии (см. также лекцию 9). Исходные данные имеют вид $$(x_i,y_i)\in R^2, i=1,2,...,n$$ Цель состоит в том, чтобы с достаточной точностью описать y как полином от x, т.е. модель имеет вид

    $$y_i=\sum_{k=0}^m a_j x_i^k+\varepsilon_i$$

    где $$m$$ - неизвестная степень полинома; $$a_0,a_1,a_2,...,a_m$$ - неизвестные коэффициенты многочлена; $$\varepsilon_i,i=1,2,...,n$$ - погрешности, которые для простоты примем независимыми и имеющими одно и то же нормальное распределение. (Здесь наглядно проявляется одна из причин живучести статистических моделей на основе нормального распределения. Такие модели, как правило, неадекватны реальной ситуации (см. лекцию 5), но с математической точки зрения позволяют проникнуть глубже в суть изучаемого явления. Поэтому они пригодны для первоначального анализа ситуации, как и в рассматриваемом случае. Дальнейшие научные исследования должны быть направлены на снятие нереалистического предположения нормальности и перехода к непараметрическим моделям погрешности.) Распространенная процедура такова: сначала пытаются применить модель (2) для линейной функции ( $$m = 1$$ ), при неудаче (неадекватности модели) переходят к многочлену второго порядка ( $$m = 2$$ ), если снова неудача, то берут модель (2) с $$m = 3$$ и т.д. (адекватность модели проверяют по $$F$$ -критерию Фишера).

    Обсудим свойства этой процедуры в терминах прикладной статистики. Если степень полинома задана ( $$m = m_0$$ ), то его коэффициенты оценивают методом наименьших квадратов, свойства этих оценок хорошо известны (см., например, , гл.26]). Однако в описанной выше реальной постановке m тоже является неизвестным параметром и подлежит оценке. Таким образом, требуется оценить объект ( $$m, a_0, a_1, a_2, ..., a_m$$ ), множество значений которого можно описать как $$R^1\bigcup R^2\bigcup R^3\bigcup..$$. Это - объект нечисловой природы, обычные методы оценивания для него неприменимы, так как $$m$$ - дискретный параметр. В рассматриваемой постановке разработанные к настоящему времени методы оценивания степени полинома носят в основном эвристический характер (см., например, гл.12 монографии []). Свойства описанной выше распространенной процедуры рассмотрены в лекции 9. Там показано, что степень полинома $$m$$ при этом оценивается несостоятельно, и найдено предельное распределение оценки этого параметра, оказавшееся геометрическим.

    В более общем случае линейной регрессии данные имеют вид $$(y_i,X_i),i=1,2,...,n$$ где $$X_i=(x_{i1},x_{i2},...,x_{iN})\in R^N$$ - вектор предикторов (факторов, объясняющих переменных), а модель такова:

    $$y_i=\sum_{j\in K} a_j x_{ij}+\varepsilon_i,i=1,2,...,n$$

    (здесь $$K$$ - некоторое подмножество множества $$\{1,2,...,n\}$$ ; - те же, что и в модели (2); $$a_j$$ - неизвестные коэффициенты при предикторах с номерами из $$K)$$. Модель (2) сводится к модели (3), если

    $$x_{i1}=1,x_{i1}=x_1,x_{i2}=x_i^2,x_{i3}=x_i^3,...,x_{ij}=x_i^{j-1},...$$

    В модели (2) есть естественный порядок ввода предикторов в рассмотрение - в соответствии с возрастанием степени, а в модели (3) естественного порядка нет, поэтому здесь стоит произвольное подмножество множества предикторов. Есть только частичный порядок - чем мощность подмножества меньше, тем лучше. Модель (3) особенно актуальна в технических исследованиях (см. многочисленные примеры в журнале "Заводская лаборатория"). Она применяется в задачах управления качеством продукции и других технико-экономических исследованиях, в экономике, маркетинге и социологии, когда из большого числа факторов, предположительно влияющих на изучаемую переменную, надо отобрать по возможности наименьшее число значимых факторов и с их помощью сконструировать прогнозирующую формулу (3).

    Задача оценивания модели (3) разбивается на две последовательные задачи: оценивание множества $$K$$ - подмножества множества всех предикторов, а затем - неизвестных параметров $$a_j$$. Методы решения второй задачи хорошо известны и подробно изучены. Гораздо хуже обстоит дело с оцениванием объекта нечисловой природы $$K$$. Как уже отмечалось, существующие методы - в основном эвристические, они зачастую не являются даже состоятельными. Даже само понятие состоятельности в данном случае требует специального определения. Пусть $$K_0$$ - истинное подмножество предикторов, т.е. подмножество, для которого справедлива модель (3), а подмножество предикторов $$K_n$$ - его оценка. Оценка $$K_n$$ называется состоятельной, если

    $$\lim_{n\rightarrow\infty} \textit{Card}(K_n\Delta K_0)=0,$$

    где $$\Delta$$ - символ симметрической разности множеств; $$\textit{Card}(K)$$ означает число элементов в множестве $$K$$, а предел понимается в смысле сходимости по вероятности.

    Задача оценивания в моделях регрессии, таким образом, разбивается на две - оценивание структуры модели и оценивание параметров при заданной структуре. В модели (2) структура описывается неотрицательным целым числом $$m$$, в модели (3) - множеством $$K$$. Структура - объект нечисловой природы. Задача ее оценивания сложна, в то время как задача оценивания численных параметров при заданной структуре хорошо изучена, разработаны эффективные (в смысле прикладной математической статистики) методы.

    Такова же ситуация и в других методах многомерного статистического анализа - в факторном анализе (включая метод главных компонент) и в многомерном шкалировании, в иных оптимизационных постановках проблем прикладного многомерного статистического анализа.

    Перейдем к объектам нечисловой природы на "выходе" статистической процедуры. Примеры многочисленны. Разбиения - итог работы многих алгоритмов классификации, в частности, алгоритмов кластер-анализа. Ранжировки - результат упорядочения профессий по привлекательности или автоматизированной обработки мнений экспертов - членов комиссии по подведению итогов конкурса научных работ. (В последнем случае используются ранжировки со связями; так, в одну группу, наиболее многочисленную, попадают работы, не получившие наград.) Из всех объектов нечисловой природы, видимо, наиболее часты на "выходе" дихотомические данные - принять или не принять гипотезу; в частности, принять или забраковать партию продукции. Результатом статистической обработки данных может быть множество, например, зона наибольшего поражения при аварии, или последовательность множеств, например, "среднемерное" описание распространения пожара (см. главу 4 в монографии []). Нечетким множеством Э. Борель [] еще в начале ХХ в. предлагал описывать представление людей о числе зерен, образующем "кучу". С помощью нечетких множеств формализуются значения лингвистических переменных, выступающих как итоговая оценка качества систем автоматизированного проектирования, сельскохозяйственных машин, бытовых газовых плит, надежности программного обеспечения или систем управления. Можно констатировать, что все виды объектов нечисловой природы могут появляться "на выходе" статистического исследования.

    1.4. Нечеткие множества - частный случай нечисловых данных

    Нечеткие множества. Пусть $$A$$ - некоторое множество. Подмножество $$B$$ множества $$A$$ может быть задано своей характеристической функцией

    $$\mu_B(x)= \left \{ \begin{gathered} 1,x\in B,\\ 0,x\notin B \end{gathered} \right.$$

    Что такое нечеткое множество? Обычно говорят, что нечеткое подмножество $$C$$ множества $$A$$ характеризуется своей функцией принадлежности $$\mu_C:A\rightarrow [0,1]$$. Значение функции принадлежности в точке $$х$$ показывает степень принадлежности этой точки нечеткому множеству. Нечеткое множество описывает неопределенность, соответствующую точке х - она одновременно и входит, и не входит в нечеткое множество $$С$$. За вхождение - $$\mu_C(x)$$ шансов, за второе - $$(1-\mu_C(x))$$ шансов.

    Если функция принадлежности $$\mu_C(x)$$ имеет вид (1) при некотором $$B$$, то $$C$$ есть обычное (четкое) подмножество $$A$$. Таким образом, теория нечетких множество является не менее общей математической дисциплиной, чем обычная теория множеств, поскольку обычные множества - частный случай нечетких. Соответственно можно ожидать, что теория нечеткости, как целое, обобщает классическую математику. Однако позже мы увидим, что теория нечеткости в определенном смысле сводится к теории случайных множеств и тем самым является частью классической математики. Другими словами, по степени общности обычная математика и нечеткая математика эквивалентны. Однако для практического применения, например, в теории принятия решений описание и анализ неопределенностей с помощью теории нечетких множеств весьма плодотворны.

    Обычное подмножество можно было бы отождествить с его характеристической функцией. Этого математики не делают, поскольку для задания функции (в ныне принятом подходе) необходимо сначала задать множество. Нечеткое же подмножество с формальной точки зрения можно отождествить с его функцией принадлежности. Однако термин "нечеткое подмножество" предпочтительнее при построении математических моделей реальных явлений.

    Теория нечеткости является обобщением интервальной математики. Действительно, функция принадлежности

    $$\mu_B(x)= \left \{ \begin{gathered} 1,x\in [a,b],\\ 0,x\notin [a,b] \end{gathered} \right.$$

    задает интервальную неопределенность - про рассматриваемую величину известно лишь, что она лежит в заданном интервале $$[a,b]$$. Тем самым описание неопределенностей с помощью нечетких множеств является более общим, чем с помощью интервалов.

    Начало современной теории нечеткости положено в 1965 г. работой американского ученого азербайджанского происхождения Л.А. Заде. К настоящему времени по этой теории опубликованы тысячи книг и статей, издается несколько международных журналов, выполнено достаточно много как теоретических, так и прикладных работ. Первая книга российского автора по теории нечеткости вышла в 1980 г. [].

    Л.А. Заде рассматривал теорию нечетких множеств как аппарат анализа и моделирования гуманистических систем, т.е. систем, в которых участвует человек. Его подход опирается на предпосылку о том, что элементами мышления человека являются не числа, а элементы некоторых нечетких множеств или классов объектов, для которых переход от "принадлежности" к "непринадлежности" не скачкообразен, а непрерывен. В настоящее время методы теории нечеткости используются почти во всех прикладных областях, в том числе при управлении предприятиями, качеством продукции и технологическими процессами, при описании предпочтений потребителей и варки стали.

    Л.А. Заде использовал термин "fuzzy set" (нечеткое множество). На русский язык термин "fuzzy" переводили как нечеткий, размытый, расплывчатый, и даже как пушистый и туманный.

    Аппарат теории нечеткости громоздок. В качестве примера дадим определения теоретико-множественных операций над нечеткими множествами. Пусть $$C$$ и $$D$$ - два нечетких подмножества $$A$$ с функциями принадлежности $$\mu_C(x)$$ и $$\mu_D(x)$$ соответственно. Пересечением $$C\bigcap D$$, произведением $$CD$$, объединением $$C\bigcup D$$, отрицанием $$\overline{C}$$, суммой $$C+D$$ называются нечеткие подмножества $$A$$ с функциями принадлежности

    $$\begin{multiline*} \mu_{C\cap D}(x)=\min(\mu_C(x),\mu_D(x)),\mu_{CD}(x)=\mu_C(x)\mu_D(x),\mu_{\overline{C}}(x)=1-\mu_C(x), \\ \mu_{C\cup D}(x)=\max(\mu_C(x),\mu_D(x)),\mu_{C+D}(x)=\mu_C(x)+\mu_D(x)-\mu_C(x)\mu_D(x),x\in A \end{multiline*}$$

    соответственно.

    Как уже отмечалось, теория нечетких множеств в определенном смысле сводится к теории вероятностей, а именно, к теории случайных множеств. Соответствующий цикл теорем приведен ниже в лекции 4. Однако при решении прикладных задач вероятностно-статистические методы и методы теории нечеткости обычно рассматриваются как различные.

    Для знакомства со спецификой нечетких множеств рассмотрим некоторые их свойства.

    В дальнейшем считаем, что все рассматриваемые нечеткие множества являются подмножествами одного и того же множества $$Y$$.

    Законы де Моргана для нечетких множеств. Как известно, законами де Моргана называются следующие тождества алгебры множеств

    $$\overline{A\bigcup B}=\overline{A}\bigcap\overline{B},\overline{A\bigcap B}=\overline{A}\bigcup\overline{B}.$$

    Теорема 1. Для нечетких множеств справедливы тождества

    $$\overline{A\bigcup B}=\overline{A}\bigcap\overline{B},\overline{A\bigcap B}=\overline{A}\bigcup\overline{B},$$ $$\overline{A+B}=\overline{A}\overline{B},\overline{AB}=\overline{A}+\overline{B}.$$

    Доказательство теоремы 1 состоит в непосредственной проверке справедливости соотношений (3) и (4) путем вычисления значений функций принадлежности участвующих в этих соотношениях нечетких множеств на основе определений, данных выше.

    Тождества (3) и (4) назовем законами де Моргана для нечетких множеств. В отличие от классического случая соотношений (2), они состоят из четырех тождеств, одна пара которых относится к операциям объединения и пересечения, а вторая - к операциям произведения и суммы. Как и соотношение (2) в алгебре множеств, законы де Моргана в алгебре нечетких множеств позволяют преобразовывать выражения и формулы, в состав которых входят операции отрицания.

    Дистрибутивный закон для нечетких множеств. Некоторые свойства операций над множествами не выполнены для нечетких множеств. Так, $$A+A\ne A$$ за исключением случая, когда $$А$$ - "четкое" множество (т.е. функция принадлежности принимает только значения 0 и 1).

    Верен ли дистрибутивный закон для нечетких множеств? В литературе иногда расплывчато утверждается, что "не всегда". Внесем полную ясность.

    Теорема 2. Для любых нечетких множеств $$А$$, $$В$$ и $$С$$

    $$A\bigcap(B\bigcup C)=(A\bigcap B)\bigcup(A\bigcap C)$$

    В то же время равенство

    $$A(B+C)=AB+AC$$

    справедливо тогда и только тогда, когда при всех $$y\in Y$$

    $$(\mu_A^2(y)-\mu_A(y))\mu_B(y)\mu_C(y)=0.$$

    Доказательство. Фиксируем произвольный элемент $$y\in Y$$. Для сокращения записи обозначим $$a=\mu_A(y),b=\mu_B(y),c=\mu_C(y)$$ Для доказательства тождества (5) необходимо показать, что

    $$\min(a,\max(b,c))=\max(\min(a,b),\min(a,c))$$

    Рассмотрим различные упорядочения трех чисел $$a, b, c$$. Пусть сначала $$a\leq b\leq c$$. Тогда левая часть соотношения (7) есть $$\min(a,c)=a$$, а правая $$\max(a,a)=a$$, т.е. равенство (7) справедливо.

    Пусть $$b\leq c\leq a$$. Тогда в соотношении (7) слева стоит $$\min(a,c)=c$$, а справа $$\max(b,a)=a$$, т.е. соотношение (7) опять является равенством.

    Если $$b\leq c\leq a$$, то в соотношении (7) слева стоит $$\min(a,c)=c$$, а справа $$\max(b,c)=c$$, т.е. обе части снова совпадают.

    Три остальные упорядочения чисел $$a, b, c$$ разбирать нет необходимости, поскольку в соотношение (6) числа $$b$$ и $$c$$ входят симметрично. Тождество (5) доказано.

    Второе утверждение теоремы 2 вытекает из того, что в соответствии с определениями операций над нечеткими множествами

    $$\mu_{A(B+C)}(y)=a(b+c-bc)=ab+ac-abc$$

    и

    $$\mu_{AB+AC}(y)=ab+ac-(ab)(ac)=ab+ac-a^2bc.$$

    Эти два выражения совпадают тогда и только тогда, когда $$a^2bc = abc$$, что и требовалось доказать.

    Определение 1. Носителем нечеткого множества $$А$$ называется совокупность всех точек $$y\in Y$$, для которых $$\mu_A(y)>0$$.

    Следствие теоремы 2. Если носители нечетких множеств $$B$$ и $$C$$ совпадают с $$Y$$, то равенство (6) имеет место тогда и только тогда, когда $$A$$ - "четкое" (т.е. обычное, классическое, не нечеткое) множество.

    Доказательство. По условию $$\mu_B(y)\mu_C(y)\ne 0$$ при всех $$y\in Y$$. Тогда из теоремы 2 следует, что $$\mu_A^2(y)-\mu_A(y)=0$$, т.е. $$\mu_A(y)=1$$ или $$\mu_A(y)=0$$, что и означает, что $$A$$ - четкое множество.

    Пример описания неопределенности с помощью нечеткого множества. Понятие "богатый" часто используется при обсуждении социально-экономических проблем, в том числе и в связи с подготовкой и принятием решений. Однако очевидно, что разные лица вкладывают в это понятие различное содержание. Сотрудники Института высоких статистических технологий и эконометрики провели в 2004 г. небольшое пилотное социологическое исследование представления различных слоев населения о понятии "богатый человек".

    Мини-анкета опроса выглядела так:

  • При каком месячном доходе (в тыс. руб. на одного человека) Вы считали бы себя богатым человеком?
  • Оценив свой сегодняшний доход, к какой из категорий Вы себя относите:

    a) богатые;

    б) достаток выше среднего;

    в) достаток ниже среднего;

    г) бедные;

    д) за чертой бедности.

    (В дальнейшем вместо полного наименования категорий будем оперировать буквами, например "в" - категория, "б" - категория и т.д.)
  • Ваша профессия, специальность.
  • Всего было опрошено 74 человека, из них 40 - научные работники и преподаватели, 34 человека - не занятых в сфере науки и образования, в том числе 5 рабочих и 5 пенсионеров. Из всех опрошенных только один (!) считает себя богатым. Несколько типичных ответов научных работников и преподавателей приведено в табл.1.3, а аналогичные сведения для работников коммерческой сферы - в табл.1.4.

    Типичные ответы научных работников и преподавателей
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Кандидат наук 6 д ж
    Преподаватель 6 в ж
    Доцент 6 б ж
    Учитель 60 в м
    Старший научный сотрудник 60 д м
    Инженер-физик 140 д ж
    Программист 150 г м
    Научный работник 270 г м
    Типичные ответы работников коммерческой сферы
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Вице-президент банка 600 а ж
    Зам. директора банка 300 б ж
    Начальник кредитного отдела 300 б м
    Начальник отдела ценных бумаг 60 б м
    Главный бухгалтер 120 д ж
    Бухгалтер 90 в ж
    Менеджер банка 66 б м
    Начальник отдела проектирования 60 в ж

    Разброс ответов на первый вопрос - от 6 до 600 тыс. руб. в месяц на человека. Результаты опроса показывают, что критерий богатства у финансовых работников в целом несколько выше, чем у научных (см. гистограммы на рис.1.1,1.2 ниже).

    Опрос показал, что выявить какое-нибудь конкретное значение суммы, которая необходима "для полного счастья", пусть даже с небольшим разбросом, нельзя, что вполне естественно. Как видно из таблиц 1.3 и 1.4, денежный эквивалент богатства колеблется от 6 до 600 тыс. руб. в месяц. Подтвердилось мнение, что работники сферы образования в подавляющем большинстве причисляют свой достаток к категории "в" и ниже (81% опрошенных), в том числе к категории "д" отнесли свой достаток 57%.

    Со служащими коммерческих структур и бюджетных организаций иная картина: "г" - категория 1 человек (4%), "д" - категория 4 человека (17%), "б" - категория - 46% и 1 человек "а" - категория.

    Пенсионеры, что не вызывает удивления, отнесли свой доход к категории "д" (4 человека), и лишь один человек указал "г" - категорию. Рабочие же ответили так: 4 человека - "в", и один человек - "б".

    Для представления общей картины в табл.1.5 приведены данные об ответах работников других профессий.

    Типичные ответы работников различных профессий
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Работник торговли 6 б ж
    Дворник 12 в ж
    Водитель 60 в м
    Военнослужащий 60 в м
    Владелец бензоколонки 120 б ж
    Пенсионер 36 д ж
    Начальник фабрики 120 б м
    Хирург 30 в м
    Домохозяйка 60 в м
    Слесарь-механик 150 в м
    Юрист 60 б м
    Оператор ЭВМ 120 д м
    Работник собеса 18 д ж
    Архитектор 150 б ж

    Прослеживается интересное явление: чем выше планка богатства для человека, тем к более низкой категории относительно этой планки он себя относит.

    Для сводки данных естественно использовать гистограммы. Для этого необходимо сгруппировать ответы. Использовались 7 классов (интервалов):

  • – до 30 тыс. руб. в месяц на человека (включительно);
  • – от 30 до 60 тыс. руб.;
  • – от 60 до 90 тыс. руб.;
  • – от 90 до 120 тыс. руб.;
  • – от 120 до 150 тыс. руб.;
  • – от 150 до 180 тыс. руб;
  • – более 180 тыс.
  • (Во всех интервалах левая граница исключена, а правая, наоборот, включена.)

    Сводная информация представлена на рис.1.1 (для научных работников и преподавателей) и рис.1.2 (для всех остальных, т.е. для лиц, не занятых в сфере науки и образования - служащих иных бюджетных организаций, коммерческих структур, рабочих, пенсионеров).

    (рис 1.2) Гистограмма ответов на вопрос 1 для научных работников и преподавателей (40 чел.)(рис 1.1) Гистограмма ответов на вопрос 1 для лиц, не занятых в сфере науки и образования (34 чел.)

    Для двух выделенных групп, а также для некоторых подгрупп второй группы рассчитаны сводные средние характеристики - выборочные средние арифметические, медианы, моды. При этом медиана группы - количество тыс. руб., названное центральным по порядковому номеру опрашиваемым в возрастающем ряду ответов на вопрос 1, а мода группы - интервал, на котором столбик гистограммы - самый высокий, т.е. в него "попало" максимальное количество опрашиваемых. Результаты приведены в табл.1.6.

    Сводные средние характеристики ответов на вопрос 1 для различных групп (в тыс. руб. в мес. на чел.)
    Группа опрошенных Среднее арифметическое Медиана Мода
    Научные работники и преподаватели 70 43,5 (30; 60)
    Лица, не занятые в сфере науки и образования 86,4 120,0 (30; 60)
    Служащие коммерческих структур и бюджетных организаций 107,5 60 (30; 60)
    Рабочие 90,0 78,0 -
    Пенсионеры 61,8 60,0 -

    Построим нечеткое множество, описывающее понятие "богатый человек" в соответствии с представлениями опрошенных. Для этого составим табл.1.7 на основе рис.1.1 и рис.1.2 с учетом размаха ответов на первый вопрос.

    Число ответов, попавших в интервалы
    № п/п Номер интервала 0 1 2 3 4 5 6 7 8
    1 Интервал, тыс. руб. в месяц (0;6) [6;30] (30;60] (60;90] (90;120] (120;150] (150;180] (180;600) [600;+ $$\infty$$ )
    2 Число ответов в интервале 0 19 21 13 5 6 7 2 1
    3 Доля ответов в интервале 0 0,257 0,284 0,176 0,068 0,081 0,095 0,027 0,013
    4 Накопленное число ответов 19 40 53 58 64 71 73 74
    5 Накопленная доля ответов 0 0,257 0,541 0,716 0,784 0,865 0,960 0,987 1,000

    Пятая строка табл.1.7 задает функцию принадлежности нечеткого множества, выражающего понятие "богатый человек" в терминах его ежемесячного дохода. Это нечеткое множество является подмножеством множества из 9 интервалов, заданных в строке 2 табл.5. Или множества из 9 условных номеров {0, 1, 2, …, 8}. Эмпирическая функция распределения, построенная по выборке из ответов 74 опрошенных на первый вопрос мини-анкеты, описывает понятие "богатый человек" как нечеткое подмножество положительной полуоси.

    О разработке методики ценообразования на основе теории нечетких множеств. Для оценки значений показателей, не имеющих количественной оценки, можно использовать методы нечетких множеств. Например, в диссертации П.В. Битюкова [] нечеткие множества применялись при моделировании задач ценообразования на электронные обучающие курсы, используемые при дистанционном обучении. Им было проведено исследование значений фактора "Уровень качества курса" с использованием нечетких множеств. В ходе практического использования предложенной П.В. Битюковым методики ценообразования значения ряда других факторов могут также определяться с использованием теории нечетких множеств. Например, ее можно использовать для определения прогноза рейтинга специальности в вузе с помощью экспертов, а также значений других факторов, относящихся к группе "Особенности курса". Опишем подход П.В. Битюкова, как пример практического использования теории нечетких множеств.

    Значение оценки, присваиваемой каждому интервалу для фактора "Уровень качества курса", определяется на универсальной шкале [0,1], где необходимо разместить значения лингвистической переменной "Уровень качества курса": НИЗКИЙ, СРЕДНИЙ, ВЫСОКИЙ. Степень принадлежности некоторого значения вычисляется как отношение числа ответов, в которых оно встречалось в определенном интервале шкалы, к максимальному (для этого значения) числу ответов по всем интервалам.

    Был проведен опрос экспертов о степени влияния уровня качества электронных курсов на их потребительную ценность. Каждому эксперту в процессе опроса предлагалось оценить с позиции потребителя ценность того или иного класса курсов в зависимости от уровня качества. Эксперты давали свою оценку для каждого класса курсов по 10-ти балльной шкале (где 1 - min, 10 - max). Для перехода к универсальной шкале [0,1] все значения 10-ти балльной шкалы оценки ценности были разделены на максимальную оценку, т.е. на 10.

    Используя свойства функции принадлежности, необходимо предварительно обработать данные для того, чтобы уменьшить искажения, вносимые опросом. Естественными свойствами функций принадлежности являются наличие одного максимума и гладкие, затухающие до нуля фронты. Для обработки статистических данных можно воспользоваться так называемой матрицей подсказок. Предварительно удаляются явно ошибочные элементы. Критерием удаления служит наличие нескольких нулей в строке вокруг этого элемента.

    Элементы матрицы подсказок вычисляются по формуле:

    $$k_j=\sum_{i=1}^n b_{ij}, j=\overline{1,n},$$

    где $$b_{ij}$$ - элемент таблицы с результатами анкетирования, сгруппированными по интервалам. Матрица подсказок представляет собой строку, в которой выбирается максимальный элемент: $$k_{\max}=\max_j k_j$$, и далее все ее элементы преобразуются по формуле:

    $$c_{ij}=\frac{b_{ij}k_{\max}}{k_i},i=\overline{1,m},j=\overline{1,n}.$$

    Для столбцов, где $$k_j = 0$$, применяется линейная аппроксимация:

    $$c_{ij}=\frac{c_{ij-1}+c_{ij+1}}{2}, i=\overline{1,m},j=\overline{1,n}.$$

    Результаты расчетов сводятся в таблицу, на основании которой строятся функции принадлежности. Для этого находятся максимальные элементы по строкам: $$c_{i\max}=\max_j c_{ij}, i=\overline{1,m},j=\overline{1,n}$$. Функция принадлежности вычисляется по формуле: $$\mu_{ij}=c_{ij}/c_{i\max}$$. Результаты расчетов приведены в табл.1.8.

    Значения функции принадлежности лингвистической переменной
    $$\mu_i$$ Интервал на универсальной шкале
    0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1,0
    $$\mu_1$$ 0 0,2 1 1 0,89 0,67 0 0 0 0
    $$\mu_2$$ 0 0 0 0 0 0,33 1 1 0 0
    $$\mu_3$$ 0 0 0 0 0 0 0 0 1 1

    На рис.1.3 сплошными линиями показаны функции принадлежности значений лингвистической переменной "Уровень качества курса" после обработки таблицы, содержащей результаты опроса. Как видно из графика, функции принадлежности удовлетворяют описанным выше свойствам. Для сравнения пунктирной линией показана функция принадлежности лингвистической переменной для значения НИЗКИЙ без обработки данных.

    (рис 1.3) График функций принадлежности значений лингвистической переменной "Уровень качества курса"

    1.5. Данные и расстояния в пространствах произвольной природы

    Как показано выше, исходные статистические данные могут иметь разнообразную математическую природу, являться элементами разнообразных пространств - конечномерных, функциональных, бинарных отношений, множеств, нечетких множеств и т.д. Следовательно, центральной частью прикладной статистики является статистика в пространствах произвольной природы. Эта область прикладной статистики сама по себе не используется при анализе конкретных данных. Это очевидно, поскольку конкретные данные всегда имеют вполне определенную природу. Однако общие подходы, методы, результаты статистики в пространствах произвольной природы представляют собой научный инструментарий, готовый для использования в каждой конкретной области.

    Статистика в пространствах произвольной природы. Много ли общего у статистических методов анализа данных различной природы? На этот естественный вопрос можно сразу же однозначно ответить - да, очень много. Такой ответ будет постоянно подтверждаться и конкретизироваться на протяжении всего учебника. Несколько примеров приведем сразу же.

    Прежде всего отметим, что понятия случайного события, вероятности, независимости событий и случайных величин являются общими для любых конечных вероятностных пространств и любых конечных областей значений случайных величин (см. лекции 2 и 5). Поскольку все реальные явления и процессы описываются с помощью математических объектов из конечных множеств, сказанное выше означает, что конечных вероятностных пространств и дискретных случайных величин (точнее, величин, принимающих значения в конечном множестве) достаточно для всех практических применений. Переход к непрерывным моделям реальных явлений и процессов оправдан только тогда, когда этот переход облегчает проведение рассуждений и выкладок. Например, находить определенные интегралы зачастую проще, чем вычислять значения сумм. Не могу не отметить, что приведенные соображения о взаимосоотнесении дискретных и непрерывных математических моделей автор услышал более 30 лет назад от академика А.Н. Колмогорова (ясно, что за конкретную формулировку несет ответственность автор настоящего учебника).

    Основные проблемы прикладной статистики - описание данных, оценивание, проверка гипотез - также в своей существенной части могут быть рассмотрены в рамках статистики в пространствах произвольной природы. Например, для описания данных могут быть использованы эмпирические и теоретические средние, плотности вероятностей и их непараметрические оценки, регрессионные зависимости. Правда, для этого пространства произвольной природы должны быть снабжены соответствующим математическим инструментарием - расстояниями (показателями близости, мерами различия) между элементами рассматриваемых пространств.

    Популярный в настоящее время метод оценивания параметров распределений - метод максимального правдоподобия - не накладывает каких-либо ограничений на конкретный вид элементов выборки. Они могут лежать в пространстве произвольной природы. Математические условия касаются только свойств плотностей вероятности и их производных по параметрам. Аналогично положение с методом одношаговых оценок, идущим на смену методу максимального правдоподобия (см. ], когда задачу прикладной статистики удается представить в оптимизационном виде. Общая теория проверки статистических гипотез также не требует конкретизации математической природы рассматриваемых элементов выборок. Это относится, например, к лемме Неймана-Пирсона или теории статистических решений. Более того, естественная область построения теории статистик интегрального типа - это пространства произвольной природы (см. лекцию 7).

    Совершенно ясно, что в конкретных областях прикладной статистики накоплено большое число результатов, относящихся именно к этим областям. Особенно это касается областей, исследования в которых ведутся сотни лет, в частности, статистики случайных величин (одномерной статистики). Однако принципиально важно указать на "ядро" прикладной статистики - статистику в пространствах произвольной природы. Если постоянно "держать в уме" это ядро, то становится ясно, что, например, многие методы непараметрической оценки плотности вероятности или кластер-анализа, использующие только расстояния между объектами и элементами выборки, относятся именно к статистике объектов произвольной природы, а не к статистике случайных величин или многомерному статистическому анализу. Следовательно, и применяться они могут во всех областях прикладной статистики, а не только в тех, в которых "родились".

    Расстояния (метрики). В пространствах произвольной природы нет операции сложения, следовательно, статистические процедуры не могут быть основаны на использовании сумм. Поэтому используется другой математический инструментарий, использующий понятия типа расстояния.

    Как известно, расстоянием в пространстве $$Х$$ называется числовая функция двух переменных $$d(x,y), x\in X, y\in X$$, определенная на этом пространстве, т.е. в стандартных обозначениях $$d: X^2 \\rightarrow R^1$$, где $$R^1$$ - прямая, т.е. множество всех действительных чисел. Эта функция должна удовлетворять трем условиям (иногда их называют аксиомами):

  • неотрицательности: $$d(x,y) \geq 0$$, причем $$d(x,x) = 0$$, для любых значений $$x\in X, y\in X$$ ;
  • симметричности: $$d(x,y) = d(y,x)$$ для любых $$x\in X, y\in X$$ ;
  • неравенства треугольника: $$d(x,y) + d(y,z) \geq d(x,z)$$ для любых значений $$x\in X, y\in X, z\in X$$.
  • Для термина "расстояние" часто используется синоним - "метрика".

    Пример 1. Если $$d(x,x) = 0$$ и $$d(x,y) = 1$$ при $$x\ne y$$ для любых значений $$x\in X, y\in X$$, то, как легко проверить, функция $$d(x,y)$$ - расстояние (метрика). Такое расстояние естественно использовать в пространстве $$Х$$ значений номинального признака: если два значения (например, названные двумя экспертами) совпадают, то расстояние равно 0, а если различны - то 1.

    Пример 2. Расстояние, используемое в геометрии, очевидно, удовлетворяет трем приведенным выше аксиомам. Если $$Х$$ - это плоскость, а $$х(1)$$ и $$х(2)$$ - координаты точки $$x\in X$$ в некоторой прямоугольной системе координат, то эту точку естественно отождествить с двумерным вектором $$(х(1), х(2))$$. Тогда расстояние между точками $$х = (х(1), х(2))$$ и $$у = (у(1), у(2))$$ согласно известной формуле аналитической геометрии равно

    $$d(x,y)=\sqrt{(x(1)-y(1))^2+(x(2)-y(2))^2}.$$

    Пример 3. Евклидовым расстоянием в пространстве $$R^k$$ векторов вида $$x = (x(1), x(2), ..., x(k))$$ и $$y = (y(1), y(2), ..., y(k))$$ размерности $$k$$ называется

    $$d(x,y)= \left( \sum_{j=1}^k (x(j)-y(j))^2 \right)^{1/2}.$$

    В примере 2 рассмотрен частный случай примера 3 с $$k = 2$$.

    Пример 4. В пространстве $$R^k$$ векторов размерности $$k$$ используют также так называемое "блочное расстояние", имеющее вид

    $$d(x,y)=\sum_{j=1}^k|x(j)-y(j)|.$$

    Блочное расстояние соответствует передвижению по городу, разбитому на кварталы горизонтальными и вертикальными улицами. В результате можно передвигаться только параллельно одной из осей координат.

    Пример 5. В пространстве функций, элементами которого являются функции $$х = x(t), у = y(t), 0\leq t\leq 1$$, часто используют расстояние Колмогорова

    $$d(x,y)=\sup_{0\leq k\leq 0}|x(t)-y(t)|.$$

    Пример 6. Пространство функций, элементами которого являются функции $$х = x(t), у = y(t), 0\leq t\leq 1$$, превращают в метрическое пространство (т.е. в пространство с метрикой), вводя расстояние

    $$d_p(x,y)= \left( \int\limits_0^1(x(t)-y(t))^p dt \right)^{1/p}.$$

    Это пространство обычно обозначают $$L^p$$, где параметр $$p\geq 1$$ (при $$p < 1$$ не выполняются аксиомы метрического пространства, в частности, аксиома треугольника).

    Пример 7. Рассмотрим пространство квадратных матриц порядка $$k$$. Как ввести расстояние между матрицами $$А = ||a(i,j)||$$ и $$B = ||b(i,j)||$$? Можно сложить расстояния между соответствующими элементами матриц:

    $$d(A,B)=\sum_{i=1}^k \sum_{j=1}^k|a(i,j)-b(i,j)|.$$

    Пример 8. Предыдущий пример наводит на мысль о следующем полезном свойстве расстояний. Если на некотором пространстве определены два или больше расстояний, то их сумма - также расстояние.

    Пример 9. Пусть $$А$$ и $$В$$ - множества. Расстояние между множествами можно определить формулой

    $$a(A,B)=\mu(A\Delta B).$$

    Здесь $$\mu$$ - мера на рассматриваемом пространстве множеств, $$\Delta$$ - символ симметрической разности множеств.

    $$A\Delta B=(A\setminus B)\bigcup(B\setminus A).$$

    Если мера - так называемая считающая, т.е. приписывающая единичный вес каждому элементу множества, то введенное расстояние есть число несовпадающих элементов в множествах $$А$$ и $$В$$.

    Пример 10. Между множествами можно ввести и другое расстояние:

    $$d_1(A,B)=\frac{\mu(A\Delta B)}{\mu(A\cup B)}.$$

    В ряде задач прикладной статистики используются функции двух переменных, для которых выполнены не все три аксиомы расстояния, а только некоторые. Их обычно называют показателями различия, поскольку чем больше различаются объекты, тем больше значение функции. Иногда в том же смысле используют термин "мера близости". Он менее удачен, поскольку большее значение функции соответствует меньшей близости.

    Чаще всего отказываются от аксиомы, требующей выполнения неравенства треугольника, поскольку это требование не всегда находит обоснование в конкретной прикладной ситуации.

    Пример 11. В конечномерном векторном пространстве показателем различия является

    $$d(x,y)=\sum_{j=1}^k(x(j)-y(j))^2$$

    (сравните с примером 3).

    Показателями различия, но не расстояниями являются такие популярные в прикладной статистике показатели, как дисперсия или средний квадрат ошибки при оценивании.

    Иногда отказываются также и от аксиомы симметричности.

    Пример 12. Показателем различия чисел $$х$$ и $$у$$ является

    $$d(x,y)= \left| \frac{x}{y}-1 \right|.$$

    Такой показатель различия используют в ряде процедур экспертного оценивания.

    Что же касается первой аксиомы расстояния, то в различных постановках прикладной статистики ее обычно принимают. Вполне естественно, что наименьший показатель различия должен достигаться, причем именно на совпадающих объектах. Имеет ли смысл это наименьшее значение делать отличным от 0? Вряд ли, поскольку всегда можно добавить одну и ту же константу ко всем значениям показателя различия и тем самым добиться выполнения первой аксиомы.

    В прикладной статистике используются самые разные расстояния и показатели различия. О них пойдет речь в соответствующих разделах учебника.

    1.6. Аксиоматическое введение расстояний

    В прикладной статистике используют большое количество метрик и показателей различия (см. примеры в предыдущем пункте). Как обоснованно выбрать то или иное расстояние для использования в конкретной задаче? В 1959 г. американский статистик Джон Кемени предложил использовать аксиоматический подход, согласно которому следует сформулировать естественные для конкретной задачи аксиомы и вывести из них вид метрики. Этот подход получил большую популярность в нашей стране после выхода в 1972 г. переведенной на русский язык книги Дж. Кемени и Дж. Снелла [], в которой дана система аксиом для расстояния Кемени между упорядочениями. (Упорядочения, как и иные бинарные отношения, естественно представить в виде квадратных матриц из 0 и 1; тогда расстояние Кемени - это расстояние из примера 7 предыдущего пункта.) Последовала большая серия работ, в которых из тех или иных систем аксиом выводился вид метрики или показателя различия для различных видов данных, прежде всего для объектов нечисловой природы. Многие полученные результаты описаны в обзоре [], содержащем 161 ссылку, в том числе 69 на русском языке. Рассмотрим некоторые из наших результатов.

    Аксиоматическое введение расстояния между толерантностями. Толерантность - это бинарное отношение, являющееся рефлексивным и симметричным. Его обычно используют для описания отношения сходства между реальными объектами, отношений знакомства или дружбы между людьми. От отношения эквивалентности отличается тем, что свойство транзитивности не предполагается обязательно выполненным. Действительно, Иванов может быть знаком с Петровым, Петров - с Сидоровым, но при этом ничего необычного нет в том, что Иванов и Сидоров не знакомы между собой.

    Пусть множество $$Х$$, на котором определено отношение толерантности, состоит из конечного числа элементов: $$X = \{x_1, x_2, ..., x_k\}$$. Тогда толерантность описывается квадратной матрицей $$A = ||a(i,j)||, i,j = 1, 2,..., k$$, такой, что $$a(i,j) = 1$$, если $$x_i$$ и $$x_j$$ связаны отношением толерантности, и $$a(i,j) = 0$$ в противном случае. Матрица $$A$$ симметрична: $$a(i,j) = a(j,i)$$, на главной диагонали стоят единицы: $$a(i,i) = 1$$. Любая матрица, удовлетворяющая приведенным в предыдущей фразе условиям, является матрицей, соответствующей некоторому отношению толерантности. Матрице $$А$$ можно сопоставить неориентированный граф с вершинами в точках $$Х$$: вершины $$x_i$$ и $$x_j$$ соединены ребром тогда и только тогда, когда $$a(i,j) = 1$$. Толерантности используются, в частности, при проведении экспертных исследований (см. 11.6).

    Будем говорить, что толерантность $$А_3$$ лежит между толерантностями $$А_1$$ и $$А_2$$, если при всех $$i, j$$ число $$a_3(i,j)$$ лежит между числами $$a1(i,j)$$ и $$a_2(i,j)$$, т.е. выполнены либо неравенства $$a_1(i,j)\leq a_3(i,j) \leq a_2(i,j)$$, либо неравенства $$a_1(i,j) \geq a_3(i,j) \geq a2(i,j)$$.

    ]. Пусть

    (I) $$d(A_1, A_2)$$ - метрика в пространстве толерантностей, определенных на конечном множестве $$X = \{x_1, x_2, ..., x_k\}$$ ;

    (II) $$d(A_1, A_3) + d(A_3, A_2) = d(A_1, A_2)$$ тогда и только тогда, когда $$A_3$$ лежит между $$A_1$$ и $$A_2$$ ;

    (III) если отношения толерантности $$A_1$$ и $$A_2$$ отличаются только на одной паре элементов, т.е. $$a_1(i,j) = a_2(i,j)$$ при $$(i,j) \ne (i_0,j_0), i<j, i_0 < j_0$$, и $$a_1(i_0, j_0) \ne a_2(i_0, j_0)$$, то $$d(A_1, A_2) = 1$$.

    Тогда

    $$d(A_1,A_2)=\sum_{1\leq i<j\leq k}|a_1(i,j)-a_2(i,j)|=\frac12\sum_{i=1}^k\sum_{j=1}^k|a_1(i,j)-a_2(i,j)|.$$

    Таким образом, расстояние $$d(A_1, A_2)$$ только постоянным множителем 1/2 отличается от расстояния Кемени, введенного в пространстве всех бинарных отношений как расстояние Хемминга между описывающими отношения матрицами из 0 и 1 (см. пример 7 предыдущего пункта). Теорема 1 дает аксиоматическое введение расстояния в пространстве толерантностей. Оказалось, что оно является сужением расстояния Кемени на это пространство. Сам Дж. Кемени дал аналогичную систему аксиом для сужения на пространство упорядочений. Доказательство теоремы 1 вытекает из рассмотрений, связанных с аксиоматическим введением расстояний между множествами, и приводится ниже.

    Мера симметрической разности как расстояние между множествами. Как известно, бинарное отношение можно рассматривать как подмножество декартова квадрата $$Х_2$$ того множества $$Х$$, на котором оно определено. Поэтому теорему 1 можно рассматривать как аксиоматическое введение расстояния между множествами специального вида. Укажем систему аксиом для расстояния между множествами общего вида, описанного в примере 9 предыдущего пункта.

    Определение 1. Множество $$В$$ находится между множествами $$А$$ и $$С$$, если

    $$(A\bigcap C)\subseteq B\subseteq(A\bigcup C)$$

    С помощью определения 1 в совокупности множеств вводятся геометрические соотношения, использование которых полезно для восприятия рассматриваемых ситуаций.

    Расстояние между двумя точками в евклидовом пространстве не изменится, если обе точки сдвинуть на один и тот же вектор. Аналогичное свойство расстояния между множествами сформулируем в виде аксиомы 1. Оно соответствует аксиоме 3 Кемени и Снелла [, с.22] для расстояний между упорядочениями.

    Аксиома 1. Если $$A\bigcap C=B\bigcap C= \varnothing$$, то $$d(A,B)=d(A\cup C,B\cup C)$$.

    , с.38].

    Теорема 2. Пусть $$W$$ - алгебра множеств, $$d: W^2 \rightarrow R^1$$. Тогда аксиома 1 эквивалентна следующему условию: $$d(A,B) = d(A\setminus B, B\setminus A)$$ для любых $$A, B \in W$$.

    Доказательство. Поскольку

    $$(A\setminus B)\bigcap(A\bigcap B)= \varnothing, (B\setminus A)\bigcap(A\bigcap B)=\varnothing,$$

    то равенство $$d(A,B) = d(A\setminus B, B\setminus A)$$ следует из аксиомы 1. Обратное утверждение вытекает из того, что в условиях аксиомы 1

    $$(A\bigcup C)\setminus(B\bigcup C)=A\setminus B,(B\bigcup C)\setminus(A\bigcup C)=B\setminus A.$$

    Теорема 2 доказана.

    С целью внести в алгебру множеств W отношение "находиться между", аналогичное используемому при аксиоматическом введении расстояний в пространствах бинарных отношений (см. условие (II) в теореме 1), примем следующую аксиому.

    Аксиома 2. Если $$В$$ лежит между $$А$$ и $$С$$, то $$d(A,B)+d(B,C)= d(A,C)$$.

    Определение 3. Неотрицательная функция $$\mu$$, определенная на алгебре множеств $$W$$, называется мерой, если для любых двух непересекающихся множеств $$А$$ и $$В$$ из $$W$$ справедливо соотношение

    $$\mu(A\bigcup B)=\mu(A)+\mu(B).$$

    Понятие меры - это обобщение понятий длины линии, площади фигуры, объема тела.

    Теорема 3. Пусть $$W$$ - алгебра множеств, аксиомы 1 и 2 выполнены для функции $$d: W^2 \rightarrow [0;+\infty]$$. Функция $$d$$ симметрична: $$d(A,B) = d(B,A)$$ для любых $$А$$ и $$В$$ из $$W$$. Тогда существует, и притом единственная, мера $$\mu$$ на $$W$$ такая, что

    $$d(A,B)=\mu(A\Delta B)$$

    при всех $$А$$ и $$В$$ из $$W$$, где $$А\Delta В$$ - симметрическая разность множеств $$А$$ и $$В$$, т.е. $$A\Delta B=(A\setminus B)\bigcup(B\setminus A)$$.

    Доказательство. Положим

    $$\mu(B)=d(\varnothing,B),B\in W.$$

    Покажем, что определенная формулой (2) функция множества $$\mu$$ является мерой. Неотрицательность $$\mu$$ следует из неотрицательности $$d$$. Остается доказать аддитивность, т.е. что из $$A\bigcap B=\varnothing$$ следует, что

    $$\mu(A\bigcup B)=\mu(A)+\mu(B), A\in W, B\in W.$$

    Поскольку $$А$$ всегда лежит между $$\varnothing$$ и $$A\bigcup B$$, то по аксиоме 2

    $$\mu(A\bigcup B)=d(\varnothing, A\bigcup B)=d(\varnothing,A)+d(A,A\bigcup B)=\mu(A)+d(A,A\bigcup B).$$

    Если $$А\cap В=\varnothing$$, то по аксиоме 1 $$d(\varnothing,B)=d(A,A\bigcup B)$$, откуда с учетом (4) и следует (3).

    Докажем соотношение (1). Поскольку $$А\setminus B$$ и $$B\setminus A$$ имеют пустое пересечение, то согласно определению 1 пустое множество $$\varnothing$$ лежит между $$А\setminus B$$ и $$B\setminus A$$. Поэтому по аксиоме 2

    $$d(A\setminus B,B\setminus A)=d(A\setminus B,\varnothing)+d(\varnothing, B\setminus A).$$

    Из симметричности и соотношения (2) следует, что

    $$d(A\setminus B,\varnothing)=d(\varnothing, A\setminus B)=\mu(A\setminus B),$$

    откуда $$d(A\setminus B, B\setminus A)= \mu(A\setminus B) + \mu(B\setminus A)$$. Из соотношения (3) следует, что $$\mu(A\setminus B)+\mu(B\setminus A)=\mu(A\Delta B)$$. С другой стороны, по аксиоме 1 $$d(A\setminus B,B\setminus A)=d((A\setminus B)\bigcup(A\bigcap B),(B\setminus A)\bigcup(A\bigcap B))=d(A,B)$$. Из трех последних равенств вытекает справедливость равенства (1). Остается доказать единственность меры $$\mu$$ в соотношении (1). Поскольку $$А\Delta В = В$$ при $$А = \varnothing,$$ то из (1) следует (2), т.е. однозначность определения меры $$\mu = \mu(d)$$ по расстоянию $$d$$. Теорема 3 доказана.

    Теорема 4 (обратная). Пусть $$\mu$$ - мера, определенная на алгебре множеств $$W$$. Тогда функция $$d(A,B) = \mu(A\Delta B)$$ является псевдометрикой, для нее выполнены аксиомы 1 и 2.

    , с.79]). Доказательство аксиомы 2 содержится в [, c.181-183]. Аксиома 1 следует из того, что условия $$A\bigcap C=B\bigcap C=\varnothing$$ обеспечивают справедливость соотношений

    $$(A\bigcup C)\Delta(B\bigcup C)=((A\bigcup C)\setminus(B\bigcup C))\bigcup((B\bigcup C)\setminus(A\bigcup C))=(A\setminus B)\bigcup(B\setminus A)=A\Delta B.$$

    Замечание. Полагая в аксиоме 2 $$А = В = С$$, получаем, что $$d(A,А) + d(A,А) = d(A,А)$$, т.е. $$d(A,А) = 0$$. Согласно теоремам 3 и 4, из условий теоремы 3 следует неравенство треугольника. Таким образом, в теореме 3 действительно приведена система аксиом, определяющая семейство псевдометрик в пространстве множеств.

    Обсудим независимость (друг от друга) условий теоремы 3. Отбрасывание неотрицательности функции $$d$$ приводит к тому, что слово "мера" в теоремах 3 и 4 необходимо заменить на "заряд" [, с.328]. Этот термин обозначает аддитивную функцию множеств, не обладающую свойством неотрицательности. Заряд можно представить как разность двух мер.

    Функция $$d_1(A,B)=\sqrt{\mu(A\Delta B)}$$ является псевдометрикой, для нее выполнена аксиома 1, но не выполнена аксиома 2, следовательно, ее нельзя представить в виде (1).

    Приведем пример системы множеств $$W$$ и метрики в ней, для которых верна аксиома 2, но не верна аксиома 1, а потому эту метрику нельзя представить в виде (1). Пусть $$W$$ состоит из множеств $$\varnothing,A,B,A\bigcup B$$, причем $$А\cap В = \varnothing$$, а расстояния таковы:

    $$d(\varnothing,A)=d(\varnothing,B)=1, d(A,A\bigcup B)=d(B,A\bigcup B)=d(A,B)=2, d(\varnothing,A\bigcup B)=3.$$

    Если единица $$Х$$ алгебры множеств $$W$$ конечна, т.е. $$X = \{x_1, x_2,..., x_k\}$$, то расстояние (1) принимает вид

    $$d(A,B)=\sum_{i=1}^k\mu_i|\chi_A(x_i)-\chi_B(x_i)|,$$

    где $$\chi_С$$ - индикатор (индикаторная функция) множества $$С$$, т.е. $$\chi_С(х) = 1$$, если $$х\in С$$, и $$\chi_С(х) = 0$$ в противном случае. Как следует из теоремы 3, неотрицательный коэффициент $$\mu_i$$ - это мера одноэлементного множества $$\{x_i\}$$, а также расстояние этого множества от пустого множества, т.е.

    $$\mu_i=\mu(\{x_i\})=d(\varnothing,\{x_i\}).$$

    Если все коэффициенты $$\mu_i$$ положительны, то формула (5) определяет метрику, если хотя бы один равен 0, то - псевдометрику, поскольку в таком случае найдутся два различающиеся между собой множества $$А$$ и $$В$$, такие, что $$d(A,B) = 0$$.

    Расстояние определяется однозначно, если априори известны коэффициенты $$\mu_i$$. В частности, равноправность объектов (элементов единицы алгебры множеств $$Х$$ ) приводит к $$\mu_i\equiv 1$$. Требование равноправности содержится в аксиомах 2 и 4 Кемени [, с.21–22].

    Применим полученные результаты к толерантностям и докажем теорему 1. Совокупность всех толерантностей, определенных на конечном множестве $$Y$$, естественным образом ассоциируется с совокупностью всех подмножеств множества $$Х = \{(y_i, y_j), 1\leq i < j\leq k\}$$. А именно, пара $$(y_i, y_j)$$ входит в подмножество тогда и только тогда, когда $$y_i$$ и $$y_j$$ связаны отношением толерантности. Указанная совокупность подмножеств является алгеброй множеств с единицей $$Х$$. Определение 1 понятия "находиться между" для множеств полностью соответствует ранее данному определению понятия "находиться между" для толерантностей.

    $$Теорема 5$$. Пусть выполнены условия (I) и (II) теоремы 1 и аксиома 1. Тогда существуют числа $$\mu_{ij} > 0$$ такие, что

    $$d(A,B)=\sum_{1\leq i<j\leq k}\mu_{ij}|a(i,j)-b(i,j)|.$$

    Для доказательства достаточно сослаться на теорему 3. Поскольку в условии (I) требуется, чтобы функция $$d(A,B)$$ являлась метрикой, то необходимо $$\mu_ij > 0$$.

    $$Теорема 6$$. Пусть выполнены условия теоремы 1 и, кроме того, аксиома 1. Тогда верно заключение теоремы 1.

    Доказательство. Рассмотрим толерантность $$А$$, для которой $$a(i,j) = 1$$ при $$(i,j) = (i_0,j_0) и a(i,j) = 0$$ в противном случае. Согласно условию (III) теоремы 1 $$d(\varnothing,A)=1$$, а согласно (6) имеем $$d(\varnothing,A)=\mu_{i_0 j_0}$$. Следовательно, коэффициент $$\mu_{i_0 j_0} = 1$$, что и требовалось доказать.

    Для окончательного доказательства теоремы 1 осталось избавиться от требования справедливости аксиомы 1.

    Доказательство теоремы 1. Рассмотрим две толерантности $$А$$ и $$В$$ такие, что при представлении их в виде множеств $$A\subseteq B$$. Это означает, что $$a(i,j)\leq b(i,j)$$ при всех $$i,j$$. Поскольку $$Х$$ - конечное множество, то существует конечная последовательность толерантностей $$A_1, A_2, ..., A_m, ..., A_t$$ такая, что $$А_1 = А, A_t = B, A_1 \subseteq A_2\subseteq ... \subseteq A_m \subseteq ... \subseteq A_t$$, причем $$A_m+1$$ получается из $$A_m$$ заменой ровно одного значения $$a_m(i_m, j_m) = 0$$ на $$a_{m+1}(i_m, j_m) = 1$$, для $$(i, j) \ne (i_m, j_m)$$, при этом $$a_m(i,j)= a_{m+1}(i,j)$$. Тогда $$A_m$$ находится между $$A_{m-1}$$ и $$A_{m+1}$$, следовательно, по условию (II)

    $$d(A,B)=d(A_1,A_2)+d(A_2,A_3)+...+d(A_m,A_{m+1})+...+d(A_{t-1},A_t).$$

    По условию (III) $$d(A_m,A_{m+1}) = 1$$ при всех $$m$$, а потому заключение теоремы 1 верно для любых $$А$$ и $$В$$ таких, что $$A\subseteq B$$.

    Поскольку $$А\cap В$$ лежит между $$А$$ и $$В$$, то по условию (II)

    $$d(A,B)=d(A\cap B,A)+d(A\cap B,B)$$

    При этом $$А\cap В\subseteq А$$ и $$А\cap В\subseteq В$$. Применяя результат предыдущего абзаца, получаем – заключение теоремы 1 верно всегда.

    Замечание 1. Таким образом, условие (III) не только дает нормировку, но и заменяет аксиому 1.

    ], чтобы подчеркнуть цель рассуждения. По той же причине оно сохранено в формулировке теоремы 1, хотя в доказательстве удалось без него обойтись. Понадобилась только симметричность функции $$d$$.

    Аксиоматическое введение метрики в пространстве неотрицательных суммируемых функций. Рассмотрим пространство $$L(E, \mu)$$ неотрицательных суммируемых функций на множестве $$E$$ с мерой $$\mu$$. Далее в настоящем пункте будем рассматривать только функции из $$L(E, \mu)$$. Интегрирование всюду проводится по пространству $$Е$$ и по мере $$\mu$$. Будем писать $$g = h$$ или $$g \leq h$$, если указанные соотношения справедливы почти всюду по $$\mu$$ на $$Е$$ (т.е. могут нарушаться лишь на множестве нулевой меры).

    Аксиоматически введем расстояние в пространстве $$L(E, \mu)$$ (изложение следует работе []). Обозначим $$M(g,h)=\max(g,h)$$ и $$m(g,h)=\min(g,h)$$. Пусть $$D: L(E,\mu) \times L(E,\mu) \rightarrow R^1$$ - тот основной объект изучения, аксиомы для которого будут сейчас сформулированы.

    Аксиома 1. Если $$gh=0,g+h\ne 0$$, то $$D(g,h)=1$$.

    Аксиома 2. Если $$h\leq g$$, то $$D(g,h)=C\int(g-h)d\mu$$, где множитель $$С$$ не зависит от $$h$$, т.е. $$C=C(g)$$.

    $$Лемма$$. Из аксиом 1 и 2 следует, что для $$h\leq g\ne 0$$ имеем

    $$D(g,h)=\frac{\int(g-h)d\mu}{\int gd\mu}.$$

    Для доказательства заметим, что по аксиоме 1 $$D(g,0)=1$$, а по аксиоме 2 $$D(g,0)=C\int gd\mu$$, откуда $$C=\left( \int gd\mu\right)^{-1}$$. Подставляя это соотношение в аксиому 2, получаем заключение леммы.

    Требование согласованности расстояния в пространстве $$L(E,\mu)$$ с отношением "находиться между" приводит, как и ранее для расстояния $$d(A,B)$$, к следующей аксиоме.

    Аксиома 3. Для любых $$g$$ и $$h$$ справедливо равенство $$D(g,h)=D(M(g,h),g)+D(M(g,h),h)$$.

    ] так называемая D-метрика (от dissimilarity (англ.) - несходство), для которого это условие выполнено. Она имеет вид:

    $$D(A,B)= \left\{ \begin{gathered} \frac{\mu(A\Delta B)}{\mu(A\bigcup B)}, \mu(A\bigcup B) >0,\\ 0,\mu(A)=\mu(B)=0. \end{gathered} \right.$$

    Приведенные выше аксиомы являются обобщениями соответствующих аксиом для $$D$$ -метрики в пространстве множеств.

    Теорема 7. Из аксиом 1–3 следует, что

    $$D(g,h)= \left\{ \begin{gathered} \frac{\int|g-h|d\mu}{\int M(g,h)d\mu}, g+h\ne 0, \\ 0,g=h=0. \end{gathered} \right.$$

    Доказательство. Поскольку

    $$(M(g,h)-g)+(M(g,h)-h)=|g-h|,$$

    то заключение теоремы 7 при $$g+h\ne 0$$ вытекает из леммы и аксиомы 3. Из аксиомы 2 при $$g=0$$ следует, что $$D(0,0)=0$$. Легко видеть, что функция $$D$$, заданная формулой (8), удовлетворяет аксиомам 1–3 и, кроме того, $$D(g,h)\leq 1$$ при любых $$g$$ и $$h$$.

    ].

    Теорема 8. Функция $$D(g,h)$$, определенная формулой (8), является метрикой в $$L(E,\mu)$$ (при отождествлении функций, отличающихся лишь на множестве нулевой меры), причем $$D(g, f)+D(f,h)=D(g,h)$$ тогда и только тогда, когда $$f=g,f=h$$ или $$f=M(g,h)$$.

    Доказательство. Обратимся к определению метрики. Для рассматриваемой функции непосредственно очевидна справедливость условий неотрицательности и симметричности. Очевидна и эквивалентность условия $$D(g,h)=0$$ равенству $$g=h$$. Остается доказать неравенство треугольника и установить, когда оно обращается в равенство.

    Без ограничения общности можно считать, что рассматриваемые расстояния задаются верхней строкой формулы (8) и кроме того,

    $$R=\int M(g,f)d\mu-\int M(f,h)d\mu\geq 0$$

    (частные случаи с использованием нижней строки формулы (8) рассматриваются элементарно, а справедливости последнего неравенства можно добиться заменой обозначений функций - элементов пространства $$L(E,\mu)$$ ). Тогда

    $$D(g,f)+D(f,h)\geq \frac{\int(|g-f|+|f-h|)d\mu}{\int M(g,f)d\mu},$$

    причем равенство имеет место тогда и только тогда, когда $$R=0$$ или $$f=h$$. Положим

    $$P=\int(|g-f|+|f-h|-|g-h|)d\mu,Q=\int(M(g,f)-M(g,h))d\mu.$$

    Ясно, что $$P\geq 0$$ и

    $$\frac{\int(|g-f|+|f-h|)d\mu}{\int M(g,f)d\mu}=\frac{\int|g-h|d\mu+P}{\int M(g,h)d\mu+Q}.$$

    Если $$Q < 0$$, то очевидно, что неравенство треугольника выполнено, причем неравенство является строгим. Рассмотрим случай $$Q > 0$$.

    Воспользуемся следующим элементарным фактом: если $$y \geq x, y > 0, P > Q > 0$$, то

    $$\frac{x+P}{y+Q}>\frac{x}{y}.$$

    Из соотношений (10) и (11) вытекает, что для доказательства неравенства треугольника достаточно показать, что $$P–Q>0$$.

    Рассмотрим

    $$k={|g–f|+|f–h|–|g–h|}–M(g,f)+M(g,h).$$

    Применяя равенство $$(M(g,h)–g)+(M(g,h)–h)=|g–h|$$ к слагаемым, заключенным в фигурные скобки, получаем, что

    $$k=M(f,h)+[M(g,f)+M(f,h)–M(g,h)–2f].$$

    Применяя соотношение

    $$M(g,h)=g+h–m(g,h)$$

    к слагаемым, заключенным в квадратные скобки, получаем, что

    $$k=M(f,h)–m(f,h)–m(g,f)+m(g,h).$$

    Так как $$M(f,h)–m(f,h)=|f–h|$$, то

    $$k=|f–h|–(m(g,f)–m(g,h))\geq (f–h)–(m(g,f)–m(g,h)).$$

    В соответствии с (12) правая часть (13) есть $$M(g,f)–M(g,h)$$, а потому

    $$P–Q=\int k d\mu\geq Q > 0,$$

    что завершает доказательство для случая $$Q>0$$. При этом неравенство треугольника является строгим.

    Осталось рассмотреть случай $$Q = 0$$. В силу соотношений (9) и (10) неравенство треугольника выполнено. Когда оно обращается в равенство? Тривиальные случаи: $$f=g$$ или $$f=h$$. Если же $$f$$ отлично от $$g$$ и $$h$$, то необходимо, чтобы $$R=0$$ и $$P=0$$. Как легко проверить, последнее условие эквивалентно неравенствам

    $$m(g,h) \leq f \leq M(g,h).$$

    Из правого неравенства в (14) следует, что $$M(g,f)\leq M(g,M(g,h))= M(g,h)$$. Так как $$Q=0$$, то $$M(g,f)=M(g,h)$$. Аналогичным образом из соотношений

    $$M(h,f)\leq M(h,M(g,h))=M(g,h)=M(g,f)$$

    и $$R=0$$ следует, что $$M(f,h)=M(g,h)$$.

    Рассмотрим измеримое множество $$X=\{x\in E:h(x)<g(x)\}$$. Тогда $$M(g,h)(x)=M(f,h)(x)=g(x)>h(x)$$, т.е. $$h(x)<f(x)=M(g,h)(x)$$ для почти всех $$x\in X$$. Для почти всех $$y\in\{x\in E:h(x)>g(x)\}$$ точно так же получаем $$f(y)=M(g,h)(y)$$. Для почти всех $$z\in\{x\in E:h(x)=g(x)\}$$ в силу (14) $$f(z)=M(g,h)(z)$$, что и завершает доказательство теоремы.

    ].

    Контрольные вопросы и задачи

  • Приведите примеры практического использования количественных и категоризованных данных.
  • Как соотносятся группы допустимых преобразований для различных шкал измерения?
  • Почему анализ нечисловых данных занимает одно из центральных мест в прикладной статистике?
  • В каких случаях целесообразно применение нечетких множеств?
  • Справедливо ли для нечетких множеств равенство $$(A+B)C=AC+BC$$? А равенство $$(AB)C=(AC)(BC)$$?
  • Докажите, что для блочного расстояния (пример 4 из п.1.5) справедливо неравенство треугольника.
  • Расскажите о многообразии расстояний в различных пространствах статистических данных.
  • Докажите, что если $$d(x,y)$$ - расстояние в некотором пространстве, то $$\sart{d(x,y)}$$ - также расстояние в этом пространстве.
  • Темы докладов, рефератов, исследовательских работ

  • Содержание первого сочинения по прикладной статистике - книги "Числа" в Библии.
  • Свойства основных шкал измерения.
  • Взаимосвязи различных классов объектов нечисловой природы между собой.
  • Опишите с помощью нечеткого подмножества временной шкалы понятие "молодой человек" (на основе опроса 10–20 экспертов).
  • Опишите с помощью теории нечеткости понятие "куча зерен" (на основе опроса 10–20 экспертов).
  • Центральная роль статистики объектов произвольной природы в прикладной статистике.
  • Расстояния в пространствах функций.
  • Докажите, что аксиоматически введенный в п.1.6 показатель различия между множествами $$d(A,B)=\mu(А\Delta В)$$ удовлетворяет неравенству треугольника.
  • Страницы:

    1.1. Количественные и категоризованные данные

    Методы прикладной статистики - это методы анализа данных, причем обычно достаточно большого их количества. Статистические данные могут иметь различную природу. Исторически самыми ранними были два вида данных - сведения о числе объектов, удовлетворяющих тем или иным условиям, и числовые результаты измерений.

    Первый из этих видов до сих пор главенствует в сборниках государственных статистических органов. Такого рода данные часто называют категоризованными, поскольку о каждом из рассматриваемых объектов известно, в какую из нескольких заранее заданных категорий он попадает. Примером является информация Росстата о населении страны, с разделением по возрастным категориям и полу. Часто при составлении таблиц жертвуют информацией, заменяя точное значение измеряемой величины на указание интервала группировки, в которую это значение попадает. Например, вместо точного возраста человека используют лишь один из указанных в таблице возрастных интервалов.

    Второй наиболее распространенный вид - количественные данные, рассматриваемые как действительные числа. Таковы результаты измерений, наблюдений, испытаний, опытов, анализов. Количественные данные обычно описываются набором чисел (выборкой), а не таблицей.

    Нельзя утверждать, что категоризованные данные соответствуют первому этапу исследования, а числовые - следующему, на котором используются более совершенные методы измерения. Дело в том, что человеку свойственно давать качественные ответы на возникающие в его практической деятельности вопросы. Примером является используемая А.А. Пивнем таблица сильных и слабых сторон внутренней среды конкретной компании (табл.1.1).

    Ясно, что вполне можно превратить в числа значения признаков, названия которых приведены в столбце "Показатели компании", однако этот переход будет зависеть от исследователя, носить неизбежный налет субъективизма.

    Иногда не удается однозначно отнести данные к категоризованным или количественным. Например, в Ветхом Завете, в Четвертой книге Моисея "Числа" указывается количество воинов в различных коленах. С одной стороны, это типичные категоризованные данные, градациями служат названия колен. С другой стороны, эти данные можно рассматривать как количественные, как выборку, их вполне естественно складывать, вычислять среднее арифметическое и т.п.

    Описанная ситуация типична. Существует весьма много различных видов статистических данных. Это связано, в частности, со способами их получения. Например, если испытания некоторых технических устройств продолжаются до определенного момента, то получаем так называемые цензурированные данные, состоящие из набора чисел - продолжительности работы ряда устройств до отказа, и информации о том, что остальные устройства продолжали работать в момент окончания испытания. Такого рода данные часто используются при оценке и контроле надежности технических устройств.

    Описание вида данных и, при необходимости, механизма их порождения - начало любого статистического исследования.

    В простейшем случае статистические данные - это значения некоторого признака, свойственного изучаемым объектам. Значения могут быть количественными или представлять собой указание на категорию, к которой можно отнести объект. Во втором случае говорят о качественном признаке. Используют и более сложные признаки, перечень которых будет расширяться по мере развертывания изложения в учебнике.

    При измерении по нескольким количественным или качественным признакам в качестве статистических данных об объекте получаем вектор. Его можно рассматривать как новый вид данных. В таком случае выборка состоит из набора векторов. Если часть координат - числа, а часть - качественные (категоризованные) данные, то говорим о векторе разнотипных данных.

    Одним элементом выборки, т.е. одним измерением, может быть и функция в целом. Например, электрокардиограмма больного или амплитуда биений вала двигателя, или временной ряд, описывающий динамику показателей определенной фирмы. Тогда выборка состоит из набора функций.

    Элементами выборки могут быть и бинарные отношения. Например, при опросах экспертов часто используют упорядочения (ранжировки) объектов экспертизы - образцов продукции, инвестиционных проектов, вариантов управленческих решений. В зависимости от регламента экспертного исследования элементами выборки могут быть различные виды бинарных отношений (упорядочения, разбиения, толерантности), множества, нечеткие множества и т.д.

    Итак, математическая природа элементов выборки в различных задачах прикладной статистики может быть самой разной. Однако можно выделить два класса статистических данных - числовые и нечисловые. Соответственно прикладная статистика разбивается на две части - числовую и нечисловую.

    Числовые статистические данные - это числа, векторы, функции. Их можно складывать, умножать на коэффициенты. Поэтому в числовой статистике большое значение имеют разнообразные суммы. Математический аппарат анализа сумм случайных элементов выборки – это (классические) законы больших чисел и центральные предельные теоремы (см. лекцию 4).

    Нечисловые статистические данные - это категоризованные данные, векторы разнотипных признаков, бинарные отношения, множества, нечеткие множества и др. Их нельзя складывать и умножать на коэффициенты. Поэтому не имеет смысла говорить о суммах нечисловых статистических данных. Они являются элементами нечисловых математических пространств (множеств). Математический аппарат анализа нечисловых статистических данных основан на использовании расстояний между элементами (а также мер близости, показателей различия) в таких пространствах. С помощью расстояний определяются эмпирические и теоретические средние, доказываются законы больших чисел, строятся непараметрические оценки плотности распределения вероятностей, решаются задачи диагностики и кластерного анализа, и т.д. (см. лекцию 11).

    Сведем информацию об основных областях прикладной статистики в табл.1.2. Отметим, что модели порождения цензурированных данных входят в состав каждой из рассматриваемых областей.

    Оценка сильных и слабых сторон внутренней среды компании
    Показатели компании Оценка показателя (по отношению к предприятиям отрасли) Важность (вес)
    Очень высокая Высокая Средняя Низкая Очень низкая Высокая Средняя Низкая
    1 2 3 4 5 6 7 8 9
    Финансы
    1. Оценка структуры активов Х Х
    2. Инвестиционная привлекательность Х Х
    3. Доход на активы Х Х
    4. Норма прибыли Х Х
    5. Доход на вложенный капитал Х Х
    Производство
    1. Использование оборудования Х Х
    2. Производственные мощности Х Х
    3. Численность персонала Х Х
    4. Система контроля качества Х Х
    5. Возможность расширения производства Х Х
    6. Износ оборудования Х Х
    Организация и управление
    1. Численность ИТР и управленческого персонала Х Х
    2. Скорость реакции управления на изменения во внешней среде Х Х
    3. Четкость разделения полномочий и функций Х Х
    4. Качество используемой в управлении информации Х Х
    5. Гибкость оргструктуры управления Х Х
    Маркетинг
    1. Доля рынка Х Х
    2. Репутация компании Х Х
    3. Престиж торговой марки Х Х
    4. Стимулирование сбыта Х Х
    5. Численность сбытового персонала Х Х
    6. Уровень цен Х Х
    7. Уровень сервиса Х Х
    8. Число клиентов Х Х
    9. Качество поступающей информации Х Х
    Кадровый состав
    1. Уровень квалификации производственного персонала Х Х
    2. Расходы по подготовке и переподготовке персонала Х Х
    3. Уровень подготовке сбытового персонала в технической области Х Х
    Технология
    1. Применяемые стандарты Х Х
    2. Новые продукты Х Х
    3. Расходы на НИОКР Х Х
    Области прикладной статистики
    № п/п Вид статистических данных Область прикладной статистики
    1 Числа Статистика (случайных) величин
    2 Конечномерные векторы Многомерный статистический анализ
    3 Функции Статистика случайных процессов и временных рядов
    4 Объекты нечисловой природы Статистика нечисловых данных (статистика объектов нечисловой природы)

    1.2. Основные шкалы измерения

    Почему необходима теория измерений? Теория измерений (в дальнейшем сокращенно ТИ) является одной из составных частей прикладной статистики. Она входит в состав статистики объектов нечисловой природы.

    Использование чисел в жизни и хозяйственной деятельности людей отнюдь не всегда предполагает, что их можно складывать и умножать, производить иные арифметические действия. Что бы вы сказали о человеке, который занимается умножением телефонных номеров? И отнюдь не всегда 2+2=4. Если вы вечером поместите в клетку двух животных, а потом еще двух, то отнюдь не всегда можно утром найти в этой клетке четырех животных. Их может быть и намного больше - если вечером вы загнали в клетку овцематок или беременных кошек. Их может быть и меньше - если к двум волкам вы поместили двух ягнят. Числа используются гораздо шире, чем арифметика.

    Так, например, мнения экспертов часто выражены в порядковой шкале (подробнее о шкалах говорится ниже), т.е. эксперт может сказать (и обосновать), что один показатель качества продукции более важен, чем другой, первый технологический объект более опасен, чем второй, и т.д. Но он не в состоянии сказать, во сколько раз или на сколько более важен, соответственно – более опасен. Экспертов часто просят дать ранжировку (упорядочение) объектов экспертизы, т.е. расположить их в порядке возрастания (или убывания) интенсивности интересующей организаторов экспертизы характеристики. Ранг - это номер объекта экспертизы в упорядоченном ряду значений характеристики у различных объектов. Такой ряд в статистике называется вариационным. Формально ранги выражаются числами 1, 2, 3, ..., но с этими числами нельзя совершать привычные арифметические операции. Например, хотя в арифметике 1 + 2 = 3, нельзя утверждать, что для объекта, стоящем на третьем месте в упорядочении, интенсивность изучаемой характеристики равна сумме интенсивностей объектов с рангами 1 и 2. Так, один из видов экспертного оценивания - оценки учащихся. Вряд ли кто-либо будет утверждать, что знания отличника равны сумме знаний двоечника и троечника (хотя 5 = 2 + 3), хорошист соответствует двум двоечникам (2 + 2 = 4), а между отличником и троечником такая же разница, как между хорошистом и двоечником (5 – 3 = 4 – 2). Поэтому очевидно, что для анализа подобного рода качественных данных необходима не всем известная арифметика, а другая теория, дающая базу для разработки, изучения и применения конкретных методов расчета. Это и есть теория измерений (ТИ).

    При чтении литературы надо иметь в виду, что в настоящее время термин "теория измерений" применяется для обозначения целого ряда научных дисциплин. А именно – классической метрологии (науки об измерениях физических величин), рассматриваемой здесь ТИ, некоторых других направлений, например, алгоритмической теории измерений. Обычно из контекста понятно, о какой конкретно теории идет речь.

    Краткая история теории измерений. Сначала ТИ развивалась как теория психофизических измерений. В послевоенных публикациях американский психолог С.С. Стивенс основное внимание уделял шкалам измерения. Во второй половине ХХ в. сфера применения ТИ стремительно расширяется. Посмотрим, как это происходило. Один из томов выпущенной в США в 1950-х гг. "Энциклопедии психологических наук" назывался "Психологические измерения". Значит, составители этого тома расширили сферу применения РТИ с психофизики на психологию в целом. А в основной статье в этом сборнике под названием, обратите внимание, "Основы теории измерений", изложение шло на абстрактно-математическом уровне, без привязки к какой-либо конкретной области применения. В этой статье [] упор был сделан на "гомоморфизмах эмпирических систем с отношениями в числовые" (в эти математические термины здесь вдаваться нет необходимости), и математическая сложность изложения возросла по сравнению с работами С.С. Стивенса.

    Уже в одной из первых отечественных статей по РТИ (конец 1960-х гг.) было установлено, что баллы, присваиваемые экспертами при оценке объектов экспертизы, измерены, как правило, в порядковой шкале. Отечественные работы, появившиеся в начале 1970-х гг., привели к существенному расширению области использования РТИ. Ее применяли в педагогической квалиметрии (измерении качества знаний учащихся), в системных исследованиях, в различных задачах теории экспертных оценок, для агрегирования показателей качества продукции, в социологических исследованиях, и др.

    Итоги этого этапа были подведены в монографии []. В качестве двух основных проблем РТИ наряду с установлением типа шкалы измерения конкретных данных был выдвинут поиск алгоритмов анализа данных, результат работы которых не меняется при любом допустимом преобразовании шкалы (т.е. является инвариантным относительно этого преобразования).

    Метрологи вначале резко возражали против использования термина "измерение" для качественных признаков. Однако постепенно возражения сошли на нет, и к концу ХХ в. ТИ стала рассматриваться как общенаучная теория.

    Шесть типов шкал. В соответствии с ТИ при математическом моделировании реального явления или процесса следует прежде всего установить типы шкал, в которых измерены те или иные переменные. Тип шкалы задает группу допустимых преобразований шкалы. Допустимые преобразования не меняют соотношений между объектами измерения. Например, при измерении длины переход от аршинов к метрам не меняет интересующих исследователя соотношений между длинами рассматриваемых объектов - если первый объект длиннее второго, то это будет установлено и при измерении в аршинах, и при измерении в метрах. Обратите внимание, что при этом численное значение длины в аршинах отличается от численного значения длины в метрах - не меняется лишь результат сравнения длин двух объектов.

    Укажем основные виды шкал измерения и соответствующие группы допустимых преобразований.

    В шкале наименований (другое название этой шкалы - номинальная - переписанное русскими буквами английское название шкалы) допустимыми являются все взаимно-однозначные преобразования. В этой шкале числа используются лишь как метки. Примерно так же, как при сдаче белья в прачечную, т.е. лишь для различения объектов. В шкале наименований измерены, например, номера телефонов, автомашин, паспортов, студенческих билетов, страховых свидетельств государственного пенсионного страхования, медицинского страхования, ИНН (индивидуальный номер налогоплательщика). Пол людей также измерен в шкале наименований, результат измерения принимает два значения - мужской, женский. Раса, национальность, цвет глаз, волос - номинальные признаки. Номера букв в алфавите - тоже измерения в шкале наименований. Никому в здравом уме не придет в голову складывать или умножать номера телефонов, такие операции не имеют смысла. Сравнивать буквы и говорить, например, что буква П лучше буквы С, также никто не будет. Единственное, для чего годятся измерения в шкале наименований - это различать объекты. Во многих случаях только это от них и требуется. Например, шкафчики в раздевалках для взрослых различают по номерам, т.е. числам, а в детских садах используют рисунки, поскольку дети еще не знают чисел.

    В порядковой шкале числа используются не только для различения объектов, но и для установления порядка между ними. Простейшим примером являются оценки знаний учащихся. Символично, что в средней школе применяются оценки 2, 3, 4, 5, а в высшей школе ровно тот же смысл выражается словесно - неудовлетворительно, удовлетворительно, хорошо, отлично. Этим подчеркивается "нечисловой" характер оценок знаний учащихся. В порядковой шкале допустимыми являются все строго возрастающие преобразования.

    Установление типа шкалы, т.е. задания группы допустимых преобразований шкалы измерения - дело специалистов соответствующей прикладной области. Так, оценки привлекательности профессий мы, выступая в качестве социологов [], считали измеренными в порядковой шкале. Однако отдельные социологи не соглашались с нами, полагая, что выпускники школ пользуются шкалой с более узкой группой допустимых преобразований, например, интервальной шкалой. Очевидно, эта проблема относится не к математике, а к наукам о человеке. Для ее решения должен быть проведен достаточно трудоемкий эксперимент. В настоящее же время целесообразно принимать порядковую шкалу, так как это гарантирует от возможных ошибок.

    Почему мнения экспертов естественно выражать именно в порядковой шкале? Как показали многочисленные опыты, человек более правильно (и с меньшими затруднениями) отвечает на вопросы качественного, например, сравнительного, характера, чем количественного. Так, ему легче сказать, какая из двух гирь тяжелее, чем указать их примерный вес в граммах.

    В различных областях человеческой деятельности применяется много других видов порядковых шкал. Так, например, в минералогии используется шкала Мооса, по которому минералы классифицируются согласно критерию твердости. А именно: тальк имеет балл 1, гипс - 2, кальций - 3, флюорит - 4, апатит - 5, ортоклаз - 6, кварц - 7, топаз - 8, корунд - 9, алмаз - 10. Минерал с большим номером является более твердым, чем минерал с меньшим номером, и при нажатии царапает его.

    Порядковыми шкалами в географии являются: бофортова шкала ветров ("штиль", "слабый ветер", "умеренный ветер" и т.д.), шкала силы землетрясений. Очевидно, нельзя утверждать, что землетрясение в 2 балла (лампа качнулась под потолком - такое бывает и в Москве) ровно в 5 раз слабее, чем землетрясение в 10 баллов (полное разрушение всего на поверхности земли).

    В медицине: шкала стадий гипертонической болезни (по Мясникову), шкала степеней сердечной недостаточности (по Стражеско-Василенко-Лангу), шкала степени выраженности коронарной недостаточности (по Фогельсону) и т.д. Все эти шкалы построены по схеме: заболевание не обнаружено; первая стадия заболевания; вторая стадия; третья стадия... Иногда выделяют стадии 1а, 1б и др. Каждая из них имеет свойственную только ей медицинскую характеристику. При описании групп инвалидности числа используются в противоположном порядке: самая тяжелая - первая группа инвалидности, затем - вторая, самая легкая - третья.

    Номера домов также измерены в порядковой шкале - они показывают, в каком порядке стоят дома вдоль улицы. Номера томов в собрании сочинений писателя или номера дел в архиве предприятия обычно связаны с хронологическим порядком их создания.

    При оценке качества продукции и услуг, в так называемой квалиметрии (буквальный перевод: измерение качества) популярны порядковые шкалы. А именно, единица продукции оценивается как годная или не годная. При более тщательном анализе используется шкала с тремя градациями: есть значительные дефекты - присутствуют только незначительные дефекты - нет дефектов. Иногда применяют четыре градации: имеются критические дефекты (делающие невозможным использование) - есть значительные дефекты - присутствуют только незначительные дефекты - нет дефектов. Аналогичный смысл имеет сортность продукции - высший сорт, первый сорт, второй сорт,...

    При оценке экологических воздействий первая, наиболее обобщенная оценка - обычно порядковая, например: природная среда стабильна - природная среда угнетена (деградирует). Аналогично в эколого-медицинской шкале: нет выраженного воздействия на здоровье людей - отмечается отрицательное воздействие на здоровье.

    Порядковая шкала используется и во многих иных областях. В эконометрике это прежде всего различные методы экспертных оценок (см. лекцию 3).

    Все шкалы измерения делят на две группы - шкалы качественных и количественных признаков.

    Порядковая шкала и шкала наименований - основные шкалы качественных признаков. Поэтому во многих конкретных областях результаты качественного анализа можно рассматривать как измерения по этим шкалам.

    Шкалы количественных признаков - это шкалы интервалов, отношений, разностей, абсолютная. По шкале интервалов измеряют величину потенциальной энергии или координату точки на прямой. В этих случаях на шкале нельзя отметить ни естественное начало отсчета, ни естественную единицу измерения. Исследователь должен сам задать точку отсчета и сам выбрать единицу измерения. Допустимыми преобразованиями в шкале интервалов являются линейные возрастающие преобразования, т.е. линейные функции. Температурные шкалы Цельсия и Фаренгейта связаны именно такой зависимостью: $$^\circ C$$ = 5/9 ( $$^\circ F$$ - 32), где $$^\circ C$$ - температура (в градусах) по шкале Цельсия, а $$^\circ F$$ - температура по шкале Фаренгейта.

    Из количественных шкал наиболее распространенными в науке и практике являются шкалы отношений. В них есть естественное начало отсчета - ноль, т.е. отсутствие величины, но нет естественной единицы измерения. По шкале отношений измерены большинство физических единиц: масса тела, длина, заряд, а также цены в экономике. Допустимыми преобразованиями в шкале отношений являются подобные (изменяющие только масштаб). Другими словами – линейные возрастающие преобразования без свободного члена. Примером является пересчет цен из одной валюты в другую по фиксированному курсу. Предположим, мы сравниваем экономическую эффективность двух инвестиционных проектов, используя цены в рублях. Пусть первый проект оказался лучше второго. Теперь перейдем на валюту самой экономически мощной державы мира - юани, используя фиксированный курс пересчета. Очевидно (исходя из общих соображений), что первый проект должен опять оказаться более выгодным. Однако алгоритмы расчета не обеспечивают автоматически выполнения этого очевидного условия. Надо проверять, что оно выполнено. Результаты подобной проверки для средних величин описаны ниже (см. 5.3).

    В шкале разностей есть естественная единица измерения, но нет естественного начала отсчета. Время измеряется по шкале ], разработанной группой известного математика акад. РАН А.Т. Фоменко, Господь Иисус Христос родился примерно в 1054 г. по принятому ныне летоисчислению в Стамбуле (он же - Царьград, Византия, Троя, Иерусалим, Рим).

    Только для абсолютной шкалы результаты измерений - числа в обычном смысле слова. Примером является число людей в комнате. Для абсолютной шкалы допустимым является только тождественное преобразование.

    В процессе развития соответствующей области знания тип шкалы может меняться. Так, сначала температура измерялась по порядковой шкале (холоднее - теплее). Затем - по интервальной (шкалы Цельсия, Фаренгейта, Реомюра). Наконец, после открытия абсолютного нуля температуру можно считать измеренной по шкале отношений (шкала Кельвина). Надо отметить, что среди специалистов иногда имеются разногласия по поводу того, по каким шкалам следует считать измеренными те или иные реальные величины. Другими словами, процесс измерения включает в себя и определение типа шкалы (вместе с обоснованием выбора). Кроме перечисленных шести основных типов шкал иногда используют и другие.

    Обсуждение шкал измерения будет продолжено далее в более широком контексте - как одного из понятий статистики нечисловых данных.

    1.3. Нечисловые данные

    Статистика нечисловых данных - это направление в прикладной статистике, в котором в качестве исходных статистических данных (результатов наблюдений) рассматриваются объекты нечисловой природы. Так принято называть объекты, которые нельзя складывать и умножать на числа, в частности, элементы нелинейных пространств. Примерами являются бинарные отношения (ранжировки, разбиения, толерантности и др.), результаты парных и множественных сравнений, множества, нечеткие множества, измерение в шкалах, отличных от абсолютных. Этот перечень примеров не претендует на законченность. Он складывался постепенно, по мере того, как развивались теоретические исследования в области статистики нечисловых данных и расширялся опыт применений этого направления прикладной статистики.

    Объекты нечисловой природы широко используются в теоретических и прикладных исследованиях по экономике, менеджменту и другим проблемам управления, в частности, управления качеством продукции, в технических науках, социологии, психологии, медицине и т.д., а также практически во всех отраслях народного хозяйства.

    Начнем с первоначального знакомства с основными видами объектов нечисловой природы.

    ] использовалось среднее арифметическое баллов, выставленных профессии опрошенными школьниками. В частности, физика получила средний балл 7,69, а математика - 7,50. Поскольку 7,69 больше, чем 7,50, был сделан вывод, что физика более предпочтительна для школьников, чем математика.

    Однако этот вывод противоречит данным работы [], согласно которым ленинградские школьники средних классов больше любят математику, чем физику. Обсудим одно из возможных объяснений этого противоречия, которое сводится к указанию на неадекватность (с точки зрения теории измерений) методики обработки эконометрических данных, примененной в работе [].

    Дело в том, что баллы 1,2,...,10 введены конкретными исследователями, т.е. субъективно. Если одна профессия оценена в 10 баллов, а вторая - в 2, то из этого нельзя заключить, что первая ровно в 5 раз привлекательней второй. Другой коллектив социологов мог бы принять иную систему баллов, например 1,4,9,16,...,100. Естественно предположить, что упорядочивание профессий по привлекательности, присущее школьникам, не зависит от того, какой системой баллов им предложит пользоваться маркетолог. Раз так, то распределение профессий по градациям десятибалльной системы не изменится, если перейти к другой системе баллов с помощью любого допустимого преобразования в порядковой шкале, т.е. с помощью строго возрастающей функции $$g:R^1\rightarrow R^1$$. Если $$Y_1, Y_2,...,Y_n$$ - ответы $$n$$ выпускников школ, касающихся математики, а $$Z_1, Z_2,...,Z_n$$ - физики, то после перехода к новой системе баллов ответы относительно математики будут иметь вид $$g(Y_1), g(Y_2),...,g(Y_n)$$, а относительно физики - $$g(Z_1), g(Z_2),...,g(Z_n)$$.

    Пусть единая оценка привлекательности профессии вычисляется с помощью функции $$f(X_1, X_2,...,X_n)$$. Какие требования естественно наложить на функцию $$f:R^n\rightarrow R^1$$, чтобы полученные с ее помощью выводы не зависели от того, какой именно системой баллов пользовался специалист по маркетингу образовательных услуг?

    Замечание. Обсуждение можно вести в терминах экспертных оценок. Тогда вместо сравнения математики и физики $$n$$ экспертов (а не выпускников школ) оценивают по конкурентоспособности на мировом рынке, например, две марки стали. Однако в настоящее время маркетинговые и социологические исследования более привычны, чем экспертные.

    Единая оценка вычислялась для того, чтобы сравнивать профессии по привлекательности. Пусть $$f(X_1, X_2,...,X_n)$$ - среднее по Коши. Пусть среднее по первой совокупности меньше среднего по второй совокупности:

    $$f(Y_1, Y_2,...,Y_n) < f(Z_1, Z_2,...,Z_n ).$$

    Тогда согласно теории измерений необходимо потребовать, чтобы для любого допустимого преобразования $$g$$ из группы допустимых преобразований в порядковой шкале было справедливо также неравенство

    $$f(g(Y_1), g(Y_2),...,g(Y_n)) < f(g(Z_1), g(Z_2),...,g(Z_n)),$$

    т.е. среднее преобразованных значений из первой совокупности также было меньше среднего преобразованных значений для второй совокупности. Причем сформулированное условие должно быть верно для любых двух совокупностей $$Y_1, Y_2,...,Y_n$$ и $$Z_1, Z_2,...,Z_n$$ и, напомним, любого допустимого преобразования. Средние величины, удовлетворяющие сформулированному условию, называют допустимыми (в порядковой шкале). Согласно теории измерений только такими средними можно пользоваться при анализе мнений выпускников школ, экспертов и иных данных, измеренных в порядковой шкале.

    Какие единые оценки привлекательности профессий $$f(X_1, X_2,...,X_n)$$ устойчивы относительно сравнения? Ответ на этот вопрос дается ниже в ] новосибирских специалистов по маркетингу образовательных услуг, пользоваться нельзя, а порядковыми статистиками, т.е. членами вариационного ряда (и только ими) - можно.

    Методы анализа конкретных экономических данных, измеренных в шкалах, отличных от абсолютной, являются предметом изучения в статистике нечисловых данных как части прикладной статистики. Как известно, основные шкалы измерения делятся на качественные (шкалы наименований и порядка) и количественные (шкалы интервалов, отношений, разностей, абсолютная). Методы анализа статистических данных в количественных шкалах сравнительно мало отличаются от таковых в абсолютной шкале. Добавляется только требование инвариантности относительно преобразований сдвига и/или масштаба. Методы анализа качественных данных - принципиально иные.

    Напомним, что исходным понятием теории измерений является совокупность $$\Phi=\{\varphi\}$$ допустимых преобразований шкалы (обычно $$\Phi$$ - группа), $$\varphi:R^1\rightarrow R^1$$. Алгоритм обработки данных $$W$$, т.е. функция $$W:R^n\rightarrow A$$ (здесь $$A$$ -множество возможных результатов работы алгоритма) называется адекватным в шкале с совокупностью допустимых преобразований $$\Phi$$, если

    $$W(x_1,x_2,...,x_n)=W(\varphi(x_1),\varphi(x_2),...,\varphi(x_n))$$

    для всех $$x_i\in R^1, i=1,2,...,n$$ и всех $$\varphi\in\Phi$$. Таким образом, теорию измерений рассматриваем как теорию инвариантов относительно различных совокупностей допустимых преобразований $$\Phi$$. Интерес вызывают две задачи:

  • дана группа допустимых преобразований $$\Phi$$ (т.е. задана шкала). Какие алгоритмы анализа данных $$W$$ из определенного класса являются адекватными?
  • дан алгоритм анализа данных $$W$$. Для каких шкал (т.е. групп допустимых преобразований $$\Phi$$ ) он является адекватным?
  • В ,,].

    Бинарные отношения. Пусть $$W:R^n\rightarrow A$$ - адекватный алгоритм в шкале наименований. Можно показать, что этот алгоритм задается некоторой функцией от матрицы $$B=||b_{ij}||=B(x_1,x_2,...,x_n)$$ где

    $$b_{ij}= \left\{ \begin{gathered} 1,x_i=x_j, i, j=1,2,...,n, \\ 0,x_i\ne x_j, i, j=1,2,...,n. \end{gathered} \right.$$

    Если $$W:R^n\rightarrow A$$ - адекватный алгоритм в порядковой шкале, то этот алгоритм задается некоторой функцией от матрицы $$C=||c_{ij}||=C(x_1,x_2,...,x_n)$$ порядка $$n \times n$$, где

    $$c_{ij}= \left \{ \begin{gathered} 1,x_i\leq x_j, i, j=1,2,...,n, \\ 0,x_i > x_j, i, j=1,2,...,n. \end{gathered} \right.$$

    Матрицы $$B$$ и $$C$$ можно проинтерпретировать в терминах бинарных отношений. Пусть некоторая характеристика измеряется у $$n$$ объектов $$q_1,q_2,...,q_n$$, причем $$x_i$$ - результат ее измерения у объекта $$q_i$$. Тогда матрицы $$B$$ и $$C$$ задают бинарные отношения на множестве объектов $$Q ={q_1,q_2,...,q_n}$$. Поскольку бинарное отношение можно рассматривать как подмножество декартова квадрата $$Q \times Q$$, то любой матрице $$D = ||d_{ij}||$$ порядка $$n \times n$$ из 0 и 1 соответствует бинарное отношение $$R(D)$$, определяемое следующим образом: $$(q_i,q_i)\in R(D)$$ тогда и только тогда, когда $$d_{ij} = 1$$.

    Бинарное отношение $$R(B)$$ - отношение эквивалентности, т.е. симметричное рефлексивное транзитивное отношение. Оно задает разбиение $$Q$$ на классы эквивалентности. Два объекта $$q_i$$ и $$q_j$$ входят в один класс эквивалентности тогда и только тогда, когда $$x_i = x_j, b_{ij} = 1$$.

    Выше показано, как разбиения возникают в результате измерений в шкале наименований. Разбиения могут появляться и непосредственно. Так, при оценке качества промышленной продукции эксперты дают разбиение показателей качества на группы. Для изучения психологического состояния людей их просят разбить предъявленные рисунки на группы сходных между собой. Аналогичная методика применяется и в иных экспериментальных психологических исследованиях, необходимых для оптимизации управления персоналом.

    Во многих эконометрических задачах разбиения получаются "на выходе" (например, в кластерном анализе) или же используются на промежуточных этапах анализа данных (например, сначала проводят классификацию с целью выделения однородных групп, а затем в каждой группе строят регрессионную зависимость).

    Бинарное отношение $$R(С)$$ задает разбиение $$Q$$ на классы эквивалентности, между которыми введено отношение строгого порядка. Два объекта $$q_i$$ и $$q_j$$ входят в один класс тогда и только тогда, когда $$c_{ij}= 1 и c_{ji}= 1$$, т.е. $$x_i = x_j$$. Класс эквивалентности $$Q_1$$ предшествует классу эквивалентности $$Q_2$$ тогда и только тогда, когда для любых $$q_i\in Q_1,q_j\in Q_2$$ имеем $$c_{ij} = 1, c_{ji}= 0$$, т.е. $$x_i < x_j$$. Такое бинарное отношение в статистике часто называют ранжировкой со связями; связанными считаются объекты, входящие в один класс эквивалентности. В литературе встречаются и другие названия: линейный квазипорядок, упорядочение, квазисерия, ранжирование. Если каждый из классов эквивалентности состоит только из одного элемента, то имеем обычную ранжировку (другими словами, линейный порядок).

    Как известно, ранжировки возникают в результате измерений в порядковой шкале. Так, при описанном выше опросе ответ выпускника школы - это ранжировка (со связями) профессий по привлекательности. Ранжировки часто возникают и непосредственно, без промежуточного этапа - приписывания объектам квазичисловых оценок - баллов. Многочисленные примеры тому приведены английским статистиком М. Кендэлом []. При оценке качества промышленной продукции широко применяемые нормативные и методические документы предусматривают использование ранжировок.

    Для прикладных областей, кроме ранжировок и разбиений, представляют интерес толерантности, т.е. рефлексивные симметричные отношения. Толерантность - математическая модель для выражения представлений о сходстве (похожести, близости). Разбиения - частный вид толерантностей. Толерантность, обладающая свойством транзитивности - это разбиение. Однако в общем случае толерантность не обязана быть транзитивной. Толерантности появляются во многих постановках теории экспертных оценок, например, как результат парных сравнений (см. ниже).

    Напомним, что любое бинарное отношение на конечном множестве может быть описано матрицей из 0 и 1.

    Дихотомические (бинарные) данные. Это данные, которые могут принимать одно из двух значений (0 или 1), т.е. результаты измерений значений альтернативного признака. Как уже было показано, измерения в шкале наименований и порядковой шкале приводят к бинарным отношениям, а те могут быть выражены, как результаты измерений по нескольким альтернативным признакам, соответствующим элементам матриц, описывающих отношения. Дихотомические данные возникают в прикладных исследованиях и многими иными путями.

    В настоящее время в большинстве стандартов, технических условий, технических регламентов, договоров на поставку конкретной продукции предусмотрен контроль по альтернативному признаку. Это означает, что единица продукции относится к одной из двух категорий - "годных" или "дефектных", т.е. соответствующих или не соответствующих требованиям стандарта. Отечественными специалистами проведены обширные теоретические исследования проблем статистического приемочного контроля по альтернативному признаку. Основополагающими в этой области являются работы академика А.Н. Колмогорова. Подход советской вероятностно-статистической школы к проблемам контроля качества продукции отражен в монографиях [,] (см. также лекцию 11).

    Дихотомические данные - давний объект прикладной статистики. Особенно большое применение они имеют в экономических и социологических исследованиях, в которых большинство переменных, интересующих специалистов, измеряется по качественным шкалам. При этом дихотомические данные зачастую являются более адекватными, чем результаты измерений по методикам, использующим большее число градаций. В частности, психологические тесты типа MMPI используют только дихотомические данные. На них опираются и популярные в технико-экономическом анализе методы парных сравнений [].

    Элементарным актом в методе парных сравнений является предъявление эксперту для сравнения двух объектов (сравнение может проводиться также прибором). В одних постановках эксперт должен выбрать из двух объектов лучший по качеству, в других - ответить, похожи объекты или нет. В обоих случаях ответ эксперта можно выразить одной из двух цифр (меток) - 0 или 1. В первой постановке: 0, если лучшим объявлен первый объект; 1 - если второй. Во второй постановке: 0, если объекты похожи, схожи, близки; 1 - в противном случае.

    Подводя итоги изложенному, можно сказать, что рассмотренные выше данные представимы в виде векторов из 0 и 1 (при этом матрицы, очевидно, могут быть записаны в виде векторов). Поскольку все результаты наблюдений имеют лишь несколько значащих цифр, то, используя двоичную систему счисления, любые виды анализируемых статистическими методами данных можно записать в виде векторов конечной длины (размерности) из 0 и 1. Представляется, что эта возможность в большинстве случаев имеет лишь академический интерес, но во всяком случае можно констатировать, что анализ дихотомических данных необходим во многих прикладных постановках.

    Множества. Совокупность $$X^n$$ векторов $$X = (x_1, x_2,...,x_n)$$ из 0 и 1 размерности $$n$$ находится во взаимнооднозначном соответствии с совокупностью из $$2^n$$ всех подмножеств множества $$N = \{1, 2, ..., n\}$$. При этом вектору $$X = (x_1, x_2,...,x_n)$$ соответствует подмножество $$N(X)\subseteq N$$, состоящее из тех и только из тех $$i$$, для которых $$x_i = 1$$. Это объясняет, почему изложение вероятностных и статистических результатов, относящихся к анализу данных, являющихся объектами нечисловой природы перечисленных выше видов, можно вести на языке конечных случайных множеств, как это было сделано в монографии [].

    Множества как исходные данные появляются и в иных постановках. Из геологических задач исходил Ж. Матерон, из электротехнических - Н.Н. Ляшенко и др. Случайные множества применялись для описания процесса случайного распространения, например, распространения информации, слухов, эпидемии или пожара, а также в математической экономике. В монографии [] рассмотрены приложения случайных множеств в теории экспертных оценок и в теории управления запасами и ресурсами (логистике).

    Отметим, что с точки зрения математики реальные объекты можно моделировать случайными множествами как из конечного числа элементов, так и из бесконечного, однако при расчетах на компьютерах неизбежна дискретизация, т.е. переход к первой из названных возможностей.

    Объекты нечисловой природы как статистические данные. В эконометрике и прикладной математической статистике наиболее распространенный объект изучения - выборка $$x1, x2,...,xn$$, т.е. совокупность результатов $$n$$ наблюдений. В различных областях статистики результат наблюдения - это или число, или конечномерный вектор, или функция... Соответственно проводится, как уже отмечалось, деление прикладной математической статистики: одномерная статистика, многомерный статистический анализ, статистика временных рядов и случайных процессов... В статистике нечисловых данных в качестве результатов наблюдений рассматриваются объекты нечисловой природы, в частности, перечисленных выше видов - измерения в шкалах, отличных от абсолютной, бинарные отношения, вектора из 0 и 1, множества, нечеткие множества. Выборка может состоять из $$n$$ ранжировок или $$n$$ толерантностей, или $$n$$ множеств, или $$n$$ нечетких множеств и т.д.

    Отметим необходимость развития методов статистической обработки "разнотипных данных", обусловленную большой ролью в прикладных исследованиях "признаков смешанной природы". Речь идет о том, что результат наблюдения состояния объекта зачастую представляет собой вектор, у которого часть координат измерена по шкале наименований, часть - по порядковой шкале, часть - по шкале интервалов и т.д. Статистические методы ориентированы обычно либо на абсолютную шкалу, либо на шкалу наименований (анализ таблиц сопряженности), а потому зачастую непригодны для обработки разнотипных данных. Есть и более сложные модели разнотипных данных, например, когда некоторые координаты вектора наблюдений описываются нечеткими множествами.

    Для обозначения подобных неклассических результатов наблюдений в 1979 г. в монографии [] предложен собирательный термин - объекты нечисловой природы. Термин "нечисловой" означает, что структура пространства, в котором лежат результаты наблюдений, не является структурой действительных чисел, векторов или функций, она вообще не является структурой линейного (векторного) пространства. При расчетах объекты числовой природы, разумеется, изображаются с помощью чисел, но эти числа нельзя складывать и умножать.

    С целью "стандартизации математических орудий" (выражение группы французских математиков Н. Бурбаки) целесообразно разрабатывать методы статистического анализа данных, пригодные одновременно для всех перечисленных выше видов результатов наблюдений. Кроме того, в процессе развития прикладных исследований выявляется необходимость использования новых видов объектов нечисловой природы, отличных от рассмотренных выше, например, в связи с развитием статистических методов обработки текстовой информации. Поэтому целесообразно ввести еще один вид объектов нечисловой природы - объекты произвольной природы, т.е. элементы множеств, на которые не наложено никаких условий (кроме "условий регулярности", необходимых для справедливости доказываемых теорем). Другими словами, в этом случае предполагается, что результаты наблюдений (элементы выборки) лежат в произвольном пространстве $$X$$. Для получения теорем необходимо потребовать, чтобы $$X$$ удовлетворяло некоторым условиям, например, было так называемым топологическим пространством. Как известно, ряд результатов классической математической статистики получен именно в такой постановке. Так, при изучении оценок максимального правдоподобия элементы выборки могут лежать в пространстве произвольной природы. Это не влияет на рассуждения, поскольку в них рассматривается лишь зависимость плотности вероятности от параметра. Методы классификации, использующие лишь расстояние между классифицируемыми объектами, могут применяться к совокупностям объектов произвольной природы, лишь бы в пространстве, где они лежат, была задана метрика. Цель статистики нечисловых данных (в некоторых литературных источниках используется термин "статистика объектов нечисловой природы") состоит в том, чтобы систематически рассматривать методы статистической обработки данных как произвольной природы, так и относящихся к указанным выше конкретным видам объектов нечисловой природы, т.е. методы описания данных, оценивания и проверки гипотез. Взгляд с общей точки зрения позволяет получить новые результаты и в других областях прикладной статистики.

    Использование объектов нечисловой природы при формировании статистической или математической модели реального явления. Использование объектов нечисловой природы часто порождено желанием обрабатывать более объективную, более освобожденную от погрешностей информацию. Как показали многочисленные опыты, человек более правильно (и с меньшими затруднениями) отвечает на вопросы качественного, например, сравнительного, характера, чем количественного. Так, ему легче сказать, какая из двух гирь тяжелее, чем указать их примерный вес в граммах. Другими словами, использование объектов нечисловой природы - средство повышения устойчивости эконометрических и экономико-математических моделей реальных явлений. Сначала конкретные области статистики объектов нечисловой природы (а именно – прикладная теория измерений, нечеткие и случайные множества) были рассмотрены в монографии [], как частные постановки проблемы устойчивости математических моделей социально-экономических явлений и процессов к допустимым отклонениям исходных данных и предпосылок модели, а затем пришли к пониманию необходимости проведения работ по развитию статистики объектов нечисловой природы как самостоятельного научного направления.

    Обсуждение начнем со шкал измерения. Науку о единстве мер и точности измерений называют метрологией. Таким образом, репрезентативная теория измерений - часть метрологии. Методы обработки данных должны быть адекватны относительно допустимых преобразований шкал измерения в смысле репрезентативной теории измерений. Однако, как было отмечено ранее (см. 1.2), проблема установления типа шкалы, относится, скорее всего, к наукам о человеке и для ее решения необходимо определенное время. Пока же целесообразно в неясных случаях принимать порядковую шкалу, так как это гарантирует от возможных ошибок.

    Порядковые шкалы широко распространены не только в социально-экономических исследованиях. Они применяются в медицине - шкала стадий гипертонической болезни по Мясникову, шкала степеней сердечной недостаточности по Стражеско-Василенко-Лангу, шкала степени выраженности коронарной недостаточности по Фогельсону; в минералогии - шкала Мооса (тальк - 1, гипс - 2, кальций - 3, флюорит - 4, апатит - 5, ортоклаз - 6, кварц - 7, топаз - 8, корунд - 9, алмаз - 10), по которой минералы классифицируются согласно критерию твердости; в географии - бофортова шкала ветров ("штиль", "слабый ветер", "умеренный ветер" и др.) и т.д. Напомним, что по шкале интервалов измеряют величину потенциальной энергии или координату точки на прямой, на которой не отмечены ни начало, ни единица измерения; по шкале отношений - цены в экономике; большинство физических единиц – массу тела, длину, заряд. Время измеряется по шкале разностей, если год принимаем естественной единицей измерения, и по шкале интервалов в общем случае. В процессе развития соответствующей области знания тип шкалы может меняться. Так, сначала температура измерялась по порядковой шкале (холоднее - теплее), затем - по интервальной (шкалы Цельсия, Фаренгейта, Реомюра) и наконец, после открытия абсолютного нуля температур - по шкале отношений (шкала Кельвина). Следует отметить, что среди специалистов иногда имеются разногласия по поводу того, по каким шкалам следует считать измеренными те или иные реальные величины.

    Отметим, что термин "репрезентативная" использовался, чтобы отличить рассматриваемый подход к теории измерений от классической метрологии, а также от работ А.Н. Колмогорова и А. Лебега, связанных с измерением геометрических величин, от "алгоритмической теории измерения" и др.

    Необходимость использования в математических моделях реальных явлений таких объектов нечисловой природы, как бинарные отношения, множества, нечеткие множества, кратко была показана выше. Здесь же обратим внимание, что используемые в классической статистике результаты наблюдений также "не совсем числа". А именно, любая величина $$X$$ измеряется всегда с некоторой погрешностью $$\Delta X$$ и результатом наблюдения является

    $$Y=X+\Delta X$$

    Как уже отмечалось, погрешностями измерений занимается метрология. Отметим справедливость следующих фактов:

  • для большинства реальных измерений невозможно полностью исключить систематическую ошибку, т.е. $$M(\Delta X)\ne 0$$ ;
  • распределение $$\Delta X$$ в подавляющем большинстве случаев не является нормальным (см. лекцию 5);
  • измеряемую величину $$X$$ и погрешность ее измерения $$\Delta X$$ обычно нельзя считать независимыми случайными величинами;
  • распределение погрешностей оценивается по результатам специальных наблюдений, следовательно, полностью известным считать его нельзя; зачастую исследователь располагает лишь границами для систематической погрешности и оценками таких характеристик для случайной погрешности, как дисперсия или размах.
  • Приведенные факты показывают ограниченность области применимости распространенной модели погрешностей, в которой $$X$$ и $$\Delta X$$ рассматриваются как независимые случайные величины, причем $$\Delta X$$ имеет нормальное распределение с нулевым математическим ожиданием.

    Строго говоря, результаты наблюдения всегда имеют дискретное распределение, поскольку описываются числами с небольшим (1 – 5) числом значащих цифр. Возникает дилемма: либо признать, что непрерывные распределения - фикция, и прекратить ими пользоваться, либо считать, что непрерывные распределения имеют "реальные" величины $$X$$, которые мы наблюдаем с принципиально неустранимой погрешностью $$\Delta X$$. Первый выход в настоящее время нецелесообразен, так как потребует отказаться от большей части разработанного математического аппарата. Из второго следует необходимость изучения влияния неустранимых погрешностей на статистические выводы.

    Погрешности $$\Delta X$$ можно учитывать либо с помощью вероятностной модели ( $$\Delta X$$ - случайная величина, имеющая функцию распределения, вообще говоря, зависящую от $$X$$ ), либо с помощью нечетких множеств. Во втором случае приходим к теории нечетких чисел и к ее частному случаю - статистике интервальных данных (см. лекцию 12).

    Другой источник появления погрешности $$\Delta X$$ связан с принятой в конструкторской и технологической документации системой допусков на контролируемые параметры изделий и деталей, с использованием шаблонов при проверке контроля качества продукции []. В этих случаях характеристики $$\Delta X$$ определяются не свойствами средств измерения, а применяемой технологией проектирования и производства. В терминах прикладной статистики сказанному соответствует группировка данных, при которой мы знаем, какому из заданных интервалов принадлежит наблюдение, но не знаем точного значения результата наблюдения. Применение группировки может дать экономический эффект, поскольку зачастую легче (в среднем) установить, к какому интервалу относится результат наблюдения, чем точно измерить его.

    Объекты нечисловой природы как результат статистической обработки данных. Объекты нечисловой природы появляются не только на "входе" статистической процедуры, но и в процессе обработки данных, и на "выходе" в качестве итога статистического анализа.

    Рассмотрим простейшую прикладную постановку задачи регрессии (см. также лекцию 9). Исходные данные имеют вид $$(x_i,y_i)\in R^2, i=1,2,...,n$$ Цель состоит в том, чтобы с достаточной точностью описать y как полином от x, т.е. модель имеет вид

    $$y_i=\sum_{k=0}^m a_j x_i^k+\varepsilon_i$$

    где $$m$$ - неизвестная степень полинома; $$a_0,a_1,a_2,...,a_m$$ - неизвестные коэффициенты многочлена; $$\varepsilon_i,i=1,2,...,n$$ - погрешности, которые для простоты примем независимыми и имеющими одно и то же нормальное распределение. (Здесь наглядно проявляется одна из причин живучести статистических моделей на основе нормального распределения. Такие модели, как правило, неадекватны реальной ситуации (см. лекцию 5), но с математической точки зрения позволяют проникнуть глубже в суть изучаемого явления. Поэтому они пригодны для первоначального анализа ситуации, как и в рассматриваемом случае. Дальнейшие научные исследования должны быть направлены на снятие нереалистического предположения нормальности и перехода к непараметрическим моделям погрешности.) Распространенная процедура такова: сначала пытаются применить модель (2) для линейной функции ( $$m = 1$$ ), при неудаче (неадекватности модели) переходят к многочлену второго порядка ( $$m = 2$$ ), если снова неудача, то берут модель (2) с $$m = 3$$ и т.д. (адекватность модели проверяют по $$F$$ -критерию Фишера).

    Обсудим свойства этой процедуры в терминах прикладной статистики. Если степень полинома задана ( $$m = m_0$$ ), то его коэффициенты оценивают методом наименьших квадратов, свойства этих оценок хорошо известны (см., например, , гл.26]). Однако в описанной выше реальной постановке m тоже является неизвестным параметром и подлежит оценке. Таким образом, требуется оценить объект ( $$m, a_0, a_1, a_2, ..., a_m$$ ), множество значений которого можно описать как $$R^1\bigcup R^2\bigcup R^3\bigcup..$$. Это - объект нечисловой природы, обычные методы оценивания для него неприменимы, так как $$m$$ - дискретный параметр. В рассматриваемой постановке разработанные к настоящему времени методы оценивания степени полинома носят в основном эвристический характер (см., например, гл.12 монографии []). Свойства описанной выше распространенной процедуры рассмотрены в лекции 9. Там показано, что степень полинома $$m$$ при этом оценивается несостоятельно, и найдено предельное распределение оценки этого параметра, оказавшееся геометрическим.

    В более общем случае линейной регрессии данные имеют вид $$(y_i,X_i),i=1,2,...,n$$ где $$X_i=(x_{i1},x_{i2},...,x_{iN})\in R^N$$ - вектор предикторов (факторов, объясняющих переменных), а модель такова:

    $$y_i=\sum_{j\in K} a_j x_{ij}+\varepsilon_i,i=1,2,...,n$$

    (здесь $$K$$ - некоторое подмножество множества $$\{1,2,...,n\}$$ ; - те же, что и в модели (2); $$a_j$$ - неизвестные коэффициенты при предикторах с номерами из $$K)$$. Модель (2) сводится к модели (3), если

    $$x_{i1}=1,x_{i1}=x_1,x_{i2}=x_i^2,x_{i3}=x_i^3,...,x_{ij}=x_i^{j-1},...$$

    В модели (2) есть естественный порядок ввода предикторов в рассмотрение - в соответствии с возрастанием степени, а в модели (3) естественного порядка нет, поэтому здесь стоит произвольное подмножество множества предикторов. Есть только частичный порядок - чем мощность подмножества меньше, тем лучше. Модель (3) особенно актуальна в технических исследованиях (см. многочисленные примеры в журнале "Заводская лаборатория"). Она применяется в задачах управления качеством продукции и других технико-экономических исследованиях, в экономике, маркетинге и социологии, когда из большого числа факторов, предположительно влияющих на изучаемую переменную, надо отобрать по возможности наименьшее число значимых факторов и с их помощью сконструировать прогнозирующую формулу (3).

    Задача оценивания модели (3) разбивается на две последовательные задачи: оценивание множества $$K$$ - подмножества множества всех предикторов, а затем - неизвестных параметров $$a_j$$. Методы решения второй задачи хорошо известны и подробно изучены. Гораздо хуже обстоит дело с оцениванием объекта нечисловой природы $$K$$. Как уже отмечалось, существующие методы - в основном эвристические, они зачастую не являются даже состоятельными. Даже само понятие состоятельности в данном случае требует специального определения. Пусть $$K_0$$ - истинное подмножество предикторов, т.е. подмножество, для которого справедлива модель (3), а подмножество предикторов $$K_n$$ - его оценка. Оценка $$K_n$$ называется состоятельной, если

    $$\lim_{n\rightarrow\infty} \textit{Card}(K_n\Delta K_0)=0,$$

    где $$\Delta$$ - символ симметрической разности множеств; $$\textit{Card}(K)$$ означает число элементов в множестве $$K$$, а предел понимается в смысле сходимости по вероятности.

    Задача оценивания в моделях регрессии, таким образом, разбивается на две - оценивание структуры модели и оценивание параметров при заданной структуре. В модели (2) структура описывается неотрицательным целым числом $$m$$, в модели (3) - множеством $$K$$. Структура - объект нечисловой природы. Задача ее оценивания сложна, в то время как задача оценивания численных параметров при заданной структуре хорошо изучена, разработаны эффективные (в смысле прикладной математической статистики) методы.

    Такова же ситуация и в других методах многомерного статистического анализа - в факторном анализе (включая метод главных компонент) и в многомерном шкалировании, в иных оптимизационных постановках проблем прикладного многомерного статистического анализа.

    Перейдем к объектам нечисловой природы на "выходе" статистической процедуры. Примеры многочисленны. Разбиения - итог работы многих алгоритмов классификации, в частности, алгоритмов кластер-анализа. Ранжировки - результат упорядочения профессий по привлекательности или автоматизированной обработки мнений экспертов - членов комиссии по подведению итогов конкурса научных работ. (В последнем случае используются ранжировки со связями; так, в одну группу, наиболее многочисленную, попадают работы, не получившие наград.) Из всех объектов нечисловой природы, видимо, наиболее часты на "выходе" дихотомические данные - принять или не принять гипотезу; в частности, принять или забраковать партию продукции. Результатом статистической обработки данных может быть множество, например, зона наибольшего поражения при аварии, или последовательность множеств, например, "среднемерное" описание распространения пожара (см. главу 4 в монографии []). Нечетким множеством Э. Борель [] еще в начале ХХ в. предлагал описывать представление людей о числе зерен, образующем "кучу". С помощью нечетких множеств формализуются значения лингвистических переменных, выступающих как итоговая оценка качества систем автоматизированного проектирования, сельскохозяйственных машин, бытовых газовых плит, надежности программного обеспечения или систем управления. Можно констатировать, что все виды объектов нечисловой природы могут появляться "на выходе" статистического исследования.

    1.4. Нечеткие множества - частный случай нечисловых данных

    Нечеткие множества. Пусть $$A$$ - некоторое множество. Подмножество $$B$$ множества $$A$$ может быть задано своей характеристической функцией

    $$\mu_B(x)= \left \{ \begin{gathered} 1,x\in B,\\ 0,x\notin B \end{gathered} \right.$$

    Что такое нечеткое множество? Обычно говорят, что нечеткое подмножество $$C$$ множества $$A$$ характеризуется своей функцией принадлежности $$\mu_C:A\rightarrow [0,1]$$. Значение функции принадлежности в точке $$х$$ показывает степень принадлежности этой точки нечеткому множеству. Нечеткое множество описывает неопределенность, соответствующую точке х - она одновременно и входит, и не входит в нечеткое множество $$С$$. За вхождение - $$\mu_C(x)$$ шансов, за второе - $$(1-\mu_C(x))$$ шансов.

    Если функция принадлежности $$\mu_C(x)$$ имеет вид (1) при некотором $$B$$, то $$C$$ есть обычное (четкое) подмножество $$A$$. Таким образом, теория нечетких множество является не менее общей математической дисциплиной, чем обычная теория множеств, поскольку обычные множества - частный случай нечетких. Соответственно можно ожидать, что теория нечеткости, как целое, обобщает классическую математику. Однако позже мы увидим, что теория нечеткости в определенном смысле сводится к теории случайных множеств и тем самым является частью классической математики. Другими словами, по степени общности обычная математика и нечеткая математика эквивалентны. Однако для практического применения, например, в теории принятия решений описание и анализ неопределенностей с помощью теории нечетких множеств весьма плодотворны.

    Обычное подмножество можно было бы отождествить с его характеристической функцией. Этого математики не делают, поскольку для задания функции (в ныне принятом подходе) необходимо сначала задать множество. Нечеткое же подмножество с формальной точки зрения можно отождествить с его функцией принадлежности. Однако термин "нечеткое подмножество" предпочтительнее при построении математических моделей реальных явлений.

    Теория нечеткости является обобщением интервальной математики. Действительно, функция принадлежности

    $$\mu_B(x)= \left \{ \begin{gathered} 1,x\in [a,b],\\ 0,x\notin [a,b] \end{gathered} \right.$$

    задает интервальную неопределенность - про рассматриваемую величину известно лишь, что она лежит в заданном интервале $$[a,b]$$. Тем самым описание неопределенностей с помощью нечетких множеств является более общим, чем с помощью интервалов.

    Начало современной теории нечеткости положено в 1965 г. работой американского ученого азербайджанского происхождения Л.А. Заде. К настоящему времени по этой теории опубликованы тысячи книг и статей, издается несколько международных журналов, выполнено достаточно много как теоретических, так и прикладных работ. Первая книга российского автора по теории нечеткости вышла в 1980 г. [].

    Л.А. Заде рассматривал теорию нечетких множеств как аппарат анализа и моделирования гуманистических систем, т.е. систем, в которых участвует человек. Его подход опирается на предпосылку о том, что элементами мышления человека являются не числа, а элементы некоторых нечетких множеств или классов объектов, для которых переход от "принадлежности" к "непринадлежности" не скачкообразен, а непрерывен. В настоящее время методы теории нечеткости используются почти во всех прикладных областях, в том числе при управлении предприятиями, качеством продукции и технологическими процессами, при описании предпочтений потребителей и варки стали.

    Л.А. Заде использовал термин "fuzzy set" (нечеткое множество). На русский язык термин "fuzzy" переводили как нечеткий, размытый, расплывчатый, и даже как пушистый и туманный.

    Аппарат теории нечеткости громоздок. В качестве примера дадим определения теоретико-множественных операций над нечеткими множествами. Пусть $$C$$ и $$D$$ - два нечетких подмножества $$A$$ с функциями принадлежности $$\mu_C(x)$$ и $$\mu_D(x)$$ соответственно. Пересечением $$C\bigcap D$$, произведением $$CD$$, объединением $$C\bigcup D$$, отрицанием $$\overline{C}$$, суммой $$C+D$$ называются нечеткие подмножества $$A$$ с функциями принадлежности

    $$\begin{multiline*} \mu_{C\cap D}(x)=\min(\mu_C(x),\mu_D(x)),\mu_{CD}(x)=\mu_C(x)\mu_D(x),\mu_{\overline{C}}(x)=1-\mu_C(x), \\ \mu_{C\cup D}(x)=\max(\mu_C(x),\mu_D(x)),\mu_{C+D}(x)=\mu_C(x)+\mu_D(x)-\mu_C(x)\mu_D(x),x\in A \end{multiline*}$$

    соответственно.

    Как уже отмечалось, теория нечетких множеств в определенном смысле сводится к теории вероятностей, а именно, к теории случайных множеств. Соответствующий цикл теорем приведен ниже в лекции 4. Однако при решении прикладных задач вероятностно-статистические методы и методы теории нечеткости обычно рассматриваются как различные.

    Для знакомства со спецификой нечетких множеств рассмотрим некоторые их свойства.

    В дальнейшем считаем, что все рассматриваемые нечеткие множества являются подмножествами одного и того же множества $$Y$$.

    Законы де Моргана для нечетких множеств. Как известно, законами де Моргана называются следующие тождества алгебры множеств

    $$\overline{A\bigcup B}=\overline{A}\bigcap\overline{B},\overline{A\bigcap B}=\overline{A}\bigcup\overline{B}.$$

    Теорема 1. Для нечетких множеств справедливы тождества

    $$\overline{A\bigcup B}=\overline{A}\bigcap\overline{B},\overline{A\bigcap B}=\overline{A}\bigcup\overline{B},$$ $$\overline{A+B}=\overline{A}\overline{B},\overline{AB}=\overline{A}+\overline{B}.$$

    Доказательство теоремы 1 состоит в непосредственной проверке справедливости соотношений (3) и (4) путем вычисления значений функций принадлежности участвующих в этих соотношениях нечетких множеств на основе определений, данных выше.

    Тождества (3) и (4) назовем законами де Моргана для нечетких множеств. В отличие от классического случая соотношений (2), они состоят из четырех тождеств, одна пара которых относится к операциям объединения и пересечения, а вторая - к операциям произведения и суммы. Как и соотношение (2) в алгебре множеств, законы де Моргана в алгебре нечетких множеств позволяют преобразовывать выражения и формулы, в состав которых входят операции отрицания.

    Дистрибутивный закон для нечетких множеств. Некоторые свойства операций над множествами не выполнены для нечетких множеств. Так, $$A+A\ne A$$ за исключением случая, когда $$А$$ - "четкое" множество (т.е. функция принадлежности принимает только значения 0 и 1).

    Верен ли дистрибутивный закон для нечетких множеств? В литературе иногда расплывчато утверждается, что "не всегда". Внесем полную ясность.

    Теорема 2. Для любых нечетких множеств $$А$$, $$В$$ и $$С$$

    $$A\bigcap(B\bigcup C)=(A\bigcap B)\bigcup(A\bigcap C)$$

    В то же время равенство

    $$A(B+C)=AB+AC$$

    справедливо тогда и только тогда, когда при всех $$y\in Y$$

    $$(\mu_A^2(y)-\mu_A(y))\mu_B(y)\mu_C(y)=0.$$

    Доказательство. Фиксируем произвольный элемент $$y\in Y$$. Для сокращения записи обозначим $$a=\mu_A(y),b=\mu_B(y),c=\mu_C(y)$$ Для доказательства тождества (5) необходимо показать, что

    $$\min(a,\max(b,c))=\max(\min(a,b),\min(a,c))$$

    Рассмотрим различные упорядочения трех чисел $$a, b, c$$. Пусть сначала $$a\leq b\leq c$$. Тогда левая часть соотношения (7) есть $$\min(a,c)=a$$, а правая $$\max(a,a)=a$$, т.е. равенство (7) справедливо.

    Пусть $$b\leq c\leq a$$. Тогда в соотношении (7) слева стоит $$\min(a,c)=c$$, а справа $$\max(b,a)=a$$, т.е. соотношение (7) опять является равенством.

    Если $$b\leq c\leq a$$, то в соотношении (7) слева стоит $$\min(a,c)=c$$, а справа $$\max(b,c)=c$$, т.е. обе части снова совпадают.

    Три остальные упорядочения чисел $$a, b, c$$ разбирать нет необходимости, поскольку в соотношение (6) числа $$b$$ и $$c$$ входят симметрично. Тождество (5) доказано.

    Второе утверждение теоремы 2 вытекает из того, что в соответствии с определениями операций над нечеткими множествами

    $$\mu_{A(B+C)}(y)=a(b+c-bc)=ab+ac-abc$$

    и

    $$\mu_{AB+AC}(y)=ab+ac-(ab)(ac)=ab+ac-a^2bc.$$

    Эти два выражения совпадают тогда и только тогда, когда $$a^2bc = abc$$, что и требовалось доказать.

    Определение 1. Носителем нечеткого множества $$А$$ называется совокупность всех точек $$y\in Y$$, для которых $$\mu_A(y)>0$$.

    Следствие теоремы 2. Если носители нечетких множеств $$B$$ и $$C$$ совпадают с $$Y$$, то равенство (6) имеет место тогда и только тогда, когда $$A$$ - "четкое" (т.е. обычное, классическое, не нечеткое) множество.

    Доказательство. По условию $$\mu_B(y)\mu_C(y)\ne 0$$ при всех $$y\in Y$$. Тогда из теоремы 2 следует, что $$\mu_A^2(y)-\mu_A(y)=0$$, т.е. $$\mu_A(y)=1$$ или $$\mu_A(y)=0$$, что и означает, что $$A$$ - четкое множество.

    Пример описания неопределенности с помощью нечеткого множества. Понятие "богатый" часто используется при обсуждении социально-экономических проблем, в том числе и в связи с подготовкой и принятием решений. Однако очевидно, что разные лица вкладывают в это понятие различное содержание. Сотрудники Института высоких статистических технологий и эконометрики провели в 2004 г. небольшое пилотное социологическое исследование представления различных слоев населения о понятии "богатый человек".

    Мини-анкета опроса выглядела так:

  • При каком месячном доходе (в тыс. руб. на одного человека) Вы считали бы себя богатым человеком?
  • Оценив свой сегодняшний доход, к какой из категорий Вы себя относите:

    a) богатые;

    б) достаток выше среднего;

    в) достаток ниже среднего;

    г) бедные;

    д) за чертой бедности.

    (В дальнейшем вместо полного наименования категорий будем оперировать буквами, например "в" - категория, "б" - категория и т.д.)
  • Ваша профессия, специальность.
  • Всего было опрошено 74 человека, из них 40 - научные работники и преподаватели, 34 человека - не занятых в сфере науки и образования, в том числе 5 рабочих и 5 пенсионеров. Из всех опрошенных только один (!) считает себя богатым. Несколько типичных ответов научных работников и преподавателей приведено в табл.1.3, а аналогичные сведения для работников коммерческой сферы - в табл.1.4.

    Типичные ответы научных работников и преподавателей
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Кандидат наук 6 д ж
    Преподаватель 6 в ж
    Доцент 6 б ж
    Учитель 60 в м
    Старший научный сотрудник 60 д м
    Инженер-физик 140 д ж
    Программист 150 г м
    Научный работник 270 г м
    Типичные ответы работников коммерческой сферы
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Вице-президент банка 600 а ж
    Зам. директора банка 300 б ж
    Начальник кредитного отдела 300 б м
    Начальник отдела ценных бумаг 60 б м
    Главный бухгалтер 120 д ж
    Бухгалтер 90 в ж
    Менеджер банка 66 б м
    Начальник отдела проектирования 60 в ж

    Разброс ответов на первый вопрос - от 6 до 600 тыс. руб. в месяц на человека. Результаты опроса показывают, что критерий богатства у финансовых работников в целом несколько выше, чем у научных (см. гистограммы на рис.1.1,1.2 ниже).

    Опрос показал, что выявить какое-нибудь конкретное значение суммы, которая необходима "для полного счастья", пусть даже с небольшим разбросом, нельзя, что вполне естественно. Как видно из таблиц 1.3 и 1.4, денежный эквивалент богатства колеблется от 6 до 600 тыс. руб. в месяц. Подтвердилось мнение, что работники сферы образования в подавляющем большинстве причисляют свой достаток к категории "в" и ниже (81% опрошенных), в том числе к категории "д" отнесли свой достаток 57%.

    Со служащими коммерческих структур и бюджетных организаций иная картина: "г" - категория 1 человек (4%), "д" - категория 4 человека (17%), "б" - категория - 46% и 1 человек "а" - категория.

    Пенсионеры, что не вызывает удивления, отнесли свой доход к категории "д" (4 человека), и лишь один человек указал "г" - категорию. Рабочие же ответили так: 4 человека - "в", и один человек - "б".

    Для представления общей картины в табл.1.5 приведены данные об ответах работников других профессий.

    Типичные ответы работников различных профессий
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Работник торговли 6 б ж
    Дворник 12 в ж
    Водитель 60 в м
    Военнослужащий 60 в м
    Владелец бензоколонки 120 б ж
    Пенсионер 36 д ж
    Начальник фабрики 120 б м
    Хирург 30 в м
    Домохозяйка 60 в м
    Слесарь-механик 150 в м
    Юрист 60 б м
    Оператор ЭВМ 120 д м
    Работник собеса 18 д ж
    Архитектор 150 б ж

    Прослеживается интересное явление: чем выше планка богатства для человека, тем к более низкой категории относительно этой планки он себя относит.

    Для сводки данных естественно использовать гистограммы. Для этого необходимо сгруппировать ответы. Использовались 7 классов (интервалов):

  • – до 30 тыс. руб. в месяц на человека (включительно);
  • – от 30 до 60 тыс. руб.;
  • – от 60 до 90 тыс. руб.;
  • – от 90 до 120 тыс. руб.;
  • – от 120 до 150 тыс. руб.;
  • – от 150 до 180 тыс. руб;
  • – более 180 тыс.
  • (Во всех интервалах левая граница исключена, а правая, наоборот, включена.)

    Сводная информация представлена на рис.1.1 (для научных работников и преподавателей) и рис.1.2 (для всех остальных, т.е. для лиц, не занятых в сфере науки и образования - служащих иных бюджетных организаций, коммерческих структур, рабочих, пенсионеров).

    (рис 1.2) Гистограмма ответов на вопрос 1 для научных работников и преподавателей (40 чел.)(рис 1.1) Гистограмма ответов на вопрос 1 для лиц, не занятых в сфере науки и образования (34 чел.)

    Для двух выделенных групп, а также для некоторых подгрупп второй группы рассчитаны сводные средние характеристики - выборочные средние арифметические, медианы, моды. При этом медиана группы - количество тыс. руб., названное центральным по порядковому номеру опрашиваемым в возрастающем ряду ответов на вопрос 1, а мода группы - интервал, на котором столбик гистограммы - самый высокий, т.е. в него "попало" максимальное количество опрашиваемых. Результаты приведены в табл.1.6.

    Сводные средние характеристики ответов на вопрос 1 для различных групп (в тыс. руб. в мес. на чел.)
    Группа опрошенных Среднее арифметическое Медиана Мода
    Научные работники и преподаватели 70 43,5 (30; 60)
    Лица, не занятые в сфере науки и образования 86,4 120,0 (30; 60)
    Служащие коммерческих структур и бюджетных организаций 107,5 60 (30; 60)
    Рабочие 90,0 78,0 -
    Пенсионеры 61,8 60,0 -

    Построим нечеткое множество, описывающее понятие "богатый человек" в соответствии с представлениями опрошенных. Для этого составим табл.1.7 на основе рис.1.1 и рис.1.2 с учетом размаха ответов на первый вопрос.

    Число ответов, попавших в интервалы
    № п/п Номер интервала 0 1 2 3 4 5 6 7 8
    1 Интервал, тыс. руб. в месяц (0;6) [6;30] (30;60] (60;90] (90;120] (120;150] (150;180] (180;600) [600;+ $$\infty$$ )
    2 Число ответов в интервале 0 19 21 13 5 6 7 2 1
    3 Доля ответов в интервале 0 0,257 0,284 0,176 0,068 0,081 0,095 0,027 0,013
    4 Накопленное число ответов 19 40 53 58 64 71 73 74
    5 Накопленная доля ответов 0 0,257 0,541 0,716 0,784 0,865 0,960 0,987 1,000

    Пятая строка табл.1.7 задает функцию принадлежности нечеткого множества, выражающего понятие "богатый человек" в терминах его ежемесячного дохода. Это нечеткое множество является подмножеством множества из 9 интервалов, заданных в строке 2 табл.5. Или множества из 9 условных номеров {0, 1, 2, …, 8}. Эмпирическая функция распределения, построенная по выборке из ответов 74 опрошенных на первый вопрос мини-анкеты, описывает понятие "богатый человек" как нечеткое подмножество положительной полуоси.

    О разработке методики ценообразования на основе теории нечетких множеств. Для оценки значений показателей, не имеющих количественной оценки, можно использовать методы нечетких множеств. Например, в диссертации П.В. Битюкова [] нечеткие множества применялись при моделировании задач ценообразования на электронные обучающие курсы, используемые при дистанционном обучении. Им было проведено исследование значений фактора "Уровень качества курса" с использованием нечетких множеств. В ходе практического использования предложенной П.В. Битюковым методики ценообразования значения ряда других факторов могут также определяться с использованием теории нечетких множеств. Например, ее можно использовать для определения прогноза рейтинга специальности в вузе с помощью экспертов, а также значений других факторов, относящихся к группе "Особенности курса". Опишем подход П.В. Битюкова, как пример практического использования теории нечетких множеств.

    Значение оценки, присваиваемой каждому интервалу для фактора "Уровень качества курса", определяется на универсальной шкале [0,1], где необходимо разместить значения лингвистической переменной "Уровень качества курса": НИЗКИЙ, СРЕДНИЙ, ВЫСОКИЙ. Степень принадлежности некоторого значения вычисляется как отношение числа ответов, в которых оно встречалось в определенном интервале шкалы, к максимальному (для этого значения) числу ответов по всем интервалам.

    Был проведен опрос экспертов о степени влияния уровня качества электронных курсов на их потребительную ценность. Каждому эксперту в процессе опроса предлагалось оценить с позиции потребителя ценность того или иного класса курсов в зависимости от уровня качества. Эксперты давали свою оценку для каждого класса курсов по 10-ти балльной шкале (где 1 - min, 10 - max). Для перехода к универсальной шкале [0,1] все значения 10-ти балльной шкалы оценки ценности были разделены на максимальную оценку, т.е. на 10.

    Используя свойства функции принадлежности, необходимо предварительно обработать данные для того, чтобы уменьшить искажения, вносимые опросом. Естественными свойствами функций принадлежности являются наличие одного максимума и гладкие, затухающие до нуля фронты. Для обработки статистических данных можно воспользоваться так называемой матрицей подсказок. Предварительно удаляются явно ошибочные элементы. Критерием удаления служит наличие нескольких нулей в строке вокруг этого элемента.

    Элементы матрицы подсказок вычисляются по формуле:

    $$k_j=\sum_{i=1}^n b_{ij}, j=\overline{1,n},$$

    где $$b_{ij}$$ - элемент таблицы с результатами анкетирования, сгруппированными по интервалам. Матрица подсказок представляет собой строку, в которой выбирается максимальный элемент: $$k_{\max}=\max_j k_j$$, и далее все ее элементы преобразуются по формуле:

    $$c_{ij}=\frac{b_{ij}k_{\max}}{k_i},i=\overline{1,m},j=\overline{1,n}.$$

    Для столбцов, где $$k_j = 0$$, применяется линейная аппроксимация:

    $$c_{ij}=\frac{c_{ij-1}+c_{ij+1}}{2}, i=\overline{1,m},j=\overline{1,n}.$$

    Результаты расчетов сводятся в таблицу, на основании которой строятся функции принадлежности. Для этого находятся максимальные элементы по строкам: $$c_{i\max}=\max_j c_{ij}, i=\overline{1,m},j=\overline{1,n}$$. Функция принадлежности вычисляется по формуле: $$\mu_{ij}=c_{ij}/c_{i\max}$$. Результаты расчетов приведены в табл.1.8.

    Значения функции принадлежности лингвистической переменной
    $$\mu_i$$ Интервал на универсальной шкале
    0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1,0
    $$\mu_1$$ 0 0,2 1 1 0,89 0,67 0 0 0 0
    $$\mu_2$$ 0 0 0 0 0 0,33 1 1 0 0
    $$\mu_3$$ 0 0 0 0 0 0 0 0 1 1

    На рис.1.3 сплошными линиями показаны функции принадлежности значений лингвистической переменной "Уровень качества курса" после обработки таблицы, содержащей результаты опроса. Как видно из графика, функции принадлежности удовлетворяют описанным выше свойствам. Для сравнения пунктирной линией показана функция принадлежности лингвистической переменной для значения НИЗКИЙ без обработки данных.

    (рис 1.3) График функций принадлежности значений лингвистической переменной "Уровень качества курса"

    1.5. Данные и расстояния в пространствах произвольной природы

    Как показано выше, исходные статистические данные могут иметь разнообразную математическую природу, являться элементами разнообразных пространств - конечномерных, функциональных, бинарных отношений, множеств, нечетких множеств и т.д. Следовательно, центральной частью прикладной статистики является статистика в пространствах произвольной природы. Эта область прикладной статистики сама по себе не используется при анализе конкретных данных. Это очевидно, поскольку конкретные данные всегда имеют вполне определенную природу. Однако общие подходы, методы, результаты статистики в пространствах произвольной природы представляют собой научный инструментарий, готовый для использования в каждой конкретной области.

    Статистика в пространствах произвольной природы. Много ли общего у статистических методов анализа данных различной природы? На этот естественный вопрос можно сразу же однозначно ответить - да, очень много. Такой ответ будет постоянно подтверждаться и конкретизироваться на протяжении всего учебника. Несколько примеров приведем сразу же.

    Прежде всего отметим, что понятия случайного события, вероятности, независимости событий и случайных величин являются общими для любых конечных вероятностных пространств и любых конечных областей значений случайных величин (см. лекции 2 и 5). Поскольку все реальные явления и процессы описываются с помощью математических объектов из конечных множеств, сказанное выше означает, что конечных вероятностных пространств и дискретных случайных величин (точнее, величин, принимающих значения в конечном множестве) достаточно для всех практических применений. Переход к непрерывным моделям реальных явлений и процессов оправдан только тогда, когда этот переход облегчает проведение рассуждений и выкладок. Например, находить определенные интегралы зачастую проще, чем вычислять значения сумм. Не могу не отметить, что приведенные соображения о взаимосоотнесении дискретных и непрерывных математических моделей автор услышал более 30 лет назад от академика А.Н. Колмогорова (ясно, что за конкретную формулировку несет ответственность автор настоящего учебника).

    Основные проблемы прикладной статистики - описание данных, оценивание, проверка гипотез - также в своей существенной части могут быть рассмотрены в рамках статистики в пространствах произвольной природы. Например, для описания данных могут быть использованы эмпирические и теоретические средние, плотности вероятностей и их непараметрические оценки, регрессионные зависимости. Правда, для этого пространства произвольной природы должны быть снабжены соответствующим математическим инструментарием - расстояниями (показателями близости, мерами различия) между элементами рассматриваемых пространств.

    Популярный в настоящее время метод оценивания параметров распределений - метод максимального правдоподобия - не накладывает каких-либо ограничений на конкретный вид элементов выборки. Они могут лежать в пространстве произвольной природы. Математические условия касаются только свойств плотностей вероятности и их производных по параметрам. Аналогично положение с методом одношаговых оценок, идущим на смену методу максимального правдоподобия (см. ], когда задачу прикладной статистики удается представить в оптимизационном виде. Общая теория проверки статистических гипотез также не требует конкретизации математической природы рассматриваемых элементов выборок. Это относится, например, к лемме Неймана-Пирсона или теории статистических решений. Более того, естественная область построения теории статистик интегрального типа - это пространства произвольной природы (см. лекцию 7).

    Совершенно ясно, что в конкретных областях прикладной статистики накоплено большое число результатов, относящихся именно к этим областям. Особенно это касается областей, исследования в которых ведутся сотни лет, в частности, статистики случайных величин (одномерной статистики). Однако принципиально важно указать на "ядро" прикладной статистики - статистику в пространствах произвольной природы. Если постоянно "держать в уме" это ядро, то становится ясно, что, например, многие методы непараметрической оценки плотности вероятности или кластер-анализа, использующие только расстояния между объектами и элементами выборки, относятся именно к статистике объектов произвольной природы, а не к статистике случайных величин или многомерному статистическому анализу. Следовательно, и применяться они могут во всех областях прикладной статистики, а не только в тех, в которых "родились".

    Расстояния (метрики). В пространствах произвольной природы нет операции сложения, следовательно, статистические процедуры не могут быть основаны на использовании сумм. Поэтому используется другой математический инструментарий, использующий понятия типа расстояния.

    Как известно, расстоянием в пространстве $$Х$$ называется числовая функция двух переменных $$d(x,y), x\in X, y\in X$$, определенная на этом пространстве, т.е. в стандартных обозначениях $$d: X^2 \\rightarrow R^1$$, где $$R^1$$ - прямая, т.е. множество всех действительных чисел. Эта функция должна удовлетворять трем условиям (иногда их называют аксиомами):

  • неотрицательности: $$d(x,y) \geq 0$$, причем $$d(x,x) = 0$$, для любых значений $$x\in X, y\in X$$ ;
  • симметричности: $$d(x,y) = d(y,x)$$ для любых $$x\in X, y\in X$$ ;
  • неравенства треугольника: $$d(x,y) + d(y,z) \geq d(x,z)$$ для любых значений $$x\in X, y\in X, z\in X$$.
  • Для термина "расстояние" часто используется синоним - "метрика".

    Пример 1. Если $$d(x,x) = 0$$ и $$d(x,y) = 1$$ при $$x\ne y$$ для любых значений $$x\in X, y\in X$$, то, как легко проверить, функция $$d(x,y)$$ - расстояние (метрика). Такое расстояние естественно использовать в пространстве $$Х$$ значений номинального признака: если два значения (например, названные двумя экспертами) совпадают, то расстояние равно 0, а если различны - то 1.

    Пример 2. Расстояние, используемое в геометрии, очевидно, удовлетворяет трем приведенным выше аксиомам. Если $$Х$$ - это плоскость, а $$х(1)$$ и $$х(2)$$ - координаты точки $$x\in X$$ в некоторой прямоугольной системе координат, то эту точку естественно отождествить с двумерным вектором $$(х(1), х(2))$$. Тогда расстояние между точками $$х = (х(1), х(2))$$ и $$у = (у(1), у(2))$$ согласно известной формуле аналитической геометрии равно

    $$d(x,y)=\sqrt{(x(1)-y(1))^2+(x(2)-y(2))^2}.$$

    Пример 3. Евклидовым расстоянием в пространстве $$R^k$$ векторов вида $$x = (x(1), x(2), ..., x(k))$$ и $$y = (y(1), y(2), ..., y(k))$$ размерности $$k$$ называется

    $$d(x,y)= \left( \sum_{j=1}^k (x(j)-y(j))^2 \right)^{1/2}.$$

    В примере 2 рассмотрен частный случай примера 3 с $$k = 2$$.

    Пример 4. В пространстве $$R^k$$ векторов размерности $$k$$ используют также так называемое "блочное расстояние", имеющее вид

    $$d(x,y)=\sum_{j=1}^k|x(j)-y(j)|.$$

    Блочное расстояние соответствует передвижению по городу, разбитому на кварталы горизонтальными и вертикальными улицами. В результате можно передвигаться только параллельно одной из осей координат.

    Пример 5. В пространстве функций, элементами которого являются функции $$х = x(t), у = y(t), 0\leq t\leq 1$$, часто используют расстояние Колмогорова

    $$d(x,y)=\sup_{0\leq k\leq 0}|x(t)-y(t)|.$$

    Пример 6. Пространство функций, элементами которого являются функции $$х = x(t), у = y(t), 0\leq t\leq 1$$, превращают в метрическое пространство (т.е. в пространство с метрикой), вводя расстояние

    $$d_p(x,y)= \left( \int\limits_0^1(x(t)-y(t))^p dt \right)^{1/p}.$$

    Это пространство обычно обозначают $$L^p$$, где параметр $$p\geq 1$$ (при $$p < 1$$ не выполняются аксиомы метрического пространства, в частности, аксиома треугольника).

    Пример 7. Рассмотрим пространство квадратных матриц порядка $$k$$. Как ввести расстояние между матрицами $$А = ||a(i,j)||$$ и $$B = ||b(i,j)||$$? Можно сложить расстояния между соответствующими элементами матриц:

    $$d(A,B)=\sum_{i=1}^k \sum_{j=1}^k|a(i,j)-b(i,j)|.$$

    Пример 8. Предыдущий пример наводит на мысль о следующем полезном свойстве расстояний. Если на некотором пространстве определены два или больше расстояний, то их сумма - также расстояние.

    Пример 9. Пусть $$А$$ и $$В$$ - множества. Расстояние между множествами можно определить формулой

    $$a(A,B)=\mu(A\Delta B).$$

    Здесь $$\mu$$ - мера на рассматриваемом пространстве множеств, $$\Delta$$ - символ симметрической разности множеств.

    $$A\Delta B=(A\setminus B)\bigcup(B\setminus A).$$

    Если мера - так называемая считающая, т.е. приписывающая единичный вес каждому элементу множества, то введенное расстояние есть число несовпадающих элементов в множествах $$А$$ и $$В$$.

    Пример 10. Между множествами можно ввести и другое расстояние:

    $$d_1(A,B)=\frac{\mu(A\Delta B)}{\mu(A\cup B)}.$$

    В ряде задач прикладной статистики используются функции двух переменных, для которых выполнены не все три аксиомы расстояния, а только некоторые. Их обычно называют показателями различия, поскольку чем больше различаются объекты, тем больше значение функции. Иногда в том же смысле используют термин "мера близости". Он менее удачен, поскольку большее значение функции соответствует меньшей близости.

    Чаще всего отказываются от аксиомы, требующей выполнения неравенства треугольника, поскольку это требование не всегда находит обоснование в конкретной прикладной ситуации.

    Пример 11. В конечномерном векторном пространстве показателем различия является

    $$d(x,y)=\sum_{j=1}^k(x(j)-y(j))^2$$

    (сравните с примером 3).

    Показателями различия, но не расстояниями являются такие популярные в прикладной статистике показатели, как дисперсия или средний квадрат ошибки при оценивании.

    Иногда отказываются также и от аксиомы симметричности.

    Пример 12. Показателем различия чисел $$х$$ и $$у$$ является

    $$d(x,y)= \left| \frac{x}{y}-1 \right|.$$

    Такой показатель различия используют в ряде процедур экспертного оценивания.

    Что же касается первой аксиомы расстояния, то в различных постановках прикладной статистики ее обычно принимают. Вполне естественно, что наименьший показатель различия должен достигаться, причем именно на совпадающих объектах. Имеет ли смысл это наименьшее значение делать отличным от 0? Вряд ли, поскольку всегда можно добавить одну и ту же константу ко всем значениям показателя различия и тем самым добиться выполнения первой аксиомы.

    В прикладной статистике используются самые разные расстояния и показатели различия. О них пойдет речь в соответствующих разделах учебника.

    1.6. Аксиоматическое введение расстояний

    В прикладной статистике используют большое количество метрик и показателей различия (см. примеры в предыдущем пункте). Как обоснованно выбрать то или иное расстояние для использования в конкретной задаче? В 1959 г. американский статистик Джон Кемени предложил использовать аксиоматический подход, согласно которому следует сформулировать естественные для конкретной задачи аксиомы и вывести из них вид метрики. Этот подход получил большую популярность в нашей стране после выхода в 1972 г. переведенной на русский язык книги Дж. Кемени и Дж. Снелла [], в которой дана система аксиом для расстояния Кемени между упорядочениями. (Упорядочения, как и иные бинарные отношения, естественно представить в виде квадратных матриц из 0 и 1; тогда расстояние Кемени - это расстояние из примера 7 предыдущего пункта.) Последовала большая серия работ, в которых из тех или иных систем аксиом выводился вид метрики или показателя различия для различных видов данных, прежде всего для объектов нечисловой природы. Многие полученные результаты описаны в обзоре [], содержащем 161 ссылку, в том числе 69 на русском языке. Рассмотрим некоторые из наших результатов.

    Аксиоматическое введение расстояния между толерантностями. Толерантность - это бинарное отношение, являющееся рефлексивным и симметричным. Его обычно используют для описания отношения сходства между реальными объектами, отношений знакомства или дружбы между людьми. От отношения эквивалентности отличается тем, что свойство транзитивности не предполагается обязательно выполненным. Действительно, Иванов может быть знаком с Петровым, Петров - с Сидоровым, но при этом ничего необычного нет в том, что Иванов и Сидоров не знакомы между собой.

    Пусть множество $$Х$$, на котором определено отношение толерантности, состоит из конечного числа элементов: $$X = \{x_1, x_2, ..., x_k\}$$. Тогда толерантность описывается квадратной матрицей $$A = ||a(i,j)||, i,j = 1, 2,..., k$$, такой, что $$a(i,j) = 1$$, если $$x_i$$ и $$x_j$$ связаны отношением толерантности, и $$a(i,j) = 0$$ в противном случае. Матрица $$A$$ симметрична: $$a(i,j) = a(j,i)$$, на главной диагонали стоят единицы: $$a(i,i) = 1$$. Любая матрица, удовлетворяющая приведенным в предыдущей фразе условиям, является матрицей, соответствующей некоторому отношению толерантности. Матрице $$А$$ можно сопоставить неориентированный граф с вершинами в точках $$Х$$: вершины $$x_i$$ и $$x_j$$ соединены ребром тогда и только тогда, когда $$a(i,j) = 1$$. Толерантности используются, в частности, при проведении экспертных исследований (см. 11.6).

    Будем говорить, что толерантность $$А_3$$ лежит между толерантностями $$А_1$$ и $$А_2$$, если при всех $$i, j$$ число $$a_3(i,j)$$ лежит между числами $$a1(i,j)$$ и $$a_2(i,j)$$, т.е. выполнены либо неравенства $$a_1(i,j)\leq a_3(i,j) \leq a_2(i,j)$$, либо неравенства $$a_1(i,j) \geq a_3(i,j) \geq a2(i,j)$$.

    ]. Пусть

    (I) $$d(A_1, A_2)$$ - метрика в пространстве толерантностей, определенных на конечном множестве $$X = \{x_1, x_2, ..., x_k\}$$ ;

    (II) $$d(A_1, A_3) + d(A_3, A_2) = d(A_1, A_2)$$ тогда и только тогда, когда $$A_3$$ лежит между $$A_1$$ и $$A_2$$ ;

    (III) если отношения толерантности $$A_1$$ и $$A_2$$ отличаются только на одной паре элементов, т.е. $$a_1(i,j) = a_2(i,j)$$ при $$(i,j) \ne (i_0,j_0), i<j, i_0 < j_0$$, и $$a_1(i_0, j_0) \ne a_2(i_0, j_0)$$, то $$d(A_1, A_2) = 1$$.

    Тогда

    $$d(A_1,A_2)=\sum_{1\leq i<j\leq k}|a_1(i,j)-a_2(i,j)|=\frac12\sum_{i=1}^k\sum_{j=1}^k|a_1(i,j)-a_2(i,j)|.$$

    Таким образом, расстояние $$d(A_1, A_2)$$ только постоянным множителем 1/2 отличается от расстояния Кемени, введенного в пространстве всех бинарных отношений как расстояние Хемминга между описывающими отношения матрицами из 0 и 1 (см. пример 7 предыдущего пункта). Теорема 1 дает аксиоматическое введение расстояния в пространстве толерантностей. Оказалось, что оно является сужением расстояния Кемени на это пространство. Сам Дж. Кемени дал аналогичную систему аксиом для сужения на пространство упорядочений. Доказательство теоремы 1 вытекает из рассмотрений, связанных с аксиоматическим введением расстояний между множествами, и приводится ниже.

    Мера симметрической разности как расстояние между множествами. Как известно, бинарное отношение можно рассматривать как подмножество декартова квадрата $$Х_2$$ того множества $$Х$$, на котором оно определено. Поэтому теорему 1 можно рассматривать как аксиоматическое введение расстояния между множествами специального вида. Укажем систему аксиом для расстояния между множествами общего вида, описанного в примере 9 предыдущего пункта.

    Определение 1. Множество $$В$$ находится между множествами $$А$$ и $$С$$, если

    $$(A\bigcap C)\subseteq B\subseteq(A\bigcup C)$$

    С помощью определения 1 в совокупности множеств вводятся геометрические соотношения, использование которых полезно для восприятия рассматриваемых ситуаций.

    Расстояние между двумя точками в евклидовом пространстве не изменится, если обе точки сдвинуть на один и тот же вектор. Аналогичное свойство расстояния между множествами сформулируем в виде аксиомы 1. Оно соответствует аксиоме 3 Кемени и Снелла [, с.22] для расстояний между упорядочениями.

    Аксиома 1. Если $$A\bigcap C=B\bigcap C= \varnothing$$, то $$d(A,B)=d(A\cup C,B\cup C)$$.

    , с.38].

    Теорема 2. Пусть $$W$$ - алгебра множеств, $$d: W^2 \rightarrow R^1$$. Тогда аксиома 1 эквивалентна следующему условию: $$d(A,B) = d(A\setminus B, B\setminus A)$$ для любых $$A, B \in W$$.

    Доказательство. Поскольку

    $$(A\setminus B)\bigcap(A\bigcap B)= \varnothing, (B\setminus A)\bigcap(A\bigcap B)=\varnothing,$$

    то равенство $$d(A,B) = d(A\setminus B, B\setminus A)$$ следует из аксиомы 1. Обратное утверждение вытекает из того, что в условиях аксиомы 1

    $$(A\bigcup C)\setminus(B\bigcup C)=A\setminus B,(B\bigcup C)\setminus(A\bigcup C)=B\setminus A.$$

    Теорема 2 доказана.

    С целью внести в алгебру множеств W отношение "находиться между", аналогичное используемому при аксиоматическом введении расстояний в пространствах бинарных отношений (см. условие (II) в теореме 1), примем следующую аксиому.

    Аксиома 2. Если $$В$$ лежит между $$А$$ и $$С$$, то $$d(A,B)+d(B,C)= d(A,C)$$.

    Определение 3. Неотрицательная функция $$\mu$$, определенная на алгебре множеств $$W$$, называется мерой, если для любых двух непересекающихся множеств $$А$$ и $$В$$ из $$W$$ справедливо соотношение

    $$\mu(A\bigcup B)=\mu(A)+\mu(B).$$

    Понятие меры - это обобщение понятий длины линии, площади фигуры, объема тела.

    Теорема 3. Пусть $$W$$ - алгебра множеств, аксиомы 1 и 2 выполнены для функции $$d: W^2 \rightarrow [0;+\infty]$$. Функция $$d$$ симметрична: $$d(A,B) = d(B,A)$$ для любых $$А$$ и $$В$$ из $$W$$. Тогда существует, и притом единственная, мера $$\mu$$ на $$W$$ такая, что

    $$d(A,B)=\mu(A\Delta B)$$

    при всех $$А$$ и $$В$$ из $$W$$, где $$А\Delta В$$ - симметрическая разность множеств $$А$$ и $$В$$, т.е. $$A\Delta B=(A\setminus B)\bigcup(B\setminus A)$$.

    Доказательство. Положим

    $$\mu(B)=d(\varnothing,B),B\in W.$$

    Покажем, что определенная формулой (2) функция множества $$\mu$$ является мерой. Неотрицательность $$\mu$$ следует из неотрицательности $$d$$. Остается доказать аддитивность, т.е. что из $$A\bigcap B=\varnothing$$ следует, что

    $$\mu(A\bigcup B)=\mu(A)+\mu(B), A\in W, B\in W.$$

    Поскольку $$А$$ всегда лежит между $$\varnothing$$ и $$A\bigcup B$$, то по аксиоме 2

    $$\mu(A\bigcup B)=d(\varnothing, A\bigcup B)=d(\varnothing,A)+d(A,A\bigcup B)=\mu(A)+d(A,A\bigcup B).$$

    Если $$А\cap В=\varnothing$$, то по аксиоме 1 $$d(\varnothing,B)=d(A,A\bigcup B)$$, откуда с учетом (4) и следует (3).

    Докажем соотношение (1). Поскольку $$А\setminus B$$ и $$B\setminus A$$ имеют пустое пересечение, то согласно определению 1 пустое множество $$\varnothing$$ лежит между $$А\setminus B$$ и $$B\setminus A$$. Поэтому по аксиоме 2

    $$d(A\setminus B,B\setminus A)=d(A\setminus B,\varnothing)+d(\varnothing, B\setminus A).$$

    Из симметричности и соотношения (2) следует, что

    $$d(A\setminus B,\varnothing)=d(\varnothing, A\setminus B)=\mu(A\setminus B),$$

    откуда $$d(A\setminus B, B\setminus A)= \mu(A\setminus B) + \mu(B\setminus A)$$. Из соотношения (3) следует, что $$\mu(A\setminus B)+\mu(B\setminus A)=\mu(A\Delta B)$$. С другой стороны, по аксиоме 1 $$d(A\setminus B,B\setminus A)=d((A\setminus B)\bigcup(A\bigcap B),(B\setminus A)\bigcup(A\bigcap B))=d(A,B)$$. Из трех последних равенств вытекает справедливость равенства (1). Остается доказать единственность меры $$\mu$$ в соотношении (1). Поскольку $$А\Delta В = В$$ при $$А = \varnothing,$$ то из (1) следует (2), т.е. однозначность определения меры $$\mu = \mu(d)$$ по расстоянию $$d$$. Теорема 3 доказана.

    Теорема 4 (обратная). Пусть $$\mu$$ - мера, определенная на алгебре множеств $$W$$. Тогда функция $$d(A,B) = \mu(A\Delta B)$$ является псевдометрикой, для нее выполнены аксиомы 1 и 2.

    , с.79]). Доказательство аксиомы 2 содержится в [, c.181-183]. Аксиома 1 следует из того, что условия $$A\bigcap C=B\bigcap C=\varnothing$$ обеспечивают справедливость соотношений

    $$(A\bigcup C)\Delta(B\bigcup C)=((A\bigcup C)\setminus(B\bigcup C))\bigcup((B\bigcup C)\setminus(A\bigcup C))=(A\setminus B)\bigcup(B\setminus A)=A\Delta B.$$

    Замечание. Полагая в аксиоме 2 $$А = В = С$$, получаем, что $$d(A,А) + d(A,А) = d(A,А)$$, т.е. $$d(A,А) = 0$$. Согласно теоремам 3 и 4, из условий теоремы 3 следует неравенство треугольника. Таким образом, в теореме 3 действительно приведена система аксиом, определяющая семейство псевдометрик в пространстве множеств.

    Обсудим независимость (друг от друга) условий теоремы 3. Отбрасывание неотрицательности функции $$d$$ приводит к тому, что слово "мера" в теоремах 3 и 4 необходимо заменить на "заряд" [, с.328]. Этот термин обозначает аддитивную функцию множеств, не обладающую свойством неотрицательности. Заряд можно представить как разность двух мер.

    Функция $$d_1(A,B)=\sqrt{\mu(A\Delta B)}$$ является псевдометрикой, для нее выполнена аксиома 1, но не выполнена аксиома 2, следовательно, ее нельзя представить в виде (1).

    Приведем пример системы множеств $$W$$ и метрики в ней, для которых верна аксиома 2, но не верна аксиома 1, а потому эту метрику нельзя представить в виде (1). Пусть $$W$$ состоит из множеств $$\varnothing,A,B,A\bigcup B$$, причем $$А\cap В = \varnothing$$, а расстояния таковы:

    $$d(\varnothing,A)=d(\varnothing,B)=1, d(A,A\bigcup B)=d(B,A\bigcup B)=d(A,B)=2, d(\varnothing,A\bigcup B)=3.$$

    Если единица $$Х$$ алгебры множеств $$W$$ конечна, т.е. $$X = \{x_1, x_2,..., x_k\}$$, то расстояние (1) принимает вид

    $$d(A,B)=\sum_{i=1}^k\mu_i|\chi_A(x_i)-\chi_B(x_i)|,$$

    где $$\chi_С$$ - индикатор (индикаторная функция) множества $$С$$, т.е. $$\chi_С(х) = 1$$, если $$х\in С$$, и $$\chi_С(х) = 0$$ в противном случае. Как следует из теоремы 3, неотрицательный коэффициент $$\mu_i$$ - это мера одноэлементного множества $$\{x_i\}$$, а также расстояние этого множества от пустого множества, т.е.

    $$\mu_i=\mu(\{x_i\})=d(\varnothing,\{x_i\}).$$

    Если все коэффициенты $$\mu_i$$ положительны, то формула (5) определяет метрику, если хотя бы один равен 0, то - псевдометрику, поскольку в таком случае найдутся два различающиеся между собой множества $$А$$ и $$В$$, такие, что $$d(A,B) = 0$$.

    Расстояние определяется однозначно, если априори известны коэффициенты $$\mu_i$$. В частности, равноправность объектов (элементов единицы алгебры множеств $$Х$$ ) приводит к $$\mu_i\equiv 1$$. Требование равноправности содержится в аксиомах 2 и 4 Кемени [, с.21–22].

    Применим полученные результаты к толерантностям и докажем теорему 1. Совокупность всех толерантностей, определенных на конечном множестве $$Y$$, естественным образом ассоциируется с совокупностью всех подмножеств множества $$Х = \{(y_i, y_j), 1\leq i < j\leq k\}$$. А именно, пара $$(y_i, y_j)$$ входит в подмножество тогда и только тогда, когда $$y_i$$ и $$y_j$$ связаны отношением толерантности. Указанная совокупность подмножеств является алгеброй множеств с единицей $$Х$$. Определение 1 понятия "находиться между" для множеств полностью соответствует ранее данному определению понятия "находиться между" для толерантностей.

    $$Теорема 5$$. Пусть выполнены условия (I) и (II) теоремы 1 и аксиома 1. Тогда существуют числа $$\mu_{ij} > 0$$ такие, что

    $$d(A,B)=\sum_{1\leq i<j\leq k}\mu_{ij}|a(i,j)-b(i,j)|.$$

    Для доказательства достаточно сослаться на теорему 3. Поскольку в условии (I) требуется, чтобы функция $$d(A,B)$$ являлась метрикой, то необходимо $$\mu_ij > 0$$.

    $$Теорема 6$$. Пусть выполнены условия теоремы 1 и, кроме того, аксиома 1. Тогда верно заключение теоремы 1.

    Доказательство. Рассмотрим толерантность $$А$$, для которой $$a(i,j) = 1$$ при $$(i,j) = (i_0,j_0) и a(i,j) = 0$$ в противном случае. Согласно условию (III) теоремы 1 $$d(\varnothing,A)=1$$, а согласно (6) имеем $$d(\varnothing,A)=\mu_{i_0 j_0}$$. Следовательно, коэффициент $$\mu_{i_0 j_0} = 1$$, что и требовалось доказать.

    Для окончательного доказательства теоремы 1 осталось избавиться от требования справедливости аксиомы 1.

    Доказательство теоремы 1. Рассмотрим две толерантности $$А$$ и $$В$$ такие, что при представлении их в виде множеств $$A\subseteq B$$. Это означает, что $$a(i,j)\leq b(i,j)$$ при всех $$i,j$$. Поскольку $$Х$$ - конечное множество, то существует конечная последовательность толерантностей $$A_1, A_2, ..., A_m, ..., A_t$$ такая, что $$А_1 = А, A_t = B, A_1 \subseteq A_2\subseteq ... \subseteq A_m \subseteq ... \subseteq A_t$$, причем $$A_m+1$$ получается из $$A_m$$ заменой ровно одного значения $$a_m(i_m, j_m) = 0$$ на $$a_{m+1}(i_m, j_m) = 1$$, для $$(i, j) \ne (i_m, j_m)$$, при этом $$a_m(i,j)= a_{m+1}(i,j)$$. Тогда $$A_m$$ находится между $$A_{m-1}$$ и $$A_{m+1}$$, следовательно, по условию (II)

    $$d(A,B)=d(A_1,A_2)+d(A_2,A_3)+...+d(A_m,A_{m+1})+...+d(A_{t-1},A_t).$$

    По условию (III) $$d(A_m,A_{m+1}) = 1$$ при всех $$m$$, а потому заключение теоремы 1 верно для любых $$А$$ и $$В$$ таких, что $$A\subseteq B$$.

    Поскольку $$А\cap В$$ лежит между $$А$$ и $$В$$, то по условию (II)

    $$d(A,B)=d(A\cap B,A)+d(A\cap B,B)$$

    При этом $$А\cap В\subseteq А$$ и $$А\cap В\subseteq В$$. Применяя результат предыдущего абзаца, получаем – заключение теоремы 1 верно всегда.

    Замечание 1. Таким образом, условие (III) не только дает нормировку, но и заменяет аксиому 1.

    ], чтобы подчеркнуть цель рассуждения. По той же причине оно сохранено в формулировке теоремы 1, хотя в доказательстве удалось без него обойтись. Понадобилась только симметричность функции $$d$$.

    Аксиоматическое введение метрики в пространстве неотрицательных суммируемых функций. Рассмотрим пространство $$L(E, \mu)$$ неотрицательных суммируемых функций на множестве $$E$$ с мерой $$\mu$$. Далее в настоящем пункте будем рассматривать только функции из $$L(E, \mu)$$. Интегрирование всюду проводится по пространству $$Е$$ и по мере $$\mu$$. Будем писать $$g = h$$ или $$g \leq h$$, если указанные соотношения справедливы почти всюду по $$\mu$$ на $$Е$$ (т.е. могут нарушаться лишь на множестве нулевой меры).

    Аксиоматически введем расстояние в пространстве $$L(E, \mu)$$ (изложение следует работе []). Обозначим $$M(g,h)=\max(g,h)$$ и $$m(g,h)=\min(g,h)$$. Пусть $$D: L(E,\mu) \times L(E,\mu) \rightarrow R^1$$ - тот основной объект изучения, аксиомы для которого будут сейчас сформулированы.

    Аксиома 1. Если $$gh=0,g+h\ne 0$$, то $$D(g,h)=1$$.

    Аксиома 2. Если $$h\leq g$$, то $$D(g,h)=C\int(g-h)d\mu$$, где множитель $$С$$ не зависит от $$h$$, т.е. $$C=C(g)$$.

    $$Лемма$$. Из аксиом 1 и 2 следует, что для $$h\leq g\ne 0$$ имеем

    $$D(g,h)=\frac{\int(g-h)d\mu}{\int gd\mu}.$$

    Для доказательства заметим, что по аксиоме 1 $$D(g,0)=1$$, а по аксиоме 2 $$D(g,0)=C\int gd\mu$$, откуда $$C=\left( \int gd\mu\right)^{-1}$$. Подставляя это соотношение в аксиому 2, получаем заключение леммы.

    Требование согласованности расстояния в пространстве $$L(E,\mu)$$ с отношением "находиться между" приводит, как и ранее для расстояния $$d(A,B)$$, к следующей аксиоме.

    Аксиома 3. Для любых $$g$$ и $$h$$ справедливо равенство $$D(g,h)=D(M(g,h),g)+D(M(g,h),h)$$.

    ] так называемая D-метрика (от dissimilarity (англ.) - несходство), для которого это условие выполнено. Она имеет вид:

    $$D(A,B)= \left\{ \begin{gathered} \frac{\mu(A\Delta B)}{\mu(A\bigcup B)}, \mu(A\bigcup B) >0,\\ 0,\mu(A)=\mu(B)=0. \end{gathered} \right.$$

    Приведенные выше аксиомы являются обобщениями соответствующих аксиом для $$D$$ -метрики в пространстве множеств.

    Теорема 7. Из аксиом 1–3 следует, что

    $$D(g,h)= \left\{ \begin{gathered} \frac{\int|g-h|d\mu}{\int M(g,h)d\mu}, g+h\ne 0, \\ 0,g=h=0. \end{gathered} \right.$$

    Доказательство. Поскольку

    $$(M(g,h)-g)+(M(g,h)-h)=|g-h|,$$

    то заключение теоремы 7 при $$g+h\ne 0$$ вытекает из леммы и аксиомы 3. Из аксиомы 2 при $$g=0$$ следует, что $$D(0,0)=0$$. Легко видеть, что функция $$D$$, заданная формулой (8), удовлетворяет аксиомам 1–3 и, кроме того, $$D(g,h)\leq 1$$ при любых $$g$$ и $$h$$.

    ].

    Теорема 8. Функция $$D(g,h)$$, определенная формулой (8), является метрикой в $$L(E,\mu)$$ (при отождествлении функций, отличающихся лишь на множестве нулевой меры), причем $$D(g, f)+D(f,h)=D(g,h)$$ тогда и только тогда, когда $$f=g,f=h$$ или $$f=M(g,h)$$.

    Доказательство. Обратимся к определению метрики. Для рассматриваемой функции непосредственно очевидна справедливость условий неотрицательности и симметричности. Очевидна и эквивалентность условия $$D(g,h)=0$$ равенству $$g=h$$. Остается доказать неравенство треугольника и установить, когда оно обращается в равенство.

    Без ограничения общности можно считать, что рассматриваемые расстояния задаются верхней строкой формулы (8) и кроме того,

    $$R=\int M(g,f)d\mu-\int M(f,h)d\mu\geq 0$$

    (частные случаи с использованием нижней строки формулы (8) рассматриваются элементарно, а справедливости последнего неравенства можно добиться заменой обозначений функций - элементов пространства $$L(E,\mu)$$ ). Тогда

    $$D(g,f)+D(f,h)\geq \frac{\int(|g-f|+|f-h|)d\mu}{\int M(g,f)d\mu},$$

    причем равенство имеет место тогда и только тогда, когда $$R=0$$ или $$f=h$$. Положим

    $$P=\int(|g-f|+|f-h|-|g-h|)d\mu,Q=\int(M(g,f)-M(g,h))d\mu.$$

    Ясно, что $$P\geq 0$$ и

    $$\frac{\int(|g-f|+|f-h|)d\mu}{\int M(g,f)d\mu}=\frac{\int|g-h|d\mu+P}{\int M(g,h)d\mu+Q}.$$

    Если $$Q < 0$$, то очевидно, что неравенство треугольника выполнено, причем неравенство является строгим. Рассмотрим случай $$Q > 0$$.

    Воспользуемся следующим элементарным фактом: если $$y \geq x, y > 0, P > Q > 0$$, то

    $$\frac{x+P}{y+Q}>\frac{x}{y}.$$

    Из соотношений (10) и (11) вытекает, что для доказательства неравенства треугольника достаточно показать, что $$P–Q>0$$.

    Рассмотрим

    $$k={|g–f|+|f–h|–|g–h|}–M(g,f)+M(g,h).$$

    Применяя равенство $$(M(g,h)–g)+(M(g,h)–h)=|g–h|$$ к слагаемым, заключенным в фигурные скобки, получаем, что

    $$k=M(f,h)+[M(g,f)+M(f,h)–M(g,h)–2f].$$

    Применяя соотношение

    $$M(g,h)=g+h–m(g,h)$$

    к слагаемым, заключенным в квадратные скобки, получаем, что

    $$k=M(f,h)–m(f,h)–m(g,f)+m(g,h).$$

    Так как $$M(f,h)–m(f,h)=|f–h|$$, то

    $$k=|f–h|–(m(g,f)–m(g,h))\geq (f–h)–(m(g,f)–m(g,h)).$$

    В соответствии с (12) правая часть (13) есть $$M(g,f)–M(g,h)$$, а потому

    $$P–Q=\int k d\mu\geq Q > 0,$$

    что завершает доказательство для случая $$Q>0$$. При этом неравенство треугольника является строгим.

    Осталось рассмотреть случай $$Q = 0$$. В силу соотношений (9) и (10) неравенство треугольника выполнено. Когда оно обращается в равенство? Тривиальные случаи: $$f=g$$ или $$f=h$$. Если же $$f$$ отлично от $$g$$ и $$h$$, то необходимо, чтобы $$R=0$$ и $$P=0$$. Как легко проверить, последнее условие эквивалентно неравенствам

    $$m(g,h) \leq f \leq M(g,h).$$

    Из правого неравенства в (14) следует, что $$M(g,f)\leq M(g,M(g,h))= M(g,h)$$. Так как $$Q=0$$, то $$M(g,f)=M(g,h)$$. Аналогичным образом из соотношений

    $$M(h,f)\leq M(h,M(g,h))=M(g,h)=M(g,f)$$

    и $$R=0$$ следует, что $$M(f,h)=M(g,h)$$.

    Рассмотрим измеримое множество $$X=\{x\in E:h(x)<g(x)\}$$. Тогда $$M(g,h)(x)=M(f,h)(x)=g(x)>h(x)$$, т.е. $$h(x)<f(x)=M(g,h)(x)$$ для почти всех $$x\in X$$. Для почти всех $$y\in\{x\in E:h(x)>g(x)\}$$ точно так же получаем $$f(y)=M(g,h)(y)$$. Для почти всех $$z\in\{x\in E:h(x)=g(x)\}$$ в силу (14) $$f(z)=M(g,h)(z)$$, что и завершает доказательство теоремы.

    ].

    Контрольные вопросы и задачи

  • Приведите примеры практического использования количественных и категоризованных данных.
  • Как соотносятся группы допустимых преобразований для различных шкал измерения?
  • Почему анализ нечисловых данных занимает одно из центральных мест в прикладной статистике?
  • В каких случаях целесообразно применение нечетких множеств?
  • Справедливо ли для нечетких множеств равенство $$(A+B)C=AC+BC$$? А равенство $$(AB)C=(AC)(BC)$$?
  • Докажите, что для блочного расстояния (пример 4 из п.1.5) справедливо неравенство треугольника.
  • Расскажите о многообразии расстояний в различных пространствах статистических данных.
  • Докажите, что если $$d(x,y)$$ - расстояние в некотором пространстве, то $$\sart{d(x,y)}$$ - также расстояние в этом пространстве.
  • Темы докладов, рефератов, исследовательских работ

  • Содержание первого сочинения по прикладной статистике - книги "Числа" в Библии.
  • Свойства основных шкал измерения.
  • Взаимосвязи различных классов объектов нечисловой природы между собой.
  • Опишите с помощью нечеткого подмножества временной шкалы понятие "молодой человек" (на основе опроса 10–20 экспертов).
  • Опишите с помощью теории нечеткости понятие "куча зерен" (на основе опроса 10–20 экспертов).
  • Центральная роль статистики объектов произвольной природы в прикладной статистике.
  • Расстояния в пространствах функций.
  • Докажите, что аксиоматически введенный в п.1.6 показатель различия между множествами $$d(A,B)=\mu(А\Delta В)$$ удовлетворяет неравенству треугольника.
  • Вернуться к учебному плану