Теория и методы разработки управленческих решений

Описание неопределенностей в теории принятия решений

Разбить на страницы
Показывать лекцию целиком

Одна из основных проблем в теории принятия решений - необходимость учета неопределенностей, оценки и управления рисками. Для описания неопределенностей и рисков применяют различные подходы.

Чаще всего используется вероятностно-статистический подход. Kратко обсуждаются основные понятия и результаты в области теории вероятностей и статистики.

Изложение в настоящей главе доведено до современного уровня. Одним из наиболее интересных и продуктивных бурно развивающихся направлений теории принятия решений является анализ интервальных данных, согласно которому исходные данные - не числа, а интервалы. Таким образом, неопределенность величин, используемых в процессе принятия решения, моделируется путем замены конкретных численных значений на интервалы, в которых содержатся рассматриваемые величины.

Интервальные данные - это частный случай нечетких данных. В последнее время теория нечеткости все чаще используется в экономических исследованиях. Нечеткость, расплывчатость, размытость понятий и величин - типичная черта многих задач принятия решений.Обратим внимание на систему принципиально важных утверждений, согласно которой теория нечеткости в определенном смысле сводится к теории случайных множеств - одной из частей вероятностно-статистической теории.

Настоящая глава содержит введение в методы описания неопределенностей. За более подробной информацией необходимо обратиться к специальной литературе.

Вероятностно-статистические методы описания неопределенностей

Статистика - это наука о том, как обрабатывать данные. Статистические методы основаны на вероятностных моделях. Они активно применяются в технических исследованиях, экономике, теории и практике управления (менеджмента). А также в социологии, медицине, геологии, истории и т.д. С обработкой результатов наблюдений, измерений, испытаний, опытов, анализов имеют дело специалисты во всех отраслях практической деятельности, почти во всех областях научных исследований.

Развитие наукоемких технологий, как правило, основано на применении высоких статистических технологий организации и управления производством. Особенно активно они используются в высокотехнологичных отраслях промышленности. Без вероятностно-статистических методов немыслимы оценка и анализ риска, страхование, финансовая деятельность. Инженеры, менеджеры, экономисты, социологи, врачи, психологи, историки успешно применяют интеллектуальные инструменты принятия решений, основанные на вероятности и статистике.

Статистические методы и модели и их база - теория вероятностей - активно развиваются во всем мире. Американская статистическая ассоциация насчитывает более двадцати тысяч членов, Королевское статистическое общество - более десяти тысяч. Статьи по вероятности и статистике постоянно публикуются более чем в пятистах научных журналах. В университетах США статистических факультетов больше, чем математических и физических. Восемь нобелевских премий получены эконометриками (специалистами по статистическим методам в экономике).

Современная теория вероятностей основана на аксиоматике академика АН СССР А.Н. Колмогорова. Однако в нашей стране специалисты и научные работники, студенты и преподаватели пока еще недостаточно знакомы с последними достижениями в области вероятностно-статистических методов, хотя ссылки на них постоянно встречаются в научно-технической, деловой и учебной литературе.

Вероятность и статистика нужны всем. Теория вероятностей и математическая статистика - основа вероятностно-статистических методов обработки данных. А данные мы обрабатываем и анализируем прежде всего для принятия решений. Чтобы воспользоваться современным математическим аппаратом, необходимо рассматриваемые задачи выразить в терминах вероятностно-статистических моделей.

Применение конкретного вероятностно-статистического метода состоит из трех этапов:

  • переход от экономической, управленческой, технологической реальности к абстрактной математико-статистической схеме, т.е. построение вероятностной модели системы управления, технологического процесса, процедуры принятия решений, в частности по результатам статистического контроля, и т.п.
  • проведение расчетов и получение выводов чисто математическими средствами в рамках вероятностной модели;
  • интерпретация математико-статистических выводов применительно к реальной ситуации и принятие соответствующего решения (например, о соответствии или несоответствии качества продукции установленным требованиям, необходимости наладки технологического процесса и т.п.), в частности, заключения (о доле дефектных единиц продукции в партии, о конкретном виде законов распределения контролируемых параметров технологического процесса и др.).
  • Математическая статистика использует понятия, методы и результаты теории вероятностей. Далее рассматриваем основные вопросы построения вероятностных моделей в экономических, управленческих, технологических и иных ситуациях. Подчеркнем, что для активного и правильного использования нормативно-технических и инструктивно-методических документов (инструкций, методик, правил, стандартов, справочников, учебников и т.п.) по вероятностно-статистическим методам нужны предварительные знания. Так, необходимо знать, при каких условиях следует применять тот или иной документ, какую исходную информацию необходимо иметь для его выбора и применения, какие решения должны быть приняты по результатам обработки данных и т.д.

    Примеры применения теории вероятностей и математической статистики.Рассмотрим несколько примеров, когда вероятностно-статистические модели являются хорошим инструментом для решения управленческих, производственных, экономических, народнохозяйственных задач. Так, например, в романе А.Н.Толстого "Хождение по мукам" (т.1) говорится: "Мастерская дает двадцать три процента брака, этой цифры вы и держитесь, - сказал Струков Ивану Ильичу".

    Как понимать эти слова в разговоре заводских менеджеров? Одна единица продукции не может быть дефектна на 23%. Она может быть либо годной, либо дефектной. Наверно, Струков имел в виду, что в партии большого объема содержится примерно 23% дефектных единиц продукции. Тогда возникает вопрос, а что значит "примерно"? Пусть из 100 проверенных единиц продукции 30 окажутся дефектными, или из 1000 - 300, или из 100000 - 30000 и т.д., надо ли обвинять Струкова во лжи?

    Или другой пример. Монетка, которую используют как жребий, должна быть "симметричной". При ее бросании в среднем в половине случаев должен выпадать герб (орел), а в половине случаев - решетка (решка, цифра). Но что означает "в среднем"? Если провести много серий по 10 бросаний в каждой серии, то часто будут встречаться серии, в которых монетка 4 раза выпадает гербом. Для симметричной монеты это будет происходить в 20,5% серий. А если на 100000 бросаний окажется 40000 гербов, то можно ли считать монету симметричной? Процедура принятия решений строится на основе теории вероятностей и математической статистики.

    Пример может показаться недостаточно серьезным. Однако это не так. Жеребьевка широко используется при организации промышленных технико-экономических экспериментов. Например, при обработке результатов измерения показателя качества (момента трения) подшипников в зависимости от различных технологических факторов (влияния консервационной среды, методов подготовки подшипников перед измерением, влияния нагрузки подшипников в процессе измерения и т.п.). Допустим, необходимо сравнить качество подшипников в зависимости от результатов хранения их в разных консервационных маслах, т.е. в маслах состава А и В. При планировании такого эксперимента возникает вопрос, какие подшипники следует поместить в масло состава А, а какие - в масло состава В, но так, чтобы избежать субъективизма и обеспечить объективность принимаемого решения. Ответ на этот вопрос может быть получен с помощью жребия.

    Аналогичный пример можно привести и с контролем качества любой продукции. Чтобы решить, соответствует или не соответствует контролируемая партия продукции установленным требованиям, из нее отбирается выборка. По результатам контроля выборки делается заключение о всей партии. В этом случае очень важно избежать субъективизма при формировании выборки, т.е. необходимо, чтобы каждая единица продукции в контролируемой партии имела одинаковую вероятность быть отобранной в выборку. В производственных условиях отбор единиц продукции в выборку обычно осуществляют не с помощью жребия, а по специальным таблицам случайных чисел или с помощью компьютерных датчиков случайных чисел.

    Похожие проблемы обеспечения объективности сравнения возникают при сопоставлении различных схем организации производства, оплаты труда, при проведении тендеров и конкурсов, подбора кандидатов на вакантные должности и т.п. Всюду нужна жеребьевка или подобные ей процедуры.

    Пусть надо выявить наиболее сильную и вторую по силе команду при организации турнира по олимпийской системе (проигравший выбывает). Допустим, что более сильная команда всегда побеждает более слабую. Ясно, что самая сильная команда однозначно станет чемпионом. Вторая по силе команда выйдет в финал тогда и только тогда, когда до финала у нее не будет игр с будущим чемпионом. Если такая игра запланирована, то вторая по силе команда в финал не попадет. Тот, кто планирует турнир, может либо досрочно "выбить" вторую по силе команду из турнира, сведя ее в первой же встрече с лидером, либо обеспечить ей второе место, обеспечив встречи с более слабыми командами вплоть до финала. Чтобы избежать субъективизма, проводят жеребьевку. Для турнира из 8 команд вероятность того, что в финале встретятся две самые сильные команды, равна 4/7. Соответственно с вероятностью 3/7 вторая по силе команда покинет турнир досрочно.

    При любом измерении единиц продукции (с помощью штангенциркуля, микрометра, амперметра и т.п.) имеются погрешности. Чтобы выяснить, есть ли систематические погрешности, необходимо сделать многократные измерения единицы продукции, характеристики которой известны (например, стандартного образца). При этом следует помнить, что кроме систематической погрешности присутствует и случайная погрешность.

    Поэтому встает вопрос, как по результатам измерений узнать, есть ли систематическая погрешность. Если отмечать только, является ли полученная при очередном измерении погрешность положительной или отрицательной, то эту задачу можно свести к уже рассмотренной. Действительно, сопоставим измерение с бросанием монеты, положительную погрешность - с выпадением герба, отрицательную - решетки (нулевая погрешность при достаточном числе делений шкалы практически никогда не встречается). Тогда проверка отсутствия систематической погрешности эквивалентна проверке симметричности монеты.

    Итак, задача проверки отсутствия систематической погрешности сведена к задаче проверки симметричности монеты. Проведенные рассуждения приводят к так называемому "критерию знаков" в математической статистике.

    При статистическом регулировании технологических процессов на основе методов математической статистики разрабатываются правила и планы статистического контроля процессов, направленные на своевременное обнаружение разладки технологических процессов и принятия мер к их наладке и предотвращению выпуска продукции, не соответствующей установленным требованиям. Эти меры нацелены на сокращение издержек производства и потерь от поставки некачественных единиц продукции. При статистическом приемочном контроле на основе методов математической статистики разрабатываются планы контроля качества путем анализа выборок из партий продукции. Сложность заключается в том, чтобы уметь правильно строить вероятностно-статистические модели принятия решений. В математической статистике для этого разработаны вероятностные модели и методы проверки гипотез, в частности, гипотез о том, что доля дефектных единиц продукции равна определенному числу р0, например, $$р_0 = 0,23$$ (вспомните слова Струкова из романа А.Н.Толстого).

    Задачи оценивания. В ряде управленческих, производственных, экономических, народнохозяйственных ситуаций возникают задачи другого типа - задачи оценки характеристик и параметров распределений вероятностей.

    Рассмотрим пример. Пусть на контроль поступила партия из $$N$$ электроламп. Из этой партии случайным образом отобрана выборка объемом n электроламп. Возникает ряд естественных вопросов. Как по результатам испытаний элементов выборки определить средний срок службы электроламп, с какой точностью можно оценить эту характеристику? Как изменится точность, если взять выборку большего объема? При каком числе часов Т можно гарантировать, что не менее 90% электроламп прослужат Т и более часов?

    Предположим, что при испытании выборки объемом n электроламп дефектными оказались Х электроламп. Какие границы можно указать для числа D дефектных электроламп в партии, для уровня дефектности $$D/N$$ и т.п.?

    Или при статистическом анализе точности и стабильности технологических процессов надлежит оценить такие показатели качества, как среднее значение контролируемого параметра и степень его разброса в рассматриваемом процессе. Согласно теории вероятностей в качестве среднего значения случайной величины целесообразно использовать ее математическое ожидание, а в качестве статистической характеристики разброса - дисперсию, среднее квадратическое отклонение или коэффициент вариации. Возникают вопросы: как оценить эти статистические характеристики по выборочным данным, с какой точностью это удается сделать?

    Аналогичных примеров можно привести очень много. Здесь важно было показать, как теория вероятностей и математическая статистика могут быть использованы в инженерных, экономических и управленческих задачах.

    Современное представление о математической статистике. Под математической статистикой понимают "раздел математики, посвященный математическим методам сбора, систематизации, обработки и интерпретации статистических данных, а также использованию их для научных или практических выводов. Правила и процедуры математической статистики опираются на теорию вероятностей, позволяющую оценить точность и надежность выводов, получаемых в каждой задаче на основании имеющегося статистического материала". При этом статистическими данными называются сведения о числе объектов в какой-либо более или менее обширной совокупности, обладающих теми или иными признаками.

    По типу решаемых задач математическая статистика обычно делится на три раздела: описание данных, оценивание и проверка гипотез.

    По виду обрабатываемых статистических данных математическая статистика делится на четыре направления:

  • одномерная статистика (статистика случайных величин), в которой результат наблюдения описывается действительным числом;
  • многомерный статистический анализ, где результат наблюдения над объектом описывается несколькими числами (вектором);
  • статистика случайных процессов и временных рядов, где результат наблюдения - функция;
  • статистика объектов нечисловой природы, в которой результат наблюдения имеет нечисловую природу, например, является множеством (геометрической фигурой), упорядочением или получен в результате измерения по качественному признаку.
  • Исторически первой появились некоторые области статистики объектов нечисловой природы (в частности, задачи оценивания доли брака и проверки гипотез о ней; первоначально говорилось об извлечении разноцветных шаров из урны) и одномерная статистика. Математический аппарат для них проще, поэтому на их примере обычно демонстрируют основные идеи математической статистики.

    Лишь те методы обработки данных, т.е. математической статистики, являются доказательными, которые опираются на вероятностные модели соответствующих реальных явлений и процессов. Речь идет о моделях поведения потребителей, возникновения рисков, функционирования технологического оборудования, получения результатов эксперимента, течения заболевания и т.п. Вероятностную модель реального явления следует считать построенной, если рассматриваемые величины и связи между ними выражены в терминах теории вероятностей. Соответствие вероятностной модели реальности, т.е. ее адекватность, обосновывают, в частности, с помощью статистических методов проверки гипотез.

    Невероятностные методы обработки данных являются поисковыми, их можно использовать лишь при предварительном анализе данных, так как они не дают возможности оценить точность и надежность выводов, полученных на основании ограниченного статистического материала.

    Вероятностные и статистические методы применимы всюду, где удается построить и обосновать вероятностную модель явления или процесса. Их применение обязательно, когда сделанные на основе выборочных данных выводы переносятся на всю совокупность (например, с выборки на всю партию продукции).

    В конкретных областях применений используются как вероятностно-статистические методы широкого применения, так и специфические. Например, в разделе производственного менеджмента, посвященного статистическим методам управления качеством продукции, используют прикладную математическую статистику (включая планирование экспериментов). С помощью ее методов проводится статистический анализ точности и стабильности технологических процессов и статистическая оценка качества. К специфическим методам относятся методы статистического приемочного контроля качества продукции, статистического регулирования технологических процессов, оценки и контроля надежности и др.

    Широко применяются такие прикладные вероятностно-статистические дисциплины, как теория надежности и теория массового обслуживания. Содержание первой из них ясно из названия, вторая занимается изучением систем типа телефонной станции, на которую в случайные моменты времени поступают вызовы - требования абонентов, набирающих номера на своих телефонных аппаратах. Длительность обслуживания этих требований, т.е. длительность разговоров, также моделируется случайными величинами. Большой вклад в развитие этих дисциплин внесли член-корреспондент АН СССР А.Я. Хинчин (1894-1959), академик АН УССР Б.В.Гнеденко (1912-1995) и другие отечественные ученые.

    Коротко об истории математической статистики. Математическая статистика как наука начинается с работ знаменитого немецкого математика Карла Фридриха Гаусса (1777-1855), который на основе теории вероятностей исследовал и обосновал метод наименьших квадратов, созданный им в 1795 г. и примененный для обработки астрономических данных (с целью уточнения орбиты малой планеты Церера). Его именем часто называют одно из наиболее популярных распределений вероятностей - нормальное, а в теории случайных процессов основной объект изучения - гауссовские процессы.

    В конце XIX в. - начале ХХ в. крупный вклад в математическую статистику внесли английские исследователи, прежде всего К.Пирсон (1857-1936) и Р.А.Фишер (1890-1962). В частности, Пирсон разработал критерий "хи-квадрат" проверки статистических гипотез, а Фишер - дисперсионный анализ, теорию планирования эксперимента, метод максимального правдоподобия оценки параметров.

    В 30-е годы ХХ в. поляк Ежи Нейман (1894-1977) и англичанин Э.Пирсон развили общую теорию проверки статистических гипотез, а советские математики академик А.Н. Колмогоров (1903-1987) и член-корреспондент АН СССР Н.В.Смирнов (1900-1966) заложили основы непараметрической статистики. В сороковые годы ХХ в. румын А. Вальд (1902-1950) построил теорию последовательного статистического анализа.

    Математическая статистика бурно развивается и в настоящее время. Так, за последние 40 лет можно выделить четыре принципиально новых направления исследований:

  • разработка и внедрение математических методов планирования экспериментов;
  • развитие статистики объектов нечисловой природы как самостоятельного направления в прикладной математической статистике;
  • развитие статистических методов, устойчивых по отношению к малым отклонениям от используемой вероятностной модели;
  • широкое развертывание работ по созданию компьютерных пакетов программ, предназначенных для проведения статистического анализа данных.
  • Вероятностно-статистические методы и оптимизация. Идея оптимизации пронизывает современную прикладную математическую статистику и иные статистические методы. А именно, методы планирования экспериментов, статистического приемочного контроля, статистического регулирования технологических процессов и др. С другой стороны, оптимизационные постановки в теории принятия решений, например, прикладная теория оптимизации качества продукции и требований стандартов, предусматривают широкое использование вероятностно-статистических методов, прежде всего прикладной математической статистики.

    В производственном менеджменте, в частности, при оптимизации качества продукции и требований стандартов особенно важно применять статистические методы на начальном этапе жизненного цикла продукции, т.е. на этапе научно-исследовательской подготовки опытно-конструкторских разработок (разработка перспективных требований к продукции, аванпроекта, технического задания на опытно-конструкторскую разработку). Это объясняется ограниченностью информации, доступной на начальном этапе жизненного цикла продукции, и необходимостью прогнозирования технических возможностей и экономической ситуации на будущее. Статистические методы должны применяться на всех этапах решения задачи оптимизации - при шкалировании переменных, разработке математических моделей функционирования изделий и систем, проведении технических и экономических экспериментов и т.д.

    В задачах оптимизации, в том числе оптимизации качества продукции и требований стандартов, используют все области статистики. А именно, статистику случайных величин, многомерный статистический анализ, статистику случайных процессов и временных рядов, статистику объектов нечисловой природы. Разработаны рекомендации по выбору статистического метода для анализа конкретных данных .

    Анализ интервальных данных

    Перспективная и быстро развивающаяся область исследований последних десятилетий - анализ интервальных данных. Речь идет о развитии методов прикладной математической статистики в ситуации, когда статистические данные - не числа, а интервалы, в частности, порожденные наложением ошибок измерения на значения случайных величин. Приведем основные идеи весьма перспективного для вероятностно-статистических методов и моделей принятия решений асимптотического направления в статистике интервальных данных.

    В настоящее время признается необходимым изучение устойчивости (робастности) оценок параметров к малым отклонениям исходных данных и предпосылок модели. Однако популярная среди теоретиков модель засорения (модель Тьюки-Хьюбера) представляется не вполне адекватной. Эта модель нацелена на изучение влияния больших "выбросов". Поскольку любые реальные измерения лежат в некотором фиксированном диапазоне, а именно, заданном в техническом паспорте средства измерения, то зачастую выбросы не могут быть слишком большими.

    В одной из таких схем изучается влияние интервальности исходных данных на статистические выводы. Необходимость такого изучения стала очевидной следующим образом. В государственных стандартах СССР по прикладной статистике в обязательном порядке давалось справочное приложение "Примеры применения правил стандарта". При разработке ГОСТ 11.011-83 были переданы для анализа реальные данные о наработке резцов до предельного состояния (в часах). Оказалось, что все эти данные представляли собой либо целые числа, либо полуцелые (т.е. после умножения на 2 становящиеся целыми). Ясно, что исходная длительность наработок искажена. Необходимо учесть в статистических процедурах наличие такого искажения исходных данных. Как это сделать?

    Первое, что приходит в голову - модель группировки данных, согласно которой для истинного значения Х проводится замена на ближайшее число из множества {0,5n, n=1,2,3,...} . Однако эту модель целесообразно подвергнуть сомнению, а также рассмотреть иные модели. Так, возможно, что Х надо приводить к ближайшему сверху элементу указанного множества - если проверка качества поставленных на испытание резцов проводилась раз в полчаса. Другой вариант: если расстояния от Х до двух ближайших элементов множества {0,5n, n=1,2,3,...} примерно равны, то естественно ввести рандомизацию при выборе заменяющего числа, и т.д.

    Целесообразно построить новую математико-статистическую модель, согласно которой результаты наблюдений - не числа, а интервалы Например, если в таблице приведено значение 53,5, то это значит, что реальное значение - какое-то число от 53,0 до 54,0, т.е. какое-то число в интервале [53,5 - 0,5; 53,5 + 0,5] , где 0,5 - максимально возможная погрешность. Принимая эту модель, мы попадаем в новую научную область - статистику интервальных данных. Статистика интервальных данных идейно связана с интервальной математикой, в которой в роли чисел выступают интервалы . Это направление математики является дальнейшим развитием известных правил приближенных вычислений, посвященных выражению погрешностей суммы, разности, произведения, частного через погрешности тех чисел, над которыми осуществляются перечисленные операции.

    В интервальной математике сумма двух интервальных чисел [a,b] и [c,d] имеет вид [a,b] + [c,d] = [a+c, b+d] , а разность определяется по формуле $$[a,b] - [c,d] = [a-d, b-c] $$. Для положительных a, b, c, d произведение определяется формулой $$[a,b] * [c,d] = [ac, bd] $$, а частное имеет вид $$[a,b] / [c,d] = [a/d, b/c] $$. Эти формулы получены при решении соответствующих оптимизационных задач. Пусть х лежит в отрезке $$[a,b] $$, а у - в отрезке $$[c,d] $$. Каково минимальное и максимальное значение для $$х+у$$? Очевидно, $$a+c$$ и $$b+d$$ соответственно. Минимальные и максимальные значения для х-у, ху, х/у задают нижние и верхние границы для интервальных чисел, задающих результаты арифметических операций. А от арифметических операций можно перейти ко всем остальным математическим алгоритмам. Так строится интервальная математика. К настоящему времени удалось решить, в частности, ряд задач теории интервальных дифференциальных уравнений, в которых коэффициенты, начальные условия и решения описываются с помощью интервалов.

    В настоящем разделе обсуждаем асимптотические методы статистического анализа интервальных данных при больших объемах выборок и малых погрешностях измерений. В отличие от классической математической статистики, сначала устремляется к бесконечности объем выборки и только потом - уменьшаются до нуля погрешности. В частности, еще в начале 1980-х годов с помощью такой асимптотики были сформулированы правила выбора метода оценивания в ГОСТ 11.011-83.

    Разработана общая схема исследования, включающая расчет нотны (максимально возможного отклонения статистики, вызванного интервальностью исходных данных) и рационального объема выборки (превышение которого не дает существенного повышения точности оценивания). Она применена к оцениванию математического ожидания и дисперсии, медианы и коэффициента вариации, параметров гамма-распределения и характеристик аддитивных статистик, при проверке гипотез о параметрах нормального распределения, в т.ч. с помощью критерия Стьюдента, а также гипотезы однородности с помощью критерия Смирнова. Изучено асимптотическое поведение оценок метода моментов и оценок максимального правдоподобия (а также более общих - оценок минимального контраста), проведено асимптотическое сравнение этих методов в случае интервальных данных, найдены общие условия, при которых, в отличие от классической математической статистики, метод моментов дает более точные оценки, чем метод максимального правдоподобия.

    Разработаны подходы к рассмотрению интервальных данных в основных постановках регрессионного, дискриминантного и кластерного анализов. В частности, изучено влияние погрешностей измерений и наблюдений на свойства алгоритмов регрессионного анализа, разработаны способы расчета нотн и рациональных объемов выборок, введены и исследованы новые понятия многомерных и асимптотических нотн, доказаны соответствующие предельные теоремы. Начата разработка интервального дискриминантного анализа, в частности, рассмотрено влияние интервальности данных на показатель качества классификации.

    В области асимптотической математической статистики интервальных данных мы имеем мировой приоритет. Очевидно, со временем во все виды статистического программного обеспечения должны быть включены алгоритмы интервальной статистики, "параллельные" обычно используемым алгоритмам прикладной математической статистики. Это позволит в явном виде учесть наличие погрешностей у результатов наблюдений, сблизить позиции метрологов и статистиков.

    Многие из утверждений статистики интервальных данных весьма отличаются от аналогов из классической математической статистики. В частности, не существует состоятельных оценок; средний квадрат ошибки оценки, как правило, асимптотически равен сумме дисперсии оценки, рассчитанной согласно классической теории, и некоторого положительного числа (равного квадрату т.н. нотны - максимально возможного отклонения значения статистики из-за погрешностей исходных данных) - в результате метод моментов оказывается иногда точнее метода максимального правдоподобия; нецелесообразно увеличивать объем выборки сверх некоторого предела (называемого рациональным объемом выборки) - вопреки классической теории, согласно которой чем больше объем выборки, тем точнее выводы.

    Развитие идей статистики интервальных данных продолжается уже в течение более чем 25 лет, и еще много чего надо сделать!

    Одна из ведущих научных школ в области анализа интервальных данных - это школа проф. А.П. Вощинина, активно работающая с конца 70-х годов. В частности, изучены проблемы регрессионного анализа, планирования эксперимента, сравнения альтернатив и принятия решений в условиях интервальной неопределенности.

    Рассматриваемое ниже направление отличается нацеленностью на асимптотические результаты, полученные при больших объемах выборок и малых погрешностях измерений, поэтому оно и названо асимптотической статистикой интервальных данных.

    Сформулируем сначала основные идеи асимптотической математической статистики интервальных данных. Следует сразу подчеркнуть, что основные идеи достаточно просты, в то время как их проработка в конкретных ситуациях зачастую оказывается достаточно трудоемкой.

    Пусть существо реального явления описывается выборкой $$x_1, x_2 , \dots, x_n$$. В вероятностной теории математической статистики, из которой мы исходим, выборка - это набор n независимых в совокупности одинаково распределенных случайных величин. Однако беспристрастный и тщательный анализ подавляющего большинства реальных задач показывает, что статистику известна отнюдь не выборка $$x_1, x_2, \dots, x_n$$, а величины

    $$y_j = x_j + \varepsilon _j, j = 1, 2, \dots , n,$$

    где $$\varepsilon _1, \varepsilon _2, \dots \varepsilon_n $$, некоторые погрешности измерений, наблюдений, анализов, опытов, исследований (например, инструментальные ошибки).

    Одна из причин появления погрешностей - запись результатов наблюдений с конечным числом значащих цифр. Дело в том, что для случайных величин с непрерывными функциями распределения событие, состоящее в попадании хотя бы одного элемента выборки в множество рациональных чисел, согласно правилам теории вероятностей имеет вероятность 0, а такими событиями в теории вероятностей принято пренебрегать. Поэтому при рассуждениях о выборках из обычно используемых распределений (нормального, логарифмически нормального, экспоненциального, равномерного, гамма - распределений, распределения Вейбулла-Гнеденко и т.п.) приходится принимать, что эти распределения имеют элементы исходной выборки $$x_1, x_2 , \dots, x_n $$, в то время как статистической обработке доступны лишь искаженные значения $$y_j = x_j + \varepsilon_j $$.

    Введем обозначения

    $$x = (x_1, x_2 , \dots, x_n), y = (y_1, y_2 ,\dots, y_n), \varepsilon = (\varepsilon_1, \varepsilon_2, \dots , \varepsilon_n) $$

    Пусть статистические выводы основываются на статистике $$f:R^n \to R^1 $$ используемой для оценивания параметров и характеристик распределения, проверки гипотез и решения иных статистических задач. Принципиально важная для статистики интервальных данных идея такова: СТАТИСТИК ЗНАЕТ ТОЛЬКО $$f(y) $$, НО НЕ $$f(x) $$.

    Очевидно, в статистических выводах необходимо отразить различие между $$f(y) $$ и $$f(x) $$. Одним из двух основных понятий статистики интервальных данных является понятие нотны.

    Определение. Величину максимально возможного (по абсолютной величине) отклонения, вызванного погрешностями наблюдений , известного статистику значения $$f(y) $$ от истинного значения $$f(x) $$, т.е.

    $$N_f(x) = \sup |f(y) - f(x)|,$$

    где супремум берется по множеству возможных значений вектора погрешностей $$\varepsilon $$ (см. ниже), будем называть НОТНОЙ .

    Если функция $$f$$ имеет частные производные второго порядка, а ограничения на погрешности имеют вид

    $$|\varepsilon_i| \le \Delta, i=1,2, \dots, n $$

    причем $$\Delta$$ мало, то приращение функции $$f$$ с точностью до бесконечно малых более высокого порядка описывается главным линейным членом, т.е.

    $$f(y)-f(x)=\sum_{1\le i \le n}\frac{df(x)}{dx_i}\varepsilon_i+O(\Delta^2) $$

    Чтобы получить асимптотическое (при $$\Delta \to 0$$ ) выражение для нотны, достаточно найти максимум и минимум линейной функции (главного линейного члена) на кубе, заданном неравенствами (1).

    Легко видеть, что максимум достигается, если положить

    $$\varepsilon_i=\begin{cases} \Delta, \frac {df(x)}{dx_i}\ge0\\ -\Delta, \frac{df(x)}{dx_i}<0 \end{cases} $$

    а минимум, отличающийся от максимума только знаком, достигается при $$\varepsilon_i=-\varepsilon_i$$. Следовательно, нотна с точностью до бесконечно малых более высокого порядка имеет вид

    $$N_f(x)=(\sum_{1 \le i \le n} |\frac{df(x)}{dx_i}|)\Delta$$

    Это выражение назовем асимптотической нотной.

    Условие (1) означает, что исходные данные представляются статистику в виде интервалов $$[y_i-\Delta; y_i+\Delta], i=1,2, \dots, n$$ (отсюда и название этого научного направления). Ограничения на погрешности могут задаваться разными способами - кроме абсолютных ошибок используются относительные или иные показатели различия между x и y.

    Если задана не предельная абсолютная погрешность $$\Delta$$, а предельная относительная погрешность $$\delta$$, т.е. ограничения на погрешности вошедших в выборку результатов измерений имеют вид

    $$|\varepsilon_i|\le \delta|x_i|, i=1,2,\dots, n$$

    то аналогичным образом получаем, что нотна с точностью до бесконечно малых более высокого порядка, т.е. асимптотическая нотна, имеет вид

    $$N_f(x)=(\sum_{1 \le i \le n}| x_i \frac{df(x)}{dx_i}|)\delta $$

    При практическом использовании рассматриваемой концепции необходимо провести в расчетных формулах тотальную замену символов x на символы y. В каждом конкретном случае удается показать, что в силу малости погрешностей разность $$N_f(y)-n_f(x) $$ является бесконечно малой более высокого порядка сравнительно с $$N_f(x)$$ или $$N_f(y) $$

    Основные результаты в вероятностной модели. В классической вероятностной модели элементы исходной выборки $$x_1, x_2 , \dots, x_n$$ рассматриваются как независимые одинаково распределенные случайные величины. Как правило, существует некоторая константа C > 0 такая, что в смысле сходимости по вероятности

    $$\lim_{n \to \infty} N_f(x)=C\Delta$$

    Соотношение (2) доказывается отдельно для каждой конкретной задачи.

    При использовании классических статистических методов в большинстве случаев используемая статистика $$f(x) $$ является асимптотически нормальной. Это означает, что существуют константы а и $$\sigma^2$$ такие, что

    $$\lim_{n \to \infty} P\left( \sqrt n \frac{f(x)-a}{\sigma}<x \right)=Ф(x) $$

    где $$Ф(х) $$ - функция стандартного нормального распределения с математическим ожиданием 0 и дисперсией 1. При этом обычно оказывается, что

    $$\lim_{n \to \infty} \sqrt n (Mf(x)-a)=0$$

    и

    $$\lim_{n \to \infty} nDf(x)= \sigma^2$$

    а потому в классической прикладной математической статистике средний квадрат ошибки статистической оценки равен

    $$M(f(x)-a)^2=(Mf(x)-a)^2+Df(x)=\frac{\sigma^2}{n}$$

    с точностью до членов более высокого порядка.

    В статистике интервальных данных ситуация совсем иная - обычно можно доказать, что средний квадрат ошибки равен

    $$max_{\{\varepsilon\}} M(f(x)-a)^2=\frac{\sigma^2}{n}+n_f^2(y)+o(\Delta^2+\frac {1}{n})$$

    Из соотношения (3) можно сделать ряд важных следствий. Прежде всего, отметим, что правая часть этого равенства, в отличие от правой части соответствующего классического равенства, не стремится к 0 при безграничном возрастании объема выборки. Она остается больше некоторого положительного числа, а именно, квадрата нотны. Следовательно, статистика $$f(x) $$ не является состоятельной оценкой параметра a. Более того, состоятельных оценок вообще не существует.

    Пусть доверительным интервалом для параметра a, соответствующим заданной доверительной вероятности $$\gamma$$, в классической математической статистике является интервал $$(c_n(\gamma); d_n(\gamma)) $$ В статистике интервальных данных аналогичный доверительный интервал является более широким. Он имеет вид $$(c_n(\gamma )-N_f(y); d_n(\gamma )+N_f(y))$$.Таким образом, его длина увеличивается на две нотны. Следовательно, при увеличении объема выборки длина доверительного интервала не может стать меньше, чем $$2C\Delta$$ (см. формулу (2)).

    В статистике интервальных данных методы оценивания параметров имеют другие свойства по сравнению с классической математической статистикой. Так, при больших объемах выборок метод моментов может быть заметно лучше, чем метод максимального правдоподобия (т.е. иметь меньший средний квадрат ошибки - см. формулу (3)), в то время как в классической математической статистике второй из названных методов всегда не хуже первого. Именно так обстоит дело при оценивании параметров гамма-распределения.

    Рациональный объем выборки. Анализ формулы (3) показывает, что в отличие от классической математической статистики нецелесообразно безгранично увеличивать объем выборки, поскольку средний квадрат ошибки остается всегда большим квадрата нотны. Поэтому представляется полезным ввести понятие "рационального объема выборки" $$n_{rat}$$, при достижении которого продолжать наблюдения нецелесообразно.

    Как установить "рациональный объем выборки"? Можно воспользоваться идеей "принципа уравнивания погрешностей", выдвинутой в монографии [2]. Речь идет о том, что вклад погрешностей различной природы в общую погрешность должен быть примерно одинаков. Этот принцип дает возможность выбирать необходимую точность оценивания тех или иных характеристик в тех случаях, когда это зависит от исследователя. В статистике интервальных данных в соответствии с "принципом уравнивания погрешностей" предлагается определять рациональный объем выборки nrat из условия равенства двух слагаемых - метрологической составляющей, связанной с нотной, и статистической составляющей - в среднем квадрате ошибки (3), т.е. из условия

    $$\frac{\sigma^2}{n_{rat}}=N_f^2(y), n_{rat}=\frac{\sigma^2}{N_f^2(y)}$$

    Для практического использования выражения для рационального объема выборки неизвестные теоретические характеристики необходимо заменить их оценками. Это делается в каждой конкретной задаче по-своему.

    Исследовательскую программу в области статистики интервальных данных можно "в двух словах" сформулировать так: для любого алгоритма анализа данных (алгоритма прикладной статистики) необходимо вычислить нотну и рациональный объем выборки. Или иные величины из того же понятийного ряда, возникающие в многомерном случае, при наличии нескольких выборок и при иных обобщениях описываемой здесь простейшей схемы. Затем проследить влияние погрешностей исходных данных на точность оценивания, доверительные интервалы, значения статистик критериев при проверке гипотез, уровни значимости и другие характеристики статистических выводов. Очевидно, классическая математическая статистика является частью статистики интервальных данных, выделяемой условием $$\Delta=0$$.

    Нечеткие множества

    Пусть $$A$$ - некоторое множество. Подмножество $$B$$ множества $$A$$ характеризуется своей характеристической функцией

    $$\mu_B(x)=\begin{cases} 1, x\in B,\\ 0, x \notin B \end{cases} $$

    Что такое нечеткое множество? Обычно говорят, что нечеткое подмножество $$C$$ множества $$A$$ характеризуется своей функцией принадлежности $$\mu_c \to[0,1] $$ Значение функции принадлежности в точке х показывает степень принадлежности этой точки нечеткому множеству. Нечеткое множество описывает неопределенность, соответствующую точке х - она одновременно и входит, и не входит в нечеткое множество $$С$$. За вхождение - $$\mu_c(x) $$ шансов, за второе - $$(1- \mu_c(x)) $$ шансов.

    Если функция принадлежности $$\mu_C(x)$$ имеет вид (4) при некотором B, то $$C$$ есть обычное (четкое) подмножество $$A$$. Таким образом, теория нечетких множеств является не менее общей математической дисциплиной, чем обычная теория множеств, поскольку обычные множества - частный случай нечетких.

    Соответственно можно ожидать, что теория нечеткости как целое обобщает классическую математику. Однако еще в 1970-х годах установлено, что теория нечеткости в определенном смысле сводится к теории случайных множеств и тем самым является частью классической математики. Другими словами, по степени общности обычная математика и нечеткая математика эквивалентны. Однако для практического применения в теории принятия решений описание и анализ неопределенностей с помощью теории нечетких множеств весьма плодотворны.

    Обычное подмножество можно было бы отождествить с его характеристической функцией. Этого математики не делают, поскольку для задания функции (в ныне принятом подходе) необходимо сначала задать множество. Нечеткое же подмножество с формальной точки зрения можно отождествить с его функцией принадлежности. Однако термин "нечеткое подмножество" предпочтительнее при построении математических моделей реальных явлений.

    Теория нечеткости является обобщением интервальной математики. Действительно, функция принадлежности

    $$\mu_B(x)=\begin{cases} 1, x \in [a,b]\\ 0, x \notin [a,b] \end{cases} $$

    задает интервальную неопределенность - про рассматриваемую величину известно лишь, что она лежит в заданном интервале $$[a,b] $$. Тем самым описание неопределенностей с помощью нечетких множеств является более общим, чем с помощью интервалов.

    Начало современной теории нечеткости положено работой 1965 г. американского ученого азербайджанского происхождения Л.А. Заде. К настоящему времени по этой теории опубликованы тысячи книг и статей, издается несколько международных журналов, выполнено достаточно много как теоретических, так и прикладных работ. Первая книга российского автора по теории нечеткости вышла в 1980 г.

    Сам Л.А. Заде рассматривал теорию нечетких множеств как аппарат анализа и моделирования гуманистических систем, т.е. систем, в которых участвует человек. Его подход опирается на предпосылку о том, что элементами мышления человека являются не числа, а элементы некоторых нечетких множеств или классов объектов, для которых переход от "принадлежности" к "непринадлежности" не скачкообразен, а непрерывен. В настоящее время методы теории нечеткости используются почти во всех прикладных областях, в том числе при управлении предприятием, качеством продукции и технологическими процессами.

    Л.А. Заде использовал термин "fuzzy set" (нечеткое множество). На русский язык термин "fuzzy" переводили как нечеткий, размытый, расплывчатый, и даже как пушистый и туманный.

    Аппарат теории нечеткости громоздок. В качестве примера дадим определения теоретико-множественных операций над нечеткими множествами. Пусть $$C$$ и $$D$$ - два нечетких подмножества $$A$$ с функциями принадлежности $$\mu_C(x) $$ и $$\mu_D(x) $$ соответственно. Пересечением $$C\bigcap D$$, произведением $$CD$$, объединением $$C\bigcupD$$, отрицанием $$\bar C$$, суммой $$C+D$$ называются нечеткие подмножества $$A$$ с функциями принадлежности

    $$\mu_{C\bigcap D}=min(\mu_C(x), \mu_D(x)), \mu_{CD}(x)=\mu_C(x)\mu_D(x), \mu_{\bar C}=1-\mu_C(x),\\ \mu_{C\bigcupD}=max(\mu_C(x), \mu_D(x)), \mu_{C+D}(x)=\mu_C(x)+\mu_D(x)-\mu_C(x)\mu_D(x), x \in A $$

    соответственно.

    Как уже отмечалось, теория нечетких множеств в определенном смысле сводится к теории вероятностей, а именно, к теории случайных множеств. Однако при решении прикладных задач вероятностно-статистические методы и методы теории нечеткости обычно рассматриваются как различные.

    Для знакомства со спецификой нечетких множеств рассмотрим некоторые их свойства.

    В дальнейшем считаем, что все рассматриваемые нечеткие множества являются подмножествами одного и того же множества $$Y$$.

    Законы де Моргана для нечетких множеств. Как известно, законами де Моргана называются следующие тождества алгебры множеств

    $$\overline {A\bigcap B}= \bar A \bigcup \bar B, \overline {A\bigcup B}= \bar A \bigcap \bar B$$

    Теорема 1. Для нечетких множеств справедливы тождества

    $$\overline {A\bigcap B}=\bar A \bigcup \bar B, \overline {A \bigcup B}=\bar A \bigcap \bar B$$ $$\overline {A+B}=\bar A \bar B, \overline {AB}=\bar A+\bar B$$

    Доказательство теоремы 1 состоит в непосредственной проверке справедливости соотношений (6) и (7) путем вычисления значений функций принадлежности участвующих в этих соотношениях нечетких множеств на основе определений, данных выше.

    Тождества (6) и (7) назовем законами де Моргана для нечетких множеств. В отличие от классического случая соотношений (5), они состоят из четырех тождеств, одна пара которых относится к операциям объединения и пересечения, а вторая - к операциям произведения и суммы. Как и соотношения (5) в алгебре множеств, законы де Моргана в алгебре нечетких множеств позволяют преобразовывать выражения и формулы, в состав которых входят операции отрицания.

    Дистрибутивный закон для нечетких множеств. Некоторые свойства операций над множествами не выполнены для нечетких множеств. Так, $$A+A \ne A$$ за исключением случая, когда $$А$$ - "четкое" множество (т.е. функция принадлежности принимает только значения 0 и 1).

    Верен ли дистрибутивный закон для нечетких множеств? В литературе иногда расплывчато утверждается, что "не всегда". Внесем полную ясность.

    Теорема 2. Для любых нечетких множеств $$А$$, $$В$$ и $$С$$

    $$A \bigcap (B\bigcup C)=(A \bigcap B) \bigcup(A \bigcap C)$$

    В то же время равенство

    $$A(B+C)=AB+AC$$

    справедливо тогда и только тогда, когда при всех $$y \inY$$

    $$_\mu_A^2(y)-\mu_A(y))\mu_B(y)\mu_C(y)=0$$

    Доказательство. Фиксируем произвольный элемент $$y \inY$$. Для сокращения записи обозначим $$a=\mu_A(y), b=\mu_B(y), c=\mu_C(y) $$ Для доказательства тождества (8) необходимо показать, что

    $$min(a, max(b,c))=max(min(a,b), min(a,c))$$

    Рассмотрим различные упорядочения трех чисел $$a, b, c$$. Пусть сначала $$a\le b\le c$$ Тогда левая часть соотношения (10) есть $$min(a,c)=a$$ а правая $$max(a,a)=a$$ т.е. равенство (10) справедливо.

    Пусть $$b\le a\le c$$ Тогда в соотношении (10) слева стоит $$min(a,c)=a$$ а справа $$max(b,a)=a$$ т.е. соотношение (10) опять является равенством.

    Если $$b\le c\le a$$ то в соотношении (10) слева стоит $$min(a,c)=c$$ а справа $$max(b,c)=c$$ т.е. обе части снова совпадают.

    Три остальные упорядочения чисел a, b, c разбирать нет необходимости, поскольку в соотношение (10) числа b и c входят симметрично. Тождество (8) доказано.

    Второе утверждение теоремы 2 вытекает из того, что в соответствии с определениями операций над нечеткими множествами

    $$\mu_{A(B+C)}(y)=a(b+c-bc)=ab+ac-abc$$

    и

    $$\mu_{AB+AC}(y)=ab+ac-(ab)(ac)=ab+ac-a^2bc$$

    Эти два выражения совпадают тогда и только тогда, когда $$a^2bc=abc$$ что и требовалось доказать.

    Определение 1. Носителем нечеткого множества $$А$$ называется совокупность всех точек $$y \inY$$, для которых $$\mu_A(y)>0$$

    Следствие теоремы 2. Если носители нечетких множеств В и С совпадают с У, то равенство (9) имеет место тогда и только тогда, когда А - "четкое" (т.е. обычное, классическое, не нечеткое) множество.

    Доказательство. По условию $$\mu_B(y)\mu_C(y)\ne0$$ при всех $$y \inY$$. Тогда из теоремы 2 следует, что $$\mu_A^2(y)-\mu_A(y)=0$$ т.е. $$\mu_A(y)=1$$ или $$\mu_A(y)=0$$, что и означает, что $$А$$ - четкое множество.

    Пример описания неопределенности с помощью нечеткого множества. Понятие "богатый" часто используется при обсуждении социально-экономических проблем, в том числе и в связи с подготовкой и принятием решений. Однако очевидно, что разные лица вкладывают в это понятие различное содержание. Сотрудники Института высоких статистических технологий и эконометрики провели в 1996 г. социологическое исследование представления различных слоёв населения о понятии "богатый человек".

    Мини-анкета опроса выглядела так:

  • При каком месячном доходе (в млн. руб. на одного человека) Вы считали бы себя богатым человеком?
  • Оценив свой сегодняшний доход, к какой из категорий Вы себя относите:
  • богатые;
  • достаток выше среднего;
  • достаток ниже среднего;
  • бедные;
  • за чертой бедности?
  • (В дальнейшем вместо полного наименования категорий будем оперировать буквами, например "в" - категория, "б" - категория и т.д.)
  • Ваша профессия, специальность.
  • Всего было опрошено 74 человека, из них 40 - научные работники и преподаватели, 34 человека - не занятых в сфере науки и образования, в том числе 5 рабочих и 5 пенсионеров. Из всех опрошенных только один (!) считает себя богатым. Несколько типичных ответов научных работников и преподавателей приведено в табл. 9.1, а аналогичные сведения для работников коммерческой сферы - в табл.9.2.

    Типичные ответы научных работников и преподавателей
    Ответы на вопрос 3 Ответы на вопрос 1, млн. руб./чел. Ответы на вопрос 2 Пол
    Кандидат наук 1 д ж
    Преподаватель 1 в ж
    Доцент 1 б ж
    Учитель 10 в м
    Старший. научный сотрудник 10 д м
    Инженер-физик 24 д ж
    Программист 25 г м
    Научный работник 45 г м
    Типичные ответы работников коммерческой сферы
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Вице-президент банка 100 а ж
    Зам. директора банка 50 б ж
    Начальник. кредитного отдела 50 б м
    Начальник отдела ценных бумаг 10 б м
    Главный бухгалтер 20 д ж
    Бухгалтер 15 в ж
    Менеджер банка 11 б м
    Начальник отдела проектирования 10 в ж

    Разброс ответов на первый вопрос - от 1 до 100 млн. руб. в месяц на человека. Результаты опроса показывают, что критерий богатства у финансовых работников в целом несколько выше, чем у научных (см. гистограммы на. рис 9.1 и рис.9.29.2 ниже).

    Опрос показал, что выявить какое-нибудь конкретное значение суммы, которая необходима "для полного счастья", пусть даже с небольшим разбросом, нельзя, что вполне естественно. Как видно из таблиц 9.1 и 9.2, денежный эквивалент богатства колеблется от 1 до 100 миллионов рублей в месяц. Подтвердилось мнение, что работники сферы образования в подавляющем большинстве причисляют свой достаток к категории "в" и ниже (81% опрошенных), в том числе к категории "д" отнесли свой достаток 57%.

    Со служащими коммерческих структур и бюджетных организаций иная картина: "г" - категория 1 человек (4%), "д" - категория 4 человека (17%), "б" - категория - 46% и 1 человек "а" - категория.

    Пенсионеры, что не вызывает удивления, отнесли свой доход к категории "д" (4 человека), и лишь один человек указал "г" - категорию. Рабочие же ответили так: 4 человека - "в", и один человек - "б".

    Для представления общей картины в табл. 9.3 приведены данные об ответах работников других профессий.

    Типичные ответы работников различных профессий
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Работник торговли 1 б ж
    Дворник 2 в ж
    Водитель 10 в м
    Военнослужащий 10 в м
    Владелец бензоколонки 20 б ж
    Пенсионер 6 д ж
    Начальник фабрики 20 б м
    Хирург 5 в м
    Домохозяйка 10 в ж
    Слесарь-механик 25 в м
    Юрист 10 б м
    Оператор ЭВМ 20 д м
    Работник собеса 3 д ж
    Архитектор 25 б ж

    Прослеживается интересное явление: чем выше планка богатства для человека, тем к более низкой категории относительно этой планки он себя относит.

    Для сводки данных естественно использовать гистограммы. Для этого необходимо сгруппировать ответы. Использовались 7 классов (интервалов):

    1 - до 5 миллионов рублей в месяц на человека (включительно);

    2 - от 5 до 10 миллионов;

    3- от 10 до 15 миллионов;

    4 - от 15 до 20 миллионов;

    5 - от 20 до 25 миллионов;

    6 - от 25 до 30 миллионов;

    7 - более 30 миллионов.

    (Во всех интервалах левая граница исключена, а правая, наоборот - включена.)

    Сводная информация представлена на рис. 9.1 (для научных работников и преподавателей) и рис. 9.2 (для всех остальных, т.е. для лиц, не занятых в сфере науки и образования - служащих иных бюджетных организаций, коммерческих структур, рабочих, пенсионеров).

    (рис 9.1) Гистограмма ответов на вопрос 1 для научных работников и преподавателей (40 человек) (рис 9.2) Гистограмма ответов на вопрос 1 для лиц, не занятых в сфере науки и образования (34 человека).

    Для двух выделенных групп, а также для некоторых подгрупп второй группы рассчитаны сводные средние характеристики - выборочные средние арифметические, медианы, моды. При этом медиана группы - количество млн. руб., названное центральным по порядковому номеру опрашиваемым в возрастающем ряду ответов на вопрос 1, а мода группы - интервал, на котором столбик гистограммы - самый высокий, т.е. в него "попало" максимальное количество опрашиваемых. Результаты приведены в табл. 9.4.

    Сводные средние характеристики ответов на вопрос 1 для различных групп (в млн. руб. в мес. на чел.)
    Группа опрошенных Среднее арифметическое медиана мода
    Научные работники и преподаватели 11,66 7,25 (5; 10)
    Лица, не занятые в сфере науки и образования 14,4 10 (5; 10)
    Служащие коммерческих структур и бюджетных организаций 17,91 10 (5; 10)
    Рабочие 15 13 -
    Пенсионеры 10,3 10

    Построим нечеткое множество, описывающее понятие "богатый человек" в соответствии с представлениями опрошенных. Для этого составим табл. 9.5 на основе рис. 9.1 и рис. 9.2 с учетом размаха ответов на первый вопрос.

    Число ответов, попавших в интервалы
    Номер интервала 0 1 2 3 4 5 6 7 8
    1 Интервал, млн. руб. в месяц (0;1) [1;5] (5;10] (10;15] (15;20] (20;25] (25;30] (30;100) [100;+?)
    2 Число ответов в интервале 0 19 21 13 5 6 7 2 1
    3 Доля ответов в интервале 0 0,257 0,284 0,176 0.068 0,081 0,095 0,027 0,013
    4 Накопленное число ответов 0 19 40 53 58 64 71 73 74
    5 Накопленная доля ответов 0 0,257 0,541 0,716 0,784 0,865 0,960 0,987 1,000

    Пятая строка табл. 9.5 задает функцию принадлежности нечеткого множества, выражающего понятие "богатый человек" в терминах его ежемесячного дохода. Это нечеткое множество является подмножеством множества из 9 интервалов, заданных в строке 2 табл. 9.5. Или множества из 9 условных номеров $${0, 1, 2, \dots, 8}$$. Эмпирическая функция распределения, построенная по выборке из ответов 74 опрошенных на первый вопрос мини-анкеты, описывает понятие "богатый человек" как нечеткое подмножество положительной полуоси.

    О разработке методики ценообразования на основе теории нечетких множеств. Для оценки значений показателей, не имеющих количественной оценки, можно использовать методы нечетких множеств. Например, в работе П.В. Битюкова нечеткие множества применялись при моделировании задач ценообразования на электронные обучающие курсы, используемые при дистанционном обучении. Им было проведено исследование значений фактора "Уровень качества курса" с использованием нечетких множеств. В ходе практического использования предложенной П.В. Битюковым методики ценообразования значения ряда других факторов могут также определяться с использованием теории нечетких множеств. Например, ее можно использовать для определения прогноза рейтинга специальности в вузе с помощью экспертов, а также значений других факторов, относящихся к группе "Особенности курса". Опишем подход П.В. Битюкова как пример практического использования теории нечетких множеств.

    Значение оценки, присваиваемой каждому интервалу для фактора "Уровень качества курса", определяется на универсальной шкале [0,1], где необходимо разместить значения лингвистической переменной "Уровень качества курса": НИЗКИЙ, СРЕДНИЙ, ВЫСОКИЙ. Степень принадлежности некоторого значения вычисляется как отношение числа ответов, в которых оно встречалось в определенном интервале шкалы, к максимальному (для этого значения) числу ответов по всем интервалам.

    Был проведен опрос экспертов о степени влияния уровня качества электронных курсов на их потребительную ценность. Каждому эксперту в процессе опроса предлагалось оценить с позиции потребителя ценность того или иного класса курсов в зависимости от уровня качества. Эксперты давали свою оценку для каждого класса курсов по 10-ти балльной шкале (где 1 - min, 10 - max). Для перехода к универсальной шкале [0,1], все значения 10-ти балльной шкалы оценки ценности были разделены на максимальную оценку 10.

    Используя свойства функции принадлежности, необходимо предварительно обработать данные с тем, чтобы уменьшить искажения, вносимые опросом. Естественными свойствами функций принадлежности являются наличие одного максимума и гладкие, затухающие до нуля фронты. Для обработки статистических данных можно воспользоваться так называемой матрицей подсказок. Предварительно удаляются явно ошибочные элементы. Критерием удаления служит наличие нескольких нулей в строке вокруг этого элемента.

    Элементы матрицы подсказок вычисляются по формуле:

    $$k_j=\sum_{i=1}^nb_{ij}, j=\overline{1,n},$$

    где $$b_{ij}$$ - элемент таблицы с результатами анкетирования, сгруппированными по интервалам. Матрица подсказок представляет собой строку, в которой выбирается максимальный элемент: $$k_{max}=max_j k_j$$, и далее все ее элементы преобразуются по формуле:

    $$c_{ij}=\frac{b_{ij}k_{max}}{k_j}, i=\overline {1,m}, j=\overline {1,n}$$

    Для столбцов, где $$k_j=0$$, применяется линейная аппроксимация:

    $$c_{ij}=\frac{c_{ij-1}+c_{ij+1}}{2}, i=\overline {1,m}, j=\overline {1,n}$$

    Результаты расчетов сводятся в таблицу, на основании которой строятся функции принадлежности. Для этого находятся максимальные элементы по строкам: $$c_{imax}=max_j c_{ij}, i=\overline {1,m}, j=\overline {1,n}$$. Функция принадлежности вычисляется по формуле: $$\mu_{ij}=c_{ij}/c_{imax}$$. Результаты расчетов приведены в табл. 9.6.

    Значения функции принадлежности лингвистической переменной
    Интервал на универсальной шкале
    $$\mu_i$$ 0 1,2 1 1 0.89 0 0 0 0
    $$\mu_1$$ 0 0 0 0 0 0,33 1 1 1 0
    $$\mu_2$$ 0 0 0 0 0 0,33 1 1 0 0
    $$\mu_3$$ 0 0 0 0 0 0 0 0 1 1
    (рис 9.3) График функций принадлежности значений лингвистической переменной "Уровень качества курса".

    На рис. 9.3 сплошными линиями показаны функции принадлежности значений лингвистической переменной "Уровень качества курса" после обработки таблицы, содержащей результаты опроса. Как видно из графика, функции принадлежности удовлетворяют описанным выше свойствам. Для сравнения пунктирной линией показана функция принадлежности лингвистической переменной для значения НИЗКИЙ без обработки данных.

    О статистике нечетких множеств. Нечеткие множества - частный вид объектов нечисловой природы. Статистические методы анализа объектов нечисловой природы описаны в. В частности, среднее значение нечеткого множества можно определить по формуле:

    $$M(A)=\frac{\sum_{i=1}^n x_i\mu_A(x_i)}{\sum_{i=1}^n \mu_A(x_i)}$$

    где $$\mu_A(x_i) $$ - функция принадлежности нечеткого множества $$A$$.

    Как известно, методы статистики нечисловых данных базируются на использовании расстояний (или показателей различия) в соответствующих пространствах нечисловой природы. Расстояние между нечеткими подмножествами $$А$$ и $$В$$ множества $$Х = \{x1, x2, \dots, x_k\}$$ можно определить как

    $$d(A,B)=\sum_{j=1}^k |\mu_A(x_j)- \mu_B(x_j)|$$

    где $$\mu_A(x_j)$$ - функция принадлежности нечеткого множества $$A$$, а $$\mu_B(x_j) $$ - функция принадлежности нечеткого множества $$B$$. Может использоваться и другое расстояние:

    $$d_1(A,B)=\frac{\sum_{j=1}^k|\mu_A(x_j)-\mu_B(x_j)|}{\sum_{j=1}^k(\mu_A(x_j)+\mu_B(x_j))}$$

    (Примем это расстояние равным 0, если функции принадлежности тождественно равны 0.)

    В соответствии с аксиоматическим подходом к выбору расстояний (метрик) в пространствах нечисловой природы разработан обширный набор систем аксиом, из которых выводится тот или иной вид расстояний (метрик) в конкретных пространствах. При использовании вероятностных моделей расстояние между случайными нечеткими множествами само является случайной величиной, имеющей в ряде постановок асимптотически нормальное распределение.

    В эконометрике разработан ряд методов статистического анализа нечетких данных, в том числе методы классификации, регрессии, проверки гипотез о совпадении функций принадлежности по опытным данным и т.д., при этом оказались полезными общие подходы статистики объектов нечисловой природы, основанные на использовании расстояний в выборочных пространствах.

    Нечеткие множества как проекции случайных множеств. С самого начала появления современной теории нечеткости в 1960-е годы началось обсуждение ее взаимоотношений с теорией вероятностей. Дело в том, что функция принадлежности нечеткого множества напоминает распределение вероятностей. Отличие только в том, что сумма вероятностей по всем возможным значениям случайной величины (или интеграл, если множество возможных значений несчетно) всегда равна 1, а сумма $$S$$ значений функции принадлежности (в непрерывном случае - интеграл от функции принадлежности) может быть любым неотрицательным числом. Возникает искушение пронормировать функцию принадлежности, т.е. разделить все ее значения на $$S$$ (при $$S \ne0$$ ), чтобы свести ее к распределению вероятностей (или к плотности вероятности). Однако специалисты по нечеткости справедливо возражают против такого "примитивного сведения", поскольку оно проводится отдельно для каждой размытости (нечеткого множества), и определения обычных операций над нечеткими множествами с ним согласовать нельзя. Последнее утверждение означает следующее. Пусть указанным образом преобразованы функции принадлежности нечетких множеств $$А$$ и $$В$$. Как при этом преобразуются функции принадлежности $$A\bigcap B, A\bigcup B, A+B, AB$$? Установить это невозможно в принципе. Последнее утверждение становится совершенно ясным после рассмотрения нескольких примеров пар нечетких множеств с одними и теми же суммами значений функций принадлежности, но различными результатами теоретико-множественных операций над ними, причем и суммы значений соответствующих функций принадлежности для этих результатов теоретико-множественных операций, например, для пересечений множеств, также различны.

    В работах по нечетким множествам довольно часто утверждалось, что теория нечеткости является самостоятельным разделом прикладной математики и не имеет отношения к теории вероятностей. Авторы, сравнивавшие теорию нечеткости и теорию вероятностей, обычно подчеркивали различие между этими областями теоретических и прикладных исследований. Обычно сравнивают аксиоматику и сравнивают области приложений. Надо сразу отметить, что аргументы при втором типе сравнений не имеют доказательной силы, поскольку по поводу границ применимости даже такой давно выделившейся научной области, как вероятностно-статистические методы, имеются различные мнения. Напомним, что итог рассуждений одного из наиболее известных французских математиков Анри Лебега по поводу границ применимости арифметики таков: "Арифметика применима тогда, когда она применима".

    При сравнении различных аксиоматик теории нечеткости и теории вероятностей нетрудно увидеть, что списки аксиом различаются. Из этого, однако, отнюдь не следует, что между указанными теориями нельзя установить связь, типа известного сведения евклидовой геометрии на плоскости к арифметике. Напомним, что эти две аксиоматики - евклидовой геометрии и арифметики - на первый взгляд весьма сильно различаются.

    Можно понять желание энтузиастов нового направления подчеркнуть принципиальную новизну своего научного аппарата. Однако не менее важно установить связи нового подхода с ранее известными.

    Как оказалось, теория нечетких множеств тесно связана с теорией случайных множеств. Еще в 1970-х годах было показано, что нечеткие множества естественно рассматривать как "проекции" случайных множеств. Рассмотрим основную идею этого метода сведения теории нечетких множеств к теории случайных множеств.

    Определение 2. Пусть $$A=A(\omega) $$ - случайное подмножество конечного множества У. Нечеткое множество В, определенное на $$У$$, называется проекцией $$А$$ и обозначается Proj A, если

    $$\mu_B(y)=P(y \in A)$$

    при всех $$y\in Y$$

    Очевидно, каждому случайному множеству А можно поставить в соответствие с помощью формулы (11) его проекцию - нечеткое множество В = Proj A. Оказывается, верно и обратное - любое нечеткое множество является проекцией некоторого случайного.

    Цель сведения теории нечетких множеств к теории случайных множеств состоит в том, чтобы за любой конструкцией из нечетких множеств увидеть конструкцию из случайных множеств, определяющую свойства первой, аналогично тому, как за плотностью распределения вероятностей мы видим случайную величину. Сведение теории нечетких множеств к теории случайных теорем реализовано в виде системы теорем.

    Методологические, теоретические и прикладные вопросы теории нечеткости обсуждаются в многочисленных литературных источниках.

    Контрольные вопросы и задачи

  • Расскажите о понятиях случайного события и его вероятности.
  • Чем многомерный статистический анализ отличается от статистики объектов нечисловой природы?
  • Покажите на примерах, что в задачах принятия решений исходные данные часто имеют интервальный характер.
  • В чем особенности подхода статистики интервальных данных в задачах оценивания параметров?
  • Выполните операции над интервальными числами:

    а) $$[1,2]+[3,4]$$, б) $$[4,5]-[2,3]$$, в) $$[3,4]\times[5,7]$$, г) $$[10,20]:[4,5]$$ ;

    д) $$[0,2]+[3,5]$$, е) $$[3,5]-[2,4]$$, ж) $$[2,4]\times[5,8]$$, з) $$[15,25]:[1,5]$$.

  • Выпишите формулу для асимптотической нотны (ошибки по абсолютной величине не превосходят константы t, предполагающейся малой) для функции

    $$f(x1,x2) = 5 (x1)2 + 10 (x2)2 + 7 x1x2$$

    Вычислите асимптотическую нотну в точке $$(x1, x2) = (1,2) при t = 0,1$$. Проделайте то же для функции

    $$f(x1,x2) = 4 (x1)2 + 12 (x2)2 - 3 x1x2$$

    Вычислите асимптотическую нотну в точке $$(x1, x2) = (2,1) при t = 0,05$$.

  • В каких случаях целесообразно применение нечетких множеств?
  • Справедливо ли для нечетких множеств равенство $$(A+B)C = AC + BC$$? А равенство $$(AB)C = (AC)(BC)$$?
  • Опишите с помощью нечеткого подмножества временной шкалы понятие "молодой человек".
  • Опишите с помощью теории нечеткости понятие "куча зерен".
  • Как можно проводить кластерный анализ совокупности нечетких множеств?
  • Темы докладов, рефератов, исследовательских работ

  • Описание данных с помощью гистограмм и непараметрических оценок плотности.
  • Сравнительный анализ методов оценивания параметров и характеристик.
  • Преимущества одношаговых оценок по сравнению с оценками метода максимального правдоподобия.
  • Методы проверки однородности для независимых и связанных выборок.
  • Непараметрический регрессионный анализ.
  • Структура статистики нечисловых данных.
  • Аксиоматическое введение метрик и их использование в статистике объектов нечисловой природы.
  • Законы больших чисел в пространствах произвольной природы.
  • Непараметрические оценки плотности в пространствах произвольной природы, в том числе в дискретных пространствах.
  • Оптимизационные постановки в вероятностно-статистических задачах принятия решений.
  • Основные идеи статистики интервальных данных.
  • Классическая математическая статистика как предельный случай статистики интервальных данных.
  • Концепция рационального объема выборки.
  • Сравнение методов оценивания параметров и характеристик распределений в статистике интервальных данных и в классической математической статистике.
  • Подход к проверке гипотез в статистике интервальных данных.
  • Метод наименьших квадратов для интервальных данных.
  • Различные способы учета погрешностей исходных данных в статистических процедурах.
  • Статистика интервальных данных как часть теории устойчивости (с использованием монографии [3]).
  • Обсудите суждение: "Мы мыслим нечетко". Почему нечеткость мышления помогает взаимопониманию?
  • Взаимосвязь теории нечеткости и теории вероятностей.
  • Методы оценивания функции принадлежности.
  • Теория нечеткости и интервальная математика.
  • Описание данных для выборок, элементы которых - нечеткие множества.
  • Регрессионный анализ нечетких переменных.
  • Непараметрические оценки плотности распределения вероятностей в пространстве нечетких множеств.
  • Страницы:

    Одна из основных проблем в теории принятия решений - необходимость учета неопределенностей, оценки и управления рисками. Для описания неопределенностей и рисков применяют различные подходы.

    Чаще всего используется вероятностно-статистический подход. Kратко обсуждаются основные понятия и результаты в области теории вероятностей и статистики.

    Изложение в настоящей главе доведено до современного уровня. Одним из наиболее интересных и продуктивных бурно развивающихся направлений теории принятия решений является анализ интервальных данных, согласно которому исходные данные - не числа, а интервалы. Таким образом, неопределенность величин, используемых в процессе принятия решения, моделируется путем замены конкретных численных значений на интервалы, в которых содержатся рассматриваемые величины.

    Интервальные данные - это частный случай нечетких данных. В последнее время теория нечеткости все чаще используется в экономических исследованиях. Нечеткость, расплывчатость, размытость понятий и величин - типичная черта многих задач принятия решений.Обратим внимание на систему принципиально важных утверждений, согласно которой теория нечеткости в определенном смысле сводится к теории случайных множеств - одной из частей вероятностно-статистической теории.

    Настоящая глава содержит введение в методы описания неопределенностей. За более подробной информацией необходимо обратиться к специальной литературе.

    Вероятностно-статистические методы описания неопределенностей

    Статистика - это наука о том, как обрабатывать данные. Статистические методы основаны на вероятностных моделях. Они активно применяются в технических исследованиях, экономике, теории и практике управления (менеджмента). А также в социологии, медицине, геологии, истории и т.д. С обработкой результатов наблюдений, измерений, испытаний, опытов, анализов имеют дело специалисты во всех отраслях практической деятельности, почти во всех областях научных исследований.

    Развитие наукоемких технологий, как правило, основано на применении высоких статистических технологий организации и управления производством. Особенно активно они используются в высокотехнологичных отраслях промышленности. Без вероятностно-статистических методов немыслимы оценка и анализ риска, страхование, финансовая деятельность. Инженеры, менеджеры, экономисты, социологи, врачи, психологи, историки успешно применяют интеллектуальные инструменты принятия решений, основанные на вероятности и статистике.

    Статистические методы и модели и их база - теория вероятностей - активно развиваются во всем мире. Американская статистическая ассоциация насчитывает более двадцати тысяч членов, Королевское статистическое общество - более десяти тысяч. Статьи по вероятности и статистике постоянно публикуются более чем в пятистах научных журналах. В университетах США статистических факультетов больше, чем математических и физических. Восемь нобелевских премий получены эконометриками (специалистами по статистическим методам в экономике).

    Современная теория вероятностей основана на аксиоматике академика АН СССР А.Н. Колмогорова. Однако в нашей стране специалисты и научные работники, студенты и преподаватели пока еще недостаточно знакомы с последними достижениями в области вероятностно-статистических методов, хотя ссылки на них постоянно встречаются в научно-технической, деловой и учебной литературе.

    Вероятность и статистика нужны всем. Теория вероятностей и математическая статистика - основа вероятностно-статистических методов обработки данных. А данные мы обрабатываем и анализируем прежде всего для принятия решений. Чтобы воспользоваться современным математическим аппаратом, необходимо рассматриваемые задачи выразить в терминах вероятностно-статистических моделей.

    Применение конкретного вероятностно-статистического метода состоит из трех этапов:

  • переход от экономической, управленческой, технологической реальности к абстрактной математико-статистической схеме, т.е. построение вероятностной модели системы управления, технологического процесса, процедуры принятия решений, в частности по результатам статистического контроля, и т.п.
  • проведение расчетов и получение выводов чисто математическими средствами в рамках вероятностной модели;
  • интерпретация математико-статистических выводов применительно к реальной ситуации и принятие соответствующего решения (например, о соответствии или несоответствии качества продукции установленным требованиям, необходимости наладки технологического процесса и т.п.), в частности, заключения (о доле дефектных единиц продукции в партии, о конкретном виде законов распределения контролируемых параметров технологического процесса и др.).
  • Математическая статистика использует понятия, методы и результаты теории вероятностей. Далее рассматриваем основные вопросы построения вероятностных моделей в экономических, управленческих, технологических и иных ситуациях. Подчеркнем, что для активного и правильного использования нормативно-технических и инструктивно-методических документов (инструкций, методик, правил, стандартов, справочников, учебников и т.п.) по вероятностно-статистическим методам нужны предварительные знания. Так, необходимо знать, при каких условиях следует применять тот или иной документ, какую исходную информацию необходимо иметь для его выбора и применения, какие решения должны быть приняты по результатам обработки данных и т.д.

    Примеры применения теории вероятностей и математической статистики.Рассмотрим несколько примеров, когда вероятностно-статистические модели являются хорошим инструментом для решения управленческих, производственных, экономических, народнохозяйственных задач. Так, например, в романе А.Н.Толстого "Хождение по мукам" (т.1) говорится: "Мастерская дает двадцать три процента брака, этой цифры вы и держитесь, - сказал Струков Ивану Ильичу".

    Как понимать эти слова в разговоре заводских менеджеров? Одна единица продукции не может быть дефектна на 23%. Она может быть либо годной, либо дефектной. Наверно, Струков имел в виду, что в партии большого объема содержится примерно 23% дефектных единиц продукции. Тогда возникает вопрос, а что значит "примерно"? Пусть из 100 проверенных единиц продукции 30 окажутся дефектными, или из 1000 - 300, или из 100000 - 30000 и т.д., надо ли обвинять Струкова во лжи?

    Или другой пример. Монетка, которую используют как жребий, должна быть "симметричной". При ее бросании в среднем в половине случаев должен выпадать герб (орел), а в половине случаев - решетка (решка, цифра). Но что означает "в среднем"? Если провести много серий по 10 бросаний в каждой серии, то часто будут встречаться серии, в которых монетка 4 раза выпадает гербом. Для симметричной монеты это будет происходить в 20,5% серий. А если на 100000 бросаний окажется 40000 гербов, то можно ли считать монету симметричной? Процедура принятия решений строится на основе теории вероятностей и математической статистики.

    Пример может показаться недостаточно серьезным. Однако это не так. Жеребьевка широко используется при организации промышленных технико-экономических экспериментов. Например, при обработке результатов измерения показателя качества (момента трения) подшипников в зависимости от различных технологических факторов (влияния консервационной среды, методов подготовки подшипников перед измерением, влияния нагрузки подшипников в процессе измерения и т.п.). Допустим, необходимо сравнить качество подшипников в зависимости от результатов хранения их в разных консервационных маслах, т.е. в маслах состава А и В. При планировании такого эксперимента возникает вопрос, какие подшипники следует поместить в масло состава А, а какие - в масло состава В, но так, чтобы избежать субъективизма и обеспечить объективность принимаемого решения. Ответ на этот вопрос может быть получен с помощью жребия.

    Аналогичный пример можно привести и с контролем качества любой продукции. Чтобы решить, соответствует или не соответствует контролируемая партия продукции установленным требованиям, из нее отбирается выборка. По результатам контроля выборки делается заключение о всей партии. В этом случае очень важно избежать субъективизма при формировании выборки, т.е. необходимо, чтобы каждая единица продукции в контролируемой партии имела одинаковую вероятность быть отобранной в выборку. В производственных условиях отбор единиц продукции в выборку обычно осуществляют не с помощью жребия, а по специальным таблицам случайных чисел или с помощью компьютерных датчиков случайных чисел.

    Похожие проблемы обеспечения объективности сравнения возникают при сопоставлении различных схем организации производства, оплаты труда, при проведении тендеров и конкурсов, подбора кандидатов на вакантные должности и т.п. Всюду нужна жеребьевка или подобные ей процедуры.

    Пусть надо выявить наиболее сильную и вторую по силе команду при организации турнира по олимпийской системе (проигравший выбывает). Допустим, что более сильная команда всегда побеждает более слабую. Ясно, что самая сильная команда однозначно станет чемпионом. Вторая по силе команда выйдет в финал тогда и только тогда, когда до финала у нее не будет игр с будущим чемпионом. Если такая игра запланирована, то вторая по силе команда в финал не попадет. Тот, кто планирует турнир, может либо досрочно "выбить" вторую по силе команду из турнира, сведя ее в первой же встрече с лидером, либо обеспечить ей второе место, обеспечив встречи с более слабыми командами вплоть до финала. Чтобы избежать субъективизма, проводят жеребьевку. Для турнира из 8 команд вероятность того, что в финале встретятся две самые сильные команды, равна 4/7. Соответственно с вероятностью 3/7 вторая по силе команда покинет турнир досрочно.

    При любом измерении единиц продукции (с помощью штангенциркуля, микрометра, амперметра и т.п.) имеются погрешности. Чтобы выяснить, есть ли систематические погрешности, необходимо сделать многократные измерения единицы продукции, характеристики которой известны (например, стандартного образца). При этом следует помнить, что кроме систематической погрешности присутствует и случайная погрешность.

    Поэтому встает вопрос, как по результатам измерений узнать, есть ли систематическая погрешность. Если отмечать только, является ли полученная при очередном измерении погрешность положительной или отрицательной, то эту задачу можно свести к уже рассмотренной. Действительно, сопоставим измерение с бросанием монеты, положительную погрешность - с выпадением герба, отрицательную - решетки (нулевая погрешность при достаточном числе делений шкалы практически никогда не встречается). Тогда проверка отсутствия систематической погрешности эквивалентна проверке симметричности монеты.

    Итак, задача проверки отсутствия систематической погрешности сведена к задаче проверки симметричности монеты. Проведенные рассуждения приводят к так называемому "критерию знаков" в математической статистике.

    При статистическом регулировании технологических процессов на основе методов математической статистики разрабатываются правила и планы статистического контроля процессов, направленные на своевременное обнаружение разладки технологических процессов и принятия мер к их наладке и предотвращению выпуска продукции, не соответствующей установленным требованиям. Эти меры нацелены на сокращение издержек производства и потерь от поставки некачественных единиц продукции. При статистическом приемочном контроле на основе методов математической статистики разрабатываются планы контроля качества путем анализа выборок из партий продукции. Сложность заключается в том, чтобы уметь правильно строить вероятностно-статистические модели принятия решений. В математической статистике для этого разработаны вероятностные модели и методы проверки гипотез, в частности, гипотез о том, что доля дефектных единиц продукции равна определенному числу р0, например, $$р_0 = 0,23$$ (вспомните слова Струкова из романа А.Н.Толстого).

    Задачи оценивания. В ряде управленческих, производственных, экономических, народнохозяйственных ситуаций возникают задачи другого типа - задачи оценки характеристик и параметров распределений вероятностей.

    Рассмотрим пример. Пусть на контроль поступила партия из $$N$$ электроламп. Из этой партии случайным образом отобрана выборка объемом n электроламп. Возникает ряд естественных вопросов. Как по результатам испытаний элементов выборки определить средний срок службы электроламп, с какой точностью можно оценить эту характеристику? Как изменится точность, если взять выборку большего объема? При каком числе часов Т можно гарантировать, что не менее 90% электроламп прослужат Т и более часов?

    Предположим, что при испытании выборки объемом n электроламп дефектными оказались Х электроламп. Какие границы можно указать для числа D дефектных электроламп в партии, для уровня дефектности $$D/N$$ и т.п.?

    Или при статистическом анализе точности и стабильности технологических процессов надлежит оценить такие показатели качества, как среднее значение контролируемого параметра и степень его разброса в рассматриваемом процессе. Согласно теории вероятностей в качестве среднего значения случайной величины целесообразно использовать ее математическое ожидание, а в качестве статистической характеристики разброса - дисперсию, среднее квадратическое отклонение или коэффициент вариации. Возникают вопросы: как оценить эти статистические характеристики по выборочным данным, с какой точностью это удается сделать?

    Аналогичных примеров можно привести очень много. Здесь важно было показать, как теория вероятностей и математическая статистика могут быть использованы в инженерных, экономических и управленческих задачах.

    Современное представление о математической статистике. Под математической статистикой понимают "раздел математики, посвященный математическим методам сбора, систематизации, обработки и интерпретации статистических данных, а также использованию их для научных или практических выводов. Правила и процедуры математической статистики опираются на теорию вероятностей, позволяющую оценить точность и надежность выводов, получаемых в каждой задаче на основании имеющегося статистического материала". При этом статистическими данными называются сведения о числе объектов в какой-либо более или менее обширной совокупности, обладающих теми или иными признаками.

    По типу решаемых задач математическая статистика обычно делится на три раздела: описание данных, оценивание и проверка гипотез.

    По виду обрабатываемых статистических данных математическая статистика делится на четыре направления:

  • одномерная статистика (статистика случайных величин), в которой результат наблюдения описывается действительным числом;
  • многомерный статистический анализ, где результат наблюдения над объектом описывается несколькими числами (вектором);
  • статистика случайных процессов и временных рядов, где результат наблюдения - функция;
  • статистика объектов нечисловой природы, в которой результат наблюдения имеет нечисловую природу, например, является множеством (геометрической фигурой), упорядочением или получен в результате измерения по качественному признаку.
  • Исторически первой появились некоторые области статистики объектов нечисловой природы (в частности, задачи оценивания доли брака и проверки гипотез о ней; первоначально говорилось об извлечении разноцветных шаров из урны) и одномерная статистика. Математический аппарат для них проще, поэтому на их примере обычно демонстрируют основные идеи математической статистики.

    Лишь те методы обработки данных, т.е. математической статистики, являются доказательными, которые опираются на вероятностные модели соответствующих реальных явлений и процессов. Речь идет о моделях поведения потребителей, возникновения рисков, функционирования технологического оборудования, получения результатов эксперимента, течения заболевания и т.п. Вероятностную модель реального явления следует считать построенной, если рассматриваемые величины и связи между ними выражены в терминах теории вероятностей. Соответствие вероятностной модели реальности, т.е. ее адекватность, обосновывают, в частности, с помощью статистических методов проверки гипотез.

    Невероятностные методы обработки данных являются поисковыми, их можно использовать лишь при предварительном анализе данных, так как они не дают возможности оценить точность и надежность выводов, полученных на основании ограниченного статистического материала.

    Вероятностные и статистические методы применимы всюду, где удается построить и обосновать вероятностную модель явления или процесса. Их применение обязательно, когда сделанные на основе выборочных данных выводы переносятся на всю совокупность (например, с выборки на всю партию продукции).

    В конкретных областях применений используются как вероятностно-статистические методы широкого применения, так и специфические. Например, в разделе производственного менеджмента, посвященного статистическим методам управления качеством продукции, используют прикладную математическую статистику (включая планирование экспериментов). С помощью ее методов проводится статистический анализ точности и стабильности технологических процессов и статистическая оценка качества. К специфическим методам относятся методы статистического приемочного контроля качества продукции, статистического регулирования технологических процессов, оценки и контроля надежности и др.

    Широко применяются такие прикладные вероятностно-статистические дисциплины, как теория надежности и теория массового обслуживания. Содержание первой из них ясно из названия, вторая занимается изучением систем типа телефонной станции, на которую в случайные моменты времени поступают вызовы - требования абонентов, набирающих номера на своих телефонных аппаратах. Длительность обслуживания этих требований, т.е. длительность разговоров, также моделируется случайными величинами. Большой вклад в развитие этих дисциплин внесли член-корреспондент АН СССР А.Я. Хинчин (1894-1959), академик АН УССР Б.В.Гнеденко (1912-1995) и другие отечественные ученые.

    Коротко об истории математической статистики. Математическая статистика как наука начинается с работ знаменитого немецкого математика Карла Фридриха Гаусса (1777-1855), который на основе теории вероятностей исследовал и обосновал метод наименьших квадратов, созданный им в 1795 г. и примененный для обработки астрономических данных (с целью уточнения орбиты малой планеты Церера). Его именем часто называют одно из наиболее популярных распределений вероятностей - нормальное, а в теории случайных процессов основной объект изучения - гауссовские процессы.

    В конце XIX в. - начале ХХ в. крупный вклад в математическую статистику внесли английские исследователи, прежде всего К.Пирсон (1857-1936) и Р.А.Фишер (1890-1962). В частности, Пирсон разработал критерий "хи-квадрат" проверки статистических гипотез, а Фишер - дисперсионный анализ, теорию планирования эксперимента, метод максимального правдоподобия оценки параметров.

    В 30-е годы ХХ в. поляк Ежи Нейман (1894-1977) и англичанин Э.Пирсон развили общую теорию проверки статистических гипотез, а советские математики академик А.Н. Колмогоров (1903-1987) и член-корреспондент АН СССР Н.В.Смирнов (1900-1966) заложили основы непараметрической статистики. В сороковые годы ХХ в. румын А. Вальд (1902-1950) построил теорию последовательного статистического анализа.

    Математическая статистика бурно развивается и в настоящее время. Так, за последние 40 лет можно выделить четыре принципиально новых направления исследований:

  • разработка и внедрение математических методов планирования экспериментов;
  • развитие статистики объектов нечисловой природы как самостоятельного направления в прикладной математической статистике;
  • развитие статистических методов, устойчивых по отношению к малым отклонениям от используемой вероятностной модели;
  • широкое развертывание работ по созданию компьютерных пакетов программ, предназначенных для проведения статистического анализа данных.
  • Вероятностно-статистические методы и оптимизация. Идея оптимизации пронизывает современную прикладную математическую статистику и иные статистические методы. А именно, методы планирования экспериментов, статистического приемочного контроля, статистического регулирования технологических процессов и др. С другой стороны, оптимизационные постановки в теории принятия решений, например, прикладная теория оптимизации качества продукции и требований стандартов, предусматривают широкое использование вероятностно-статистических методов, прежде всего прикладной математической статистики.

    В производственном менеджменте, в частности, при оптимизации качества продукции и требований стандартов особенно важно применять статистические методы на начальном этапе жизненного цикла продукции, т.е. на этапе научно-исследовательской подготовки опытно-конструкторских разработок (разработка перспективных требований к продукции, аванпроекта, технического задания на опытно-конструкторскую разработку). Это объясняется ограниченностью информации, доступной на начальном этапе жизненного цикла продукции, и необходимостью прогнозирования технических возможностей и экономической ситуации на будущее. Статистические методы должны применяться на всех этапах решения задачи оптимизации - при шкалировании переменных, разработке математических моделей функционирования изделий и систем, проведении технических и экономических экспериментов и т.д.

    В задачах оптимизации, в том числе оптимизации качества продукции и требований стандартов, используют все области статистики. А именно, статистику случайных величин, многомерный статистический анализ, статистику случайных процессов и временных рядов, статистику объектов нечисловой природы. Разработаны рекомендации по выбору статистического метода для анализа конкретных данных .

    Анализ интервальных данных

    Перспективная и быстро развивающаяся область исследований последних десятилетий - анализ интервальных данных. Речь идет о развитии методов прикладной математической статистики в ситуации, когда статистические данные - не числа, а интервалы, в частности, порожденные наложением ошибок измерения на значения случайных величин. Приведем основные идеи весьма перспективного для вероятностно-статистических методов и моделей принятия решений асимптотического направления в статистике интервальных данных.

    В настоящее время признается необходимым изучение устойчивости (робастности) оценок параметров к малым отклонениям исходных данных и предпосылок модели. Однако популярная среди теоретиков модель засорения (модель Тьюки-Хьюбера) представляется не вполне адекватной. Эта модель нацелена на изучение влияния больших "выбросов". Поскольку любые реальные измерения лежат в некотором фиксированном диапазоне, а именно, заданном в техническом паспорте средства измерения, то зачастую выбросы не могут быть слишком большими.

    В одной из таких схем изучается влияние интервальности исходных данных на статистические выводы. Необходимость такого изучения стала очевидной следующим образом. В государственных стандартах СССР по прикладной статистике в обязательном порядке давалось справочное приложение "Примеры применения правил стандарта". При разработке ГОСТ 11.011-83 были переданы для анализа реальные данные о наработке резцов до предельного состояния (в часах). Оказалось, что все эти данные представляли собой либо целые числа, либо полуцелые (т.е. после умножения на 2 становящиеся целыми). Ясно, что исходная длительность наработок искажена. Необходимо учесть в статистических процедурах наличие такого искажения исходных данных. Как это сделать?

    Первое, что приходит в голову - модель группировки данных, согласно которой для истинного значения Х проводится замена на ближайшее число из множества {0,5n, n=1,2,3,...} . Однако эту модель целесообразно подвергнуть сомнению, а также рассмотреть иные модели. Так, возможно, что Х надо приводить к ближайшему сверху элементу указанного множества - если проверка качества поставленных на испытание резцов проводилась раз в полчаса. Другой вариант: если расстояния от Х до двух ближайших элементов множества {0,5n, n=1,2,3,...} примерно равны, то естественно ввести рандомизацию при выборе заменяющего числа, и т.д.

    Целесообразно построить новую математико-статистическую модель, согласно которой результаты наблюдений - не числа, а интервалы Например, если в таблице приведено значение 53,5, то это значит, что реальное значение - какое-то число от 53,0 до 54,0, т.е. какое-то число в интервале [53,5 - 0,5; 53,5 + 0,5] , где 0,5 - максимально возможная погрешность. Принимая эту модель, мы попадаем в новую научную область - статистику интервальных данных. Статистика интервальных данных идейно связана с интервальной математикой, в которой в роли чисел выступают интервалы . Это направление математики является дальнейшим развитием известных правил приближенных вычислений, посвященных выражению погрешностей суммы, разности, произведения, частного через погрешности тех чисел, над которыми осуществляются перечисленные операции.

    В интервальной математике сумма двух интервальных чисел [a,b] и [c,d] имеет вид [a,b] + [c,d] = [a+c, b+d] , а разность определяется по формуле $$[a,b] - [c,d] = [a-d, b-c] $$. Для положительных a, b, c, d произведение определяется формулой $$[a,b] * [c,d] = [ac, bd] $$, а частное имеет вид $$[a,b] / [c,d] = [a/d, b/c] $$. Эти формулы получены при решении соответствующих оптимизационных задач. Пусть х лежит в отрезке $$[a,b] $$, а у - в отрезке $$[c,d] $$. Каково минимальное и максимальное значение для $$х+у$$? Очевидно, $$a+c$$ и $$b+d$$ соответственно. Минимальные и максимальные значения для х-у, ху, х/у задают нижние и верхние границы для интервальных чисел, задающих результаты арифметических операций. А от арифметических операций можно перейти ко всем остальным математическим алгоритмам. Так строится интервальная математика. К настоящему времени удалось решить, в частности, ряд задач теории интервальных дифференциальных уравнений, в которых коэффициенты, начальные условия и решения описываются с помощью интервалов.

    В настоящем разделе обсуждаем асимптотические методы статистического анализа интервальных данных при больших объемах выборок и малых погрешностях измерений. В отличие от классической математической статистики, сначала устремляется к бесконечности объем выборки и только потом - уменьшаются до нуля погрешности. В частности, еще в начале 1980-х годов с помощью такой асимптотики были сформулированы правила выбора метода оценивания в ГОСТ 11.011-83.

    Разработана общая схема исследования, включающая расчет нотны (максимально возможного отклонения статистики, вызванного интервальностью исходных данных) и рационального объема выборки (превышение которого не дает существенного повышения точности оценивания). Она применена к оцениванию математического ожидания и дисперсии, медианы и коэффициента вариации, параметров гамма-распределения и характеристик аддитивных статистик, при проверке гипотез о параметрах нормального распределения, в т.ч. с помощью критерия Стьюдента, а также гипотезы однородности с помощью критерия Смирнова. Изучено асимптотическое поведение оценок метода моментов и оценок максимального правдоподобия (а также более общих - оценок минимального контраста), проведено асимптотическое сравнение этих методов в случае интервальных данных, найдены общие условия, при которых, в отличие от классической математической статистики, метод моментов дает более точные оценки, чем метод максимального правдоподобия.

    Разработаны подходы к рассмотрению интервальных данных в основных постановках регрессионного, дискриминантного и кластерного анализов. В частности, изучено влияние погрешностей измерений и наблюдений на свойства алгоритмов регрессионного анализа, разработаны способы расчета нотн и рациональных объемов выборок, введены и исследованы новые понятия многомерных и асимптотических нотн, доказаны соответствующие предельные теоремы. Начата разработка интервального дискриминантного анализа, в частности, рассмотрено влияние интервальности данных на показатель качества классификации.

    В области асимптотической математической статистики интервальных данных мы имеем мировой приоритет. Очевидно, со временем во все виды статистического программного обеспечения должны быть включены алгоритмы интервальной статистики, "параллельные" обычно используемым алгоритмам прикладной математической статистики. Это позволит в явном виде учесть наличие погрешностей у результатов наблюдений, сблизить позиции метрологов и статистиков.

    Многие из утверждений статистики интервальных данных весьма отличаются от аналогов из классической математической статистики. В частности, не существует состоятельных оценок; средний квадрат ошибки оценки, как правило, асимптотически равен сумме дисперсии оценки, рассчитанной согласно классической теории, и некоторого положительного числа (равного квадрату т.н. нотны - максимально возможного отклонения значения статистики из-за погрешностей исходных данных) - в результате метод моментов оказывается иногда точнее метода максимального правдоподобия; нецелесообразно увеличивать объем выборки сверх некоторого предела (называемого рациональным объемом выборки) - вопреки классической теории, согласно которой чем больше объем выборки, тем точнее выводы.

    Развитие идей статистики интервальных данных продолжается уже в течение более чем 25 лет, и еще много чего надо сделать!

    Одна из ведущих научных школ в области анализа интервальных данных - это школа проф. А.П. Вощинина, активно работающая с конца 70-х годов. В частности, изучены проблемы регрессионного анализа, планирования эксперимента, сравнения альтернатив и принятия решений в условиях интервальной неопределенности.

    Рассматриваемое ниже направление отличается нацеленностью на асимптотические результаты, полученные при больших объемах выборок и малых погрешностях измерений, поэтому оно и названо асимптотической статистикой интервальных данных.

    Сформулируем сначала основные идеи асимптотической математической статистики интервальных данных. Следует сразу подчеркнуть, что основные идеи достаточно просты, в то время как их проработка в конкретных ситуациях зачастую оказывается достаточно трудоемкой.

    Пусть существо реального явления описывается выборкой $$x_1, x_2 , \dots, x_n$$. В вероятностной теории математической статистики, из которой мы исходим, выборка - это набор n независимых в совокупности одинаково распределенных случайных величин. Однако беспристрастный и тщательный анализ подавляющего большинства реальных задач показывает, что статистику известна отнюдь не выборка $$x_1, x_2, \dots, x_n$$, а величины

    $$y_j = x_j + \varepsilon _j, j = 1, 2, \dots , n,$$

    где $$\varepsilon _1, \varepsilon _2, \dots \varepsilon_n $$, некоторые погрешности измерений, наблюдений, анализов, опытов, исследований (например, инструментальные ошибки).

    Одна из причин появления погрешностей - запись результатов наблюдений с конечным числом значащих цифр. Дело в том, что для случайных величин с непрерывными функциями распределения событие, состоящее в попадании хотя бы одного элемента выборки в множество рациональных чисел, согласно правилам теории вероятностей имеет вероятность 0, а такими событиями в теории вероятностей принято пренебрегать. Поэтому при рассуждениях о выборках из обычно используемых распределений (нормального, логарифмически нормального, экспоненциального, равномерного, гамма - распределений, распределения Вейбулла-Гнеденко и т.п.) приходится принимать, что эти распределения имеют элементы исходной выборки $$x_1, x_2 , \dots, x_n $$, в то время как статистической обработке доступны лишь искаженные значения $$y_j = x_j + \varepsilon_j $$.

    Введем обозначения

    $$x = (x_1, x_2 , \dots, x_n), y = (y_1, y_2 ,\dots, y_n), \varepsilon = (\varepsilon_1, \varepsilon_2, \dots , \varepsilon_n) $$

    Пусть статистические выводы основываются на статистике $$f:R^n \to R^1 $$ используемой для оценивания параметров и характеристик распределения, проверки гипотез и решения иных статистических задач. Принципиально важная для статистики интервальных данных идея такова: СТАТИСТИК ЗНАЕТ ТОЛЬКО $$f(y) $$, НО НЕ $$f(x) $$.

    Очевидно, в статистических выводах необходимо отразить различие между $$f(y) $$ и $$f(x) $$. Одним из двух основных понятий статистики интервальных данных является понятие нотны.

    Определение. Величину максимально возможного (по абсолютной величине) отклонения, вызванного погрешностями наблюдений , известного статистику значения $$f(y) $$ от истинного значения $$f(x) $$, т.е.

    $$N_f(x) = \sup |f(y) - f(x)|,$$

    где супремум берется по множеству возможных значений вектора погрешностей $$\varepsilon $$ (см. ниже), будем называть НОТНОЙ .

    Если функция $$f$$ имеет частные производные второго порядка, а ограничения на погрешности имеют вид

    $$|\varepsilon_i| \le \Delta, i=1,2, \dots, n $$

    причем $$\Delta$$ мало, то приращение функции $$f$$ с точностью до бесконечно малых более высокого порядка описывается главным линейным членом, т.е.

    $$f(y)-f(x)=\sum_{1\le i \le n}\frac{df(x)}{dx_i}\varepsilon_i+O(\Delta^2) $$

    Чтобы получить асимптотическое (при $$\Delta \to 0$$ ) выражение для нотны, достаточно найти максимум и минимум линейной функции (главного линейного члена) на кубе, заданном неравенствами (1).

    Легко видеть, что максимум достигается, если положить

    $$\varepsilon_i=\begin{cases} \Delta, \frac {df(x)}{dx_i}\ge0\\ -\Delta, \frac{df(x)}{dx_i}<0 \end{cases} $$

    а минимум, отличающийся от максимума только знаком, достигается при $$\varepsilon_i=-\varepsilon_i$$. Следовательно, нотна с точностью до бесконечно малых более высокого порядка имеет вид

    $$N_f(x)=(\sum_{1 \le i \le n} |\frac{df(x)}{dx_i}|)\Delta$$

    Это выражение назовем асимптотической нотной.

    Условие (1) означает, что исходные данные представляются статистику в виде интервалов $$[y_i-\Delta; y_i+\Delta], i=1,2, \dots, n$$ (отсюда и название этого научного направления). Ограничения на погрешности могут задаваться разными способами - кроме абсолютных ошибок используются относительные или иные показатели различия между x и y.

    Если задана не предельная абсолютная погрешность $$\Delta$$, а предельная относительная погрешность $$\delta$$, т.е. ограничения на погрешности вошедших в выборку результатов измерений имеют вид

    $$|\varepsilon_i|\le \delta|x_i|, i=1,2,\dots, n$$

    то аналогичным образом получаем, что нотна с точностью до бесконечно малых более высокого порядка, т.е. асимптотическая нотна, имеет вид

    $$N_f(x)=(\sum_{1 \le i \le n}| x_i \frac{df(x)}{dx_i}|)\delta $$

    При практическом использовании рассматриваемой концепции необходимо провести в расчетных формулах тотальную замену символов x на символы y. В каждом конкретном случае удается показать, что в силу малости погрешностей разность $$N_f(y)-n_f(x) $$ является бесконечно малой более высокого порядка сравнительно с $$N_f(x)$$ или $$N_f(y) $$

    Основные результаты в вероятностной модели. В классической вероятностной модели элементы исходной выборки $$x_1, x_2 , \dots, x_n$$ рассматриваются как независимые одинаково распределенные случайные величины. Как правило, существует некоторая константа C > 0 такая, что в смысле сходимости по вероятности

    $$\lim_{n \to \infty} N_f(x)=C\Delta$$

    Соотношение (2) доказывается отдельно для каждой конкретной задачи.

    При использовании классических статистических методов в большинстве случаев используемая статистика $$f(x) $$ является асимптотически нормальной. Это означает, что существуют константы а и $$\sigma^2$$ такие, что

    $$\lim_{n \to \infty} P\left( \sqrt n \frac{f(x)-a}{\sigma}<x \right)=Ф(x) $$

    где $$Ф(х) $$ - функция стандартного нормального распределения с математическим ожиданием 0 и дисперсией 1. При этом обычно оказывается, что

    $$\lim_{n \to \infty} \sqrt n (Mf(x)-a)=0$$

    и

    $$\lim_{n \to \infty} nDf(x)= \sigma^2$$

    а потому в классической прикладной математической статистике средний квадрат ошибки статистической оценки равен

    $$M(f(x)-a)^2=(Mf(x)-a)^2+Df(x)=\frac{\sigma^2}{n}$$

    с точностью до членов более высокого порядка.

    В статистике интервальных данных ситуация совсем иная - обычно можно доказать, что средний квадрат ошибки равен

    $$max_{\{\varepsilon\}} M(f(x)-a)^2=\frac{\sigma^2}{n}+n_f^2(y)+o(\Delta^2+\frac {1}{n})$$

    Из соотношения (3) можно сделать ряд важных следствий. Прежде всего, отметим, что правая часть этого равенства, в отличие от правой части соответствующего классического равенства, не стремится к 0 при безграничном возрастании объема выборки. Она остается больше некоторого положительного числа, а именно, квадрата нотны. Следовательно, статистика $$f(x) $$ не является состоятельной оценкой параметра a. Более того, состоятельных оценок вообще не существует.

    Пусть доверительным интервалом для параметра a, соответствующим заданной доверительной вероятности $$\gamma$$, в классической математической статистике является интервал $$(c_n(\gamma); d_n(\gamma)) $$ В статистике интервальных данных аналогичный доверительный интервал является более широким. Он имеет вид $$(c_n(\gamma )-N_f(y); d_n(\gamma )+N_f(y))$$.Таким образом, его длина увеличивается на две нотны. Следовательно, при увеличении объема выборки длина доверительного интервала не может стать меньше, чем $$2C\Delta$$ (см. формулу (2)).

    В статистике интервальных данных методы оценивания параметров имеют другие свойства по сравнению с классической математической статистикой. Так, при больших объемах выборок метод моментов может быть заметно лучше, чем метод максимального правдоподобия (т.е. иметь меньший средний квадрат ошибки - см. формулу (3)), в то время как в классической математической статистике второй из названных методов всегда не хуже первого. Именно так обстоит дело при оценивании параметров гамма-распределения.

    Рациональный объем выборки. Анализ формулы (3) показывает, что в отличие от классической математической статистики нецелесообразно безгранично увеличивать объем выборки, поскольку средний квадрат ошибки остается всегда большим квадрата нотны. Поэтому представляется полезным ввести понятие "рационального объема выборки" $$n_{rat}$$, при достижении которого продолжать наблюдения нецелесообразно.

    Как установить "рациональный объем выборки"? Можно воспользоваться идеей "принципа уравнивания погрешностей", выдвинутой в монографии [2]. Речь идет о том, что вклад погрешностей различной природы в общую погрешность должен быть примерно одинаков. Этот принцип дает возможность выбирать необходимую точность оценивания тех или иных характеристик в тех случаях, когда это зависит от исследователя. В статистике интервальных данных в соответствии с "принципом уравнивания погрешностей" предлагается определять рациональный объем выборки nrat из условия равенства двух слагаемых - метрологической составляющей, связанной с нотной, и статистической составляющей - в среднем квадрате ошибки (3), т.е. из условия

    $$\frac{\sigma^2}{n_{rat}}=N_f^2(y), n_{rat}=\frac{\sigma^2}{N_f^2(y)}$$

    Для практического использования выражения для рационального объема выборки неизвестные теоретические характеристики необходимо заменить их оценками. Это делается в каждой конкретной задаче по-своему.

    Исследовательскую программу в области статистики интервальных данных можно "в двух словах" сформулировать так: для любого алгоритма анализа данных (алгоритма прикладной статистики) необходимо вычислить нотну и рациональный объем выборки. Или иные величины из того же понятийного ряда, возникающие в многомерном случае, при наличии нескольких выборок и при иных обобщениях описываемой здесь простейшей схемы. Затем проследить влияние погрешностей исходных данных на точность оценивания, доверительные интервалы, значения статистик критериев при проверке гипотез, уровни значимости и другие характеристики статистических выводов. Очевидно, классическая математическая статистика является частью статистики интервальных данных, выделяемой условием $$\Delta=0$$.

    Нечеткие множества

    Пусть $$A$$ - некоторое множество. Подмножество $$B$$ множества $$A$$ характеризуется своей характеристической функцией

    $$\mu_B(x)=\begin{cases} 1, x\in B,\\ 0, x \notin B \end{cases} $$

    Что такое нечеткое множество? Обычно говорят, что нечеткое подмножество $$C$$ множества $$A$$ характеризуется своей функцией принадлежности $$\mu_c \to[0,1] $$ Значение функции принадлежности в точке х показывает степень принадлежности этой точки нечеткому множеству. Нечеткое множество описывает неопределенность, соответствующую точке х - она одновременно и входит, и не входит в нечеткое множество $$С$$. За вхождение - $$\mu_c(x) $$ шансов, за второе - $$(1- \mu_c(x)) $$ шансов.

    Если функция принадлежности $$\mu_C(x)$$ имеет вид (4) при некотором B, то $$C$$ есть обычное (четкое) подмножество $$A$$. Таким образом, теория нечетких множеств является не менее общей математической дисциплиной, чем обычная теория множеств, поскольку обычные множества - частный случай нечетких.

    Соответственно можно ожидать, что теория нечеткости как целое обобщает классическую математику. Однако еще в 1970-х годах установлено, что теория нечеткости в определенном смысле сводится к теории случайных множеств и тем самым является частью классической математики. Другими словами, по степени общности обычная математика и нечеткая математика эквивалентны. Однако для практического применения в теории принятия решений описание и анализ неопределенностей с помощью теории нечетких множеств весьма плодотворны.

    Обычное подмножество можно было бы отождествить с его характеристической функцией. Этого математики не делают, поскольку для задания функции (в ныне принятом подходе) необходимо сначала задать множество. Нечеткое же подмножество с формальной точки зрения можно отождествить с его функцией принадлежности. Однако термин "нечеткое подмножество" предпочтительнее при построении математических моделей реальных явлений.

    Теория нечеткости является обобщением интервальной математики. Действительно, функция принадлежности

    $$\mu_B(x)=\begin{cases} 1, x \in [a,b]\\ 0, x \notin [a,b] \end{cases} $$

    задает интервальную неопределенность - про рассматриваемую величину известно лишь, что она лежит в заданном интервале $$[a,b] $$. Тем самым описание неопределенностей с помощью нечетких множеств является более общим, чем с помощью интервалов.

    Начало современной теории нечеткости положено работой 1965 г. американского ученого азербайджанского происхождения Л.А. Заде. К настоящему времени по этой теории опубликованы тысячи книг и статей, издается несколько международных журналов, выполнено достаточно много как теоретических, так и прикладных работ. Первая книга российского автора по теории нечеткости вышла в 1980 г.

    Сам Л.А. Заде рассматривал теорию нечетких множеств как аппарат анализа и моделирования гуманистических систем, т.е. систем, в которых участвует человек. Его подход опирается на предпосылку о том, что элементами мышления человека являются не числа, а элементы некоторых нечетких множеств или классов объектов, для которых переход от "принадлежности" к "непринадлежности" не скачкообразен, а непрерывен. В настоящее время методы теории нечеткости используются почти во всех прикладных областях, в том числе при управлении предприятием, качеством продукции и технологическими процессами.

    Л.А. Заде использовал термин "fuzzy set" (нечеткое множество). На русский язык термин "fuzzy" переводили как нечеткий, размытый, расплывчатый, и даже как пушистый и туманный.

    Аппарат теории нечеткости громоздок. В качестве примера дадим определения теоретико-множественных операций над нечеткими множествами. Пусть $$C$$ и $$D$$ - два нечетких подмножества $$A$$ с функциями принадлежности $$\mu_C(x) $$ и $$\mu_D(x) $$ соответственно. Пересечением $$C\bigcap D$$, произведением $$CD$$, объединением $$C\bigcupD$$, отрицанием $$\bar C$$, суммой $$C+D$$ называются нечеткие подмножества $$A$$ с функциями принадлежности

    $$\mu_{C\bigcap D}=min(\mu_C(x), \mu_D(x)), \mu_{CD}(x)=\mu_C(x)\mu_D(x), \mu_{\bar C}=1-\mu_C(x),\\ \mu_{C\bigcupD}=max(\mu_C(x), \mu_D(x)), \mu_{C+D}(x)=\mu_C(x)+\mu_D(x)-\mu_C(x)\mu_D(x), x \in A $$

    соответственно.

    Как уже отмечалось, теория нечетких множеств в определенном смысле сводится к теории вероятностей, а именно, к теории случайных множеств. Однако при решении прикладных задач вероятностно-статистические методы и методы теории нечеткости обычно рассматриваются как различные.

    Для знакомства со спецификой нечетких множеств рассмотрим некоторые их свойства.

    В дальнейшем считаем, что все рассматриваемые нечеткие множества являются подмножествами одного и того же множества $$Y$$.

    Законы де Моргана для нечетких множеств. Как известно, законами де Моргана называются следующие тождества алгебры множеств

    $$\overline {A\bigcap B}= \bar A \bigcup \bar B, \overline {A\bigcup B}= \bar A \bigcap \bar B$$

    Теорема 1. Для нечетких множеств справедливы тождества

    $$\overline {A\bigcap B}=\bar A \bigcup \bar B, \overline {A \bigcup B}=\bar A \bigcap \bar B$$ $$\overline {A+B}=\bar A \bar B, \overline {AB}=\bar A+\bar B$$

    Доказательство теоремы 1 состоит в непосредственной проверке справедливости соотношений (6) и (7) путем вычисления значений функций принадлежности участвующих в этих соотношениях нечетких множеств на основе определений, данных выше.

    Тождества (6) и (7) назовем законами де Моргана для нечетких множеств. В отличие от классического случая соотношений (5), они состоят из четырех тождеств, одна пара которых относится к операциям объединения и пересечения, а вторая - к операциям произведения и суммы. Как и соотношения (5) в алгебре множеств, законы де Моргана в алгебре нечетких множеств позволяют преобразовывать выражения и формулы, в состав которых входят операции отрицания.

    Дистрибутивный закон для нечетких множеств. Некоторые свойства операций над множествами не выполнены для нечетких множеств. Так, $$A+A \ne A$$ за исключением случая, когда $$А$$ - "четкое" множество (т.е. функция принадлежности принимает только значения 0 и 1).

    Верен ли дистрибутивный закон для нечетких множеств? В литературе иногда расплывчато утверждается, что "не всегда". Внесем полную ясность.

    Теорема 2. Для любых нечетких множеств $$А$$, $$В$$ и $$С$$

    $$A \bigcap (B\bigcup C)=(A \bigcap B) \bigcup(A \bigcap C)$$

    В то же время равенство

    $$A(B+C)=AB+AC$$

    справедливо тогда и только тогда, когда при всех $$y \inY$$

    $$_\mu_A^2(y)-\mu_A(y))\mu_B(y)\mu_C(y)=0$$

    Доказательство. Фиксируем произвольный элемент $$y \inY$$. Для сокращения записи обозначим $$a=\mu_A(y), b=\mu_B(y), c=\mu_C(y) $$ Для доказательства тождества (8) необходимо показать, что

    $$min(a, max(b,c))=max(min(a,b), min(a,c))$$

    Рассмотрим различные упорядочения трех чисел $$a, b, c$$. Пусть сначала $$a\le b\le c$$ Тогда левая часть соотношения (10) есть $$min(a,c)=a$$ а правая $$max(a,a)=a$$ т.е. равенство (10) справедливо.

    Пусть $$b\le a\le c$$ Тогда в соотношении (10) слева стоит $$min(a,c)=a$$ а справа $$max(b,a)=a$$ т.е. соотношение (10) опять является равенством.

    Если $$b\le c\le a$$ то в соотношении (10) слева стоит $$min(a,c)=c$$ а справа $$max(b,c)=c$$ т.е. обе части снова совпадают.

    Три остальные упорядочения чисел a, b, c разбирать нет необходимости, поскольку в соотношение (10) числа b и c входят симметрично. Тождество (8) доказано.

    Второе утверждение теоремы 2 вытекает из того, что в соответствии с определениями операций над нечеткими множествами

    $$\mu_{A(B+C)}(y)=a(b+c-bc)=ab+ac-abc$$

    и

    $$\mu_{AB+AC}(y)=ab+ac-(ab)(ac)=ab+ac-a^2bc$$

    Эти два выражения совпадают тогда и только тогда, когда $$a^2bc=abc$$ что и требовалось доказать.

    Определение 1. Носителем нечеткого множества $$А$$ называется совокупность всех точек $$y \inY$$, для которых $$\mu_A(y)>0$$

    Следствие теоремы 2. Если носители нечетких множеств В и С совпадают с У, то равенство (9) имеет место тогда и только тогда, когда А - "четкое" (т.е. обычное, классическое, не нечеткое) множество.

    Доказательство. По условию $$\mu_B(y)\mu_C(y)\ne0$$ при всех $$y \inY$$. Тогда из теоремы 2 следует, что $$\mu_A^2(y)-\mu_A(y)=0$$ т.е. $$\mu_A(y)=1$$ или $$\mu_A(y)=0$$, что и означает, что $$А$$ - четкое множество.

    Пример описания неопределенности с помощью нечеткого множества. Понятие "богатый" часто используется при обсуждении социально-экономических проблем, в том числе и в связи с подготовкой и принятием решений. Однако очевидно, что разные лица вкладывают в это понятие различное содержание. Сотрудники Института высоких статистических технологий и эконометрики провели в 1996 г. социологическое исследование представления различных слоёв населения о понятии "богатый человек".

    Мини-анкета опроса выглядела так:

  • При каком месячном доходе (в млн. руб. на одного человека) Вы считали бы себя богатым человеком?
  • Оценив свой сегодняшний доход, к какой из категорий Вы себя относите:
  • богатые;
  • достаток выше среднего;
  • достаток ниже среднего;
  • бедные;
  • за чертой бедности?
  • (В дальнейшем вместо полного наименования категорий будем оперировать буквами, например "в" - категория, "б" - категория и т.д.)
  • Ваша профессия, специальность.
  • Всего было опрошено 74 человека, из них 40 - научные работники и преподаватели, 34 человека - не занятых в сфере науки и образования, в том числе 5 рабочих и 5 пенсионеров. Из всех опрошенных только один (!) считает себя богатым. Несколько типичных ответов научных работников и преподавателей приведено в табл. 9.1, а аналогичные сведения для работников коммерческой сферы - в табл.9.2.

    Типичные ответы научных работников и преподавателей
    Ответы на вопрос 3 Ответы на вопрос 1, млн. руб./чел. Ответы на вопрос 2 Пол
    Кандидат наук 1 д ж
    Преподаватель 1 в ж
    Доцент 1 б ж
    Учитель 10 в м
    Старший. научный сотрудник 10 д м
    Инженер-физик 24 д ж
    Программист 25 г м
    Научный работник 45 г м
    Типичные ответы работников коммерческой сферы
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Вице-президент банка 100 а ж
    Зам. директора банка 50 б ж
    Начальник. кредитного отдела 50 б м
    Начальник отдела ценных бумаг 10 б м
    Главный бухгалтер 20 д ж
    Бухгалтер 15 в ж
    Менеджер банка 11 б м
    Начальник отдела проектирования 10 в ж

    Разброс ответов на первый вопрос - от 1 до 100 млн. руб. в месяц на человека. Результаты опроса показывают, что критерий богатства у финансовых работников в целом несколько выше, чем у научных (см. гистограммы на. рис 9.1 и рис.9.29.2 ниже).

    Опрос показал, что выявить какое-нибудь конкретное значение суммы, которая необходима "для полного счастья", пусть даже с небольшим разбросом, нельзя, что вполне естественно. Как видно из таблиц 9.1 и 9.2, денежный эквивалент богатства колеблется от 1 до 100 миллионов рублей в месяц. Подтвердилось мнение, что работники сферы образования в подавляющем большинстве причисляют свой достаток к категории "в" и ниже (81% опрошенных), в том числе к категории "д" отнесли свой достаток 57%.

    Со служащими коммерческих структур и бюджетных организаций иная картина: "г" - категория 1 человек (4%), "д" - категория 4 человека (17%), "б" - категория - 46% и 1 человек "а" - категория.

    Пенсионеры, что не вызывает удивления, отнесли свой доход к категории "д" (4 человека), и лишь один человек указал "г" - категорию. Рабочие же ответили так: 4 человека - "в", и один человек - "б".

    Для представления общей картины в табл. 9.3 приведены данные об ответах работников других профессий.

    Типичные ответы работников различных профессий
    Ответы на вопрос 3 Ответы на вопрос 1 Ответы на вопрос 2 Пол
    Работник торговли 1 б ж
    Дворник 2 в ж
    Водитель 10 в м
    Военнослужащий 10 в м
    Владелец бензоколонки 20 б ж
    Пенсионер 6 д ж
    Начальник фабрики 20 б м
    Хирург 5 в м
    Домохозяйка 10 в ж
    Слесарь-механик 25 в м
    Юрист 10 б м
    Оператор ЭВМ 20 д м
    Работник собеса 3 д ж
    Архитектор 25 б ж

    Прослеживается интересное явление: чем выше планка богатства для человека, тем к более низкой категории относительно этой планки он себя относит.

    Для сводки данных естественно использовать гистограммы. Для этого необходимо сгруппировать ответы. Использовались 7 классов (интервалов):

    1 - до 5 миллионов рублей в месяц на человека (включительно);

    2 - от 5 до 10 миллионов;

    3- от 10 до 15 миллионов;

    4 - от 15 до 20 миллионов;

    5 - от 20 до 25 миллионов;

    6 - от 25 до 30 миллионов;

    7 - более 30 миллионов.

    (Во всех интервалах левая граница исключена, а правая, наоборот - включена.)

    Сводная информация представлена на рис. 9.1 (для научных работников и преподавателей) и рис. 9.2 (для всех остальных, т.е. для лиц, не занятых в сфере науки и образования - служащих иных бюджетных организаций, коммерческих структур, рабочих, пенсионеров).

    (рис 9.1) Гистограмма ответов на вопрос 1 для научных работников и преподавателей (40 человек) (рис 9.2) Гистограмма ответов на вопрос 1 для лиц, не занятых в сфере науки и образования (34 человека).

    Для двух выделенных групп, а также для некоторых подгрупп второй группы рассчитаны сводные средние характеристики - выборочные средние арифметические, медианы, моды. При этом медиана группы - количество млн. руб., названное центральным по порядковому номеру опрашиваемым в возрастающем ряду ответов на вопрос 1, а мода группы - интервал, на котором столбик гистограммы - самый высокий, т.е. в него "попало" максимальное количество опрашиваемых. Результаты приведены в табл. 9.4.

    Сводные средние характеристики ответов на вопрос 1 для различных групп (в млн. руб. в мес. на чел.)
    Группа опрошенных Среднее арифметическое медиана мода
    Научные работники и преподаватели 11,66 7,25 (5; 10)
    Лица, не занятые в сфере науки и образования 14,4 10 (5; 10)
    Служащие коммерческих структур и бюджетных организаций 17,91 10 (5; 10)
    Рабочие 15 13 -
    Пенсионеры 10,3 10

    Построим нечеткое множество, описывающее понятие "богатый человек" в соответствии с представлениями опрошенных. Для этого составим табл. 9.5 на основе рис. 9.1 и рис. 9.2 с учетом размаха ответов на первый вопрос.

    Число ответов, попавших в интервалы
    Номер интервала 0 1 2 3 4 5 6 7 8
    1 Интервал, млн. руб. в месяц (0;1) [1;5] (5;10] (10;15] (15;20] (20;25] (25;30] (30;100) [100;+?)
    2 Число ответов в интервале 0 19 21 13 5 6 7 2 1
    3 Доля ответов в интервале 0 0,257 0,284 0,176 0.068 0,081 0,095 0,027 0,013
    4 Накопленное число ответов 0 19 40 53 58 64 71 73 74
    5 Накопленная доля ответов 0 0,257 0,541 0,716 0,784 0,865 0,960 0,987 1,000

    Пятая строка табл. 9.5 задает функцию принадлежности нечеткого множества, выражающего понятие "богатый человек" в терминах его ежемесячного дохода. Это нечеткое множество является подмножеством множества из 9 интервалов, заданных в строке 2 табл. 9.5. Или множества из 9 условных номеров $${0, 1, 2, \dots, 8}$$. Эмпирическая функция распределения, построенная по выборке из ответов 74 опрошенных на первый вопрос мини-анкеты, описывает понятие "богатый человек" как нечеткое подмножество положительной полуоси.

    О разработке методики ценообразования на основе теории нечетких множеств. Для оценки значений показателей, не имеющих количественной оценки, можно использовать методы нечетких множеств. Например, в работе П.В. Битюкова нечеткие множества применялись при моделировании задач ценообразования на электронные обучающие курсы, используемые при дистанционном обучении. Им было проведено исследование значений фактора "Уровень качества курса" с использованием нечетких множеств. В ходе практического использования предложенной П.В. Битюковым методики ценообразования значения ряда других факторов могут также определяться с использованием теории нечетких множеств. Например, ее можно использовать для определения прогноза рейтинга специальности в вузе с помощью экспертов, а также значений других факторов, относящихся к группе "Особенности курса". Опишем подход П.В. Битюкова как пример практического использования теории нечетких множеств.

    Значение оценки, присваиваемой каждому интервалу для фактора "Уровень качества курса", определяется на универсальной шкале [0,1], где необходимо разместить значения лингвистической переменной "Уровень качества курса": НИЗКИЙ, СРЕДНИЙ, ВЫСОКИЙ. Степень принадлежности некоторого значения вычисляется как отношение числа ответов, в которых оно встречалось в определенном интервале шкалы, к максимальному (для этого значения) числу ответов по всем интервалам.

    Был проведен опрос экспертов о степени влияния уровня качества электронных курсов на их потребительную ценность. Каждому эксперту в процессе опроса предлагалось оценить с позиции потребителя ценность того или иного класса курсов в зависимости от уровня качества. Эксперты давали свою оценку для каждого класса курсов по 10-ти балльной шкале (где 1 - min, 10 - max). Для перехода к универсальной шкале [0,1], все значения 10-ти балльной шкалы оценки ценности были разделены на максимальную оценку 10.

    Используя свойства функции принадлежности, необходимо предварительно обработать данные с тем, чтобы уменьшить искажения, вносимые опросом. Естественными свойствами функций принадлежности являются наличие одного максимума и гладкие, затухающие до нуля фронты. Для обработки статистических данных можно воспользоваться так называемой матрицей подсказок. Предварительно удаляются явно ошибочные элементы. Критерием удаления служит наличие нескольких нулей в строке вокруг этого элемента.

    Элементы матрицы подсказок вычисляются по формуле:

    $$k_j=\sum_{i=1}^nb_{ij}, j=\overline{1,n},$$

    где $$b_{ij}$$ - элемент таблицы с результатами анкетирования, сгруппированными по интервалам. Матрица подсказок представляет собой строку, в которой выбирается максимальный элемент: $$k_{max}=max_j k_j$$, и далее все ее элементы преобразуются по формуле:

    $$c_{ij}=\frac{b_{ij}k_{max}}{k_j}, i=\overline {1,m}, j=\overline {1,n}$$

    Для столбцов, где $$k_j=0$$, применяется линейная аппроксимация:

    $$c_{ij}=\frac{c_{ij-1}+c_{ij+1}}{2}, i=\overline {1,m}, j=\overline {1,n}$$

    Результаты расчетов сводятся в таблицу, на основании которой строятся функции принадлежности. Для этого находятся максимальные элементы по строкам: $$c_{imax}=max_j c_{ij}, i=\overline {1,m}, j=\overline {1,n}$$. Функция принадлежности вычисляется по формуле: $$\mu_{ij}=c_{ij}/c_{imax}$$. Результаты расчетов приведены в табл. 9.6.

    Значения функции принадлежности лингвистической переменной
    Интервал на универсальной шкале
    $$\mu_i$$ 0 1,2 1 1 0.89 0 0 0 0
    $$\mu_1$$ 0 0 0 0 0 0,33 1 1 1 0
    $$\mu_2$$ 0 0 0 0 0 0,33 1 1 0 0
    $$\mu_3$$ 0 0 0 0 0 0 0 0 1 1
    (рис 9.3) График функций принадлежности значений лингвистической переменной "Уровень качества курса".

    На рис. 9.3 сплошными линиями показаны функции принадлежности значений лингвистической переменной "Уровень качества курса" после обработки таблицы, содержащей результаты опроса. Как видно из графика, функции принадлежности удовлетворяют описанным выше свойствам. Для сравнения пунктирной линией показана функция принадлежности лингвистической переменной для значения НИЗКИЙ без обработки данных.

    О статистике нечетких множеств. Нечеткие множества - частный вид объектов нечисловой природы. Статистические методы анализа объектов нечисловой природы описаны в. В частности, среднее значение нечеткого множества можно определить по формуле:

    $$M(A)=\frac{\sum_{i=1}^n x_i\mu_A(x_i)}{\sum_{i=1}^n \mu_A(x_i)}$$

    где $$\mu_A(x_i) $$ - функция принадлежности нечеткого множества $$A$$.

    Как известно, методы статистики нечисловых данных базируются на использовании расстояний (или показателей различия) в соответствующих пространствах нечисловой природы. Расстояние между нечеткими подмножествами $$А$$ и $$В$$ множества $$Х = \{x1, x2, \dots, x_k\}$$ можно определить как

    $$d(A,B)=\sum_{j=1}^k |\mu_A(x_j)- \mu_B(x_j)|$$

    где $$\mu_A(x_j)$$ - функция принадлежности нечеткого множества $$A$$, а $$\mu_B(x_j) $$ - функция принадлежности нечеткого множества $$B$$. Может использоваться и другое расстояние:

    $$d_1(A,B)=\frac{\sum_{j=1}^k|\mu_A(x_j)-\mu_B(x_j)|}{\sum_{j=1}^k(\mu_A(x_j)+\mu_B(x_j))}$$

    (Примем это расстояние равным 0, если функции принадлежности тождественно равны 0.)

    В соответствии с аксиоматическим подходом к выбору расстояний (метрик) в пространствах нечисловой природы разработан обширный набор систем аксиом, из которых выводится тот или иной вид расстояний (метрик) в конкретных пространствах. При использовании вероятностных моделей расстояние между случайными нечеткими множествами само является случайной величиной, имеющей в ряде постановок асимптотически нормальное распределение.

    В эконометрике разработан ряд методов статистического анализа нечетких данных, в том числе методы классификации, регрессии, проверки гипотез о совпадении функций принадлежности по опытным данным и т.д., при этом оказались полезными общие подходы статистики объектов нечисловой природы, основанные на использовании расстояний в выборочных пространствах.

    Нечеткие множества как проекции случайных множеств. С самого начала появления современной теории нечеткости в 1960-е годы началось обсуждение ее взаимоотношений с теорией вероятностей. Дело в том, что функция принадлежности нечеткого множества напоминает распределение вероятностей. Отличие только в том, что сумма вероятностей по всем возможным значениям случайной величины (или интеграл, если множество возможных значений несчетно) всегда равна 1, а сумма $$S$$ значений функции принадлежности (в непрерывном случае - интеграл от функции принадлежности) может быть любым неотрицательным числом. Возникает искушение пронормировать функцию принадлежности, т.е. разделить все ее значения на $$S$$ (при $$S \ne0$$ ), чтобы свести ее к распределению вероятностей (или к плотности вероятности). Однако специалисты по нечеткости справедливо возражают против такого "примитивного сведения", поскольку оно проводится отдельно для каждой размытости (нечеткого множества), и определения обычных операций над нечеткими множествами с ним согласовать нельзя. Последнее утверждение означает следующее. Пусть указанным образом преобразованы функции принадлежности нечетких множеств $$А$$ и $$В$$. Как при этом преобразуются функции принадлежности $$A\bigcap B, A\bigcup B, A+B, AB$$? Установить это невозможно в принципе. Последнее утверждение становится совершенно ясным после рассмотрения нескольких примеров пар нечетких множеств с одними и теми же суммами значений функций принадлежности, но различными результатами теоретико-множественных операций над ними, причем и суммы значений соответствующих функций принадлежности для этих результатов теоретико-множественных операций, например, для пересечений множеств, также различны.

    В работах по нечетким множествам довольно часто утверждалось, что теория нечеткости является самостоятельным разделом прикладной математики и не имеет отношения к теории вероятностей. Авторы, сравнивавшие теорию нечеткости и теорию вероятностей, обычно подчеркивали различие между этими областями теоретических и прикладных исследований. Обычно сравнивают аксиоматику и сравнивают области приложений. Надо сразу отметить, что аргументы при втором типе сравнений не имеют доказательной силы, поскольку по поводу границ применимости даже такой давно выделившейся научной области, как вероятностно-статистические методы, имеются различные мнения. Напомним, что итог рассуждений одного из наиболее известных французских математиков Анри Лебега по поводу границ применимости арифметики таков: "Арифметика применима тогда, когда она применима".

    При сравнении различных аксиоматик теории нечеткости и теории вероятностей нетрудно увидеть, что списки аксиом различаются. Из этого, однако, отнюдь не следует, что между указанными теориями нельзя установить связь, типа известного сведения евклидовой геометрии на плоскости к арифметике. Напомним, что эти две аксиоматики - евклидовой геометрии и арифметики - на первый взгляд весьма сильно различаются.

    Можно понять желание энтузиастов нового направления подчеркнуть принципиальную новизну своего научного аппарата. Однако не менее важно установить связи нового подхода с ранее известными.

    Как оказалось, теория нечетких множеств тесно связана с теорией случайных множеств. Еще в 1970-х годах было показано, что нечеткие множества естественно рассматривать как "проекции" случайных множеств. Рассмотрим основную идею этого метода сведения теории нечетких множеств к теории случайных множеств.

    Определение 2. Пусть $$A=A(\omega) $$ - случайное подмножество конечного множества У. Нечеткое множество В, определенное на $$У$$, называется проекцией $$А$$ и обозначается Proj A, если

    $$\mu_B(y)=P(y \in A)$$

    при всех $$y\in Y$$

    Очевидно, каждому случайному множеству А можно поставить в соответствие с помощью формулы (11) его проекцию - нечеткое множество В = Proj A. Оказывается, верно и обратное - любое нечеткое множество является проекцией некоторого случайного.

    Цель сведения теории нечетких множеств к теории случайных множеств состоит в том, чтобы за любой конструкцией из нечетких множеств увидеть конструкцию из случайных множеств, определяющую свойства первой, аналогично тому, как за плотностью распределения вероятностей мы видим случайную величину. Сведение теории нечетких множеств к теории случайных теорем реализовано в виде системы теорем.

    Методологические, теоретические и прикладные вопросы теории нечеткости обсуждаются в многочисленных литературных источниках.

    Контрольные вопросы и задачи

  • Расскажите о понятиях случайного события и его вероятности.
  • Чем многомерный статистический анализ отличается от статистики объектов нечисловой природы?
  • Покажите на примерах, что в задачах принятия решений исходные данные часто имеют интервальный характер.
  • В чем особенности подхода статистики интервальных данных в задачах оценивания параметров?
  • Выполните операции над интервальными числами:

    а) $$[1,2]+[3,4]$$, б) $$[4,5]-[2,3]$$, в) $$[3,4]\times[5,7]$$, г) $$[10,20]:[4,5]$$ ;

    д) $$[0,2]+[3,5]$$, е) $$[3,5]-[2,4]$$, ж) $$[2,4]\times[5,8]$$, з) $$[15,25]:[1,5]$$.

  • Выпишите формулу для асимптотической нотны (ошибки по абсолютной величине не превосходят константы t, предполагающейся малой) для функции

    $$f(x1,x2) = 5 (x1)2 + 10 (x2)2 + 7 x1x2$$

    Вычислите асимптотическую нотну в точке $$(x1, x2) = (1,2) при t = 0,1$$. Проделайте то же для функции

    $$f(x1,x2) = 4 (x1)2 + 12 (x2)2 - 3 x1x2$$

    Вычислите асимптотическую нотну в точке $$(x1, x2) = (2,1) при t = 0,05$$.

  • В каких случаях целесообразно применение нечетких множеств?
  • Справедливо ли для нечетких множеств равенство $$(A+B)C = AC + BC$$? А равенство $$(AB)C = (AC)(BC)$$?
  • Опишите с помощью нечеткого подмножества временной шкалы понятие "молодой человек".
  • Опишите с помощью теории нечеткости понятие "куча зерен".
  • Как можно проводить кластерный анализ совокупности нечетких множеств?
  • Темы докладов, рефератов, исследовательских работ

  • Описание данных с помощью гистограмм и непараметрических оценок плотности.
  • Сравнительный анализ методов оценивания параметров и характеристик.
  • Преимущества одношаговых оценок по сравнению с оценками метода максимального правдоподобия.
  • Методы проверки однородности для независимых и связанных выборок.
  • Непараметрический регрессионный анализ.
  • Структура статистики нечисловых данных.
  • Аксиоматическое введение метрик и их использование в статистике объектов нечисловой природы.
  • Законы больших чисел в пространствах произвольной природы.
  • Непараметрические оценки плотности в пространствах произвольной природы, в том числе в дискретных пространствах.
  • Оптимизационные постановки в вероятностно-статистических задачах принятия решений.
  • Основные идеи статистики интервальных данных.
  • Классическая математическая статистика как предельный случай статистики интервальных данных.
  • Концепция рационального объема выборки.
  • Сравнение методов оценивания параметров и характеристик распределений в статистике интервальных данных и в классической математической статистике.
  • Подход к проверке гипотез в статистике интервальных данных.
  • Метод наименьших квадратов для интервальных данных.
  • Различные способы учета погрешностей исходных данных в статистических процедурах.
  • Статистика интервальных данных как часть теории устойчивости (с использованием монографии [3]).
  • Обсудите суждение: "Мы мыслим нечетко". Почему нечеткость мышления помогает взаимопониманию?
  • Взаимосвязь теории нечеткости и теории вероятностей.
  • Методы оценивания функции принадлежности.
  • Теория нечеткости и интервальная математика.
  • Описание данных для выборок, элементы которых - нечеткие множества.
  • Регрессионный анализ нечетких переменных.
  • Непараметрические оценки плотности распределения вероятностей в пространстве нечетких множеств.
  • Вернуться к учебному плану