Одна из основных задач прикладной статистики - оценивание по выборочным данным характеристик генеральной совокупности, таких, как математическое ожидание, медиана, дисперсия, среднее квадратическое отклонение,
Пусть исходные данные - это выборка $$x_1, x_2, ..., x_n$$, где $$n$$ -
В расчетах будут использоваться
Точечное и интервальное оценивание математического ожидания. Точечной оценкой для математического ожидания в силу закона больших чисел является
Нижняя доверительная граница для математического ожидания имеет вид$$\overline{X}-U(p)s_0/n^{1/2},$$ где:
Верхняя доверительная граница для математического ожидания имеет вид$$\overline{X}+U(p)s_0/n^{1/2}.$$
Выражения для верхней и нижней доверительных границ получены с помощью Центральной предельной теоремы теории вероятностей, теоремы о наследовании сходимости и других результатов лекция 4. Они являются асимптотическими, т.е. становятся тем точнее, чем больше
Интересно сопоставить с параметрическим подходом. Обычно в таких случаях предполагают нормальность результатов наблюдений (которой, как уже было обосновано в лекции 5, практически никогда нет). Тогда формулы для нижней и верхней доверительных границ для математического ожидания имеют похожий вид, только вместо $$U(p)$$ стоят квантили распределения Стьюдента (а не нормального распределения, как в приведенных выше формулах), соответствующие объему выборки. Как известно, при росте объема выборки квантили распределения Стьюдента сходятся к соответствующим квантилям стандартного нормального распределения, так что при больших объемах выборок оба подхода дают близкие результаты. Отметим, что классические доверительные интервалы несколько длиннее, поскольку квантили распределения Стьюдента больше квантилей стандартного нормального распределения, хотя это различие, на наш взгляд, и невелико.
Пример 1. Рассмотрим данные о наработке резцов до отказа (см. 6.1, табл.6.2). Для них
Если заранее известно, что результаты наблюдения имеют нормальное распределение, то нижняя и верхняя доверительная границы для математического ожидания определяются по формулам$$\overline{X}-t(p,n-1)s_0/\sqrt{n},\;\overline{X}+t(p,n-1)s_0/\sqrt{n}$$
соответственно. Эти формулы отличаются от предыдущих тем, что
Для
Отметим, что рассматриваемые данные согласуются с гамма-распределением (см. 7.1), а не с нормальным распределением, поэтому использование распределения Стьюдента для получения доверительных границ явно некорректно.
Иногда рекомендуют сначала проверить нормальность результатов наблюдений, а потом, в случае принятия гипотезы нормальности, рассчитывать доверительные границы с использованием квантилей распределения Стьюдента. Однако проверка нормальности - более сложная статистическая процедура, чем оценивание математического ожидания. Кроме того, применение одной статистической процедуры, как правило, нарушает предпосылки следующей процедуры, в частности, независимость результатов наблюдений (см. 7.5). Поэтому цепочка статистических процедур, следующих друг за другом, как правило, образует статистическую технологию, свойства которой неизвестны на современном уровне развития прикладной статистики.
Из сказанного вытекает, что только непараметрическую статистическую процедуру, основанную на асимптотических результатах лекции 4, следует применять для анализа реальных данных. Как правило, встречающиеся на практике распределения не являются нормальными (см. 5.1), а потому применение квантилей распределения Стьюдента неправомерно.
Точечное и интервальное оценивание медианы. Точечной оценкой для медианы является выборочная медиана.
Пример 2. Для данных о наработке резцов до отказа
Чтобы построить доверительные границы для медианы, по
Пример 3. Для данных о наработке резцов до отказа $$n = 50$$. Рассмотрим как обычно, доверительную вероятность $$p = 0,95$$. Тогда$$C(p)=[50/2-1,96\sqrt{50}/2]=[18,07]=18.$$
Следовательно, нижней доверительной границей является $$X(18) = 47,5$$, а верхней доверительной границей $$X(50 + 1 - 18) = X(33) = 61,5$$.
Поскольку в случае нормального распределения медиана совпадает с математическим ожиданием, то каких-либо специальных способов ее оценивания в классическом случае нет.
Точечное и интервальное оценивание дисперсии. Точечной оценкой дисперсии является выборочная дисперсия $$s_0^4$$. Эта оценка является несмещенной и состоятельной. Доверительные границы находятся с помощью величины$$d^2=(m_4-((n-1)/n)^4 s_0^4)/n,$$
где $$m_4$$ - выборочный четвертый центральный момент, т.е. $$m_4=\{(X_1-\overline{X})^4+(X_2-\overline{X})^4+...+(X_n-\overline{X})^4\}/n$$.
Нижняя доверительная граница для дисперсии случайной величины имеет вид$$s_0^2-U(p)d,$$ где:
Верхняя доверительная граница для дисперсии случайной величины имеет вид$$s_0^2+U(p)d,$$ где все составляющие имеют тот же смысл, что и выше.
При выводе приведенных соотношений используется асимптотическая нормальность выборочной дисперсии, установленная, например, в учебнике по математической статистике [, с.419]. Соответственно
Пример 4. Для данных о наработке резцов до отказа
Тогда $$d = 161,03$$. Для
Пример 5. В случае нормального распределения с целью быстрого получения доверительного интервала величина $$d^2$$ оценивается как$$(2s_0^4)/n=(2\cdot 663,00^2)/50=17582,76,$$
а потому $$d = 132,6$$. Для
Сужение границ для дисперсии вполне естественно. Данные о наработке резцов до предельного состояния (т.е. до отказа) соответствуют гамма-распределению, а это распределение является асимметричным, с "тяжелым" правым "хвостом". Последнее означает, что плотность убывает заметно медленнее, чем для нормального распределения. Как следствие, четвертый момент заметно больше, чем для нормального распределения с теми же математическим ожиданием и дисперсией. А потому больше и параметр $$d$$. Из проведенных расчетов видно, что использование алгоритмов расчетов, соответствующих нормальному распределению, в ситуации, когда распределение результатов наблюдений отлично от нормального, может привести к заметно искаженным выводам.
Пример 6. В классическом случае нормального распределения исходят из того, что величина $$(n-1)s_0^2/\gigma^2$$ имеет распределение хи-квадрат с $$(n - 1)$$ степенью свободы. Для
Полученный
Точечное и интервальное оценивание среднего квадратического отклонения. Точечной оценкой является
Нижняя доверительная граница для среднего квадратического отклонения исходной случайной величины имеет вид$$s_0-U(p)d/(2s_0),$$ где:
Верхняя доверительная граница для среднего квадратического отклонения исходной случайной величины имеет вид$$s_0+U(p)d/(2s_))$$ , где все составляющие имеют тот же смысл, что и выше.
Пример 7. Для данных о наработке резцов до отказа точечной оценкой для среднего квадратического отклонения является $$s_0=\sqrt{663,00}=25,75$$. При
Соответственно верхняя доверительная граница симметрична нижней относительно точечной оценки и равна 25,75+6,13=31,88.
Правила интервального оценивания для среднего квадратического отклонения получены из аналогичных правил для оценивания дисперсии с помощью метода
Поскольку среднее квадратическое отклонение - это квадратный корень их дисперсии, то доверительные границы можно получить, извлекая квадратные корни из одноименных границ для дисперсии.
Пример 8. Для данных о наработке резцов до отказа при
Классический подход, основанный на гипотезе нормальности распределения результатов наблюдения, связан с использованием распределения хи-квадрат и сводится к извлечению квадратных корней из доверительных границ для дисперсии.
Пример 9. Применяя формально классический подход к данным о наработке резцов до отказа, исходим из доверительного интервала для дисперсии [462,63; 1029,54], соответствующего
Точечное и интервальное оценивание
Дисперсия выборочного
Нижняя доверительная граница для (теоретического)
Верхняя доверительная граница для (теоретического)
Как и в предыдущих случаях,
Пример 10. Для данных о наработке резцов до отказа
Рассчитаем значение вспомогательной величины$$\begin{gathered} D^2 = ((0,4449)^4 - (0,4449)^2 / 4 + 1702050,71 / (4 \cdot 663,00\cdot(57,88)^2) - \\ - 14927,91 / (57,88)^3 ) / 50 = (0,0392 - 0,0495 + 0,1916 - 0,0770)/50 = \\ = 0,1043/50 = 0,002086. \end{gathered}$$
Следовательно, $$D = 0,04567$$. При
Среди классических результатов математической статистики, основанных на гипотезе нормальности результатов наблюдений, нет методов построения доверительных границ для
Примеры применения доверительных границ для
В прикладных исследованиях часто возникает необходимость выяснить, различаются ли генеральные совокупности, из которых взяты две независимые выборки. Например, надо выяснить, влияет ли способ упаковки подшипников на их потребительские качества через год после хранения. Или: отличается ли потребительское поведение мужчин и женщин. Если отличается - рекламные ролики и плакаты надо делать отдельно для мужчин и отдельно для женщин. Если нет - рекламная кампания может быть единой.
В математико-статистических терминах постановка задачи такова: имеются две выборки $$x_1, x_2,...,x_m$$ и $$y_1, y_2,...,y_n$$ (т. е. наборы из $$m$$ и $$n$$ действительных чисел), требуется проверить их однородность. Термин "однородность" уточняется ниже.
Противоположным понятием является "различие". Можно переформулировать задачу: требуется проверить, есть ли различие между выборками. Если различия нет, то для дальнейшего изучения две рассматриваемые выборки часто объединяют в одну.
Например, в маркетинге важно выделить сегменты потребительского рынка. Если установлена однородность двух выборок, то возможно объединение сегментов, из которых они взяты, в один. В дальнейшем это позволит осуществлять по отношению к ним одинаковую маркетинговую политику (проводить одни и те же рекламные мероприятия и т.п.). Если же установлено различие, то поведение потребителей в двух сегментах различно, объединять эти сегменты нельзя, и могут понадобиться различные маркетинговые стратегии, своя для каждого из этих сегментов.
Традиционный метод проверки однородности (критерий Стьюдента). Для дальнейшего критического разбора опишем традиционный статистический метод проверки однородности. Вычисляют
По заданному уровню значимости $$\alpha$$ и числу степеней свободы $$(m+n - 2)$$ из таблиц распределения Стьюдента находят критическое значение $$t_{\kappa p}$$. Если $$|t|>t_{\kappa p}$$, то гипотезу однородности (отсутствия различия) отклоняют, если же $$|t|\le t_{\kappa p}$$, - то принимают. (При односторонних альтернативных гипотезах вместо условия $$|t|>t_{\kappa p}$$ проверяют, что $$t>t_{\kappa p}$$ ; эту постановку рассматривать не будем, так как в ней нет принципиальных отличий от обсуждаемой здесь.)
Рассмотрим условия применимости традиционного метода проверки однородности, основанного на использовании статистики $$t$$ Стьюдента, а также укажем более современные методы.
Вероятностная модель порождения данных. Для обоснованного применения статистических методов необходимо прежде всего построить и обосновать вероятностную модель порождения данных. При проверке однородности двух выборок общепринята модель, в которой $$x_1, x_2,...,x_m$$ рассматриваются как результаты $$m$$ независимых наблюдений некоторой случайной величины $$X$$ с функцией распределения $$F(x)$$, неизвестной статистику, а $$y_1, y_2,...,y_n$$ - как результаты п независимых наблюдений, вообще говоря, другой случайной величины $$Y$$ с функцией распределения $$G(x)$$, также неизвестной статистику. Предполагается также, что наблюдения в одной выборке не зависят от наблюдений в другой, поэтому выборки и называют независимыми.
Возможность применения модели в конкретной реальной ситуации требует обоснования. Независимость и одинаковая распределенность результатов наблюдений, входящих в выборку, могут быть установлены или исходя из методики проведения конкретных наблюдений, или путем проверки статистических гипотез независимости и одинаковой распределенности с помощью соответствующих критериев [].
Если проведено $$(m+n)$$ измерений объемов продаж в $$(m+n)$$ торговых точках, то описанную выше модель, как правило, можно применять. Если же, например, $$x_i$$ и $$y_i$$ - объемы продаж одного и того же товара до и после определенного рекламного воздействия, то рассматриваемую модель применять нельзя. В последнем случае используют модель связанных выборок. В ней обычно строят новую выборку $$z_i = x_i - y_i$$ и используют статистические методы анализа одной выборки, а не двух. Методы проверки однородности для связанных выборок рассматриваются в 8.6.
При дальнейшем изложении принимаем описанную выше вероятностную модель двух выборок.
Уточнения понятия однородности. Понятие "однородность", т. е. "отсутствие различия", может быть формализовано в терминах вероятностной модели различными способами.
Наивысшая степень однородности достигается, если обе выборки взяты из одной и той же генеральной совокупности, т. е. справедлива нулевая гипотеза$$H_0 : F(x) = G(x) \textit{ при всех } x.$$
Отсутствие однородности означает, что верна альтернативная гипотеза, согласно которой$$H_1 : F(x_0) \ne G(x_0)$$ хотя бы при одном значении аргумента $$x_0$$. Если гипотеза $$H_0$$ принята, то выборки можно объединить в одну, если нет - то нельзя.
В некоторых случаях целесообразно проверять не совпадение функций распределения, а совпадение некоторых характеристик случайных величин $$X$$ и $$Y$$ - математических ожиданий, медиан, дисперсий,
Если гипотеза $$H_0$$ верна, то и гипотеза $$H'_0$$ верна, но из справедливости $$H'_0$$, вообще говоря, не следует справедливость $$H_0$$. Математические ожидания могут совпадать для различающихся между собой функций распределения. В частности, если в результате обработки выборочных данных принята гипотеза $$H'_0$$, то отсюда не следует, что две выборки можно объединить в одну. Однако в ряде ситуаций целесообразна проверка именно гипотезы $$H'_0$$. Например, пусть функция спроса на определенный товар или услугу оценивается путем опроса потребителей (первая выборка) или с помощью данных о продажах (вторая выборка). Тогда маркетологу важно проверить гипотезу об отсутствии систематических расхождений результатов этих двух методов, т.е. гипотезу о равенстве математических ожиданий. Другой пример - из производственного менеджмента. Пусть изучается эффективность управления бригадами рабочих на предприятии с помощью двух организационных схем, результаты наблюдения - объем производства на одного члена бригады, а показатель эффективности организационной схемы - средний (по предприятию) объем производства на одного рабочего. Тогда для сравнения эффективности схем достаточно проверить гипотезу $$H'_0$$.
Классические условия применимости критерия Стьюдента. Согласно математико-статистической теории должны быть выполнены два классических условия применимости критерия Стьюдента, основанного на использовании статистики $$t$$, заданной формулой (1):
а) результаты наблюдений имеют нормальные распределения:$$F(x)=N(x;m_1,\sigma_1^2), G(x)=N(x;m_2,\sigma_2^2)$$ с математическими ожиданиями $$m_1$$ и $$m_2$$ и дисперсиями $$\sigma_1^2$$ и $$\sigma_2^2$$ в первой и во второй выборках соответственно;
б) дисперсии результатов наблюдений в первой и второй выборках совпадают:$$D(X) = \sigma_1^2 = D(Y) = \sigma_2^2.$$
Если условия а) и б) выполнены, то нормальные распределения $$F(x)$$ и $$G(x)$$ отличаются только математическими ожиданиями, а поэтому обе гипотезы $$H_0$$ и $$H'_0$$ сводятся к гипотезе$$H''_0:m_1=m_2,$$ а обе альтернативные гипотезы $$H_1$$ и $$H'_1$$ сводятся к гипотезе$$H''_1 : m_1 \ne m_2 .$$
Если условия а) и б) выполнены, то статистика $$t$$ при справедливости $$H''_0$$ имеет распределение Стьюдента с $$(m + n - 2)$$ степенями свободы. Только в этом случае описанный выше традиционный метод обоснован безупречно. Если хотя бы одно из условий а) и б) не выполнено, то нет никаких оснований считать, что статистика $$t$$ имеет распределение Стьюдента, поэтому применение традиционного метода, строго говоря, не обосновано. Обсудим возможность проверки этих условий и последствия их нарушений.
Имеют ли результаты наблюдений нормальное распределение? Как показано в ]. Однако проверка нормальности - более сложная и трудоемкая статистическая процедура, чем проверка однородности (как с помощью статистики $$t$$ Стьюдента, так и с использованием непараметрических критериев, рассматриваемых ниже).
Для достаточно надежного установления нормальности требуется весьма большое число наблюдений. В лекции 5 показано, что для того, чтобы гарантировать, что функция распределения результатов наблюдений отличается от некоторой нормальной не более чем на 0,01 (при любом значении аргумента), требуется порядка 2500 наблюдений. В большинстве технических, экономических, медицинских и иных исследований число наблюдений существенно меньше.
Как уже отмечалось, есть и одна общая причина отклонений от нормальности: любой результат наблюдения записывается конечным (обычно 2-5) количеством цифр, а с математической точки зрения вероятность такого события равна 0. Следовательно, в прикладной статистике распределение результатов наблюдений практически всегда более или менее отличается от нормального распределения.
Последствия нарушения условия нормальности. Если условие а) не выполнено, то распределение статистики $$t$$ не является распределением Стьюдента. Однако при справедливости $$H'_0$$ и условии б) распределение статистики $$t$$ при росте объемов выборок приближается к стандартному нормальному распределению $$\Phi(x) = N(x; 0, 1)$$. К этому же распределению приближается распределение Стьюдента при возрастании числа степеней свободы. Другими словами, несмотря на нарушение условия нормальности традиционный метод (критерий Стьюдента) можно использовать для проверки гипотезы $$H'_0$$ при больших объемах выборок. При этом вместо таблиц распределения Стьюдента достаточно пользоваться таблицами стандартного нормального распределения $$\Phi(x)$$.
Сформулированное в предыдущем абзаце утверждение справедливо для любых функций распределения $$F(x)$$ и $$G(x)$$ таких, что $$M(X)=M(Y), D(X)=D(Y)$$ и выполнены некоторые внутриматематические условия, обычно считающиеся справедливыми в реальных задачах. Если же $$M(X)\ne M(Y)$$, то нетрудно вычислить, что при больших объемах выборок$$P(t\le x)\approx\Phi(x-a_{mn}),$$ где$$a_{mn}=\frac{\sqrt{mn}[M(X)-M(Y)]}{\sqrt{mD(X)+nD(Y)}}.$$
Формулы (2) - (3) позволяют приближенно вычислять мощность $$t$$ -критерия (точность возрастает при увеличении объемов выборок $$m$$ и $$n$$ ).
О проверке условия равенства дисперсий. Иногда условие б) вытекает из методики получения результатов наблюдений, например, когда с помощью одного и того же прибора или методики $$m$$ раз измеряют характеристику первого объекта и $$n$$ раз - второго, а параметры распределения погрешностей измерения при этом не меняются. Однако ясно, что в постановках большинства исследовательских и практических задач нет оснований априори предполагать равенство дисперсий.
Целесообразно ли проверять равенство дисперсий статистическими методами, например, как это иногда предлагают, с помощью $$F$$ -критерия Фишера? Этот критерий основан на нормальности распределений результатов наблюдений, от которой неизбежны отклонения (см. выше). Причем хорошо известно, что в отличие от t-критерия распределение $$F$$ -критерия Фишера сильно меняется при малых отклонениях от нормальности []. Кроме того, $$F$$ -критерий отвергает гипотезу $$D(X)=D(Y)$$ лишь при большом различии выборочных дисперсий. Так, для данных [] о двух группах результатов химических анализов отношение выборочных дисперсий равно 1,95, т.е. существенно отличается от 1. Тем не менее гипотеза о равенстве теоретических дисперсий принимается на 1%-м уровне значимости. Следовательно, при проверке однородности применение $$F$$ -критерия для предварительной проверки равенства дисперсий нецелесообразно.
Итак, в большинстве технических, экономических, медицинских и иных задач условие б) нельзя считать выполненным, а проверять его нецелесообразно.
Последствия нарушения условия равенства дисперсий. Если объемы выборок $$m$$ и $$n$$ велики, то можно показать, что распределение статистики $$t$$ описывается с помощью только математических ожиданий $$M(X)$$ и $$M(Y)$$, дисперсий $$D(X), D(Y)$$ и отношения объемов выборок, а именно:$$P(t\le x)\approx\Phi(b_{mn} x-a_{mn}),$$ где $$a_{mn}$$ определено формулой (3),$$b_{mn}^2=\frac{\lambda D(X)+D(Y)}{D(X)+\lambda D(Y)},\quad \lambda=\frac{m}{n}.$$
Если $$b_{mn} \ne 1$$, то распределение статистики $$t$$ отличается от распределения, заданного формулой (2), полученной в предположении равенства дисперсий. Когда $$b_{mn}=1$$? В двух случаях - при $$m = n$$ и при $$D(X) = D(Y)$$. Таким образом, при больших и равных объемах выборок требовать выполнения условия б) нет необходимости. Кроме того, ясно, что если объемы выборок мало различаются, то $$b_{mn}$$ близко к 1. Так, для данных [] о двух группах результатов химических анализов имеем $$b^*_{mn}= 0,987$$, где $$b^*_{mn}$$ - оценка $$b_{mn}$$, полученная заменой в формуле (5) теоретических дисперсий на выборочные.
Область применимости традиционного метода проверки однородности с помощью критерия Стьюдента. Подведем итоги рассмотрения $$t$$ -критерия. Он позволяет проверять гипотезу $$H'0$$ о равенстве математических ожиданий, но не гипотезу $$H_0$$ о том, что обе выборки взяты из одной и той же генеральной совокупности. Классические условия применимости критерия Стьюдента в подавляющем большинстве технических, экономических, медицинских и иных задач не выполнены. Тем не менее при больших и примерно равных объемах выборок его можно применять. При конечных объемах выборок традиционный метод носит неустранимо приближенный характер.
Критерий Крамера-Уэлча равенства математических ожиданий. Вместо критерия Стьюдента целесообразно для проверки $$H'0$$ использовать критерий Крамера-Уэлча [], основанный на статистике$$T=\frac{\sqrt{mn}(\overline{x}-\overline{y})}{\sqrt{ns_x^2+ms_y^2}}.$$
Критерий Крамера-Уэлча имеет прозрачный смысл - разность выборочных средних арифметических для двух выборок делится на естественную оценку среднего квадратического отклонения этой разности. Естественность указанной оценки состоит в том, что неизвестные статистику дисперсии заменены их выборочными оценками. Из многомерной Центральной предельной теоремы и из теорем о наследовании сходимости [] вытекает (см. лекцию 4), что при росте объемов выборок распределение статистики $$T$$ Крамера-Уэлча сходится к стандартному нормальному распределению с математическим ожиданием 0 и дисперсией 1. Итак, при справедливости $$H'0$$ и больших объемах выборок распределение статистики $$T$$ приближается с помощью стандартного нормального распределения $$\Phi(х)$$, из таблиц которого следует брать критические значения.
При $$m = n$$, как следует из формул (1) и (6), $$t = T$$. При $$m\ne n$$ этого равенства нет. В частности, при $$s_x^2$$ в (1) стоит множитель $$(m - 1)$$, а в (6) - множитель $$n$$.
Если $$M(X)\ne M(Y)$$, то при больших объемах выборок$$P(T\le X)\approx\Phi(x-c_{mn}),$$ где$$C_{mn}=\frac{\sqrt{mn}[M(X)-M(Y)]}{\sqrt{nD(X)+mD(Y)}}.$$
При $$m = n$$ или $$D(X)=D(Y)$$, согласно формулам (3) и (8), $$a_{mn}= c_{mn}$$, в остальных случаях равенства нет.
Из асимптотической нормальности статистики $$T$$, формул (7) и (8) следует, что правило принятия решения для критерия Крамера-Уэлча выглядит следующим образом:
В прикладной статистике наиболее часто применяется уровень значимости $$\alpha=0,05$$. Тогда значение модуля статистики $$T$$ Крамера-Уэлча надо сравнивать с граничным значением $$\underline{\Phi^{-1}\left(1-\frac{\alpha}{2}\right)=1,96}$$.
Из сказанного выше следует, что применение критерия Крамера-Уэлча не менее обосновано, чем применение критерия Стьюдента. Дополнительное преимущество - не требуется равенства дисперсий $$D(X)=D(Y)$$. Распределение статистики $$T$$ не является распределением Стьюдента, однако и распределение статистики $$t$$, как показано выше, не является таковым в реальных ситуациях.
Распределение статистики $$T$$ при объемах выборок $$m=n=6, 8, 10, 12$$ и различных функциях распределений выборок $$F(x)$$ и $$G(x)$$ изучено нами совместно с Ю.Э. Камнем и Я.Э. Камнем
Пример 1. Пусть объем первой выборки $$m=120, \overline{x}=13,7, s_x=5,3$$. Для второй выборки $$n=541,\overline{y}=14,1, s_y=8,4$$. Вычислим величину статистики Крамера-Уэлча$$\begin{aligned} T=\frac{\sqrt{mn}(\overline{x}-\overline{y})}{\sqrt{ns_x^2+ms_y^2}}= \frac{\sqrt{120\times 541}(13,7-14,1)}{\sqrt{541\times 5,3^2+120\times 8,4^2}}= \frac{\sqrt{64920}(-0,4)}{\sqrt{541\times 28,09+120\times 141,12}}= \\ = \frac{254,79 \times (-0,4)}{\sqrt{15196,69+16934,4}}= \frac{-101,916}{\sqrt{32131,09}}=\frac{-101,916}{179,25}=-0,57. \end{aligned}$$
Поскольку полученное значение по абсолютной величине меньше 1,96, то гипотеза однородности математических ожиданий принимается на уровне значимости 0,05.
Непараметрические методы проверки однородности. В большинстве технических, экономических, медицинских и иных задач представляет интерес не проверка равенства математических ожиданий или иных характеристик распределения, а обнаружение различия генеральных совокупностей, из которых извлечены выборки, т.е. проверка гипотезы $$H_0$$. Методы проверки гипотезы $$H_0$$ позволяют обнаружить не только изменение математического ожидания, но и любые иные изменения функции распределения результатов наблюдений при переходе от одной выборки к другой (увеличение разброса, появление
Для проверки гипотезы $$H_0$$ разработано много непараметрических методов - критерии Смирнова, типа омега-квадрат (Лемана - Розенблатта), Вилкоксона (Манна-Уитни), Ван-дер-Вардена, Сэвиджа, хи-квадрат и др. [, , ]. Распределения статистик всех этих критериев при справедливости H0 не зависят от конкретного вида совпадающих функций распределения $$F(x) \equiv G(x)$$. Следовательно, таблицами точных и предельных (при больших объемах выборок) распределений статистик этих критериев и их процентных точек [, ] можно пользоваться при любых непрерывных функциях распределения результатов наблюдений.
], для выбора одного из нескольких критериев необходимо сравнить их мощности, определяемые видом альтернативных гипотез. Сравнению
Хорошо изучены свойства критериев при альтернативной гипотезе сдвига$$H_{1c}:G(x)=F(x-d), d\ne 0.$$
Критерии Вилкоксона, Ван-дер-Вардена и ряд других ориентированы для применения именно в этой ситуации. Если $$m$$ раз измеряют характеристику одного объекта и $$n$$ раз - другого, а функция распределения погрешностей измерения произвольна, но не меняется при переходе от объекта к объекту (это более жесткое требование, чем условие равенства дисперсий), то рассмотрение гипотезы $$H_{1c}$$ оправдано. Однако в большинстве технических, экономических, медицинских и иных исследований нет оснований считать, что функции распределения, соответствующие выборкам, различаются только сдвигом.
Покажем (и это - основной результат настоящего параграфа), что двухвыборочный критерий Вилкоксона (в литературе его называют также критерием Манна-Уитни) предназначен для проверки гипотезы$$H_0:P(X<Y)=1/2,$$ где $$X$$ - случайная величина, распределенная как элементы первой выборки, а $$Y$$ - второй.
В описанной выше вероятностной модели двух независимых выборок без ограничения общности можно считать, что объем первой из них не превосходит объема второй, $$m < n$$, в противном случае выборки можно поменять местами. Обычно предполагается, что функции $$F(x)$$ и $$G(x)$$ непрерывны и строго возрастают. Из непрерывности этих функций следует, что с вероятностью 1 все $$m + n$$ результатов наблюдений различны. В реальных эконометрических данных иногда встречаются совпадения, но сам факт их наличия - свидетельство нарушений предпосылок только что описанной базовой математической модели.
Статистика $$S$$ двухвыборочного критерия Вилкоксона определяется следующим образом. Все элементы объединенной выборки $$X_1, X_2, ..., X_m, Y_1, Y_2, ..., Y_n$$ упорядочиваются в порядке возрастания. Элементы первой выборки $$X_1, X_2, ..., X_m$$ занимают в общем вариационном ряду места с номерами $$R_1, R_2, ..., R_m$$, другими словами, имеют ранги $$R_1, R_2, ..., R_m$$. Тогда статистика Вилкоксона - это сумма рангов элементов первой выборки$$S=R_1, R_2, ..., R_m.$$
Статистика $$U$$ Манна-Уитни определяется как число пар $$(X_i, Y_j)$$ таких, что $$X_i < Y_j,$$ среди всех $$mn$$ пар, в которых первый элемент - из первой выборки, а второй - из второй. Как известно [, с.160],$$U=mn+m(m+1)/2-S.$$
Поскольку $$S$$ и $$U$$ линейно связаны, то часто говорят не о двух критериях - Вилкоксона и Манна-Уитни, а об одном - критерии Вилкоксона (Манна-Уитни).
Критерий Вилкоксона - один из самых известных инструментов непараметрической статистики (наряду со статистиками типа Колмогорова-Смирнова и коэффициентами ранговой корреляции). Свойствам этого критерия и таблицам его критических значений уделяется место во многих монографиях по математической и прикладной статистике (см., например, [, , ]).
Однако в литературе имеются и неточные утверждения относительно возможностей критерия Вилкоксона. Так, одни полагают, что с его помощью можно обнаружить любое различие между функциями распределения $$F(x)$$ и $$G(x)$$. По мнению других, этот критерий нацелен на проверку равенства медиан распределений, соответствующих выборкам. И то, и другое, строго говоря, неверно. Это будет ясно из дальнейшего изложения.
Введем некоторые обозначения. Пусть $$F^{-1}(t)$$ - функция, обратная к функции распределения $$F(x)$$. Она определена на отрезке [0;1]. Положим $$L(t) = G(F^{-1}(t))$$. Поскольку $$F(x)$$ непрерывна и строго возрастает, то $$F^{-1}(t)$$ и $$L(t)$$ обладают теми же свойствами. Важную роль в дальнейшем изложении будет играть величина $$a = P(X< Y).$$ Как нетрудно показать,$$a=P(X<Y)=\int\limits_0^1 tdL(t).$$
Введем также параметры$$b^2=\int\limits_0^1 L^2(t)dt-(1-a)^2,\; g^2=\int\limits_0^1 t^2 dL(t)-a^2.$$
Тогда математические ожидания и дисперсии статистик Вилкоксона и Манна-Уитни согласно [, с.160] выражаются через введенные величины:$$\begin{gathered} М(U) = mna, М(S) = mn + m(m+1)/2 - М(U) = mn(1- a) + m(m+1)/2,\\ D(S) = D(U) = mn [(n - 1) b^2 + (m - 1) g^2 + a(1 - a)]. \end{gathered}$$
Когда объемы обеих выборок безгранично растут, распределения статистик Вилкоксона и Манна-Уитни являются асимптотически нормальными (см., например, [, гл. 5 и ]) с параметрами, задаваемыми формулами (1).
Если выборки полностью однородны, т.е. их функции распределения совпадают, справедлива гипотеза$$H_0: F(x) = G(x) \textit{ при всех } x,$$ то $$L(t) = t$$ для $$t$$ из отрезка $$[0, 1], L(t)= 0$$ для всех отрицательных $$t$$ и $$L(t)= 1$$ для $$t > 1$$, соответственно $$a = 1/2$$. Подставляя в формулы (1), получаем, что$$М(S) = m(m+n+1)/2, D(S) = mn(m+n+1)/12.$$
Следовательно, распределение нормированной и центрированной статистики Вилкоксона$$T = ( S - m(m+n+1)/2) (mn(m+n+1)/ 12)^{-1/2}$$ при росте объемов выборок приближается к стандартному нормальному распределению (с математическим ожиданием 0 и дисперсией 1).
Из асимптотической нормальности статистики $$Т$$ следует, что правило принятия решения для критерия Вилкоксона выглядит следующим образом:
В прикладной статистике наиболее часто применяется уровень значимости $$\alpha=0,05$$. Тогда значение модуля статистики $$T$$ Вилкоксона надо сравнивать с граничным значением $$\underline{\Phi^{-1}\left(1-\frac{\alpha}{2}\right)}=1,96$$.
Пример 1. Пусть даны две выборки. Первая содержит $$m = 12$$ элементов 17; 22; 3; 5; 15; 2; 0; 7; 13; 97; 66; 14. Вторая содержит $$n=14$$ элементов 47; 30; 2; 15; 1; 21; 25; 7; 44; 29; 33; 11; 6; 15. Проведем проверку однородности функций распределения двух выборок с помощью критерия Вилкоксона.
Первым шагом является построение общего вариационного ряда для элементов двух выборок (табл.8.1).
| Ранги | 1 | 2 | 3,5 | 3,5 | 5 | 6 | 7 | 8,5 | 8,5 | 10 | 11 | 12 | 14 |
| Элементы выборок | 0 | 1 | 2 | 2 | 3 | 5 | 6 | 7 | 7 | 11 | 13 | 14 | 15 |
| Номера выборок | 1 | 2 | 1 | 2 | 1 | 1 | 2 | 1 | 2 | 2 | 1 | 1 | 1 |
| Ранги | 14 | 14 | 16 | 17 | 18 | 19 | 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| Элементы выборок | 15 | 15 | 17 | 21 | 22 | 25 | 29 | 30 | 33 | 44 | 47 | 66 | 97 |
| Номера выборок | 2 | 2 | 1 | 2 | 1 | 2 | 2 | 2 | 2 | 2 | 2 | 1 | 1 |
Хотя с точки зрения теории математической статистики вероятность совпадения двух элементов выборок равна 0, в реальных выборках экономических данных совпадения встречаются. Так, в рассматриваемых выборках, как видно из табл.8.1, два раза повторяется величина 2, два раза - величина 7 и три раза - величина 15. В таких случаях говорят о наличии "связанных рангов", а соответствующим совпадающим величинам приписывают среднее арифметическое тех рангов, которые они занимают. Так, величины 2 и 2 занимают в объединенной выборке места 3 и 4, поэтому им приписывается ранг (3+4)/2 = 3,5. Величины 7 и 7 занимают в объединенной выборке места 8 и 9, поэтому им приписывается ранг (8+9)/2 = 8,5. Величины 15, 15 и 15 занимают в объединенной выборке места 13, 14 и 15, поэтому им приписывается ранг (13+14+15)/3 = 14.
Следующий шаг - подсчет значения статистики Вилкоксона, т.е. суммы рангов элементов первой выборки$$S = R_1 + R_2 + ... + R_m = 1+3,5+5+6+8,5+11+12+14+16+18+25+26=146.$$
Подсчитаем также сумму рангов элементов второй выборки$$S_1 = 2+3,5+7+8,5+10+14+14+17+19+20+21+22+23+24= 205.$$
Величина $$S_1$$ может быть использована для контроля вычислений. Дело в том, что суммы рангов элементов первой выборки $$S$$ и второй выборки $$S_1$$ вместе составляют сумму рангов объединенной выборки, т.е. сумму всех натуральных чисел от 1 до $$m+n$$. Следовательно,$$S+ S_1 = (m+n)(m+n+1)/2= (12+14)(12+14+1)/2= 351.$$
В соответствии с ранее проведенными расчетами $$S+S_1 = 146+205=351$$. Необходимое условие правильности расчетов выполнено. Это условие не является достаточным и не гарантирует правильности расчетов.
Перейдем к расчету статистики $$T$$. Согласно формуле (3)$$М(S) = 12(12+14+1)/ 2 = 162, D(S) = 12\cdot 14(12+14+1)/ 12= 378 .$$
Следовательно,$$T = ( S - 162) (378)^{-1/2} = (146-162) / 19,44 = - 0,82.$$
Поскольку $$|T|\le 1,96$$, то гипотеза однородности принимается на уровне значимости 0,05.
Что будет, если поменять выборки местами, вторую назвать первой? Тогда вместо $$S$$ надо рассматривать $$S_1$$. Имеем$$\begin{gathered} М(S1 ) = 14(12+14+1)/ 2 = 189, D(S) = D(S1 ) = 378 , \\ T_1 = (S_1 - 189)(378)^{-1/2} = (205-162)/19,44 = 0,82. \end{gathered}$$
Таким образом, значения статистики критерия отличаются только знаком (можно показать, что это утверждение верно всегда). Поскольку в правиле принятия решения используется только абсолютная величина статистики, то принимаемое решение не зависит от того, какую выборку считаем первой, а какую второй. Для уменьшения объема таблиц принято считать первой выборку меньшего объема.
Продолжим обсуждение критерия Вилкоксона. Правила принятия решений и таблица критических значений для критерия Вилкоксона строятся в предположении справедливости гипотезы полной однородности, описываемой формулой (2). А что будет, если эта гипотеза неверна? Другими словами, какова
Пусть объемы выборок достаточно велики, так что можно пользоваться асимптотической нормальностью статистики Вилкоксона. Тогда в соответствии с формулами (1) статистика T будет асимптотически нормальна с параметрами$$\begin{aligned} М(T) = (12mn)^{1/2}(1/2-a)(m+n+1)^{-1/2}, \\ D(T)= 12 [(n - 1) b^2 + (m - 1) g^2 + a(1 - a) ] (m+n+1)^{-1}. \end{aligned}$$
Из формул (5) видно большое значение гипотезы$$H_{01}: a = P(X < Y) = 1/2.$$
Если эта гипотеза неверна, то, поскольку $$m < n$$, справедлива оценка$$|M(T)|\ge (12m n (2n+1)^{-1})^{1/2}|1/2 - a|,$$ а потому $$|M(T)|$$ безгранично растет при росте объемов выборок. В то же время, поскольку$$b^2\le\int\limits_0^1 L^2(t)dt\le 1, g^2\le\int\limits_0^1 t^2 dL(t)\le 1, \alpha(1-\alpha)\le 1/4,$$ то$$D(T)\le 12[(n-1)+(m-1)+1/4](m+n+1)^{-1}\le 12.$$
Следовательно, вероятность отклонения гипотезы $$H_{01}$$, когда она неверна, т.е.
Гипотеза (6) является сложной, дисперсия (9), как показывают приводимые ниже примеры, в зависимости от значений $$b^2$$ и $$g^2$$ может быть как больше 1, так и меньше 1, но согласно неравенству (7) никогда не превосходит 12.
Приведем пример двух функций распределения $$F(x)$$ и $$G(x)$$ таких, что гипотеза (6) выполнена, а гипотеза (2) - нет. Поскольку$$a=P(X<Y)=\int\limits_{-\infty}^{+\infty} F(x)dG(x),\; 1-a=P(Y<X)=\int\limits_{-\infty}^{+\infty} G(x)dF(x)$$ и $$a = 1/2$$ в случае справедливости гипотезы (2), то для выполнения условия (6) необходимо и достаточно, чтобы$$\int\limits_{-\infty}^{+\infty} (F(x)-G(x))dF(x)=0,$$ а потому естественно в качестве $$F(x)$$ рассмотреть функцию равномерного распределения на интервале (-1; 1). Тогда формула (11) переходит в условие$$\int\limits_{-\infty}^{+\infty} (F(x)-G(x))dF(x)=-\frac12 \int\limits_{-1}^{+1}\left(G(x)-\frac{(x+1)}{2}\right)dx=0.$$
Это условие выполняется, если функция $$(G(x) - (x + 1)/2)$$ является нечетной.
Пример 2. Пусть функции распределения $$F(x)$$ и $$G(x)$$ сосредоточены на интервале (-1; 1), на котором$$F(x)=(x+1)/2,\; G(x)=(x+1+1/\pi \sin \pi x)/2.$$
Тогда$$x=F^{-1}(t)=2t-1, L(t)=G(F^{-1}(t))=(2t+1/\pi\sin\pi(2t-1))/2=t+1/2\pi\sin\pi(2t-1).$$
Условие (11) выполнено, поскольку функция $$(G(x)-(x+1)/2)$$ является нечетной. Следовательно, $$a = 1/2$$. Начнем с вычисления$$g^2=\int\limits_0^1 t^2 dL(t)=\frac14=\int\limits_0^1 t^2 d(t+\frac{1}{2\pi}\sin\pi(2t-1))=\frac14 .$$
Поскольку$$d\left(t+\frac{1}{2\pi}\sin\pi(2t-1)\right)=(1+\cos\pi(2t-1))dt,$$ то $$g^2=\int\limits_0^1 t^2(1+\cos\pi(2t-1))dt-\frac14 =\frac{1}{12}+\int\limits_0^1 t^2\cos\pi(2t-1)dt$$.
С помощью замены переменных $$t = (x+1)/2$$ получаем, что$$\int\limits_0^1 t^2\cos\pi(2t-1)dt=\frac18 \left( \int\limits_{-1}^1 x^2\cos\pi xdx+ 2\int\limits_{-1}^1 x\cos\pi xdx+ \int\limits_{-1}^1 \cos\pi xdx \right).$$
В правой части последнего равенства стоят табличные интегралы (см., например, справочник [, с.71]). Проведя соответствующие вычисления, получаем, что в правой части стоит $$1/8 (-4/\pi^2) = -1/(2\pi^2 )$$. Следовательно,$$g^2=1/12-1/(2\pi^2)-0,032672733...$$
Перейдем к вычислению $$b^2$$. Поскольку$$b^2=\int\limits_0^1 L^2(t)dt-frac14=\int\limits_0^1 \left(t+\frac12\pi\sin\pi(2t-1)\right)^2-frac14,$$ то$$b^2=frac{1}{12}+\frac{1}{\pi}\int\limits_0^1(t\sin\pi(2t-1))dt+ \left(\frac{\pi}{2}\right)^2\int\limits_0^1\sin^2\pi(2t-1)dt.$$
С помощью замены переменных $$t = (x+1)/2$$ переходим к табличным интегралам (см., например, справочник [, с.65]): b^2=\frac{1}{12}+\frac{1}{4\pi}\int\limits_{-1}^1 x\sin\pi xdx+ \frac{1}{4\pi}\int\limits_{-1}^1 \sin\pi xdx+ \frca{1}{8\pi^2}\int\limits_{-1}^1 \sin^2\pi xdx.
Проведя необходимые вычисления, получим, что$$b^2=\frac{1}{12}+\frac{1}{4\pi}\left(-\frac{2}{\pi}\right) +0+\frac{1}{8\pi^2}=\frac{1}{12}-\frac{3}{8\pi^2}=0,045337893...$$
Следовательно, для рассматриваемых функций распределения нормированная и центрированная статистика Вилкоксона (см. формулу (4)) асимптотически нормальна с математическим ожиданием 0 и дисперсией (см. формулу (9))$$D(T)=(0,544n+0,392m+2,064)(m+n+1)^{-1}.$$
Как легко видеть, дисперсия всегда меньше 1. Это значит, что в рассматриваемом случае гипотеза полной однородности (2) при проверке с помощью критерия Вилкоксона будет приниматься чаще, чем если она на самом деле верна.
На наш взгляд, это означает, что критерий Вилкоксона нельзя считать критерием для проверки гипотезы (2) при альтернативе общего вида. Он не всегда позволяет проверить однородность - не при всех альтернативах. Точно так же критерии типа хи-квадрат нельзя считать критериями проверки гипотез согласия и однородности - они позволяют обнаружить не все различия, поскольку некоторые из них "скрадывает" группировка.
Обсудим теперь, действительно ли критерий Вилкоксона нацелен на проверку равенства медиан распределений, соответствующих выборкам.
Пример 3. Построим семейство
Очевидно, что медиана $$F(x)$$ равна $$\lambda$$, а медиана $$G(x)$$ равна 1/2.
Согласно соотношению (9) для выполнения гипотезы (6) достаточно определить $$\delta$$ как функцию $$\lambda, \delta =\delta(\lambda)$$, из условия$$\int\limits_0^1 F(x)dx=\frac12 .$$
Вычисления дают$$\delta=\delta(\lambda)=3(1-\lambda)/2.$$
Учитывая, что $$\delta$$ лежит между $$\lambda$$ и 1, не совпадая ни с тем, ни с другим, получаем ограничения на $$\lambda$$, а именно, $$1/3 < \lambda < 3/5.$$ Итак, построено искомое семейство
Пример 4. Пусть, как и в примере 3, распределения сосредоточены на интервале (0; 1), и на нем $$F(x)=x$$. А $$G(x)$$ - функция распределения, сосредоточенного в двух точках - $$\beta$$ и 1. Т.е. $$G(x) = 0$$ при $$x$$, не превосходящем $$\beta$$ ; $$G(x) = h$$ на $$(\beta; 1]; G(x)=1$$ при $$x > 1$$. С такой функцией $$G(x)$$ легко проводить расчеты. Однако она не удовлетворяет принятым выше условиям непрерывности и строгого возрастания. Вместе с тем легко видеть, что она является предельной (сходимость в каждой точке отрезка [0; 1]) для последовательности функций распределения, удовлетворяющих этим условиям. А распределение статистики Вилкоксона для пары функций распределения примера 4 является предельным для последовательности соответствующих распределений статистики Вилкоксона, полученных в рассматриваемых условиях непрерывности и строгого возрастания.
Условие $$P(X < Y) = 1/4$$ выполнено, если $$h=(1-\beta)^{-1}/2$$ (при $$\beta$$ из отрезка [0; 1/2]). Поскольку $$h > 1/2$$ при положительном $$\beta$$, то очевидно, что медиана $$G(x)$$ равна $$\beta$$, в то время как медиана $$F(x)$$ равна 1/2 . Значит, при $$\beta = 1/2$$ медианы совпадают, при всех иных положительных $$\beta$$ - различны. При $$\beta = 0$$ медианой $$G(x)$$ является любая точка из отрезка [0; 1].
Легко подсчитать, что в условиях примера 4 параметры предельного распределения имеют вид$$b^2=\beta(1-\beta)^{-1}/4, g^2=(1-2\beta)/4.$$
Следовательно, распределение нормированной и центрированной статистики Вилкоксона будет асимптотически нормальным с математическим ожиданием 0 и дисперсией$$D(T)=3[(n-1)\beta(1-\beta)^{-1}+(m-1)(1-2\beta)+1](m+n+1)^{-1}.$$
Проанализируем величину $$D(T)$$ в зависимости от параметра $$\beta$$ и объемов выборок $$m$$ и $$n$$. При достаточно больших $$m$$ и $$n$$$$D(T)=3w\beta(1-\beta)^{-1}+3(1-w)(1-2\beta),$$ с точностью до величин порядка $$(m+n)^{-1}$$, где $$w= n/(m+n)$$. Значит, $$D(T)$$ - линейная функция от $$w$$, а потому достигает экстремальных значений на границах интервала изменения $$w$$, т.е. при $$w = 0$$ и $$w = 1$$. Легко видеть, что при $$\beta(1-\beta)^{-1}<1-2\beta$$ минимум - $$3\beta(1-\beta)^{-1}$$ (при $$w=1$$ ), а максимум - $$3(1-2\beta)$$ (при $$w = 0)$$. В случае $$\beta(1-\beta)^{-1}>1-2\beta$$ максимум равен $$3\beta(1-\beta)^{-1}$$ (при $$w = 1$$ ), а минимум - $$3(1-2\beta)$$ (при $$w=0$$ ). Если же $$\beta(1-\beta)^{-1}=1-2\beta$$ (это равенство справедливо при $$\beta=\beta_0=1-2^{-1/2}=0,293)$$, то $$D(T)=3(2^{1/2}-1)=1,2426..$$. при всех $$w$$ из отрезка [0; 1].
Первый из описанных выше случаев имеет место при $$\beta<\beta_0$$, при этом минимум $$D(T)$$ возрастает от 0 (при $$\beta=0, w=1$$ - предельный случай) до $$3(2^{1/2}-1)$$ (при $$\beta=\beta_0, w$$ - любом), а максимум уменьшается от 3 (при $$\beta=0, w=0$$ - предельный случай) до $$3(2^{1/2}-1)$$ (при $$\beta=\beta_0, w$$ - любом). Второй случай относится к $$\beta$$ из интервала $$(\beta;1/2]$$. При этом минимум убывает от приведенного выше значения для $$\beta=\beta_0$$ до 0 (при $$\beta=1/2, w=0$$ - предельный случай), а максимум возрастает от того же значения при $$\beta=\beta_0$$ до 3 (при $$\beta=1/2, w=0$$ ).
Таким образом, $$D(T)$$ может принимать все значения из интервала (0; 3) в зависимости от значений $$\beta$$ и $$w$$. Если $$D(T)< 1$$, то при применении критерия Вилкоксона к выборкам с рассматриваемыми функциями распределения гипотеза однородности (2) будет приниматься чаще (при соответствующих значениях $$\beta$$ и $$w$$ - с вероятностью, сколь угодно близкой к 1), чем если бы она самом деле была верна. Если $$1<D(T)<3$$, то гипотеза (2) также принимается достаточно часто. Так, если уровень
Гипотеза сдвига. При проверке гипотезы однородности мы рассмотрели различные виды нулевых и альтернативных гипотез - гипотезу (2) и ее отрицание в качестве альтернативы, гипотезу (6) и ее отрицание, гипотезы о равенстве или различии медиан. В теоретических работах по математической статистике часто рассматривают гипотезу сдвига, в которой альтернативой гипотезе (2) является гипотеза$$H_1: F(x) = G(x+r)$$ при всех $$x$$ и некотором сдвиге $$r$$, отличным от 0. Если верна альтернативная гипотеза $$H_1$$, то вероятность $$P(X < Y)$$ отлична от 1/2, а потому при альтернативе (12) критерий Вилкоксона является состоятельным.
В некоторых прикладных постановках гипотеза (12) представляется естественной. Например, если одним и тем же прибором проводятся две серии измерений двух значений некоторой величины (физической, химической и т.п.). При этом функция распределения $$G(x)$$ описывает погрешности измерения одного значения, а $$G(x+r)$$ - другого. Вопреки распространенному заблуждению, хорошо известно, что распределение погрешностей измерений, как правило, не является нормальным (см. об этом лекцию 5). Однако при анализе конкретных статистических данных, как правило, нет никаких оснований считать, что отсутствие однородности всегда выражается столь однозначным образом, как следует из формулы (12). Поэтому эконометрику для проверки однородности необходимо использовать
Почему же математики так любят гипотезу сдвига (12)? Да потому, что она дает возможность доказывать глубокие математические результаты, например, об асимптотической оптимальности критериев. К сожалению, с точки зрения эконометрики это напоминает поиск ключей под фонарем, где светло, а не там, где они потеряны.
Отметим еще одно обстоятельство. Часто говорят (в соответствии с классическим подходом математической статистики), что нельзя проверять нулевые гипотезы без рассмотрения альтернативных. Однако при анализе данных технических, экономических, медицинских или иных исследований зачастую полностью ясна формулировка той гипотезы, которую желательно проверить (например, гипотезы полной однородности - см. формулу (2)), в то время как формулировка альтернативной гипотезы не очевидна (то ли это гипотеза о неверности равенства (2) хотя бы для одного значения x, то ли это альтернатива (8), то ли - альтернатива сдвига (12), и т. д.). В таких случаях целесообразно "обернуть" задачу - исходя из статистического критерия найти альтернативы, относительно которых он состоятелен. Именно это и проделано в настоящем параграфе для критерия Вилкоксона.
Подведем итоги рассмотрения критерия Вилкоксона.
Например, в литературе по математической статистике часто говорится, что для проверки нормальности используются критерии
Так что недостатки критерия Вилкоксона не являются исключением, мощность ряда иных популярных в математической статистике критериев заслуживает тщательного изучения, при этом заранее можно сказать, что зачастую они не позволяют проверять те гипотезы, с которыми традиционно связаны. При применении подобных критериев к анализу реальных данных необходимо тщательно взвешивать их достоинства и недостатки.
В соответствии с методологией прикладной статистики естественно потребовать, чтобы рекомендуемый для массового использования в технических, экономических, медицинских и иных исследованиях критерий однородности был состоятельным. Напомним: это значит, что для любых отличных друг от друга функций распределения $$F(x)$$ и $$G(x)$$ (другими словами, при справедливости альтернативной гипотезы $$H_1$$ ) вероятность отклонения гипотезы $$H_0$$ должна стремиться к 1 при увеличении объемов выборок т и п. Из перечисленных выше (в конце 8.2) критериев однородности состоятельными являются только критерии Смирнова и типа омега-квадрат.
Проведенное исследование мощности (
Критерий Смирнова однородности двух независимых выборок. Он предложен членом-корреспондентом АН СССР Н.В. Смирновым в 1939 г. (см. справочник []). Единственное ограничение - функции распределения $$F(x)$$ и $$G(x)$$ должны быть непрерывными. Напомним, что согласно Л.Н. Большеву и Н.В. Смирнову [] значение
где $$x'_1<x'_2<...<x'_m$$ - элементы первой выборки $$x_1,x_2,...,x_m$$, переставленные в порядке возрастания, а $$y'_1<y'_2<...<y'_n$$ - элементы второй выборки $$y_1,y_2,...,y_n,$$ также переставленные в порядке возрастания. Поскольку функции распределения $$F(x)$$ и $$G(x)$$ предполагаются непрерывными, то вероятность совпадения каких-либо выборочных значений равна 0.
Разработаны алгоритмы и программы для ЭВМ, позволяющие рассчитывать точные распределения, процентные точки и достигаемый уровень значимости для двухвыборочной статистики Смирнова $$D_{m,n}$$, а также подробные таблицы (см., например, методику [6], содержащую описание алгоритмов, тексты программ и подробные таблицы).
Однако у критерия Смирнова есть и недостатки. Его распределение сосредоточено в сравнительно небольшом числе точек, поэтому функция распределения растет большими скачками. В результате не удается выдержать заданный уровень значимости. Реальный уровень значимости может в несколько раз отличаться от номинального (подробному обсуждению неклассического феномена существенного отличия реального уровня значимости от номинального посвящена работа []).
Критерий типа омега-квадрат (Лемана-Розенблатта). Статистика критерия типа омега-квадрат для проверки однородности двух независимых выборок имеет вид:$$A=\frac{mn}{m+n}\int\limits_{-\infty}^{+\infty}(F_m(x)-G_n(x))^2 dH_{m+n}(x),$$ где $$H_{m+n}(x)$$ - эмпирическая функция распределения, построенная по объединенной выборке. Легко видеть, что$$H_{m+n}(x)=\frac{m}{m+n}F_m(x)+\frac{n}{m+n}G_n(x).$$
Статистика $$A$$ типа омега-квадрат была предложена Э. Леманом в 1951 г., изучена в 1952 г. М. Розенблаттом, а затем и другими исследователями. Она зависит лишь от рангов элементов двух выборок в объединенной выборке. Пусть $$x_1,x_2,...,x_m$$ - первая выборка, $$x'_1<x'_2<...x'_m$$ - соответствующий вариационный ряд, $$y_1,y_2,...,y_n$$ - вторая выборка, $$y'_1<y'_2<...<y'_n$$ - вариационный ряд, соответствующий второй выборке. Поскольку функции распределения независимых выборок непрерывны, то с вероятностью 1 все выборочные значения различны, совпадения отсутствуют. Статистика $$A$$ представляется в виде (см., например, []):$$A=\frac{1}{mn(m+n)}[m\sum_{i=1}^m(r_i-i)^2+n\sum_{j=1}^n(s_j-j^2)]-\frac{4mn-1}{6(m+n)},$$ где $$r_i$$ - ранг $$x'_i$$ и $$s_j$$ - ранг $$y'j$$ в общем вариационном ряду, построенном по объединенной выборке.
Правила принятия решений при проверке однородности двух выборок на основе статистик Смирнова и типа омега-квадрат, т.е. таблицы критических значений в зависимости от уровней значимости и объемов выборок, приведены, например, в [].
Рекомендации по выбору критерия однородности. Для критерия типа омега-квадрат нет выраженного эффекта различия между номинальными и реальными уровнями значимости. Поэтому мы рекомендуем для проверки однородности функций распределения (гипотеза $$H_0$$ ) применять статистику $$A$$ типа омега-квадрат. Если методическое, табличное или программное обеспечение для статистики Лемана - Розенблатта отсутствует, рекомендуем использовать критерий Смирнова. Для проверки однородности математических ожиданий (гипотеза $$H'_0$$ ) целесообразно применять критерий Крамера-Уэлча. По нашему мнению, статистики Стьюдента, Вилкоксона и др. допустимо использовать лишь в отдельных частных случаях, рассмотренных выше.
Некоторые соображения о внедрении современных методов прикладной статистики в практику технических, экономических, медицинских и иных исследований. Даже из проведенного выше разбора лишь одной из типичных статистических задач - задачи проверки однородности двух независимых выборок - можно сделать вывод о целесообразности широкого развертывания работ по критическому анализу сложившейся практики статистической обработки данных и по внедрению накопленного арсенала современных методов прикладной статистики. По нашему мнению, широкого внедрения заслуживают, в частности, методы многомерного статистического анализа, планирования эксперимента, статистики объектов нечисловой природы. Очевидно, рассматриваемые работы должны быть плановыми, организационно оформленными, проводиться мощными самостоятельными организациями и подразделениями. Целесообразно создание службы статистических консультаций в системе научно-исследовательских учреждений и вузов технического, экономического, медицинского профиля.
Начнем с практического примера. Приведем письмо главного инженера подмосковного химического комбината (некоторые названия изменены).
Наш комбинат выпускает мастику по ГОСТ (следует номер) и является разработчиком указанного стандарта.
В результате исследовательских работ по подбору стандартного метода определения вязкости мастики на комбинате накоплен большой опыт сравнительных данных определения вязкости по двум методам:
Учитывая высокую компетентность сотрудников Вашего института, прошу Вас, в порядке оказания технической помощи нашему предприятию, поручить соответствующей лаборатории провести обработку представленных данных современными статистическими методами и выдать заключение о наличии (или отсутствии) зависимости между указанными выше методами определения вязкости мастики. Ваше заключение необходимо для решения спорного вопроса о целесообразности вновь ввести в ГОСТ (следует номер) метода определения вязкости мастики по вискозиметру ВЗ-4, который, по мнению некоторых потребителей, был необоснованно исключен из этого ГОСТ по изменению № 1.
Заранее благодарю Вас за оказанную помощь.
Приложение: статистика на 3 листах.
Главный инженер (Подпись) (Фамилия, имя, отчество)"Комментарий. Вязкость - один из показателей качества мастики. Измерять его можно с помощью различных способов, которые, как оказалось, дают разные результаты. Ничего необычного в этом нет. Однако поставщику и потребителю следует согласовать способы измерения показателей качества. Иначе достаточно часто поставщик (производитель) будет утверждать, что он выполнил условия контракта, а потребитель заявлять, что нет. Такая конфликтная ситуация иногда называется арбитражной, поскольку для ее решения стороны могут обращаться в арбитражный суд. Простейший метод согласования способов измерения показателей состоит в том, чтобы выбрать один из них и внести в государственный стандарт, который тем самым будет содержать не только описание продукции, перечень ее показателей качества и требований к ним, но и способы измерения этих показателей.
Заключение по статистическим данным, представленным химическим комбинатом. Для каждой из 213 партий мастики представлены два числа - результат измерения вязкости на нестандартном приборе фабрики им. Петрова и результат измерения вязкости на стандартном вискозиметре ВЗ-4. Требуется установить, дают ли два указанных метода сходные результаты. Если они дают сходные результаты, то нет необходимости вводить в соответствующий ГОСТ указание о методе определения вязкости. Если же методы дают существенно различные результаты, то подобное указание ввести необходимо.
Для применения статистических методов в рассматриваемой задаче необходимо описать вероятностную модель. Считаем, что статистические данные имеют вид $$(x_i,y_i),i=1,2,...,213$$ где $$x_i$$ - результат измерения на нестандартном приборе фабрики им. Петрова в $$i$$ -ой партии, а $$y_i$$ - результат измерения вязкости на стандартном вискозиметре ВЗ-4 в той же $$i$$ -ой партии. Пусть $$a_i$$ - истинное значение показателя качества в $$i$$ -ой партии. Естественно считать, что указанные выше случайные векторы независимы в совокупности. При этом они не являются одинаково распределенными, поскольку отличаются истинными значениями показателей качества $$a_i$$. Принимаем, что при каждом $$i$$ случайные величины $$x_i - a_i$$ и $$y_i - a_i$$ независимы и одинаково распределены. Это условие и означает однородность в связанных выборках. Параметры связи - величины $$a_i$$. Их наличие не позволяет объединить первые координаты в одну выборку, вторую - во вторую, как делалось в случае проверки однородности двух независимых выборок.
В предположении непрерывности функций распределения из условия однородности в связанных выборках вытекает, что$$P(x_i<y_i)=P(x_i\ge y_i)=\frac12 .$$
Рассмотрим случайные величины $$Z_i=x_i-y_i, i=1,2,...,213$$. Из последнего соотношения вытекает, что при справедливости гипотезы однородности для связанных выборок эти случайные величины имеют нулевые медианы. Другими словами, проверка того, что методы измерения вязкости дают схожие результаты, эквивалентна проверке равенства 0 медиан величин $$Z_i$$.
Для проверки гипотезы о том, что медианы величин $$Z_i$$ нулевые, применим широко известный критерий знаков (см., например, справочник [, с.89-91]). Согласно этому критерию необходимо подсчитать, в скольких партиях $$x_i<y_i$$ и в скольких $$x_i\ge y_i$$. Для представленных химическим комбинатом данных $$x_i<y_i$$ в 187 случаях из 213 и $$x_i\ge y_i$$ в 26 случаях из 213.
Если рассматриваемая гипотеза верна, то число $$W$$ осуществлений события $$\{x_i<y_i\}$$ имеет
Таким образом, статистический анализ показывает, что два метода дают существенно различные результаты - по прибору фабрики им. Петрова результаты измерений, как правило, меньше, чем по вискозиметру ВЗ-4. Это означает, что в соответствующий ГОСТ целесообразно ввести указание на метод определения вязкости.
Система вероятностных моделей при проверке гипотезы однородности для связанных выборок. Как и в случае проверки однородности для независимых выборок, система вероятностных моделей состоит из трех уровней. Наиболее простая модель - на уровне однородности альтернативного признака - уже рассмотрена. Она сводится к проверке гипотезы о значении параметра
Речь идет о "критерии знаков". При справедливости гипотезы однородности число $$W$$ осуществлений события $$\{x_i<y_i\}$$ имеет
Гипотезу $$p = 1/2$$ можно проверять как непосредственно с помощью
Второй
Альтернативная гипотеза также является непараметрической и имеет вид:$$H_{11}:M(Z_j)\ne 0.$$
Как и в случае проверки гипотезы однородности для независимых выборок с помощью критерия Крамера-Уэлча, в рассматриваемой ситуации естественно использовать статистику$$Q=\sqrt{n}\frac{\overline{Z}}{s(Z)},$$
где$$\overline{Z}=\frac{Z_1+Z_2+...+Z_n}{n}$$
среднее арифметическое разностей, а$$s(Z)=\sqrt{\frac{1}{n-1}\sum_{j=1}^n(Z_j-\overline{Z})^2}$$
Третий
При этом предполагается, что все участвующие в вероятностной модели случайные величины независимы (в совокупности) между собой.
Отметим одно важное свойство функции распределения случайной величины $$Z$$. Если случайные величины $$X$$ и $$Y$$ независимы и одинаково распределены, то для функции распределения $$H(x)=P(Z\le x)$$ случайной величины $$Z = X - Y$$ выполнено, как нетрудно видеть, соотношение$$H(-x)=1-H(x)$$
Это соотношение означает симметрию функции распределения относительно 0. Плотность такой функции распределения является четной функцией, ее значения в точках $$x$$ и $$(-x)$$ совпадают.
Проверка гипотезы однородности связанных выборок в наиболее общем случае сводится к проверке симметрии функции распределения разности $$Z = X - Y$$ относительно 0.
Рассмотрим методы проверки гипотезы симметрии функции распределения относительно 0. Сначала обсудим, какого типа отклонения от гипотезы симметрии можно ожидать при альтернативных гипотезах?
Как и в случае проверки однородности независимых выборок, в зависимости от вида альтернативной гипотезы выделяют два подуровня моделей. Рассмотрим сначала альтернативу сдвига$$H_{13}:G(x)=F(x+a).$$
В этом случае распределение $$Z$$ при альтернативе отличается сдвигом от симметричного относительно 0. Для проверки гипотезы однородности может быть использован критерий знаковых рангов, разработанный Вилкоксоном (см., например, справочник [, с.46-53]).
Он строится следующим образом. Пусть $$R(Z_j)$$ является рангом $$|Zj|$$ в ранжировке от меньшего к большему абсолютных значений разностей $$|Z_1|, |Z_2|,...,|Z_n|, j=1,2,...,n$$. Положим для $$j=1,2,...,n$$$$Q(Z_j)= \left\{ \begin{aligned} 1,Z_j>0, 0,Z_j<0. \end{aligned} \right.$$
Статистика критерия знаковых рангов имеет вид$$W^+=\sum_{j=1}^n R(Z_j)Q(Z_j).$$
Таким образом, нужно просуммировать ранги положительных разностей в вариационном ряду, построенном стандартным образом по абсолютным величинам всех разностей.
Для практического использования статистики критерия знаковых рангов Вилкоксона либо обращаются к соответствующим таблицам и программному обеспечению, либо применяют асимптотические соотношения. При выполнении нулевой гипотезы статистика$$W^{++}=\frac{W^+-\frac{n(n+1)}{4}}{\sqrt{\frac{n(n+1)(2n+1)}{24}}}$$
имеет асимптотическое (при $$n\rightarrow\infty$$ ) стандартное нормальное распределение с математическим ожиданием 0 и дисперсией 1. Следовательно, правило принятия решений на уровне значимости 5% имеет обычный вид: если$$|W^{++}|\le 1,96,$$
то гипотезу однородности связанных выборок по критерию знаковых рангов Вилкоксона принимают, в противном случае - отклоняют. Как обычно, при желании использовать другой уровень значимости применяют в качестве критического значения иной
Альтернативная гипотеза общего вида записывается как$$H_{14}:H(-x_0)\ne 1-H(x_0)$$ при некотором $$х_0$$. Таким образом, проверке подлежит гипотеза симметрии относительно 0, которую можно переписать в виде$$H(x)+H(-x)-1=0.$$
Для построенной по выборке $$Z_j = х_j - у_j , j = 1,2,...,n$$,
Как измерять отличие от 0? По тем же соображениям, что и в предыдущем параграфе, целесообразно использовать статистику типа омега-квадрат. Соответствующий критерий был предложен в работе []. Он имеет вид \omega_n^2=\sum_{j=1}^n(H_n(Z_j)+H_n(-Z_j)-1)^2
В работе [] найдено предельное распределение этой статистики:$$\lim_{n\rightarrow\infty}P(\omega_n^2< x)=S_0(x).$$
В табл.8.2 приведены критические значения статистики типа омега-квадрат для проверки симметрии распределения (и тем самым для проверки однородности связанных выборок), соответствующие наиболее распространенным значениям уровней значимости (расчеты проведены Г.В. Мартыновым). При практических вычислениях удобнее принять, что эмпирическая функция распределения $$H_n(x)$$ - это доля результатов наблюдений, не превосходящих $$x$$.
Как следует из табл.8.2, правило принятия решений при проверке однородности связанных выборок в наиболее общей постановке и при уровне значимости 5% формулируется следующим образом: вычислить статистику $$\omega_n^2$$. Если $$\omega_n^2\le 1,66$$, то принять гипотезу однородности. В противном случае - отвергнуть.
| Значение функции распределения $$S_0(x)$$ | Уровень значимости $$\alpha=1-S_0(x)$$ | Критическое значение х статистики $$\omega_n^2$$ |
|---|---|---|
| 0,90 | 0,10 | 1,20 |
| 0,95 | 0,05 | 1,66 |
| 0,99 | 0,01 | 2,80 |
Пример. Пусть величины $$Z_j, j=1,2,...,20$$, таковы:$$\begin{gathered} 20, 18, (-2), 34, 25, (-17), 24, 42, 16, 26, \\ 13, (-23), 35, 21, 19, 8, 27, 11, (-5), 7. \end{gathered}$$
Соответствующий вариационный ряд $$Z(1)<Z(2)<...<Z(20)$$ имеет вид:$$\begin{gathered} (-23) < (-17) < (-5) < (-2) < 7 < 8 < 11 < 13 < 16 < 18 < \\ < 19 < 20 < 21 < 24 < 25 < 26 < 27 < 34 < 35 < 42. \end{gathered}$$
Для расчета значения статистики $$\omega_n^2$$ построим табл.8.3 из 7 столбцов и 20 строк, не считая заголовков столбцов (сказуемого таблицы). В первом столбце указаны номера (ранги) членов вариационного ряда, во втором - сами эти члены, в третьем - значения
| $$j$$ | $$Z(j)$$ | $$H_n(Z(j))$$ | $$-Z(j)$$ | $$H_n(-Z(j))$$ | $$H_n(Z(j))+H_n(-Z(j))-1$$ | $$(H_n(Z(j))+H_n(-Z(j))-1)^2$$ |
|---|---|---|---|---|---|---|
| 1 | -23 | 0,05 | 23 | 0,65 | -0,30 | 0,09 |
| 2 | -17 | 0,10 | 17 | 0,45 | -0,45 | 0,2025 |
| 3 | -5 | 0,15 | 5 | 0,20 | -0,65 | 0,4225 |
| 4 | -2 | 0,20 | 2 | 0,20 | -0,60 | 0,36 |
| 5 | 7 | 0,25 | -7 | 0,10 | -0,65 | 0,4225 |
| 6 | 8 | 0,30 | -8 | 0,10 | -0,60 | 0,36 |
| 7 | 11 | 0,35 | -11 | 0,10 | -0,55 | 0,3025 |
| 8 | 13 | 0,40 | -13 | 0,10 | -0,50 | 0,25 |
| 9 | 16 | 0,45 | -16 | 0,10 | -0,45 | 0,2025 |
| 10 | 18 | 0,50 | -18 | 0,05 | -0,45 | 0,2025 |
| 11 | 19 | 0,55 | -19 | 0,05 | -0,40 | 0,16 |
| 12 | 20 | 0,60 | -20 | 0,05 | -0,35 | 0,1225 |
| 13 | 21 | 0,65 | -21 | 0,05 | -0,30 | 0,09 |
| 14 | 24 | 0,70 | -24 | 0 | -0,30 | 0,09 |
| 15 | 25 | 0,75 | -25 | 0 | -0,25 | 0,0625 |
| 16 | 26 | 0,80 | -26 | 0 | -0,20 | 0,04 |
| 17 | 27 | 0,85 | -27 | 0 | -0,15 | 0,0225 |
| 18 | 34 | 0,90 | -34 | 0 | -0,10 | 0,01 |
| 19 | 35 | 0,95 | -35 | 0 | -0,05 | 0,0025 |
| 20 | 42 | 1,00 | -42 | 0 | 0 | 0 |
Результаты расчетов (суммирование значений по седьмому столбцу табл.8.3) показывают, что значение статистики $$\omega_n^2=3,055$$. В соответствии с табл.8.2 это означает, что на любом используемом в прикладных эконометрических исследованиях уровнях значимости отклоняется гипотеза симметрии распределения относительно 0 (а потому и гипотеза однородности в связанных выборках).
В настоящей лекции затронута лишь небольшая часть непараметрических методов анализа числовых статистических данных. В частности, обратим внимание на непараметрические оценки плотности, которые используются для описания данных, проверки однородности, в задачах восстановления зависимостей и других областях прикладной статистики. Непараметрические оценки плотности рассмотрены в лекции 5.
| $$N$$ | $$n_1$$ | $$\overline{X}$$ | $$s_x$$ | $$n_2$$ | $$\overline{Y}$$ | $$s_y$$ |
|---|---|---|---|---|---|---|
| 1 | 100 | 13,7 | 7,3 | 200 | 12,1 | 2,5 |
| 2 | 200 | 10,2 | 5,3 | 400 | 12,0 | 1,7 |
| Первая выборка | 33 | 27 | 12 | 27 | 39 | 42 | 47 | 48 | 50 | 32 |
| Вторая выборка | 11 | 20 | 30 | 31 | 22 | 18 | 17 | 25 | 28 | 29 |
| $$j$$ | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| $$X_j$$ | 74 | 79 | 65 | 69 | 71 | 66 | 71 | 73 | 72 | 68 |
| $$Y_j$$ | 73 | 65 | 71 | 69 | 70 | 69 | 78 | 70 | 60 | 62 |
| $$j$$ | 11 | 12 | 13 | 14 | 15 | 16 | 17 | 18 | 19 | 20 |
| $$X_j$$ | 70 | 69 | 76 | 74 | 72 | 69 | 74 | 72 | 77 | 75 |
| $$Y_j$$ | 61 | 67 | 73 | 67 | 73 | 64 | 67 | 65 | 63 | 70 |
Примечание. Для уровня значимости 0,05 критическим значением для критерия Смирнова является 0,7 (т.е. гипотеза однородности отклоняется, если значение статистики Смирнова не менее 0,7). Для того же уровня значимости критическим значением для критерия типа омега-квадрат (Лемана-Розенблатта) является 0,461.
Одна из основных задач прикладной статистики - оценивание по выборочным данным характеристик генеральной совокупности, таких, как математическое ожидание, медиана, дисперсия, среднее квадратическое отклонение,
Пусть исходные данные - это выборка $$x_1, x_2, ..., x_n$$, где $$n$$ -
В расчетах будут использоваться
Точечное и интервальное оценивание математического ожидания. Точечной оценкой для математического ожидания в силу закона больших чисел является
Нижняя доверительная граница для математического ожидания имеет вид$$\overline{X}-U(p)s_0/n^{1/2},$$ где:
Верхняя доверительная граница для математического ожидания имеет вид$$\overline{X}+U(p)s_0/n^{1/2}.$$
Выражения для верхней и нижней доверительных границ получены с помощью Центральной предельной теоремы теории вероятностей, теоремы о наследовании сходимости и других результатов лекция 4. Они являются асимптотическими, т.е. становятся тем точнее, чем больше
Интересно сопоставить с параметрическим подходом. Обычно в таких случаях предполагают нормальность результатов наблюдений (которой, как уже было обосновано в лекции 5, практически никогда нет). Тогда формулы для нижней и верхней доверительных границ для математического ожидания имеют похожий вид, только вместо $$U(p)$$ стоят квантили распределения Стьюдента (а не нормального распределения, как в приведенных выше формулах), соответствующие объему выборки. Как известно, при росте объема выборки квантили распределения Стьюдента сходятся к соответствующим квантилям стандартного нормального распределения, так что при больших объемах выборок оба подхода дают близкие результаты. Отметим, что классические доверительные интервалы несколько длиннее, поскольку квантили распределения Стьюдента больше квантилей стандартного нормального распределения, хотя это различие, на наш взгляд, и невелико.
Пример 1. Рассмотрим данные о наработке резцов до отказа (см. 6.1, табл.6.2). Для них
Если заранее известно, что результаты наблюдения имеют нормальное распределение, то нижняя и верхняя доверительная границы для математического ожидания определяются по формулам$$\overline{X}-t(p,n-1)s_0/\sqrt{n},\;\overline{X}+t(p,n-1)s_0/\sqrt{n}$$
соответственно. Эти формулы отличаются от предыдущих тем, что
Для
Отметим, что рассматриваемые данные согласуются с гамма-распределением (см. 7.1), а не с нормальным распределением, поэтому использование распределения Стьюдента для получения доверительных границ явно некорректно.
Иногда рекомендуют сначала проверить нормальность результатов наблюдений, а потом, в случае принятия гипотезы нормальности, рассчитывать доверительные границы с использованием квантилей распределения Стьюдента. Однако проверка нормальности - более сложная статистическая процедура, чем оценивание математического ожидания. Кроме того, применение одной статистической процедуры, как правило, нарушает предпосылки следующей процедуры, в частности, независимость результатов наблюдений (см. 7.5). Поэтому цепочка статистических процедур, следующих друг за другом, как правило, образует статистическую технологию, свойства которой неизвестны на современном уровне развития прикладной статистики.
Из сказанного вытекает, что только непараметрическую статистическую процедуру, основанную на асимптотических результатах лекции 4, следует применять для анализа реальных данных. Как правило, встречающиеся на практике распределения не являются нормальными (см. 5.1), а потому применение квантилей распределения Стьюдента неправомерно.
Точечное и интервальное оценивание медианы. Точечной оценкой для медианы является выборочная медиана.
Пример 2. Для данных о наработке резцов до отказа
Чтобы построить доверительные границы для медианы, по
Пример 3. Для данных о наработке резцов до отказа $$n = 50$$. Рассмотрим как обычно, доверительную вероятность $$p = 0,95$$. Тогда$$C(p)=[50/2-1,96\sqrt{50}/2]=[18,07]=18.$$
Следовательно, нижней доверительной границей является $$X(18) = 47,5$$, а верхней доверительной границей $$X(50 + 1 - 18) = X(33) = 61,5$$.
Поскольку в случае нормального распределения медиана совпадает с математическим ожиданием, то каких-либо специальных способов ее оценивания в классическом случае нет.
Точечное и интервальное оценивание дисперсии. Точечной оценкой дисперсии является выборочная дисперсия $$s_0^4$$. Эта оценка является несмещенной и состоятельной. Доверительные границы находятся с помощью величины$$d^2=(m_4-((n-1)/n)^4 s_0^4)/n,$$
где $$m_4$$ - выборочный четвертый центральный момент, т.е. $$m_4=\{(X_1-\overline{X})^4+(X_2-\overline{X})^4+...+(X_n-\overline{X})^4\}/n$$.
Нижняя доверительная граница для дисперсии случайной величины имеет вид$$s_0^2-U(p)d,$$ где:
Верхняя доверительная граница для дисперсии случайной величины имеет вид$$s_0^2+U(p)d,$$ где все составляющие имеют тот же смысл, что и выше.
При выводе приведенных соотношений используется асимптотическая нормальность выборочной дисперсии, установленная, например, в учебнике по математической статистике [, с.419]. Соответственно
Пример 4. Для данных о наработке резцов до отказа
Тогда $$d = 161,03$$. Для
Пример 5. В случае нормального распределения с целью быстрого получения доверительного интервала величина $$d^2$$ оценивается как$$(2s_0^4)/n=(2\cdot 663,00^2)/50=17582,76,$$
а потому $$d = 132,6$$. Для
Сужение границ для дисперсии вполне естественно. Данные о наработке резцов до предельного состояния (т.е. до отказа) соответствуют гамма-распределению, а это распределение является асимметричным, с "тяжелым" правым "хвостом". Последнее означает, что плотность убывает заметно медленнее, чем для нормального распределения. Как следствие, четвертый момент заметно больше, чем для нормального распределения с теми же математическим ожиданием и дисперсией. А потому больше и параметр $$d$$. Из проведенных расчетов видно, что использование алгоритмов расчетов, соответствующих нормальному распределению, в ситуации, когда распределение результатов наблюдений отлично от нормального, может привести к заметно искаженным выводам.
Пример 6. В классическом случае нормального распределения исходят из того, что величина $$(n-1)s_0^2/\gigma^2$$ имеет распределение хи-квадрат с $$(n - 1)$$ степенью свободы. Для
Полученный
Точечное и интервальное оценивание среднего квадратического отклонения. Точечной оценкой является
Нижняя доверительная граница для среднего квадратического отклонения исходной случайной величины имеет вид$$s_0-U(p)d/(2s_0),$$ где:
Верхняя доверительная граница для среднего квадратического отклонения исходной случайной величины имеет вид$$s_0+U(p)d/(2s_))$$ , где все составляющие имеют тот же смысл, что и выше.
Пример 7. Для данных о наработке резцов до отказа точечной оценкой для среднего квадратического отклонения является $$s_0=\sqrt{663,00}=25,75$$. При
Соответственно верхняя доверительная граница симметрична нижней относительно точечной оценки и равна 25,75+6,13=31,88.
Правила интервального оценивания для среднего квадратического отклонения получены из аналогичных правил для оценивания дисперсии с помощью метода
Поскольку среднее квадратическое отклонение - это квадратный корень их дисперсии, то доверительные границы можно получить, извлекая квадратные корни из одноименных границ для дисперсии.
Пример 8. Для данных о наработке резцов до отказа при
Классический подход, основанный на гипотезе нормальности распределения результатов наблюдения, связан с использованием распределения хи-квадрат и сводится к извлечению квадратных корней из доверительных границ для дисперсии.
Пример 9. Применяя формально классический подход к данным о наработке резцов до отказа, исходим из доверительного интервала для дисперсии [462,63; 1029,54], соответствующего
Точечное и интервальное оценивание
Дисперсия выборочного
Нижняя доверительная граница для (теоретического)
Верхняя доверительная граница для (теоретического)
Как и в предыдущих случаях,
Пример 10. Для данных о наработке резцов до отказа
Рассчитаем значение вспомогательной величины$$\begin{gathered} D^2 = ((0,4449)^4 - (0,4449)^2 / 4 + 1702050,71 / (4 \cdot 663,00\cdot(57,88)^2) - \\ - 14927,91 / (57,88)^3 ) / 50 = (0,0392 - 0,0495 + 0,1916 - 0,0770)/50 = \\ = 0,1043/50 = 0,002086. \end{gathered}$$
Следовательно, $$D = 0,04567$$. При
Среди классических результатов математической статистики, основанных на гипотезе нормальности результатов наблюдений, нет методов построения доверительных границ для
Примеры применения доверительных границ для
В прикладных исследованиях часто возникает необходимость выяснить, различаются ли генеральные совокупности, из которых взяты две независимые выборки. Например, надо выяснить, влияет ли способ упаковки подшипников на их потребительские качества через год после хранения. Или: отличается ли потребительское поведение мужчин и женщин. Если отличается - рекламные ролики и плакаты надо делать отдельно для мужчин и отдельно для женщин. Если нет - рекламная кампания может быть единой.
В математико-статистических терминах постановка задачи такова: имеются две выборки $$x_1, x_2,...,x_m$$ и $$y_1, y_2,...,y_n$$ (т. е. наборы из $$m$$ и $$n$$ действительных чисел), требуется проверить их однородность. Термин "однородность" уточняется ниже.
Противоположным понятием является "различие". Можно переформулировать задачу: требуется проверить, есть ли различие между выборками. Если различия нет, то для дальнейшего изучения две рассматриваемые выборки часто объединяют в одну.
Например, в маркетинге важно выделить сегменты потребительского рынка. Если установлена однородность двух выборок, то возможно объединение сегментов, из которых они взяты, в один. В дальнейшем это позволит осуществлять по отношению к ним одинаковую маркетинговую политику (проводить одни и те же рекламные мероприятия и т.п.). Если же установлено различие, то поведение потребителей в двух сегментах различно, объединять эти сегменты нельзя, и могут понадобиться различные маркетинговые стратегии, своя для каждого из этих сегментов.
Традиционный метод проверки однородности (критерий Стьюдента). Для дальнейшего критического разбора опишем традиционный статистический метод проверки однородности. Вычисляют
По заданному уровню значимости $$\alpha$$ и числу степеней свободы $$(m+n - 2)$$ из таблиц распределения Стьюдента находят критическое значение $$t_{\kappa p}$$. Если $$|t|>t_{\kappa p}$$, то гипотезу однородности (отсутствия различия) отклоняют, если же $$|t|\le t_{\kappa p}$$, - то принимают. (При односторонних альтернативных гипотезах вместо условия $$|t|>t_{\kappa p}$$ проверяют, что $$t>t_{\kappa p}$$ ; эту постановку рассматривать не будем, так как в ней нет принципиальных отличий от обсуждаемой здесь.)
Рассмотрим условия применимости традиционного метода проверки однородности, основанного на использовании статистики $$t$$ Стьюдента, а также укажем более современные методы.
Вероятностная модель порождения данных. Для обоснованного применения статистических методов необходимо прежде всего построить и обосновать вероятностную модель порождения данных. При проверке однородности двух выборок общепринята модель, в которой $$x_1, x_2,...,x_m$$ рассматриваются как результаты $$m$$ независимых наблюдений некоторой случайной величины $$X$$ с функцией распределения $$F(x)$$, неизвестной статистику, а $$y_1, y_2,...,y_n$$ - как результаты п независимых наблюдений, вообще говоря, другой случайной величины $$Y$$ с функцией распределения $$G(x)$$, также неизвестной статистику. Предполагается также, что наблюдения в одной выборке не зависят от наблюдений в другой, поэтому выборки и называют независимыми.
Возможность применения модели в конкретной реальной ситуации требует обоснования. Независимость и одинаковая распределенность результатов наблюдений, входящих в выборку, могут быть установлены или исходя из методики проведения конкретных наблюдений, или путем проверки статистических гипотез независимости и одинаковой распределенности с помощью соответствующих критериев [].
Если проведено $$(m+n)$$ измерений объемов продаж в $$(m+n)$$ торговых точках, то описанную выше модель, как правило, можно применять. Если же, например, $$x_i$$ и $$y_i$$ - объемы продаж одного и того же товара до и после определенного рекламного воздействия, то рассматриваемую модель применять нельзя. В последнем случае используют модель связанных выборок. В ней обычно строят новую выборку $$z_i = x_i - y_i$$ и используют статистические методы анализа одной выборки, а не двух. Методы проверки однородности для связанных выборок рассматриваются в 8.6.
При дальнейшем изложении принимаем описанную выше вероятностную модель двух выборок.
Уточнения понятия однородности. Понятие "однородность", т. е. "отсутствие различия", может быть формализовано в терминах вероятностной модели различными способами.
Наивысшая степень однородности достигается, если обе выборки взяты из одной и той же генеральной совокупности, т. е. справедлива нулевая гипотеза$$H_0 : F(x) = G(x) \textit{ при всех } x.$$
Отсутствие однородности означает, что верна альтернативная гипотеза, согласно которой$$H_1 : F(x_0) \ne G(x_0)$$ хотя бы при одном значении аргумента $$x_0$$. Если гипотеза $$H_0$$ принята, то выборки можно объединить в одну, если нет - то нельзя.
В некоторых случаях целесообразно проверять не совпадение функций распределения, а совпадение некоторых характеристик случайных величин $$X$$ и $$Y$$ - математических ожиданий, медиан, дисперсий,
Если гипотеза $$H_0$$ верна, то и гипотеза $$H'_0$$ верна, но из справедливости $$H'_0$$, вообще говоря, не следует справедливость $$H_0$$. Математические ожидания могут совпадать для различающихся между собой функций распределения. В частности, если в результате обработки выборочных данных принята гипотеза $$H'_0$$, то отсюда не следует, что две выборки можно объединить в одну. Однако в ряде ситуаций целесообразна проверка именно гипотезы $$H'_0$$. Например, пусть функция спроса на определенный товар или услугу оценивается путем опроса потребителей (первая выборка) или с помощью данных о продажах (вторая выборка). Тогда маркетологу важно проверить гипотезу об отсутствии систематических расхождений результатов этих двух методов, т.е. гипотезу о равенстве математических ожиданий. Другой пример - из производственного менеджмента. Пусть изучается эффективность управления бригадами рабочих на предприятии с помощью двух организационных схем, результаты наблюдения - объем производства на одного члена бригады, а показатель эффективности организационной схемы - средний (по предприятию) объем производства на одного рабочего. Тогда для сравнения эффективности схем достаточно проверить гипотезу $$H'_0$$.
Классические условия применимости критерия Стьюдента. Согласно математико-статистической теории должны быть выполнены два классических условия применимости критерия Стьюдента, основанного на использовании статистики $$t$$, заданной формулой (1):
а) результаты наблюдений имеют нормальные распределения:$$F(x)=N(x;m_1,\sigma_1^2), G(x)=N(x;m_2,\sigma_2^2)$$ с математическими ожиданиями $$m_1$$ и $$m_2$$ и дисперсиями $$\sigma_1^2$$ и $$\sigma_2^2$$ в первой и во второй выборках соответственно;
б) дисперсии результатов наблюдений в первой и второй выборках совпадают:$$D(X) = \sigma_1^2 = D(Y) = \sigma_2^2.$$
Если условия а) и б) выполнены, то нормальные распределения $$F(x)$$ и $$G(x)$$ отличаются только математическими ожиданиями, а поэтому обе гипотезы $$H_0$$ и $$H'_0$$ сводятся к гипотезе$$H''_0:m_1=m_2,$$ а обе альтернативные гипотезы $$H_1$$ и $$H'_1$$ сводятся к гипотезе$$H''_1 : m_1 \ne m_2 .$$
Если условия а) и б) выполнены, то статистика $$t$$ при справедливости $$H''_0$$ имеет распределение Стьюдента с $$(m + n - 2)$$ степенями свободы. Только в этом случае описанный выше традиционный метод обоснован безупречно. Если хотя бы одно из условий а) и б) не выполнено, то нет никаких оснований считать, что статистика $$t$$ имеет распределение Стьюдента, поэтому применение традиционного метода, строго говоря, не обосновано. Обсудим возможность проверки этих условий и последствия их нарушений.
Имеют ли результаты наблюдений нормальное распределение? Как показано в ]. Однако проверка нормальности - более сложная и трудоемкая статистическая процедура, чем проверка однородности (как с помощью статистики $$t$$ Стьюдента, так и с использованием непараметрических критериев, рассматриваемых ниже).
Для достаточно надежного установления нормальности требуется весьма большое число наблюдений. В лекции 5 показано, что для того, чтобы гарантировать, что функция распределения результатов наблюдений отличается от некоторой нормальной не более чем на 0,01 (при любом значении аргумента), требуется порядка 2500 наблюдений. В большинстве технических, экономических, медицинских и иных исследований число наблюдений существенно меньше.
Как уже отмечалось, есть и одна общая причина отклонений от нормальности: любой результат наблюдения записывается конечным (обычно 2-5) количеством цифр, а с математической точки зрения вероятность такого события равна 0. Следовательно, в прикладной статистике распределение результатов наблюдений практически всегда более или менее отличается от нормального распределения.
Последствия нарушения условия нормальности. Если условие а) не выполнено, то распределение статистики $$t$$ не является распределением Стьюдента. Однако при справедливости $$H'_0$$ и условии б) распределение статистики $$t$$ при росте объемов выборок приближается к стандартному нормальному распределению $$\Phi(x) = N(x; 0, 1)$$. К этому же распределению приближается распределение Стьюдента при возрастании числа степеней свободы. Другими словами, несмотря на нарушение условия нормальности традиционный метод (критерий Стьюдента) можно использовать для проверки гипотезы $$H'_0$$ при больших объемах выборок. При этом вместо таблиц распределения Стьюдента достаточно пользоваться таблицами стандартного нормального распределения $$\Phi(x)$$.
Сформулированное в предыдущем абзаце утверждение справедливо для любых функций распределения $$F(x)$$ и $$G(x)$$ таких, что $$M(X)=M(Y), D(X)=D(Y)$$ и выполнены некоторые внутриматематические условия, обычно считающиеся справедливыми в реальных задачах. Если же $$M(X)\ne M(Y)$$, то нетрудно вычислить, что при больших объемах выборок$$P(t\le x)\approx\Phi(x-a_{mn}),$$ где$$a_{mn}=\frac{\sqrt{mn}[M(X)-M(Y)]}{\sqrt{mD(X)+nD(Y)}}.$$
Формулы (2) - (3) позволяют приближенно вычислять мощность $$t$$ -критерия (точность возрастает при увеличении объемов выборок $$m$$ и $$n$$ ).
О проверке условия равенства дисперсий. Иногда условие б) вытекает из методики получения результатов наблюдений, например, когда с помощью одного и того же прибора или методики $$m$$ раз измеряют характеристику первого объекта и $$n$$ раз - второго, а параметры распределения погрешностей измерения при этом не меняются. Однако ясно, что в постановках большинства исследовательских и практических задач нет оснований априори предполагать равенство дисперсий.
Целесообразно ли проверять равенство дисперсий статистическими методами, например, как это иногда предлагают, с помощью $$F$$ -критерия Фишера? Этот критерий основан на нормальности распределений результатов наблюдений, от которой неизбежны отклонения (см. выше). Причем хорошо известно, что в отличие от t-критерия распределение $$F$$ -критерия Фишера сильно меняется при малых отклонениях от нормальности []. Кроме того, $$F$$ -критерий отвергает гипотезу $$D(X)=D(Y)$$ лишь при большом различии выборочных дисперсий. Так, для данных [] о двух группах результатов химических анализов отношение выборочных дисперсий равно 1,95, т.е. существенно отличается от 1. Тем не менее гипотеза о равенстве теоретических дисперсий принимается на 1%-м уровне значимости. Следовательно, при проверке однородности применение $$F$$ -критерия для предварительной проверки равенства дисперсий нецелесообразно.
Итак, в большинстве технических, экономических, медицинских и иных задач условие б) нельзя считать выполненным, а проверять его нецелесообразно.
Последствия нарушения условия равенства дисперсий. Если объемы выборок $$m$$ и $$n$$ велики, то можно показать, что распределение статистики $$t$$ описывается с помощью только математических ожиданий $$M(X)$$ и $$M(Y)$$, дисперсий $$D(X), D(Y)$$ и отношения объемов выборок, а именно:$$P(t\le x)\approx\Phi(b_{mn} x-a_{mn}),$$ где $$a_{mn}$$ определено формулой (3),$$b_{mn}^2=\frac{\lambda D(X)+D(Y)}{D(X)+\lambda D(Y)},\quad \lambda=\frac{m}{n}.$$
Если $$b_{mn} \ne 1$$, то распределение статистики $$t$$ отличается от распределения, заданного формулой (2), полученной в предположении равенства дисперсий. Когда $$b_{mn}=1$$? В двух случаях - при $$m = n$$ и при $$D(X) = D(Y)$$. Таким образом, при больших и равных объемах выборок требовать выполнения условия б) нет необходимости. Кроме того, ясно, что если объемы выборок мало различаются, то $$b_{mn}$$ близко к 1. Так, для данных [] о двух группах результатов химических анализов имеем $$b^*_{mn}= 0,987$$, где $$b^*_{mn}$$ - оценка $$b_{mn}$$, полученная заменой в формуле (5) теоретических дисперсий на выборочные.
Область применимости традиционного метода проверки однородности с помощью критерия Стьюдента. Подведем итоги рассмотрения $$t$$ -критерия. Он позволяет проверять гипотезу $$H'0$$ о равенстве математических ожиданий, но не гипотезу $$H_0$$ о том, что обе выборки взяты из одной и той же генеральной совокупности. Классические условия применимости критерия Стьюдента в подавляющем большинстве технических, экономических, медицинских и иных задач не выполнены. Тем не менее при больших и примерно равных объемах выборок его можно применять. При конечных объемах выборок традиционный метод носит неустранимо приближенный характер.
Критерий Крамера-Уэлча равенства математических ожиданий. Вместо критерия Стьюдента целесообразно для проверки $$H'0$$ использовать критерий Крамера-Уэлча [], основанный на статистике$$T=\frac{\sqrt{mn}(\overline{x}-\overline{y})}{\sqrt{ns_x^2+ms_y^2}}.$$
Критерий Крамера-Уэлча имеет прозрачный смысл - разность выборочных средних арифметических для двух выборок делится на естественную оценку среднего квадратического отклонения этой разности. Естественность указанной оценки состоит в том, что неизвестные статистику дисперсии заменены их выборочными оценками. Из многомерной Центральной предельной теоремы и из теорем о наследовании сходимости [] вытекает (см. лекцию 4), что при росте объемов выборок распределение статистики $$T$$ Крамера-Уэлча сходится к стандартному нормальному распределению с математическим ожиданием 0 и дисперсией 1. Итак, при справедливости $$H'0$$ и больших объемах выборок распределение статистики $$T$$ приближается с помощью стандартного нормального распределения $$\Phi(х)$$, из таблиц которого следует брать критические значения.
При $$m = n$$, как следует из формул (1) и (6), $$t = T$$. При $$m\ne n$$ этого равенства нет. В частности, при $$s_x^2$$ в (1) стоит множитель $$(m - 1)$$, а в (6) - множитель $$n$$.
Если $$M(X)\ne M(Y)$$, то при больших объемах выборок$$P(T\le X)\approx\Phi(x-c_{mn}),$$ где$$C_{mn}=\frac{\sqrt{mn}[M(X)-M(Y)]}{\sqrt{nD(X)+mD(Y)}}.$$
При $$m = n$$ или $$D(X)=D(Y)$$, согласно формулам (3) и (8), $$a_{mn}= c_{mn}$$, в остальных случаях равенства нет.
Из асимптотической нормальности статистики $$T$$, формул (7) и (8) следует, что правило принятия решения для критерия Крамера-Уэлча выглядит следующим образом:
В прикладной статистике наиболее часто применяется уровень значимости $$\alpha=0,05$$. Тогда значение модуля статистики $$T$$ Крамера-Уэлча надо сравнивать с граничным значением $$\underline{\Phi^{-1}\left(1-\frac{\alpha}{2}\right)=1,96}$$.
Из сказанного выше следует, что применение критерия Крамера-Уэлча не менее обосновано, чем применение критерия Стьюдента. Дополнительное преимущество - не требуется равенства дисперсий $$D(X)=D(Y)$$. Распределение статистики $$T$$ не является распределением Стьюдента, однако и распределение статистики $$t$$, как показано выше, не является таковым в реальных ситуациях.
Распределение статистики $$T$$ при объемах выборок $$m=n=6, 8, 10, 12$$ и различных функциях распределений выборок $$F(x)$$ и $$G(x)$$ изучено нами совместно с Ю.Э. Камнем и Я.Э. Камнем
Пример 1. Пусть объем первой выборки $$m=120, \overline{x}=13,7, s_x=5,3$$. Для второй выборки $$n=541,\overline{y}=14,1, s_y=8,4$$. Вычислим величину статистики Крамера-Уэлча$$\begin{aligned} T=\frac{\sqrt{mn}(\overline{x}-\overline{y})}{\sqrt{ns_x^2+ms_y^2}}= \frac{\sqrt{120\times 541}(13,7-14,1)}{\sqrt{541\times 5,3^2+120\times 8,4^2}}= \frac{\sqrt{64920}(-0,4)}{\sqrt{541\times 28,09+120\times 141,12}}= \\ = \frac{254,79 \times (-0,4)}{\sqrt{15196,69+16934,4}}= \frac{-101,916}{\sqrt{32131,09}}=\frac{-101,916}{179,25}=-0,57. \end{aligned}$$
Поскольку полученное значение по абсолютной величине меньше 1,96, то гипотеза однородности математических ожиданий принимается на уровне значимости 0,05.
Непараметрические методы проверки однородности. В большинстве технических, экономических, медицинских и иных задач представляет интерес не проверка равенства математических ожиданий или иных характеристик распределения, а обнаружение различия генеральных совокупностей, из которых извлечены выборки, т.е. проверка гипотезы $$H_0$$. Методы проверки гипотезы $$H_0$$ позволяют обнаружить не только изменение математического ожидания, но и любые иные изменения функции распределения результатов наблюдений при переходе от одной выборки к другой (увеличение разброса, появление
Для проверки гипотезы $$H_0$$ разработано много непараметрических методов - критерии Смирнова, типа омега-квадрат (Лемана - Розенблатта), Вилкоксона (Манна-Уитни), Ван-дер-Вардена, Сэвиджа, хи-квадрат и др. [, , ]. Распределения статистик всех этих критериев при справедливости H0 не зависят от конкретного вида совпадающих функций распределения $$F(x) \equiv G(x)$$. Следовательно, таблицами точных и предельных (при больших объемах выборок) распределений статистик этих критериев и их процентных точек [, ] можно пользоваться при любых непрерывных функциях распределения результатов наблюдений.
], для выбора одного из нескольких критериев необходимо сравнить их мощности, определяемые видом альтернативных гипотез. Сравнению
Хорошо изучены свойства критериев при альтернативной гипотезе сдвига$$H_{1c}:G(x)=F(x-d), d\ne 0.$$
Критерии Вилкоксона, Ван-дер-Вардена и ряд других ориентированы для применения именно в этой ситуации. Если $$m$$ раз измеряют характеристику одного объекта и $$n$$ раз - другого, а функция распределения погрешностей измерения произвольна, но не меняется при переходе от объекта к объекту (это более жесткое требование, чем условие равенства дисперсий), то рассмотрение гипотезы $$H_{1c}$$ оправдано. Однако в большинстве технических, экономических, медицинских и иных исследований нет оснований считать, что функции распределения, соответствующие выборкам, различаются только сдвигом.
Покажем (и это - основной результат настоящего параграфа), что двухвыборочный критерий Вилкоксона (в литературе его называют также критерием Манна-Уитни) предназначен для проверки гипотезы$$H_0:P(X<Y)=1/2,$$ где $$X$$ - случайная величина, распределенная как элементы первой выборки, а $$Y$$ - второй.
В описанной выше вероятностной модели двух независимых выборок без ограничения общности можно считать, что объем первой из них не превосходит объема второй, $$m < n$$, в противном случае выборки можно поменять местами. Обычно предполагается, что функции $$F(x)$$ и $$G(x)$$ непрерывны и строго возрастают. Из непрерывности этих функций следует, что с вероятностью 1 все $$m + n$$ результатов наблюдений различны. В реальных эконометрических данных иногда встречаются совпадения, но сам факт их наличия - свидетельство нарушений предпосылок только что описанной базовой математической модели.
Статистика $$S$$ двухвыборочного критерия Вилкоксона определяется следующим образом. Все элементы объединенной выборки $$X_1, X_2, ..., X_m, Y_1, Y_2, ..., Y_n$$ упорядочиваются в порядке возрастания. Элементы первой выборки $$X_1, X_2, ..., X_m$$ занимают в общем вариационном ряду места с номерами $$R_1, R_2, ..., R_m$$, другими словами, имеют ранги $$R_1, R_2, ..., R_m$$. Тогда статистика Вилкоксона - это сумма рангов элементов первой выборки$$S=R_1, R_2, ..., R_m.$$
Статистика $$U$$ Манна-Уитни определяется как число пар $$(X_i, Y_j)$$ таких, что $$X_i < Y_j,$$ среди всех $$mn$$ пар, в которых первый элемент - из первой выборки, а второй - из второй. Как известно [, с.160],$$U=mn+m(m+1)/2-S.$$
Поскольку $$S$$ и $$U$$ линейно связаны, то часто говорят не о двух критериях - Вилкоксона и Манна-Уитни, а об одном - критерии Вилкоксона (Манна-Уитни).
Критерий Вилкоксона - один из самых известных инструментов непараметрической статистики (наряду со статистиками типа Колмогорова-Смирнова и коэффициентами ранговой корреляции). Свойствам этого критерия и таблицам его критических значений уделяется место во многих монографиях по математической и прикладной статистике (см., например, [, , ]).
Однако в литературе имеются и неточные утверждения относительно возможностей критерия Вилкоксона. Так, одни полагают, что с его помощью можно обнаружить любое различие между функциями распределения $$F(x)$$ и $$G(x)$$. По мнению других, этот критерий нацелен на проверку равенства медиан распределений, соответствующих выборкам. И то, и другое, строго говоря, неверно. Это будет ясно из дальнейшего изложения.
Введем некоторые обозначения. Пусть $$F^{-1}(t)$$ - функция, обратная к функции распределения $$F(x)$$. Она определена на отрезке [0;1]. Положим $$L(t) = G(F^{-1}(t))$$. Поскольку $$F(x)$$ непрерывна и строго возрастает, то $$F^{-1}(t)$$ и $$L(t)$$ обладают теми же свойствами. Важную роль в дальнейшем изложении будет играть величина $$a = P(X< Y).$$ Как нетрудно показать,$$a=P(X<Y)=\int\limits_0^1 tdL(t).$$
Введем также параметры$$b^2=\int\limits_0^1 L^2(t)dt-(1-a)^2,\; g^2=\int\limits_0^1 t^2 dL(t)-a^2.$$
Тогда математические ожидания и дисперсии статистик Вилкоксона и Манна-Уитни согласно [, с.160] выражаются через введенные величины:$$\begin{gathered} М(U) = mna, М(S) = mn + m(m+1)/2 - М(U) = mn(1- a) + m(m+1)/2,\\ D(S) = D(U) = mn [(n - 1) b^2 + (m - 1) g^2 + a(1 - a)]. \end{gathered}$$
Когда объемы обеих выборок безгранично растут, распределения статистик Вилкоксона и Манна-Уитни являются асимптотически нормальными (см., например, [, гл. 5 и ]) с параметрами, задаваемыми формулами (1).
Если выборки полностью однородны, т.е. их функции распределения совпадают, справедлива гипотеза$$H_0: F(x) = G(x) \textit{ при всех } x,$$ то $$L(t) = t$$ для $$t$$ из отрезка $$[0, 1], L(t)= 0$$ для всех отрицательных $$t$$ и $$L(t)= 1$$ для $$t > 1$$, соответственно $$a = 1/2$$. Подставляя в формулы (1), получаем, что$$М(S) = m(m+n+1)/2, D(S) = mn(m+n+1)/12.$$
Следовательно, распределение нормированной и центрированной статистики Вилкоксона$$T = ( S - m(m+n+1)/2) (mn(m+n+1)/ 12)^{-1/2}$$ при росте объемов выборок приближается к стандартному нормальному распределению (с математическим ожиданием 0 и дисперсией 1).
Из асимптотической нормальности статистики $$Т$$ следует, что правило принятия решения для критерия Вилкоксона выглядит следующим образом:
В прикладной статистике наиболее часто применяется уровень значимости $$\alpha=0,05$$. Тогда значение модуля статистики $$T$$ Вилкоксона надо сравнивать с граничным значением $$\underline{\Phi^{-1}\left(1-\frac{\alpha}{2}\right)}=1,96$$.
Пример 1. Пусть даны две выборки. Первая содержит $$m = 12$$ элементов 17; 22; 3; 5; 15; 2; 0; 7; 13; 97; 66; 14. Вторая содержит $$n=14$$ элементов 47; 30; 2; 15; 1; 21; 25; 7; 44; 29; 33; 11; 6; 15. Проведем проверку однородности функций распределения двух выборок с помощью критерия Вилкоксона.
Первым шагом является построение общего вариационного ряда для элементов двух выборок (табл.8.1).
| Ранги | 1 | 2 | 3,5 | 3,5 | 5 | 6 | 7 | 8,5 | 8,5 | 10 | 11 | 12 | 14 |
| Элементы выборок | 0 | 1 | 2 | 2 | 3 | 5 | 6 | 7 | 7 | 11 | 13 | 14 | 15 |
| Номера выборок | 1 | 2 | 1 | 2 | 1 | 1 | 2 | 1 | 2 | 2 | 1 | 1 | 1 |
| Ранги | 14 | 14 | 16 | 17 | 18 | 19 | 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| Элементы выборок | 15 | 15 | 17 | 21 | 22 | 25 | 29 | 30 | 33 | 44 | 47 | 66 | 97 |
| Номера выборок | 2 | 2 | 1 | 2 | 1 | 2 | 2 | 2 | 2 | 2 | 2 | 1 | 1 |
Хотя с точки зрения теории математической статистики вероятность совпадения двух элементов выборок равна 0, в реальных выборках экономических данных совпадения встречаются. Так, в рассматриваемых выборках, как видно из табл.8.1, два раза повторяется величина 2, два раза - величина 7 и три раза - величина 15. В таких случаях говорят о наличии "связанных рангов", а соответствующим совпадающим величинам приписывают среднее арифметическое тех рангов, которые они занимают. Так, величины 2 и 2 занимают в объединенной выборке места 3 и 4, поэтому им приписывается ранг (3+4)/2 = 3,5. Величины 7 и 7 занимают в объединенной выборке места 8 и 9, поэтому им приписывается ранг (8+9)/2 = 8,5. Величины 15, 15 и 15 занимают в объединенной выборке места 13, 14 и 15, поэтому им приписывается ранг (13+14+15)/3 = 14.
Следующий шаг - подсчет значения статистики Вилкоксона, т.е. суммы рангов элементов первой выборки$$S = R_1 + R_2 + ... + R_m = 1+3,5+5+6+8,5+11+12+14+16+18+25+26=146.$$
Подсчитаем также сумму рангов элементов второй выборки$$S_1 = 2+3,5+7+8,5+10+14+14+17+19+20+21+22+23+24= 205.$$
Величина $$S_1$$ может быть использована для контроля вычислений. Дело в том, что суммы рангов элементов первой выборки $$S$$ и второй выборки $$S_1$$ вместе составляют сумму рангов объединенной выборки, т.е. сумму всех натуральных чисел от 1 до $$m+n$$. Следовательно,$$S+ S_1 = (m+n)(m+n+1)/2= (12+14)(12+14+1)/2= 351.$$
В соответствии с ранее проведенными расчетами $$S+S_1 = 146+205=351$$. Необходимое условие правильности расчетов выполнено. Это условие не является достаточным и не гарантирует правильности расчетов.
Перейдем к расчету статистики $$T$$. Согласно формуле (3)$$М(S) = 12(12+14+1)/ 2 = 162, D(S) = 12\cdot 14(12+14+1)/ 12= 378 .$$
Следовательно,$$T = ( S - 162) (378)^{-1/2} = (146-162) / 19,44 = - 0,82.$$
Поскольку $$|T|\le 1,96$$, то гипотеза однородности принимается на уровне значимости 0,05.
Что будет, если поменять выборки местами, вторую назвать первой? Тогда вместо $$S$$ надо рассматривать $$S_1$$. Имеем$$\begin{gathered} М(S1 ) = 14(12+14+1)/ 2 = 189, D(S) = D(S1 ) = 378 , \\ T_1 = (S_1 - 189)(378)^{-1/2} = (205-162)/19,44 = 0,82. \end{gathered}$$
Таким образом, значения статистики критерия отличаются только знаком (можно показать, что это утверждение верно всегда). Поскольку в правиле принятия решения используется только абсолютная величина статистики, то принимаемое решение не зависит от того, какую выборку считаем первой, а какую второй. Для уменьшения объема таблиц принято считать первой выборку меньшего объема.
Продолжим обсуждение критерия Вилкоксона. Правила принятия решений и таблица критических значений для критерия Вилкоксона строятся в предположении справедливости гипотезы полной однородности, описываемой формулой (2). А что будет, если эта гипотеза неверна? Другими словами, какова
Пусть объемы выборок достаточно велики, так что можно пользоваться асимптотической нормальностью статистики Вилкоксона. Тогда в соответствии с формулами (1) статистика T будет асимптотически нормальна с параметрами$$\begin{aligned} М(T) = (12mn)^{1/2}(1/2-a)(m+n+1)^{-1/2}, \\ D(T)= 12 [(n - 1) b^2 + (m - 1) g^2 + a(1 - a) ] (m+n+1)^{-1}. \end{aligned}$$
Из формул (5) видно большое значение гипотезы$$H_{01}: a = P(X < Y) = 1/2.$$
Если эта гипотеза неверна, то, поскольку $$m < n$$, справедлива оценка$$|M(T)|\ge (12m n (2n+1)^{-1})^{1/2}|1/2 - a|,$$ а потому $$|M(T)|$$ безгранично растет при росте объемов выборок. В то же время, поскольку$$b^2\le\int\limits_0^1 L^2(t)dt\le 1, g^2\le\int\limits_0^1 t^2 dL(t)\le 1, \alpha(1-\alpha)\le 1/4,$$ то$$D(T)\le 12[(n-1)+(m-1)+1/4](m+n+1)^{-1}\le 12.$$
Следовательно, вероятность отклонения гипотезы $$H_{01}$$, когда она неверна, т.е.
Гипотеза (6) является сложной, дисперсия (9), как показывают приводимые ниже примеры, в зависимости от значений $$b^2$$ и $$g^2$$ может быть как больше 1, так и меньше 1, но согласно неравенству (7) никогда не превосходит 12.
Приведем пример двух функций распределения $$F(x)$$ и $$G(x)$$ таких, что гипотеза (6) выполнена, а гипотеза (2) - нет. Поскольку$$a=P(X<Y)=\int\limits_{-\infty}^{+\infty} F(x)dG(x),\; 1-a=P(Y<X)=\int\limits_{-\infty}^{+\infty} G(x)dF(x)$$ и $$a = 1/2$$ в случае справедливости гипотезы (2), то для выполнения условия (6) необходимо и достаточно, чтобы$$\int\limits_{-\infty}^{+\infty} (F(x)-G(x))dF(x)=0,$$ а потому естественно в качестве $$F(x)$$ рассмотреть функцию равномерного распределения на интервале (-1; 1). Тогда формула (11) переходит в условие$$\int\limits_{-\infty}^{+\infty} (F(x)-G(x))dF(x)=-\frac12 \int\limits_{-1}^{+1}\left(G(x)-\frac{(x+1)}{2}\right)dx=0.$$
Это условие выполняется, если функция $$(G(x) - (x + 1)/2)$$ является нечетной.
Пример 2. Пусть функции распределения $$F(x)$$ и $$G(x)$$ сосредоточены на интервале (-1; 1), на котором$$F(x)=(x+1)/2,\; G(x)=(x+1+1/\pi \sin \pi x)/2.$$
Тогда$$x=F^{-1}(t)=2t-1, L(t)=G(F^{-1}(t))=(2t+1/\pi\sin\pi(2t-1))/2=t+1/2\pi\sin\pi(2t-1).$$
Условие (11) выполнено, поскольку функция $$(G(x)-(x+1)/2)$$ является нечетной. Следовательно, $$a = 1/2$$. Начнем с вычисления$$g^2=\int\limits_0^1 t^2 dL(t)=\frac14=\int\limits_0^1 t^2 d(t+\frac{1}{2\pi}\sin\pi(2t-1))=\frac14 .$$
Поскольку$$d\left(t+\frac{1}{2\pi}\sin\pi(2t-1)\right)=(1+\cos\pi(2t-1))dt,$$ то $$g^2=\int\limits_0^1 t^2(1+\cos\pi(2t-1))dt-\frac14 =\frac{1}{12}+\int\limits_0^1 t^2\cos\pi(2t-1)dt$$.
С помощью замены переменных $$t = (x+1)/2$$ получаем, что$$\int\limits_0^1 t^2\cos\pi(2t-1)dt=\frac18 \left( \int\limits_{-1}^1 x^2\cos\pi xdx+ 2\int\limits_{-1}^1 x\cos\pi xdx+ \int\limits_{-1}^1 \cos\pi xdx \right).$$
В правой части последнего равенства стоят табличные интегралы (см., например, справочник [, с.71]). Проведя соответствующие вычисления, получаем, что в правой части стоит $$1/8 (-4/\pi^2) = -1/(2\pi^2 )$$. Следовательно,$$g^2=1/12-1/(2\pi^2)-0,032672733...$$
Перейдем к вычислению $$b^2$$. Поскольку$$b^2=\int\limits_0^1 L^2(t)dt-frac14=\int\limits_0^1 \left(t+\frac12\pi\sin\pi(2t-1)\right)^2-frac14,$$ то$$b^2=frac{1}{12}+\frac{1}{\pi}\int\limits_0^1(t\sin\pi(2t-1))dt+ \left(\frac{\pi}{2}\right)^2\int\limits_0^1\sin^2\pi(2t-1)dt.$$
С помощью замены переменных $$t = (x+1)/2$$ переходим к табличным интегралам (см., например, справочник [, с.65]): b^2=\frac{1}{12}+\frac{1}{4\pi}\int\limits_{-1}^1 x\sin\pi xdx+ \frac{1}{4\pi}\int\limits_{-1}^1 \sin\pi xdx+ \frca{1}{8\pi^2}\int\limits_{-1}^1 \sin^2\pi xdx.
Проведя необходимые вычисления, получим, что$$b^2=\frac{1}{12}+\frac{1}{4\pi}\left(-\frac{2}{\pi}\right) +0+\frac{1}{8\pi^2}=\frac{1}{12}-\frac{3}{8\pi^2}=0,045337893...$$
Следовательно, для рассматриваемых функций распределения нормированная и центрированная статистика Вилкоксона (см. формулу (4)) асимптотически нормальна с математическим ожиданием 0 и дисперсией (см. формулу (9))$$D(T)=(0,544n+0,392m+2,064)(m+n+1)^{-1}.$$
Как легко видеть, дисперсия всегда меньше 1. Это значит, что в рассматриваемом случае гипотеза полной однородности (2) при проверке с помощью критерия Вилкоксона будет приниматься чаще, чем если она на самом деле верна.
На наш взгляд, это означает, что критерий Вилкоксона нельзя считать критерием для проверки гипотезы (2) при альтернативе общего вида. Он не всегда позволяет проверить однородность - не при всех альтернативах. Точно так же критерии типа хи-квадрат нельзя считать критериями проверки гипотез согласия и однородности - они позволяют обнаружить не все различия, поскольку некоторые из них "скрадывает" группировка.
Обсудим теперь, действительно ли критерий Вилкоксона нацелен на проверку равенства медиан распределений, соответствующих выборкам.
Пример 3. Построим семейство
Очевидно, что медиана $$F(x)$$ равна $$\lambda$$, а медиана $$G(x)$$ равна 1/2.
Согласно соотношению (9) для выполнения гипотезы (6) достаточно определить $$\delta$$ как функцию $$\lambda, \delta =\delta(\lambda)$$, из условия$$\int\limits_0^1 F(x)dx=\frac12 .$$
Вычисления дают$$\delta=\delta(\lambda)=3(1-\lambda)/2.$$
Учитывая, что $$\delta$$ лежит между $$\lambda$$ и 1, не совпадая ни с тем, ни с другим, получаем ограничения на $$\lambda$$, а именно, $$1/3 < \lambda < 3/5.$$ Итак, построено искомое семейство
Пример 4. Пусть, как и в примере 3, распределения сосредоточены на интервале (0; 1), и на нем $$F(x)=x$$. А $$G(x)$$ - функция распределения, сосредоточенного в двух точках - $$\beta$$ и 1. Т.е. $$G(x) = 0$$ при $$x$$, не превосходящем $$\beta$$ ; $$G(x) = h$$ на $$(\beta; 1]; G(x)=1$$ при $$x > 1$$. С такой функцией $$G(x)$$ легко проводить расчеты. Однако она не удовлетворяет принятым выше условиям непрерывности и строгого возрастания. Вместе с тем легко видеть, что она является предельной (сходимость в каждой точке отрезка [0; 1]) для последовательности функций распределения, удовлетворяющих этим условиям. А распределение статистики Вилкоксона для пары функций распределения примера 4 является предельным для последовательности соответствующих распределений статистики Вилкоксона, полученных в рассматриваемых условиях непрерывности и строгого возрастания.
Условие $$P(X < Y) = 1/4$$ выполнено, если $$h=(1-\beta)^{-1}/2$$ (при $$\beta$$ из отрезка [0; 1/2]). Поскольку $$h > 1/2$$ при положительном $$\beta$$, то очевидно, что медиана $$G(x)$$ равна $$\beta$$, в то время как медиана $$F(x)$$ равна 1/2 . Значит, при $$\beta = 1/2$$ медианы совпадают, при всех иных положительных $$\beta$$ - различны. При $$\beta = 0$$ медианой $$G(x)$$ является любая точка из отрезка [0; 1].
Легко подсчитать, что в условиях примера 4 параметры предельного распределения имеют вид$$b^2=\beta(1-\beta)^{-1}/4, g^2=(1-2\beta)/4.$$
Следовательно, распределение нормированной и центрированной статистики Вилкоксона будет асимптотически нормальным с математическим ожиданием 0 и дисперсией$$D(T)=3[(n-1)\beta(1-\beta)^{-1}+(m-1)(1-2\beta)+1](m+n+1)^{-1}.$$
Проанализируем величину $$D(T)$$ в зависимости от параметра $$\beta$$ и объемов выборок $$m$$ и $$n$$. При достаточно больших $$m$$ и $$n$$$$D(T)=3w\beta(1-\beta)^{-1}+3(1-w)(1-2\beta),$$ с точностью до величин порядка $$(m+n)^{-1}$$, где $$w= n/(m+n)$$. Значит, $$D(T)$$ - линейная функция от $$w$$, а потому достигает экстремальных значений на границах интервала изменения $$w$$, т.е. при $$w = 0$$ и $$w = 1$$. Легко видеть, что при $$\beta(1-\beta)^{-1}<1-2\beta$$ минимум - $$3\beta(1-\beta)^{-1}$$ (при $$w=1$$ ), а максимум - $$3(1-2\beta)$$ (при $$w = 0)$$. В случае $$\beta(1-\beta)^{-1}>1-2\beta$$ максимум равен $$3\beta(1-\beta)^{-1}$$ (при $$w = 1$$ ), а минимум - $$3(1-2\beta)$$ (при $$w=0$$ ). Если же $$\beta(1-\beta)^{-1}=1-2\beta$$ (это равенство справедливо при $$\beta=\beta_0=1-2^{-1/2}=0,293)$$, то $$D(T)=3(2^{1/2}-1)=1,2426..$$. при всех $$w$$ из отрезка [0; 1].
Первый из описанных выше случаев имеет место при $$\beta<\beta_0$$, при этом минимум $$D(T)$$ возрастает от 0 (при $$\beta=0, w=1$$ - предельный случай) до $$3(2^{1/2}-1)$$ (при $$\beta=\beta_0, w$$ - любом), а максимум уменьшается от 3 (при $$\beta=0, w=0$$ - предельный случай) до $$3(2^{1/2}-1)$$ (при $$\beta=\beta_0, w$$ - любом). Второй случай относится к $$\beta$$ из интервала $$(\beta;1/2]$$. При этом минимум убывает от приведенного выше значения для $$\beta=\beta_0$$ до 0 (при $$\beta=1/2, w=0$$ - предельный случай), а максимум возрастает от того же значения при $$\beta=\beta_0$$ до 3 (при $$\beta=1/2, w=0$$ ).
Таким образом, $$D(T)$$ может принимать все значения из интервала (0; 3) в зависимости от значений $$\beta$$ и $$w$$. Если $$D(T)< 1$$, то при применении критерия Вилкоксона к выборкам с рассматриваемыми функциями распределения гипотеза однородности (2) будет приниматься чаще (при соответствующих значениях $$\beta$$ и $$w$$ - с вероятностью, сколь угодно близкой к 1), чем если бы она самом деле была верна. Если $$1<D(T)<3$$, то гипотеза (2) также принимается достаточно часто. Так, если уровень
Гипотеза сдвига. При проверке гипотезы однородности мы рассмотрели различные виды нулевых и альтернативных гипотез - гипотезу (2) и ее отрицание в качестве альтернативы, гипотезу (6) и ее отрицание, гипотезы о равенстве или различии медиан. В теоретических работах по математической статистике часто рассматривают гипотезу сдвига, в которой альтернативой гипотезе (2) является гипотеза$$H_1: F(x) = G(x+r)$$ при всех $$x$$ и некотором сдвиге $$r$$, отличным от 0. Если верна альтернативная гипотеза $$H_1$$, то вероятность $$P(X < Y)$$ отлична от 1/2, а потому при альтернативе (12) критерий Вилкоксона является состоятельным.
В некоторых прикладных постановках гипотеза (12) представляется естественной. Например, если одним и тем же прибором проводятся две серии измерений двух значений некоторой величины (физической, химической и т.п.). При этом функция распределения $$G(x)$$ описывает погрешности измерения одного значения, а $$G(x+r)$$ - другого. Вопреки распространенному заблуждению, хорошо известно, что распределение погрешностей измерений, как правило, не является нормальным (см. об этом лекцию 5). Однако при анализе конкретных статистических данных, как правило, нет никаких оснований считать, что отсутствие однородности всегда выражается столь однозначным образом, как следует из формулы (12). Поэтому эконометрику для проверки однородности необходимо использовать
Почему же математики так любят гипотезу сдвига (12)? Да потому, что она дает возможность доказывать глубокие математические результаты, например, об асимптотической оптимальности критериев. К сожалению, с точки зрения эконометрики это напоминает поиск ключей под фонарем, где светло, а не там, где они потеряны.
Отметим еще одно обстоятельство. Часто говорят (в соответствии с классическим подходом математической статистики), что нельзя проверять нулевые гипотезы без рассмотрения альтернативных. Однако при анализе данных технических, экономических, медицинских или иных исследований зачастую полностью ясна формулировка той гипотезы, которую желательно проверить (например, гипотезы полной однородности - см. формулу (2)), в то время как формулировка альтернативной гипотезы не очевидна (то ли это гипотеза о неверности равенства (2) хотя бы для одного значения x, то ли это альтернатива (8), то ли - альтернатива сдвига (12), и т. д.). В таких случаях целесообразно "обернуть" задачу - исходя из статистического критерия найти альтернативы, относительно которых он состоятелен. Именно это и проделано в настоящем параграфе для критерия Вилкоксона.
Подведем итоги рассмотрения критерия Вилкоксона.
Например, в литературе по математической статистике часто говорится, что для проверки нормальности используются критерии
Так что недостатки критерия Вилкоксона не являются исключением, мощность ряда иных популярных в математической статистике критериев заслуживает тщательного изучения, при этом заранее можно сказать, что зачастую они не позволяют проверять те гипотезы, с которыми традиционно связаны. При применении подобных критериев к анализу реальных данных необходимо тщательно взвешивать их достоинства и недостатки.
В соответствии с методологией прикладной статистики естественно потребовать, чтобы рекомендуемый для массового использования в технических, экономических, медицинских и иных исследованиях критерий однородности был состоятельным. Напомним: это значит, что для любых отличных друг от друга функций распределения $$F(x)$$ и $$G(x)$$ (другими словами, при справедливости альтернативной гипотезы $$H_1$$ ) вероятность отклонения гипотезы $$H_0$$ должна стремиться к 1 при увеличении объемов выборок т и п. Из перечисленных выше (в конце 8.2) критериев однородности состоятельными являются только критерии Смирнова и типа омега-квадрат.
Проведенное исследование мощности (
Критерий Смирнова однородности двух независимых выборок. Он предложен членом-корреспондентом АН СССР Н.В. Смирновым в 1939 г. (см. справочник []). Единственное ограничение - функции распределения $$F(x)$$ и $$G(x)$$ должны быть непрерывными. Напомним, что согласно Л.Н. Большеву и Н.В. Смирнову [] значение
где $$x'_1<x'_2<...<x'_m$$ - элементы первой выборки $$x_1,x_2,...,x_m$$, переставленные в порядке возрастания, а $$y'_1<y'_2<...<y'_n$$ - элементы второй выборки $$y_1,y_2,...,y_n,$$ также переставленные в порядке возрастания. Поскольку функции распределения $$F(x)$$ и $$G(x)$$ предполагаются непрерывными, то вероятность совпадения каких-либо выборочных значений равна 0.
Разработаны алгоритмы и программы для ЭВМ, позволяющие рассчитывать точные распределения, процентные точки и достигаемый уровень значимости для двухвыборочной статистики Смирнова $$D_{m,n}$$, а также подробные таблицы (см., например, методику [6], содержащую описание алгоритмов, тексты программ и подробные таблицы).
Однако у критерия Смирнова есть и недостатки. Его распределение сосредоточено в сравнительно небольшом числе точек, поэтому функция распределения растет большими скачками. В результате не удается выдержать заданный уровень значимости. Реальный уровень значимости может в несколько раз отличаться от номинального (подробному обсуждению неклассического феномена существенного отличия реального уровня значимости от номинального посвящена работа []).
Критерий типа омега-квадрат (Лемана-Розенблатта). Статистика критерия типа омега-квадрат для проверки однородности двух независимых выборок имеет вид:$$A=\frac{mn}{m+n}\int\limits_{-\infty}^{+\infty}(F_m(x)-G_n(x))^2 dH_{m+n}(x),$$ где $$H_{m+n}(x)$$ - эмпирическая функция распределения, построенная по объединенной выборке. Легко видеть, что$$H_{m+n}(x)=\frac{m}{m+n}F_m(x)+\frac{n}{m+n}G_n(x).$$
Статистика $$A$$ типа омега-квадрат была предложена Э. Леманом в 1951 г., изучена в 1952 г. М. Розенблаттом, а затем и другими исследователями. Она зависит лишь от рангов элементов двух выборок в объединенной выборке. Пусть $$x_1,x_2,...,x_m$$ - первая выборка, $$x'_1<x'_2<...x'_m$$ - соответствующий вариационный ряд, $$y_1,y_2,...,y_n$$ - вторая выборка, $$y'_1<y'_2<...<y'_n$$ - вариационный ряд, соответствующий второй выборке. Поскольку функции распределения независимых выборок непрерывны, то с вероятностью 1 все выборочные значения различны, совпадения отсутствуют. Статистика $$A$$ представляется в виде (см., например, []):$$A=\frac{1}{mn(m+n)}[m\sum_{i=1}^m(r_i-i)^2+n\sum_{j=1}^n(s_j-j^2)]-\frac{4mn-1}{6(m+n)},$$ где $$r_i$$ - ранг $$x'_i$$ и $$s_j$$ - ранг $$y'j$$ в общем вариационном ряду, построенном по объединенной выборке.
Правила принятия решений при проверке однородности двух выборок на основе статистик Смирнова и типа омега-квадрат, т.е. таблицы критических значений в зависимости от уровней значимости и объемов выборок, приведены, например, в [].
Рекомендации по выбору критерия однородности. Для критерия типа омега-квадрат нет выраженного эффекта различия между номинальными и реальными уровнями значимости. Поэтому мы рекомендуем для проверки однородности функций распределения (гипотеза $$H_0$$ ) применять статистику $$A$$ типа омега-квадрат. Если методическое, табличное или программное обеспечение для статистики Лемана - Розенблатта отсутствует, рекомендуем использовать критерий Смирнова. Для проверки однородности математических ожиданий (гипотеза $$H'_0$$ ) целесообразно применять критерий Крамера-Уэлча. По нашему мнению, статистики Стьюдента, Вилкоксона и др. допустимо использовать лишь в отдельных частных случаях, рассмотренных выше.
Некоторые соображения о внедрении современных методов прикладной статистики в практику технических, экономических, медицинских и иных исследований. Даже из проведенного выше разбора лишь одной из типичных статистических задач - задачи проверки однородности двух независимых выборок - можно сделать вывод о целесообразности широкого развертывания работ по критическому анализу сложившейся практики статистической обработки данных и по внедрению накопленного арсенала современных методов прикладной статистики. По нашему мнению, широкого внедрения заслуживают, в частности, методы многомерного статистического анализа, планирования эксперимента, статистики объектов нечисловой природы. Очевидно, рассматриваемые работы должны быть плановыми, организационно оформленными, проводиться мощными самостоятельными организациями и подразделениями. Целесообразно создание службы статистических консультаций в системе научно-исследовательских учреждений и вузов технического, экономического, медицинского профиля.
Начнем с практического примера. Приведем письмо главного инженера подмосковного химического комбината (некоторые названия изменены).
Наш комбинат выпускает мастику по ГОСТ (следует номер) и является разработчиком указанного стандарта.
В результате исследовательских работ по подбору стандартного метода определения вязкости мастики на комбинате накоплен большой опыт сравнительных данных определения вязкости по двум методам:
Учитывая высокую компетентность сотрудников Вашего института, прошу Вас, в порядке оказания технической помощи нашему предприятию, поручить соответствующей лаборатории провести обработку представленных данных современными статистическими методами и выдать заключение о наличии (или отсутствии) зависимости между указанными выше методами определения вязкости мастики. Ваше заключение необходимо для решения спорного вопроса о целесообразности вновь ввести в ГОСТ (следует номер) метода определения вязкости мастики по вискозиметру ВЗ-4, который, по мнению некоторых потребителей, был необоснованно исключен из этого ГОСТ по изменению № 1.
Заранее благодарю Вас за оказанную помощь.
Приложение: статистика на 3 листах.
Главный инженер (Подпись) (Фамилия, имя, отчество)"Комментарий. Вязкость - один из показателей качества мастики. Измерять его можно с помощью различных способов, которые, как оказалось, дают разные результаты. Ничего необычного в этом нет. Однако поставщику и потребителю следует согласовать способы измерения показателей качества. Иначе достаточно часто поставщик (производитель) будет утверждать, что он выполнил условия контракта, а потребитель заявлять, что нет. Такая конфликтная ситуация иногда называется арбитражной, поскольку для ее решения стороны могут обращаться в арбитражный суд. Простейший метод согласования способов измерения показателей состоит в том, чтобы выбрать один из них и внести в государственный стандарт, который тем самым будет содержать не только описание продукции, перечень ее показателей качества и требований к ним, но и способы измерения этих показателей.
Заключение по статистическим данным, представленным химическим комбинатом. Для каждой из 213 партий мастики представлены два числа - результат измерения вязкости на нестандартном приборе фабрики им. Петрова и результат измерения вязкости на стандартном вискозиметре ВЗ-4. Требуется установить, дают ли два указанных метода сходные результаты. Если они дают сходные результаты, то нет необходимости вводить в соответствующий ГОСТ указание о методе определения вязкости. Если же методы дают существенно различные результаты, то подобное указание ввести необходимо.
Для применения статистических методов в рассматриваемой задаче необходимо описать вероятностную модель. Считаем, что статистические данные имеют вид $$(x_i,y_i),i=1,2,...,213$$ где $$x_i$$ - результат измерения на нестандартном приборе фабрики им. Петрова в $$i$$ -ой партии, а $$y_i$$ - результат измерения вязкости на стандартном вискозиметре ВЗ-4 в той же $$i$$ -ой партии. Пусть $$a_i$$ - истинное значение показателя качества в $$i$$ -ой партии. Естественно считать, что указанные выше случайные векторы независимы в совокупности. При этом они не являются одинаково распределенными, поскольку отличаются истинными значениями показателей качества $$a_i$$. Принимаем, что при каждом $$i$$ случайные величины $$x_i - a_i$$ и $$y_i - a_i$$ независимы и одинаково распределены. Это условие и означает однородность в связанных выборках. Параметры связи - величины $$a_i$$. Их наличие не позволяет объединить первые координаты в одну выборку, вторую - во вторую, как делалось в случае проверки однородности двух независимых выборок.
В предположении непрерывности функций распределения из условия однородности в связанных выборках вытекает, что$$P(x_i<y_i)=P(x_i\ge y_i)=\frac12 .$$
Рассмотрим случайные величины $$Z_i=x_i-y_i, i=1,2,...,213$$. Из последнего соотношения вытекает, что при справедливости гипотезы однородности для связанных выборок эти случайные величины имеют нулевые медианы. Другими словами, проверка того, что методы измерения вязкости дают схожие результаты, эквивалентна проверке равенства 0 медиан величин $$Z_i$$.
Для проверки гипотезы о том, что медианы величин $$Z_i$$ нулевые, применим широко известный критерий знаков (см., например, справочник [, с.89-91]). Согласно этому критерию необходимо подсчитать, в скольких партиях $$x_i<y_i$$ и в скольких $$x_i\ge y_i$$. Для представленных химическим комбинатом данных $$x_i<y_i$$ в 187 случаях из 213 и $$x_i\ge y_i$$ в 26 случаях из 213.
Если рассматриваемая гипотеза верна, то число $$W$$ осуществлений события $$\{x_i<y_i\}$$ имеет
Таким образом, статистический анализ показывает, что два метода дают существенно различные результаты - по прибору фабрики им. Петрова результаты измерений, как правило, меньше, чем по вискозиметру ВЗ-4. Это означает, что в соответствующий ГОСТ целесообразно ввести указание на метод определения вязкости.
Система вероятностных моделей при проверке гипотезы однородности для связанных выборок. Как и в случае проверки однородности для независимых выборок, система вероятностных моделей состоит из трех уровней. Наиболее простая модель - на уровне однородности альтернативного признака - уже рассмотрена. Она сводится к проверке гипотезы о значении параметра
Речь идет о "критерии знаков". При справедливости гипотезы однородности число $$W$$ осуществлений события $$\{x_i<y_i\}$$ имеет
Гипотезу $$p = 1/2$$ можно проверять как непосредственно с помощью
Второй
Альтернативная гипотеза также является непараметрической и имеет вид:$$H_{11}:M(Z_j)\ne 0.$$
Как и в случае проверки гипотезы однородности для независимых выборок с помощью критерия Крамера-Уэлча, в рассматриваемой ситуации естественно использовать статистику$$Q=\sqrt{n}\frac{\overline{Z}}{s(Z)},$$
где$$\overline{Z}=\frac{Z_1+Z_2+...+Z_n}{n}$$
среднее арифметическое разностей, а$$s(Z)=\sqrt{\frac{1}{n-1}\sum_{j=1}^n(Z_j-\overline{Z})^2}$$
Третий
При этом предполагается, что все участвующие в вероятностной модели случайные величины независимы (в совокупности) между собой.
Отметим одно важное свойство функции распределения случайной величины $$Z$$. Если случайные величины $$X$$ и $$Y$$ независимы и одинаково распределены, то для функции распределения $$H(x)=P(Z\le x)$$ случайной величины $$Z = X - Y$$ выполнено, как нетрудно видеть, соотношение$$H(-x)=1-H(x)$$
Это соотношение означает симметрию функции распределения относительно 0. Плотность такой функции распределения является четной функцией, ее значения в точках $$x$$ и $$(-x)$$ совпадают.
Проверка гипотезы однородности связанных выборок в наиболее общем случае сводится к проверке симметрии функции распределения разности $$Z = X - Y$$ относительно 0.
Рассмотрим методы проверки гипотезы симметрии функции распределения относительно 0. Сначала обсудим, какого типа отклонения от гипотезы симметрии можно ожидать при альтернативных гипотезах?
Как и в случае проверки однородности независимых выборок, в зависимости от вида альтернативной гипотезы выделяют два подуровня моделей. Рассмотрим сначала альтернативу сдвига$$H_{13}:G(x)=F(x+a).$$
В этом случае распределение $$Z$$ при альтернативе отличается сдвигом от симметричного относительно 0. Для проверки гипотезы однородности может быть использован критерий знаковых рангов, разработанный Вилкоксоном (см., например, справочник [, с.46-53]).
Он строится следующим образом. Пусть $$R(Z_j)$$ является рангом $$|Zj|$$ в ранжировке от меньшего к большему абсолютных значений разностей $$|Z_1|, |Z_2|,...,|Z_n|, j=1,2,...,n$$. Положим для $$j=1,2,...,n$$$$Q(Z_j)= \left\{ \begin{aligned} 1,Z_j>0, 0,Z_j<0. \end{aligned} \right.$$
Статистика критерия знаковых рангов имеет вид$$W^+=\sum_{j=1}^n R(Z_j)Q(Z_j).$$
Таким образом, нужно просуммировать ранги положительных разностей в вариационном ряду, построенном стандартным образом по абсолютным величинам всех разностей.
Для практического использования статистики критерия знаковых рангов Вилкоксона либо обращаются к соответствующим таблицам и программному обеспечению, либо применяют асимптотические соотношения. При выполнении нулевой гипотезы статистика$$W^{++}=\frac{W^+-\frac{n(n+1)}{4}}{\sqrt{\frac{n(n+1)(2n+1)}{24}}}$$
имеет асимптотическое (при $$n\rightarrow\infty$$ ) стандартное нормальное распределение с математическим ожиданием 0 и дисперсией 1. Следовательно, правило принятия решений на уровне значимости 5% имеет обычный вид: если$$|W^{++}|\le 1,96,$$
то гипотезу однородности связанных выборок по критерию знаковых рангов Вилкоксона принимают, в противном случае - отклоняют. Как обычно, при желании использовать другой уровень значимости применяют в качестве критического значения иной
Альтернативная гипотеза общего вида записывается как$$H_{14}:H(-x_0)\ne 1-H(x_0)$$ при некотором $$х_0$$. Таким образом, проверке подлежит гипотеза симметрии относительно 0, которую можно переписать в виде$$H(x)+H(-x)-1=0.$$
Для построенной по выборке $$Z_j = х_j - у_j , j = 1,2,...,n$$,
Как измерять отличие от 0? По тем же соображениям, что и в предыдущем параграфе, целесообразно использовать статистику типа омега-квадрат. Соответствующий критерий был предложен в работе []. Он имеет вид \omega_n^2=\sum_{j=1}^n(H_n(Z_j)+H_n(-Z_j)-1)^2
В работе [] найдено предельное распределение этой статистики:$$\lim_{n\rightarrow\infty}P(\omega_n^2< x)=S_0(x).$$
В табл.8.2 приведены критические значения статистики типа омега-квадрат для проверки симметрии распределения (и тем самым для проверки однородности связанных выборок), соответствующие наиболее распространенным значениям уровней значимости (расчеты проведены Г.В. Мартыновым). При практических вычислениях удобнее принять, что эмпирическая функция распределения $$H_n(x)$$ - это доля результатов наблюдений, не превосходящих $$x$$.
Как следует из табл.8.2, правило принятия решений при проверке однородности связанных выборок в наиболее общей постановке и при уровне значимости 5% формулируется следующим образом: вычислить статистику $$\omega_n^2$$. Если $$\omega_n^2\le 1,66$$, то принять гипотезу однородности. В противном случае - отвергнуть.
| Значение функции распределения $$S_0(x)$$ | Уровень значимости $$\alpha=1-S_0(x)$$ | Критическое значение х статистики $$\omega_n^2$$ |
|---|---|---|
| 0,90 | 0,10 | 1,20 |
| 0,95 | 0,05 | 1,66 |
| 0,99 | 0,01 | 2,80 |
Пример. Пусть величины $$Z_j, j=1,2,...,20$$, таковы:$$\begin{gathered} 20, 18, (-2), 34, 25, (-17), 24, 42, 16, 26, \\ 13, (-23), 35, 21, 19, 8, 27, 11, (-5), 7. \end{gathered}$$
Соответствующий вариационный ряд $$Z(1)<Z(2)<...<Z(20)$$ имеет вид:$$\begin{gathered} (-23) < (-17) < (-5) < (-2) < 7 < 8 < 11 < 13 < 16 < 18 < \\ < 19 < 20 < 21 < 24 < 25 < 26 < 27 < 34 < 35 < 42. \end{gathered}$$
Для расчета значения статистики $$\omega_n^2$$ построим табл.8.3 из 7 столбцов и 20 строк, не считая заголовков столбцов (сказуемого таблицы). В первом столбце указаны номера (ранги) членов вариационного ряда, во втором - сами эти члены, в третьем - значения
| $$j$$ | $$Z(j)$$ | $$H_n(Z(j))$$ | $$-Z(j)$$ | $$H_n(-Z(j))$$ | $$H_n(Z(j))+H_n(-Z(j))-1$$ | $$(H_n(Z(j))+H_n(-Z(j))-1)^2$$ |
|---|---|---|---|---|---|---|
| 1 | -23 | 0,05 | 23 | 0,65 | -0,30 | 0,09 |
| 2 | -17 | 0,10 | 17 | 0,45 | -0,45 | 0,2025 |
| 3 | -5 | 0,15 | 5 | 0,20 | -0,65 | 0,4225 |
| 4 | -2 | 0,20 | 2 | 0,20 | -0,60 | 0,36 |
| 5 | 7 | 0,25 | -7 | 0,10 | -0,65 | 0,4225 |
| 6 | 8 | 0,30 | -8 | 0,10 | -0,60 | 0,36 |
| 7 | 11 | 0,35 | -11 | 0,10 | -0,55 | 0,3025 |
| 8 | 13 | 0,40 | -13 | 0,10 | -0,50 | 0,25 |
| 9 | 16 | 0,45 | -16 | 0,10 | -0,45 | 0,2025 |
| 10 | 18 | 0,50 | -18 | 0,05 | -0,45 | 0,2025 |
| 11 | 19 | 0,55 | -19 | 0,05 | -0,40 | 0,16 |
| 12 | 20 | 0,60 | -20 | 0,05 | -0,35 | 0,1225 |
| 13 | 21 | 0,65 | -21 | 0,05 | -0,30 | 0,09 |
| 14 | 24 | 0,70 | -24 | 0 | -0,30 | 0,09 |
| 15 | 25 | 0,75 | -25 | 0 | -0,25 | 0,0625 |
| 16 | 26 | 0,80 | -26 | 0 | -0,20 | 0,04 |
| 17 | 27 | 0,85 | -27 | 0 | -0,15 | 0,0225 |
| 18 | 34 | 0,90 | -34 | 0 | -0,10 | 0,01 |
| 19 | 35 | 0,95 | -35 | 0 | -0,05 | 0,0025 |
| 20 | 42 | 1,00 | -42 | 0 | 0 | 0 |
Результаты расчетов (суммирование значений по седьмому столбцу табл.8.3) показывают, что значение статистики $$\omega_n^2=3,055$$. В соответствии с табл.8.2 это означает, что на любом используемом в прикладных эконометрических исследованиях уровнях значимости отклоняется гипотеза симметрии распределения относительно 0 (а потому и гипотеза однородности в связанных выборках).
В настоящей лекции затронута лишь небольшая часть непараметрических методов анализа числовых статистических данных. В частности, обратим внимание на непараметрические оценки плотности, которые используются для описания данных, проверки однородности, в задачах восстановления зависимостей и других областях прикладной статистики. Непараметрические оценки плотности рассмотрены в лекции 5.
| $$N$$ | $$n_1$$ | $$\overline{X}$$ | $$s_x$$ | $$n_2$$ | $$\overline{Y}$$ | $$s_y$$ |
|---|---|---|---|---|---|---|
| 1 | 100 | 13,7 | 7,3 | 200 | 12,1 | 2,5 |
| 2 | 200 | 10,2 | 5,3 | 400 | 12,0 | 1,7 |
| Первая выборка | 33 | 27 | 12 | 27 | 39 | 42 | 47 | 48 | 50 | 32 |
| Вторая выборка | 11 | 20 | 30 | 31 | 22 | 18 | 17 | 25 | 28 | 29 |
| $$j$$ | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| $$X_j$$ | 74 | 79 | 65 | 69 | 71 | 66 | 71 | 73 | 72 | 68 |
| $$Y_j$$ | 73 | 65 | 71 | 69 | 70 | 69 | 78 | 70 | 60 | 62 |
| $$j$$ | 11 | 12 | 13 | 14 | 15 | 16 | 17 | 18 | 19 | 20 |
| $$X_j$$ | 70 | 69 | 76 | 74 | 72 | 69 | 74 | 72 | 77 | 75 |
| $$Y_j$$ | 61 | 67 | 73 | 67 | 73 | 64 | 67 | 65 | 63 | 70 |
Примечание. Для уровня значимости 0,05 критическим значением для критерия Смирнова является 0,7 (т.е. гипотеза однородности отклоняется, если значение статистики Смирнова не менее 0,7). Для того же уровня значимости критическим значением для критерия типа омега-квадрат (Лемана-Розенблатта) является 0,461.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.