Исследование операций и модели экономического поведения

Проверка простой гипотезы относительно простой альтернативы

Разбить на страницы
Показывать лекцию целиком

Байесовское решение как проверка по отношению правдоподобия

Рассмотрим статистическую игру (17.17) при m=n=2. Примером операции такого рода является обсуждавшаяся в предыдущей лекции задача диагностики туберкулеза. Будем использовать эту задачу для иллюстрации основных положений, вводимых ниже.

Примем, что функция потерь $$L(\omega, a)$$ включает лишь затраты, вызываемые ошибками при постановке диагноза. При этом потери L(1,2), связанные с ошибочным направлением на лечение здорового человека, примем за единицу потерь. Тогда$$L(1,1) = L(2,2) = 0,\quad L(1,2) = 1,\quad L(2,1) =w,$$ где w>0 есть (выраженные в указанных выше единицах) потери от постановки ошибочного диагноза лицу, пораженному заболеванием. Заметим, что при сделанных предположениях функция $$L(\omega, a)$$ полностью определяется заданием единственного числа w>0.

В соответствии с замечанием о простых гипотезах (см. лекцию 17), любая статистическая игра с функцией потерь вида (18.1) может интерпретироваться как выбор одной из двух простых гипотез. При этом остающаяся альтернатива также соответствует простой гипотезе.

Отметим, что два типа ошибок статистика, возможных в обсуждавшейся задаче диагностики туберкулеза, вообще говоря, не являются одинаковыми по сопровождающим их потерям. Случай, когда обследование не выявило факт заболевания, следствием чего будет позднее начало лечения запущенной формы болезни, должен рассматриваться как более серьезная ошибка, чем направление здорового человека для прохождения курса леченияЗаметим, что такое направление предполагает более подробное обследование, предшествующее лечению. Затраты на это обследование и ущерб от временного прерывания нормальной жизнедеятельности пациента (не нуждавшегося в лечении) составляют содержание потерь, вызываемых обсуждаемым ошибочным диагнозом..

В задачах выбора решений, для которых характерно указанное различие последствий, вызываемых ошибками, бoлее серьезную ошибку, ведущую к большим потерям, принято называть ошибкой первого рода. Вторая возможная ошибка называется ошибкой второго рода.

Указанное различие в классификации ошибок ведет к соответствующему различению двух рассматриваемых гипотез. Если отвержение гипотезы, являющейся истинной, ведет к ошибке первого рода, то ее называют испытуемой гипотезой или нуль-гипотезой. В рассматриваемом примере диагностики туберкулеза такой гипотезой является наличие заболевания (т.е. факт порождения исхода испытания $$z\in Z$$ случайной величиной с распределением p2(z) ).

Матрица потерь, соответствующая функции (18,1), и введенные наименования для состояний природы, действий статистика и ошибок представлены в табл. 4.3.

Введем обозначение $$\zeta = \xi(1)$$ для априорной вероятности первого состояния природы, т.е. примем, что$$\xi =(\zeta, 1 - \zeta),\quad 0 \le \zeta \le 1,$$ и определим условия, при выполнении которых решение a=1, соответствующее отвержению нуль-гипотезы, будет байесовским. Согласно (17.21), эти условия состоят в выполнении неравенства$$L(1,1) p_1(z) \xi(1) + L(2,1)p_2(z) \xi(2) \le L(1,2) p_1(z) \zeta(1) + L(2,2) p_2(z) \xi(2),$$ которое, учитывая (18.1) и (18.2), может быть представлено в виде$$w p_2(z)(1 -\zeta) \le p_1(z)\zeta$$ или$$\frac{p_2(z)}{p_1(z)} \le c(w, \zeta) = \frac{\zeta}{w(1 - \zeta)}.$$

Матрица потерь Решения статистика: Нуль-гипотезу
Состояния природы: Нуль гипотеза Отвергнуть ( a=1 ) Принять ( a=2 )
Не верна $$(\omega = 1)$$ } Ошибки нет L(1,1)=0 Ошибка 2 рода L(1,2)=1
Верна $$(\omega=2)$$ Ошибка 1 рода L(2,1)=w Ошибки нет L(2,2)=0

Условие (18,3) выделяет точки $$z\in Z$$, которым сопоставляется решение az=1, определяемое байесовской решающей функцией $$d_\zeta$$. При этом az=2, если для соответствующего значения z условие (18,3) не выполняется. Следовательно, байесовская стратегия $$d_\zeta$$ может быть задана разбиением множества исходов Z из (17.7) на подмножества Q1 и Q2 из (17.3), где$$\begin{gathered} Q_1 = \{z \in Z\colon \frac{p_2(z)}{p_1(z)} \le c(w,\zeta)\},\\ Q_2 = \{z \in Z\colon \frac{p_2(z)}{p_1(z)} > c(w,\zeta)\}, \end{gathered}$$ и $$c(w, \zeta)$$ из (18.3).

Определение 4.1 ( критической области критерия). Для именования стратегий (или решающих функций) статистика используется также и более старый термин статистический критерий (или просто критерий). При этом множество Q1 исходов $$z \in Z$$, наблюдение которых ведет к отвержению нуль-гипотезы в соответствии с некоторым критерием $$d\in D$$, называется критической областью этого критерия

Заметим, что в силу принятого условия n=2, разбиение множества исходов Z на подмножества из (17.13) содержит лишь два элемента Q1 и Q2, т.е.$$Z = Q_1 \cup Q_2.$$ Следовательно, критическая область $$Q_1 \subset Z$$ полностью определяет соответствующий критерий $$d \in D$$.

В дальнейшем для выделения критических областей, соответствующих байесовским критериям $$d_\xi$$, $$\xi \in S_2$$, будем обозначать определяющие их критические области из (18.3) символом $$Q_\zeta$$, где $$\zeta$$ из (18.2).

Замечание 4.3. (о проверках по отношению правдоподобия ).

Отношение вероятностей p2(z) и p1(z) из левой части правила (18.3) называют отношением правдоподобия, поскольку сами эти вероятности, характеризующие частоты исходов испытаний, первоначально именовались функциями правдоподобия. Поэтому правила выбора решений, основанные на условиях типа (18.3), получили название проверок по отношению правдоподобия.

Идея использования отношений правдоподобия для выбора простой гипотезы (при простой альтернативе) путем сравнения этого отношения с некоторой положительной константой c возникла независимо от концепции байесовских решений, минимизирующих ожидаемые потери. В ее основе лежит простое соображение, согласно которому при p2(z)/p1(z)<1 более правдоподобно, что исход $$z\in Z$$ соответствует случайной величине с распределением p1(z). При этом, учитывая разный характер последствий, связанных с различными ошибочными решениями, а также (обычно имеющееся) различие частот появления состояний $$\omega = 1$$ и $$\omega= 2$$, значение константы сравнения c могло быть выбрано отличным от 1.

Таким образом, байесовский критерий $$d_\xi$$, задаваемый критической областью $$Q_\zeta$$ из (18.4), относится к классу проверок по отношению правдоподобия. При этом рассмотренный байесовский подход позволяет дать содержательную интерпретацию значений константы $$c = c(w, \zeta)$$.

Поскольку при любой функции потерь вида (18.1) значение величины $$c = c(w, \zeta)$$ из (18.3) пробегает весь диапазон $$0\le c < \infty$$ при изменении вероятности $$\zeta$$ от нулевого до единичного значений, то класс всех проверок по отношению правдоподобия совпадает с классом всех байесовских критериев $$d_\xi$$, $$\xi \in \Xi = S_2$$.

Значимость и мощность критерия

Рассмотрим некоторый критерий $$d\in D$$, заданный критической областью $$Q_1 \subset Z$$. Ошибки первого рода, порождаемые этим критерием, соответствуют отвержению правильной нуль-гипотезы. Следовательно, такие ошибки происходят при попадании выборочной точки z, являющейся реализацией случайной величины с распределением p2(z), в критическую область Q1 (см. табл. 4.3). Вероятность таких ошибок$$\alpha = \sum_{z \in Q_1} p_2(z)$$ называется значимостью (или уровнем значимости критерия d.

Ошибка второго рода соответствует выборочным точкам z, порожденным случайной величиной с распределением p1(z) и попадающим в дополнение критической области, т.е. во множество Q2 из (18.5). Поэтому вероятность таких ошибок есть$$\beta = \sum_{z \in Q_2} p_1(z).$$ При этом величина$$1 - \beta = \sum_{z \in Z} p_1(z) - \sum_{z \in Q_2} p_1(z) = \sum_{z \in Q_1} p_1(z),$$ характеризующая вероятность отвержения неверной испытуемой гипотезы, называется мощностью критерия.

(рис 4.3)

Отметим, что величины (18.06) и (18.8), характеризующие (соответственно) значимость и мощность критерия, определяются суммированием распределений p2(z) и p1(z) по одной и той же критической области Q1. Это обстоятельство ограничивает возможность формирования критической области, обеспечивающей одновременно высокую (т.е. близкую к нулевому значению) значимость критерия и высокую (т.е. близкую к единичному значению) мощность критерия.

В качестве иллюстрации на рис. 4.3 приведены функции правдоподобия p1(z), p2(z) и соответствующие им кривые мощности $$1-\beta(z)$$ и значимости $$\alpha(z)$$ для случая $$N=17$$. Параметр z задает критическую область$$Q_1 = \{u \in Z \colon u \le z\},$$ по которой осуществляется суммирование в (18.6) и (18.8). На рисунке отмечена точка z, которой соответствует единичное значение отношения правдоподобия, и указана область Q1 из (18.9), определяемая этой точкой.

Функция байесовского риска

Введем обозначение ci для возможных в модели испытаний (17.7), (17.8) значений отношения правдоподобия:$$c_i = \frac{p_2(z_i)}{p_1(z_i)},\quad 1 \le i \le N.$$

Дополним эти значения величинами$$c_0 = 0,\qq c_{N+1} = \infty$$ и условимся, что нумерация чисел (18.10), (18.11) выполнена в порядке возрастания их значений, т.е.$$c_i \le c_{i+1},\quad 0 \le i \le N.$$

Поскольку при такой нумерации из включения $$c \in [c_i, c_{i+1})$$ вытекает выполнение неравенств$$c_i \le c < c_{i+1},$$ то проверке по отношению правдоподобия с константой сравнения c соответствует критическая область Q1(i), содержащая первые i исходов из множества (17.7). Т.е.$$(\forall\, 0 \le i \le N)\quad c \in [c_i, c_{i+1}) \to Q_1(i) = \{z_1\dots z_i\}.$$ Таким образом, класс всех проверок по отношению правдоподобия (и, следовательно, класс всех байесовских решающих функций) определяется набором, содержащим N+1 критическую область:$$Q_1(0) = \varnothing \dots Q_1(i) = \{z_1\dots z_i\} \dots Q_1(N) = Z.$$

Теперь для конкретного значения w, определяющего функцию потерь из (18.1), вычислим вероятности $$\zeta_i$$ из (18.2), при которых величина $$c(\zeta_i,w)$$ из (18.3) совпадает с числом ci из (18.10), т.е.$$c_i = c(\zeta_i,w) = \frac{\zeta_i}{w(1 - \zeta_i)}.$$ Отсюда$$\zeta_i = \frac{wc_i}{(1 + wc_i)},\quad 0 \le i \le N+1,$$ причем, в силу (18.11), (18.12),$$\zeta_i \le \zeta_{i+1},\quad 0 \le i \le N,\quad \zeta_0 = 0,\ \zeta_{N+1} = 1.$$

Таким образом, интервал [0,1) возможных значений априорной вероятности $$\zeta = \xi(1)$$ появления первого состояния природы разбивается значениями из набора (18.15), (18.16) на N+1 подынтервал $$[\zeta_i, \zeta_{i+1})$$, $$0\le i\le N$$. При этом из включения $$\zeta \in [\zeta_i, \zeta_{i+1})$$ вытекает справедливость неравенств$$c_i \le c(\zeta,w) < c_{i+1},$$ и, следовательно, критическая область $$Q_\zeta$$ байесовского критерия $$d_\xi$$ совпадает с критической областью Q1(i) из (18.13), т.е.$$(\forall \zeta \in [\zeta_i, \zeta_{i+1})) \quad Q_\zeta = Q_1(i) = \{z_1 \dots z_i\}.$$

Согласно (18.1), потери статистика происходят лишь в случае ошибочных решений. Следовательно, математическое ожидание потерь, соответствующих критерию d, характеризуемому критической областью Q1 и вероятностями ошибок (18.6), (18.7), определяется величиной$$\rho(\xi, d) = L(1,2)\zeta \beta + L(2,1)(1 - \zeta) \alpha,$$ где $$\zeta$$ из (18.2).

Согласно (18.6) и (18.7), критической области (18.17) соответствуют вероятности ошибок первого и второго рода, представляющие собой следующие суммы:$$\alpha_i = p_2(z_1) + \ldots + p_2(z_i),$$ $$\beta_i = p_1(z_{i+1}) + \ldots + p_1(z_N).$$ Теперь из (18.18)-(18.20) следует, что величина$$\rho(\zeta) = \rho(\xi, d_\xi) = \zeta(\beta_i - w \alpha_i) + w \alpha_i,\quad \zeta \in [\zeta_i,\zeta_{i+1}),$$ соответствует ожидаемым потерям для байесовского критерия.

Согласно (18.21), байесовский риск $$\rho(\zeta)$$ является кусочно-линейной функцией параметра $$\zeta$$, поскольку значения коэффициентов $$\alpha_i$$ и $$\beta_i$$ из (18.19) и (18.20) остаются неизменными при вариации $$\zeta$$ в подынтервале $$\zeta \in [\zeta_i, \zeta_{i+1})$$. Непосредственной проверкой можно убедиться, что функция $$\rho(\zeta)$$ является непрерывной, поскольку линейные дуги (18.21) пересекаются в точках $$\zeta_i$$, $$1\le i \le N$$. Действительно, положим$$\zeta_i(\beta_{i-1} - w \alpha_{i-1}) + w \alpha_{i-1} = \zeta_i(\beta_i - w \alpha_i) + w \alpha_i$$ и подставим в это выражение значения вероятностей ошибок из (18.19), (18.20). В результате получим равенство$$\zeta_i = \frac{w p_2(z_i)}{p_1(z_i) + w p_2(z_i)},$$ совпадающее, согласно (18.10), с определением (18.15)Ниже мы установим, что функция $$\rho(\zeta)$$ является вогнутой, из чего автоматически следует ее непрерывность. Тем не менее, небольшое упражнение по непосредственной проверке непрерывности риска $$\rho(\zeta)$$ представляется уместным с методической точки зрения.. Отметим также, что из (18.14) и (18.19)-(18.21) можно получить оценки$$\rho(0) = \rho(1) = 0.$$ Продолжим изучение свойств байесовского риска.

Лемма 4.1 (о вогнутости инфимума семейства вогнутых функций). Пусть функции $$\varphi_t(x)$$, $$t\in T$$, определенные на выпуклом множестве X, вогнуты по x а этом множестве. Тогда нижняя огибающая этого семейства$$\varphi(x) = \inf_{t \in T} \varphi_t(x),\quad x \in X,$$ также вогнута на множестве X, если она является конечнойЗаметим, что рис. 4.1 демонстрирует семейство из трех вогнутых (линейных) функций, определенных на выпуклом (отрезок [0,1] ) множестве и имеющих вогнутую нижнюю огибающую..

Доказательство. Пусть x1 и x2 есть две произвольные точки из множества X и точка$$x = \gamma x_1 + (1 - \gamma) x_2,\quad 0 \le \gamma \le 1,$$ есть их выпуклая комбинация, принадлежащая множеству X в силу его выпуклости. Согласно условиям леммы и определению (18.23), для любого $$t\in T$$ справедливо, что$$\begin{gathered} \varphi_t(x) = \varphi_t(\gamma x_1 + (1 - \gamma)x_2) \ge \gamma\varphi_t(x_1) + (1 - \gamma)\varphi_t(x_2) \ge \\ \ge \gamma\varphi(x_1) + (1 -\gamma)\varphi(x_2). \end{gathered}$$ Поскольку неравенства (18.24) верны при любом значении $$t \in T$$, то они должны быть справедливы и для функции $$\varphi(x)$$. Следовательно,$$\varphi(x) = \varphi(\gamma x_1 + (1 - \gamma)x_2)\ge \gamma\varphi(x_1) + (1 - \gamma) \varphi(x_2),$$ где x1, $$x_2\in X$$ и г $$0\le \gamma \le 1$$.

Следствие 4.1. Функция байесовского риска $$\rho(\zeta)$$ вогнута по $$\zeta$$ на интервале [0,1].

Доказательство В соответствии с определением (17.18), (17.19) и учитывая (18.21) и возможность задания любого байесовского критерия критической областью (18.17) из конечного набора (18.14), получаем, что$$\eq{ \rho(\zeta) \!=\! \min\{\rho(\xi,d)\colon d \in D\} \!=\! \min\{\zeta(\beta_i \!-\! w \al_i) \!+\! w \al_i\colon 0 \!\le\! i \!\le\! N\}. \label{eq18_25} }$$

Поскольку линейные функции из правой части (18.25) являются вогнутыми, то в соответствии с утверждением леммы их нижняя огибающая также должна быть вогнутой.

Пример 4.3. Второй и третий столбцы табл. 4.4 представляют значения функций правдоподобия для некоторой схемы испытаний с четырьмя возможными исходами. При этом исходы занумерованы в соответствии с правилами (18.10)-(18.12) (см. четвертый столбец таблицы). Для заданного значения w=1,5 таблица содержит также граничные точки подынтервалов из (18.15), (18.16), вероятности ошибок первого и второго рода из (18.19), (18.20) и выражения для функций$$\rho_i(\zeta) = \zeta(\beta_i - w \alpha_i) + w \alpha_i,\,\zeta \in [0,1],$$ совпадающих с байесовским риском в соответствующих подынтервалах $$[\zeta_i, \zeta_{i+1})$$, $$0 \le i \le 4$$.

i p1(zi) p2(zi) ci $$\zeta_i$$ $$\alpha_i$$ $$\beta_i$$ $$\rho_i(z)$$
0 - - 0 0 0 1 $$\zeta$$
1 0,675 0,05 0,074 0,1 0,05 0,325 $$0{,}25\zeta + 0{,}075$$
2 0,059 0,016 0,285 0,3 0,066 0,266 $$0{,}166\zeta + 0{,}1$$
3 1,133 0,134 1 0,6 0,2 0,133 $$-0{,}166\zeta + 0{,}3$$
4 0,133 0,8 6 0,9 1 0 $$-1{,}5\zeta + 1{,}5$$

Представленная на рис. 4.4 функция $$\rho(\zeta)$$ из (18.21), соответствующая данным из табл. 4.4, иллюстрирует рассмотренные выше свойства байесовского риска.

(рис 4.4)

Определение 4.2 (наименее выгодного распределения). Априорное распределение $$\xi^\circ$$ из (18.2), при котором функция байесовского риска достигает максимального значения$$\rho^\circ = \rho(\zeta^\circ) = \max\{\rho(\zeta)\colon 0 \le \zeta \le 1\}$$ где $$\zeta = \xi(1)$$, называется наименее выгодным распределением вероятностей для состояний природы. Заметим, что точка $$\zeta^\circ$$ является внутренней точкой интервала (0,1) и совпадает с одной из точек $$\zeta_i$$, $$1 \le i \le N$$, поскольку функция $$\rho(\zeta)$$ является вогнутой и имеет, согласно (18.22), нулевые значения на концах интервала [0,1] ; см. рис. 4.4.

Страницы:

Байесовское решение как проверка по отношению правдоподобия

Рассмотрим статистическую игру (17.17) при m=n=2. Примером операции такого рода является обсуждавшаяся в предыдущей лекции задача диагностики туберкулеза. Будем использовать эту задачу для иллюстрации основных положений, вводимых ниже.

Примем, что функция потерь $$L(\omega, a)$$ включает лишь затраты, вызываемые ошибками при постановке диагноза. При этом потери L(1,2), связанные с ошибочным направлением на лечение здорового человека, примем за единицу потерь. Тогда$$L(1,1) = L(2,2) = 0,\quad L(1,2) = 1,\quad L(2,1) =w,$$ где w>0 есть (выраженные в указанных выше единицах) потери от постановки ошибочного диагноза лицу, пораженному заболеванием. Заметим, что при сделанных предположениях функция $$L(\omega, a)$$ полностью определяется заданием единственного числа w>0.

В соответствии с замечанием о простых гипотезах (см. лекцию 17), любая статистическая игра с функцией потерь вида (18.1) может интерпретироваться как выбор одной из двух простых гипотез. При этом остающаяся альтернатива также соответствует простой гипотезе.

Отметим, что два типа ошибок статистика, возможных в обсуждавшейся задаче диагностики туберкулеза, вообще говоря, не являются одинаковыми по сопровождающим их потерям. Случай, когда обследование не выявило факт заболевания, следствием чего будет позднее начало лечения запущенной формы болезни, должен рассматриваться как более серьезная ошибка, чем направление здорового человека для прохождения курса леченияЗаметим, что такое направление предполагает более подробное обследование, предшествующее лечению. Затраты на это обследование и ущерб от временного прерывания нормальной жизнедеятельности пациента (не нуждавшегося в лечении) составляют содержание потерь, вызываемых обсуждаемым ошибочным диагнозом..

В задачах выбора решений, для которых характерно указанное различие последствий, вызываемых ошибками, бoлее серьезную ошибку, ведущую к большим потерям, принято называть ошибкой первого рода. Вторая возможная ошибка называется ошибкой второго рода.

Указанное различие в классификации ошибок ведет к соответствующему различению двух рассматриваемых гипотез. Если отвержение гипотезы, являющейся истинной, ведет к ошибке первого рода, то ее называют испытуемой гипотезой или нуль-гипотезой. В рассматриваемом примере диагностики туберкулеза такой гипотезой является наличие заболевания (т.е. факт порождения исхода испытания $$z\in Z$$ случайной величиной с распределением p2(z) ).

Матрица потерь, соответствующая функции (18,1), и введенные наименования для состояний природы, действий статистика и ошибок представлены в табл. 4.3.

Введем обозначение $$\zeta = \xi(1)$$ для априорной вероятности первого состояния природы, т.е. примем, что$$\xi =(\zeta, 1 - \zeta),\quad 0 \le \zeta \le 1,$$ и определим условия, при выполнении которых решение a=1, соответствующее отвержению нуль-гипотезы, будет байесовским. Согласно (17.21), эти условия состоят в выполнении неравенства$$L(1,1) p_1(z) \xi(1) + L(2,1)p_2(z) \xi(2) \le L(1,2) p_1(z) \zeta(1) + L(2,2) p_2(z) \xi(2),$$ которое, учитывая (18.1) и (18.2), может быть представлено в виде$$w p_2(z)(1 -\zeta) \le p_1(z)\zeta$$ или$$\frac{p_2(z)}{p_1(z)} \le c(w, \zeta) = \frac{\zeta}{w(1 - \zeta)}.$$

Матрица потерь Решения статистика: Нуль-гипотезу
Состояния природы: Нуль гипотеза Отвергнуть ( a=1 ) Принять ( a=2 )
Не верна $$(\omega = 1)$$ } Ошибки нет L(1,1)=0 Ошибка 2 рода L(1,2)=1
Верна $$(\omega=2)$$ Ошибка 1 рода L(2,1)=w Ошибки нет L(2,2)=0

Условие (18,3) выделяет точки $$z\in Z$$, которым сопоставляется решение az=1, определяемое байесовской решающей функцией $$d_\zeta$$. При этом az=2, если для соответствующего значения z условие (18,3) не выполняется. Следовательно, байесовская стратегия $$d_\zeta$$ может быть задана разбиением множества исходов Z из (17.7) на подмножества Q1 и Q2 из (17.3), где$$\begin{gathered} Q_1 = \{z \in Z\colon \frac{p_2(z)}{p_1(z)} \le c(w,\zeta)\},\\ Q_2 = \{z \in Z\colon \frac{p_2(z)}{p_1(z)} > c(w,\zeta)\}, \end{gathered}$$ и $$c(w, \zeta)$$ из (18.3).

Определение 4.1 ( критической области критерия). Для именования стратегий (или решающих функций) статистика используется также и более старый термин статистический критерий (или просто критерий). При этом множество Q1 исходов $$z \in Z$$, наблюдение которых ведет к отвержению нуль-гипотезы в соответствии с некоторым критерием $$d\in D$$, называется критической областью этого критерия

Заметим, что в силу принятого условия n=2, разбиение множества исходов Z на подмножества из (17.13) содержит лишь два элемента Q1 и Q2, т.е.$$Z = Q_1 \cup Q_2.$$ Следовательно, критическая область $$Q_1 \subset Z$$ полностью определяет соответствующий критерий $$d \in D$$.

В дальнейшем для выделения критических областей, соответствующих байесовским критериям $$d_\xi$$, $$\xi \in S_2$$, будем обозначать определяющие их критические области из (18.3) символом $$Q_\zeta$$, где $$\zeta$$ из (18.2).

Замечание 4.3. (о проверках по отношению правдоподобия ).

Отношение вероятностей p2(z) и p1(z) из левой части правила (18.3) называют отношением правдоподобия, поскольку сами эти вероятности, характеризующие частоты исходов испытаний, первоначально именовались функциями правдоподобия. Поэтому правила выбора решений, основанные на условиях типа (18.3), получили название проверок по отношению правдоподобия.

Идея использования отношений правдоподобия для выбора простой гипотезы (при простой альтернативе) путем сравнения этого отношения с некоторой положительной константой c возникла независимо от концепции байесовских решений, минимизирующих ожидаемые потери. В ее основе лежит простое соображение, согласно которому при p2(z)/p1(z)<1 более правдоподобно, что исход $$z\in Z$$ соответствует случайной величине с распределением p1(z). При этом, учитывая разный характер последствий, связанных с различными ошибочными решениями, а также (обычно имеющееся) различие частот появления состояний $$\omega = 1$$ и $$\omega= 2$$, значение константы сравнения c могло быть выбрано отличным от 1.

Таким образом, байесовский критерий $$d_\xi$$, задаваемый критической областью $$Q_\zeta$$ из (18.4), относится к классу проверок по отношению правдоподобия. При этом рассмотренный байесовский подход позволяет дать содержательную интерпретацию значений константы $$c = c(w, \zeta)$$.

Поскольку при любой функции потерь вида (18.1) значение величины $$c = c(w, \zeta)$$ из (18.3) пробегает весь диапазон $$0\le c < \infty$$ при изменении вероятности $$\zeta$$ от нулевого до единичного значений, то класс всех проверок по отношению правдоподобия совпадает с классом всех байесовских критериев $$d_\xi$$, $$\xi \in \Xi = S_2$$.

Значимость и мощность критерия

Рассмотрим некоторый критерий $$d\in D$$, заданный критической областью $$Q_1 \subset Z$$. Ошибки первого рода, порождаемые этим критерием, соответствуют отвержению правильной нуль-гипотезы. Следовательно, такие ошибки происходят при попадании выборочной точки z, являющейся реализацией случайной величины с распределением p2(z), в критическую область Q1 (см. табл. 4.3). Вероятность таких ошибок$$\alpha = \sum_{z \in Q_1} p_2(z)$$ называется значимостью (или уровнем значимости критерия d.

Ошибка второго рода соответствует выборочным точкам z, порожденным случайной величиной с распределением p1(z) и попадающим в дополнение критической области, т.е. во множество Q2 из (18.5). Поэтому вероятность таких ошибок есть$$\beta = \sum_{z \in Q_2} p_1(z).$$ При этом величина$$1 - \beta = \sum_{z \in Z} p_1(z) - \sum_{z \in Q_2} p_1(z) = \sum_{z \in Q_1} p_1(z),$$ характеризующая вероятность отвержения неверной испытуемой гипотезы, называется мощностью критерия.

(рис 4.3)

Отметим, что величины (18.06) и (18.8), характеризующие (соответственно) значимость и мощность критерия, определяются суммированием распределений p2(z) и p1(z) по одной и той же критической области Q1. Это обстоятельство ограничивает возможность формирования критической области, обеспечивающей одновременно высокую (т.е. близкую к нулевому значению) значимость критерия и высокую (т.е. близкую к единичному значению) мощность критерия.

В качестве иллюстрации на рис. 4.3 приведены функции правдоподобия p1(z), p2(z) и соответствующие им кривые мощности $$1-\beta(z)$$ и значимости $$\alpha(z)$$ для случая $$N=17$$. Параметр z задает критическую область$$Q_1 = \{u \in Z \colon u \le z\},$$ по которой осуществляется суммирование в (18.6) и (18.8). На рисунке отмечена точка z, которой соответствует единичное значение отношения правдоподобия, и указана область Q1 из (18.9), определяемая этой точкой.

Функция байесовского риска

Введем обозначение ci для возможных в модели испытаний (17.7), (17.8) значений отношения правдоподобия:$$c_i = \frac{p_2(z_i)}{p_1(z_i)},\quad 1 \le i \le N.$$

Дополним эти значения величинами$$c_0 = 0,\qq c_{N+1} = \infty$$ и условимся, что нумерация чисел (18.10), (18.11) выполнена в порядке возрастания их значений, т.е.$$c_i \le c_{i+1},\quad 0 \le i \le N.$$

Поскольку при такой нумерации из включения $$c \in [c_i, c_{i+1})$$ вытекает выполнение неравенств$$c_i \le c < c_{i+1},$$ то проверке по отношению правдоподобия с константой сравнения c соответствует критическая область Q1(i), содержащая первые i исходов из множества (17.7). Т.е.$$(\forall\, 0 \le i \le N)\quad c \in [c_i, c_{i+1}) \to Q_1(i) = \{z_1\dots z_i\}.$$ Таким образом, класс всех проверок по отношению правдоподобия (и, следовательно, класс всех байесовских решающих функций) определяется набором, содержащим N+1 критическую область:$$Q_1(0) = \varnothing \dots Q_1(i) = \{z_1\dots z_i\} \dots Q_1(N) = Z.$$

Теперь для конкретного значения w, определяющего функцию потерь из (18.1), вычислим вероятности $$\zeta_i$$ из (18.2), при которых величина $$c(\zeta_i,w)$$ из (18.3) совпадает с числом ci из (18.10), т.е.$$c_i = c(\zeta_i,w) = \frac{\zeta_i}{w(1 - \zeta_i)}.$$ Отсюда$$\zeta_i = \frac{wc_i}{(1 + wc_i)},\quad 0 \le i \le N+1,$$ причем, в силу (18.11), (18.12),$$\zeta_i \le \zeta_{i+1},\quad 0 \le i \le N,\quad \zeta_0 = 0,\ \zeta_{N+1} = 1.$$

Таким образом, интервал [0,1) возможных значений априорной вероятности $$\zeta = \xi(1)$$ появления первого состояния природы разбивается значениями из набора (18.15), (18.16) на N+1 подынтервал $$[\zeta_i, \zeta_{i+1})$$, $$0\le i\le N$$. При этом из включения $$\zeta \in [\zeta_i, \zeta_{i+1})$$ вытекает справедливость неравенств$$c_i \le c(\zeta,w) < c_{i+1},$$ и, следовательно, критическая область $$Q_\zeta$$ байесовского критерия $$d_\xi$$ совпадает с критической областью Q1(i) из (18.13), т.е.$$(\forall \zeta \in [\zeta_i, \zeta_{i+1})) \quad Q_\zeta = Q_1(i) = \{z_1 \dots z_i\}.$$

Согласно (18.1), потери статистика происходят лишь в случае ошибочных решений. Следовательно, математическое ожидание потерь, соответствующих критерию d, характеризуемому критической областью Q1 и вероятностями ошибок (18.6), (18.7), определяется величиной$$\rho(\xi, d) = L(1,2)\zeta \beta + L(2,1)(1 - \zeta) \alpha,$$ где $$\zeta$$ из (18.2).

Согласно (18.6) и (18.7), критической области (18.17) соответствуют вероятности ошибок первого и второго рода, представляющие собой следующие суммы:$$\alpha_i = p_2(z_1) + \ldots + p_2(z_i),$$ $$\beta_i = p_1(z_{i+1}) + \ldots + p_1(z_N).$$ Теперь из (18.18)-(18.20) следует, что величина$$\rho(\zeta) = \rho(\xi, d_\xi) = \zeta(\beta_i - w \alpha_i) + w \alpha_i,\quad \zeta \in [\zeta_i,\zeta_{i+1}),$$ соответствует ожидаемым потерям для байесовского критерия.

Согласно (18.21), байесовский риск $$\rho(\zeta)$$ является кусочно-линейной функцией параметра $$\zeta$$, поскольку значения коэффициентов $$\alpha_i$$ и $$\beta_i$$ из (18.19) и (18.20) остаются неизменными при вариации $$\zeta$$ в подынтервале $$\zeta \in [\zeta_i, \zeta_{i+1})$$. Непосредственной проверкой можно убедиться, что функция $$\rho(\zeta)$$ является непрерывной, поскольку линейные дуги (18.21) пересекаются в точках $$\zeta_i$$, $$1\le i \le N$$. Действительно, положим$$\zeta_i(\beta_{i-1} - w \alpha_{i-1}) + w \alpha_{i-1} = \zeta_i(\beta_i - w \alpha_i) + w \alpha_i$$ и подставим в это выражение значения вероятностей ошибок из (18.19), (18.20). В результате получим равенство$$\zeta_i = \frac{w p_2(z_i)}{p_1(z_i) + w p_2(z_i)},$$ совпадающее, согласно (18.10), с определением (18.15)Ниже мы установим, что функция $$\rho(\zeta)$$ является вогнутой, из чего автоматически следует ее непрерывность. Тем не менее, небольшое упражнение по непосредственной проверке непрерывности риска $$\rho(\zeta)$$ представляется уместным с методической точки зрения.. Отметим также, что из (18.14) и (18.19)-(18.21) можно получить оценки$$\rho(0) = \rho(1) = 0.$$ Продолжим изучение свойств байесовского риска.

Лемма 4.1 (о вогнутости инфимума семейства вогнутых функций). Пусть функции $$\varphi_t(x)$$, $$t\in T$$, определенные на выпуклом множестве X, вогнуты по x а этом множестве. Тогда нижняя огибающая этого семейства$$\varphi(x) = \inf_{t \in T} \varphi_t(x),\quad x \in X,$$ также вогнута на множестве X, если она является конечнойЗаметим, что рис. 4.1 демонстрирует семейство из трех вогнутых (линейных) функций, определенных на выпуклом (отрезок [0,1] ) множестве и имеющих вогнутую нижнюю огибающую..

Доказательство. Пусть x1 и x2 есть две произвольные точки из множества X и точка$$x = \gamma x_1 + (1 - \gamma) x_2,\quad 0 \le \gamma \le 1,$$ есть их выпуклая комбинация, принадлежащая множеству X в силу его выпуклости. Согласно условиям леммы и определению (18.23), для любого $$t\in T$$ справедливо, что$$\begin{gathered} \varphi_t(x) = \varphi_t(\gamma x_1 + (1 - \gamma)x_2) \ge \gamma\varphi_t(x_1) + (1 - \gamma)\varphi_t(x_2) \ge \\ \ge \gamma\varphi(x_1) + (1 -\gamma)\varphi(x_2). \end{gathered}$$ Поскольку неравенства (18.24) верны при любом значении $$t \in T$$, то они должны быть справедливы и для функции $$\varphi(x)$$. Следовательно,$$\varphi(x) = \varphi(\gamma x_1 + (1 - \gamma)x_2)\ge \gamma\varphi(x_1) + (1 - \gamma) \varphi(x_2),$$ где x1, $$x_2\in X$$ и г $$0\le \gamma \le 1$$.

Следствие 4.1. Функция байесовского риска $$\rho(\zeta)$$ вогнута по $$\zeta$$ на интервале [0,1].

Доказательство В соответствии с определением (17.18), (17.19) и учитывая (18.21) и возможность задания любого байесовского критерия критической областью (18.17) из конечного набора (18.14), получаем, что$$\eq{ \rho(\zeta) \!=\! \min\{\rho(\xi,d)\colon d \in D\} \!=\! \min\{\zeta(\beta_i \!-\! w \al_i) \!+\! w \al_i\colon 0 \!\le\! i \!\le\! N\}. \label{eq18_25} }$$

Поскольку линейные функции из правой части (18.25) являются вогнутыми, то в соответствии с утверждением леммы их нижняя огибающая также должна быть вогнутой.

Пример 4.3. Второй и третий столбцы табл. 4.4 представляют значения функций правдоподобия для некоторой схемы испытаний с четырьмя возможными исходами. При этом исходы занумерованы в соответствии с правилами (18.10)-(18.12) (см. четвертый столбец таблицы). Для заданного значения w=1,5 таблица содержит также граничные точки подынтервалов из (18.15), (18.16), вероятности ошибок первого и второго рода из (18.19), (18.20) и выражения для функций$$\rho_i(\zeta) = \zeta(\beta_i - w \alpha_i) + w \alpha_i,\,\zeta \in [0,1],$$ совпадающих с байесовским риском в соответствующих подынтервалах $$[\zeta_i, \zeta_{i+1})$$, $$0 \le i \le 4$$.

i p1(zi) p2(zi) ci $$\zeta_i$$ $$\alpha_i$$ $$\beta_i$$ $$\rho_i(z)$$
0 - - 0 0 0 1 $$\zeta$$
1 0,675 0,05 0,074 0,1 0,05 0,325 $$0{,}25\zeta + 0{,}075$$
2 0,059 0,016 0,285 0,3 0,066 0,266 $$0{,}166\zeta + 0{,}1$$
3 1,133 0,134 1 0,6 0,2 0,133 $$-0{,}166\zeta + 0{,}3$$
4 0,133 0,8 6 0,9 1 0 $$-1{,}5\zeta + 1{,}5$$

Представленная на рис. 4.4 функция $$\rho(\zeta)$$ из (18.21), соответствующая данным из табл. 4.4, иллюстрирует рассмотренные выше свойства байесовского риска.

(рис 4.4)

Определение 4.2 (наименее выгодного распределения). Априорное распределение $$\xi^\circ$$ из (18.2), при котором функция байесовского риска достигает максимального значения$$\rho^\circ = \rho(\zeta^\circ) = \max\{\rho(\zeta)\colon 0 \le \zeta \le 1\}$$ где $$\zeta = \xi(1)$$, называется наименее выгодным распределением вероятностей для состояний природы. Заметим, что точка $$\zeta^\circ$$ является внутренней точкой интервала (0,1) и совпадает с одной из точек $$\zeta_i$$, $$1 \le i \le N$$, поскольку функция $$\rho(\zeta)$$ является вогнутой и имеет, согласно (18.22), нулевые значения на концах интервала [0,1] ; см. рис. 4.4.

Вернуться к учебному плану