Введение в аналитику больших массивов данных

Информативность и выбор признаков

Показывать лекцию целиком

 

Ну а сейчас мы поговорим еще об одной очень важной проблеме анализа данных - о выборе системы наиболее информативных признаков. Первое замечание такое - успех в решении задачи анализа данных в основном определяется выбором признаков, потом можно разные сложные математические преобразования делать, что-то там выжимать, но если в признаке мало содержится информации, ничего сделать нельзя. Выбор признаков, сам по себе, это задача такая сложная. Первый этап - просто назначение каких-то характеристик на роль будущих полезных признаков. Это делает эксперт, тут наука помочь никак не может, не может прийти математик к врачу и сказать - вот у тебя лежит там неизвестной болезни больной, так ты у него измерь то, то, то и то. Каждый раз специалист знает, на, что нужно обратить внимание, если более-менее известная область, ну а если область совершенно новая, ну так наугад, по интуиции, авось набирается какой-то набор признаков с тем, чтобы потом проверить, может среди них есть действительно информативные и полезные. Вот тут наука может помочь, собственно этим и занимается раздел анализа данных, связанный с выбором признаков - оценить информативность предъявленных характеристик, выбрать из них необходимое и достаточное.

Надо сказать, что информативность вообще - это понятие относительное, в каждой задаче, если есть большой набор признаков, представим себе, что у нас имеется полный портрет человека на языке экспрессии его генов, полный геном изучили и видим, как работают разные гены. Задача состоит в том, чтобы выбрать наиболее важные гены, по которым можно было бы диагностировать вот такое-то заболевание. Да, такая задача решается в конце концов, из большого набора генов выбирается небольшое подмножество, иногда 3-4 гена достаточно, чтобы сделать диагноз этого заболевания. Но на тех же данных можно сказать, а теперь вот такое заболевание как бы отличать от здоровых? Хорошо, из того же набора мы выбираем другое подмножество генов, то есть для каждой задачи нужно выбирать свое подмножество информативных характеристик.

Как формально эта задача выглядит? Имеется исходный набор характеристик X, назовем, мы ориентируемся на какое-то решающее правило D. Мы знаем, что от чего нужно отличать, есть у нас алфавит распознаваемых образов. Кроме того, какие-то представления о допустимых потерях. Какие потери имеются в виду? Разные потери, если признаки будут малоинформативными, то будет много ошибок - это потери одни. С другой стороны, большое число признаков приводит к увеличению требуемого объема памяти и требует машинного времени дополнительного. При этом нужно так, чтобы с одной стороны это было просто и быстро, а с другой стороны хорошо, качественно, вот такой компромисс. То есть некоторое представление о допустимых потерях у нас имеется. И тогда решается задача экстремального такого характера, что мы среди всех возможных вариантов признаковых подсистем выбираем такую,, которая минимизирует эти потери.

Общая схема алгоритма выбора признаков может выглядеть так: имеется входная таблица, на которой мы работаем, и к ней применяется два разных метода выбора признаков. Первый метод - это фильтрация, второй — селекция. Фильтрация состоит том, что из заданного набора признаков нужно просто выбрать некоторое подмножество, отфильтровать остальные. А селекция предусматривает из исходного множества первичных признаков создание вторичных признаков. Это вот два таких направления. После того, как мы с помощью вот этого механизма выбрали подмножество или сформировали какие-то вторичные признаки, мы теперь должны оценить их информативность.

Методы оценки тоже различаются между собой, имеются разные, но главное - класса этих методов два: прямой или, как иногда называется, внутренний и внешний, косвенный способ оценки информативности признаков. Прямой - это когда судят о том, хорошо ли мы выбрали признаки или нет по тому, как мы распознаем в этом пространстве признаков объекты обучающей выборки, а косвенный состоит в том, что мы смотрим некоторые общие характеристики распределения, которые при этом получаются, и как-то оцениваем это распределение с позиции «Хорошо ли это, будет способствовать ли это хорошему распознаванию, например, или нет». Применяются при этом разные критерии информативности, о которых мы будем говорить подробно, и выбираются, следовательно, самые лучшие подмножества, тут предусмотрены, как вы видите, линии обратной связи, если на данном этапе нас еще не устраивает качество выбранных признаков, то мы возвращаемся снова назад, если там формируем другое подмножество, другой вариант признаков, его оцениваем и так до тех пор, пока мы не найдем хорошего подмножества.

Чуть-чуть подробнее про фильтрацию. Одним из первых алгоритмов фильтрации явился метод случайного поиска с адаптацией, который еще 1964 году разработал наш сотрудник Лбов Геннадий Сергеевич. Метод состоит в следующем: представим себе, есть вещественная ось, которая разделена на n частей 1, 2, 3, 4 и так далее, n-ая, и каждая часть связана с признаками, с одним из n признаков. Случайным образом мы выбираем несколько признаков - вот звездочками обозначены те, которые попали в данный выбор, и оцениваем, например, прямым способом — оцениваем, как распознается выборка в этом пространстве. Запомнили этот результат, затем другое случайное бросание, другой набор признаков выбрали, получили следующую оценку и так далее. Несколько раз мы провели такую процедуру, это был случайный поиск, а теперь этап адаптации. Мы смотрим, какой же вариант был лучше других. Вот мы увидели, что тут вероятность правильного распознавания была самой высокой вот при этом наборе призраков. А какой самый плохой? Вот при этом наборе призраков был самый плохой результат. И тогда, эта вещественная ось, на ней вот эти границы сдвигаются так, что участки, соответствующие признакам, входившим в хороший набор, расширяются на некоторую величину, а те признаки, которые попали в плохой набор, для них границы сужаются и вероятность их включения в следующий раз уменьшается. Таким образом при случайном бросании у нас чаще будут появляться признаки, которые себя уже как-то зарекомендовали в прошлом, и наоборот, все реже будут попадаться признаки, которые в прошлом себя не оправдывали. Вот таким образом границы движутся, в конце концов это сдвигается вот к такой картине, где основную часть этого участка занимает несколько широких промежутков и дальше, сколько бы вы не бросали случайных чисел, они все в эти участки, мы повторяем одну и ту же систему признаков. Вот такой критерий остановки. Можно смотреть, как уменьшается ошибка при этом движении, и это ниспадающая такая линия, крутизна которой зависит от того, как сильно мы расширяли эти участки на каждом шаге и сужали, как сильно мы влияние адаптации применяли, вернее, последние наказание на этапе адаптации. Если добавлять большие куски и вычитать большие куски, то крутая резко падает, но останавливаться на высоком уровне, а вот если адаптация более мягкая, когда мы на каждом шаге осторожно небольшую часть, небольшой элемент расширения применяли и сужения, то это более плавная кривая, которая устанавливается на более низком уровне, так что качество при этом получается лучше.

Вопрос о том, как выбрать этот коэффициент адаптации, он такой открытый, это некий параметр. Когда-то раньше мы пользовались таким методом - запускали с каким-то случайно выбранным коэффициентом адаптации и, если машина быстро приходила к ответу, а у нас еще оставалось машинное время, в то время, тогда это было большой дефицит, мы запускали ту же задачу с меньшим коэффициентом адаптации, ну так вот адаптировались к возможности машин.

Вот этот алгоритм себя очень хорошо зарекомендовал, и он используется и до сих пор, и с успехом, и даже более того, чуть ли не через 30 лет после этого появилось книжка Фогеля Эволюционное моделирование, в которой излагались основы эволюционного программирования, которые фактически повторяли эту идею. Потом это стало официальным большим движением, эволюционное программирование сейчас всюду, но это вот ни что иное, как некоторое развитие метода случайного поиска с адаптацией.

По поводу селекции - тут надо отметить большой вклад академика Ивахненко Алексея Григорьевича, который придумал метод группового учета аргументов. Идея такая - мы берем исходные признаки и делаем самые разные комбинации, какие нам только в голову придут. Мы можем брать просто отдельные группы признаков, как показано там первый-второй, это будет считаться вторичным признаком, их общее участие, можем брать произведение этих признаков, может можем брать их отношение, возводить в степень и так далее, разные функции от них делать. И пробовать, какая комбинация окажется информативной. Действительно, это иногда помогает и неплохо помогает- по первичным признакам плохо распознается, а при удачно выбранном преобразовании этих признаков качество решения задач улучшается. Это вот представитель второго направления селекции.

Алгоритмы выбора признаков, которые в литературе относится классу жадных. Сначала в один и тот же год были опубликованы работы в Америке, Merill T., Green O.M. опубликовали работу о выборе признаков путем устранения на каждом шаге самых слабых. Имеется множество признаков, мы оценили качество распознавания в полном пространстве этих признаков, а потом первого исключили и без него смотрим, каково качество распознавания. Его возвращаем, второго исключаем из этой компании и в таком составе смотрим качество, таким образом мы наблюдаем, выбрасывание какого призрака было наиболее благоприятным, потому что некоторые признаки просто мешали, а их устранения повышает качество. Очень хорошо, избавились от самого слабого. После этого на оставшихся повторяем ту же самую процедуру, и так делаем до тех пор, пока не выберем заданное количество признаков. Это метод Deletion, которым пользуются многие сейчас тоже.

В то же время группа киевских специалистов во главе с Юлием Барабашем сделали алгоритм выбора признаков, который проповедует противоположную технику. Давайте мы выберем сначала, оценим информативность каждого признака по-отдельности, это быстро можно сделать, выберем самого информативного, его закрепим, а к нему будем подставлять в пару по очереди все остальные. Выберем самую лучшую пару, к этой паре по-очередь добавляем третьего, выберем в итоге самую лучшую тройку признаков, и так до тех пор, пока не выберем n самых лучших призраков. Мы сравнили в свое время эти два метода, и оказалось, что этот метод Барабаша лучше, трудоемкость их примерно одинаковая, а дает он более правильные результаты. Этому есть статистическое объяснение, и так оно и должно было бы быть, но потом мы обратили внимание на возможность их комбинирования и применили алгоритм, который мы называем AdDel, то есть алгоритм итеративного типа, когда сначала на первом этапе мы с помощью Addition добавляем признаки, потом останавливаемся на каком-то шаге и смотрим, а все ли они теперь нужны. Некоторые признаки, которые были информативны сами по себе, после добавления других признаков они уже не так важны, можно их изъять оттуда и ничего не изменится, а иногда даже улучшится. Таким образом наступает этап Deletion, то есть мы исключаем из этой выбранной компании самого слабого и начинаем снова добавлять самых лучших. И так два шага вперед, шаг назад, два шага вперед, шаг назад - вот такая стратегия. Потом мы нашли в литературе, что этим, оказывается, занимаются уже некоторые товарищи, может быть даже раньше нас, вот Kittler J. исследовал этот метод. Метод AdDel оказался самым эффективным, он помогает избежать попадания в локальный экстремум, в такие ловушки, которые стоят на пути, в результате непрерывного накопления что-то там накапливается не очень хорошее, если его исключить, то процесс улучшения пойдёт и дальше. В основе наших алгоритмов именно вот эта техника выбора подмножества признаков.

Как себя ведет при этом информативность, при вот таком манипулировании? Вот видите, такая лесенка, два шага вперед, шаг назад, и в целом размер пространства медленно растет, а вот на этом рисунке мы видим, как ведет себя информативность выбираемой подсистемы, она растет, иногда даже на каком-то шаге отступает этот процесс назад, ухудшается, потом снова все-таки улучшается, и где-то наступает экстремум, после чего никакие ухищрения не помогают, чего бы не добавляли мы, лучше этого не получишь. И это очень важный момент, потому что исходные алгоритмы Addition и Deletion требовали задания числа n, сколько признаков надо выбрать, а никто заранее не знает, сколько надо. А этот алгоритм сам это решает, он определяет вот это, находит этот экстремум и говорит, вам нужно вот, скажем, шесть признаков, и не меньше, и не больше, потому что меньше - вы теряете информацию, больше - вы добавляете шумов и в общем тоже ухудшаете ситуацию.

Следующий шаг у нас состоит в том, что мы кроме фильтрации, то, что мы делаем, пока фильтрация, мы решили еще и селекцию применить. Мы решили посмотреть, а что, если манипулировать не отдельными признаками, а группами признаков. Самый простой вторичный признак - это брать некое подмножество и считать его признаком. Два признака вместе, три признака вместе - вот такие гранулы, как мы их называем, рассматривать как отдельные призраки, и тогда добавлять и убавлять не по отдельным признакам, а гранулами. Вроде это должно как-то ускорить процесс, и должно улучшать качество. Но тут смущает вопрос с перебором, если у вас исходное множество признаков велико, то уже даже полный перебор по три признака, чтобы все это проверить, иногда требует очень больших затрат времени, я уж не говорю о гранулах большей мощности. Мы остановились на гранулах 3 из двух соображений: во-первых, резко возрастает трудоемкость при увеличении мощности гранул, а во-вторых, в практических задачах редко встречается такая ситуация, чтобы три признака, вместе будучи собранными, что-то там не распознают, а добавление четвертого вдруг сразу меняет всю картину - как-то редко это бывает, чаще всего это все-таки небольшие подмножества признаков, тесно связанные между собой, и мы ограничились вот на мощности 3. Но опять же, перебор совсем без включений вот таких гранул все равно очень большой, и тогда мы обнаружили следующую вещь, вот на этом графике показано следующее - по оси координат отложено количество признаков, взяли какую-такую средненькую задачку, где было почти тысяча признаков, и стали набирать случайным образом по подпространству и смотреть, какие признаки встречаются в хороших подпространствах. И выяснилось, что в хороших подпространствах чаще встречаются признаки, которые здесь у самого начала, мы их так упорядочили по частоте встречаемости в хороших сочетаниях, и получилась вот такая интересная гистограмма, то есть ценные признаки можно отобрать, некоторое подмножество наиболее ценных признаков, и дальше их комбинировать по 3, по 4, сколько угодно, их будет немного и с задачей можно справиться.

Таким образом мы формируем некое подмножество самых информативных признаков самих по себе, а каждый признак в отдельности, легко оценить его информативность тем или иным методом. На этом подмножество информативных признаков мы формируем гранулы, гранулируем, и дальше манипулируем гранулами разной мощности. Гранулы мощности 1, 2 и 3, это такой список вторичных признаков, где все они представлены как бы на равных правах, и дальше они соревнуются между собой. Это основа алгоритма GRAD, это гранулированный AdDel, так сокращенно. Алгоритм FRiS-GRAD у нас самая ходовая программа и много интересных задач мы решали и решили с помощью этого алгоритма.

Ну а теперь, как же мы оцениваем информативность одного признака или подсистемы признаков, каковы критерии? Внутренние критерии - тестовое распознавание всей обучающей выборки или ее части. Всей обучающей выборки - так практически никто не делает, это делается следующим образом: делится обучающая выборка на две части. Первая часть обучающая так и остается обучающей, вторая часть отделяется, называется тестовой, она не участвует в обучении. На объектах, выделенных для обучения, строятся решающие правила, и потом предъявляется тестовая выборка. И смотрим, сколько ошибок при этом получается. Один из вариантов называются Leave-one-out, это когда качестве теста выступает всего один признак, то есть мы по-очереди все признаки выводим на роль тестового этого признака, на остальных обучаемся, потом этого тестового проверяем и смотрим, сколько ошибок при этом получалось. Вот такой метод, который называется Cross-validation, Jackknife или перекрестный экзамен - много разных названий вот такого метода, ну так для общности будем называть Cross-validation. Он используется практически всеми, кто занимается анализом данных, последнее время и мы только этим пользуемся. Но есть и другие способы. Можно оценивать некое распределение, есть мера Махаланобиса, а затем есть критерий Q-Fisher. Идея такая, что информативность признаков тем выше, чем больше расстояние между мат. ожиданиями распределений, и чем меньше дисперсия этих распределений, вполне очевидная вещь.

Это все хорошо исследовано, но только для нормальных законов распределения, если у нас выборка не подчиняются этому закону или вообще, как правило, мы не знаем, какому закону можно было бы ее подчинить, то тогда - мера энтропии, можно в принципе применить энтропию, которая получается при этом как одна из косвенных мер, а можно применить FRiS-компактность. FRiS-компактность, мы уже знаем, что в задачах распознавания выделяются объекты, которые называются столпами, то есть эталоны или прецеденты, и потом по близости к эталонам принимается решение о каждом контрольной в объекте. Каждый эталон формирует вокруг себя объекты обучающей выборки, которые на него похожи больше, чем на другие эталоны, то есть его кластер. Так вот, сумма сходства объектов данного класса со своим столпом - это есть характеристика компактности. Если взять, просуммировать для каждого столпа сумму сходств его подчиненных, элементов его кластера, то вот эта сумма и будет характеризовать общую компактность распознаваемых образов - это косвенный критерий.

Мы сравнили некоторые из них между собой. Например, здесь показаны результаты сравнения трех вариантов. Вот эта нижняя пунктирная линия - это Cross-validation, вот это Q-Fisher - черная линия, а вот эта более высокая пунктирная линия - это FRiS-компактность. Сравнили мы метод Cross-validation и наш метод, и на эксперименте по устойчивости к помехам. Берется таблица и измеряется некое качество распознавания по выбранной системе признаков, а потом добавляются в этой таблице шумы, вот по горизонтали это шумы растущие, и мы видим, что вот эта пунктирная тонкая линия - это результаты, которые при этом показывает Cross-validation. Cross-validation как-то очень мало реагирует на эти шумы, и вы видите выше 0,95, почти единица здесь даже, то есть даже есть участки зашумленные, которые лучше распознаются, чем чистые, и так спокойно себя ведет. А FRiS-компактность ведет вот по этой линии, да, с ростом шума она уменьшается. А потом на эту выбранную систему признаков мы предъявляем контрольную выборку, и оказывается, что по признакам, выбранным с помощью FRiS-компактности, мы получаем результаты почти такие же, как и при обучении, а вот результаты, которые обеспечивали нам признаки, выбранные с помощью Cross-validation, показали вот здесь большое такое различие большое ухудшение.

Объяснение этому есть. Если мы имеем два образа, как здесь показано, вот эти вот красные шарики, звездочки и черные звездочки, то при таком расстоянии друг от друга и границы между ними, показана вертикальной линией Cross-validation будет говорить сто процентов. И вот в этом случае, они приблизились, но он все равно будет говорить сто процентов, тут ничего не перепутаешь. В то время как FRiS функция, мы видим, что здесь она равна, вот компактность здесь 0,56, а здесь 0,87, то есть этот случай предпочтительнее, эти признаки лучше, чем те, которые обеспечивают такое распознание. Это различие обеспечило преимущество этого критерия перед критерием Cross-validation.

Это методы, а каковы результаты приложения этих методов? У нас есть несколько интересных задач, которые мы в свое время решили, применяя описанные раньше методы, то есть выбор признаков с помощью FRiS-GRAD, по критерию компактности, с опорой на вектора - вот эти столпы, то есть прецеденты, выбранные с помощью алгоритма FRiS-STOLP, и вот на такой задаче, например - задача распознавания двух видов заболевания, ALL и AML - это разновидности заболевание крови, лейкемия. Обучающая выборка была небольшая - 27 объектов этого образа, 11 этого, а признаковое пространство — 7129. Контрольная выборка - здесь было 20 объектов, не входивших в обучение, здесь 14, итого - 34 контрольных объекта надо было бы распознать. Это мы взяли из работы, вот здесь показана группа американских авторов, среди которых есть и хорошо нам знакомый Владимир Наумович Вапник, который работает там очень эффективно, и он применяет свой Support Vector Machines вот в частности к этой задаче. В литературе эта задача решалась много раз, описано, и каждый раз результаты повышались, с каждой нового публикацией повышается результат. Последний результат самый высокий - это как раз вот эта работа с участием Вапника, и нам было интересно сравнить наши методы с этими результатами. Вот результаты сравнения, эта таблица, так будем называть, таблица Вапника, она выглядит так: они выбирают признаки методом Deletion фактически, некоей версией вот этого жадного алгоритма, из общего на каждом шаге уменьшая количество признаков два раза. Было семь тысяч, стало 4096, потом 2048, 1024, 512 и так далее, степени двойки, 16, 8, 4, 2 и один - самый информативный признак. По некоторым критериям, которые здесь в виде вот этих вот двух столбиков показаны, выбирается лучшие подмножество признаков, лучшее с точки зрения максимального значения этих двух критериев. Пожалуй, здесь два претендента: 256 признаков и 126 признаков. В частности, 128 признаках получилось 33 правильных ответа из 34, ну что ж, это хорошо.

Теперь наши результаты. Мы выбрали с помощью FRiS-GRAD разные признаковые подпространства, здесь показаны 10 первых штук. Этот столбец показывает информативность этого подпространства, максимальное значение равно единице, здесь мы видим 0,72 и так далее, то есть достаточно высокая информативность. Это состав их - номера признаков 537 - один раз, 1833 - один раз с весом 1, 2641 с весом 2 и 4049 с весом 2, вот такой набор признаков. Второй вариант вот здесь показан, третий и так далее - 10 разных вариантов, нам наша программа позволяет получить столько вариантов, сколько закажешь. В этом эксперименте мы заказали 30 первых вариантов и оказалось, что двадцать семь вариантов дают стопроцентный результат 34 из 34, при этом это считается быстро, такая задача, внешне кажется, она большая, на самом деле для этих методов она маленькая, это считается за 15-20 секунд выдает 30 правил вот с таким результатом. Нам было интересно, за счет чего? То ли признаки у нас лучше выбираются, то ли метод принятия решения лучше. Вот здесь это показано - мы взяли признаки, которые выбрали наши коллеги - два самых лучших признака, и и посмотрели. Оказывается, что если применять Support Vector Machines, то эти два признака дают 30 правильных ответов из 34, а наш метод дал тридцать три правильных ответа из 34, то есть тут на десять процентов лучше. Дальше мы взяли один самый информативный признак, который был выбран вот здесь, он дает сам по себе 27 правильных ответов по SVM, этот же признак FRiS функции у нас по столпам распознавания - 30 из 34. Таким образом FRiS подход себя оправдывает как при выборе признаков, так и при выборе решающих правил.

Вот очень интересная задача. Мы обнаружили два или три года назад, наверное уже теперь три, обнаружили одну работу шотландских специалистов из Эдинбургского университета, которые взяли на себя труд проверить, сравнить между собою разные способы выбора признаков. Они взяли из литературы 10 наиболее популярных методов, самых широко используемых в мире методов выбора признаков. Дальше они взяли четыре типа решающих правил, самых популярных в мире, скрестили их и получилось 40 методов, которые образованы самыми мощными выбора признаков и решающими правилами, и предъявили этим методом 9 генетических задач. Задача корявая очень, там два образа каждой задачи, выборка обучающая маленькая и признаков много, такие девять штук трудных задач, и сказали, какое сочетание вот этих методов даст лучший результат? И провели вот эти эксперименты. Гигантский труд, приводятся все эти результаты. Каковы же результаты? В этой таблице названия 9 задач, это вот ALL тут разные, простаты, меланома, два типа лейкемии, этот забыл как он там расшифровывается кодом. Они характерны тем, что признаковое пространство 12625, вот это одно и то же признаковое пространство, а задачи разные формулируются. Для каждой задачи свои обучающие контрольные объекты и их, видите, немного, тут 95, тут вообще 24, 50, 36 на контроль примерно столько же, и, что самое плохое еще, такие они неравномощные, а, нет, извините, неправильно сказал, это количество объектов первого образа, это количество второго образа, вот это что такое. Плохо то, что эти классы неравномощные, тут в три раза, тут вот в четыре раза отличается по мощности - это очень мешает получить хороший результат, их разная представительность.

Для сравнения мы выбрали, по каждой из этих задач мы посмотрели 40 результатов, полученных ими, и выбрали самые лучшие, то есть можно смело сказать, что мировой рекорд, выбрали 9 мировых рекордов. Результаты, полученные этими рекордсменами - вот их результаты, потом применили наши методы FRiS-GRAD, и получили результаты, перекрывающие все эти мировые рекорды. Средняя ошибка тут порядка 15 процентов, а тут порядка шести процентов, то есть в два с половиной раза меньшее количество ошибок. Я потом послал эти результаты профессору Хиггинсу, который в Эдинбурге возглавляет эту группу, он написал, что это очень-очень любопытно, но не знаю, что там дальше с любопытством у него будет, они знают нашу работу.

Потом еще на этом материале посмотрели мы вот какую задачу - сравнили между собою вот те самые 10 методов признаков, которые они использовали. Вот их тут перечень, и сравнение было таким - какое место занял результат, полученный данным методом выбора признаков во всех этих задачах, сумма мест. Справа рейтинг - это сумма мест, чем выше цифра - тем хуже. Мы видим, что там 47, 43 и так далее, самое малое - это эмпирический Баевский риск, t-статистика, 32 штрафных баллов набрал. Наш FRiS-GRAD при этом получил 12 штрафных баллов, то есть отличается от них очень сильно.

Теперь решающие правила. Тут 4 решающих правила: межгрупповой анализ BGA, k -ближайших соседей, самая распространенная такая штука, Наивный Байес и Support Vector Machines, конечно же, самый популярный последнее время в литературе, это метод Вапника. Тут мы видим 35, 32, 25, Support Vector Machines обгоняет их существенно - 19, а наш FRiS-STOLP - 9 штрафных баллов. Мы таким образом убедились, что наш метод не уступает, по крайней мере не уступает лучшим из опубликованных методов.

В заключение я говорю то, что уже произнес, что по качеству получаемых решений этот метод не уступают другим, а по простоте интерпретации тоже довольно хорош, то есть человеку интерпретировать результат, оперируя ссылкой на эталоны проще понять, чем показывая ему какие-нибудь уравнения с преобразованиями нелинейными и что-то там пытаясь убедить врача, что это вот хорошо, а это плохо. Метод, который тут применяется, он такой человекоориентированный, поэтому-то мы и называем это когнитивный анализ данных.

Вернуться к учебному плану