Глубинный анализ данных и текстов на базе IBM SPSS Modeler

Пример модели деревьев решений ч.2 Сравнения

В лекции изложен практический подход к сравнению и выбору оптимального алгоритма машинного обучения на платформе SPSS Modeler. Логика повествования строится от построения базовых моделей деревьев решений (C&RT, CHAID, QUEST, C5.0) и случайного леса до их сравнительного анализа по точности. Затем рассматриваются другие типы алгоритмов (нейронная сеть, XGBoost, дискриминантный анализ), и демонстрируется, что тонкая настройка (бустинг, бэггинг) не всегда превосходит базовые настройки. Завершается материал переходом к задаче регрессии.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Описать разницу между алгоритмами деревьев решений, основанную на используемых критериях оценки качества разбиения (хи-квадрат, энтропийный критерий, критерий Фишера).
2. Объяснить назначение механизмов бустинга и бэггинга в контексте повышения точности ансамблевых моделей.
3. Интерпретировать результаты сравнительного анализа нескольких моделей в узле анализа SPSS Modeler.
4. Применить узел оценки для визуального сравнения точности прогнозных моделей с помощью графиков.
5. Сформулировать ограничения автоматического режима построения модели и обосновать необходимость экспертного вмешательства для учета логики предметной области.
6. Провести сравнительный анализ нескольких алгоритмов классификации и выбрать наиболее точный для конкретного набора данных.
Показывать лекцию целиком
Краткое изложение

Построение и анализ базовых моделей

Модель случайного леса

Модель случайного леса построена на 22 165 объектах. В результатах отображаются заданные параметры алгоритма и важность предикторов (predictors), закодированных цифрами от 1 до 16. Легенда позволяет сопоставить каждую цифру с конкретным предиктором.
При просмотре результатов для каждого объекта выводится предсказание и его вероятность. На примере первых десяти строк видно, что предсказание об уходе клиента совпадает с действительностью, и указана вероятность этого прогноза. Полное сравнение качества всех моделей будет проведено позже.

Модель случайного дерева

Перед запуском алгоритма проверяется разбиение на тестовую и обучающую выборки. Поскольку оно выполнено заранее, на вход подается 100% данных.

Доступные для настройки параметры включают:
• Обработку несбалансированных данных (в текущей сбалансированной выборке не требуется).
• Взвешенную выборку для переменных, если заранее известна большая значимость какого-либо фактора для бизнес-задачи.
Максимальное число узлов, максимальное количество уровней (глубина дерева).
Минимальный размер дочернего узла (min sample leaf) — аналог параметра из Python.
• Число предикторов для использования.
• Критерий остановки построения при отсутствии улучшения точности.
Стоимость (веса) факторов. Можно задать больший вес для правильного предсказания ухода клиента по сравнению с предсказанием активного, чтобы повысить значимость целевого события.

Остался также блок дополнительных параметров, например, максимальный процент пропущенных значений. Деревья решений устойчивы к пропускам. Один из способов их обработки — использование суррогатных полей (surrogate fields). Принцип работы суррогатного поля: для объекта с пропущенным значением (например, возраст) ищутся другие объекты с идентичными значениями по всем остальным полям. Пропущенное значение заполняется наиболее частой категорией или средним значением из этой группы похожих объектов. Второй подход — поиск переменной с самой высокой корреляцией с пропущенной, и замена на ее основе.

Все эти параметры позволяют максимизировать точность, но на данном этапе модели запускаются в базовых настройках для сравнения.

Модели C&RT, CHAID, QUEST и C5.0

Алгоритмы деревьев (SiR-дерево, CHAID, QUEST, C5.0) отличаются друг от друга критерием оценки качества построения, то есть функцией потерь (loss function). Принцип построения одинаков, различается способ измерения ошибки:
• CHAID-дерево: использует критерий хи-квадрат (Chi-square).
• C&RT-дерево (SiR): использует информационный критерий, основанный на энтропии.
• C5.0: использует комбинированный подход: для категориальных полей — критерий хи-квадрат, для непрерывных — критерий Фишера (F-test).
• QUEST-дерево: также основано на статистических критериях.

При настройке, например, C&RT-дерева, появляется выбор между автоматическим созданием модели и итеративным сеансом. Итеративный сеанс позволяет на каждом шаге построения дерева экспертно оценивать предлагаемое алгоритмом решение. Это критически важно, так как машина не понимает бизнес-смысла данных и может принять статистически обоснованное, но логически противоречащее предметной области решение. Алгоритм предлагает не один, а несколько отсортированных по уменьшению ошибки вариантов. Эксперт может выбрать второй или третий вариант, который лучше соответствует логике задачи. В данной лекции используется автоматический режим для первичного знакомства с функционалом.

Также доступны ансамблевые методы: бустинг (boosting) и бэггинг (bagging).

• Бустинг разбивает выборку на подвыборки, и после обучения объектам с ошибкой присваивается больший вес. Процесс итеративно повторяется, фокусируясь на сложных случаях, что обычно повышает итоговое качество.
• Бэггинг основан на выборке данных с возвратом (бутстрэп). Один и тот же объект может попасть в обучающую подвыборку несколько раз. На основе нескольких таких подвыборок строятся разные деревья, и при прогнозировании для каждой записи выбирается дерево, дающее наилучшую точность на соответствующем уровне.

К настраиваемым параметрам также относятся: максимальное количество уровней, правила остановки (минимальное количество или процент записей в родительском и дочернем узлах), априорные вероятности для балансировки выборки и стоимость ошибок классификации.

В модели C5.0 дополнительно можно настроить процент зашумления данных и использовать экспертный режим для тонкой настройки. Для CHAID-дерева доступен исчерпывающий CHAID (Exhaustive CHAID) с полным перебором для категориальных полей, требующий больше времени. Все модели запускаются с базовыми настройками без бустинга и бэггинга.

Сравнение моделей и выбор лучшей

После построения всех моделей деревьев, для их сравнения используется узел анализа. Все построенные модели последовательно соединяются с этим узлом. Результаты ранжируются по точности, где модель случайного леса показала 90.4%, а наилучший результат продемонстрировала модель C5.0 с точностью 90.93%. Ошибка на обучающей и проверочной выборках составила 9%, что говорит об отсутствии переобучения.

Для визуальной оценки используется узел оценки, который строит график сравнения точностей моделей. Красная диагональная линия на графике означает случайное угадывание, а кривые алгоритмов, расположенные выше, показывают их эффективность.

Анализ других алгоритмов

Далее к сравнению подключаются другие типы моделей: XGBoost, нейронная сеть (многослойный персептрон) и дискриминантный анализ. Нейронная сеть настраивается как стандартная модель многослойного персептрона без бустинга и бэггинга, с автоматическим подбором числа нейронов. XGBoost-дерево запускается с числом циклов бустинга 10 и другими стандартными параметрами.

Сравнение этих трех моделей показывает, что ни одна из них не превзошла по точности модель C5.0, которая остается лидером (87% и 89% у новых моделей против ~91% у C5.0). Важно отметить, что сравнение проводилось при базовых настройках, и потенциально настройка параметров может изменить результат.

Тонкая настройка лучшей модели

Для улучшения результата в модель C5.0 вносятся модификации: применяется бустинг и перекрестная проверка. После запуска точность составляет 98.4%. Дальнейшая корректировка параметров (например, увеличение числа итераций бустинга) не приводит к существенному росту точности, и она остается на уровне выше 90%, что является отличным результатом для проверочной выборки.

На этом анализ задачи классификации (classification) — предсказания принадлежности к одному из классов — завершен. Далее автор переходит к рассмотрению задачи регрессии (regression) для предсказания непрерывных значений.

Краткие итоги

Анализ демонстрирует системный подход к выбору прогностической модели, начиная с построения широкого пула кандидатов и заканчивая тонкой настройкой финального решения. Исходной точкой является понимание того, что алгоритмы, решающие одну и ту же задачу, могут базироваться на различных математических принципах оценки ошибок, что напрямую влияет на их эффективность в конкретной предметной области. Практическая ценность этого подхода раскрывается через сравнение не только родственных методов, таких как деревья решений, но и моделей из разных семейств, включая нейронные сети и бустинг.

Ключевой вывод заключается в том, что не существует априорно лучшего алгоритма. Как показал эксперимент, C5.0, используя комбинированный критерий для работы с разнородными данными, продемонстрировал превосходство над ансамблевым методом случайного леса и более простыми деревьями, что подчеркивает важность соответствия математического аппарата структуре данных. Еще один важный практический аспект — нелинейная зависимость между сложностью модели и ее качеством. Применение ансамблевых методов, таких как бустинг и бэггинг, а также манипуляции с их параметрами не привели к гарантированному росту точности, а в ряде случаев могли бы вызвать переобучение. Это формирует понимание того, что усложнение модели оправдано только тогда, когда оно дает статистически значимый прирост метрик на отложенной выборке, в противном случае предпочтительнее более простая и интерпретируемая модель.

Процесс итеративной настройки, где за изменением параметров следует обязательная перекрестная проверка, является неотъемлемой частью построения надежного решения. Упоминание итеративного экспертного режима в SPSS Modeler акцентирует фундаментальное ограничение автоматического машинного обучения: алгоритм оптимизирует математическую функцию, но не способен оценить бизнес-логику или причинно-следственные связи. Поэтому успех моделирования определяется не только техническими навыками, но и глубоким пониманием предметной области, позволяющим валидировать решения, предлагаемые машиной, и выбирать из нескольких статистически приемлемых вариантов тот, что имеет практический смысл. Переход в конце к задаче регрессии логично расширяет эту методологию на другой, более широкий класс задач, где целевой переменной является непрерывная величина.
Построение базовых моделей деревьев

Анализ начинается с построения модели случайного леса на 22 165 объектах. В результатах отображается важность предикторов и прогнозы с вероятностями для каждого объекта.

Далее поочередно строятся модели других деревьев: случайное дерево, C&RT (SiR), CHAID, QUEST и C5.0. Перед запуском каждой проверяется корректность разбиения на тестовую и обучающую выборки. Все модели запускаются в базовых настройках, без включения бустинга и бэггинга. Однако обозреваются доступные параметры для будущей тонкой настройки.

Ключевые параметры и концепции

• Критерии оценки разбиения: В этом заключается главное различие между деревьями. CHAID использует критерий хи-квадрат, C&RT — энтропийный критерий, а C5.0 применяет комбинированный подход: хи-квадрат для категориальных и критерий Фишера для непрерывных полей.
• Итеративный сеанс: Это экспертный режим, позволяющий на каждом шаге построения дерева оценить предлагаемое алгоритмом решение и, если оно противоречит бизнес-логике, выбрать альтернативный вариант разбиения из предложенного списка.
• Бустинг и бэггинг:
o Бустинг итеративно перестраивает модель, увеличивая вес объектов, которые были классифицированы с ошибкой.
o Бэггинг строит несколько моделей на подвыборках, сформированных случайным образом с возвращением (один объект может попасть в выборку несколько раз).
• Обработка пропусков: Деревья решений устойчивы к пропускам и могут использовать суррогатные поля. Это метод, при котором пропущенное значение заменяется на основе переменной, максимально коррелирующей с пропущенной.
• Стоимость ошибок: Можно задать цену ошибки для каждого класса. Например, присвоить больший вес пропуску уходящего клиента, чтобы сместить фокус модели на выявление этого критичного события.

Сравнительный анализ моделей

Для сравнения используется узел анализа. К нему подключаются все построенные модели. Результаты показывают, что наилучшую точность на проверочной выборке показала модель C5.0 (90.93%), опередив случайный лес (90.4%). Ошибка в 9% стабильна как на обучении, так и на тесте, что говорит об отсутствии переобучения. Узел оценки визуализирует это превосходство на графике, где кривая C5.0 находится выше других относительно линии случайного угадывания.

Подключение и оценка других алгоритмов

К анализу добавляются модели из других семейств: нейронная сеть (многослойный персептрон), XGBoost и дискриминантный анализ. Их запуск в базовых настройках и последующее сравнение показывают, что ни одна из них не превосходит C5.0. Нейронная сеть достигает точности 89%, XGBoost — 87%. Это подтверждает лидерство C5.0 для данной задачи.

Тонкая настройка и выводы

В модель-лидер C5.0 вносятся изменения: включается бустинг и перекрестная проверка. Делается несколько итераций с изменением параметров, но значимо превзойти первоначальную точность (~91%) не удается. Достигнутый результат на проверочной выборке признается отличным.

В итоге демонстрируется, что не существует априорно лучшего алгоритма, и даже простые модели с правильным математическим критерием могут превзойти сложные ансамбли. Усложнение модели за счет бустинга и настройки гиперпараметров не всегда оправдано и должно подтверждаться ростом метрик на отложенной выборке. Завершается работа переходом к рассмотрению задачи регрессии для предсказания непрерывных значений.

Выводы

1. Выбор лучшей модели требует сравнительного анализа нескольких алгоритмов из разных семейств.
2. Ключевое отличие деревьев решений (C&RT, CHAID, QUEST, C5.0) заключается в критерии оценки качества разбиения.
3. Алгоритм C5.0 использует комбинированный подход: хи-квадрат для категорий и критерий Фишера для непрерывных переменных.
4. Модель C5.0 с настройками по умолчанию может превосходить по точности случайный лес, нейронные сети и XGBoost.
5. Бустинг и бэггинг не гарантируют повышения точности модели; их применение требует валидации.
6. Итеративный сеанс позволяет эксперту корректировать построение дерева, согласовывая математику с бизнес-логикой.
7. Суррогатные поля — это метод восстановления пропусков в деревьях решений на основе корреляции переменных.
8. Стабильность низкой ошибки на обучающей и тестовой выборках свидетельствует об отсутствии переобучения.
9. Узел оценки в SPSS Modeler визуализирует сравнительную точность моделей относительно случайного угадывания.
10. Переход от задачи классификации к задаче регрессии меняет цель с предсказания класса на предсказание непрерывного значения.
11. Небольшой прирост точности от усложнения модели не всегда оправдан по сравнению с простым и надежным базовым решением.
12. Для предотвращения переобучения при настройке параметров необходимо использовать перекрестную проверку.

Вопросы для самопроверки

1. Чем принципиально отличаются алгоритмы C&RT, CHAID и C5.0 друг от друга?
2. В чем заключается практическая польза итеративного сеанса при построении дерева решений?
3. Как работает механизм восстановления пропущенных значений с помощью суррогатных полей?
4. Каким образом можно изменить порог принятия решения модели, если для бизнеса критичнее выявлять уходящих клиентов, чем активных?
5. В чем ключевое различие между бустингом и бэггингом?
6. Почему высокая точность на обучающей выборке не гарантирует хорошего качества модели на новых данных?
7. Что означает красная диагональная линия на графике сравнения моделей в узле оценки и как относительно нее интерпретировать качество алгоритмов?
8. Почему модель C5.0 может показывать более высокие результаты, чем случайный лес, несмотря на то что последний является ансамблевым методом?
9. Какой параметр в настройках дерева отвечает за минимальное количество объектов в узле, при котором еще возможно его дальнейшее разбиение?
10. Какие метрики сравниваются в узле анализа для определения лучшей модели?
11. Почему для оценки эффективности модели необходимо использовать отдельную тестовую выборку, а не только обучающую?
12. Чем постановка задачи регрессии отличается от задачи классификации?
Вернуться к учебному плану