Построение и анализ базовых моделей
Модель случайного леса
Модель случайного леса построена на 22 165 объектах. В результатах отображаются заданные параметры алгоритма и
важность предикторов (predictors), закодированных цифрами от 1 до 16. Легенда позволяет сопоставить каждую цифру с конкретным предиктором.
При просмотре результатов для каждого объекта выводится предсказание и его вероятность. На примере первых десяти строк видно, что предсказание об уходе клиента совпадает с действительностью, и указана вероятность этого прогноза. Полное сравнение качества всех моделей будет проведено позже.
Модель случайного дерева
Перед запуском алгоритма проверяется разбиение на тестовую и обучающую выборки. Поскольку оно выполнено заранее, на вход подается 100% данных.
Доступные для настройки параметры включают:
• Обработку несбалансированных данных (в текущей сбалансированной выборке не требуется).
• Взвешенную выборку для переменных, если заранее известна большая значимость какого-либо фактора для бизнес-задачи.
•
Максимальное число узлов, максимальное количество уровней (глубина дерева).
•
Минимальный размер дочернего узла (min sample leaf) — аналог параметра из Python.
• Число предикторов для использования.
• Критерий остановки построения при отсутствии улучшения точности.
•
Стоимость (веса) факторов. Можно задать больший вес для правильного предсказания ухода клиента по сравнению с предсказанием активного, чтобы повысить значимость целевого события.
Остался также блок дополнительных параметров, например,
максимальный процент пропущенных значений. Деревья решений устойчивы к пропускам. Один из способов их обработки — использование
суррогатных полей (surrogate fields). Принцип работы суррогатного поля: для объекта с пропущенным значением (например, возраст) ищутся другие объекты с идентичными значениями по всем остальным полям. Пропущенное значение заполняется наиболее частой категорией или средним значением из этой группы похожих объектов. Второй подход — поиск переменной с самой высокой корреляцией с пропущенной, и замена на ее основе.
Все эти параметры позволяют максимизировать точность, но на данном этапе модели запускаются в базовых настройках для сравнения.
Модели C&RT, CHAID, QUEST и C5.0
Алгоритмы деревьев (SiR-дерево, CHAID, QUEST, C5.0) отличаются друг от друга критерием оценки качества построения, то есть
функцией потерь (loss function). Принцип построения одинаков, различается способ измерения ошибки:
• CHAID-дерево: использует критерий
хи-квадрат (Chi-square).
• C&RT-дерево (SiR): использует
информационный критерий, основанный на энтропии.
• C5.0: использует комбинированный подход: для категориальных полей — критерий хи-квадрат, для непрерывных —
критерий Фишера (F-test).
• QUEST-дерево: также основано на статистических критериях.
При настройке, например, C&RT-дерева, появляется выбор между автоматическим созданием модели и
итеративным сеансом. Итеративный сеанс позволяет на каждом шаге построения дерева экспертно оценивать предлагаемое алгоритмом решение. Это критически важно, так как машина не понимает бизнес-смысла данных и может принять статистически обоснованное, но логически противоречащее предметной области решение. Алгоритм предлагает не один, а несколько отсортированных по уменьшению ошибки вариантов. Эксперт может выбрать второй или третий вариант, который лучше соответствует логике задачи. В данной лекции используется автоматический режим для первичного знакомства с функционалом.
Также доступны
ансамблевые методы:
бустинг (boosting) и
бэггинг (bagging).
• Бустинг разбивает выборку на подвыборки, и после обучения объектам с ошибкой присваивается больший вес. Процесс итеративно повторяется, фокусируясь на сложных случаях, что обычно повышает итоговое качество.
• Бэггинг основан на выборке данных с возвратом (бутстрэп). Один и тот же объект может попасть в обучающую подвыборку несколько раз. На основе нескольких таких подвыборок строятся разные деревья, и при прогнозировании для каждой записи выбирается дерево, дающее наилучшую точность на соответствующем уровне.
К настраиваемым параметрам также относятся: максимальное количество уровней, правила остановки (минимальное количество или процент записей в родительском и дочернем узлах), априорные вероятности для балансировки выборки и стоимость ошибок классификации.
В модели
C5.0 дополнительно можно настроить процент зашумления данных и использовать экспертный режим для тонкой настройки. Для
CHAID-дерева доступен
исчерпывающий CHAID (Exhaustive CHAID) с полным перебором для категориальных полей, требующий больше времени. Все модели запускаются с базовыми настройками без бустинга и бэггинга.
Сравнение моделей и выбор лучшей
После построения всех моделей деревьев, для их сравнения используется
узел анализа. Все построенные модели последовательно соединяются с этим узлом. Результаты ранжируются по точности, где модель случайного леса показала 90.4%, а наилучший результат продемонстрировала модель C5.0 с точностью 90.93%. Ошибка на обучающей и проверочной выборках составила 9%, что говорит об отсутствии переобучения.
Для визуальной оценки используется узел оценки, который строит график сравнения точностей моделей. Красная диагональная линия на графике означает случайное угадывание, а кривые алгоритмов, расположенные выше, показывают их эффективность.
Анализ других алгоритмов
Далее к сравнению подключаются другие типы моделей:
XGBoost,
нейронная сеть (многослойный персептрон) и
дискриминантный анализ. Нейронная сеть настраивается как стандартная модель многослойного персептрона без бустинга и бэггинга, с автоматическим подбором числа нейронов. XGBoost-дерево запускается с числом циклов бустинга 10 и другими стандартными параметрами.
Сравнение этих трех моделей показывает, что ни одна из них не превзошла по точности модель C5.0, которая остается лидером (87% и 89% у новых моделей против ~91% у C5.0). Важно отметить, что сравнение проводилось при базовых настройках, и потенциально настройка параметров может изменить результат.
Тонкая настройка лучшей модели
Для улучшения результата в модель C5.0 вносятся модификации: применяется бустинг и перекрестная проверка. После запуска точность составляет 98.4%. Дальнейшая корректировка параметров (например, увеличение числа итераций бустинга) не приводит к существенному росту точности, и она остается на уровне выше 90%, что является отличным результатом для проверочной выборки.
На этом анализ задачи
классификации (classification) — предсказания принадлежности к одному из классов — завершен. Далее автор переходит к рассмотрению задачи
регрессии (regression) для предсказания непрерывных значений.
Краткие итоги
Анализ демонстрирует системный подход к выбору прогностической модели, начиная с построения широкого пула кандидатов и заканчивая тонкой настройкой финального решения. Исходной точкой является понимание того, что алгоритмы, решающие одну и ту же задачу, могут базироваться на различных математических принципах оценки ошибок, что напрямую влияет на их эффективность в конкретной предметной области. Практическая ценность этого подхода раскрывается через сравнение не только родственных методов, таких как деревья решений, но и моделей из разных семейств, включая нейронные сети и бустинг.
Ключевой вывод заключается в том, что не существует априорно лучшего алгоритма. Как показал эксперимент, C5.0, используя комбинированный критерий для работы с разнородными данными, продемонстрировал превосходство над ансамблевым методом случайного леса и более простыми деревьями, что подчеркивает важность соответствия математического аппарата структуре данных. Еще один важный практический аспект — нелинейная зависимость между сложностью модели и ее качеством. Применение ансамблевых методов, таких как бустинг и бэггинг, а также манипуляции с их параметрами не привели к гарантированному росту точности, а в ряде случаев могли бы вызвать переобучение. Это формирует понимание того, что усложнение модели оправдано только тогда, когда оно дает статистически значимый прирост метрик на отложенной выборке, в противном случае предпочтительнее более простая и интерпретируемая модель.
Процесс итеративной настройки, где за изменением параметров следует обязательная перекрестная проверка, является неотъемлемой частью построения надежного решения. Упоминание итеративного экспертного режима в SPSS Modeler акцентирует фундаментальное ограничение автоматического машинного обучения: алгоритм оптимизирует математическую функцию, но не способен оценить бизнес-логику или причинно-следственные связи. Поэтому успех моделирования определяется не только техническими навыками, но и глубоким пониманием предметной области, позволяющим валидировать решения, предлагаемые машиной, и выбирать из нескольких статистически приемлемых вариантов тот, что имеет практический смысл. Переход в конце к задаче регрессии логично расширяет эту методологию на другой, более широкий класс задач, где целевой переменной является непрерывная величина.
1. Выбор лучшей модели требует сравнительного анализа нескольких алгоритмов из разных семейств.
2. Ключевое отличие деревьев решений (C&RT, CHAID, QUEST, C5.0) заключается в критерии оценки качества разбиения.
3. Алгоритм C5.0 использует комбинированный подход: хи-квадрат для категорий и критерий Фишера для непрерывных переменных.
4. Модель C5.0 с настройками по умолчанию может превосходить по точности случайный лес, нейронные сети и XGBoost.
5. Бустинг и бэггинг не гарантируют повышения точности модели; их применение требует валидации.
6. Итеративный сеанс позволяет эксперту корректировать построение дерева, согласовывая математику с бизнес-логикой.
7. Суррогатные поля — это метод восстановления пропусков в деревьях решений на основе корреляции переменных.
8. Стабильность низкой ошибки на обучающей и тестовой выборках свидетельствует об отсутствии переобучения.
9. Узел оценки в SPSS Modeler визуализирует сравнительную точность моделей относительно случайного угадывания.
10. Переход от задачи классификации к задаче регрессии меняет цель с предсказания класса на предсказание непрерывного значения.
11. Небольшой прирост точности от усложнения модели не всегда оправдан по сравнению с простым и надежным базовым решением.
12. Для предотвращения переобучения при настройке параметров необходимо использовать перекрестную проверку.
1. Чем принципиально отличаются алгоритмы C&RT, CHAID и C5.0 друг от друга?
2. В чем заключается практическая польза итеративного сеанса при построении дерева решений?
3. Как работает механизм восстановления пропущенных значений с помощью суррогатных полей?
4. Каким образом можно изменить порог принятия решения модели, если для бизнеса критичнее выявлять уходящих клиентов, чем активных?
5. В чем ключевое различие между бустингом и бэггингом?
6. Почему высокая точность на обучающей выборке не гарантирует хорошего качества модели на новых данных?
7. Что означает красная диагональная линия на графике сравнения моделей в узле оценки и как относительно нее интерпретировать качество алгоритмов?
8. Почему модель C5.0 может показывать более высокие результаты, чем случайный лес, несмотря на то что последний является ансамблевым методом?
9. Какой параметр в настройках дерева отвечает за минимальное количество объектов в узле, при котором еще возможно его дальнейшее разбиение?
10. Какие метрики сравниваются в узле анализа для определения лучшей модели?
11. Почему для оценки эффективности модели необходимо использовать отдельную тестовую выборку, а не только обучающую?
12. Чем постановка задачи регрессии отличается от задачи классификации?