Глубинный анализ данных и текстов на базе IBM SPSS Modeler

Ансамблирование моделей ч.2

В материале разбирается работа с узлом Auto Classifier в IBM SPSS Modeler. Излагается логика автоматизации выбора лучшей модели классификации: от настройки метрик ранжирования (AUC) и выбора алгоритмов до тонкой корректировки их гиперпараметров (глубина дерева, регуляризация SVM, количество компонентов бустинга). Демонстрируется, как инструмент перебирает комбинации настроек, выявляет оптимальные модели и объединяет их в ансамбль для повышения итоговой точности предсказаний без написания программного кода.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Описать назначение и функциональные возможности узла Auto Classifier.
2. Объяснить роль метрики AUC (Area Under Curve) для ранжирования качества моделей бинарной классификации.
3. Настраивать состав конкурирующих алгоритмов и их ключевые гиперпараметры через экспертный режим.
4. Интерпретировать результаты сравнения моделей для выявления наиболее эффективного решения.
5. Сравнивать подходы к улучшению модели: перебор гиперпараметров одного алгоритма и выбор из множества разных.
6. Оценить влияние ансамблирования (композиции лучших моделей) на итоговое значение AUC.
7. Обосновать стратегию автоматизированного поиска оптимальных настроек без написания программного кода.
8. Анализировать процесс нахождения наилучшего сочетания гиперпараметров для заданного алгоритма (на примере SVM).
Показывать лекцию целиком
Краткое изложение
Настройка узла Auto Classifier для сравнения алгоритмов

Используем подготовленный набор данных с разбиением на обучающую и тестовую выборки в пропорции 70/30. Целевая переменная — response to Campaign (отклик на маркетинговую кампанию) с двумя возможными значениями («да» и «нет»). Это задача бинарной классификации.

Для её решения в IBM SPSS Modeler существует узел Auto Classifier (Автоматический классификатор). Он корректно определяет целевую переменную, считывая её тип из узла Type. Заходим в настройки узла.

В разделе Model задаём критерий ранжирования моделей. В поле Rank Models by выбираем метрику AUC (Area Under Curve — площадь под ROC-кривой). Это позволит объективно сравнивать качество алгоритмов. Увеличиваем количество используемых моделей с 3 до 5, чтобы расширить конкуренцию за звание лучшей.

Теперь выберем конкретные алгоритмы и настроим их параметры через Expert Mode:
1. C5.0. Меняем параметр Minimum records per child branch (минимальное количество записей в дочернем узле) на значение 25. Это регулирует ветвление дерева решений.
2. CHAID (Chi-square Automatic Interaction Detection). В настройках активируем Boosting (бустинг) — метод усиления модели. Меняем количество компонентов для бустинга (Number of component models for boosting) со значения 10 на 25.
3. C&R Tree (Classification and Regression Tree). Находим параметр Maximum tree depth (максимальная глубина дерева) и добавляем к стандартному значению 5 ещё и значение 10. Теперь алгоритм проверит деревья с обеими глубинами.
4. Neural Net (Нейронная сеть). Выбираем для использования обе архитектуры: и Radial Basis Function (радиальная базисная функция, RBF), и Multilayer Perceptron (многослойный перцептрон).

После настройки отключаем неиспользуемые алгоритмы (Quest, Goot, XGBoost Linear, 3S, Random Forest). Для сравнения оставляем C5.0, CHAID, C&R Tree, Neural Net (две модели) и Logistic regression (логистическая регрессия) с параметрами по умолчанию. В сумме получается 9 различных моделей-претендентов. Запускаем анализ.

Анализ результатов и ансамблирование

Получаем итоговое ранжирование по метрике AUC. Лучшей оказалась логистическая регрессия, которую мы не настраивали. Далее следуют CHAID (первая модель), Neural Net (первая модель), C&R Tree (вторая модель) и Neural Net (вторая модель).

Теперь мы можем не просто взять лучшую модель, а улучшить результат с помощью ансамблирования. Отбираем три лучшие модели, исключив аутсайдеров (CHAID 2 и Neural Net 2). Узел Auto Classifier позволяет выполнить ансамблирование автоматически: если в результатах оставить отмеченными несколько моделей, они объединяются в ансамблевую модель (ансамбль). Отдельный узел Ensemble не требуется.

Смотрим итоговый результат. Ансамблевая модель показала значение AUC = 0,751. Это выше, чем результат лучшей одиночной модели (логистическая регрессия с AUC = 0,74). Таким образом, ансамблирование повысило качество предсказания.

Тонкая настройка гиперпараметров одной модели

Auto Classifier можно использовать и для другой цели: найти лучшие настройки для одного конкретного алгоритма. Ограничимся одной моделью, но переберём множество комбинаций её гиперпараметров.

В качестве примера берём SVM (Support Vector Machine — метод опорных векторов), который ранее не использовали. Отключаем все остальные алгоритмы. Заходим в экспертный режим SVM и меняем параметры:
• C (Regularization) — параметр регуляризации. Задаём значения: 5, 10, 15.
• RBF Gamma — коэффициент ядра радиальной базисной функции. Задаём значения: 0.5, 1.0, 1.5.

Перебор этих параметров независимый. Получается 12 комбинаций (3 значения C × 4 значения gamma). Запускаем анализ. Узел перебирает все 12 моделей и автоматически выводит тройку лучших. Самой качественной оказывается модель SVM 4.

Открываем её сводку параметров (Summary Build Settings) и видим победившую комбинацию: C = 5 и Gamma = 1.0. Это сочетание не является стандартным. Без автоматизированного перебора мы бы не нашли его и не получили бы модель с максимальной точностью. Так можно искать наилучшие параметры для любого числа алгоритмов, хоть с сотней комбинаций, а затем лучшие из них объединить в ансамбль.

Общий обзор возможностей IBM SPSS Modeler

Процесс анализа данных в Modeler не ограничивается моделированием. Помимо узла Auto Classifier, платформа предоставляет широкие возможности:
• Подготовка данных: подключение к источникам, разбиение на выборки (Partition), создание вычисляемых полей (Field Ops), сортировка и балансировка данных (Balance), создание подвыборок (Sample).
• Слияние данных: объединение таблиц через операцию, аналогичную JOIN (Merge), или UNION (Append).
• Автоматизация: существует узел Auto Data Preparation, автоматизирующий подготовку данных по аналогии с Auto Classifier.

Все эти инструменты позволяют без написания программного кода довести исходные данные до нужного качества, найти оптимальную модель и внедрить её. В серверной версии модели можно публиковать для общего доступа, что упрощает их промышленную эксплуатацию.

Краткие итоги
Материал последовательно раскрывает эволюцию мысли аналитика от ручного сравнения единичных моделей к полной автоматизации поиска лучшего решения. В основе лежит прагматичная задача — максимизировать точность предсказания отклика на маркетинговую кампанию, минимизируя при этом рутинный труд.

Центральным элементом повествования становится инструмент, выполняющий роль «автопилота» для анализа данных. Сначала демонстрируется его способность проводить «соревнование» между принципиально разными классами алгоритмов: от линейных моделей и деревьев решений до нейронных сетей. Это позволяет быстро получить бейзлайн и выявить, какие семейства методов в принципе лучше справляются с конкретной структурой данных. Затем логика усложняется: от сравнения алгоритмов осуществляется переход к глубинному тюнингу одного из них, в частности метода опорных векторов. На этом этапе иллюстрируется ключевая идея о том, что стандартные настройки почти никогда не являются оптимальными, и потенциал улучшения кроется в методичном переборе гиперпараметров.

Качественным скачком становится применение ансамблирования — объединения нескольких лучших моделей. На конкретном примере с метрикой AUC видно, что композиция слабых или средних по отдельности моделей способна превзойти любого сильного одиночного игрока. Этот результат подводит к важной практической максиме: в машинном обучении побеждает не столько уникальный алгоритм, сколько выверенная стратегия комбинирования и автоматизированного поиска. Такой подход полностью снимает с исследователя бремя ручного кодирования и позволяет сосредоточиться на интерпретации результатов. В итоге вырисовывается целостная картина промышленного анализа данных, где путь от сырых сведений до готовой к внедрению предиктивной модели представляет собой не линейную последовательность шагов, а итеративный процесс управляемой автоматической оптимизации, доступный пользователю без навыков программирования.
Введение

Мы работаем с задачей бинарной классификации для прогнозирования отклика на маркетинговую кампанию. Вместо ручного тестирования отдельных моделей воспользуемся узлом Auto Classifier (Автоматический классификатор). Этот инструмент позволяет автоматически сравнить множество алгоритмов с разными настройками и выбрать лучшее решение.

Автоматический выбор лучшего алгоритма

В узле Auto Classifier в качестве критерия ранжирования моделей (Rank Models by) выбираем метрику AUC (Area Under Curve — площадь под ROC-кривой). Увеличиваем количество конкурирующих моделей до 5.

Через Expert Mode настраиваем следующие алгоритмы:
• C5.0: меняем параметр Minimum records per child branch (минимальное количество записей в дочернем узле) на 25.
• CHAID: активируем Boosting (бустинг), меняем количество компонентов для бустинга (Number of component models for boosting) с 10 на 25.
• C&R Tree: для параметра Maximum tree depth (максимальная глубина дерева) задаём значения 5 и 10 для сравнения.
• Neural Net (нейронная сеть): выбираем для тестирования обе архитектуры — RBF (радиальная базисная функция) и MLP (многослойный перцептрон).
• Logistic regression (логистическая регрессия): оставляем без изменений.

Остальные алгоритмы отключаем. Запускаем анализ 9 моделей. Лучшей одиночной моделью становится логистическая регрессия. На втором и третьем местах — CHAID и нейросеть.

Ансамблирование для повышения качества

Отбираем три лучшие модели и убираем аутсайдеров. Узел Auto Classifier автоматически создает из них ансамблевую модель (ансамбль). Итоговый результат ансамбля — AUC = 0,751. Это выше, чем у лучшей одиночной модели (AUC = 0,74). Таким образом, комбинирование разных алгоритмов улучшает прогнозную точность.

Автоматический подбор гиперпараметров (на примере SVM)

Auto Classifier можно сфокусировать на поиске лучших настроек для одного алгоритма. Оставляем только SVM (метод опорных векторов). В экспертном режиме задаём диапазоны для двух гиперпараметров:
• C (Regularization): 5, 10, 15.
• RBF Gamma: 0.5, 1.0, 1.5.

Получается 12 комбинаций (3×4). Узел перебирает их все и выводит тройку лучших. Победителем становится модель с параметрами C = 5 и Gamma = 1.0. Это сочетание не было стандартным. Без автоматизированного перебора найти его было бы крайне сложно.

Такой подход масштабируется: можно перебирать сотни комбинаций для десятков алгоритмов, автоматически находя самые точные решения, которые затем можно объединить в ансамбль.

Общий взгляд на платформу

Помимо моделирования, IBM SPSS Modeler позволяет выполнять полный цикл подготовки данных без программирования. Сюда входят: слияние данных (Merge — аналог JOIN и Append — аналог UNION), создание вычисляемых полей (Field Ops), балансировка (Balance), создание подвыборок (Sample) и даже автоматическая подготовка данных с помощью узла Auto Data Preparation. Готовые модели можно публиковать для командной работы и промышленной эксплуатации.

Выводы

1. Узел Auto Classifier автоматизирует процесс сравнения и выбора лучшей модели классификации.
2. Метрика AUC используется для объективного ранжирования моделей по их прогнозной силе.
3. Экспертный режим позволяет гибко менять гиперпараметры каждого алгоритма в рамках одного узла.
4. Параметр «Минимальное количество записей в дочернем узле» регулирует глубину и ветвистость деревьев решений.
5. Для алгоритма CHAID можно активировать бустинг и настраивать количество его компонентов.
6. Алгоритм C&R Tree допускает тестирование нескольких вариантов максимальной глубины дерева в одном запуске.
7. Auto Classifier может перебирать разные архитектуры одного алгоритма (например, RBF и MLP для нейросети).
8. Инструмент позволяет находить лучшую комбинацию гиперпараметров для одного алгоритма путём прямого перебора.
9. Ансамблирование нескольких лучших моделей даёт прирост качества (AUC) по сравнению с лучшей одиночной моделью.
10. Процесс поиска оптимального решения полностью реализуется без написания программного кода.
11. Auto Classifier может работать как полигон для сравнения алгоритмов и как инструмент тонкой настройки (тюнинга).
12. Платформа Modeler включает инструменты для полного цикла анализа: от подготовки данных до внедрения финальной модели.

Вопросы для самопроверки

1. Каково основное назначение узла Auto Classifier в процессе анализа данных?
2. Какую метрику мы использовали для ранжирования качества моделей и почему?
3. Чем задача тонкой настройки одного алгоритма (на примере SVM) принципиально отличается от задачи сравнения разных семейств алгоритмов?
4. Какой параметр в алгоритме C5.0 регулирует минимальный размер выборки после разделения узла?
5. Какой метод усиления модели мы применяли для алгоритма CHAID?
6. Какие две архитектуры нейронных сетей мы использовали для сравнения?
7. Как в интерфейсе узла Auto Classifier выполняется ансамблирование нескольких лучших моделей?
8. Каким образом изменилось значение AUC после применения ансамбля из трёх моделей по сравнению с лучшей одиночной моделью?
9. Какие значения параметров регуляризации (C) и коэффициента RBF-ядра (Gamma) дали наилучший результат для SVM?
10. Какое преимущество даёт автоматизация перебора гиперпараметров по сравнению с их ручным подбором?
11. Какие ещё узлы платформы Modeler помогают в подготовке данных, помимо узлов моделирования?
12. Объясните, почему комбинация параметров C=5 и Gamma=1.0 для SVM является нестандартной и почему её было бы трудно найти вручную.
Вернуться к учебному плану