Настройка узла Auto Classifier для сравнения алгоритмов
Используем подготовленный набор данных с разбиением на обучающую и тестовую выборки в пропорции 70/30. Целевая переменная —
response to Campaign (отклик на маркетинговую кампанию) с двумя возможными значениями («да» и «нет»). Это задача
бинарной классификации.
Для её решения в IBM SPSS Modeler существует узел
Auto Classifier (Автоматический классификатор). Он корректно определяет целевую переменную, считывая её тип из узла Type. Заходим в настройки узла.
В разделе
Model задаём критерий ранжирования моделей. В поле
Rank Models by выбираем метрику
AUC (Area Under Curve — площадь под ROC-кривой). Это позволит объективно сравнивать качество алгоритмов. Увеличиваем количество используемых моделей с 3 до 5, чтобы расширить конкуренцию за звание лучшей.
Теперь выберем конкретные алгоритмы и настроим их параметры через
Expert Mode:
1.
C5.0. Меняем параметр
Minimum records per child branch (минимальное количество записей в дочернем узле) на значение 25. Это регулирует ветвление дерева решений.
2.
CHAID (Chi-square Automatic Interaction Detection). В настройках активируем
Boosting (бустинг) — метод усиления модели. Меняем количество компонентов для бустинга (
Number of component models for boosting) со значения 10 на 25.
3.
C&R Tree (Classification and Regression Tree). Находим параметр
Maximum tree depth (максимальная глубина дерева) и добавляем к стандартному значению 5 ещё и значение 10. Теперь алгоритм проверит деревья с обеими глубинами.
4.
Neural Net (Нейронная сеть). Выбираем для использования обе архитектуры: и Radial Basis Function (радиальная базисная функция, RBF), и Multilayer Perceptron (многослойный перцептрон).
После настройки отключаем неиспользуемые алгоритмы (Quest, Goot, XGBoost Linear, 3S, Random Forest). Для сравнения оставляем
C5.0,
CHAID,
C&R Tree,
Neural Net (две модели) и
Logistic regression (логистическая регрессия) с параметрами по умолчанию. В сумме получается 9 различных моделей-претендентов. Запускаем анализ.
Анализ результатов и ансамблирование
Получаем итоговое ранжирование по метрике AUC. Лучшей оказалась логистическая регрессия, которую мы не настраивали. Далее следуют CHAID (первая модель), Neural Net (первая модель), C&R Tree (вторая модель) и Neural Net (вторая модель).
Теперь мы можем не просто взять лучшую модель, а улучшить результат с помощью
ансамблирования. Отбираем три лучшие модели, исключив аутсайдеров (CHAID 2 и Neural Net 2). Узел Auto Classifier позволяет выполнить ансамблирование автоматически: если в результатах оставить отмеченными несколько моделей, они объединяются в
ансамблевую модель (ансамбль). Отдельный узел Ensemble не требуется.
Смотрим итоговый результат. Ансамблевая модель показала значение AUC = 0,751. Это выше, чем результат лучшей одиночной модели (логистическая регрессия с AUC = 0,74). Таким образом, ансамблирование повысило качество предсказания.
Тонкая настройка гиперпараметров одной модели
Auto Classifier можно использовать и для другой цели: найти лучшие настройки для одного конкретного алгоритма. Ограничимся одной моделью, но переберём множество комбинаций её гиперпараметров.
В качестве примера берём
SVM (Support Vector Machine — метод опорных векторов), который ранее не использовали. Отключаем все остальные алгоритмы. Заходим в экспертный режим SVM и меняем параметры:
• C (Regularization) — параметр регуляризации. Задаём значения: 5, 10, 15.
• RBF Gamma — коэффициент ядра радиальной базисной функции. Задаём значения: 0.5, 1.0, 1.5.
Перебор этих параметров независимый. Получается 12 комбинаций (3 значения C × 4 значения gamma). Запускаем анализ. Узел перебирает все 12 моделей и автоматически выводит тройку лучших. Самой качественной оказывается модель
SVM 4.
Открываем её сводку параметров (
Summary Build Settings) и видим победившую комбинацию:
C = 5 и
Gamma = 1.0. Это сочетание не является стандартным. Без автоматизированного перебора мы бы не нашли его и не получили бы модель с максимальной точностью. Так можно искать наилучшие параметры для любого числа алгоритмов, хоть с сотней комбинаций, а затем лучшие из них объединить в ансамбль.
Общий обзор возможностей IBM SPSS Modeler
Процесс анализа данных в Modeler не ограничивается моделированием. Помимо узла Auto Classifier, платформа предоставляет широкие возможности:
• Подготовка данных: подключение к источникам, разбиение на выборки (Partition), создание вычисляемых полей (Field Ops), сортировка и балансировка данных (Balance), создание подвыборок (Sample).
• Слияние данных: объединение таблиц через операцию, аналогичную JOIN (Merge), или UNION (Append).
• Автоматизация: существует узел
Auto Data Preparation, автоматизирующий подготовку данных по аналогии с Auto Classifier.
Все эти инструменты позволяют без написания программного кода довести исходные данные до нужного качества, найти оптимальную модель и внедрить её. В серверной версии модели можно публиковать для общего доступа, что упрощает их промышленную эксплуатацию.
Краткие итоги
Материал последовательно раскрывает эволюцию мысли аналитика от ручного сравнения единичных моделей к полной автоматизации поиска лучшего решения. В основе лежит прагматичная задача — максимизировать точность предсказания отклика на маркетинговую кампанию, минимизируя при этом рутинный труд.
Центральным элементом повествования становится инструмент, выполняющий роль «автопилота» для анализа данных. Сначала демонстрируется его способность проводить «соревнование» между принципиально разными классами алгоритмов: от линейных моделей и деревьев решений до нейронных сетей. Это позволяет быстро получить бейзлайн и выявить, какие семейства методов в принципе лучше справляются с конкретной структурой данных. Затем логика усложняется: от сравнения алгоритмов осуществляется переход к глубинному тюнингу одного из них, в частности метода опорных векторов. На этом этапе иллюстрируется ключевая идея о том, что стандартные настройки почти никогда не являются оптимальными, и потенциал улучшения кроется в методичном переборе гиперпараметров.
Качественным скачком становится применение ансамблирования — объединения нескольких лучших моделей. На конкретном примере с метрикой AUC видно, что композиция слабых или средних по отдельности моделей способна превзойти любого сильного одиночного игрока. Этот результат подводит к важной практической максиме: в машинном обучении побеждает не столько уникальный алгоритм, сколько выверенная стратегия комбинирования и автоматизированного поиска. Такой подход полностью снимает с исследователя бремя ручного кодирования и позволяет сосредоточиться на интерпретации результатов. В итоге вырисовывается целостная картина промышленного анализа данных, где путь от сырых сведений до готовой к внедрению предиктивной модели представляет собой не линейную последовательность шагов, а итеративный процесс управляемой автоматической оптимизации, доступный пользователю без навыков программирования.
1. Узел Auto Classifier автоматизирует процесс сравнения и выбора лучшей модели классификации.
2. Метрика AUC используется для объективного ранжирования моделей по их прогнозной силе.
3. Экспертный режим позволяет гибко менять гиперпараметры каждого алгоритма в рамках одного узла.
4. Параметр «Минимальное количество записей в дочернем узле» регулирует глубину и ветвистость деревьев решений.
5. Для алгоритма CHAID можно активировать бустинг и настраивать количество его компонентов.
6. Алгоритм C&R Tree допускает тестирование нескольких вариантов максимальной глубины дерева в одном запуске.
7. Auto Classifier может перебирать разные архитектуры одного алгоритма (например, RBF и MLP для нейросети).
8. Инструмент позволяет находить лучшую комбинацию гиперпараметров для одного алгоритма путём прямого перебора.
9. Ансамблирование нескольких лучших моделей даёт прирост качества (AUC) по сравнению с лучшей одиночной моделью.
10. Процесс поиска оптимального решения полностью реализуется без написания программного кода.
11. Auto Classifier может работать как полигон для сравнения алгоритмов и как инструмент тонкой настройки (тюнинга).
12. Платформа Modeler включает инструменты для полного цикла анализа: от подготовки данных до внедрения финальной модели.
1. Каково основное назначение узла Auto Classifier в процессе анализа данных?
2. Какую метрику мы использовали для ранжирования качества моделей и почему?
3. Чем задача тонкой настройки одного алгоритма (на примере SVM) принципиально отличается от задачи сравнения разных семейств алгоритмов?
4. Какой параметр в алгоритме C5.0 регулирует минимальный размер выборки после разделения узла?
5. Какой метод усиления модели мы применяли для алгоритма CHAID?
6. Какие две архитектуры нейронных сетей мы использовали для сравнения?
7. Как в интерфейсе узла Auto Classifier выполняется ансамблирование нескольких лучших моделей?
8. Каким образом изменилось значение AUC после применения ансамбля из трёх моделей по сравнению с лучшей одиночной моделью?
9. Какие значения параметров регуляризации (C) и коэффициента RBF-ядра (Gamma) дали наилучший результат для SVM?
10. Какое преимущество даёт автоматизация перебора гиперпараметров по сравнению с их ручным подбором?
11. Какие ещё узлы платформы Modeler помогают в подготовке данных, помимо узлов моделирования?
12. Объясните, почему комбинация параметров C=5 и Gamma=1.0 для SVM является нестандартной и почему её было бы трудно найти вручную.