Глубинный анализ данных и текстов на базе IBM SPSS Modeler

Пример модели сегрегации

В материале показан быстрый способ сегментации клиентов по их предпочтениям в характеристиках автомобилей с помощью визуального инструмента IBM SPSS Modeler. Логика изложения: от загрузки данных из CRM и их первичного аудита — к исключению нерелевантных признаков и запуску автоматической кластеризации, где параллельно испытываются три алгоритма (TwoStep, K-Means, Kohonen). После выбора наилучшей модели детально разбираются пять полученных сегментов, выявляется их содержательный образ. В завершение обсуждаются возможности бескодовой разработки, совместной работы, интеграции с Python/R и встраивания прогнозной модели в бизнес-процессы через API.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Объяснить бизнес-смысл сегментации клиентов для персонализации маркетинга.
2. Описать типовой поток построения модели сегментации в IBM SPSS Modeler.
3. Загрузить данные из файла статистики и провести их аудит с помощью узла «Аудит данных».
4. Настроить типы и роли полей, исключив идентификаторы, мешающие выявлению предпочтений.
5. Применить узел Auto Cluster для одновременного сравнения алгоритмов кластеризации.
6. Интерпретировать метрику качества и обоснованно выбрать лучший алгоритм.
7. Анализировать распределение кластеров и важность предикторов в модели K-Means.
8. Давать характеристику каждому сегменту на основе графиков и описательных статистик.
9. Оценить возможности совместной разработки, публикации модели на сервер и её вызова через API.
Показывать лекцию целиком
Краткое изложение

Для лекции используйте файл car_sales.sav (необходимо распаковать).

Приложения

car_sales.sav
Переход к задаче сегментации

Ранее мы построили ассоциативную модель, визуализировали связи между продуктами и сформировали правила для роста доходности. Теперь переходим к сегментации — разделению клиентов на устойчивые группы. Данные поступают из CRM-системы. Модель строится в автоматическом режиме. Сегментация помогает прояснить «образ клиента»: хотя аудитория неоднородна, часто выделяются группы со схожим поведением. Это позволяет точнее нацеливать маркетинговые акции и делать рассылки индивидуальными для каждой группы, повышая клиентоориентированность.

Загрузка и обзор исходных данных

Создаём новый поток. Источником служит файл статистики (расширение .sav) — формат выгрузки из SPSS Statistics. Выбираем набор данных «Sigmentation Carsales» — продажи автомобилей. После корректного разбиения на столбцы подтверждаем импорт и выводим таблицу на холст. В ней представлены: производитель, модель, количество продаж, тип цены (resale), тип двигателя, длина, ширина и другие технические характеристики.

Идея подхода

Покупатели, как правило, ищут автомобили определённого типа, ориентируясь на комплекс взаимосвязанных параметров — мощность, объём двигателя, расход топлива. Задача — сегментировать клиентов именно по предпочтениям к таким «собранным» классам автомобилей, а не по конкретной марке или модели. Производитель и модель несущественны для анализа.

Аудит и подготовка данных

Подключаем узел «Аудит данных» — он выполняет предварительный статистический анализ. Видим распределения для каждой переменной: продажи, типы автомобилей, цена (присутствует небольшое число сверхдорогих машин, основная масса — ниже средней), ширина и т. д. Доступны минимальные, максимальные, средние значения и гистограммы. При двойном щелчке по графику можно рассмотреть его детально.

Далее с помощью узла «Тип» задаём поля, участвующие в анализе, и их роли. Первые четыре поля (относящиеся к продажам и конкретным маркам) исключаем — устанавливаем для них значение «Нет». Оставляем только технические характеристики автомобиля, чтобы понять предпочтения людей вне привязки к бренду.

Автоматическая кластеризация: узел Auto Cluster

Переходим в раздел моделирования и выбираем узел Auto Cluster (автоматическая кластеризация). Существует несколько отдельных алгоритмов, например TwoStep, K-Means и Kohonen (нейронные сети Кохонена). Каждый из них можно настраивать вручную, добиваясь максимального качества. Узел Auto Cluster работает иначе: он запускает все три алгоритма одновременно с автоматически подбираемыми параметрами. Это даёт менее тонкую настройку, чем при ручной оптимизации, но существенно ускоряет первичный анализ. Запускаем узел — он отрабатывает мгновенно.

Сравнение моделей и выбор решения

Результат показывает три построенные модели с итоговой мерой качества. Для TwoStep-анализа метрика качества оказалась наивысшей, однако количество кластеров автоматически определилось как три. Для всей совокупности покупателей это слишком грубое деление — теряется детализация. Гораздо интереснее пять кластеров, которые предлагает метод K-средних.

Перейдём на уровень модели K-Means. Круговая диаграмма показывает распределение размеров кластеров: два крупных, один средний и два более мелких.

Анализ предикторов и распределений

На панели «Важность предиктора» видно, что самыми значимыми переменными оказались:
• объём топливного бака (Fuel Capacity) в абсолютных величинах;
Z-оценка (Z-score) объёма бака — нормированное значение, показывающее отклонение от среднего по всем автомобилям.

Таким образом, именно вместимость бензобака стала ключевым фактором разделения.

При выборе сразу всех пяти кластеров можно наблюдать распределение каждой характеристики по группам с помощью цветовой индикации.

Описание выделенных сегментов

• Кластер №2 (зелёный) — все показатели гипертрофированно большие. По типу кузова почти полностью состоит из Truck — крупных автомобилей с открытым задним багажником (Toyota Navara, Ford и аналоги). Это полноразмерные пикапы.
• Кластер №4 — тоже содержит Truck, но характеристики значительно уступают зелёному. Это маленькие грузовички.
• Кластер №1 — малогабаритная машина с большим объёмом бензобака, короткая и узкая, но с крупным двигателем. Необычное сочетание: маленький кузов — большой запас топлива и мотора.
• Кластер №5 (красный) — чуть выше среднего почти по всем характеристикам, располагается в районе четвёртой квартили.
• Синий кластер — по одним параметрам выше третьей квартили, по другим — ниже. Малый объём бензобака, длина ниже среднего, средняя ширина, цена ниже среднего, но высокий объём двигателя и большая масса.

Анализируя такие профили, можно составить образ каждого типа покупателя и выявить их целевые предпочтения.

Уровень глубины: первичный анализ

Построение заняло около 10 минут. Это не глубокая аналитика, а первичный анализ, который даёт быстрый обзор. При необходимости можно углубиться в любую отдельную модель и тонко настроить её параметры.

Возможности платформы IBM SPSS Modeler

Весь процесс реализован без программирования — только выбор опций из выпадающих списков и расстановка флажков. Это главная идея SPSS Modeler: графическая разработка моделей. При этом всегда можно перейти к написанию кода. В разделе «Python» и через специальные узлы доступны скрипты на Python и R — как готовые, так и пользовательские.

Дополнительные возможности:
• Совместная работа и развёртывание. В клиентской версии вы экспериментируете, перебираете модели. Одной кнопкой выгружаете лучшую на сервер, где она становится доступной коллегам. Можно открыть доступ для редактирования.
• Подключение к источникам данных. Широкий спектр коннекторов: классические XML, Excel, а также JSON, геопространственные данные, TM1, SAS, файлы статистики и др.
• Интеграция в бизнес-процессы. Модель может работать фоново, вызываться удалённо через API. Не нужно открывать приложение и запускать её вручную. Бизнес-процесс посылает запрос и получает прогноз, на основе которого продолжается выполнение.
Таким образом, в руках аналитика оказывается мощный инструмент прогнозной аналитики, позволяющий быстро, наглядно и без кода создавать сегментации и классификации, с возможностью совместной работы и бесшовной интеграции в живые процессы компании.

Краткие итоги

Сегментация клиентов неразрывно связана с пониманием их глубинных предпочтений, а не формальных меток вроде бренда. На примере данных о продажах автомобилей показано, как можно оперативно перейти от сырых записей к осмысленным группам покупателей, ориентируясь исключительно на объективные технические параметры машин. Исключение идентификаторов (производитель, модель) сразу переводит фокус с учёта продаж на изучение потребительского поведения. Предварительный аудит распределений даёт первое представление о структуре данных и аномалиях, а настройка ролей полей формализует задачу.

Ключевое звено — автоматическая кластеризация, объединяющая принципиально разные алгоритмы. Метрика качества выступает одновременно и индикатором пригодности модели, и способом избежать избыточной тонкой настройки на старте. Контраст между тремя кластерами TwoStep и пятью кластерами K-Means чётко демонстрирует компромисс между статистической оптимальностью и бизнес-полезной детализацией. Выбор в пользу пяти сегментов продиктован практической потребностью в более персонализированных решениях.

Разбор профилей кластеров через распределения и важность предикторов превращает математический результат в операциональное знание. На первый план выходит не самый очевидный показатель — объём топливного бака, который в сочетании с Z-оценкой служит надёжным дифференциатором. Описания сегментов — от тяжелых пикапов до малогабаритных машин с большим двигателем — сразу переводят статистические выводы на язык бизнес-действий: кому адресовать предложения по экономичности, кому — по грузоподъемности.

Примечательно, что вся процедура занимает около десяти минут и не требует программирования. Это снижает порог входа, позволяет многократно экспериментировать и быстро обмениваться результатами с коллегами. Одновременно заложена возможность углубления: ручная настройка отдельных алгоритмов, написание скриптов на Python или R, встраивание модели в потоковые бизнес-процессы через API. Таким образом, даже поверхностный кластерный анализ, проведённый с помощью визуального инструментария, способен стать не просто разовым исследованием, а постоянно действующим компонентом принятия маркетинговых решений, автоматически реагирующим на изменения в данных.
Цель и подход к сегментации

Переходим от ассоциативных правил к разделению клиентов на устойчивые группы. Данные — из CRM. Идея — уловить «образ клиента» через его предпочтения, нацелить акции на самые интересные сегменты и сделать рассылки индивидуальными. Используются записи о продажах автомобилей.

Данные и их подготовка

Источник — файл статистики .sav («Sigmentation Carsales»). После загрузки видим поля: производитель, модель, количество, resale-цена, тип двигателя, длина, ширина и т. д. Поскольку клиенты выбирают комплекс характеристик, а не конкретную марку, первые четыре поля (продажи, бренд) исключаем через узел «Тип», оставляя только технические параметры.

Предварительный аудит выполняет узел «Аудит данных»: для каждой переменной строятся гистограммы, отображаются минимум, максимум, среднее. Это позволяет заметить, например, малую долю сверхдорогих автомобилей и основную массу цен ниже среднего.

Автоматическая кластеризация Auto Cluster

В разделе моделирования берём узел Auto Cluster. В отличие от ручного запуска отдельных алгоритмов (TwoStep, K-Means, Kohonen), он испытывает все три одновременно с автоматическим подбором параметров. Результат содержит метрику качества для каждой модели. Наивысший показатель у TwoStep, но он предложил всего три кластера. Для практической персонализации это слишком мало, поэтому выбираем K-Means с пятью кластерами.

Интерпретация модели K-Means

Круговая диаграмма показывает распределение размеров: два крупных, один средний и два маленьких кластера. Узел выводит важность предиктора — главным фактором оказался объём топливного бака (Fuel Capacity) и его Z-оценка (нормировка относительно средней по всем автомобилям). С помощью цветового отображения можно сравнить сразу все пять кластеров.

Характеристики сегментов:
• Кластер №2 (зелёный) — пикапы (тип кузова Truck) с очень большими значениями всех параметров, полноразмерные грузовички.
• Кластер №4 — тоже Truck, но заметно меньше по всем характеристикам (компактные пикапы).
• Кластер №1 — малогабаритная, короткая и узкая машина, но с большими бензобаком и двигателем.
• Кластер №5 (красный) — почти по всем показателям чуть выше среднего, в районе четвёртой квартили.
• Синий кластер — малый бензобак, длина ниже средней, цена низкая, но двигатель объёмный и масса большая.
Такой анализ даёт первичный портрет предпочтений примерно за 10 минут.

Возможности платформы IBM SPSS Modeler

Весь процесс реализуется без программирования — выбором опций в выпадающих списках и расстановкой флажков. При необходимости можно добавить узлы Python и R, писать собственные скрипты или использовать готовые. Клиентская версия позволяет экспериментировать; удачную модель одной кнопкой выгружают на сервер, открывая совместный доступ. Коллеги могут не только просматривать, но и редактировать поток. Поддерживается множество источников данных: XML, Excel, JSON, SAS, файлы статистики, базы данных и другие. Более того, модель способна работать фоново, вызываться удалённо через API и возвращать прогноз прямо в бизнес-процесс без необходимости вручную открывать приложение.

Таким образом, SPSS Modeler — это мощная среда прогнозной аналитики, где можно быстро создавать, совместно дорабатывать и встраивать модели в живые процессы компании.

Выводы

1. Сегментация клиентов выявляет группы со схожими предпочтениями, позволяя точечно настраивать маркетинг и рассылки.
2. Для анализа предпочтений необходимо отказаться от брендовых признаков и сосредоточиться на объективных характеристиках продукта.
3. Узел «Аудит данных» даёт быстрый предварительный обзор распределений и выбросов по каждой переменной.
4. Узел «Тип» позволяет исключить идентификаторы и указать, какие поля использовать для кластеризации.
5. Auto Cluster параллельно испытывает три алгоритма с автоматическим подбором параметров, экономя время аналитика.
6. Метрика качества служит первичным критерием выбора, но одной её недостаточно — важно учитывать практическую интерпретируемость числа кластеров.
7. При равных статистических показателях большее число кластеров часто лучше раскрывает неоднородность аудитории.
8. Важность предиктора показывает, какие характеристики внесли наибольший вклад в разделение; в примере лидирует объём топливного бака и его Z-оценка.
9. Цветовое отображение распределений по кластерам позволяет быстро составить «портрет» каждого сегмента без дополнительных расчётов.
10. IBM SPSS Modeler реализует весь цикл построения модели без кода, но даёт возможность перехода на скрипты Python и R.
11. Готовую модель можно одной кнопкой выгрузить на сервер для совместного доступа и коллективной доработки.
12. Вызов модели через API встраивает прогнозную аналитику прямо в бизнес-процесс, исключая ручной запуск и ускоряя принятие решений.

Вопросы для самопроверки

1. Какую основную цель преследует сегментация клиентов в маркетинге?
2. Почему при сегментации покупателей автомобилей исключают поля «Производитель» и «Модель»?
3. Какую информацию предоставляет узел «Аудит данных» и чем она полезна перед моделированием?
4. Какие три алгоритма кластеризации запускает узел Auto Cluster?
5. В чём различие между абсолютным значением переменной и её Z-оценкой в контексте важности предиктора?
6. Почему выбор пал на решение K-Means с пятью кластерами, хотя TwoStep показал более высокую метрику качества?
7. Как можно охарактеризовать клиентов «зелёного» кластера в рассмотренном примере?
8. Чем кластер №1 принципиально отличается по сочетанию характеристик от остальных легковых кластеров?
9. Какие преимущества даёт графический подход SPSS Modeler по сравнению с написанием кода вручную?
10. Какие возможности интеграции предоставляет платформа для встраивания модели в действующие бизнес-процессы?
11. Какую роль играют узлы Python и R в потоке, если базовый анализ делается без программирования?
12. Какие форматы источников данных, помимо файлов статистики, поддерживаются в SPSS Modeler?
Вернуться к учебному плану