Для лекции используйте файл car_sales.sav (необходимо распаковать).
Переход к задаче сегментации
Ранее мы построили ассоциативную модель, визуализировали связи между продуктами и сформировали правила для роста доходности. Теперь переходим к сегментации — разделению клиентов на устойчивые группы. Данные поступают из CRM-системы. Модель строится в автоматическом режиме. Сегментация помогает прояснить «образ клиента»: хотя аудитория неоднородна, часто выделяются группы со схожим поведением. Это позволяет точнее нацеливать маркетинговые акции и делать рассылки индивидуальными для каждой группы, повышая клиентоориентированность.
Загрузка и обзор исходных данных
Создаём новый поток. Источником служит файл статистики (расширение .sav) — формат выгрузки из SPSS Statistics. Выбираем набор данных
«Sigmentation Carsales» — продажи автомобилей. После корректного разбиения на столбцы подтверждаем импорт и выводим таблицу на холст. В ней представлены: производитель, модель, количество продаж, тип цены (resale), тип двигателя, длина, ширина и другие технические характеристики.
Идея подхода
Покупатели, как правило, ищут автомобили определённого типа, ориентируясь на комплекс взаимосвязанных параметров — мощность, объём двигателя, расход топлива. Задача — сегментировать клиентов именно по предпочтениям к таким «собранным» классам автомобилей, а не по конкретной марке или модели. Производитель и модель несущественны для анализа.
Аудит и подготовка данных
Подключаем узел
«Аудит данных» — он выполняет предварительный статистический анализ. Видим распределения для каждой переменной: продажи, типы автомобилей, цена (присутствует небольшое число сверхдорогих машин, основная масса — ниже средней), ширина и т. д. Доступны минимальные, максимальные, средние значения и гистограммы. При двойном щелчке по графику можно рассмотреть его детально.
Далее с помощью узла
«Тип» задаём поля, участвующие в анализе, и их роли. Первые четыре поля (относящиеся к продажам и конкретным маркам) исключаем — устанавливаем для них значение «Нет». Оставляем только технические характеристики автомобиля, чтобы понять предпочтения людей вне привязки к бренду.
Автоматическая кластеризация: узел Auto Cluster
Переходим в раздел моделирования и выбираем узел
Auto Cluster (автоматическая кластеризация). Существует несколько отдельных алгоритмов, например TwoStep, K-Means и
Kohonen (нейронные сети Кохонена). Каждый из них можно настраивать вручную, добиваясь максимального качества. Узел Auto Cluster работает иначе: он запускает все три алгоритма одновременно с автоматически подбираемыми параметрами. Это даёт менее тонкую настройку, чем при ручной оптимизации, но существенно ускоряет первичный анализ. Запускаем узел — он отрабатывает мгновенно.
Сравнение моделей и выбор решения
Результат показывает три построенные модели с итоговой мерой качества. Для TwoStep-анализа метрика качества оказалась наивысшей, однако количество кластеров автоматически определилось как три. Для всей совокупности покупателей это слишком грубое деление — теряется детализация. Гораздо интереснее пять кластеров, которые предлагает метод K-средних.
Перейдём на уровень модели K-Means. Круговая диаграмма показывает распределение размеров кластеров: два крупных, один средний и два более мелких.
Анализ предикторов и распределений
На панели
«Важность предиктора» видно, что самыми значимыми переменными оказались:
• объём топливного бака (Fuel Capacity) в абсолютных величинах;
•
Z-оценка (Z-score) объёма бака — нормированное значение, показывающее отклонение от среднего по всем автомобилям.
Таким образом, именно вместимость бензобака стала ключевым фактором разделения.
При выборе сразу всех пяти кластеров можно наблюдать распределение каждой характеристики по группам с помощью цветовой индикации.
Описание выделенных сегментов
• Кластер №2 (зелёный) — все показатели гипертрофированно большие. По типу кузова почти полностью состоит из
Truck — крупных автомобилей с открытым задним багажником (Toyota Navara, Ford и аналоги). Это полноразмерные пикапы.
• Кластер №4 — тоже содержит Truck, но характеристики значительно уступают зелёному. Это маленькие грузовички.
• Кластер №1 — малогабаритная машина с большим объёмом бензобака, короткая и узкая, но с крупным двигателем. Необычное сочетание: маленький кузов — большой запас топлива и мотора.
• Кластер №5 (красный) — чуть выше среднего почти по всем характеристикам, располагается в районе четвёртой квартили.
• Синий кластер — по одним параметрам выше третьей квартили, по другим — ниже. Малый объём бензобака, длина ниже среднего, средняя ширина, цена ниже среднего, но высокий объём двигателя и большая масса.
Анализируя такие профили, можно составить образ каждого типа покупателя и выявить их целевые предпочтения.
Уровень глубины: первичный анализ
Построение заняло около 10 минут. Это не глубокая аналитика, а первичный анализ, который даёт быстрый обзор. При необходимости можно углубиться в любую отдельную модель и тонко настроить её параметры.
Возможности платформы IBM SPSS Modeler
Весь процесс реализован без программирования — только выбор опций из выпадающих списков и расстановка флажков. Это главная идея SPSS Modeler: графическая разработка моделей. При этом всегда можно перейти к написанию кода. В разделе
«Python» и через специальные узлы доступны скрипты на Python и R — как готовые, так и пользовательские.
Дополнительные возможности:
• Совместная работа и развёртывание. В клиентской версии вы экспериментируете, перебираете модели. Одной кнопкой выгружаете лучшую на сервер, где она становится доступной коллегам. Можно открыть доступ для редактирования.
• Подключение к источникам данных. Широкий спектр коннекторов: классические XML, Excel, а также JSON, геопространственные данные, TM1, SAS, файлы статистики и др.
• Интеграция в бизнес-процессы. Модель может работать фоново, вызываться удалённо через API. Не нужно открывать приложение и запускать её вручную. Бизнес-процесс посылает запрос и получает прогноз, на основе которого продолжается выполнение.
Таким образом, в руках аналитика оказывается мощный инструмент прогнозной аналитики, позволяющий быстро, наглядно и без кода создавать сегментации и классификации, с возможностью совместной работы и бесшовной интеграции в живые процессы компании.
Краткие итоги
Сегментация клиентов неразрывно связана с пониманием их глубинных предпочтений, а не формальных меток вроде бренда. На примере данных о продажах автомобилей показано, как можно оперативно перейти от сырых записей к осмысленным группам покупателей, ориентируясь исключительно на объективные технические параметры машин. Исключение идентификаторов (производитель, модель) сразу переводит фокус с учёта продаж на изучение потребительского поведения. Предварительный аудит распределений даёт первое представление о структуре данных и аномалиях, а настройка ролей полей формализует задачу.
Ключевое звено — автоматическая кластеризация, объединяющая принципиально разные алгоритмы. Метрика качества выступает одновременно и индикатором пригодности модели, и способом избежать избыточной тонкой настройки на старте. Контраст между тремя кластерами TwoStep и пятью кластерами K-Means чётко демонстрирует компромисс между статистической оптимальностью и бизнес-полезной детализацией. Выбор в пользу пяти сегментов продиктован практической потребностью в более персонализированных решениях.
Разбор профилей кластеров через распределения и важность предикторов превращает математический результат в операциональное знание. На первый план выходит не самый очевидный показатель — объём топливного бака, который в сочетании с Z-оценкой служит надёжным дифференциатором. Описания сегментов — от тяжелых пикапов до малогабаритных машин с большим двигателем — сразу переводят статистические выводы на язык бизнес-действий: кому адресовать предложения по экономичности, кому — по грузоподъемности.
Примечательно, что вся процедура занимает около десяти минут и не требует программирования. Это снижает порог входа, позволяет многократно экспериментировать и быстро обмениваться результатами с коллегами. Одновременно заложена возможность углубления: ручная настройка отдельных алгоритмов, написание скриптов на Python или R, встраивание модели в потоковые бизнес-процессы через API. Таким образом, даже поверхностный кластерный анализ, проведённый с помощью визуального инструментария, способен стать не просто разовым исследованием, а постоянно действующим компонентом принятия маркетинговых решений, автоматически реагирующим на изменения в данных.
1. Сегментация клиентов выявляет группы со схожими предпочтениями, позволяя точечно настраивать маркетинг и рассылки.
2. Для анализа предпочтений необходимо отказаться от брендовых признаков и сосредоточиться на объективных характеристиках продукта.
3. Узел «Аудит данных» даёт быстрый предварительный обзор распределений и выбросов по каждой переменной.
4. Узел «Тип» позволяет исключить идентификаторы и указать, какие поля использовать для кластеризации.
5. Auto Cluster параллельно испытывает три алгоритма с автоматическим подбором параметров, экономя время аналитика.
6. Метрика качества служит первичным критерием выбора, но одной её недостаточно — важно учитывать практическую интерпретируемость числа кластеров.
7. При равных статистических показателях большее число кластеров часто лучше раскрывает неоднородность аудитории.
8. Важность предиктора показывает, какие характеристики внесли наибольший вклад в разделение; в примере лидирует объём топливного бака и его Z-оценка.
9. Цветовое отображение распределений по кластерам позволяет быстро составить «портрет» каждого сегмента без дополнительных расчётов.
10. IBM SPSS Modeler реализует весь цикл построения модели без кода, но даёт возможность перехода на скрипты Python и R.
11. Готовую модель можно одной кнопкой выгрузить на сервер для совместного доступа и коллективной доработки.
12. Вызов модели через API встраивает прогнозную аналитику прямо в бизнес-процесс, исключая ручной запуск и ускоряя принятие решений.
1. Какую основную цель преследует сегментация клиентов в маркетинге?
2. Почему при сегментации покупателей автомобилей исключают поля «Производитель» и «Модель»?
3. Какую информацию предоставляет узел «Аудит данных» и чем она полезна перед моделированием?
4. Какие три алгоритма кластеризации запускает узел Auto Cluster?
5. В чём различие между абсолютным значением переменной и её Z-оценкой в контексте важности предиктора?
6. Почему выбор пал на решение K-Means с пятью кластерами, хотя TwoStep показал более высокую метрику качества?
7. Как можно охарактеризовать клиентов «зелёного» кластера в рассмотренном примере?
8. Чем кластер №1 принципиально отличается по сочетанию характеристик от остальных легковых кластеров?
9. Какие преимущества даёт графический подход SPSS Modeler по сравнению с написанием кода вручную?
10. Какие возможности интеграции предоставляет платформа для встраивания модели в действующие бизнес-процессы?
11. Какую роль играют узлы Python и R в потоке, если базовый анализ делается без программирования?
12. Какие форматы источников данных, помимо файлов статистики, поддерживаются в SPSS Modeler?