Для лекции используйте файл Customers.xlsx.
Постановка задачи
Мы проведём предиктивный анализ, чтобы определить отток клиентов (churn) — тех, кто разорвал контракт. Будем использовать данные из CRM-системы телеком-компании. Задача: предвосхитить уход клиента и заранее применить целевое воздействие — отправить специальное предложение, скидку или бонус. Выполним следующие шаги:
• импортируем данные,
• настроим роли переменных,
• построим модель дерева решений,
• оценим результаты.
1. Импорт данных
Мы работаем в SPSS Modeler. В его центре находится
холст (canvas), на который перетаскиваются
узлы (nodes) — элементы анализа. Источником служит файл Excel. Узел источника помещается на холст двойным щелчком, после чего открывается окно настройки.
Для импорта не нужно писать код — достаточно выбрать файл из выпадающего списка. В этом примере используется
Customers File. После выбора происходит автоматический импорт и можно предварительно просмотреть первые 10 строк, чтобы убедиться в корректности считывания.
Обзор набора данных:
• Идентификатор клиента (ID) — уникальный номер, не несёт аналитического смысла.
• Пол, семейное положение, количество детей, среднегодовой доход — демографические признаки.
• Наличие автомобиля — флаговое поле.
• Тарифный план (rate plan) — код тарифа.
• Потребление трафика (usage) — объём использованного трафика.
• Длительность разговоров: местные (local), междугородние (long distance) и международные (international).
• Количество сброшенных звонков (dropped calls).
• Метод оплаты — способ расчёта (карта, наличные, онлайн и т.д.), закодированный.
• Выставленный счёт.
• Статус клиента (churn) — целевое поле. Принимает значения «Cancelled» (контракт расторгнут) или «Current» (клиент активен).
Наша цель — предсказать значение последнего столбца.
2. Определение типов и ролей полей
Следующий этап — настройка описания данных с помощью узла
«Тип» (Type). Соединяем его с узлом источника (клавиша F2 или команда «Подключиться»). Узел автоматически получает все поля. Функция «Просчитать значения» анализирует весь файл и выдаёт рекомендации по типам для каждой переменной.
Здесь же задаётся роль переменной. Поле
churn назначаем
целевым (Target) — именно его модель будет предсказывать. Поле
ID помечаем как
идентификатор (ID), чтобы алгоритм не использовал его как предиктор. Остальные поля остаются
входными (Input).
3. Начальное распределение целевой переменной
Для быстрой оценки данных добавим узел гистограммы из раздела «Диаграммы». Подсоединяем его к узлу «Тип», указываем поле
churn в качестве анализируемого и запускаем выполнение. Результат: примерно 39% клиентов покинули компанию, 61% остались. Эта визуализация показывает базовый дисбаланс классов.
4. Построение дерева классификации и регрессии
Переходим к моделированию. В разделе «Моделирование» выбираем узел
дерево классификации и регрессии (Classification and Regression Tree, C&R Tree). Это один из множества доступных алгоритмов. Соединяем C&R Tree с узлом «Тип». Название узла автоматически становится
churn — по имени целевой переменной.
В настройках модели уже определены целевое поле и входные переменные. Запускаем выполнение. Создаётся модель, и можно сразу исследовать её свойства.
Важность предикторов
На вкладке модели отображается диаграмма значимости переменных. Наиболее важным предиктором оказалось
наличие детей (children), затем —
возраст. Это значит, что при прогнозе оттока ключевую роль играют демографические факторы.
Структура дерева
Построенное дерево решений получилось компактным — глубина равна 5. Каждый узел показывает правило разделения данных, которое автоматически подобрано алгоритмом. Подобную логику ручным способом воспроизвести было бы крайне сложно.
5. Просмотр прогнозов
Чтобы увидеть предсказания модели, выносим узел
«Таблица» (Table) и соединяем его с построенной моделью. После запуска в таблице появляются исходные данные плюс два новых столбца:
• Prediction (предсказанное значение churn),
• Вероятность предсказания (P-churn) — уверенность модели в своём решении.
Сравнивая предсказания с реальным столбцом
churn, видим как совпадения, так и ошибки. Модель ошибается не во всех случаях.
6. Оценка точности модели
Для формальной оценки используем узел
«Анализ» (Analysis). Подключаем его к модели и запускаем. Выходная статистика показывает
точность (accuracy) 83%. Дополнительные метрики: AUC — 0.86, Gini — 0.72. Это означает, что примерно в 80% случаев модель способна верно определить, покинет ли клиент компанию.
7. Заключение
На сборку работающей модели прогнозирования оттока потребовалось всего несколько узлов: источник (Excel), тип (определение ролей), C&R Tree (модель), анализ (оценка). Мы не написали ни строчки кода — всё делалось через графический интерфейс перетаскиванием узлов и их настройкой. Благодаря быстродействию разработки, многообразию алгоритмов, возможности кастомизации и совместной работы (серверная версия) SPSS Modeler является одним из ведущих решений для анализа данных.
Краткие итоги
Представленный материал демонстрирует законченный цикл создания прогнозной модели оттока клиентов с акцентом на скорость и простоту реализации без программирования. Последовательность шагов — от сырых данных до оценки точности — реализована исключительно средствами визуального конструирования: узлы источников, трансформации типов, моделирования и анализа соединяются в единый поток на холсте. Такой подход позволяет аналитику сосредоточиться на логике задачи, а не на синтаксисе языка.
Принципиальным моментом является автоматическое распознавание типов полей и ролей: целевая переменная, предикторы и идентификатор задаются в одном окне. Это устраняет рутинные ошибки и гарантирует корректную передачу данных в алгоритм. Мгновенный предпросмотр распределения целевого признака через гистограмму даёт быстрое понимание структуры классов, что важно для выбора стратегии моделирования.
Применение дерева классификации и регрессии (C&R Tree) подчёркивает интерпретируемость модели. Уже на этапе обучения доступна диаграмма важности предикторов, которая сразу выявляет ключевые факторы оттока — в данном случае демографические характеристики (наличие детей, возраст). Само дерево наглядно, а его компактность свидетельствует об отсутствии избыточного переобучения. Такая прозрачность важна для бизнес-пользователей, которым нужно обосновывать решения.
Оценка качества не ограничилась выводом прогнозов, а включила формальные метрики — точность, AUC, коэффициент Джини. Уровень точности 83% для базовой модели без тонкой настройки показывает, что даже минимальная конфигурация способна давать практически полезные результаты. Это позволяет быстро инициировать удерживающие мероприятия: выделить группу риска, оценить вероятность ухода и применить дифференцированное воздействие.
Практическая ценность продемонстрированного workflow — в его воспроизводимости и масштабируемости. Замена источника данных, смена целевой переменной или выбор другого алгоритма потребуют минимальных изменений на холсте, а серверная версия даёт возможность коллективной работы и внедрения модели в продуктивную среду. Тем самым аналитическая команда получает инструмент, который сокращает путь от гипотезы до действующего прогноза.
Рассматривается кейс прогнозирования оттока клиентов (churn) в телекоме с помощью SPSS Modeler. Задача — выявить клиентов, которые с высокой вероятностью разорвут контракт, чтобы заранее применить удерживающие акции. Вся работа ведётся без написания кода, через визуальный конструктор.
Данные и их импорт
Источником служит Excel-файл Customers File. В наборе данных присутствуют: ID клиента, демографические признаки (пол, семейное положение, количество детей, возраст, доход), наличие автомобиля, параметры тарифа и потребления (rate plan, объём трафика, часы местных, междугородних и международных разговоров), количество сброшенных звонков, метод оплаты, сумма счёта и целевое поле churn со значениями «Cancelled» и «Current». Импорт выполняется выбором файла в узле источника, автоматически считываются все поля.
Определение ролей и типов
Следующий узел — «Тип» (Type). Он соединён с источником и получает данные. При нажатии «Просчитать значения» система анализирует весь файл и рекомендует типы. Здесь же задаются роли: поле churn помечается как целевое (Target), ID клиента — как идентификатор (ID), чтобы исключить его из обучения, остальные поля выступают предикторами (Input).
Первичный анализ
Для понимания распределения целевого признака используется гистограмма. Результат: примерно 39% клиентов ушли, 61% остались. Это показывает исходный дисбаланс классов и помогает осознать масштаб проблемы.
Построение модели
Из раздела моделирования выбран узел «C&R Tree» (дерево классификации и регрессии). Он подключается к узлу «Тип». После запуска создаётся готовая модель. На вкладке важности предикторов видно, что главный фактор оттока — наличие детей, за ним возраст. Такая интерпретируемость критична для бизнеса.
Построенное дерево имеет компактную глубину — 5 уровней, что снижает риск переобучения. Узлы дерева отражают правила, автоматически найденные алгоритмом.
Результаты прогнозирования
Узел «Таблица», подключённый к модели, выводит исходные записи и добавляет два столбца: предсказанное значение churn (Prediction) и вероятность этого предсказания (P-churn). Вероятности позволяют ранжировать клиентов по степени риска и адресно применять удерживающие меры.
Оценка качества
Узел «Анализ» (Analysis) даёт метрики: точность (accuracy) = 83%, AUC = 0.86, Gini = 0.72. Это означает, что модель верно предсказывает уход в 8 из 10 случаев — хороший базовый результат.
Итоговая схема работы
Поток состоит из четырёх функциональных узлов: источник → тип → модель C&R Tree → анализ. Все связи устанавливаются мышью или клавишей F2. Любой узел настраивается через графический интерфейс, код не требуется. Такой подход радикально ускоряет разработку, делает её доступной аналитикам без навыков программирования и легко масштабируется.
Практическое применение
Полученную модель можно сразу использовать: для каждого клиента рассчитывается вероятность оттока, затем формируется список группы риска и запускается целевая маркетинговая кампания (SMS, скидки, бонусы). При необходимости модель улучшается добавлением новых переменных, настройкой гиперпараметров или заменой алгоритма — всё это делается в том же визуальном интерфейсе. Серверная версия SPSS Modeler обеспечивает командную работу и встраивание модели в продуктивные системы.
Таким образом, за минимальное число шагов построен полноценный предиктивный инструмент, способный приносить бизнесу измеримую пользу.
1. Прогнозирование оттока клиентов может быть выполнено полностью без написания кода, через графический интерфейс SPSS Modeler.
2. Импорт данных из Excel осуществляется простым выбором файла, без ручного программирования команд чтения.
3. Узел «Тип» автоматически определяет типы данных и позволяет задать роли: идентификатор, входные переменные и целевое поле.
4. Гистограмма распределения целевого признака быстро показывает соотношение ушедших и оставшихся клиентов (39% к 61%).
5. Алгоритм C&R Tree строит интерпретируемое дерево решений для бинарной классификации оттока.
6. Наиболее значимыми предикторами оказались наличие детей и возраст — демографические факторы критичны для оттока.
7. Глубина дерева (5 уровней) свидетельствует о компактности и предотвращении переобучения.
8. Модель добавляет к исходным данным столбцы с предсказанием и вероятностью, что позволяет оценивать риски по каждому клиенту.
9. Точность модели составила 83% (AUC 0.86), что подтверждает её практическую пригодность.
10. Для построения работающей модели потребовалось всего четыре функциональных узла: источник, тип, модель, анализ.
11. Важность предикторов визуализируется сразу после обучения, облегчая интерпретацию результатов бизнес-пользователями.
12. Быстродействие разработки, возможность кастомизации и командной работы делают SPSS Modeler мощным инструментом анализа данных.
1. Какую задачу решает представленная модель и какие значения принимает целевая переменная?
2. Какие роли переменных настраиваются в узле «Тип» и почему идентификатор клиента нельзя использовать как предиктор?
3. Чем отличается импорт данных в SPSS Modeler от написания кода в Python с использованием pandas?
4. Какой узел позволяет быстро увидеть распределение целевого класса до обучения модели?
5. Какова была доля клиентов, расторгнувших договор, согласно гистограмме?
6. Назовите два наиболее важных предиктора, выявленных моделью C&R Tree, и объясните их смысл.
7. Какая информация добавляется в таблицу после применения модели к исходным данным?
8. Какие метрики использовались для оценки качества модели и что показывает точность 83%?
9. Опишите последовательность узлов, минимально необходимую для построения и оценки прогнозной модели.
10. Как можно использовать полученные вероятности оттока в маркетинговых кампаниях?
11. Почему компактная глубина дерева считается преимуществом, а не недостатком?
12. Какие преимущества даёт визуальная сборка модели по сравнению с программированием с точки зрения бизнес-аналитика?