Три основные техники анализа данных
Мы переходим к техникам анализа данных. Три основные техники, реализуемые алгоритмами машинного обучения, — это
классификация, сегментация и поиск ассоциативных правил (association rules).
Классификация
Классификация (classification) — это прогноз принадлежности объекта к определённой группе или категории. Примеры: предсказание, уйдёт клиент или останется; зарабатывает ли человек больше или меньше 50 000 в год. Количество классов не ограничено двумя — возможна мультиклассовая классификация на 3, 5, 16 и более категорий.
При помощи алгоритмов классификации можно предсказывать и непрерывные значения. В таких случаях обычно предсказывается не само значение, а интервал, в который оно должно попасть.
Типичные алгоритмы, применяемые в задачах классификации:
• решающие деревья;
• логистическая регрессия;
• метод опорных векторов (SVM);
• модели временных рядов.
Классификация — одна из самых востребованных техник анализа.
Сегментация
Сегментация (segmentation) используется для разделения объектов на устойчивые группы на основе их признаков (фич). В этой задаче нет целевой переменной и «правильного ответа» — все выводы делаются исключительно из структуры исходных данных. Такой подход относится к обучению без учителя.
Другое применение сегментации — обнаружение нестандартного поведения. В этом случае задача сводится к отделению «хороших» данных, которым можно доверять, от «плохих», вероятно содержащих ошибки или аномалии.
Алгоритмов сегментации очень много. Среди них:
• автокластеризация;
•
k-means (метод k-средних);
• методы обнаружения аномалий.
Ассоциативные правила
Поиск ассоциативных правил (association rule mining) — это техника выявления событий, которые происходят совместно или последовательно. Классический пример — анализ продуктовой корзины: покупатели, взявшие товары A и B, часто берут и товар C; или те, кто купил D, никогда не покупают E. Однако сфера применения правил шире ритейла.
Основные алгоритмы построения ассоциативных правил:
• Apriori (априори);
• CARMA;
•
Sequence (поиск последовательных шаблонов).
План дальнейших практических кейсов
Ранее в курсе уже была рассмотрена классификация с использованием алгоритма решающего дерева CHAID в SPSS Modeler. Теперь будут разобраны ещё две техники — сегментация и ассоциативные правила. Кроме того, заключительный кейс объединит классификацию и анализ текстов. Задача анализа текстов — извлечь из неструктурированной текстовой информации дополнительные факторы, которые при добавлении в модель позволяют повысить её точность. Начнём с ассоциативных правил.
Краткие итоги
В основе любого проекта по интеллектуальному анализу данных лежит выбор подходящей техники, который определяется характером решаемой бизнес-задачи и доступными данными. Три рассмотренные техники покрывают широкий спектр аналитических сценариев и формируют своеобразный каркас, позволяющий аналитику быстро идентифицировать требуемый подход.
Классификация ориентирована на ситуации, где уже накоплена история с известными исходами и требуется предсказать категорию или диапазон для новых объектов. Это мощный инструмент поддержки принятия решений в маркетинге, кредитном скоринге, диагностике. Сегментация, напротив, не требует размеченных данных и позволяет выявить естественную структуру совокупности — будь то типологические группы клиентов или аномальные наблюдения, требующие проверки. Способность техники решать одновременно и задачу кластеризации, и задачу изоляции выбросов делает её незаменимой на этапе разведочного анализа и очистки данных. Ассоциативные правила раскрывают совместные закономерности, которые помогают строить рекомендательные системы, оптимизировать выкладку товаров или выявлять сценарии последовательных действий пользователей.
Практическая ценность освоения перечисленных методов возрастает при их комбинировании. Расширение классификационной модели за счёт факторов, извлечённых из неструктурированных текстов, — пример гибридизации, позволяющей получить более точные прогнозы за счёт использования ранее не задействованной информации. Таким образом, выбор техники — не жёсткий детерминированный шаг, а гибкое решение, которое может предусматривать объединение нескольких подходов для максимального извлечения ценности из данных. Понимание сильных сторон и ограничений каждой из трёх техник даёт фундамент для построения таких комбинированных решений.
В анализе данных с применением машинного обучения выделяют три основные техники.
Классификация предсказывает принадлежность объекта к категории. Количество классов может быть любым: от двух (бинарная) до множества (мультиклассовая). Если отклик непрерывный, классификация предсказывает не точное значение, а интервал. Используемые алгоритмы: решающие деревья, логистическая регрессия, метод опорных векторов, временные ряды.
Сегментация разделяет объекты на устойчивые группы исключительно на основе их признаков, без целевой переменной и «правильных ответов» (обучение без учителя). Эта же техника применяется для обнаружения аномалий — отделения нетипичных, возможно ошибочных данных. Алгоритмы: автокластеризация, k-means (метод k-средних), методы поиска аномалий.
Ассоциативные правила выявляют события, происходящие совместно или последовательно. Классический пример — анализ продуктовой корзины (покупатели A и B часто берут C; купившие D не берут E). Сфера применения не ограничивается ритейлом. Основные алгоритмы: Apriori, CARMA, Sequence.
Далее в курсе будут разобраны сегментация и ассоциативные правила, а заключительный кейс объединит классификацию с анализом текстов для извлечения дополнительных факторов и повышения точности модели.
1. Классификация предсказывает принадлежность объекта к одной из заранее заданных категорий.
2. Мультиклассовая классификация позволяет работать с произвольным количеством классов.
3. Непрерывный отклик в рамках классификации прогнозируется как интервал значений.
4. Сегментация разбивает объекты на устойчивые группы без использования целевой переменной.
5. Техника сегментации применяется и для выявления аномальных, потенциально ошибочных данных.
6. Ключевое различие: классификация требует размеченных данных, сегментация — нет.
7. Ассоциативные правила обнаруживают события, происходящие совместно или последовательно.
8. Анализ продуктовой корзины — классический, но не единственный пример использования ассоциативных правил.
9. Apriori, CARMA и Sequence входят в число основных алгоритмов построения ассоциативных правил.
10. Анализ текстов позволяет получить дополнительные факторы для повышения точности классификационных моделей.
11. Изучение техник построено на последовательном разборе практических кейсов в SPSS Modeler.
12. Комбинация классификации с анализом текстов демонстрирует гибридный подход к улучшению моделей.
1. Какие три основные техники анализа данных реализуются алгоритмами машинного обучения?
2. Чем отличается задача классификации от задачи сегментации с точки зрения наличия целевой переменной?
3. Приведите примеры практических задач, решаемых с помощью классификации.
4. В каком виде алгоритмы классификации могут предсказывать непрерывные величины?
5. Какие алгоритмы наиболее часто используются для решения задач классификации?
6. Для каких двух целей применяется сегментация?
7. Почему сегментацию относят к методам обучения без учителя?
8. Какие алгоритмы упоминаются в контексте сегментации и обнаружения аномалий?
9. Что представляют собой ассоциативные правила и какова их типичная сфера применения?
10. Какие три алгоритма используются для построения ассоциативных правил?
11. Каким образом анализ текстов может способствовать повышению точности классификационной модели?
12. В какой последовательности будут разбираться практические кейсы по техникам анализа данных?