Введение в OLAP и хранилища данных

OLAP и анализ данных. Часть 2

Раздел объясняет разработку данных (data mining) как процесс извлечения из больших баз данных достоверной, ранее неизвестной, полной и значимой информации для деловых решений. Логика: от невозможности человека вручную увидеть сложные закономерности — к машинному обучению (machine learning), его задачам и связи с хранилищем данных. Разбираются классификация, прогнозирование, кластеризация, анализ связей и аномалии, а также требования к данным, масштабируемости, визуализации и интеграции с ETL и OLAP-кубами.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Объяснять назначение разработки данных (data mining) и её связь с машинным обучением (machine learning).
2. Различать задачи прогнозного моделирования: классификацию и прогнозирование непрерывных значений.
3. Определять, когда применяются обучение с учителем (supervised learning) и обучение без учителя (unsupervised learning).
4. Приводить примеры кластеризации, анализа связей и обнаружения аномалий.
5. Формулировать требования к источнику данных для анализа: единство, отдельность, частота, интегрированность, непротиворечивость.
6. Объяснять, почему хранилище данных должно включать инструменты подготовки данных, выбора алгоритмов, масштабируемости и визуализации.
7. Оценивать практическую ценность интеграции ETL, хранения, OLAP-кубов и аналитики.
8. Применять базовые понятия разработки данных для постановки бизнес-задач.
Показывать лекцию целиком
Краткое изложение

Разработка данных (data mining)

1. Назначение и определение

Разработка данных (data mining) — это процесс извлечения из больших баз данных достоверной, ранее неизвестной, полной и значимой информации и использования её для принятия ответственных деловых решений. Задача — выявлять неочевидные тенденции и закономерности в гигантских объёмах данных.

Человек, даже видя отчёты и срезы, не может осознать сложные зависимости: объём слишком велик, а закономерности могут быть сколь угодно сложными. Поэтому нужен дополнительный инструмент — алгоритмы, которые находят зависимости.

2. Связь с машинным обучением

Процесс разработки данных связан с анализом данных и программными технологиями. Наука, которая описывает модели и алгоритмы для выявления зависимостей, — это машинное обучение (machine learning). Сами алгоритмы будут подробно изучаться в следующих курсах.

Сейчас важно понимать: есть математические и программные методы, которые позволяют находить в больших данных правила, закономерности и взаимосвязи. Задача хранилища — интегрировать эти алгоритмы, чтобы аналитик подавал на вход срез из OLAP-куба и получал найденные закономерности.

3. Задачи разработки данных

Основные задачи:

4. Обучение с учителем и без учителя

Обучение с учителем (supervised learning, контролируемое обучение) используется, когда есть выборка с известными правильными ответами. Модель учится на исторических данных, где для клиента уже известен результат (ушёл или не ушёл). Затем она получает новых клиентов и даёт прогноз с уровнем уверенности, например 90%. По прогнозу можно запускать таргетированную рекламу или рассылку.

Со временем предсказания становятся историей с известным ответом. Модель дообучается и становится точнее.

Обучение без учителя (unsupervised learning, неконтролируемое обучение) используется, когда правильных ответов заранее нет. Машина сама по сложным алгоритмам разбивает клиентов на группы по характеристикам. Аналитик затем интерпретирует смысл групп и решает, какие специальные предложения делать.

5. Требования к данным и инструментам

Одно из главных затруднений — поиск данных, подходящих для разработки. Общий поток данных может содержать мусор, который не помогает анализу. Нужно отделять ценные данные от неценных; этому посвящены отдельные разделы машинного обучения.

Источник данных должен быть:

Например, данные о транзакции месяц назад не должны завтра неожиданно измениться или появиться задним числом.

В архитектуре хранилища должны быть инструменты, поддерживающие анализ:

6. Интеграция с хранилищем данных

Разработка данных и хранилища дополняют друг друга, поэтому они должны быть интегрированы. Вендор хранилища обычно закладывает внутрь инструмента возможность применения алгоритмов data mining. Изолированное хранилище без анализа теряет смысл.

Крупные поставщики предлагают единый комплекс: ETL-процедуры (Extract, Transform, Load — извлечение, преобразование, загрузка), хранение в хранилище, построение схем (MOLAP, ROLAP, HOLAP), построение OLAP-куба, отчёты и анализ данных. Источником для анализа служит само хранилище или срезы и сечения OLAP-куба.

7. Итог теоретической части

Теоретические основы курса завершаются. Далее — практическая работа: построение кубов, иерархий, drill-down и агрегирование, системы ключевых показателей (KPI), интеллектуальный анализ данных и применение алгоритмов. Предстоит создавать хранилище и манипулировать им для создания куба и анализа.

Краткие итоги

Разработка данных — не отдельный технический приём, а продолжение логики хранилища: накопленные и очищенные данные превращаются в основание для решений. Ключевой переход — от отчётности к поиску неизвестных закономерностей. Центральная идея: человек не способен вручную удерживать и интерпретировать сложные зависимости в больших объёмах, поэтому нужны алгоритмы машинного обучения. Их ценность раскрывается не сама по себе, а в связке с хранилищем, OLAP-кубами и подготовкой данных.

Задачи анализа удобно рассматривать как разные типы бизнес-вопросов. Классификация отвечает на вопрос «к какой категории отнести?», регрессия — «какое числовое значение ожидать?», кластеризация — «какие устойчивые группы существуют?», анализ связей — «что встречается вместе?», обнаружение аномалий — «что выбивается из нормы?». Такое разделение помогает выбирать метод не по названию, а по характеру решения.

Отдельный смысловой узел — различие обучения с учителем и без учителя. При обучении с учителем есть исторические ответы, поэтому модель можно обучить и оценить вероятность. При обучении без учителя ответов нет, и модель сама выделяет структуру, которую затем должен осмыслить аналитик. Это различие определяет, какие данные нужны и как интерпретировать результат.

Практическая применимость зависит от качества источника. Мусор, противоречивость, неполнота или нестабильность данных разрушают анализ. Поэтому требования единства, частоты, интегрированности и непротиворечивости — не формальность, а условие доверия к выводам. Не менее важны масштабируемость, выбор алгоритма, подготовка данных и визуализация. Без визуализации результат остаётся набором чисел, который трудно использовать для управленческого решения.

Главный вывод: data mining встроен в единый комплекс от ETL до OLAP-анализа. Ценность появляется там, где алгоритмы работают на согласованных данных, а результаты встроены в бизнес-процесс: таргетированные предложения, управление оттоком, выявление мошенничества, прогнозирование показателей. Тогда аналитика становится не отчётностью, а механизмом конкурентного преимущества.

Разработка данных (data mining) — процесс извлечения из больших баз данных достоверной, ранее неизвестной, полной и значимой информации для принятия деловых решений. Задача — находить неочевидные тенденции и закономерности в огромных объёмах. Человек не может вручную осознать сложные зависимости, поэтому нужны алгоритмы машинного обучения (machine learning).

Машинное обучение даёт модели и методы, которые позволяют находить в данных правила и взаимосвязи. Хранилище данных должно интегрировать эти алгоритмы: аналитик подаёт срез из OLAP-куба и получает найденные закономерности.

Основные задачи:

Обучение с учителем (supervised learning) использует выборку с известными ответами. Модель учится на исторических данных, где для клиента уже известен результат, затем прогнозирует для новых клиентов с уровнем уверенности, например 90%. По прогнозу запускают таргетированную рекламу или рассылку. Со временем предсказания становятся историей с известным ответом; модель дообучается и становится точнее.

Обучение без учителя (unsupervised learning) не имеет готовых ответов. Машина сама по сложным алгоритмам разбивает клиентов на группы. Аналитик интерпретирует смысл групп и решает, какие действия применять.

Одно из главных затруднений — поиск подходящих данных. Поток данных может содержать мусор, из которого нельзя извлечь пользу. Источник данных должен быть единым, частым, интегрированным и непротиворечивым. Данные о прошлой транзакции не должны неожиданно меняться или появляться задним числом.

В архитектуре хранилища должны быть инструменты подготовки данных для разных видов анализа, выбора алгоритма, масштабируемости и визуализации. Масштабируемость важна, потому что реальные потоки крупных организаций огромны: от тысяч до миллионов и миллиардов операций. Скорость алгоритма не должна резко падать при росте объёма. Визуализация нужна, чтобы результаты анализа были понятны.

Разработка данных и хранилища дополняют друг друга. Крупные вендоры поставляют единый комплекс: ETL-процедуры (извлечение, преобразование, загрузка), хранение, построение схем MOLAP/ROLAP/HOLAP, OLAP-куб, отчёты и анализ. Источником для анализа служит хранилище или срезы и сечения OLAP-куба. Изолированное хранилище без анализа теряет смысл.

Далее — практика: построение кубов, иерархий, drill-down и агрегирование, системы KPI, интеллектуальный анализ данных и применение алгоритмов.

Выводы

1. Разработка данных извлекает из больших баз достоверную, ранее неизвестную, полную и значимую информацию для деловых решений.
2. Человек не может вручную осознать сложные закономерности в больших объёмах, поэтому нужны алгоритмы машинного обучения.
3. Классификация предсказывает категорию, например уход клиента или возврат кредита.
4. Прогнозирование непрерывного значения предсказывает числовую величину, например доход или объём продаж.
5. Кластеризация делит объекты на устойчивые группы без заранее известных ответов.
6. Анализ связей ищет ассоциативные правила, например совместные покупки товаров.
7. Обнаружение аномалий сначала определяет норму и тренд, затем выявляет отклонения и их причины.
8. Обучение с учителем использует исторические данные с известными ответами и даёт прогноз с уровнем уверенности.
9. Обучение без учителя не имеет готовых ответов и самостоятельно выделяет группы в данных.
10. Источник данных должен быть единым, частым, интегрированным и непротиворечивым.
11. Система анализа должна поддерживать подготовку данных, выбор алгоритмов, масштабируемость и визуализацию.
12. Хранилище и data mining должны быть интегрированы: ETL, хранение, OLAP-куб, отчёты и анализ работают как единый комплекс.

Вопросы для самопроверки

1. Что такое разработка данных (data mining) и какую информацию она должна извлекать?
2. Почему человеку сложно выявлять закономерности в больших данных без машинных методов?
3. Как машинное обучение связано с разработкой данных?
4. Чем классификация отличается от прогнозирования непрерывного значения?
5. Приведите пример задачи классификации в бизнесе.
6. Что такое кластеризация и в чём её практический смысл?
7. Как работают ассоциативные правила? Приведите пример продуктовой корзины.
8. Почему для обнаружения аномалий сначала нужно определить норму или ключевой тренд?
9. В чём различие обучения с учителем и обучения без учителя?
10. Какие требования предъявляются к источнику данных для анализа?
11. Зачем в системе анализа нужны масштабируемость и визуализация результатов?
12. Почему хранилище данных и инструменты data mining должны быть интегрированы?
Вернуться к учебному плану