Корпоративные информационные системы

Хранилище данных

Материал раскрывает эволюцию подходов к построению аналитических систем — от классического хранилища данных по методологии Кимболла до современных децентрализованных платформ. Сначала объясняется, чем хранилище отличается от обычных баз данных и какую роль играет многомерная OLAP-модель в быстром формировании отчётов. Затем подробно разбирается архитектура Kimball: источники, область очистки (Staging Area), витрины данных (Data Marts) и центральное хранилище. На основе её ограничений показывается переход к идее «озера данных» (Data Lake) и аналитическим платформам, где бизнес-пользователь сам управляет загрузкой и исследованием данных без жёсткой предварительной структуризации.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Объяснить принципиальное различие между хранилищем данных и операционными базами данных.
2. Сформулировать цель хранилища данных в контексте поддержки принятия управленческих решений.
3. Описать ключевые компоненты классической модели Кимболла (Kimball) и их взаимодействие.
4. Охарактеризовать особенности OLAP-кубов и их преимущества при построении отчётов любого объёма.
5. Выделить ограничения централизованного подхода, породившие концепцию Data Lake.
6. Сравнить управляемый процесс очистки данных с принципом самостоятельной загрузки любых данных бизнес-пользователями.
7. Обосновать причины популярности аналитических платформ класса Data Discovery.
8. Оценить, в каких ситуациях допустимо отказаться от полноценного хранилища данных в пользу децентрализованных инструментов.
Показывать лекцию целиком
Краткое изложение

Что такое хранилище данных

Хранилище данных (Data Warehouse) — это не база данных и не их совокупность. Это сложный программно-аппаратный комплекс или архитектура, которая включает программные и аппаратные компоненты и служит исключительно для работы с данными.

Повышая качество мастер-данных (Master Data), мы обеспечиваем единое информационное пространство организации, устраняем противоречия в данных разных приложений и поддерживаем корректные текущие операции. Цель хранилища данных иная. Она не в том, чтобы улучшать существующие данные, а в том, чтобы из огромного массива разнокачественных данных отобрать достоверные, актуальные, согласованные и целостные сведения исключительно для принятия управленческих решений. Иными словами — для использования в корпоративной отчётности.

Вместо бумажных отчётов и сложных запросов к таблицам применяется многомерный куб. Его основу составляет модель OLAP (Online Analytical Processing), в частности соответствующая правилам Кодда. Преимущество OLAP-модели в том, что объём и сложность отчёта практически не влияют на производительность: отчёт из 20 чисел и отчёт из 20 000 чисел строится мгновенно. Это обеспечено технической реализацией многомерного куба, однако отдельные данные внутри куба изменить почти невозможно.

Классическая модель Кимболла

Модель хранилища данных, предложенная Кимболлом (Kimball), описывает последовательную обработку данных.

Источники данных (Operational Source Systems) — операционные системы слева на схеме. Из них извлекаются данные, на основе которых строятся показатели, вплоть до показателей системы сбалансированных показателей (BSC).
Область подготовки данных (Data Staging Area) — промежуточная область, где данные очищаются. Выполняются операции: очистка (cleanse), комбинирование (combine), стандартизация (standardize), то есть приведение к единому формату, проверка на непротиворечивость, содержательный контроль (возможно, с участием людей). Заведомо ложные данные не допускаются к дальнейшей обработке.
Витрины данных (Data Marts) или промежуточная реляционная база — после очистки данные загружаются в многомерные кубы (OLAP-кубы), именуемые Data Mart №1, Data Mart №2 и так далее, либо сначала попадают в реляционную базу, где хранятся постоянно и откуда по запросам поступают в кубы.
• Справа находятся инструменты доступа и анализа данных, работающие с этими кубами.

Характерное свойство модели: данные, попавшие в витрины или промежуточную базу, никогда не удаляются, они только накапливаются. При нынешних ценах на устройства хранения сохранение всех необходимых для стратегических показателей данных не представляет проблемы.

Эволюция модели: новые компоненты

Позднее модель усложнилась, сохранив основную идею. Появились:
Большие данные (Big Data) как источники.
• Постоянная область детальных данных — центральное хранилище (Central Warehouse), куда данные поступают после очистки и хранятся постоянно.
Зависимые хранилища данных (Dependent Data Stores) — витрины, которые могут быть как многомерными кубами, так и небольшими хранилищами со своими кубами.
• Внизу схемы отдельно выделены мастер-данные.

Это более разветвлённая, но концептуально близкая к исходной идея.

Ограничения и появление Data Lake

Архитектура централизованного хранилища довольно негибкая. Трудно заранее определить, какие именно данные понадобятся руководителям через год или три для принятия стратегических решений. Состав данных и измерений плохо поддаётся быстрым изменениям.

Альтернативный подход предлагает не прогнозировать нужный набор данных, а дать бизнес-пользователям возможность самостоятельно загружать любые данные без обязательной очистки. Такую загрузку называют Ingest (заглатывание). Данные помещаются не в Warehouse, а в озеро данных (Data Lake), где могут находиться и хорошие, и плохие, и полезные, и бесполезные сведения. Пользователи могут агрегировать и исследовать их любыми способами — с помощью кубов, статистических методов, визуализации. Принимаемые решения остаются на их ответственности.

Эта парадоксальная на первый взгляд идея, означающая отказ от обязательной очистки, структурирования и выверенных измерений, получила широкое распространение.

Аналитические платформы и Data Discovery

Системы такого класса стали называться аналитическими платформами. Появились отчёты и обзоры Gartner, требования к ним. Ключевое требование — управляемый бизнес-пользователем отбор, перемешивание и моделирование данных. Пользователь берёт то, что считает нужным, объединяет и анализирует, как считает правильным.

Это не означает, что хранилище данных полностью теряет актуальность. Во многих компаниях можно обойтись аналитической платформой, и решения, принимаемые бизнес-пользователями, будут вполне качественными. Одним из лидеров этого направления (по отчёту Gartner за 2015 год) была компания Tableau, реализующая подобный подход к обработке данных.

Выводы

• Идея централизованного стратегического управления исключительно на основе сбалансированной системы показателей не является бесспорной.
• Корпоративные BI-системы (Business Intelligence) на базе хранилищ данных распространены не очень широко и не всегда популярны, несмотря на усилия вендоров.
• Полная архитектура хранилища данных реализуется редко.
• Конкурентом централизованного хранилища становится децентрализованная обработка данных на платформе Data Discovery.

Краткие итоги

Исходной точкой анализа служит фундаментальное разделение между операционной обработкой данных и аналитической поддержкой решений. Если мастер-данные и транзакционные системы обслуживают текущую деятельность, то хранилище данных целенаправленно собирает проверенные сведения для формирования корпоративной отчётности и стратегических показателей. Центральным звеном здесь выступает многомерная OLAP-модель, обеспечивающая одинаково высокую скорость построения отчётов любого объёма, но жёстко фиксирующая структуру данных.

Классическая архитектура Кимболла закладывает эталонный конвейер: извлечение из операционных источников, очистка и стандартизация в промежуточной области (Staging), загрузка в витрины данных (Data Marts) или центральное хранилище (Central Warehouse) с последующей аналитикой через многомерные кубы. Принципиальной характеристикой является накопительный характер — данные не удаляются, и это экономически оправдано. Однако у такого подхода обнаруживается серьёзное ограничение: он требует заранее спроектированных измерений и показателей, что входит в противоречие с реальной управленческой практикой, где потребности в данных могут быстро меняться и не поддаются точному прогнозированию.

Реакцией на эту негибкость становится концепция Data Lake и аналитических платформ класса Data Discovery. В ней акцент смещается с корпоративного контроля на свободу бизнес-пользователя: любые данные (вплоть до «мусорных») загружаются в озеро данных без предварительной очистки, а весь цикл отбора, смешивания и моделирования передаётся в руки принимающего решения специалиста. Такой подход не исключает классическое хранилище, но демонстрирует, что во многих ситуациях допустима децентрализованная аналитика без жёсткого единого семантического слоя.

Практический смысл этого противостояния — в осознанном выборе между управляемостью и гибкостью. Там, где критичны согласованность показателей и юридическая достоверность отчётности, сохраняет ценность строгая архитектура с очисткой и единой версией правды. Там же, где важнее скорость получения инсайтов, возможность проверять гипотезы на разнородных данных и адаптироваться к изменчивым условиям, платформы Data Discovery оказываются более адекватным инструментом. Понимание обеих моделей позволяет выстроить гибридные решения, в которых озеро данных питает как формализованные витрины, так и среду самостоятельной аналитики.
Хранилище данных (Data Warehouse) — сложный программно-аппаратный комплекс, не эквивалентный базам данных. Его цель — не повышение качества текущих данных (это задача управления мастер-данными), а отбор достоверных, согласованных и целостных сведений для принятия управленческих решений и корпоративной отчётности.

Основным инструментом отчётности выступает многомерный куб, построенный по модели OLAP (Online Analytical Processing), в том числе соответствующей правилам Кодда. Преимущество OLAP — скорость построения отчёта не зависит от его объёма: 20 или 20 000 значений выводятся мгновенно. Недостаток — гибкость изменения отдельных данных внутри куба крайне ограничена.

Классическая модель Кимболла (Kimball) описывает цепочку обработки:
Источники (Operational Source Systems) — операционные системы, откуда извлекаются данные для показателей.
Область подготовки (Data Staging Area) — промежуточная среда, где выполняются очистка (cleanse), стандартизация (standardize) и комбинирование (combine). Данные приводятся к единому формату, проверяются на непротиворечивость и содержательность, в том числе с участием человека. Заведомо ложные данные отсеиваются.
Витрины данных (Data Marts) — многомерные OLAP-кубы, куда загружаются очищенные данные, либо промежуточная реляционная база, хранящая детальные данные постоянно и подающая их в кубы по запросам.
• Справа — инструменты доступа и анализа, работающие с кубами.

Характерное свойство: данные в витринах и промежуточной базе никогда не удаляются, только накапливаются. При современных ценах на диски хранение всех нужных для стратегических показателей данных не является проблемой.

Со временем модель усложнилась, оставаясь концептуально близкой: появились большие данные (Big Data), центральное хранилище детальных данных (Central Warehouse), зависимые витрины (Dependent Data Stores) и блок мастер-данных.

Главное ограничение архитектуры — негибкость. Сложно заранее определить, какие данные потребуются руководителям через несколько лет. Быстро изменить состав данных и измерений в Central Warehouse почти невозможно.

Ответом стала концепция озера данных (Data Lake). Вместо прогнозирования нужных данных предлагается дать бизнес-пользователю возможность самостоятельно загружать любые данные без очистки — Ingest («заглатывание»). Данные попадают в озеро, где могут находиться и качественные, и «мусорные» сведения. Пользователь сам агрегирует и исследует их с помощью кубов, статистических методов, визуализации, принимая решения на свой страх и риск.

Такие системы получили название аналитических платформ или Data Discovery. Ключевое требование Gartner к ним — управляемый пользователем отбор, смешивание и моделирование данных. Лидером этого направления (отчёт 2015 года) была компания Tableau.

Это не означает полного отказа от хранилищ данных. Во многих случаях компания может обойтись аналитической платформой, получая приемлемые решения. Однако корпоративные BI-системы (Business Intelligence) на базе полноценного хранилища реализуются редко и не очень популярны. Децентрализованная обработка данных на платформах Data Discovery становится серьёзным конкурентом централизованному подходу.

Выводы

1. Хранилище данных — сложный программно-аппаратный комплекс, принципиально отличный от операционных баз данных.
2. Цель хранилища — отбор достоверных и согласованных данных исключительно для принятия управленческих решений и построения отчётности.
3. Многомерная OLAP-модель обеспечивает мгновенное построение отчётов любого объёма за счёт фиксированной структуры куба.
4. Модель Кимболла включает источники, область очистки (Staging Area), витрины данных (Data Marts) и инструменты анализа.
5. В классической архитектуре данные проходят обязательную очистку, стандартизацию и проверку, в том числе с участием людей.
6. Очищенные данные накапливаются в витринах или центральном хранилище и никогда не удаляются.
7. Жёсткость модели Кимболла ограничивает возможность быстро менять состав данных и измерений под новые управленческие запросы.
8. Концепция Data Lake допускает загрузку любых данных без предварительной очистки и структурирования.
9. В Data Lake бизнес-пользователи самостоятельно агрегируют и исследуют данные с помощью кубов, статистики и визуализации.
10. Аналитические платформы Data Discovery переносят ответственность за отбор и моделирование данных на самого пользователя.
11. Централизованные BI-системы на базе хранилищ реализуются в полном объёме редко, несмотря на усилия вендоров.
12. Децентрализованная аналитика с аналитическими платформами становится реальным конкурентом классическому хранилищу данных.

Вопросы для самопроверки

1. Чем хранилище данных отличается от совокупности операционных баз данных?
2. Почему повышение качества мастер-данных не является целью хранилища данных?
3. Какие преимущества даёт многомерный куб OLAP при построении отчётов?
4. Какова роль области подготовки данных (Data Staging Area) в модели Кимболла?
5. Какие операции выполняются над данными в Staging Area?
6. Почему в классическом хранилище данные никогда не удаляются?
7. В чём состоит главное ограничение централизованной архитектуры хранилища данных?
8. Чем концепция Data Lake принципиально отличается от подхода Кимболла?
9. Что означает термин «Ingest» в контексте работы с озером данных?
10. Какое ключевое требование предъявляют аналитические платформы к работе бизнес-пользователя с данными?
11. Означает ли популярность Data Lake полный отказ от хранилищ данных?
12. В каких ситуациях децентрализованная аналитика может быть предпочтительнее классического хранилища?
Вернуться к учебному плану