Иерархия понятий в науке о данных
Мы переходим к обсуждению ключевых терминов, которые сегодня широко распространены и вызывают большой интерес у бизнеса при внедрении цифровой аналитики.
Big Data (Большие данные) — это термин, означающий работу с гигантскими и непрерывными потоками разнородной информации. Сложность заключается в том, что данные включают не только
структурированную информацию (где каждая строка имеет строго описанные признаки), но и
неструктурированную информацию произвольной природы: видео, аудиофайлы, тексты отзывов о компании или товаре.
Ранее мы детально обсуждали машинное
обучение (Machine Learning) — набор алгоритмов для анализа этих данных. Сейчас важно рассмотреть четыре вложенных друг в друга понятия, описывающих сферы ответственности специалистов.
Data Science (Наука о данных)
Это внешний, самый общий уровень. Он подразумевает, что у нас есть данные, и мы занимаемся их сбором, подготовкой и анализом. На этом уровне часто работают руководители проектов, связанных с построением моделей. Они понимают суть процессов, но не занимаются программированием или созданием моделей напрямую.
Data Analysis (Анализ данных)
Более детальный уровень. Здесь речь идет уже о процессе
оценки набора входных данных для определения необходимости их очистки. Аналитик оценивает качество данных и может использовать различные инструменты для получения желаемых результатов.
Data Analytics (Аналитика данных)
На этом уровне происходит
автоматизация представления о наборе данных. Используются запросы, процедуры и агрегации, выявляются зависимости между входными переменными. Это этап обнаружения скрытых закономерностей.
Data Mining (Глубинный анализ данных)
Самый глубокий, вложенный уровень. Его задача — поиск совершенно скрытых закономерностей и
генерация новой ценной информации на их основе. Здесь активно применяются технологии машинного обучения и искусственного интеллекта для анализа как структурированной, так и неструктурированной информации. Специалист этого уровня — это, по сути, программист, непосредственно разрабатывающий алгоритмы.
Таким образом, когда человек говорит, что занимается наукой о данных, важно уточнять, на каком именно уровне он работает.
Области применения прогностической аналитики
Прогностическая аналитика применима повсеместно. Среди наиболее популярных направлений можно выделить:
• Анализ клиентов: что покупают, почему покупают, как увеличить объемы продаж.
• Обнаружение и предотвращение мошенничества: фрод-анализ и анализ рисков.
• Оптимизация производственного процесса: например, составление расписания работы сотрудников для максимального выпуска продукции или снижение уровня брака.
• Анализ рисков (Hazard-анализ): прогнозирование сбоев бизнес-процессов, например, из-за отказа оборудования.
• Управление человеческими ресурсами (HR): выявление лучших сотрудников, их удержание и отбор кандидатов.
По сути, в любой аспект деятельности для повышения эффективности можно привнести прогностические модели.
Системы прогнозной аналитики
Рынок систем прогнозной аналитики представлен в основном продуктами крупных вендоров. Это связано со стандартами, принятыми в компаниях (корпоративные хранилища данных, контуры безопасности). Если вендор уже поставляет важные компоненты для бизнес-процессов, логично рассмотреть его решение и для прогнозной аналитики для обеспечения бесшовной интеграции.
Однако существуют и системы с открытым исходным кодом (open-source). Среди них:
• Orange (подмодуль в Python).
• KNIME (активно развивающаяся платформа).
Эти системы могут быть представлены как в виде standalone-приложений, так и в облачной реализации (например, продукты Amazon, Microsoft, Яндекс).
Коммерческие системы — это MatLab, IBM SPSS, SAP и другие. Выбор инструмента должен соответствовать требованиям компании.
IBM SPSS Modeler: назначение и интерфейс
Мы переходим к работе с конкретным ПО —
IBM SPSS Modeler. Это высокопроизводительный инструмент для анализа данных и текста, оптимизированный для быстрой разработки моделей. Он используется для
проактивного (упреждающего) поиска возможностей: получения дохода, снижения затрат, повышения производительности.
Ключевое преимущество Modeler — возможность анализировать данные и сразу же интегрировать результаты в бизнес-системы.
Интерфейс Modeler прост для понимания. В его основе лежит визуальное программирование:
• Центральный холст (canvas): сюда выносятся элементы —
узлы (nodes).
• Узлы: выполняют различные операции. Узлы обработки данных обычно обозначаются синим цветом, а итоговые построенные модели отображаются в виде золотистых
«бриллиантов».
• Связи: узлы связываются между собой, осуществляя транспортировку данных от одного этапа анализа к другому.
В Modeler доступно гигантское количество узлов, сгруппированных по вкладкам. Каждый узел выполняет свою функцию. После построения модели справа появляется панель для наблюдения за итоговыми моделями. Построенную модель можно выгрузить на сервер, чтобы другие пользователи могли прогонять через нее свои наборы данных для получения прогнозов.
Синтез Data Mining и Text Analytics
Эффективность IBM SPSS Modeler во многом обусловлена встроенным модулем
Text Analytics. Он позволяет извлекать смыслы из текстов (например, из отзывов покупателей) и создавать на их основе новые
признаки (features) для объекта анализа.
Анализ текста — это не отдельный процесс, а инструмент для уточнения основной модели. С помощью Text Analytics неструктурированные записи превращаются в структурированные и осмысленные данные.
Ключевая задача специалиста —
синтезировать оба компонента:
1.
Функционал Data Mining:
o Применяет передовые аналитические методы к структурированным данным.
o Выясняет ключевые связи между переменными и определяет их влияние на результат.
o Прогнозирует ключевые показатели и позволяет внедрять модели в бизнес-процессы.
2.
Функционал Text Analytics:
o Извлекает и анализирует неструктурированную информацию.
o Интегрирует результаты анализа в операционную деятельность.
o Формирует набор дополнительных входных данных (новых признаков).
Синтез заключается в том, что результаты Text Analytics подаются на вход алгоритму Data Mining. Это позволяет значительно улучшить точность модели, например, подняв ее с 70% до 90%.
Краткие итоги
Современный подход к аналитике представляет собой структурированную иерархию, где фундаментальная наука о данных (Data Science) служит лишь точкой входа, за которой следуют более специализированные и практически ориентированные дисциплины. Принципиальное различие между ними заключается не в объекте исследования, а в целях и методах работы: от дескриптивной оценки качества (Data Analysis) система движется к автоматизированному выявлению неочевидных зависимостей (Data Analytics), достигая кульминации в создании алгоритмов, самостоятельно генерирующих новые ценные знания из неструктурированной среды (Data Mining). Это восхождение от наблюдения к созиданию информации определяет профиль компетенций специалистов — от менеджеров, управляющих процессами, до разработчиков, конструирующих самообучающиеся алгоритмы.
Практическая ценность этих технологий реализуется через прогностические модели, спектр применения которых универсален — от оптимизации производственных графиков до предиктивного удержания персонала. Выбор инструментальной среды для построения таких моделей находится в плоскости дилемы между глубокой бесшовной интеграцией коммерческих вендорских решений и гибкостью open-source платформ. Однако ключевой рывок в качестве прогнозирования обеспечивается не выбором конкретного инструмента, а методологическим сдвигом в работе с данными. Объединение классического Data Mining с Text Analytics кардинально меняет картину: текст перестает быть просто массивом слов, а превращается в источник новых структурированных признаков. Именно этот синтез позволяет преодолеть ограничения традиционных моделей, извлекающих закономерности лишь из «чистых» данных, и приблизить точность прогнозов к максимальным значениям за счет анализа всего объема информации, которым реально располагает бизнес.
1. Термин Big Data описывает работу с гигантскими, непрерывными потоками как структурированной, так и неструктурированной информации.
2. Data Science является самым общим понятием, охватывающим сбор и подготовку данных, в то время как Data Mining представляет собой наиболее глубокий уровень работы со скрытыми закономерностями.
3. Data Analysis фокусируется на процессе оценки качества набора входных данных и необходимости их очистки.
4. Data Analytics подразумевает автоматизацию поиска зависимостей и скрытых закономерностей с помощью запросов и агрегаций.
5. Специалист по Data Mining — это, как правило, разработчик, который применяет технологии ИИ для генерации новой ценной информации.
6. Прогностическая аналитика применима в HR, маркетинге, управлении рисками и других сферах для проактивного улучшения показателей.
7. При выборе системы прогнозной аналитики компании часто руководствуются принципом бесшовной интеграции с уже используемыми продуктами вендора.
8. В основе интерфейса IBM SPSS Modeler лежит холст, куда выносятся узлы, соединяемые в поток обработки данных.
9. Итоговая модель в SPSS Modeler визуализируется в виде узла-«бриллианта».
10. Модуль Text Analytics предназначен для извлечения смыслов из текста и формирования на их основе новых структурированных признаков.
11. Точность прогнозной модели значительно возрастает, когда результаты анализа текста подаются на вход алгоритмам Data Mining.
12. Главная задача аналитика — синтезировать функционал глубинного анализа данных и анализа текстов, а не использовать их изолированно.
1. В чем заключается принципиальная сложность работы с Big Data?
2. Как соотносятся между собой понятия Data Science и Data Analysis с точки зрения решаемых задач?
3. Чем функционал специалиста на уровне Data Analytics отличается от задач Data Analysis?
4. Почему Data Mining можно считать самым глубоким уровнем в иерархии науки о данных?
5. Какую роль играет Data Scientist в компаниях, если он не занимается непосредственным программированием моделей?
6. Какие задачи бизнеса решает прогностическая аналитика в области управления человеческими ресурсами?
7. Что такое «проактивный» подход к снижению затрат и как он связан с прогнозными моделями?
8. Почему при выборе коммерческого ПО для аналитики часто руководствуются стандартами интеграции, а не только функционалом?
9. Каким образом визуальный интерфейс IBM SPSS Modeler реализует логику обработки данных?
10. Для чего в IBM SPSS Modeler нужен модуль Text Analytics, если основной анализ уже выполнен?
11. Каким образом Text Analytics превращает неструктурированные тексты в полезную для модели информацию?
12. Как именно синтез Data Mining и Text Analytics позволяет повысить точность модели, например, с 70% до 90%?