Глубинный анализ данных и текстов на базе IBM SPSS Modeler

Инструментальные средства предиктивной аналитики

Материал раскрывает иерархию понятий в сфере Data Science: от общего сбора данных до глубинного анализа (Data Mining). Показано, как эти уровни различаются по задачам — от оценки качества до автоматизированного поиска скрытых закономерностей и работы с неструктурированным текстом. Далее дается обзор рынка прогнозной аналитики и детально разбирается логика работы в IBM SPSS Modeler. Ключевая идея — повышение точности моделей достигается за счет синтеза классического Data Mining и Text Analytics, когда из текстов извлекаются новые признаки.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Объяснить различие между понятиями Data Science, Data Analysis, Data Analytics и Data Mining.
2. Классифицировать задачи и обязанности специалистов на каждом из уровней работы с данными.
3. Привести примеры практического применения прогностической аналитики в таких областях, как управление персоналом, маркетинг и оценка рисков.
4. Сравнить функциональные возможности коммерческих и open-source систем прогнозной аналитики.
5. Описать назначение и логику работы визуального интерфейса IBM SPSS Modeler.
6. Объяснить, каким образом интеграция модуля Text Analytics позволяет повысить точность прогнозных моделей.
Показывать лекцию целиком
Краткое изложение

Иерархия понятий в науке о данных

Мы переходим к обсуждению ключевых терминов, которые сегодня широко распространены и вызывают большой интерес у бизнеса при внедрении цифровой аналитики.

Big Data (Большие данные) — это термин, означающий работу с гигантскими и непрерывными потоками разнородной информации. Сложность заключается в том, что данные включают не только структурированную информацию (где каждая строка имеет строго описанные признаки), но и неструктурированную информацию произвольной природы: видео, аудиофайлы, тексты отзывов о компании или товаре.

Ранее мы детально обсуждали машинное обучение (Machine Learning) — набор алгоритмов для анализа этих данных. Сейчас важно рассмотреть четыре вложенных друг в друга понятия, описывающих сферы ответственности специалистов.

Data Science (Наука о данных)
Это внешний, самый общий уровень. Он подразумевает, что у нас есть данные, и мы занимаемся их сбором, подготовкой и анализом. На этом уровне часто работают руководители проектов, связанных с построением моделей. Они понимают суть процессов, но не занимаются программированием или созданием моделей напрямую.

Data Analysis (Анализ данных)
Более детальный уровень. Здесь речь идет уже о процессе оценки набора входных данных для определения необходимости их очистки. Аналитик оценивает качество данных и может использовать различные инструменты для получения желаемых результатов.

Data Analytics (Аналитика данных)
На этом уровне происходит автоматизация представления о наборе данных. Используются запросы, процедуры и агрегации, выявляются зависимости между входными переменными. Это этап обнаружения скрытых закономерностей.

Data Mining (Глубинный анализ данных)
Самый глубокий, вложенный уровень. Его задача — поиск совершенно скрытых закономерностей и генерация новой ценной информации на их основе. Здесь активно применяются технологии машинного обучения и искусственного интеллекта для анализа как структурированной, так и неструктурированной информации. Специалист этого уровня — это, по сути, программист, непосредственно разрабатывающий алгоритмы.

Таким образом, когда человек говорит, что занимается наукой о данных, важно уточнять, на каком именно уровне он работает.

Области применения прогностической аналитики

Прогностическая аналитика применима повсеместно. Среди наиболее популярных направлений можно выделить:
• Анализ клиентов: что покупают, почему покупают, как увеличить объемы продаж.
• Обнаружение и предотвращение мошенничества: фрод-анализ и анализ рисков.
• Оптимизация производственного процесса: например, составление расписания работы сотрудников для максимального выпуска продукции или снижение уровня брака.
• Анализ рисков (Hazard-анализ): прогнозирование сбоев бизнес-процессов, например, из-за отказа оборудования.
• Управление человеческими ресурсами (HR): выявление лучших сотрудников, их удержание и отбор кандидатов.

По сути, в любой аспект деятельности для повышения эффективности можно привнести прогностические модели.

Системы прогнозной аналитики

Рынок систем прогнозной аналитики представлен в основном продуктами крупных вендоров. Это связано со стандартами, принятыми в компаниях (корпоративные хранилища данных, контуры безопасности). Если вендор уже поставляет важные компоненты для бизнес-процессов, логично рассмотреть его решение и для прогнозной аналитики для обеспечения бесшовной интеграции.

Однако существуют и системы с открытым исходным кодом (open-source). Среди них:
• Orange (подмодуль в Python).
• KNIME (активно развивающаяся платформа).

Эти системы могут быть представлены как в виде standalone-приложений, так и в облачной реализации (например, продукты Amazon, Microsoft, Яндекс).

Коммерческие системы — это MatLab, IBM SPSS, SAP и другие. Выбор инструмента должен соответствовать требованиям компании.

IBM SPSS Modeler: назначение и интерфейс

Мы переходим к работе с конкретным ПО — IBM SPSS Modeler. Это высокопроизводительный инструмент для анализа данных и текста, оптимизированный для быстрой разработки моделей. Он используется для проактивного (упреждающего) поиска возможностей: получения дохода, снижения затрат, повышения производительности.

Ключевое преимущество Modeler — возможность анализировать данные и сразу же интегрировать результаты в бизнес-системы.

Интерфейс Modeler прост для понимания. В его основе лежит визуальное программирование:
• Центральный холст (canvas): сюда выносятся элементы — узлы (nodes).
• Узлы: выполняют различные операции. Узлы обработки данных обычно обозначаются синим цветом, а итоговые построенные модели отображаются в виде золотистых «бриллиантов».
• Связи: узлы связываются между собой, осуществляя транспортировку данных от одного этапа анализа к другому.

В Modeler доступно гигантское количество узлов, сгруппированных по вкладкам. Каждый узел выполняет свою функцию. После построения модели справа появляется панель для наблюдения за итоговыми моделями. Построенную модель можно выгрузить на сервер, чтобы другие пользователи могли прогонять через нее свои наборы данных для получения прогнозов.

Синтез Data Mining и Text Analytics

Эффективность IBM SPSS Modeler во многом обусловлена встроенным модулем Text Analytics. Он позволяет извлекать смыслы из текстов (например, из отзывов покупателей) и создавать на их основе новые признаки (features) для объекта анализа.

Анализ текста — это не отдельный процесс, а инструмент для уточнения основной модели. С помощью Text Analytics неструктурированные записи превращаются в структурированные и осмысленные данные.

Ключевая задача специалиста — синтезировать оба компонента:
1. Функционал Data Mining:
o Применяет передовые аналитические методы к структурированным данным.
o Выясняет ключевые связи между переменными и определяет их влияние на результат.
o Прогнозирует ключевые показатели и позволяет внедрять модели в бизнес-процессы.
2. Функционал Text Analytics:
o Извлекает и анализирует неструктурированную информацию.
o Интегрирует результаты анализа в операционную деятельность.
o Формирует набор дополнительных входных данных (новых признаков).

Синтез заключается в том, что результаты Text Analytics подаются на вход алгоритму Data Mining. Это позволяет значительно улучшить точность модели, например, подняв ее с 70% до 90%.

Краткие итоги

Современный подход к аналитике представляет собой структурированную иерархию, где фундаментальная наука о данных (Data Science) служит лишь точкой входа, за которой следуют более специализированные и практически ориентированные дисциплины. Принципиальное различие между ними заключается не в объекте исследования, а в целях и методах работы: от дескриптивной оценки качества (Data Analysis) система движется к автоматизированному выявлению неочевидных зависимостей (Data Analytics), достигая кульминации в создании алгоритмов, самостоятельно генерирующих новые ценные знания из неструктурированной среды (Data Mining). Это восхождение от наблюдения к созиданию информации определяет профиль компетенций специалистов — от менеджеров, управляющих процессами, до разработчиков, конструирующих самообучающиеся алгоритмы.

Практическая ценность этих технологий реализуется через прогностические модели, спектр применения которых универсален — от оптимизации производственных графиков до предиктивного удержания персонала. Выбор инструментальной среды для построения таких моделей находится в плоскости дилемы между глубокой бесшовной интеграцией коммерческих вендорских решений и гибкостью open-source платформ. Однако ключевой рывок в качестве прогнозирования обеспечивается не выбором конкретного инструмента, а методологическим сдвигом в работе с данными. Объединение классического Data Mining с Text Analytics кардинально меняет картину: текст перестает быть просто массивом слов, а превращается в источник новых структурированных признаков. Именно этот синтез позволяет преодолеть ограничения традиционных моделей, извлекающих закономерности лишь из «чистых» данных, и приблизить точность прогнозов к максимальным значениям за счет анализа всего объема информации, которым реально располагает бизнес.
Иерархия понятий в науке о данных

Термин Big Data (Большие данные) описывает работу с огромными, непрерывными потоками разнородной информации. Она включает структурированные данные (строго описанные признаки) и неструктурированные (видео, аудио, тексты).

Ранее мы обсуждали машинное обучение (Machine Learning). Теперь рассмотрим вложенные понятия, описывающие уровни работы с данными:
1. Data Science (Наука о данных)
Самый общий уровень: сбор, подготовка и анализ данных. Здесь часто работают менеджеры проектов, которые управляют процессами, но не программируют модели.
2. Data Analysis (Анализ данных)
Процесс оценки качества набора данных для определения необходимости их очистки и использования инструментов для получения результатов.
3. Data Analytics (Аналитика данных)
Автоматизация работы с данными через запросы и агрегации для выявления зависимостей и скрытых закономерностей.
4. Data Mining (Глубинный анализ данных)
Самый глубокий уровень. Поиск скрытых закономерностей и генерация новой ценной информации с помощью технологий ИИ. Здесь работают программисты, создающие алгоритмы.

Важно уточнять, на каком уровне работает специалист, называющий себя Data Scientist'ом.

Области применения и инструменты прогнозной аналитики

Прогностическая аналитика применима для проактивного (упреждающего) улучшения показателей в любой сфере:
• Анализ клиентов: причины покупок и увеличение продаж.
• Борьба с мошенничеством: фрод-анализ и анализ рисков.
• Оптимизация производства: снижение брака, прогнозирование сбоев оборудования (hazard-анализ).
• Управление персоналом (HR): выявление, удержание и отбор лучших сотрудников.

Системы аналитики делятся на коммерческие (MatLab, IBM SPSS, SAP) и open-source (Orange, KNIME). Коммерческие выбирают для бесшовной интеграции со стандартами компании.

IBM SPSS Modeler и синтез методов

IBM SPSS Modeler — это высокопроизводительный инструмент для проактивного анализа. Его ключевое преимущество — интеграция результатов анализа в бизнес-системы.

Интерфейс построен на визуальном программировании:
• Холст (Canvas): на него выносятся узлы (Nodes).
• Узлы: синие — для обработки, золотистые «бриллианты» — итоговые модели.
• Связи: транспортировка данных между узлами.

Ключевой компонент — встроенный модуль Text Analytics. Он извлекает смыслы из неструктурированных текстов (например, отзывов) и создает на их основе новые структурированные признаки (features).

Синтез Data Mining и Text Analytics:
• Data Mining выясняет ключевые связи и прогнозирует показатели.
• Text Analytics превращает тексты в новые признаки.

Главная задача — подать результаты Text Analytics на вход Data Mining. Это добавляет в модель новые факторы и кардинально повышает точность прогнозов (например, с 70% до 90%).

Выводы

1. Термин Big Data описывает работу с гигантскими, непрерывными потоками как структурированной, так и неструктурированной информации.
2. Data Science является самым общим понятием, охватывающим сбор и подготовку данных, в то время как Data Mining представляет собой наиболее глубокий уровень работы со скрытыми закономерностями.
3. Data Analysis фокусируется на процессе оценки качества набора входных данных и необходимости их очистки.
4. Data Analytics подразумевает автоматизацию поиска зависимостей и скрытых закономерностей с помощью запросов и агрегаций.
5. Специалист по Data Mining — это, как правило, разработчик, который применяет технологии ИИ для генерации новой ценной информации.
6. Прогностическая аналитика применима в HR, маркетинге, управлении рисками и других сферах для проактивного улучшения показателей.
7. При выборе системы прогнозной аналитики компании часто руководствуются принципом бесшовной интеграции с уже используемыми продуктами вендора.
8. В основе интерфейса IBM SPSS Modeler лежит холст, куда выносятся узлы, соединяемые в поток обработки данных.
9. Итоговая модель в SPSS Modeler визуализируется в виде узла-«бриллианта».
10. Модуль Text Analytics предназначен для извлечения смыслов из текста и формирования на их основе новых структурированных признаков.
11. Точность прогнозной модели значительно возрастает, когда результаты анализа текста подаются на вход алгоритмам Data Mining.
12. Главная задача аналитика — синтезировать функционал глубинного анализа данных и анализа текстов, а не использовать их изолированно.

Вопросы для самопроверки

1. В чем заключается принципиальная сложность работы с Big Data?
2. Как соотносятся между собой понятия Data Science и Data Analysis с точки зрения решаемых задач?
3. Чем функционал специалиста на уровне Data Analytics отличается от задач Data Analysis?
4. Почему Data Mining можно считать самым глубоким уровнем в иерархии науки о данных?
5. Какую роль играет Data Scientist в компаниях, если он не занимается непосредственным программированием моделей?
6. Какие задачи бизнеса решает прогностическая аналитика в области управления человеческими ресурсами?
7. Что такое «проактивный» подход к снижению затрат и как он связан с прогнозными моделями?
8. Почему при выборе коммерческого ПО для аналитики часто руководствуются стандартами интеграции, а не только функционалом?
9. Каким образом визуальный интерфейс IBM SPSS Modeler реализует логику обработки данных?
10. Для чего в IBM SPSS Modeler нужен модуль Text Analytics, если основной анализ уже выполнен?
11. Каким образом Text Analytics превращает неструктурированные тексты в полезную для модели информацию?
12. Как именно синтез Data Mining и Text Analytics позволяет повысить точность модели, например, с 70% до 90%?
Вернуться к учебному плану