Презентацию к лекции 4 Вы можете скачать здесь.
Процесс анализа больших данных и стандарт CRISP‑DM
Процесс анализа больших данных пока не имеет устоявшихся промышленных стандартов. Поэтому на практике часто опираются на методологию CRISP‑DM (Cross‑Industry Standard Process for Data Mining) — межотраслевой стандарт процесса интеллектуального анализа данных.
Большие данные накладывают серьезные ограничения на работу с информацией. Первое ограничение связано с невозможностью простого переноса данных с одного места на другое. Объемы в терабайты или петабайты, как правило, хранятся в облаке, и это требует пересмотра подхода к процессам ETL (Extract, Transform, Load) — извлечения, трансформации и загрузки данных.
Из этого следуют два технических требования:
- Необходимость средств предварительной обработки информации на местах её хранения.
- Возможность запуска алгоритмов непосредственно там, где данные находятся, чтобы отобрать нужную информацию и передать по сети лишь результирующий, меньший объем в аналитическую систему.
Таким образом, архитектура решения разделяется на две компоненты: место хранения с вычислительными мощностями для предобработки и аналитический контур для углубленного анализа и визуализации. Некоторые системы, например, Oracle Exalytics, позволяют анализировать большие данные в оперативной памяти компьютера, объединяя эти функции.
Сам процесс аналитики по CRISP‑DM состоит из нескольких итеративных этапов.
- Понимание бизнеса (Business Understanding). На этом этапе аналитик выясняет, какие задачи стоят перед бизнесом и существует ли вообще проблема, требующая анализа больших данных.
- Понимание данных (Data Understanding). Здесь оценивается, достаточно ли имеющихся данных для решения поставленных задач. Важна обратная связь: понимание данных может уточнить постановку бизнес‑задачи, и наоборот. Если данных недостаточно, может потребоваться отдельный этап их сбора.
- Подготовка данных (Data Preparation). Этот этап включает отсев данных, оценку их достоверности, устранение выбросов и интеграцию дополнительных источников для подготовки к моделированию.
- Моделирование (Modeling). На этом этапе происходит проверка гипотез. Например, гипотеза может заключаться в том, содержит ли видеофайл изображение автомобиля с определённым номером. Это итеративный процесс с обратной связью к этапу подготовки данных.
- Оценка (Evaluation). В оценке результатов участвует заказчик. Он определяет, получен ли желаемый результат и представляют ли данные ценность для бизнеса.
- Внедрение (Deployment). Финальный этап, на котором созданное решение встраивается в бизнес‑процессы заказчика, если это требуется. Например, система видеоаналитики в метро может автоматически отправлять оповещения службе безопасности.
Принципы аналитики больших данных
В работе с большими данными сложно опираться только на традиционные схемы принятия решений, поэтому на первый план выходят статистические принципы.
- Формулирование и проверка гипотез. В отличие от интуитивного подхода, каждое предположение о бизнесе или данных должно быть формализовано и статистически подтверждено на данных. Если гипотеза верна для 98% клиентов, она считается рабочей, несмотря на отдельные исключения.
- Численные критерии качества. Поскольку работа ведется с большими объемами данных, необходимо уметь переводить бизнес‑запрос в измеримые, численные показатели, которых нужно достичь.
- Эффективность времени и качества. При постоянном потоке данных (например, один терабайт в день) необходимо успевать обрабатывать их в рамках цикла. Это требует баланса: для части данных могут использоваться более простые, но быстрые методы, а для другой части — сложные.
Кейсы применения
Первый пример — противодействие мошенничеству. Ранее компания Visa анализировала не более 50 параметров транзакции для выявления подозрительных операций. С переходом на технологии больших данных они получили возможность анализировать до 500 характеристик, что позволило ежегодно предотвращать мошеннические платежи на сумму около 2 миллиардов долларов.
Второй кейс — избирательная кампания Барака Обамы в 2012 году. В штабе работало 100 аналитиков данных. Ежедневно проводилось более 66 000 вычислительных экспериментов для анализа общественного мнения из разных источников. Результаты использовались для принятия решений о том, какие заявления делать и на какую аудиторию ориентироваться.
Роли специалистов и компетенции
В области анализа данных выделяют два типа специалистов:
- Data Scientist (учёный по данным) — специалист, который решает научные задачи, извлекает смысл и ценность из данных.
- Data Engineer (инженер по данным) — специалист, отвечающий за инженерную часть: хранение, обработку и подготовку данных.
Ключевые компетенции, необходимые этим специалистам, можно разделить на три области:
- Программирование: Умение работать с данными на скриптовых языках, знание основ функционального программирования, принципов работы реляционных баз данных и NoSQL‑решений (например, баз данных «ключ‑значение»).
- Понимание бизнеса: Способность глубоко понимать предметную область, к которой относятся данные, а также вопросы кибербезопасности при работе с ними.
- Методы искусственного интеллекта: Знание алгоритмов машинного обучения, теории вероятностей и математических моделей.
Работа Data Scientist заключается в превращении бизнес‑проблемы в математическую постановку, её решении с помощью методов анализа и последующем переводе результатов обратно на язык бизнеса в виде понятных выводов и визуализаций. Это требует сильных коммуникативных навыков и творческого потенциала.
Проекты в области больших данных
Проекты делятся на два типа, связанных с разными затратами:
- Инфраструктурные (капитальные затраты): Направлены на создание мощностей для сбора и хранения данных.
- Аналитические (операционные затраты): Направлены на извлечение пользы и выгоды из уже собранных данных. Именно здесь формируется команда из аналитиков и инженеров.
Важным аспектом является привлечение открытых источников данных. В России существуют такие ресурсы, как DataMos.ru (данные Москвы) и Open Gov Data (федеральные данные). Использование таких источников позволяет обогащать анализ.
В заключение стоит подчеркнуть: ключевая проблема во взаимодействии аналитиков и бизнеса — это коммуникация. Аналитик должен уметь доносить результаты своей работы на простом и понятном для управленцев языке, иначе его ценные выводы могут быть проигнорированы.
Краткие итоги
Рассмотренный материал выстраивает целостную картину того, как устроена работа с большими данными с практической точки зрения. Ключевая идея, проходящая через всё изложение, заключается в переходе от интуитивных решений к решениям, обоснованным данными. Стандарт CRISP‑DM служит той самой структурной основой, которая позволяет превратить хаотичный процесс анализа в воспроизводимую инженерную дисциплину. Принципиально важным является понимание, что в мире больших данных традиционные подходы к перемещению и обработке информации не работают, что порождает необходимость в новых архитектурных решениях, где вычисления приближены к месту хранения данных.
Принципы формулирования гипотез и использования численных критериев качества — это не просто теория, а инструмент преодоления когнитивных искажений. Они позволяют бизнесу принимать решения, опираясь на статистическую значимость, а не на единичные случаи. Это дисциплинирует процесс и делает его более предсказуемым. Практические кейсы демонстрируют, что ценность больших данных не в самих данных, а в тех действиях, которые они позволяют совершить: будь то блокировка мошеннических транзакций или точечная коммуникация с избирателями.
Отдельного внимания заслуживает анализ ролей и компетенций. Утверждение о том, что специалист по данным — это не просто технический эксперт, а универсальный «переводчик» между миром математики и миром бизнеса, является центральным для понимания востребованности этой профессии. Без развитых коммуникативных навыков и понимания бизнес‑контекста даже самые точные модели останутся бесполезными. Наконец, разделение проектов на инфраструктурные и аналитические подчеркивает экономическую логику: вложения в хранение данных бессмысленны без последующей стратегии извлечения из них прибыли. Таким образом, эффективная работа с большими данными — это синергия методологии, технологий и человеческого капитала, где важна каждая составляющая.
Введение и стандарт CRISP‑DM
Анализ больших данных не имеет единого промышленного стандарта, поэтому часто опирается на методологию CRISP‑DM. Главное ограничение больших данных — их объем, который делает невозможным перемещение информации по сети. Поэтому необходимо проводить обработку на местах хранения. Архитектура систем разделяется на два контура: место хранения (с возможностями предобработки) и аналитическая система. Некоторые решения, как Oracle Exalytics, позволяют анализировать данные прямо в оперативной памяти.
Цикл анализа по CRISP‑DM
Цикл состоит из шести итеративных этапов:
- Business Understanding: Понимание задачи бизнеса.
- Data Understanding: Оценка достаточности и пригодности данных.
- Data Preparation: Очистка, отсев выбросов, интеграция источников.
- Modeling: Проверка сформулированных гипотез на данных.
- Evaluation: Оценка результатов с участием заказчика.
- Deployment: Внедрение решения в бизнес‑процессы.
Принципы аналитики
- Проверка гипотез: Решения принимаются на основе статистически подтвержденных гипотез, а не интуиции. Если правило работает для 98% случаев, оно принимается.
- Численные критерии: Бизнес‑запросы должны быть переведены в измеримые численные показатели.
- Эффективность: Скорость обработки данных должна соответствовать скорости их поступления, что требует баланса между качеством и временем.
Практические кейсы
- Visa: Увеличение числа анализируемых параметров транзакции с 50 до 500 позволило предотвращать мошенничества на $2 млрд в год.
- Выборы Обамы 2012: Команда из 100 аналитиков данных ежедневно проводила десятки тысяч экспериментов, чтобы на основе данных корректировать стратегию кампании.
Роли и компетенции
- Data Engineer: Отвечает за хранение и обработку данных.
- Data Scientist: Извлекает из данных смысл и ценность.
Компетенции специалистов включают:
- Программирование: Скриптовые языки, SQL и NoSQL базы данных.
- Бизнес: Понимание предметной области, кибербезопасность.
- Наука о данных: Методы машинного обучения, теория вероятностей.
Проекты и коммуникация
Проекты делятся на инфраструктурные (создание мощностей) и аналитические (извлечение выгоды). Важно использовать открытые источники данных (например, DataMos.ru). Ключевой навык аналитика — умение переводить бизнес‑задачу на язык математики и представлять результаты обратно в понятной для заказчика форме. Без этого навыка даже ценные результаты могут быть не востребованы бизнесом.
1. Анализ больших данных опирается на стандарт CRISP-DM, обеспечивающий структурированный подход к решению задач.
2. Большие данные требуют обработки на месте хранения, что ведет к разделению систем на компоненты предобработки и анализа.
3. Процесс анализа по CRISP-DM является итеративным, с обратными связями между этапами.
4. Оценка результатов обязательно проводится с участием заказчика для подтверждения бизнес-ценности.
5. Ключевой принцип аналитики — замена интуитивных решений на статистически подтвержденные гипотезы.
6. Бизнес-задачи должны формулироваться в виде измеримых численных критериев качества.
7. Скорость обработки данных должна соответствовать скорости их поступления, что требует баланса между качеством и временем.
8. Роли Data Scientist и Data Engineer разделяют научные и инженерные аспекты работы с данными.
9. Ученый по данным выступает связующим звеном, переводя бизнес-задачи на язык математики и обратно.
10. Компетенции аналитика включают программирование, понимание бизнеса и знание методов искусственного интеллекта.
11. Проекты делятся на инфраструктурные, требующие капитальных затрат, и аналитические, ориентированные на извлечение выгоды.
12. Умение ясно и понятно представлять результаты анализа является критически важным навыком для специалиста.
1. Почему стандарт CRISP-DM используется в качестве основы для анализа больших данных?
2. Какие два основных технических ограничения накладывают большие данные на процесс ETL?
3. Каким образом архитектура решения для больших данных учитывает ограничения на перемещение информации?
4. Перечислите и кратко опишите этапы аналитического цикла по CRISP-DM.
5. Какова роль обратных связей между этапами в методологии CRISP-DM?
6. Сформулируйте принцип «формулирование и проверка гипотез» и приведите пример его применения.
7. Почему при работе с большими данными важно использовать численные критерии качества решений?
8. В чем заключается принцип эффективности соотношения времени и качества обработки данных?
9. Чем отличаются роли Data Scientist и Data Engineer?
10. Какие три ключевые области компетенций необходимы специалисту по данным?
11. В чем заключается основная задача Data Scientist при взаимодействии с бизнесом?
12. Чем отличаются инфраструктурные и аналитические проекты в области больших данных?