Введение в аналитику больших массивов данных

Основные вызовы больших данных

В лекции рассматриваются ключевые характеристики больших данных, известные как V-факторы (объем, скорость, разнообразие, ценность). Анализируются связанные с ними проблемы: сложность извлечения ценности, ограничения на хранение и передачу данных, вопросы качества и достоверности информации. Отдельное внимание уделяется драйверам роста рынка и важности понимания структурированности данных как меры их пригодности для машинной обработки. В заключение раскрывается роль виртуализации как технологической основы, сделавшей возможной работу с большими данными.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Объяснять суть четырех основных вызовов больших данных: объем, скорость, разнообразие и ценность.
2. Анализировать, почему большой объем данных не гарантирует их высокую ценность, и как ценность связана с полнотой данных.
3. Оценивать проблемы, связанные со скоростью генерации данных, на примере ограничений физических систем.
4. Классифицировать данные на структурированные, полуструктурированные и неструктурированные, приводя примеры для каждой категории.
5. Обосновывать, почему понятие «структурированность» относительно и зависит от контекста машинной обработки.
6. Различать внутренние и внешние источники данных и оценивать риски, связанные с их достоверностью.
7. Формулировать основные технологические и экономические драйверы развития рынка больших данных.
8. Описывать роль виртуализации в создании технологической базы для обработки больших данных.
Показывать лекцию целиком
Краткое изложение

Презентацию к лекции 2 Вы можете скачать здесь.

Основные вызовы больших данных

При работе с большими данными выделяют четыре ключевых вызова, или характеристики. Их часто обозначают как 4V.

1. Объем.

Это первая и самая очевидная характеристика. Большие данные подразумевают работу с колоссальными массивами информации.

2. Скорость.

Означает высокую скорость генерации данных. Проблема в том, что данные создаются настолько быстро, что мы не всегда успеваем их сохранять. Например, на Большом адронном коллайдере (БАК) объем информации от столкновения пучков частиц составляет около 300 терабайт в секунду. Записать такой поток целиком невозможно, поэтому ученые заранее выделяют и сохраняют только потенциально важные события. Но даже этот сохраненный объем невозможно передать по современным каналам связи, например, из Швейцарии в Новосибирск, для анализа. Возникает разрыв между возможностями генерации, хранения и передачи данных.

3. Разнообразие.

Данные существуют в разных форматах: от структурированных до неструктурированных. Это создает сложности в их совместной обработке.

4. Ценность.

Это ключевой вызов. Важно не то, сколько данных мы собрали, а то, какую пользу мы можем из них извлечь.

Ценность и качество данных

Большой объем не гарантирует большую ценность. Ценность данных напрямую связана с их полнотой, то есть с тем, насколько полно данные представляют изучаемый объект или явление.

Отдельная проблема — качество исходных данных. Необходимо понимать, как данные были собраны и есть ли в них ошибки. В текущее время легко накопить огромные объемы информации, но критически важно осознавать, с какой целью это делается. От цели зависят и методы сбора.

Часто компании пытаются извлечь пользу из уже собранных данных. Однако нужно понимать, что эти данные собирались для решения прошлых задач. Поэтому они могут не содержать информации, необходимой для ответа на текущие вопросы.

Также важно учитывать различную степень достоверности источников. Государственная статистика, как правило, заслуживает доверия. Но при использовании других открытых источников степень доверия к ним должна быть критически оценена и обозначена.

Драйверы рынка

Рынок больших данных растет благодаря трем основным факторам:

  1. Увеличение потоков информации.
  2. Удешевление систем хранения в расчете на единицу информации.
  3. Совершенствование технологий обработки.

Это создает эффект «снежного кома»: компании, видя конкурентные преимущества, начинают собирать больше данных. Растущий спрос на системы хранения стимулирует их производство и дальнейшее удешевление, что, в свою очередь, позволяет собирать еще больше информации. В выгодном положении находятся компании, поставляющие системы хранения данных.

Структурированность данных

Принято выделять три типа данных:

  • Структурированные: Данные с четко определенной схемой. Классический пример — таблицы в системе управления базами данных (СУБД), к которым можно обращаться с помощью языка запросов, например SQL.
  • Полуструктурированные: Данные, не соответствующие строгой табличной модели, но имеющие собственную внутреннюю структуру. Примеры — документы XML и HTML.
  • Неструктурированные: Данные без предопределенной модели. Это видео, аудиозаписи, тексты на естественном языке.

Однако эта классификация относительна. Автор книги считает свой текст структурированным, как и режиссер — свой фильм. Но для машины, не имеющей понимания контекста, фильм — это просто неструктурированная видеозапись.

Ключевой тезис: структурированность — это не свойство самих данных, а мера легкости их обработки машиной. Она зависит от знаний и инструментов, которыми мы обладаем. Например, если у вас есть файл размером 1 терабайт, но вы не знаете его содержание, для вас он неструктурирован, хотя у него есть имя и расположение (метаданные от файловой системы). Как только вы понимаете его внутреннюю организацию, он становится структурированным.

Виртуализация как основа

Виртуализация — это изоляция вычислительных процессов и ресурсов друг от друга. Она позволяет оторваться от физического оборудования одной машины и консолидировать ресурсы множества серверов для более эффективного использования.

Именно виртуализация сделала возможными облачные технологии, которые, в свою очередь, стали фундаментом для сбора, хранения и обработки больших данных. Поэтому виртуализацию иногда называют пятой характеристикой больших данных (5V).

Краткие итоги

Понимание природы больших данных требует смещения фокуса с простого накопления информации на управление ее жизненным циклом и извлечение практической пользы. Главным вызовом становится не объем, а способность превратить сырой массив сведений в надежный актив для принятия решений. Разрыв между скоростью генерации данных и возможностями их обработки и передачи делает критически важным развитие методов фильтрации информации на этапе ее появления. Это означает, что ценность часто закладывается не на этапе анализа, а на этапе сбора, когда определяется, какие данные действительно стоит сохранить.

Вопрос качества и релевантности данных выходит на первый план. Информация, собранная без ясной цели, может оказаться бесполезной для решения новых задач, а неоднородность источников требует обязательной оценки их достоверности. Таким образом, управление качеством и понимание происхождения данных становятся неотъемлемой частью аналитической работы. Концепция структурированности также переосмысливается. Это не статичное свойство, а динамическая характеристика, отражающая наши текущие возможности по машинной обработке информации. То, что сегодня кажется неструктурированным «черным ящиком», завтра, с появлением новых алгоритмов, может стать ценным источником знаний.

Экономические и технологические драйверы создают самоподдерживающийся цикл роста, где удешевление хранения стимулирует сбор, а собранные данные — спрос на новые технологии обработки. Ключевую роль в этом цикле играет виртуализация, обеспечивающая гибкость и масштабируемость инфраструктуры. Понимание этих взаимосвязей позволяет выстраивать стратегию работы с данными не как с пассивным массивом, а как с активным ресурсом, требующим целенаправленного управления на всех этапах — от генерации до получения ценности для бизнеса.

Вызовы больших данных (4V)

Объем. Первая характеристика — работа с огромными массивами информации.

Скорость. Ключевая проблема — данные генерируются быстрее, чем их можно сохранить. Пример: Большой адронный коллайдер генерирует ~300 ТБ/с. Ученые вынуждены фильтровать и сохранять только важные события. Даже сохраненный объем трудно передать по сети, так как каналы связи не справляются с такими потоками.

Разнообразие. Данные бывают структурированными, полуструктурированными и неструктурированными, что усложняет их совместную обработку.

Ценность. Самый важный вызов. Важен не объем, а польза, которую можно извлечь. Ценность связана с полнотой данных — насколько полно они отражают изучаемое явление.

Проблемы качества и целей

Драйверы рынка

Три фактора роста: увеличение потоков информации, удешевление хранения, улучшение технологий обработки. Это создает «снежный ком»: больше данных → больше спрос на хранение → хранение дешевеет → собираем еще больше данных.

Классификация и относительность структурированности

Выделяют три типа данных:

Ключевая идея: структурированность — понятие относительное. Для автора книга структурирована, а для машины — это просто неструктурированный текст. Структурированность — это не свойство самих данных, а мера легкости их обработки машиной. Данные становятся структурированными, когда у нас есть алгоритмы и знания, чтобы их интерпретировать. Например, файл 1 ТБ неструктурирован, пока вы не знаете его внутреннюю организацию.

Виртуализация как основа

Виртуализация — это изоляция вычислительных процессов и ресурсов друг от друга. Она позволяет эффективно использовать объединенные ресурсы множества серверов. Виртуализация стала основой для облачных технологий, которые, в свою очередь, позволили собирать, хранить и обрабатывать большие данные. Поэтому виртуализацию часто добавляют как пятую характеристику (5V).

Выводы

1. Большие данные характеризуются четырьмя вызовами: объемом, скоростью, разнообразием и ценностью.
2. Главная цель — извлечение ценности, которая не всегда коррелирует с объемом данных, а зависит от их полноты.
3. Скорость генерации данных может превышать возможности их хранения и передачи, как в примере с Большим адронным коллайдером.
4. Качество данных — критическая проблема, требующая понимания целей и методов их сбора.
5. Данные, собранные для одной задачи, могут быть бесполезны для другой.
6. При использовании данных из разных источников необходимо учитывать степень их достоверности.
7. Рынок больших данных растет за счет увеличения потоков информации, удешевления хранения и развития технологий.
8. Данные делятся на структурированные, полуструктурированные и неструктурированные, но это деление относительно.
9. Понятие «структурированность» отражает легкость машинной обработки информации, а не внутренние свойства данных.
10. Виртуализация является фундаментальной технологией, обеспечившей возможность существования облачных вычислений и, как следствие, работы с большими данными.

Вопросы для самопроверки

1. Каковы четыре основных вызова больших данных (4V)?
2. Почему проблема со скоростью генерации данных актуальна для Большого адронного коллайдера?
3. Как связаны между собой ценность и полнота данных?
4. Почему наличие большого объема данных не гарантирует их полезность для решения новых задач?
5. В чем заключается проблема использования уже собранных данных для новых целей?
6. Как следует поступать с источниками данных, имеющими разную степень достоверности?
7. Назовите три основных драйвера рынка больших данных.
8. Что такое эффект «снежного кома» на рынке больших данных?
9. Приведите примеры структурированных, полуструктурированных и неструктурированных данных.
10. Почему классификацию данных по структурированности можно считать относительной?
11. Что такое виртуализация и какую роль она сыграла в развитии больших данных?
12. Почему виртуализацию иногда называют пятой характеристикой (5V) больших данных?
Вернуться к учебному плану