Введение в аналитику больших массивов данных

Общее понятие о больших данных

Показывать лекцию целиком

 

Здравствуйте, уважаемые слушатели! Сегодня мы представляем вам курс лекций по введению в анализ больших данных. Эта тема в последнее время становится очень актуальной, и в Новосибирском научном центре накопилось достаточно опыта: исследовательского, преподавательского, предпринимательского, для того, чтобы его обобщить и сейчас изложить в виде курса. Также нам известно, что онлайн-курсы в последнее время становятся очень популярными, курсы по анализу больших массивов данных уже открыты на английском языке на Coursera, Udacity, компания EMC имеет курс «Введение в науку о данных и аналитику больших данных», но на русском языке таких онлайн-курсов еще пока не было, поэтому мы решили этот пробел устранить. И вот представляем вам курс «Введением в аналитику больших данных». Цель этого курса - это сориентировать слушателя в этой формирующейся непростой области.

Курс будет разбит на несколько модулей. Первый модуль содержит собственно введение в большие данные, потом мы приходим к теме аналитики. Второй модуль посвящен введению в когнитивный анализ данных. Третий модуль, в нем мы освещаем основы языка R, как наиболее популярного инструмента для анализа больших данных. В четвертом модуле мы знакомимся с другими инструментами проведения исследований, и в пятом модуле мы знакомимся с системами хранения данных, которые позволяют не только хранить, но и обрабатывать в каком-то языке запросов большие данные.

Итак, мы сейчас начинаем лекцию «Введение в анализ больших данных». В этой лекции мы познакомимся с предпосылками формирования тренда больших данных, рассмотрим основные вызовы больших данных, так называемые 4V - четыре основных характеристики больших данных. Их выделяют по-разному, где-то три говорят характеристики, где-то четыре, пять, двенадцать... Но мы с четырьмя ключевыми ознакомимся. Следующее - мы подискутируем на тему, что такое большие данные, как определяется этот термин. Рассмотрим базовое представление о технологиях Hadoop и принципе вычисления MapReduce, и составим представление о работе аналитика. Также мы некоторое время посвятим тому, чтобы понять, в чем состоит тренд больших данных, какие были факторы и предпосылки его формирования. В результате этой лекции вы получите представление об основных вызовах больших данных, получите понимание условий возникновения технологии MapReduce, почему именно такая технология возникла, и получите представление о факторах возникновения тренда больших данных.

Итак, что же такое большие данные? На это можно посмотреть с четырех разных точек зрения. То, что первое приходит нам в голову, это как первый взгляд на эту проблему, мы все так или иначе знакомились с этой темой, смотрели в интернете материалы, какие-то курсы на английском языке прослушивали, очень много маркетингового шума на эту тему, и я предлагаю сейчас, прослушав некоторое задание, поставить видео на паузу и самим составить первое представление - что вы знаете о анализе больших данных. После того, как составите в виде, например, интеллект-карты, мы потом сравним это с тем, что получилось у меня.

Итак, на первый взгляд большие данные представляют собой такую несложную сеть:

Теперь же хотелось обратить внимание на инженерный взгляд на проблему больших данных. С инженерной точки зрения, прежде всего для того, чтобы большие данные состоялись, чтобы они там накапливались, нам нужно иметь хранилище. Поэтому составляя представление о больших данных мы должны составить представление о хранилище, о тех технологиях, которые позволяют собирать и накапливать эти данные. Здесь мы особо выделим облачные системы — то, что позволяет нам консолидировать разные вычислительные ресурсы и хранить по-настоящему огромные объемы данных, распределенные по территории земного шара. Здесь можно перечислить компании, вот несколько: Oracle, IBM, Amazon, EMC, Cloudera — те, которые собирают и накапливают большие объемы информации и производят системы хранения данных.

Следующим моментом можно обозначить с точки зрения инженерии вопросы кибербезопасности. Проблема в чем - когда мы начинаем обрабатывать данные о человеке, у нас сразу возникает вопрос, а имеем ли мы право обрабатывать данные об этом человеке, кто имеет право обрабатывать эти данные? То есть нужны какие-то политики и соответствующие технологии, ограничивающие доступ одним лицам и разрешающий доступ другим.

Следующий важный вопрос касается жизненного цикла данных. Для того, чтобы большие данные существовали, нужно поддерживать как процесс их создания, накопления, процесс их обработки, анализа, процесс представления результатов заинтересованным лицам и процесс уничтожения собственно этих данных, почти как с ядерными отходами, то есть если мы когда-то эти данные собрали, когда-то станет вопрос, куда куда их девать. Тем более, что в последнее время не такие большие затраты на создание данных, сколько на их длительное хранение. Поэтому возникает вопрос, а нужно ли нам вот эти терабайты информации хранить, или нет. Кстати, вот именно из этого вопроса, именно из-за него возникает большая потребность использовать накопленные данные, потому что мы уже компания, например, но некоторые бизнес-компании десятки лет хранят данные, терпят издержки, но зачем они хранят всю историю свою? Наверное для того, чтобы как-то использовать ее в будущем.

У нас есть еще вопросы о готовых технологиях обработки данных, вопросы с потоками данных, то, что у нас есть не только те данные, которые сохраняются, но есть и которые генерируются, но никак не сохраняется. Они в данный момент есть, и через минуту их может уже не быть. Их тоже нужно каким-то образом обрабатывать, какую-то ценность из них извлекать.

Следующий важный вопрос о больших данных — собственно, когда они стали большими? То есть до этого они, вроде как, небольшие были, сейчас большие, почему? Давайте посмотрим на этот слайд. Здесь мы видим соотношение между аналоговыми и цифровыми данными. На 1986 год мы видим, что примерно два с половиной экзабайта данных содержится в аналоговом виде. Но тут нужно учесть, каким образом считается вот эта аналоговая информация? Это уже систематизированная информация: библиотеки, фильмотеки,каталоги видеокассет - это каким-то образом уже структурированная информация, не считаются ее дубли. А дальше мы видим, что ее объем нарастает, это вот здесь видеокассета VHS нарисована, и с 2002 года происходит перелом соотношения цифровых данных по отношению к аналоговым. Здесь один к одному, и после 2002 года цифровые данные резко растут. В цифровых данных нужно учитывать, что мы считаем дубли информации. Один и тот же фильм, он записан несколько раз, и мы считаем всю сумму байтов, которые он занимает, это нужно иметь в виду. Но в целом, конечно же, действительно, цифровой информации гораздо больше, чем аналоговой, и развитие индустрии хранения информации на жестких дисках, на компакт-дисках, оно позволило больше накапливать цифровой информации.

Теперь мы плавно переходим к предпосылкам формирования тренда больших данных. Во-первых, развитие жестких дисков или удешевление производства систем хранения информации, оно позволяет меньше задумываться о том, чтобы какую-то информацию сохранять, накапливать. Это первый момент. Второй момент — то, что у нас появилось очень много различных сенсоров, которые позволяют информацию собирать в цифровом виде. Сейчас практически все ходят с мобильными телефонами, все мобильные телефоны - они накапливают информацию, они обрабатывают информацию в цифровом виде. Системы телекоммуникации, связи, различные датчики внутри машин, которые контролируют состояние двигателя - вся эта информация собирается и обрабатывается уже в цифровом виде. Можно посмотреть на данный слайд, на нем изображены изменения в основных элементах компьютерных технологий. Здесь в начале мы видим, что у нас существенно снизились затраты на хранение данных - 70 долларов за 1 терабайт, а в восьмидесятом году это было 14 миллионов долларов за терабайт, конечно, очень существенное сокращение затрат. По части вычислительной сети мы имеем рост от одного вычислительного узла в 1969 году, до 1 миллиарда вычислительных узлов в настоящее время. Также существенно удешевились вычислительные мощности центрального процессора и пропускная способность сети.

Говоря о больших данных, мы не должны забывать, что это не только технологии, но и некоторый общественный статус, осознание возможности этих технологий. Развитие новых отраслей - оно не идет непрерывно, есть даже так называемый цикл ожидания от новых технологий, инвестиционный цикл от него зависит. С большими данными тоже - не в 2008 году, как утверждается, после публикации в журнале Nature появилось понятие больших данных, оно и раньше было, и были эти большие данные, это не в 2008 году они стали большими. Просто общество через эти инструменты, через публикации в журнале Nature, через аналитический отчет McKinsey, оно осознало, что мы сейчас стоим на пороге некоторых изменений, которые дают нам технологии хранения и обработки больших данных. Поэтому все-таки правильно говорить, что в обществе в 2008 году появился термин больших данных, но особую популярность ему придают различные публикации, в частности аналитический отчет McKinsey в 2011 году.

Вернуться к учебному плану