Теперь давайте ознакомимся с процессом работы аналитика больших данных. Собственно, процесс анализа больших данных, он еще не приобрел каких-то промышленных стандартов, поэтому в этой области мы сейчас опираемся на стандарт CRISP-DM, в 2009 году, по моему, последняя версия этого стандарта вышла, и в IBM он принят как совершенно четкий стандарт. Нужно понимать, что при этом большие данные, они накладывают определенные ограничения. Первое, что мы знаем - мы не можем информацию просто переносить с одного места в другое. Эта информация, она, допустим, у нас терабайты или петабайты лежат, где-то в облаке. Этот момент нужно учитывать, то есть у нас есть определенные ограничения на процесс ETL, то есть процесс извлечения, трансформации и загрузки данных - это первое ограничение, оно, соответственно, требует от нас средства предварительной обработки информации на местах ее хранения, то есть у нас был должны быть такие средства обработки, которые локализованы там, где информация хранится, в облаке, например.
Второе - необходимо иметь возможность запуска алгоритмов прямо на местах хранения данных. Соответственно, мы можем предварительно там информацию отобрать, там, где хранятся эти данные, какими-то алгоритмами простыми, ну или не очень простыми, и потом получившийся объем информации, если его можно передать по сети, получить уже в ту аналитическую систему, где у нас больше вычислительных мощностей для более разнообразного анализа, и вот у нас появляются две компоненты в этой системе: первая компонента, где информация хранится, там должны быть вычислительной мощности, и где информация тщательно анализируется, визуализируется. Некоторые решения позволяют это все в одном месте сделать, а некоторые разделяют на две части. Например, есть базы данных, SAP HANA, например, или Oracle Exalytics, которые позволяют большие данные анализировать в памяти компьютера, то есть использовать уже очень быстрые вычислительные мощности для того, чтобы эти данные представлять в удобной форме.
Сам процесс аналитики в соответствии со стандартом CRISP-DM выглядит следующим образом - здесь у нас несколько этапов работы. Первый этап Business Understanding, то есть этап, в котором мы понимаем, какие задачи необходимо решать, есть ли там вообще проблема больших данных, или нет. Когда мы понимаем постановку задачи, мы переходим к этапу понимания данных (Data Understanding). На этом этапе мы смотрим, а достаточно ли у нас данных для того, чтобы ставить такие вопросы, которые ставит нам заказчик, поэтому здесь стрелочки в обратную сторону, то есть из тех задач, которые требуются, уточняется постановка на сбор данных. Есть такие заказчики, которые хотят воспользоваться преимуществами больших данных, но они, допустим, не имеют того объема данных для того, чтобы эти задачи решать, поэтому они переходят к этапу сбора данных, но он уже не относится к этому циклу. После того, как мы поняли, какие данные у нас есть, мы можем переходить к процессу предварительной обработки этих данных - Data Preparation. На этом этапе происходит отсев данных, мы устанавливаем степень достоверности этих данных, убираем выбросы, привлекаем новые источники данных, каким-то образом их подготавливаем для последующего этапа. На следующем этапе моделирования (Modeling) происходит проверка гипотез. Эти гипотезы, они могут быть разного характера, например, содержится ли в представленных данных какая-то информация - нам поступил видео файл, нам нужно понять автоматически, если там информация о машине с таким-то государственным номером. Вот гипотеза - «есть ли?». Множество других разных гипотез отрабатывает аналитик в процессе моделирования. Здесь также видно, что есть обратная связь к процессу подготовки данных, и вот в этом итеративном процессе отрабатываются гипотезы. После того, как гипотезы отработаны, мы переходим к этапу оценки. В этом этапе участвует заказчик и он позволяет точно определить, получен тот результат, который ему хочется, или не получен, представляют ли собранные данные какую-то ценность для заказчика или нет. Только на этом этапе, к сожалению, раньше точно утверждать сложно до этого этапа. Последний этап этого цикла - это внедрение, если, конечно, требуется. Есть заказчики, которым достаточно сказать, что в их данных достаточно информации для того, чтобы предсказывать их будущее, а есть заказчики, которые требуют, чтобы по их данным автоматически какие-то решения принимались, какие-то напоминания, допустим для систем видеоаналитики в метро, чтобы приходили оповещения в службу безопасности, что там какие-то подозрительные личности обнаружены - система распознавания лиц. Здесь тоже предполагается, что будет создано решение, которое будет встроено в систему заказчика.
Важно отметить также принципы аналитики больших данных. Здесь нам сложно отойти от каких-то традиционных схем принятия решения, в то же время нам приходится полагаться на статистические методы, и если как какая-то гипотеза относительно бизнеса, вы заметили, что она не работает в паре случаев, пара клиентов, допустим, не укладывается в эту схему. Но так может оказаться, что 98 процентов всех клиентов, то есть все остальные клиенты, они укладываются в эту схему, это же не значит, что схему нужно отклонить, наоборот, схема принятия решения, она подтверждается на 98 процентах случаев. Поэтому здесь очень важен статистический принцип, и можно его сформулировать так, что это формулирование и проверка гипотез. Если бизнесмены, которые особенно интуитивно принимает решения, они привыкли как-то действовать по ситуации, то, когда мы говорим о применении больших данных в бизнесе, мы говорим о формулировании и проверке гипотез, то есть каждая гипотеза относительно бизнеса, относительно каких-то решений, должна быть четко математически сформулирована и проверена на данных, то есть статистические подтверждена.
Второй принцип - это численные критерии качества решений. Конечно же, мы должны приходить качественным критериям решений, но и численные у нас, поскольку мы имеем дело с большим объемом данных, то мы должны уметь формулировать запрос бизнеса в численном виде, в виде каких-то критериев, которые следует достичь.
Третий принцип - это эффективность соотношения «время» и «качество», особенно актуален, когда идут большие потоки информации, когда они идут каждый день. Скажем, у вас каждый день прибывает по одному терабайтами информации, и вам нужно успевать этот терабайт обрабатывать и принять на основе него какие-то решения - может быть в этом новом терабайте какие-то новые закономерности проявились, поэтому тут возникает требование на цикл работы с данными. Если у вас данные поступают, например, в цикл анализа раз в день, то вам нужно за день закончить этот цикл. А при таком при большом объеме данных у вас возникают требования на скорость этой обработки, что-то нужно отбрасывать, что-то более простыми методами изучать, что-то более сложными.
Следующий момент, который я хочу обозначить — теперь, когда мы поняли основные принципы аналитики, те требования, которые предъявляются к аналитику больших данных, можем посмотреть, какие инструменты сейчас уже есть в арсенале аналитика больших данных. Здесь вот из блога Дэйва Фейнлейба, он определенным образом систематизировал технологии: Hadoop, Mahout, Hibase, Casssandra, инструменты визуализации Business Intelligence и другие инструменты, то есть технологии обработки больших данных, их сейчас уже достаточно много, просто можно брать готовые для того, чтобы решать текущие задачи.
Ну и хотелось бы ряд примеров рассмотреть, то есть мы сейчас посмотрим некоторые примеры и потом перейдем к компетенциям аналитика по большим данным. Первый кейс: противодействие мошенничеству рассматривается на базе финансовой аналитики. Известно, что в 2011 году мошенники нанесли ущерб 34 процентам компаний и организаций, попавших в поле зрения определенного агентства. В России процент выше - 37 процентов, причем в 60 процентах из этих случаев убытки превышали 100 тысяч долларов. Ежегодно финансовая индустрия теряет порядка 80 миллиардов долларов на мошеннических транзакциях. В компании Visa было разработано решение — раньше, без использования больших данных, они для отлавливания мошеннических транзакций использовали не более 50 параметров, то есть они смотрели на характеристику транзакции, это 50 параметров, и решали, отклонить ее как мошенническую, или нет. Сейчас, используя мощности больших данных, возможности новых технологий, они анализируют до 50 петабайт данных и при этом смотрят на 500 характеристик транзакций, то есть повысилось качество. И при этом они позволяют отлавливать мошеннические платежи на сумму примерно 2 миллиарда долларов в год. Вот совершенно конкретная польза от больших данных.
Следующий интересный кейс: это выборы Обамы в 2012 году. Он, кстати, тоже повлиял на популяризацию технологии анализа данных и технологии больших данных. В течение полутора лет предвыборной кампании было потрачено полтора миллиарда долларов на то, чтобы обеспечить тысячу оплачиваемых сотрудников, 10 тысяч волонтеров и 100 аналитиков по данным - это довольно высокооплачиваемая профессия в Америке, все эти специалисты ежедневно проводили более шестидесяти шести тысяч экспериментов вычислительных, они анализировали данные, что кто думает, говорит, что происходит во время предвыборной кампании Обамы, они старались извлечь информацию для принятия решения, что дальше делать Обаме, какие слова говорить, кому - все использовалось, всевозможные источники: коммерческие базы данных, опросы и так далее. Конечно же, они очень хорошо использовали методы анализа данных. Но в области анализа больших данных есть место и науке, и инженерии. И соответственным образом люди, которые больше занимаются научными задачами, называется Data Science или ученые по данным, а те, которые больше занимаются обработкой данных, хранением, то есть какими-то инженерными вещами, называют Data Engineering, инженер по данным. Как правило, эти специалисты - это кандидаты или доктора наук в переложении на наш российский язык, в Америке им платят порядка 300 тысяч долларов в год, но это верхняя планка, при том, что эти специалисты никем не управляют, то есть это не менеджер, но получает зарплату больше чем некоторые менеджеры - в Томске предлагают за такую вакансию 5 тысяч долларов в месяц. Мы в Новосибирске открываем магистратуру, которая будет готовить как ученых по данным, так и инженеров в этой области.
Следует отметить, как уже становится понятным из уже прочитанной лекции, что специалисты в этой области должны обладать целым рядом компетенций. Во-первых, это компетенции в области программирования. Нужно уметь обрабатывать данные, работать с ними на каком-то скриптовом языке, нужно знать основы функционального программирования и основы управления базами данных - это как традиционные наши реляционные базы данных, так и новые технологии, новый SQL, то есть не только SQL, те базы данных, которые не имеют определенной структуры, или вот так называемые key-value базы данных.
Вторая область компетенции - это понимание проблем бизнеса. Это очень важная вещь, потому что когда аналитик работает с данными, он должен понимать проблематику, должен понимать, к какой области эти данные относятся, глубже проникать в суть этих данных, связывая их с пониманием этой предметной области. Также должен владеть вопросами кибербезопасности, то есть, как правило, аналитик получает доступ к определенным данным, эти данные могут быть деперсонализированы, а могут быть и недеперсонализированны, поэтому тоже должен поддерживаться определенный уровень безопасности.
Третья большая область - это методы искусственного интеллекта или методы машинной обработки данных, методы машинного обучения. В них этот аналитик тоже должен быть специалистом, должен понимать, как устроены алгоритмы анализа данных, какие есть в этой области теории, модели, должен быть хорошо знаком с теорией вероятности.
Теперь мы немножко составили представление о компетенциях, а что же делает, собственно, аналитик по данным? Мы уже нарисовали рабочий цикл, что там есть подготовка данных, моделирование. Если чуть-чуть углубиться, то ученый по данным, вся его работа состоит в том, чтобы достичь озарения. Это как бы основная его работа - достигать озарения. Он может это делать, конечно же, и во сне, как Дмитрий Иванович Менделеев, а может использовать различные математические методы для того, чтобы максимизировать вероятность наступления такого озарения. Здесь уже достаточно много методов разработано. Ученый по данным не только используют эти методы, он может какие-то свои методы разрабатывать. Достаточно квалифицированный специалист, чтобы взять какой-то готовый метод, чуть-чуть его модифицировать под задачу и получить на ней уже конкретные результаты. Еще чем занимается ученый по данным? Он фактически превращает бизнес-постановку, конкретную проблему бизнеса - он должен понять, что это за проблема, он превращает ее в математическую постановку, то есть должен уметь переводить с языка клиентов на язык математический. Это тоже определенная сложность, поэтому таких специалистов немного, поэтому им пока очень много платят. Кстати, нужно научиться и обратно переводить, то есть из полученных результатов нужно уметь донести эту информацию в виде красивых графиков, красивых презентаций, донести ее до заказчика. Об этом, кстати, я на последнем слайде еще подробно поговорю.
Есть такие мнения об ученых по данным. Первое принадлежит главному специалисту по данных компании Linkedin, он утверждает, что ученые по данным превращают большие данные в большую ценность, поставляя продукты, которые радуют пользователей, и озарение, которое наполняет смыслом принятые бизнес-решения. Вот так красиво. Высокие аналитические компетенции, прежде всего, заключаются в том, чтобы обладать способностью получать надежные выводы по данным. Такие ученые должны обладать творческим потенциалом и сильными коммуникативными навыками. Все эти характеристики: навыки коммуникации, то есть нужно уметь как понять постановку заказчика, так и представить ему результат, и компетенция умения формулировать гипотезы и проверять их на данных.
Что еще потребуется знать - это то, что, как правило, можно разделить проекты в больших данных - те, которые связаны с инвестиционными затратами, капиталовложениями, и операционными затратами. Инвестиционные затраты, как правило, направлены на то, чтобы сформировать инфраструктуру, чтобы собирать данные, сохранять, закупить серверные мощности для хранения - это очень большие затраты. Но после того, как данные уже собираются, уже хранятся, у нас возникает задача - как отбить эти инвестиции. В операционных затратах мы хотим получить выгоду, извлекать пользу. Здесь возникает, собственно, два типа проектов больших данных - одни направленные на создание инфраструктуры, а вторые направленные на использование полученных данных. Во второй части у нас как раз возникает команда специалистов: ученые по данным, инженер по данным, менеджер, возникает процесс сбора и анализа данных, инвентаризации источников, резервирование каких-то мощностей для обработки данных - это примерные характеристики проекта в области анализа больших данных.
Еще один мне интересный момент - то, что кроме собранных внутри компании данных, можно привлекать открытые источники. В России поддерживается несколько открытых ресурсов, где представлены государственные данные: http://data.mos.ru - это московские открытые данные, http://opengovdata.ru - это открытые данные Российской Федерации и https://hubofdata.ru - это интересный такой проект, тоже по открытым данным, там инвентаризируются источники, и российские, и других стран, и представлены различные средства для их обработки. Есть также открыты и научные данные, тоже определенное направление, оно позволяет использовать тоже открытые, более верифицированные источники для того, чтобы проводить какие-то исследования, тоже их использовать в своих проектах аналитики больших данных.
Вот тот слайд, о котором я упоминал - еще один вид деятельности аналитика больших данных или ученого по данным, который заказчики все-таки приветствуют и требует - они очень хотят, чтобы ученый по данным был таким как бы многоруким специалистом. Он должен уметь переводить постановку с бизнес на математический язык, должен уметь из математического еще поставить задачу инженеру, должен получить результаты от инженера, проанализировать, понять вообще, как это с бизнес-постановкой соотносится, еще и представить эти результаты заказчику. Пока вот такой универсальный специалист, ему за это очень много платят.
На Harvard Business Review есть статья «Зачем управленцам математика?», и там подчеркивается особенно та проблема, почему аналитик должен обладать такими компетенциями. Там приводится ряд случаев, когда руководитель крупного бизнеса говорит: «А что это у нас вот как-то дела плохо идут?», обращается в аналитический отдел: «Почему у нас вот такие финансовые показатели очень низкие?», в финансовом отделе говорят: «Так мы вам полгода назад об этом говорили, вам давали прогнозы, вот такие вот отчеты». На что руководитель сказал: «Вы, видимо, как-то неясно говорили, как-то не донесли до меня этой информации». Это реальная проблема, когда аналитик, допустим, из аналитического отдела мыслит в каких-то своих терминах, терминах вероятности, статистики, графиков, гипотез, но от него сейчас, в текущем моменте требуется для того, чтобы он хотя бы остался на этой работе, что бизнес не закроется. Он должен уметь свои результаты представить на языке, понятном бизнесмену. Это может быть гораздо более простой язык, чем математика, поэтому, наверное, не составит большой сложности аналитику перейти на этот язык, но все-таки нужно и этой компетенцией тоже обладать.
В качестве дополнительного чтения предлагаю вам прочитать вот эту статью из Harvard Business Review, по второй ссылке можно найти программу по развитию BigData в США, эта программа принята на государственном уровне, и еще один очень интересный доклад от ЦРУ про большие задачи и больших данные. Несмотря на то, что это ЦРУ, доклад выглядит вполне интересным, вдохновляющим, и поскольку ЦРУ развивает такие технологии и наверняка за российскими гражданами следит, то и нам в России тоже необходимо приобретать такие компетенции и показывать свою собственную силу в этой области. Спасибо за внимание!
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.