Следующий вопрос, который хотелось бы осветить - это основные вызовы больших данных. То, что говорят 4V, 5V и 12V - вот мы рассмотрим четыре основных вызова больших данных. Прежде всего, когда мы говорим о больших данных, мы имеем ввиду объем. Действительно, первая характеристика — объем, вторая характеристика - скорость создания этих данных, третья характеристика — это разнообразие, какие-то данные представлены в виде структурированном, какие-то неструктурированном, и четвертая характеристика, вот это действительно вызов - это ценность этих данных. Не так важно, сколько данных мы собираем, как та ценность, которую мы можем потенциально из них извлечь.
Какие же проблемы здесь возникают? Прежде всего то, что большой объем, нам не всегда дает большую ценность. В общем-то ценность не всегда связана с объёмом, она больше связана с полнотой - это немножко другая характеристика, насколько мы изучаемые объекты или явления полно представим в виде этих данных. Со скоростью связаны следующие проблемы — то, что данных генерируется настолько много, что мы не успеваем их сохранять, нам нужно каким-то образом успевать из того потока информации, которая генерируется, успевать вытаскивает нужные нам события. Так, например, происходит с большим адронным коллайдером - примерно 300 терабайт в секунду - происходит такой объем информации от столкновения пучков электронов. Но 300 терабайт секунду - их невозможно записать одномоментно, поэтому ученые выделяют какие-то отдельные факты, которые они предварительно считают, что они важные, выделяют и потом уже их сохранять. Но даже из того объема, который они сохранили - этот объем уже невозможно передать, скажем, из Швейцарии в Новосибирск, чтобы здесь его проанализировать, потому что нет таких каналов связи, которые бы нам могли передать. Все это приводит к проблемам,значит запрос общества на их решение, и отсюда мы получаем еще один фактор — то, что большие данные сейчас очень разогретая тема, потому что мы их накопили, но как-то их нужно обрабатывать и передавать.
Отдельно хочется отметить проблему качества исходных данных. Проблема в чем состоит? Данных мы собрали много, но вопрос, а как мы их собирали, какого они качества, если в них ошибки? Это тоже отдельная проблема, которую нужно иметь в виду. Мы прекрасно понимаем, что в текущее время очень легко данные собирать, очень легко заполнить все свои жесткие диски какой-то информацией, но очень важно понимать, для какой цели эти данные собираются. В зависимости от цели могут отличаться и методы сбора данных.
Еще одна проблема в том, что компании, которые хотят воспользоваться преимуществами большими данных, эти компании рассчитывают извлечь полезную информацию из уже собранных данных, но тут нужно понимать что те данные, которые были собраны до постановки задач, они относились к тем задачам, которые были поставлены ранее. Поэтому те данные могут не содержать той информации, которая запрашивается на текущий момент, и это тоже определенная проблема.
Еще один аспект, который следует принять во внимание - это то, что у нас существует множество разных источников данных с различной степенью достоверности. Например, часто в анализе больших данных привлекаются открытые источники данных, какая-то государственная статистическая информация. Если государственная статистика, ей можно доверять, там целые как бы институты над этим работают, да. Но есть другие источники открытой информации, у которых степень доверия тоже должна быть вычислена, обозначена - все это нужно принимать во внимание, когда мы используем внешние источники информации.
Теперь хотелось бы рассмотреть основные драйверы рынка больших данных. Во-первых, это увеличение потоков информации, во-вторых, это удешевление систем хранения на единицу информации и усовершенствование технологии обработки информации. Мы понимаем, что здесь есть некоторый снежный ком - сейчас как бы раскручивается тренд больших данных, компания все больше обращает на это внимание ,все больше начинает собирать информации для того, чтобы воспользоваться ею для каких-то выгод, каких-то конкурентных преимуществ. При этом компании, которые поставляют системы хранения они на сформированный спрос идут, люди все больше покупают систем хранения, все больше информации собирают, все больше вопросов возникает, что с этой информацией делать. И вот такой снежный ком - больше собираю, больше потребности в информации, еще больше собираю. И получается, те компании, которые предоставляют системы хранения, они сейчас находятся в очень хорошей рыночный конъюнктуре.
Теперь хотелось бы отметить особо момент, который связан со структурированностью данных. Принято различать структурированные, полуструктурированные и неструктурированные данные. Примером структурированных данных является система управления базами данных СУБД, типичная таблица, какое-то отношение, там очень понятные структуры данных, есть язык запросов, который позволяет к ним обращаться, и, вроде как, эти данные структурированы. Полуструктурированные - это какие-то xml документы, в которых есть уже определенная структура, html документы, тоже с определенной структурой. И неструктурированная информация - это какие-нибудь видеозаписи, аудиозаписи, тексты на естественном языке. Это принятая классификация, ее можно оспорить, но я бы хотел внести элемент в относительности этой классификации в связи с тем, что, ну, что значит структурированная информация? Если вы спросите у автора книги информацию, которую вот он заложил в книгу, она структурированная? Наверное структурированная, он все там очень четко заложил, выделил заголовки жирным шрифтом, излагал это структурировано. Если спросите у режиссера - фильм, который он снял, он структурирован или нет? Режиссёр тоже скажет - ну конечно же, там определенная сцена за сценой идет, все в определенной структуре. Но с точки зрения обработки этой информации, тот человек, который не имеет этого представления, как режиссер, для него фильм и фильм, это видеозапись, она не структурированная. Получается субъективность в этой структурированности. Но нам более важно в этой классификации понимать, что понятие структурированности по сути связано с легкостью обработки информации с помощью машины. Поэтому нужно принимать во внимание, что структурированность зависит от тех знаний, которые позволяют нам обрабатывать полученную нами информацию.
В качестве еще одного примера, очень хорошо иллюстрирующего этот тезис, можно взять, например, у вас на диске записан файл размером 1 терабайт. Это структурированная информация или нет? Если вы не знаете вообще о чем файл, у вас есть информация, что он один терабайт, есть имя файла, на каком компьютере он расположен, это в принципе тоже некоторая структура, у нас структура обеспечена файловой системой. Но пока вы не вникли, что за информация внутри файла, считайте эту информацию неструктурированной.
Следующий момент, который хотелось бы подчеркнуть - это виртуализация, это тоже вызов или еще одна характеристика больших данных, которая позволила им быть. Виртуализация, в соответствии с определением - это изоляция вычислительных процессов и ресурсов друг от друга. Виртуализация позволила оторваться от вычислительных ресурсов, представленных на одной машине, на двух, и консолидировать, то есть более эффективно использовать вычислительные ресурсы, а это в свою очередь позволило быть облачным технологиям, которые позволили быть большим данным, собирать большие данные и хранить. Поэтому часто перечисляют еще одну V — виртуализация, как характеристику больших данных.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.