Здравствуйте, меня зовут Юрий Аникин, и наша сегодняшняя тема - это обзор технологии хранения для больших данных. Мы разобьем эту тему на две части: в первой мы проведем просто обзор различных технологий для хранения, поймем, что такое NoSQL базы данных, чем отличается от обычных, какие есть в этом проблемы, наоборот, какие проблемы решают они, чем они полезны аналитикам. И вторая большая часть - это мы поговорим про типы NoSQL баз данных, потому что они очень сильно типизированные, отличаются друг от друга классами и различные классы решают разные задачи. Поэтому цель первой лекции у нас будет - познакомиться с основными понятиями и сделать взгляд вширь по технологиям, и цель второй лекции - это научиться выбирать тот тип баз данных NoSQL, которые помогут решать нам наши задачи наиболее оптимально.
Итак, сегодняшняя лекция будет состоять из частей: сначала зададимся вопросом, зачем вообще нам нужны хранилища новых типов, затем мы поговорим о свойствах реляционных баз данных и их ограничений конкретно для задач больших данных, введем несколько определений, которыми мы будем оперировать дальше, поймем, что именно означает термин NoSQL, из чего он состоит и закончим интерфейсами к базам данных и описанием технологии MapReduce.
Итак, зачем все-таки мы начинаем искать новые типы баз данных и хранилищ? Обычно здесь стоит слайд о том, как растут большие данные, я думаю, он уже всем наел оскомину, и давайте не будем исходить из необходимости реагировать на все возрастающий объём больших данных, а поймем, зачем компания занимается большими данными, что их вынуждает, кроме самого роста в мире объема больших данных. В первую очередь мы говорим, что сам пользователь уже привык или постепенно привыкает, приучается использовать web-сервисы, которые сами по себе предоставляют большие объемы данных. Мало того, эти сервисы предоставляют данные разных типов, это уже давно востребовано у пользователя, то есть это уже давно не только текстовая информация, но и медиа-контент и, допустим, даже если это текстовая информация, то она, возможно, представлена самим разными структурами. То есть пользователь привык пользовать различные типы информации в достаточно больших объемах из-за развития веб-сервисов.
Сами приложения, поскольку рынок диктует, обеспечивает большой охват пользователей, сами приложения становятся масштабируемыми, рынок заставляет их масштабироваться и они ищут возможности для такого масштабирования, поэтому облачные технологии, которые предложены разработчиками, являются естественным выходом для необходимости компаний и сервисов масштабироваться.
Новая модель дистрибуции означает - есть мнение, что, чем больше контента потребляют пользователи, тем это более выгодно бизнесу, поэтому бизнес еще и сам теперь придумывает, сервисы сами придумывают, какого вида и структуру контента нужно давать пользователю. Большую роль в этом всем играет технология виртуализации, поскольку затраты ресурсов и усилий на управление своими вычислительными возможностями и возможностями хранения данных у компании ограничены и рост этих объемов опережает рост ресурсов, поэтому они вынуждены отдавать в аутсорсинг, размещаться не на физических серверах, а на виртуальных, и таким образом продолжать расти, отвечать на требования рынка. С другой стороны корпоративный сектор тоже предъявляет требования к тому, чтобы средства хранения и обработки данных изменялись, это давление достаточно ощутимо на аналитиков. С одной стороны, мы говорим про то, что в компаниях в полтора - два с половиной раза возрастает общее количество данных, которые она генерирует, или собирает, или использует. С другой стороны, время анализа таких данных у аналитиков должно сокращаться, то есть современный рынок требует онлайн решение, решение в реальном времени. Данные требования не новы, но постепенно они приводят к тому, что он возникает некоторый разрыв, нужно переходить на качественно новый инструмент или качественно новые технологии.
На картинке представлена достаточно говорящая картинка о том, как видится совещание будущего это то, когда несколько человек онлайн и оффлайн обсуждают огромную кучу данных. Здесь вопрос уже не только в том, как эти данные хранить, но и в том, как эти данные обрабатывать и представлять. Задача представления данных — это, пожалуй, будет в ближайшее время самое серьезное. Если считать, что задачу хранения уже мы более-менее как-то, нам предлагают решения задачи обработки, сейчас ей плотно занимаются, а следующий шаг - это задача представления данных.
Итак, наша тема во всей это теме BigData больших данных - это технологии хранилищ, технологии хранения. Есть стандартное представление о SMAQ Stake, в которую входит Storage, технология непосредственно хранения данных, MapReduce, о нем подробно разговаривать ,сейчас только скажем, что это технология распределенных вычислений, и слой Query - это слой формирования запросов и получения результатов аналитики большей или меньшей сложности с точки зрения обработки этих данных. Я бы добавил, чуть-чуть расширил, мы скажем, что в BigData входят само еще понимание о данных, это все технологии и инструменты или все понимания, связанные о том, где у нас данные, какие данные, какой структуры они обладают и всеми свойствами, с какой скоростью они появляются, как быстро структура их меняется во времени и так далее. И только после этого у нас появляются требования к технологиям хранения, то есть хранилище — это, кажется, второй слой понимания данной темы, и я сюда добавлю эту схему представления данных, о чем уже сказал ранее.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.