Компьютерные науки

Введение в аналитику больших массивов данных

Программа об основных понятиях аналитической обработки Big Data. Рассматриваются технологии работы с данными, процессы аналитики и машинное обучение.
Студентов 5217 Выпускников 1259 Для специалистов
690 ₽ 1 200 ₽
или любая сумма на ваше усмотрение
Вы можете оплатить любую сумму, чтобы поддержать наш проект и авторов программы. Объем услуг не зависит от размера вашей оплаты.
Темы:
Базы данных
Объем

36 час.
Длительность

30 дней
Нагрузка в неделю

9 час.
Формат обучения

Дистанционно (самостоятельно)
Описание Учебная программа дает комплексный обзор технологий и вызовов в сфере аналитики больших данных. Изучаются принципы обработки массивов информации, структура аналитического процесса и оригинальные методики машинного обучения. Она разработана для дата-аналитиков, менеджеров ИТ-проектов и исследователей, стремящихся понять архитектуру решений для работы с Big Data. Процесс обучения выстроен от теоретического определения больших данных к изучению вызовов и аналитики. Последовательное изложение материала с тестами формирует базу для изучения машинного обучения.
Цели
  • Сформировать базовое представление о концепции больших данных.
  • Раскрыть этапы и специфику процесса аналитической обработки.
  • Познакомить с основами и технологиями машинного обучения.
Чему я научусь?
  • Идентифицировать основные вызовы при работе с Big Data.
  • Планировать и организовывать процесс аналитики больших данных.
  • Применять базовые концепции машинного обучения в анализе.

Авторы

Аникин Юрий Александрович
Аникин Юрий Александрович
Кандидат технических наук, преподаватель кафедры Общей информатики ФИТ НГУ, директор ООО Футуролаб.
Борисова Ирина Артёмовна
Борисова Ирина Артёмовна
Кандидат технических наук, ассистент кафедры.
Загоруйко Николай Григорьевич
Загоруйко Николай Григорьевич
Доктор технических наук, профессор кафедры Общей информатики ФИТ НГУ, заведующий лабораторией анализа данных ИМ СО РАН.
Зырянов Александр Олегович
Зырянов Александр Олегович
Data аналитик ООО Экспасофт.
Павловский Евгений Николаевич
Павловский Евгений Николаевич
Кандидат физико-математических наук, старший преподаватель кафедры.
Чему я научусь?
  • Идентифицировать основные вызовы при работе с Big Data.
  • Планировать и организовывать процесс аналитики больших данных.
  • Применять базовые концепции машинного обучения в анализе.

Учебный план

Занятия
Экзамен экстерном Внимание! Экзамен экстерном не обязательный для сдачи. При желании вы можете его пройти, если хотите подтвердить свои знания по данному курсу без его изучения или поверить свои знания по нему. Экзамен экстерном можно сдать только один раз. 90 мин
1 Общее понятие о больших данных В лекции рассматривается феномен больших данных как результат технологической эволюции и общественного запроса. Материал построен вокруг... В лекции рассматривается феномен больших данных как результат технологической эволюции и общественного запроса. Материал построен вокруг четырех базовых характеристик (V больших данных) и разбора инженерных аспектов: от хранения и безопасности до жизненного цикла информации. Логика изложения движется от общих предпосылок и определений к конкретным технологическим решениям, таким как Hadoop и MapReduce, завершаясь портретом специалиста-аналитика. ещё
2 Основные вызовы больших данных В лекции рассматриваются ключевые характеристики больших данных, известные как V-факторы (объем, скорость, разнообразие, ценность). Анализируются связанные... В лекции рассматриваются ключевые характеристики больших данных, известные как V-факторы (объем, скорость, разнообразие, ценность). Анализируются связанные с ними проблемы: сложность извлечения ценности, ограничения на хранение и передачу данных, вопросы качества и достоверности информации. Отдельное внимание уделяется драйверам роста рынка и важности понимания структурированности данных как меры их пригодности для машинной обработки. В заключение раскрывается роль виртуализации как технологической основы, сделавшей возможной работу с большими данными. ещё
3 Определение термина большие данные Материал посвящен введению в проблематику больших данных. Вначале анализируются существующие определения термина, чтобы выделить ключевые характеристики... Материал посвящен введению в проблематику больших данных. Вначале анализируются существующие определения термина, чтобы выделить ключевые характеристики явления. Далее раскрывается фундаментальное различие между данными, информацией и знанием, что необходимо для понимания ценности анализа. Основной акцент сделан на технических вызовах: экспоненциальном росте объемов информации и проблеме их перемещения. В качестве решения рассматривается парадигма распределенных вычислений MapReduce, обеспечивающая обработку данных непосредственно в местах их хранения, и её наиболее популярная реализация — платформа Hadoop. ещё
4 Процесс аналитики В материале рассматривается процесс работы с большими данными, опирающийся на методологию CRISP-DM. Изложение строится от общих... В материале рассматривается процесс работы с большими данными, опирающийся на методологию CRISP-DM. Изложение строится от общих принципов и ограничений, накладываемых объемом информации, к конкретным этапам анализа: от понимания бизнес-задачи до внедрения решения. Далее раскрываются ключевые принципы аналитики, иллюстрируемые практическими кейсами, и требования к компетенциям специалистов (Data Scientist и Data Engineer). Завершается материал описанием специфики проектов и важности коммуникации результатов для бизнеса. ещё
Процесс аналитики тест для курса Введение в аналитику больших массивов данных 45 мин
5 Введение в когнитивный анализ данных В лекции рассматривается процесс познания через призму анализа данных. Изложение строится от общего контекста (роль данных... В лекции рассматривается процесс познания через призму анализа данных. Изложение строится от общего контекста (роль данных и интеллекта) к частному (структура эмпирической гипотезы). Автор показывает, как накопление фактов ведет к выдвижению и последовательному усилению гипотез, описывает их ключевые характеристики (опровержимость, подтвержденность, простота) и объясняет, как гипотеза превращается в закономерность и теорию. ещё
6 Классификация задач. Функция конкурентного сходства В лекции рассматривается новый подход к решению задач анализа данных на основе функции конкурентного сходства. Излагается... В лекции рассматривается новый подход к решению задач анализа данных на основе функции конкурентного сходства. Излагается логика перехода от традиционных мер сходства, зависящих только от пары объектов, к относительной мере, учитывающей контекст — окружение и конкурирующие классы. Описываются основные типы задач анализа данных: редактирование, распознавание, кластеризация, заполнение пробелов и их комбинации. Демонстрируется, как единая мера сходства позволяет унифицировать подходы к решению этих задач. ещё
7 Разработка алгоритмов на базе FRiS-функции В лекции раскрывается универсальность функции конкурентного сходства (FRiS-функции) как инструмента для решения ключевых задач анализа данных.... В лекции раскрывается универсальность функции конкурентного сходства (FRiS-функции) как инструмента для решения ключевых задач анализа данных. Изложение строится от простого к сложному: сначала описывается логика вычисления функции и ее свойства, затем демонстрируется ее применение в задачах обучения с учителем (распознавание), без учителя (таксономия) и, наконец, в смешанной задаче частичного обучения. Показывается, как единый подход, основанный на отборе эталонных объектов («столпов»), позволяет эффективно строить модели для данных с разной степенью размеченности. ещё
8 Информативность и выбор признаков В лекции рассматривается проблема выбора информативных признаков как ключевой этап анализа данных. Изложение строится от обоснования... В лекции рассматривается проблема выбора информативных признаков как ключевой этап анализа данных. Изложение строится от обоснования важности задачи к описанию двух стратегий: фильтрации (отбор исходных признаков) и селекции (конструирование новых). Далее раскрываются конкретные алгоритмы, критерии оценки информативности и демонстрируется их эффективность на практических примерах. Логика повествования ведет от постановки задачи к инструментам решения и подтверждению их состоятельности. ещё
9 Обнаружение ошибок и заполнение пробелов В лекции рассматриваются методы обнаружения ошибок и заполнения пропусков в таблицах и кубах данных. Основной акцент... В лекции рассматриваются методы обнаружения ошибок и заполнения пропусков в таблицах и кубах данных. Основной акцент сделан на алгоритме Z, который использует принципы локальной компактности и избыточности данных. Изложение строится по нарастающей: от постановки задачи и базовых гипотез к формированию «компетентной» подматрицы, оценке ошибок, примерам практического применения (прогнозирование, анализ геоданных) и завершается обсуждением ограничений и перспектив развития подхода в контексте задач с большими данными. ещё
Обнаружение ошибок и заполнение пробелов тест для курса Введение в аналитику больших массивов данных 35 мин
10 Общие сведения о языке R. Основные функции В лекции излагаются базовые сведения о языке программирования R: его назначение, история создания и место среди... В лекции излагаются базовые сведения о языке программирования R: его назначение, история создания и место среди аналитических инструментов. Далее материал выстраивается вокруг ключевой парадигмы языка: всё в R является объектом, а любая операция — функцией. Рассматривается структура программ (выражения, символы, среда), поведение объектов при присваивании, концепция неизменяемости. Затем вводятся основные типы данных и специальные константы (NA, NULL, NaN). Завершается лекция разбором механизма динамической типизации и правил автоматического приведения типов. ещё
11 Синтаксис В лекции системно излагаются основы синтаксиса языка R. Материал строится от простого к сложному: сначала рассматриваются... В лекции системно излагаются основы синтаксиса языка R. Материал строится от простого к сложному: сначала рассматриваются базовые типы данных и их представление (числовые, текстовые векторы, символы), затем — операторы и правила их выполнения, включая присваивание и группировку выражений. Далее описываются управляющие конструкции (условия, циклы) и завершается изложение разбором способов доступа к элементам структур данных. Такой подход формирует целостное понимание того, как устроен и работает код на R. ещё
12 Типы данных В лекции рассматривается система типов данных языка R. Материал излагается от простого к сложному: сначала описываются... В лекции рассматривается система типов данных языка R. Материал излагается от простого к сложному: сначала описываются примитивные векторы и их разновидности, затем составные структуры — списки, массивы и матрицы. Завершающая часть посвящена таблицам (data frame) как основному формату для анализа данных. Особое внимание уделяется практическим аспектам: способам создания объектов, логике их хранения и корректному доступу к элементам через индексы и операторы. ещё
Типы данных тест для курса Введение в аналитику больших массивов данных 45 мин
13 Weka В лекции рассматриваются готовые программные решения для анализа данных (WeKa, KNIME, Orange, RapidMiner). Изложение строится от... В лекции рассматриваются готовые программные решения для анализа данных (WeKa, KNIME, Orange, RapidMiner). Изложение строится от общего к частному: сначала дается обзор возможностей этого класса систем, затем подробно разбирается графический интерфейс Weka (Knowledge Flow) на практическом примере оценки качества классификации. Завершается материал анализом сильных и слабых сторон таких инструментов, определением сфер их применения и разбором структуры файла ARFF. ещё
14 Визуализация В материале рассматривается роль визуализации как ключевого этапа анализа данных, позволяющего выявлять зависимости, выбросы и выбирать... В материале рассматривается роль визуализации как ключевого этапа анализа данных, позволяющего выявлять зависимости, выбросы и выбирать стратегию моделирования. Изложение строится на сравнении двух полярных подходов: готовых BI-студий (на примере Tableau) и программируемых библиотек (на примере D3.js). Логика повествования движется от общих целей визуализации через практическую демонстрацию возможностей к анализу сильных и слабых сторон каждого инструмента для определения границ их применимости. ещё
15 R как инструмент Data Mining В лекции рассматривается язык программирования R как ключевой инструмент для интеллектуального анализа данных. Материал излагается последовательно:... В лекции рассматривается язык программирования R как ключевой инструмент для интеллектуального анализа данных. Материал излагается последовательно: от базового понятия Data Frame и способов доступа к его элементам до практических методов импорта и экспорта данных из различных источников. Логика повествования ведет от простых операций индексирования к более сложным — логической фильтрации и работе с файлами, завершаясь обзором интеграции R с экосистемой Big Data, в частности с Hadoop, для масштабирования вычислений. ещё
16 Решение задач Data Mining. R и Hadoop В лекции рассматриваются ключевые методы интеллектуального анализа данных на языке R. Изложение строится от простого к... В лекции рассматриваются ключевые методы интеллектуального анализа данных на языке R. Изложение строится от простого к сложному: сначала разбирается логика построения деревьев решений и случайного леса для задач классификации, затем — принципы регрессионного анализа для прогнозирования. Далее демонстрируется работа алгоритма кластеризации K-means при отсутствии целевых переменных. Завершается материал практическим примером организации распределенных вычислений через парадигму MapReduce. Основной акцент сделан на практическом применении функций и пакетов R. ещё
17 Основные библиотеки для Data Mining В лекции проводится сравнительный анализ языков Python и R для задач интеллектуального анализа данных. Рассматриваются сильные... В лекции проводится сравнительный анализ языков Python и R для задач интеллектуального анализа данных. Рассматриваются сильные и слабые стороны Python, обосновывается его выбор для создания конечных продуктов. Основной фокус направлен на изучение ключевых библиотек научного стека: NumPy, SciPy, Pandas, Matplotlib и IPython. Подробно разбираются принципы работы с многомерными массивами в NumPy: их создание, векторизованные операции, индексация и математические функции, что формирует базу для дальнейшей работы с данными. ещё
18 Возможности библиотеки Pandas В лекции рассматриваются основы работы с библиотекой Pandas в Python. Изложение строится от простого к сложному:... В лекции рассматриваются основы работы с библиотекой Pandas в Python. Изложение строится от простого к сложному: сначала вводится понятие одномерной структуры Series и её индексов, затем описывается создание и модификация табличной структуры DataFrame. Практическая часть демонстрирует применение алгоритма K-Means для кластеризации данных. Завершается материал сравнением Python и R и обоснованием выбора инструмента для анализа данных. ещё
Возможности библиотеки Pandas тест для курса Введение в аналитику больших массивов данных 50 мин
19 Зачем нужны новые хранилища В лекции рассматриваются предпосылки перехода к новым технологиям хранения данных. Анализируются ограничения традиционных реляционных баз данных... В лекции рассматриваются предпосылки перехода к новым технологиям хранения данных. Анализируются ограничения традиционных реляционных баз данных (РСУБД) в контексте задач Big Data: проблемы масштабирования, скорости обработки и работы с разнородными данными. Вводится понятие NoSQL, разбираются свойства таких систем и теорема CAP. Материал подводит к пониманию типов NoSQL-хранилищ и их связи с технологией MapReduce для распределённых вычислений. ещё
20 Свойства больших данных и ограничения RDBMS В материале рассматриваются фундаментальные ограничения реляционных баз данных (РБД) при работе с большими данными (Big Data).... В материале рассматриваются фундаментальные ограничения реляционных баз данных (РБД) при работе с большими данными (Big Data). Логика изложения строится вокруг ключевых характеристик Big Data: объем, скорость, разнообразие. Анализируется, почему традиционная опора на структурирование и индексы перестает работать при выравнивании скоростей чтения и записи, а требования к горизонтальному масштабированию вступают в конфликт с принципами консистентности данных. Отдельное внимание уделяется проблемам разреженности и изменения схемы данных, которые делают РБД неоптимальным выбором для современного аналитического ландшафта. ещё
21 ACID требования, CAP-теорема, BASE архитектура В лекции рассматривается эволюция требований к системам хранения данных при переходе к распределённым архитектурам. Излагается логика... В лекции рассматривается эволюция требований к системам хранения данных при переходе к распределённым архитектурам. Излагается логика перехода от классической модели ACID, гарантирующей надёжность транзакций, к модели BASE, применяемой в больших данных. Центральное место занимает теорема CAP, объясняющая фундаментальный выбор между согласованностью, доступностью и устойчивостью к разделению в распределённых системах. На примерах показаны практические следствия этого выбора для проектирования приложений. ещё
22 NoSQL В лекции раскрывается понятие NoSQL и его связь с реляционными системами. Сначала уточняется сам термин и... В лекции раскрывается понятие NoSQL и его связь с реляционными системами. Сначала уточняется сам термин и принципы, противопоставляющие NoSQL традиционным ACID-хранилищам. Далее материал выстроен по логике перехода от простых моделей к сложным: рассматриваются хранилища «ключ-значение», колоночные, документоориентированные и графовые базы. Для каждого типа описаны устройство, сильные стороны, ограничения и сферы применения. Завершается изложение анализом эволюции SQL и ограничений CAP-теоремы. ещё
23 Интерфейсы В лекции рассматриваются способы взаимодействия пользователей с нереляционными базами данных, включая SQL-подобные языки и REST API.... В лекции рассматриваются способы взаимодействия пользователей с нереляционными базами данных, включая SQL-подобные языки и REST API. Основное внимание уделено платформе Hadoop: описаны ее архитектура, компоненты (HDFS, MapReduce, Hive) и принципы работы. Материал построен от общего обзора интерфейсов к детальному разбору устройства распределенной файловой системы и механизмов обработки данных, что позволяет понять, как обеспечивается отказоустойчивость и параллелизм в больших кластерах. ещё
24 MapReduce В лекции рассматривается технология распределенных вычислений MapReduce как способ повышения производительности обработки больших данных за счет... В лекции рассматривается технология распределенных вычислений MapReduce как способ повышения производительности обработки больших данных за счет локализации вычислений и разделения процесса на независимые фазы. Далее излагаются принципы NoSQL-систем: их ориентация на распределенное хранение, компромиссы согласно теореме CAP, а также ключевые преимущества (масштабируемость, снижение затрат на администрирование, гибкость) и сдерживающие факторы внедрения (незрелость технологий, отсутствие транзакций). ещё
25 Ключ-значение В лекции рассматриваются базы данных класса NoSQL, а именно тип «ключ-значение». Излагается логика устройства простейших хранилищ,... В лекции рассматриваются базы данных класса NoSQL, а именно тип «ключ-значение». Излагается логика устройства простейших хранилищ, где данные доступны только по уникальному идентификатору. На примере Redis разбираются архитектурные особенности: хранение в оперативной памяти, однопоточность, механизмы репликации Master-Slave. Анализируются сильные стороны (скорость, простота) и ограничения (риск потери данных). Дается объяснение, для каких практических задач — кэширование, хранение логов или показаний датчиков — этот тип баз подходит оптимально. ещё
26 Колоночные В лекции рассматриваются колоночные базы данных как альтернатива реляционным. Объясняется их ключевая абстракция — «очень большая... В лекции рассматриваются колоночные базы данных как альтернатива реляционным. Объясняется их ключевая абстракция — «очень большая и разреженная таблица», способная хранить миллиарды строк и миллионы столбцов без потерь на пустые ячейки. На примере HBase разбирается логика хранения данных, включая семейства колонок, версионность и принципы масштабирования. Материал подводит к пониманию критериев выбора между HBase и традиционными SQL-базами. ещё
27 Документо-ориентированные В лекции рассматриваются документо-ориентированные базы данных (на примере MongoDB) как класс NoSQL-систем. Излагается логика перехода от... В лекции рассматриваются документо-ориентированные базы данных (на примере MongoDB) как класс NoSQL-систем. Излагается логика перехода от жестких схем к гибким структурам: сначала объясняется принцип хранения данных в виде документов и коллекций, затем разбираются механизмы масштабирования (репликация и шардинг). Далее демонстрируются базовые операции с данными, и в завершение анализируются причины популярности таких решений среди разработчиков — простота и снятие ограничений на изменение структуры. ещё
28 Графовые В лекции рассматриваются графовые базы данных как класс NoSQL-систем. Основной акцент сделан на их отличии от... В лекции рассматриваются графовые базы данных как класс NoSQL-систем. Основной акцент сделан на их отличии от реляционных СУБД: они оптимизированы для работы с сильно связанными данными и длинными цепочками связей. На примере флагмана Neo4j разбираются архитектура, модель данных, язык запросов и ограничения, связанные с распределённостью. В завершение даются практические рекомендации по выбору типа хранилища в контексте теоремы CAP для решения конкретных бизнес-задач. ещё
Графовые тест для курса Введение в аналитику больших массивов данных 40 мин
Тренировочный экзамен Внимание! Тренировочный экзамен экстерном не обязательный для сдачи. При желании вы можете его пройти, если хотите проверить свои знания курса перед сдачей экзамена. Тренировочный экзамен можно сдавать сколько угодно один раз. 90 мин
Экзамен 60 мин

Какой документ я получу?

Сертификат

Выдаётся автоматически после успешного завершения программы.

Удостоверение о повышении квалификации

Выдается при наличии среднего специального или высшего образования (необходимые документы).

Стоимость программы

690 ₽ 1 200 ₽
или любая сумма на ваше усмотрение
Вы можете оплатить любую сумму, чтобы поддержать наш проект и авторов программы. Объем услуг не зависит от размера вашей оплаты.