Высшая школа бизнес-информатики

Анализ и визуализация данных на языке R

Освоение полного цикла анализа данных в R: от загрузки и предобработки до статистического моделирования, машинного обучения и визуализации. Особое внимание уделяется визуализации результатов.
Для всех RU
1 900 ₽ 3 000 ₽
или любая сумма на ваше усмотрение,
но не менее 890 ₽
Вы можете оплатить любую сумму, чтобы поддержать наш проект и авторов программы. Объем услуг не зависит от размера вашей оплаты.
Объем

36 час.
Длительность

30 дней
Нагрузка в неделю

9 час.
Формат обучения

Дистанционно (самостоятельно)
Описание Учебный курс посвящен анализу и визуализации данных с использованием языка R. Рассматриваются установка и основы синтаксиса, типы данных, загрузка и визуализация данных. Изучаются алгоритмы машинного обучения — метод k ближайших соседей, ассоциативные правила, кластеризация и нейронные сети, а также пакеты caret для построения и сравнения моделей. Особое внимание уделяется интеграции результатов с PowerBI. Материал адресован аналитикам данных и студентам направлений науки о данных.
Цели
  • Сформировать понимание возможностей языка R для анализа данных.
  • Развить умение применять базовые алгоритмы машинного обучения.
  • Подготовить к интеграции результатов с инструментами BI.
Чему я научусь?
  • Загружать данные и строить базовые графики в R.
  • Применять метод k ближайших соседей и ассоциативные правила.
  • Использовать кластеризацию и нейронные сети в R.
  • Интегрировать результаты анализа с PowerBI.

Авторы

Бекларян Армен
Бекларян Армен
Чему я научусь?
  • Загружать данные и строить базовые графики в R.
  • Применять метод k ближайших соседей и ассоциативные правила.
  • Использовать кластеризацию и нейронные сети в R.
  • Интегрировать результаты анализа с PowerBI.

Учебный план

Занятия
Экзамен экстерном Внимание! Экзамен экстерном не обязательный для сдачи. При желании вы можете его пройти, если хотите подтвердить свои знания по данному курсу без его изучения или поверить свои знания по нему. Экзамен экстерном можно сдать только один раз. 90 мин
1 Установка и основы синтаксиса R Данный материал представляет собой вводную лекцию к курсу по анализу и визуализации данных на языке программирования... Данный материал представляет собой вводную лекцию к курсу по анализу и визуализации данных на языке программирования R (в тексте — «Эр»). В лекции дается общая характеристика языка, его сравнение с Python, объясняется специфика использования R для манипуляции данными, машинного обучения и визуализации. Также рассматриваются вопросы установки языка R и интегрированной среды разработки RStudio, включая практическую демонстрацию первых команд. Материал ориентирован на начинающих и не требует предварительных знаний. ещё 54 мин
2 Основные типы данных Лекция посвящена основам работы в языке программирования R, с фокусом на переход от командной строки к... Лекция посвящена основам работы в языке программирования R, с фокусом на переход от командной строки к написанию R-скриптов. Слушатели знакомятся с основными типами данных: векторами (c), списками (list) и таблицами (data.frame). Особое внимание уделяется категориальным переменным (факторам) — номинальным и ординальным, а также принципам работы с векторами (индексация, срезы). В конце лекции демонстрируется создание плоской таблицы (data frame) как основного объекта для последующего анализа данных. ещё 78 мин
Тест 1 для курса # 51857 для курса Анализ и визуализация данных на языке R 40 мин
3 Загрузка данных и базовые графики В данной лекции рассматриваются практические аспекты работы с языком R в среде RStudio применительно к анализу... В данной лекции рассматриваются практические аспекты работы с языком R в среде RStudio применительно к анализу и визуализации данных. Слушатели знакомятся с процессом настройки рабочей среды (указание рабочей папки), установкой и подключением необходимых пакетов (в частности, ggplot2 для визуализации). Основной практической частью является построение и модификация графиков на примере датасета mpg (автомобили). Лекция завершается демонстрацией бесшовной интеграции R и Power BI, позволяющей использовать мощь R-скриптов внутри интерактивных отчетов. ещё 105 мин
4 Метод k ближайших соседей в R В данной лекции рассматривается практическая интеграция языка программирования R и платформы визуализации Power BI. Автор демонстрирует,... В данной лекции рассматривается практическая интеграция языка программирования R и платформы визуализации Power BI. Автор демонстрирует, как использовать алгоритмические возможности R (в частности, алгоритм k-ближайших соседей, kNN) внутри Power BI для решения задачи медицинской диагностики. Лекция охватывает полный цикл работы: от установки необходимых пакетов (класс, RTools) и подготовки данных (нормализация, разделение на обучающую и тестовую выборки) до написания R-скрипта, выполнения предсказаний и анализа точности модели с помощью визуальных инструментов Power BI. ещё 102 мин
Тест 2 для курса # 51857 для курса Анализ и визуализация данных на языке R 40 мин
5 Алгоритм ассоциативных правил. Теория Лекция посвящена применению алгоритма ассоциативных правил для анализа данных на языке R. Алгоритм широко используется для... Лекция посвящена применению алгоритма ассоциативных правил для анализа данных на языке R. Алгоритм широко используется для формирования потребительской корзины — выявления закономерностей в транзакционных данных (покупках). Рассматриваются ключевые метрики (Support, Confidence, Lift), их расчёт и интерпретация. Также обсуждается практическая ценность метода для маркетинга (скидочные акции) и отличие от персонализированных алгоритмов. В конце лекции анонсируется реализация алгоритма двумя способами: на R и в Power BI. ещё 66 мин
6 Алгоритм ассоциативных правил. Практика В лекции рассматривается практическая реализация алгоритма поиска ассоциативных правил (Apriori) на языке R. Слушатель знакомится с... В лекции рассматривается практическая реализация алгоритма поиска ассоциативных правил (Apriori) на языке R. Слушатель знакомится с процессом подготовки данных для работы с «транзакционными» (разреженными) данными, где количество покупок в каждой строке различно. Описаны шаги: установка и загрузка библиотек (arules, Matrix), чтение данных специальной функцией (read.transactions), первичный анализ через summary и inspect, визуализация частоты товаров (itemFrequencyPlot). Основное внимание уделяется настройке параметров алгоритма Apriori (support, confidence, minlen) и интерпретации полученных правил (по лифту). В конце анонсируется перенос этого же подхода в среду Power BI. ещё 45 мин
Тест 3 для курса # 51857 для курса Анализ и визуализация данных на языке R 40 мин
7 Алгоритм ассоциативных правил. Интеграция с PowerBI В данной лекции рассматривается практическое применение алгоритма ассоциативных правил (Apriori) в среде Power BI с использованием... В данной лекции рассматривается практическое применение алгоритма ассоциативных правил (Apriori) в среде Power BI с использованием R-скриптов. Автор демонстрирует полный цикл обработки данных: от загрузки файла Groceries.csv до визуализации полученных правил в виде интерактивного графа. Особое внимание уделяется приведению результатов анализа к типу data.frame, необходимому для корректной работы Power BI, а также постобработке правил (разделение на левую и правую части, удаление лишних символов) и созданию наглядного отчета с помощью визуализации Force-Directed Graph. ещё 51 мин
8 Теория кластеризации В данной лекции рассматривается раздел машинного обучения — кластеризация (алгоритмы сегментации) как метод обучения без учителя.... В данной лекции рассматривается раздел машинного обучения — кластеризация (алгоритмы сегментации) как метод обучения без учителя. В отличие от классификации, где классы объектов предопределены заранее, кластеризация позволяет самостоятельно разбить данные на неизвестные ранее группы на основе понятия «расстояния» между объектами. Подробно разбираются иерархические (агломеративные и дивизивные), плотностные, модельные, концептуальные, сетевые и итеративные алгоритмы. Основной фокус сделан на методе k-средних (k-means): его принцип работы, критерии остановки, преимущества, недостатки (чувствительность к выбросам, необходимость заранее знать число кластеров, зависимость от начальных центров) и способы их преодоления (k-means++, нечёткая кластеризация). Также упомянуты индексы для выбора оптимального числа кластеров (Галинского-Харабаша и др.). ещё 81 мин
Тест 4 для курса # 51857 для курса Анализ и визуализация данных на языке R 40 мин
9 Алгоритм k-средних и интеграция с PowerBI В лекции рассматривается практическая реализация алгоритма кластеризации K-средних на примере датасета с химическими характеристиками белого вина.... В лекции рассматривается практическая реализация алгоритма кластеризации K-средних на примере датасета с химическими характеристиками белого вина. Автор демонстрирует полный цикл работы: от загрузки и предобработки данных (замена разделителей, нормализация) до непосредственного применения алгоритма и интерпретации результатов с помощью тепловых карт (heatmap). Особое внимание уделяется критической ошибке — выбору количества кластеров «на глаз» (по числу категорий качества) — и её исправлению с помощью метода «локтя» (анализа суммы квадратов расстояний до центров кластеров). В итоге показывается, как правильно определить оптимальное число кластеров (3–4) и содержательно проанализировать полученные группы по химическим параметрам и экспертному качеству. ещё 72 мин
10 Нейронные сети в R В данной лекции рассматривается практическое применение нейронных сетей для решения задачи регрессии на языке R. В... В данной лекции рассматривается практическое применение нейронных сетей для решения задачи регрессии на языке R. В качестве примера используется датасет, содержащий характеристики бетона (содержание цемента, воды, добавок и т.д.), где целевой переменной выступает прочность материала. Лектор демонстрирует полный цикл работы: от загрузки и нормализации данных в Power BI до построения, обучения и визуализации нейронной сети. Особое внимание уделяется сравнению архитектур сетей (количество нейронов в скрытом слое) и анализу ошибки прогноза (RMSE). ещё 120 мин
Тест 5 для курса # 51857 для курса Анализ и визуализация данных на языке R 40 мин
11 Пакет caret и множественное применение алгоритмов машинного обучения Лекция посвящена использованию пакета Caret в языке R для решения задач классификации. На примере классического датасета... Лекция посвящена использованию пакета Caret в языке R для решения задач классификации. На примере классического датасета «Ирис Фишера» (три вида цветка, четыре метрических признака) демонстрируется полный цикл машинного обучения: загрузка данных, их разбиение на обучающую и тестовую выборки, визуальный анализ, обучение сразу пяти алгоритмов (линейный дискриминантный анализ, деревья решений, k-ближайшие соседи, метод опорных векторов, случайный лес), сравнение моделей с помощью кросс-валидации и выбор лучшей модели для предсказания. ещё 138 мин
Тест 6 для курса # 51857 для курса Анализ и визуализация данных на языке R 40 мин
Тренировочный экзамен Внимание! Тренировочный экзамен экстерном не обязательный для сдачи. При желании вы можете его пройти, если хотите проверить свои знания курса перед сдачей экзамена. Тренировочный экзамен можно сдавать сколько угодно один раз. 90 мин
Экзамен 120 мин

Какой документ я получу?

Сертификат

Выдаётся автоматически после успешного завершения программы.

Удостоверение о повышении квалификации

Выдается при наличии среднего специального или высшего образования (необходимые документы).

Стоимость программы

1 900 ₽ 3 000 ₽
или любая сумма на ваше усмотрение,
но не менее 890 ₽
Вы можете оплатить любую сумму, чтобы поддержать наш проект и авторов программы. Объем услуг не зависит от размера вашей оплаты.