Анализ и визуализация данных на языке R

Загрузка данных и базовые графики

В данной лекции рассматриваются практические аспекты работы с языком R в среде RStudio применительно к анализу и визуализации данных. Слушатели знакомятся с процессом настройки рабочей среды (указание рабочей папки), установкой и подключением необходимых пакетов (в частности, ggplot2 для визуализации). Основной практической частью является построение и модификация графиков на примере датасета mpg (автомобили). Лекция завершается демонстрацией бесшовной интеграции R и Power BI, позволяющей использовать мощь R-скриптов внутри интерактивных отчетов.

Основные мысли

1. Организация рабочего процесса: Ключевое удобство — установка рабочей папки (setwd()), что позволяет обращаться к файлам без указания полного пути.
2. Управление пакетами: Пакеты (например, ggplot2) нужно сначала установить (через меню Tools или install.packages()), а затем явно подключить командой library(). Подключение всех пакетов сразу неоптимально из-за расхода памяти.
3. Базовый синтаксис ggplot2: График строится на основе data.frame, эстетики (aes — оси X/Y, размер, цвет) и геометрических объектов (geom_point()). Результат можно сохранить в переменную.
4. Визуализация многомерных данных: С помощью параметров size, color и функций facet_grid() / facet_wrap() можно отображать на одном плоском графике до 5 измерений (например, X, Y, размер точки, цвет точки, разделение на панели по категориям).
5. Интеграция R и Power BI: Готовый отлаженный R-скрипт можно напрямую использовать внутри Power BI как источник визуализации, а данные, загруженные в Power BI, автоматически доступны в скрипте как переменная (dataset).
Показывать лекцию целиком
Краткое изложение

Приложения

MachineLearningDatasets
Лекция начинается с перехода от теории к практике — работе с датасетом mpg. Первым делом демонстрируется команда setwd() для указания рабочей папки, в которой лежат CSV-файлы, и getwd() для проверки. Путь указывается в стиле Unix (слеши / или двойные обратные слеши).

Далее рассматривается установка пакета ggplot2 для визуализации через меню Tools → Install Packages. Важно отметить галочку «Install dependencies». После установки пакет подгружается через library(ggplot2). Чтение данных происходит командой read.csv("mpg.csv", header = TRUE, sep = ",").

Основное время уделено построению графиков:
• Сначала создается пустой график: t <- ggplot(data = dataset, aes(x = cty, y = hwy)). Он пуст, т.к. не указан geom.
• Добавление точек: + geom_point(size = ...). Параметр size можно привязать к столбцу cyl (количество цилиндров).
• Масштабирование размера: scale_size_continuous(range = c(1,5)) для корректной пропорции.
• Изменение формы точек: shape = 21 (круг), 23 (ромб), 24 (треугольник).
• Использование цвета: вместо размера можно привязать цвет к фактору cyl (color = factor(cyl)), что даст дискретные цвета.
• Создание панелей (фасеток): facet_grid(year ~ drv) (сетка по строкам-годам и столбцам-приводу) и facet_wrap(~ class) (обертка по классу авто).

Заключительная часть посвящена интеграции с Power BI. В Power BI есть встроенный визуальный элемент «R script». Данные из Power BI автоматически попадают в переменную dataset. Пользователь пишет тот же код на R (например, ggplot2), и график отображается внутри отчета Power BI. Это позволяет использовать алгоритмы R, отсутствующие в стандартных функциях Power BI, и сочетать их с интерактивностью.

Выводы

• Умение правильно настраивать рабочую папку и управлять пакетами — основа эффективной работы в R.
• Библиотека ggplot2 предоставляет гибкий и мощный синтаксис для создания сложных многомерных графиков за счет комбинирования эстетик (aes) и геометрий (geom_*).
• Использование функций facet_grid и facet_wrap позволяет декомпозировать данные по категориальным переменным, создавая «матрицы» графиков.
• Интеграция R и Power BI открывает широкие возможности: R используется для уникальных вычислений или визуализации, а Power BI — для публикации, интерактивности и формирования отчетов.
• Знание R расширяет аналитические возможности даже в тех средах, где есть встроенные инструменты (как в Power BI), поскольку позволяет реализовать любые алгоритмы, не ограничиваясь стандартным набором.

Вопросы для самопроверки

1. Для чего нужна команда setwd() и какую проблему она решает при загрузке файлов?
2. Почему после установки пакета через install.packages() его функции сразу не доступны? Какая команда их подгружает?
3. В чем разница между параметрами size и color внутри aes() в ggplot2? Какой тип данных лучше подходит для каждого из них?
4. Что произойдет, если в ggplot() указать aes(x = cty, y = hwy), но забыть добавить + geom_point()?
5. Зачем нужна функция scale_size_continuous()? Приведите пример ситуации, когда без нее не обойтись.
6. Чем отличается facet_grid(year ~ drv) от facet_wrap(~ class)? Когда какой способ предпочтительнее?
7. Как при переносе R-скрипта в Power BI избежать ошибки «could not find function "ggplot"»?
8. Откуда R-скрипт внутри Power BI «знает», какие данные ему нужно обрабатывать? В какой переменной лежат эти данные?
Вернуться к учебному плану