Введение в машинное обучение и анализ данных

Линейная и полиномиальная регрессия. Корреляционный анализ

В лекции рассматривается модель линейной регрессии как базовый инструмент predictive analytics. Материал построен от простого к сложному: сначала разбирается математическая суть метода наименьших квадратов (МНК) для подбора коэффициентов прямой, затем демонстрируются способы автоматизации расчетов в Excel (функции, графики, Пакет анализа). Далее автор переходит к обобщению: показывает нелинейные типы трендов (полиномиальный, экспоненциальный, синусоидальный) и объясняет логику выбора модели. В завершение рассматриваются методы визуальной оценки корреляций между несколькими переменными с помощью графиков рассеивания.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Объяснить суть задачи построения линейной регрессии и метода наименьших квадратов (МНК).
2. Рассчитать коэффициенты уравнения парной линейной регрессии по формулам.
3. Интерпретировать смысл коэффициента наклона и свободного члена уравнения.
4. Применить инструменты Excel (функция ТЕНДЕНЦИЯ, линия тренда, Пакет анализа) для построения регрессионной модели.
5. Оценить качество построенной модели с помощью коэффициента детерминации (R²).
6. Различать типы трендов (линейный, полиномиальный, экспоненциальный, синусоидальный) и обосновывать выбор оптимальной модели.
7. Анализировать парные корреляции между переменными, используя матричные диаграммы рассеивания.
Показывать лекцию целиком
Краткое изложение

Для лекции используйте файлы:

Основы линейной регрессии

Мы продолжаем изучать алгоритмы машинного обучения и переходим к регрессионным моделям. Начнем с самой простой из них — модели линейной регрессии (Linear Regression).

Задача состоит в том, чтобы найти такую прямую линию, которая наилучшим образом описывает набор данных (наблюдений). В общем виде уравнение прямой выглядит так: Y = A + B * X. Наша цель — подобрать коэффициенты A (свободный член) и B (коэффициент наклона), которые определяют положение этой прямой на плоскости.

Рассмотрим пример. У нас есть данные за 10 месяцев: X — это номер месяца, а Y — количество предметов, которые супруга оставила на столике в ванной. Это классическая задача прогнозирования: мы хотим на основе имеющейся динамики предсказать, сколько предметов будет, например, на 16-й месяц.

Метод наименьших квадратов (МНК)

Для поиска оптимальных коэффициентов используется метод наименьших квадратов (МНК, Ordinary Least Squares). Его суть — минимизация суммы квадратов ошибок (отклонений реальных точек от предсказанных значений).

Математика, стоящая за поиском коэффициентов, уже формализована. Чтобы рассчитать B, мы сначала находим:

  1. Сумму произведений X и Y.
  2. Сумму всех X и всех Y.
  3. Сумму квадратов X.

Далее вычисляем средние значения X и Y. После этого подставляем полученные суммы в формулу для коэффициента B:
B = (N * Σ(XY) – ΣX * ΣY) / (N * Σ(X²) – (ΣX)²)

Для нашего примера расчет дал значение B = 0.976. Коэффициент A рассчитывается проще:
A = Y_среднее – B * X_среднее

В нашем случае A ≈ 5.13.

Итоговое уравнение регрессии выглядит так: Y = 5.13 + 0.976 * X. Подставив X = 16, получаем прогноз: примерно 20.75 предметов. Важно отметить, что коэффициент B близок к единице. Это означает, что тренд возрастающий и довольно крутой (угол наклона близок к 45 градусам).

Инструменты автоматизации в Excel

Производить такие расчеты вручную не обязательно. В Excel есть несколько способов сделать это автоматически:

  1. Функция ТЕНДЕНЦИЯ: Достаточно указать диапазон известных значений Y, диапазон X и значение X для прогноза. Excel мгновенно вернет предсказанное значение.
  2. Линия тренда на графике: Построив точечный график, можно кликнуть по точкам данных правой кнопкой мыши и выбрать «Добавить линию тренда». В настройках можно вывести уравнение на график и коэффициент детерминации.
  3. Пакет анализа: Это встроенная надстройка Excel. Если включить ее в настройках, во вкладке «Данные» появится кнопка «Анализ данных». Выбрав инструмент Регрессия и указав входные интервалы, вы получите полный отчет: все коэффициенты, стандартные ошибки, таблицу дисперсионного анализа и остатки.

Коэффициент детерминации (R²)

Важнейшей метрикой качества модели является коэффициент детерминации (R² или R-squared). Он показывает, какая доля дисперсии (разброса) зависимой переменной (Y) объясняется построенной моделью.

В нашем примере R² ≈ 0.66. Это значит, что 66% изменений количества предметов объясняется временем (номером месяца). Это неплохой результат, но в идеале хотелось бы видеть значения выше 0.8.

Смежной метрикой является коэффициент корреляции (R). Для нашей модели он равен 0.81. Он показывает силу линейной связи между переменными (от -1 до 1).

Нелинейные тренды

Данные не всегда хорошо описываются прямой линией. Часто требуются нелинейные модели:

При выборе модели важно соблюдать баланс между точностью и сложностью. Слишком сложная модель может идеально подогнаться под текущие данные, но потеряет предсказательную силу (явление переобучения). Глядя на график данных без тренда, аналитик должен предположить, какая форма зависимости подходит лучше всего: прямая, парабола или синусоида.

Анализ многомерных данных

Когда переменных больше одной, используются специальные графики.

Краткие итоги

Переход от интуитивного восприятия данных к формализованному прогнозированию требует не только знания алгоритмов, но и понимания ограничений используемых инструментов. В основе изложенного материала лежит принцип аппроксимации: стремление описать реальные процессы с помощью математических функций, параметры которых подбираются на основе исторических наблюдений. Простота модели, как ни парадоксально, является её преимуществом, поскольку обеспечивает интерпретируемость. Когда исследователь видит уравнение прямой, он четко понимает, что рост фактора на единицу влечет пропорциональный рост результата. Это создает основу для принятия управленческих решений, в отличие от «черных ящиков» сложных алгоритмов.

Однако мир редко бывает линейным, и попытка втиснуть сложную динамику в рамки прямой ведет к потере качества. В связи с этим ключевым навыком становится визуальная диагностика. Умение читать диаграммы рассеивания позволяет отличить случайный шум от структурной зависимости. Именно визуальный анализ определяет, следует ли остановиться на полиноме, экспоненте или синусоиде. Использование матриц рассеивания позволяет выйти за пределы парного анализа и оценить взаимодействие факторов в пространстве, что приближает модель к реальной многомерности явлений.

Практическая ценность полученных знаний заключается в демонстрации того, что современные программные средства, даже такие массовые как Excel, нивелируют сложность вычислительной математики. Наличие готовых формул и пакетов анализа смещает фокус внимания специалиста с рутинного счета на содержательную интерпретацию. Специалист по данным становится не столько расчетчиком, сколько аналитиком, который должен правильно поставить задачу, выбрать тип модели, корректно интерпретировать коэффициент детерминации и, самое главное, сформулировать вывод, понятный конечному пользователю, например супругу, отстаивающему свое право на личное пространство в ванной.

1. Постановка задачи регрессии

Задача моделирования зависимости между переменными. Наличие одного предиктора (X) и целевой переменной (Y). Уравнение линейной модели: Y = A + B*X. Цель — подобрать оптимальные коэффициенты.

2. Метод наименьших квадратов (МНК)

Принцип работы: минимизация ошибок (расстояний от точек до линии).

3. Практическая реализация в Excel

Вместо ручного счета можно использовать:

  1. Функция ТЕНДЕНЦИЯ: Быстрый прогноз для нового значения X.
  2. График: Добавление «Линии тренда» с выводом уравнения и коэффициента детерминации.
  3. Пакет анализа: Инструмент «Регрессия». Выдает полную таблицу коэффициентов, остатков и дисперсионный анализ.

4. Оценка качества модели

5. Переход к нелинейным моделям

Данные не всегда линейны. Необходимо визуально оценивать форму облака точек.

6. Анализ многомерных данных

Выводы

1. Линейная регрессия описывает зависимость переменных уравнением прямой Y = A + B*X.
2. Коэффициенты A и B подбираются методом наименьших квадратов (МНК), минимизирующим ошибки.
3. Коэффициент наклона B показывает, насколько быстро растет или падает целевая переменная.
4. Формулы МНК легко воспроизводятся вручную, но для ускорения работы используются программные средства.
5. Excel предоставляет три способа построения регрессии: функция ТЕНДЕНЦИЯ, линия тренда и Пакет анализа.
6. Пакет анализа Excel выводит детальную статистику, включая остатки, что удобно для диагностики модели.
7. Коэффициент детерминации (R²) показывает, какой процент вариации данных объяснен построенной моделью.
8. Значение R² = 0.66 указывает на то, что тренд объясняет большинство, но не все изменения данных.
9. Помимо линейной, существуют полиномиальная, экспоненциальная и синусоидальная модели трендов.
10. Выбор типа модели осуществляется на основе визуального анализа графика рассеивания (наличие циклов, ускорения роста).
11. Существует компромисс между точностью модели и её сложностью (интерпретируемостью).
12. Матрица рассеивания позволяет визуально оценить корреляцию между несколькими переменными одновременно.

Вопросы для самопроверки

1. Какую задачу решает алгоритм линейной регрессии?
2. В чем суть метода наименьших квадратов (МНК)?
3. Что означают коэффициенты A и B в уравнении регрессии?
4. Какие суммы необходимо вычислить, чтобы найти коэффициент B по формулам МНК?
5. Какие встроенные инструменты Excel можно использовать для автоматического построения регрессии?
6. Что показывает коэффициент детерминации (R²)?
7. Чем отличается интерпретация коэффициента наклона B от интерпретации R²?
8. В каких ситуациях линейная модель плохо подходит для описания данных?
9. Какие существуют виды нелинейных трендов?
10. Почему при выборе модели важна не только точность, но и её простота?
11. Как можно визуально определить наличие или отсутствие корреляции между двумя переменными?
12. Зачем нужна матричная диаграмма рассеивания при работе с несколькими признаками?
Вернуться к учебному плану