Основы бизнес-аналитики и науки о данных

Основы науки о данных

В лекции раскрывается суть науки о данных как мега-дисциплины, выросшей из классической математической статистики. Изложение строится от простого к сложному: сначала демонстрируются ограничения строгих статистических теорем, затем обосновывается переход к эмпирическим методам, где выводы базируются не на формальных доказательствах, а на экспериментальной точности. Показывается логика выбора и оценки моделей в условиях, когда практическая ценность быстрого решения становится важнее его абсолютного теоретического обоснования.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Объяснить фундаментальные отличия между классической математической статистикой и современной наукой о данных.
2. Сравнить понятия строгого теоретического доказательства и эмпирически полученного результата в контексте анализа данных.
3. Аргументировать причины, по которым практическая ценность модели часто приоритетнее наличия строгого математического обоснования.
4. Классифицировать аналитические задачи (например, качественные и количественные) и подбирать под них соответствующие классы методов.
5. Оценивать ограничения применения конкретного метода с учетом его вычислительной сложности и скорости сходимости.
6. Обобщить роль аппаратно-программных средств как ключевого драйвера развития науки о данных.
Показывать лекцию целиком
Краткое изложение


Что такое на самом деле Big Data и чем они прекрасны.
Лекция Андрея Себранта в Яндексе: 
https://www.youtube.com/watch?v=TEHdfPa1eJA

Мы продолжаем работу в рамках курса «Введение в бизнес-аналитику и науку о данных». Мы закончили первую часть — введение в бизнес-аналитику, и теперь переходим к науке о данных.

От наблюдений к статистике

Данные окружали нас всегда. Без анализа ретроспективной информации человечество не обходилось даже до появления компьютеров. Статистические наблюдения велись веками: от движения звезд до переписи населения. Именно накопленная статистика позволила Кеплеру вывести законы движения планет по эллиптическим траекториям. Так же испокон веков велся учет финансов и других факторов.

Однако все базовые методы анализа здесь — это статистические методы. Они основаны на наборе математических операций и строгих теоремах. Пример из переписи населения:
• Просто посчитать количество строк, чтобы узнать общую численность.
• Вычислить средний возраст, сложив возраст всех граждан и разделив на их количество.
• Составить гендерно-возрастную картину, выделив, к примеру, женщин в возрасте от 18 до 24 лет.

Ограничения математической статистики

На этих принципах построена математическая статистика. Она изучает, как по характеристикам выборки сделать вывод обо всей генеральной совокупности (например, обо всем населении или всех яблоках в регионе). Мы не можем пересчитать вообще всё. Поэтому мы берем 100 определенным образом распределенных деревьев и на основе этого анализа делаем вывод об урожае в целом. Ровно так же можно опросить 10 квартир в доме, чтобы составить мнение обо всех жильцах.

Математическая статистика решает два вопроса:
1. Какое количество объектов в выборке достаточно для обоснованного вывода?
2. С какой точностью будет сделан этот вывод? Каков будет разброс (минимальное и максимальное отклонение) результата, полученного на выборке, от истинного значения в генеральной совокупности?

Ключевой момент: математическая статистика оперирует строгими теоремами, которые однозначно утверждают справедливость полученного соотношения. Это подраздел математики, и он не может брать на себя ответственность там, где строгого доказательства нет.

Переход к эмпирическим методам и науке о данных

Почему одной математической статистики недостаточно? Потому что для огромного числа сложных задач получить строгое математическое доказательство невозможно. Здесь начинается поле деятельности современной науки о данных.
Мы отходим от единоличного принципа строгих теорем и переходим к эмпирическим методам. Это методы, основанные на экспериментах. У нас нет безупречного доказательства, но эксперименты внушают нам уверенность, что выявленная закономерность действительно работает.

Математическая статистика остается основой и подспорьем. Мы не «тыкаем пальцем в небо», а базируем новые методы на известных закономерностях, адаптируя их под задачу. Новые методы утверждают результат с определенной экспериментальной точностью. Этот процент надежности не доказан строго, а выведен из практических испытаний.

Роль технологий в работе с большими данными

Переход к эмпирике стал возможен благодаря революции в компьютерных технологиях. Объемы хранимых данных сегодня так велики, что человек или даже все человечество не в состоянии обработать их вручную. То, на что у людей ушли бы десятилетия, компьютер делает за часы.
Поэтому мы переходим к построению моделей. Это модели, которые зарекомендовали себя как выдающие результат, которому можно доверять с определенной степенью точности на известном классе задач.

Выбор модели и практическая ценность

Перед нами стоит задача, набор методов («мешок методов») и критерии отбора лучшей модели. В современном мире практическая ценность результата часто важнее наличия его строгого теоретического обоснования. Спектр бизнес-задач настолько широк, а их постановка меняется так быстро, что мы просто не успеваем получать строгие доказательства. Мы сначала эмпирически находим рабочее решение, а затем уже, при возможности, пытаемся подвести под него теорию.

Типы задач и характеристики методов

От формулировки вопроса кардинально меняется подход. Рассмотрим кредитный скоринг (credit scoring):
Качественная задача (классификация): «Выдать кредит клиенту?» (ответ: «да» или «нет»).
Количественная задача: «В каком размере, на какой срок и под какой процент выдать кредит?»

Для этих двух задач, несмотря на общую предметную область, эффективными будут разные модели.

При выборе метода наука о данных также оценивает его характеристики:
Вычислительная сложность и скорость сходимости. Метод, которому для получения ответа нужны 5–10 лет, теряет практический смысл, если решение требуется через час.
Точность и максимальное отклонение. Знание того, насколько сильно модель может ошибаться относительно правильного ответа, критически важно. Но подобные оценки существуют не для всех методов. Часть из них мы применяем «на свой страх и риск», основываясь лишь на успешном опыте решения похожих задач.

Когда строгой теории нет, мы сами набираем экспериментальную базу, пробуем разные подходы, а затем, возвращаясь к классическим методам математической статистики, делаем вывод о точности того или иного метода на практике.

Краткие итоги

Практическая работа с данными сегодня переросла рамки, очерченные классической статистикой, и трансформировалась в инженерно-экспериментальную деятельность. Ключевой сдвиг парадигмы состоит в смене приоритета: от поиска безупречных доказательств к получению работающих решений в условиях неопределенности. Это не означает отказ от математической базы, напротив, строгие теоремы остаются фундаментом. Однако над этим фундаментом надстраивается обширный этаж эмпирических методов, чья валидность подтверждается не формальной логикой, а воспроизводимой экспериментальной точностью.

Такой прагматичный подход продиктован экспоненциальным ростом сложности и количества бизнес-задач. Ожидание строгого обоснования для каждой модели стало непозволительной роскошью, тормозящей принятие решений. Ценность сместилась в сторону скорости и адаптивности. Метод, который дает приемлемый по точности результат за час, объективно полезнее безупречного, но требующего годы вычислений. Поэтому специалист по данным работает с «мешком методов», подбирая подходящий инструмент не столько по теоретической чистоте, сколько по практическим критериям: сходимость, вычислительная сложность и релевантность конкретной постановке вопроса.

Из этого следует важнейшее методологическое разделение: характер вопроса определяет выбор инструментария. Одна и та же предметная область, например, кредитный скоринг, может быть сведена как к качественной задаче классификации (да/нет), так и к количественной задаче регрессии (расчет параметров кредита). Это требует от аналитика навыка не просто применять алгоритмы, а концептуально переформулировать бизнес-проблему на язык данных. В ситуациях, когда для выбранной модели нет формальных гарантий точности, единственной стратегией становится итеративное экспериментирование с последующей статистической валидацией результатов, что превращает разработку модели в циклический процесс с четкой обратной связью.
От наблюдений к статистике

Человечество всегда собирало данные: от астрономических наблюдений, позволивших Кеплеру вывести свои законы, до переписи населения и финансов. Классические методы анализа здесь — статистические. Мы можем просто посчитать строки, вычислить средний возраст или построить сложную гендерно-возрастную картину. Всё это операции в рамках строгих математических правил.

Ограничения математической статистики

Математическая статистика изучает, как по выборке (например, 100 яблонь или 10 квартир) делать выводы обо всей генеральной совокупности (всех яблоках в регионе или жильцах дома). Ее главные вопросы:
1. Каков должен быть размер выборки?
2. С какой точностью и разбросом наш вывод будет справедлив для всей совокупности?

Ключевая особенность — она оперирует строгими теоремами, дающими однозначные утверждения. Но это и ее ограничение: она не работает там, где такого строгого результата нет.

Наука о данных и эмпирика

Ответом на ограничения стал переход к эмпирическим методам в рамках науки о данных. Это методы, основанные не на формальном доказательстве, а на экспериментах. Мы можем с уверенностью утверждать, что закономерность работает, опираясь на многократные опыты и их экспериментальную точность. Математическая статистика остается основой, с которой мы начинаем, адаптируя известные закономерности под новые сложные задачи.

Этот переход был бы невозможен без революции в компьютерных технологиях. Объемы данных сегодня таковы, что человек не в силах их обработать, а компьютер справляется за часы. Мы перешли к построению моделей — инструментов, зарекомендовавших себя на определенных классах задач.

Выбор модели и ценность результата

В современном мире практическая ценность результата важнее теоретической чистоты. Бизнес-задачи меняются быстрее, чем мы успеваем подводить под них строгую математическую базу. Стратегия такова: сначала эмпирически находим рабочее решение, а теорию дорабатываем по возможности.

При выборе метода критически важна постановка вопроса. Например, задача кредитного скоринга (credit scoring) может быть решена двумя способами:
Качественная задача (классификация): «Выдать кредит?» (да/нет).
Количественная задача: «В каком объеме и под какой процент?»
Для каждой из них эффективны разные модели.

Также каждая модель оценивается по своим характеристикам. Две важнейшие из них:
Скорость сходимости и вычислительная сложность. Метод, который выдает идеальный ответ за 5 лет, абсолютно бесполезен, если решение нужно через час.
Максимальное отклонение. Знание того, как сильно модель может ошибаться, критически важно, но доступно не всегда.

Когда формальных гарантий точности нет, мы принимаем решение «на свой страх и риск», основываясь на успешном опыте применения метода в похожих ситуациях. Единственный путь валидации здесь — набрать собственную экспериментальную базу, пробовать разные подходы, а затем, используя аппарат математической статистики, сделать вывод о точности полученного решения.

Выводы

1. Наука о данных — это мега-дисциплина, объединяющая классическую статистику и современные эмпирические методы анализа.
2. Математическая статистика дает строгие, доказанные выводы о генеральной совокупности на основе выборки, но применима не ко всем задачам.
3. Ключевой проблемой статистики является невозможность получения строгих теорем для всего спектра современных сложных задач.
4. Наука о данных расширяет инструментарий за счет эмпирических методов, чья точность подтверждается экспериментами, а не формальными доказательствами.
5. В современном мире практическая ценность быстрого и достаточно точного результата приоритетнее, чем наличие полного теоретического обоснования.
6. Аппаратно-программные революции сделали возможной обработку гигантских объемов информации, что является драйвером эмпирического подхода.
7. Построение модели — это выбор метода из набора зарекомендовавших себя с учетом специфики решаемой задачи.
8. Одна и та же бизнес-проблема (например, кредитный скоринг) может формулироваться и как качественная, и как количественная задача, что требует разных моделей.
9. Критичными характеристиками метода являются вычислительная сложность и скорость сходимости, так как просроченный результат не имеет ценности.
10. Оценка максимального отклонения результата модели от истины существует не для всех методов, что создает зону риска.
11. При отсутствии строгой теории решение о применении метода принимается на основе его успешности на аналогичных задачах в прошлом.
12. Финальным валидатором качества модели выступает экспериментальная база, анализируемая с помощью методов математической статистики.

Вопросы для самопроверки

1. В чем главное отличие эмпирических методов науки о данных от строгих теорем математической статистики?
2. Почему математическая статистика не может быть единственным инструментом для решения всех современных аналитических задач?
3. Как изменился баланс ценности между теоретическим обоснованием и практическим результатом в современном мире и почему?
4. Каким образом одна и та же предметная область (на примере кредитного скоринга) может порождать принципиально разные типы аналитических задач?
5. Почему скорость сходимости и вычислительная сложность метода могут быть важнее его абсолютной точности?
6. Какова роль эксперимента и накопления эмпирической базы в ситуациях, когда для метода нет строгих доказательств его корректности?
7. Объясните, как развитие аппаратных и программных средств повлияло на методологию науки о данных.
8. Что такое «мешок методов» и как аналитик выбирает из него подходящий инструмент для конкретной задачи?
9. Почему при использовании некоторых моделей мы вынуждены действовать «на свой страх и риск»?
10. Может ли существовать метод, который всегда выдает правильный ответ, но при этом быть абсолютно бесполезным для бизнеса?
11. Как знание о максимальном отклонении результата модели влияет на доверие к этому результату?
Вернуться к учебному плану