Что такое на самом деле Big Data и чем они прекрасны.
Лекция Андрея Себранта в Яндексе:
https://www.youtube.com/watch?v=TEHdfPa1eJA
Мы продолжаем работу в рамках курса «Введение в бизнес-аналитику и науку о данных». Мы закончили первую часть — введение в бизнес-аналитику, и теперь переходим к науке о данных.
От наблюдений к статистике
Данные окружали нас всегда. Без анализа ретроспективной информации человечество не обходилось даже до появления компьютеров. Статистические наблюдения велись веками: от движения звезд до переписи населения. Именно накопленная статистика позволила Кеплеру вывести законы движения планет по эллиптическим траекториям. Так же испокон веков велся учет финансов и других факторов.
Однако все базовые методы анализа здесь — это
статистические методы. Они основаны на наборе математических операций и строгих теоремах. Пример из переписи населения:
• Просто посчитать количество строк, чтобы узнать общую численность.
• Вычислить средний возраст, сложив возраст всех граждан и разделив на их количество.
• Составить
гендерно-возрастную картину, выделив, к примеру, женщин в возрасте от 18 до 24 лет.
Ограничения математической статистики
На этих принципах построена
математическая статистика. Она изучает, как по характеристикам выборки сделать
вывод обо всей
генеральной совокупности (например, обо всем населении или всех яблоках в регионе). Мы не можем пересчитать вообще всё. Поэтому мы берем 100 определенным образом распределенных деревьев и на основе этого анализа делаем вывод об урожае в целом. Ровно так же можно опросить 10 квартир в доме, чтобы составить мнение обо всех жильцах.
Математическая статистика решает два вопроса:
1. Какое количество объектов в выборке достаточно для обоснованного вывода?
2. С какой точностью будет сделан этот вывод? Каков будет разброс (минимальное и максимальное отклонение) результата, полученного на выборке, от истинного значения в генеральной совокупности?
Ключевой момент: математическая статистика оперирует строгими теоремами, которые однозначно утверждают справедливость полученного соотношения. Это подраздел математики, и он не может брать на себя ответственность там, где строгого доказательства нет.
Переход к эмпирическим методам и науке о данных
Почему одной математической статистики недостаточно? Потому что для огромного числа сложных задач получить строгое математическое доказательство невозможно. Здесь начинается поле деятельности современной
науки о данных.
Мы отходим от единоличного принципа строгих теорем и переходим к э
мпирическим методам. Это методы, основанные на экспериментах. У нас нет безупречного доказательства, но эксперименты внушают нам уверенность, что выявленная закономерность действительно работает.
Математическая статистика остается основой и подспорьем. Мы не «тыкаем пальцем в небо», а базируем новые методы на известных закономерностях, адаптируя их под задачу. Новые методы утверждают результат с определенной экспериментальной точностью. Этот процент надежности не доказан строго, а выведен из практических испытаний.
Роль технологий в работе с большими данными
Переход к эмпирике стал возможен благодаря революции в компьютерных технологиях. Объемы хранимых данных сегодня так велики, что человек или даже все человечество не в состоянии обработать их вручную. То, на что у людей ушли бы десятилетия, компьютер делает за часы.
Поэтому мы переходим к построению
моделей. Это модели, которые зарекомендовали себя как выдающие результат, которому можно доверять с определенной степенью точности на известном классе задач.
Выбор модели и практическая ценность
Перед нами стоит задача, набор методов («мешок методов») и
критерии отбора лучшей модели. В современном мире практическая ценность результата часто важнее наличия его строгого теоретического обоснования. Спектр бизнес-задач настолько широк, а их постановка меняется так быстро, что мы просто не успеваем получать строгие доказательства. Мы сначала эмпирически находим рабочее решение, а затем уже, при возможности, пытаемся подвести под него теорию.
Типы задач и характеристики методов
От формулировки вопроса кардинально меняется подход. Рассмотрим
кредитный скоринг (credit scoring):
•
Качественная задача (классификация): «Выдать кредит клиенту?» (ответ: «да» или «нет»).
•
Количественная задача: «В каком размере, на какой срок и под какой процент выдать кредит?»
Для этих двух задач, несмотря на общую предметную область, эффективными будут разные модели.
При выборе метода наука о данных также оценивает его характеристики:
•
Вычислительная сложность и скорость сходимости. Метод, которому для получения ответа нужны 5–10 лет, теряет практический смысл, если решение требуется через час.
•
Точность и максимальное отклонение. Знание того, насколько сильно модель может ошибаться относительно правильного ответа, критически важно. Но подобные оценки существуют не для всех методов. Часть из них мы применяем «на свой страх и риск», основываясь лишь на успешном опыте решения похожих задач.
Когда строгой теории нет, мы сами набираем экспериментальную базу, пробуем разные подходы, а затем, возвращаясь к классическим методам математической статистики, делаем вывод о точности того или иного метода на практике.
Краткие итоги
Практическая работа с данными сегодня переросла рамки, очерченные классической статистикой, и трансформировалась в инженерно-экспериментальную деятельность. Ключевой сдвиг парадигмы состоит в смене приоритета: от поиска безупречных доказательств к получению работающих решений в условиях неопределенности. Это не означает отказ от математической базы, напротив, строгие теоремы остаются фундаментом. Однако над этим фундаментом надстраивается обширный этаж эмпирических методов, чья валидность подтверждается не формальной логикой, а воспроизводимой экспериментальной точностью.
Такой прагматичный подход продиктован экспоненциальным ростом сложности и количества бизнес-задач. Ожидание строгого обоснования для каждой модели стало непозволительной роскошью, тормозящей принятие решений. Ценность сместилась в сторону скорости и адаптивности. Метод, который дает приемлемый по точности результат за час, объективно полезнее безупречного, но требующего годы вычислений. Поэтому специалист по данным работает с «мешком методов», подбирая подходящий инструмент не столько по теоретической чистоте, сколько по практическим критериям: сходимость, вычислительная сложность и релевантность конкретной постановке вопроса.
Из этого следует важнейшее методологическое разделение: характер вопроса определяет выбор инструментария. Одна и та же предметная область, например, кредитный скоринг, может быть сведена как к качественной задаче классификации (да/нет), так и к количественной задаче регрессии (расчет параметров кредита). Это требует от аналитика навыка не просто применять алгоритмы, а концептуально переформулировать бизнес-проблему на язык данных. В ситуациях, когда для выбранной модели нет формальных гарантий точности, единственной стратегией становится итеративное экспериментирование с последующей статистической валидацией результатов, что превращает разработку модели в циклический процесс с четкой обратной связью.
1. Наука о данных — это мега-дисциплина, объединяющая классическую статистику и современные эмпирические методы анализа.
2. Математическая статистика дает строгие, доказанные выводы о генеральной совокупности на основе выборки, но применима не ко всем задачам.
3. Ключевой проблемой статистики является невозможность получения строгих теорем для всего спектра современных сложных задач.
4. Наука о данных расширяет инструментарий за счет эмпирических методов, чья точность подтверждается экспериментами, а не формальными доказательствами.
5. В современном мире практическая ценность быстрого и достаточно точного результата приоритетнее, чем наличие полного теоретического обоснования.
6. Аппаратно-программные революции сделали возможной обработку гигантских объемов информации, что является драйвером эмпирического подхода.
7. Построение модели — это выбор метода из набора зарекомендовавших себя с учетом специфики решаемой задачи.
8. Одна и та же бизнес-проблема (например, кредитный скоринг) может формулироваться и как качественная, и как количественная задача, что требует разных моделей.
9. Критичными характеристиками метода являются вычислительная сложность и скорость сходимости, так как просроченный результат не имеет ценности.
10. Оценка максимального отклонения результата модели от истины существует не для всех методов, что создает зону риска.
11. При отсутствии строгой теории решение о применении метода принимается на основе его успешности на аналогичных задачах в прошлом.
12. Финальным валидатором качества модели выступает экспериментальная база, анализируемая с помощью методов математической статистики.
1. В чем главное отличие эмпирических методов науки о данных от строгих теорем математической статистики?
2. Почему математическая статистика не может быть единственным инструментом для решения всех современных аналитических задач?
3. Как изменился баланс ценности между теоретическим обоснованием и практическим результатом в современном мире и почему?
4. Каким образом одна и та же предметная область (на примере кредитного скоринга) может порождать принципиально разные типы аналитических задач?
5. Почему скорость сходимости и вычислительная сложность метода могут быть важнее его абсолютной точности?
6. Какова роль эксперимента и накопления эмпирической базы в ситуациях, когда для метода нет строгих доказательств его корректности?
7. Объясните, как развитие аппаратных и программных средств повлияло на методологию науки о данных.
8. Что такое «мешок методов» и как аналитик выбирает из него подходящий инструмент для конкретной задачи?
9. Почему при использовании некоторых моделей мы вынуждены действовать «на свой страх и риск»?
10. Может ли существовать метод, который всегда выдает правильный ответ, но при этом быть абсолютно бесполезным для бизнеса?
11. Как знание о максимальном отклонении результата модели влияет на доверие к этому результату?