Данный текст представляет собой вводную лекцию к курсу «Анализ данных на Python в примерах и задачах» в рамках образовательной программы по бизнес-аналитике. В лекции проводится сравнение языков Python и R, обосновывается выбор Python для анализа данных, описывается подход к его изучению (без углубления в ООП, с упором на скриптовую работу), а также даются практические инструкции по установке и настройке среды разработки Anaconda и инструмента Jupyter Notebook. Основной фокус — на прикладном использовании Python для обработки и визуализации данных.
Основные мысли
1. Паритет языков: Python и R — два основных языка для анализа и визуализации данных. Их функционал во многом пересекается, а выбор часто является вопросом личных предпочтений (синтаксис, среда) или корпоративного стандарта.
2. Популярность Python: Язык несколько более распространён благодаря активному развитию и большей насыщенности библиотек для анализа данных.
3. Прикладной подход в курсе: Курс не ставит целью изучение Python как полноценного языка программирования (объектно-ориентированное или функциональное программирование). Упор делается на использование готовых библиотек для загрузки датасетов и применения алгоритмов машинного обучения.
4. Инструментарий:
o Anaconda — рекомендуемая среда разработки, которая уже включает в себя ядро Python и множество полезных инструментов.
o Jupyter Notebook — основной инструмент для работы («блокнот»), позволяющий писать код построчно, сразу видеть результат, добавлять комментарии, графику и сохранять промежуточные результаты.
5. Поколения Python: Рекомендуется использовать Python 3 (вторая версия поддерживается только для обратной совместимости со старыми проектами).
6. Этапы работы: Первичный анализ и поиск решений выполняются в Jupyter Notebook. Готовые модели затем упаковываются в полноценные приложения с интерфейсом.
Показывать лекцию целиком
Краткое изложение
Дополнительная литература:
Уэс Маккинни. Python и анализ данных. М.: ДМК Пресс, 2023 г. 537 с.
Лектор приветствует слушателей и начинает курс по анализу данных на Python, аналогичный предыдущему курсу по языку R. Области применения Python и R совпадают — это анализ и визуализация данных. Python считается более распространённым из-за более насыщенных библиотек, хотя функционально языки друг друга перекрывают.
Выбор языка зависит от эстетических предпочтений разработчика (при индивидуальной работе) или от стандартов компании. Python — свободно распространяемый язык, развиваемый сообществом. Курс не требует глубокого изучения языка (классы, ООП, функциональщина), фокус — на применении готовых библиотек для решения задач анализа данных.
В качестве среды разработки выбрана Anaconda, так как она поставляется со встроенным Python (не нужно устанавливать их отдельно). Однако возможна небольшая задержка в поддержке новых версий Python (до полугода), что для долгосрочных проектов некритично.
На сайте anaconda.com скачивается версия для нужной ОС, обязательно третьего поколения (Python 3). Установка простая: запуск от имени администратора, выбор опции «для всех пользователей» (полезна для связи с внешними графическими библиотеками). В ходе установки можно оставить настройки по умолчанию.
Работать слушатели будут не с полноценной разработкой приложений, а со скриптовой компонентой — построчным исполнением кода. Для этого используется Jupyter Notebook — «блокнот», который позволяет писать код, добавлять графику, текст, комментарии. Результаты сохраняются, и при повторном открытии блокнота графики и вывод кода уже видны, что удобно для передачи коллегам. Jupyter подходит для первичного анализа и поиска зависимостей. После того как модель найдена, её упаковывают в полноценное приложение (интерфейс, обработка ошибок), но повседневная работа с данными идёт именно в блокноте. После установки Anaconda можно будет обновить компоненты и создать свой первый «Hello World».
Выводы
• Python является практичным и мощным инструментом для бизнес-аналитики наравне с R, а среда Anaconda упрощает начало работы за счёт включения всех необходимых компонентов.
• Для целей анализа данных не требуется углублённое знание языка программирования как такового — достаточно навыков использования профильных библиотек.
• Jupyter Notebook — оптимальная среда для исследовательского анализа данных, позволяющая документировать процесс, визуализировать результаты и легко делиться ими.
• Процесс установки интуитивно понятен, критически важно выбрать версию Python 3 и при необходимости указать установку «для всех пользователей».
• Работа в блокноте — это лишь первый этап; финальная модель должна превращаться в надёжное приложение, но это выходит за рамки данного курса.
Вопросы для самопроверки
1. В чём заключается основное различие между подходом к изучению Python в данном курсе и полноценным изучением языка программирования?
2. Почему выбор между Python и R в индивидуальной работе автор называет «вопросом эстетического выбора»?
3. Какое преимущество даёт использование Jupyter Notebook перед написанием обычного скрипта (.py-файла) на начальных этапах анализа данных?
4. Почему для установки рекомендуется использовать Anaconda, а не устанавливать Python отдельно?
5. Какую версию Python (2 или 3) следует скачивать и почему?
6. Зачем при установке Anaconda рекомендуется выбирать опцию «установить для всех пользователей»?
7. Что произойдёт с графиками и выведенными результатами, если закрыть Jupyter Notebook, а потом открыть его снова?
8. Какой следующий этап работы над моделью следует после того, как анализ в Jupyter Notebook завершён и найден рабочий алгоритм?