Поиск и получение данных из интернета

Техники сбора данных из веба: парсинг HTML/XML с BeautifulSoup, работа с формами и динамическим контентом с помощью Selenium.
Для всех RU
Записаться
Объём

18 час.
Длительность

14 дней
Нагрузка

9 час.
Формат обучения

Дистанционно (самостоятельно)
Описание Учебный курс посвящен поиску и получению данных из интернета с использованием Python. Рассматриваются DOM и структура HTML-документа, веб-скрапинг с помощью BeautifulSoup, парсинг страниц из сети и работа с XML-файлами. Изучается пакет Selenium: работа с формами, методами GET и POST, динамически загружаемым контентом. Материал адресован аналитикам, инженерам данных и разработчикам, собирающим данные из открытых веб-источников.
Цели
  • Сформировать понимание принципов веб-скрапинга и парсинга данных.
  • Развить умение работать с BeautifulSoup и Selenium.
  • Подготовить к сбору данных с динамических веб-страниц.
Чему я научусь?
  • Парсить HTML-страницы с помощью BeautifulSoup.
  • Работать с XML-данными в Python.
  • Использовать Selenium для взаимодействия с формами и динамическим контентом.
  • Формировать наборы данных на основе веб-источников.

Авторы

Румянцев Дмитрий
Чему я научусь?
  • Парсить HTML-страницы с помощью BeautifulSoup.
  • Работать с XML-данными в Python.
  • Использовать Selenium для взаимодействия с формами и динамическим контентом.
  • Формировать наборы данных на основе веб-источников.

Учебный план

Занятия
DOM и сбор данных в веб
1 Введение в DOM 45 мин
2 Структура HTML-документа 72 мин
3 Web-scraping с BeautifulSoup 45 мин
4 Парсинг страниц из сети 81 мин
5 Работа с XML-файлами 102 мин
Пакет Selenium
6 Формы и методы GET и POST 84 мин
7 Selenium 48 мин
8 Работа с Selenium 75 мин
Экзамен