Бизнес-аналитика с помощью Power BI

Редактирование данных в PowerBI

В лекции показана практическая работа с таблицей, загруженной в Power BI из интернет-источника: разбор смысла столбцов, проверка типов данных, создание пользовательского столбца со средней оценкой пяти компонентов, ранжирование через столбец индекса и сравнение расчетного рейтинга с исходным. Логика движения: от понимания данных — к вычислению, сортировке, ранжированию и подготовке таблицы к связи со следующим источником.

Основные мысли

В результате изучения лекции слушатель будет способен:
1. Распознавать структуру и смысл столбцов загруженной таблицы.
2. Проверять и при необходимости изменять типы данных.
3. Создавать пользовательский вычисляемый столбец.
4. Записывать простую формулу для расчета на основе существующих столбцов.
5. Ранжировать записи с помощью столбца индекса.
6. Сравнивать расчетный и исходный рейтинги.
7. Объяснять назначение примененных шагов.
8. Понимать связь действий в интерфейсе с кодом запроса.
Показывать лекцию целиком
Краткое изложение

1. Понимание загруженной таблицы

Мы подключились к источнику данных — интернет-странице. Информация из таблицы на странице попала в Power BI. Теперь нужно понять, что представляют собой эти данные.

Первый столбец — State (штат). В нем перечислены штаты США. Далее идет столбец Overall Rank (итоговый ранг, итоговая оценка). Это рейтинг штатов по совокупному показателю. Он складывается из нескольких компонентов: погода, культурный уровень, уровень преступности, уровень здравоохранения и другие. По каждому компоненту у штата есть оценка в виде целого числа. Затем по неизвестной нам формуле получается итоговая оценка Overall Rank, соответствующая месту штата в рейтинге.

2. Проверка типов данных

С данными особенно манипулировать не нужно, потому что у столбцов уже определен правильный тип. Тип виден в левом верхнем углу — это целое число (Whole Number). Если тип определился неверно, можно перейти в Преобразование (Transform), открыть Тип данных (Data Type) и выбрать нужный вариант, например целое число (Whole Number).

3. Создание пользовательского столбца Average

Добавим пользовательский столбец (custom column), то есть вычисляемое поле на основе уже существующих в таблице. Возникает гипотеза: возможно, Overall Rank — это просто средняя арифметическая оценок по каждому из пяти компонентов. Хотя очевидно, что это не так, допустим такое предположение.

Назовем поле Average (среднее). Формула будет такой: складываем оценки по пяти компонентам и делим сумму на пять. Синтаксических ошибок нет. В таких формулах можно использовать и сложные функции: синус, квадратный корень, возведение в степень. Нажимаем ОК. Появляется столбец Average. Перемещаем его рядом с Overall Rank.

4. Ранжирование по Average

Теперь среднее значение нужно отранжировать: у кого средняя оценка самая маленькая, тому присвоить 1, далее по списку. Каждый показатель оценивается в масштабе от 1 до 50. Чем меньше среднее значение, тем лучше, потому что первые места в каждом из пяти столбцов соответствуют более высокому положению в рейтинге.

Сортируем столбец Average по возрастанию: от самого маленького значения к максимуму. Затем по выделенному столбцу выбираем Добавить столбец (Add Column) → Столбец индекса (Index Column). Это и есть ранжирование. Начать можно с нуля или с единицы. Так как рейтинг начинается с единицы, выбираем 1. Появляется последний столбец — ранг по столбцу Average. Переименуем его в New Rank (новый ранг) через Переименовать (Rename). Перемещаем его к Overall Rank.

5. Сравнение рейтингов

Сравниваем два рейтинга: исходный Overall Rank и расчетный New Rank. Оценки сильно разнятся. Например, штат Миссури занимает третье место по исходному рейтингу, а по среднему значению должен был бы занять 21 место. Расхождение капитальное. В хвосте списка, то есть у самых худших позиций, результаты достаточно согласованы.

6. Удаление промежуточного столбца

Столбец Average нужен был только для расчета New Rank. Удаляем Average. Происходит интересная вещь: New Rank, который был посчитан на основе Average, остается в таблице. Если удалить столбец, на базе которого считается другой столбец, ожидаемо, что конечный столбец исчезнет. Но Power BI устроен правильно: промежуточные действия можно удалять, а конечный столбец, заточенный на эти действия, остается внутри данных.

Тип New Rankдесятичное число (Decimal Number). Меняем его на целое число (Whole Number), то есть превращаем в integer.

7. Примененные шаги и код запроса

Справа есть раздел Примененные шаги (Applied Steps). Каждое действие логируется. Если что-то сделано не так или нужно изменить порядок, шаги можно удалять или менять их порядок.

В закладке Вид (View) есть Расширенный редактор (Advanced Editor). Все действия превратились в код запроса. В исходном пояснении он назван DAX (Data Analysis Expressions). Строго говоря, в Power Query используется язык M (Power Query M), а DAX применяется для вычислений в модели Power BI. За манипуляциями мышью и клавиатурой, за графическим интерфейсом (GUI) стоит формирование кода, который исполняется. Все действия превратились в набор строк кода. Значит, можно писать код самостоятельно, чтобы выполнять произвольные действия, даже те, которые невыполнимы через прямой интерфейс.

8. Возврат к исходной сортировке

Сортируемся по исходному рангу — Overall Rank. Штат Небраска оказывается на первом месте. Теперь можно подключаться к следующему источнику данных, который затем нужно будет связать с уже имеющейся таблицей.

Краткие итоги

Работа с данными в Power BI начинается не с визуализации, а с осмысления источника и структуры таблицы. Понимание того, что означает каждый столбец, определяет корректность всех последующих действий: проверки типов, вычислений, сортировок и ранжирования. Тип данных — не формальность, а условие правильной обработки: если числовой показатель прочитан как текст или десятичное число там, где нужен целый индекс, дальнейшие расчеты и сравнения теряют надежность.

Создание вычисляемого столбца показывает, как проверять гипотезы о происхождении итоговых показателей. Даже если простая формула не совпадает с экспертной оценкой, она дает полезную точку сравнения. Ранжирование требует внимания к направлению шкалы: меньшее значение может означать лучший результат. Индекс превращает порядок в формальный ранг, который можно сопоставлять с исходным рейтингом и выявлять расхождения.

Удаление промежуточного столбца демонстрирует важное свойство подготовки данных: результат может сохраняться независимо от промежуточного шага. Это снижает страх перед экспериментом и позволяет очищать модель от лишних полей. Журнал примененных шагов обеспечивает прозрачность, обратимость и управляемость процесса. Расширенный редактор раскрывает декларативную природу запроса: действия интерфейса не исчезают, а фиксируются в коде, который можно изучать, воспроизводить и расширять вручную.

Практическая ценность такого подхода — в повторяемости и аудите. Аналитик может объяснить, как получен каждый столбец, изменить логику без пересборки всей работы и подготовить таблицу к связям с другими источниками. Возврат к исходной сортировке показывает, что порядок отображения не разрушает вычисленные поля, а служит удобству дальнейшей интеграции. В итоге формируется управляемый конвейер: источник → смысловая интерпретация → контроль типов → вычисления → ранжирование → сравнение → очистка → код → связывание с новыми данными.

Мы подключились к интернет-странице, и таблица попала в Power BI. Первый столбец — State (штат). Далее — Overall Rank (итоговый ранг), рейтинг штатов по совокупному показателю. Он складывается из компонентов: погода, культура, преступность, здравоохранение и другие. По каждому компоненту есть целочисленная оценка. Итоговый рейтинг считается по неизвестной формуле.

Типы данных уже определены правильно: числовые столбцы — целое число (Whole Number). При необходимости тип можно изменить в Преобразовании (Transform) → Тип данных (Data Type).

Создаем пользовательский столбец (custom column) Average. Проверяем гипотезу: Overall Rank — это среднее пяти компонентов. Формула: сумма пяти компонентов делится на пять. Нажимаем ОК. Столбец Average появляется. Переносим его рядом с Overall Rank.

Ранжируем по Average. Чем меньше среднее, тем лучше. Сортируем Average по возрастанию. Затем через Добавить столбец (Add Column) → Столбец индекса (Index Column) создаем индекс с 1. Переименовываем его в New Rank. Сравниваем New Rank и Overall Rank: расхождения сильные. Например, Миссури по исходному рейтингу третий, а по среднему — 21-й. В хвосте списка оценки согласованы.

Удаляем Average, так как он нужен был только для расчета. New Rank остается, хотя промежуточный столбец удален. Меняем тип New Rank с десятичного на целый.

Справа находится Примененные шаги (Applied Steps). Каждое действие логируется. Шаги можно удалять и менять местами. В Вид (View) → Расширенный редактор (Advanced Editor) виден код запроса. В исходном пояснении он назван DAX; строго говоря, в Power Query используется язык M, а DAX — для вычислений в модели Power BI. Действия интерфейса формируют код. Код можно писать вручную для произвольных действий.

В конце сортируемся по исходному Overall Rank. Первым становится Небраска. Далее нужно подключить следующий источник и связать его с текущей таблицей.

Выводы

1. После загрузки данных сначала нужно понять смысл столбцов.
2. Типы данных проверяются и при необходимости меняются в разделе «Преобразование».
3. Пользовательский столбец считается на основе уже существующих столбцов.
4. Формула может включать арифметику и сложные функции.
5. Для ранжирования нужно отсортировать показатель и добавить столбец индекса.
6. Меньшее среднее значение означает лучший рейтинг.
7. Расчетный и исходный ранги могут сильно расходиться.
8. Промежуточный столбец можно удалить, а итоговый сохраняется.
9. Примененные шаги логируют действия и позволяют менять их порядок.
10. Расширенный редактор показывает код запроса, стоящий за действиями интерфейса.
11. После преобразований можно вернуть сортировку по исходному рангу.
12. Подготовленную таблицу можно связывать со следующим источником.

Вопросы для самопроверки

1. Что представляет собой столбец State в загруженной таблице?
2. Из каких компонентов складывается Overall Rank?
3. Почему важно проверить тип данных у числовых столбцов?
4. Где в интерфейсе можно изменить тип данных?
5. Что такое пользовательский вычисляемый столбец?
6. Какую гипотезу проверяли с помощью столбца Average?
7. Почему столбец Average нужно сортировать по возрастанию?
8. Как создать столбец индекса с началом ранжирования с единицы?
9. Что показало сравнение New Rank и Overall Rank?
10. Что происходит с New Rank после удаления Average?
11. Зачем нужен раздел «Примененные шаги»?
12. Что показывает «Расширенный редактор» и как он связан с действиями в интерфейсе?
Вернуться к учебному плану