Технологии анализа процессов: от бизнес-аналитики к процессной аналитике

Определение валидных экземпляров и размера датасета для анализа

В этой лекции разбираются особенности анализа процессов в майнинге данных, включая понятия «голов» и «хвостов» — незавершённых или начатых вне исследуемого периода экземпляров. Обсуждаются правила их фильтрации, важность выбора оптимального размера датасета (минимум 5 средних длительностей процесса) и необходимость учёта сезонности. Подчёркивается, что для успешного процессного майнинга требуется достаточный объём накопленных данных.

Основные мысли

  1. Фильтрация неполных данных – Для корректного анализа процессов важно исключать «головы» (экземпляры, начавшиеся до периода исследования) и «хвосты» (незавершённые процессы), так как они искажают результаты.

  2. Оптимальный размер датасета – Длительность анализируемого периода должна быть не менее 5 средних длительностей процесса, а лучше – год и более, чтобы учесть сезонность и получить репрезентативные данные.

  3. Проблема «замерзших» процессов – Необходимо выявлять и отдельно обрабатывать процессы без активности (например, более 5 дней), чтобы отличать их от просто долгих или незавершённых.

  4. Зависимость анализа от зрелости данных – Процессный майнинг имеет смысл только при достаточном объёме накопленных данных, поэтому его нельзя применять в только что запущенных системах.

  5. Сезонность и длительность процессов – Для точных выводов нужно учитывать цикличность (например, годовую), иначе краткосрочные выборки могут оказаться бесполезными.

Показывать лекцию целиком
Краткое изложение

В следующем видео давайте разберёмся в особенностях процесса майнинга с точки зрения анализа экземпляров. Мы посмотрим, что же такое экземпляр, ещё раз поговорим об этом, а также обсудим, что такое «головы» и «хвосты» в процессе майнинга.

Я рисую набор экземпляров. Представьте, что у нас есть какой-то процесс: экземпляры начинаются в какое-то время и заканчиваются в какое-то время.

Допустим, мы решили выгрузить данные за последний год. Здесь у нас начало года, а здесь — конец года. Вроде бы всё просто, если бы не один нюанс.

Получается, что в этом датасете (объёме выгрузки) мы «отрезали» хвосты процессов и некоторые головы процессов. Тогда возникает вопрос: можно ли их анализировать, если начало процесса находится вне нашего датасета? По правилам, такие случаи нужно исключать из анализа.

Что мы делаем?Мы должны определить процессы, которые не имеют начала, и особым образом отфильтровать их, чтобы исключить из аналитики и не допустить их влияния на показатели.

То же самое нужно сделать с процессами, которые ещё не завершились. Зачем их анализировать, если результат будет достигнут только в будущем?

Однако есть нюанс: как определить процессы, которые просто «замерли» и больше не продолжатся? Или как выявить процессы, которые начались некорректно (например, со средней операции) — такие, наоборот, нужно включить в анализ.

Это одна из задач, которую нужно решить при настройке системы. Например, мы можем принять правило: если в течение пяти дней нет активности по процессу, значит, это «замерзший» экземпляр.

Но такие гипотезы потом нужно подтверждать.

Итак, при загрузке данных что мы делаем?Мы должны очистить экземпляры процессов от «голов» и «хвостов», потому что некорректно анализировать то, что либо началось вне зоны анализа, либо завершилось за её пределами.

Следующий вывод: длительность датасета зависит от длительности экземпляра процесса.

Представьте, если мы возьмём очень короткий датасет — например, выгрузим данные за месяц — и увидим, что в нём нет ни одного завершённого экземпляра процесса. Какой тогда смысл в анализе?

Поэтому ещё одна задача при загрузке данных — определить оптимальный размер датасета.

В одной организации мы спорили, какой должна быть его длительность, и пришли к соглашению: минимум 5 средних длительностей экземпляра.

То есть если ваш процесс в среднем длится 1 месяц, то анализировать нужно минимум 5 месяцев. И это лишь минимальный объём.

С моей точки зрения, лучше смотреть год и более. Почему такие жёсткие требования?

Потому что частотность некоторых процессов зависит от сезонности, а сезонность, как правило, годовая.

Ещё один вывод: чтобы запустить проект по процессному майнингу, нужно, чтобы в системе накопилось достаточно данных. Нет смысла внедрять процессный майнинг в систему, которая только что создана. Нужно дать время на сбор информации.

В лекции обсуждаются особенности процессного майнинга, в частности анализ экземпляров процессов.

Ключевые моменты:

  1. Экземпляры процессов имеют начало и конец. При выгрузке данных (датасета) могут обрезаться «головы» (начала процессов вне датасета) и «хвосты» (незавершённые процессы).

  2. Некорректно анализировать процессы, которые:

    • Начались до датасета (неизвестно полное начало).

    • Не завершились внутри датасета (нет итогового результата).

  3. «Замёрзшие» процессы – те, в которых нет активности длительное время (например, 5 дней). Их нужно либо исключать, либо проверять отдельно.

  4. Длительность датасета должна быть не менее 5 средних длительностей процесса (например, если процесс длится месяц → датасет ≥ 5 месяцев).

  5. Рекомендуемый период анализа – год, чтобы учесть сезонность.

  6. Нельзя анализировать данные в новой системе – нужно дождаться накопления информации.

Вопросы для самопроверки

  1. Что такое «головы» и «хвосты» в процессном майнинге?

  2. Почему нельзя анализировать процессы, начавшиеся до датасета?

  3. Как определить «замёрзший» процесс?

  4. Как выбрать оптимальную длительность датасета?

  5. Почему для анализа лучше брать годовые данные, а не месячные?

Вернуться к учебному плану