В следующем видео давайте разберёмся в особенностях процесса майнинга с точки зрения анализа экземпляров. Мы посмотрим, что же такое экземпляр, ещё раз поговорим об этом, а также обсудим, что такое «головы» и «хвосты» в процессе майнинга.
Я рисую набор экземпляров. Представьте, что у нас есть какой-то процесс: экземпляры начинаются в какое-то время и заканчиваются в какое-то время.
Допустим, мы решили выгрузить данные за последний год. Здесь у нас начало года, а здесь — конец года. Вроде бы всё просто, если бы не один нюанс.
Получается, что в этом датасете (объёме выгрузки) мы «отрезали» хвосты процессов и некоторые головы процессов. Тогда возникает вопрос: можно ли их анализировать, если начало процесса находится вне нашего датасета? По правилам, такие случаи нужно исключать из анализа.
Что мы делаем?Мы должны определить процессы, которые не имеют начала, и особым образом отфильтровать их, чтобы исключить из аналитики и не допустить их влияния на показатели.
То же самое нужно сделать с процессами, которые ещё не завершились. Зачем их анализировать, если результат будет достигнут только в будущем?
Однако есть нюанс: как определить процессы, которые просто «замерли» и больше не продолжатся? Или как выявить процессы, которые начались некорректно (например, со средней операции) — такие, наоборот, нужно включить в анализ.
Это одна из задач, которую нужно решить при настройке системы. Например, мы можем принять правило: если в течение пяти дней нет активности по процессу, значит, это «замерзший» экземпляр.
Но такие гипотезы потом нужно подтверждать.
Итак, при загрузке данных что мы делаем?Мы должны очистить экземпляры процессов от «голов» и «хвостов», потому что некорректно анализировать то, что либо началось вне зоны анализа, либо завершилось за её пределами.
Следующий вывод: длительность датасета зависит от длительности экземпляра процесса.
Представьте, если мы возьмём очень короткий датасет — например, выгрузим данные за месяц — и увидим, что в нём нет ни одного завершённого экземпляра процесса. Какой тогда смысл в анализе?
Поэтому ещё одна задача при загрузке данных — определить оптимальный размер датасета.
В одной организации мы спорили, какой должна быть его длительность, и пришли к соглашению: минимум 5 средних длительностей экземпляра.
То есть если ваш процесс в среднем длится 1 месяц, то анализировать нужно минимум 5 месяцев. И это лишь минимальный объём.
С моей точки зрения, лучше смотреть год и более. Почему такие жёсткие требования?
Потому что частотность некоторых процессов зависит от сезонности, а сезонность, как правило, годовая.
Ещё один вывод: чтобы запустить проект по процессному майнингу, нужно, чтобы в системе накопилось достаточно данных. Нет смысла внедрять процессный майнинг в систему, которая только что создана. Нужно дать время на сбор информации.
В лекции обсуждаются особенности процессного майнинга, в частности анализ экземпляров процессов.
Ключевые моменты:
-
Экземпляры процессов имеют начало и конец. При выгрузке данных (датасета) могут обрезаться «головы» (начала процессов вне датасета) и «хвосты» (незавершённые процессы).
-
Некорректно анализировать процессы, которые:
-
«Замёрзшие» процессы – те, в которых нет активности длительное время (например, 5 дней). Их нужно либо исключать, либо проверять отдельно.
-
Длительность датасета должна быть не менее 5 средних длительностей процесса (например, если процесс длится месяц → датасет ≥ 5 месяцев).
-
Рекомендуемый период анализа – год, чтобы учесть сезонность.
-
Нельзя анализировать данные в новой системе – нужно дождаться накопления информации.