Итак, в представлении vTargetMailу нас есть информация о клиентах (имя, дата рождения, семейное положение, число машин и т.д.) и о том, приобрел конкретный клиент велосипед или нет (столбец BikeBuyer=1, если велосипед покупался, иначе =0). Путь необходимо разделить всех клиентов на несколько групп, сходных по значениям параметров. Подобная задача называется задачей кластеризации. Средствами надстроек интеллектуального анализа для MS Office 2007 мы решали подобную задачу в ходе выполнения в ходе лабораторной работы №2. Теперь разберем, как ее решить в среде BIDevStudio.
Сначала понадобится создать структуру и модель интеллектуального анализа. Откроем созданную ранее базу аналитических служб в среде BIDevStudio, в окне ).
(рис 28.1) Создание новой структуры интеллектуального анализа данных
После вывода окна приветствия мастер DataMiningWizardзапросит, будет ли создаваемая структура основана на реляционном источнике данных или на кубе OLAP (рис 28.2). Нам нужен первый вариант, использующий реляционную БД.
(рис 28.2) Создание новой структуры интеллектуального анализа данных (продолжение)
Следующий шаг - выбор между одновременным созданием структуры и модели интеллектуального анализа и только созданием структуры. Для решения поставленной задачи нам понадобится модель, использующая алгоритм кластеризации (рис 28.3). После чего будет предложено выбрать используемое представление источника данных. Пока в нашей базе DSV один, так что проблема выбора не стоит (рис 28.4).
Следующий шаг - выбор таблицы вариантов и вложенных таблиц (если есть). В нашем случае, таблица вариантов - ).
(рис 28.3) Создание новой структуры и модели интеллектуального анализа: выбор алгоритма
(рис 28.4) Создание новой структуры и модели интеллектуального анализа: выбор представления источника данных
(рис 28.5) Выбор таблицы вариантов
Далее потребуется указать ключевой столбец, входные столбцы и столбец, значение которого будет предсказываться. Ключевой столбец ). В случае использования вложенных таблиц, указанию ключей надо уделить особое внимание. Для задачи кластеризации указание предсказываемого (Predictable) атрибута не требуется. А в качестве входных атрибутов будем использовать:
(рис 28.6) Выбор входных и предсказываемых атрибутов
(рис 28.7) Уточнение типов данных
Следующий шаг - уточнение типов данных. На рис 28.7 представлены исходные значения. Не все они могут быть признаны удачными. Например, тип содержимого (ContentType) атрибута TotalChildren установлен как "непрерывный" (Continious), тогда как более корректно был бы выбрать тип "дискретный", т.к. количество детей в семье будет принадлежать ограниченному множеству значений {0,1,2,..}. Можно изменить тип данных и тип содержимого вручную, выбирая нужное значение из выпадающего списка. А можно воспользоваться кнопкой Detect для автоматического определения. Правда в нашем случае тип содержимого для атрибутов TotalChildren и NumberChildrenAtHome придется менять все равно вручную.
После уточнения типов данных будет предложено зарезервировать часть данных для целей тестирования. В принципе, для решения задачи кластеризации тестовое множество создавать не требуется. Поэтому лучше здесь тестовый набор не создавать и в поле Percentageofdatafortesting указать значение 0%. В следующих лабораторных, когда мы будем решать задачу классификации, резервирование данных для тестирования будет необходимо.
(рис 28.8) Резервирование данных для целей тестирования
Последнее окно мастера позволяет указать названия для структуры и модели интеллектуального анализа. Предлагаемые по умолчанию названия лучше отредактировать, так чтобы они явно указывали, что это за объект. Например, созданную структуру назовем ). После чего, т.к. мы работает в режиме immediate, на сервере интеллектуального анализа будут созданы структура и модель. А в среде BIDevStudio будет открыто окно редактора, позволяющее проводить дельнейшую работу с созданными объектами. В частности, из контекстного меню на вкладке ). В процессе обработки данные будет загружены в структуру и произойдет обучение моделей.
(рис 28.9) Указание имени структуры и модели интеллектуального анализа
(рис 28.10) Окно редактора, запуск обработка структуры данных
(рис 28.11) Настройки при обработке структуры
Можно выбрать тип обработки объекта (рис 28.11):
| ProcessFull (полная обработка) | объект полностью обрабатывается, для случая структуры происходит обработка структуры и всех ее моделей; |
| ProcessDefault (обработка по умолчанию) | сервер выполняет действия, необходимые для приведения данного объекта в обработанное состояние. Например, если ProcessDefault выполняется для отдельной модели, будет обработана именно эта модель (обработка других моделей, относящихся к структуре проводиться не будет); |
| ProcessStructure (обработка структуры) | может проводиться только для структуры, при этом читаются и кэшируются данные, обработка моделей не производится; |
| ProcessClearStructure(очистка структуры) | использование этой операции в отношении структуры приведет к тому, что кэш структуры будет очищен от исходных данных, но содержащиеся в ней модели сохранятся в обработанном состоянии; |
| Unprocess (отмена обработки) | переводит объект в необработанное состояние; в случаеструктуры, из кэшей будут удалены данные и содержащиеся в структуре модели будут переведены в необработанное состояние. |
Запускаем полную обработку для созданной структуры с настройками по умолчанию. И получаем сообщение об ошибке, что в источнике данных указано значение ).
(рис 28.12) Сообщение об ошибке при попытке обработать структуру
В лабораторной работе №10, посвященной созданию источника данных, отмечалось, что к настройке ). На вкладке Impersonation Information вместо установленного ранее "Usethecredentialsof the current user" выбираем вариант "Inherit" (наследовать). Как отмечается в справке. В этом варианте будет использоваться различные учетные записи (пользователя, службы) в зависимости от выполняемой операции.
После изменения настройки, повторно запускаем полную обработку структуры, которая сейчас должна завершиться успешно.
(рис 28.13) Открываем источник данных в редакторе
(рис 28.14) Меняем настройку Impersonation Information
(рис 28.15) Результат успешной обработки структуры
После обработки можно открыть в редакторе структуру и на вкладке ). Инструмент ) позволяет увидеть характеристики выявленных кластеров. Например, кластер 4 объединяет клиентов старшего возраста (средний возраст около 63 лет), работающих в сфере управления (EnglishOccupation='Management').
Здесь же можно переименовать кластеры, провести детализацию (опция DrillThrough в контекстном меню), чтобы увидеть записи, относимые к каждому кластеру.
(рис 28.16) Просмотр модели - диаграмма кластеров
(рис 28.17) Просмотр характеристик выявленных кластеров
Теперь рассмотрим, как можно получить список клиентов с идентификаторами присвоенных им кластеров. Для этого можно использовать конструкцию прогнозирующего соединения (PREDICTIONJOIN) и функцию Cluster().
В среде BIDevStudio в окне просмотра модели перейдем на вкладку , а его код представлен ниже.
(рис 28.18) Конструктор прогнозирующих запросов
(рис 28.19) Результат выполнения запроса
SELECT
t.[CustomerKey],
t.[FirstName],
t.[MiddleName],
t.[LastName],
t.[Region],
Cluster()
From
[vTargetMail_Cl]
PREDICTIONJOIN
OPENQUERY([Adventure Works DW],
'SELECT
[CustomerKey],
[FirstName],
[MiddleName],
[LastName],
[Region],
[Gender],
[YearlyIncome],
[TotalChildren],
[NumberChildrenAtHome],
[EnglishEducation],
[EnglishOccupation],
[NumberCarsOwned],
[CommuteDistance],
[Age],
[BikeBuyer]
FROM
[dbo].[vTargetMail]
') AS t
ON
[vTargetMail_Cl].[Gender] = t.[Gender] AND
[vTargetMail_Cl].[Yearly Income] = t.[YearlyIncome] AND
[vTargetMail_Cl].[Total Children] = t.[TotalChildren] AND
[vTargetMail_Cl].[Number Children At Home] = t.[NumberChildrenAtHome] AND
[vTargetMail_Cl].[English Education] = t.[EnglishEducation] AND
[vTargetMail_Cl].[English Occupation] = t.[EnglishOccupation] AND
[vTargetMail_Cl].[Number Cars Owned] = t.[NumberCarsOwned] AND
[vTargetMail_Cl].[Commute Distance] = t.[CommuteDistance] AND
[vTargetMail_Cl].[Region] = t.[Region] AND
[vTargetMail_Cl].[Age] = t.[Age] AND
[vTargetMail_Cl].[Bike Buyer] = t.[BikeBuyer]
Задание 3. По аналогии с рассмотренным примером, выведите список клиентов с идентификаторами кластеров, к которым их относит модель.
Воспользуйтесь функцией ClusterProbability, чтобы получить оценку вероятности того, что данный вариант находится в указанном кластере.
Итак, в представлении vTargetMailу нас есть информация о клиентах (имя, дата рождения, семейное положение, число машин и т.д.) и о том, приобрел конкретный клиент велосипед или нет (столбец BikeBuyer=1, если велосипед покупался, иначе =0). Путь необходимо разделить всех клиентов на несколько групп, сходных по значениям параметров. Подобная задача называется задачей кластеризации. Средствами надстроек интеллектуального анализа для MS Office 2007 мы решали подобную задачу в ходе выполнения в ходе лабораторной работы №2. Теперь разберем, как ее решить в среде BIDevStudio.
Сначала понадобится создать структуру и модель интеллектуального анализа. Откроем созданную ранее базу аналитических служб в среде BIDevStudio, в окне ).
(рис 28.1) Создание новой структуры интеллектуального анализа данных
После вывода окна приветствия мастер DataMiningWizardзапросит, будет ли создаваемая структура основана на реляционном источнике данных или на кубе OLAP (рис 28.2). Нам нужен первый вариант, использующий реляционную БД.
(рис 28.2) Создание новой структуры интеллектуального анализа данных (продолжение)
Следующий шаг - выбор между одновременным созданием структуры и модели интеллектуального анализа и только созданием структуры. Для решения поставленной задачи нам понадобится модель, использующая алгоритм кластеризации (рис 28.3). После чего будет предложено выбрать используемое представление источника данных. Пока в нашей базе DSV один, так что проблема выбора не стоит (рис 28.4).
Следующий шаг - выбор таблицы вариантов и вложенных таблиц (если есть). В нашем случае, таблица вариантов - ).
(рис 28.3) Создание новой структуры и модели интеллектуального анализа: выбор алгоритма
(рис 28.4) Создание новой структуры и модели интеллектуального анализа: выбор представления источника данных
(рис 28.5) Выбор таблицы вариантов
Далее потребуется указать ключевой столбец, входные столбцы и столбец, значение которого будет предсказываться. Ключевой столбец ). В случае использования вложенных таблиц, указанию ключей надо уделить особое внимание. Для задачи кластеризации указание предсказываемого (Predictable) атрибута не требуется. А в качестве входных атрибутов будем использовать:
(рис 28.6) Выбор входных и предсказываемых атрибутов
(рис 28.7) Уточнение типов данных
Следующий шаг - уточнение типов данных. На рис 28.7 представлены исходные значения. Не все они могут быть признаны удачными. Например, тип содержимого (ContentType) атрибута TotalChildren установлен как "непрерывный" (Continious), тогда как более корректно был бы выбрать тип "дискретный", т.к. количество детей в семье будет принадлежать ограниченному множеству значений {0,1,2,..}. Можно изменить тип данных и тип содержимого вручную, выбирая нужное значение из выпадающего списка. А можно воспользоваться кнопкой Detect для автоматического определения. Правда в нашем случае тип содержимого для атрибутов TotalChildren и NumberChildrenAtHome придется менять все равно вручную.
После уточнения типов данных будет предложено зарезервировать часть данных для целей тестирования. В принципе, для решения задачи кластеризации тестовое множество создавать не требуется. Поэтому лучше здесь тестовый набор не создавать и в поле Percentageofdatafortesting указать значение 0%. В следующих лабораторных, когда мы будем решать задачу классификации, резервирование данных для тестирования будет необходимо.
(рис 28.8) Резервирование данных для целей тестирования
Последнее окно мастера позволяет указать названия для структуры и модели интеллектуального анализа. Предлагаемые по умолчанию названия лучше отредактировать, так чтобы они явно указывали, что это за объект. Например, созданную структуру назовем ). После чего, т.к. мы работает в режиме immediate, на сервере интеллектуального анализа будут созданы структура и модель. А в среде BIDevStudio будет открыто окно редактора, позволяющее проводить дельнейшую работу с созданными объектами. В частности, из контекстного меню на вкладке ). В процессе обработки данные будет загружены в структуру и произойдет обучение моделей.
(рис 28.9) Указание имени структуры и модели интеллектуального анализа
(рис 28.10) Окно редактора, запуск обработка структуры данных
(рис 28.11) Настройки при обработке структуры
Можно выбрать тип обработки объекта (рис 28.11):
| ProcessFull (полная обработка) | объект полностью обрабатывается, для случая структуры происходит обработка структуры и всех ее моделей; |
| ProcessDefault (обработка по умолчанию) | сервер выполняет действия, необходимые для приведения данного объекта в обработанное состояние. Например, если ProcessDefault выполняется для отдельной модели, будет обработана именно эта модель (обработка других моделей, относящихся к структуре проводиться не будет); |
| ProcessStructure (обработка структуры) | может проводиться только для структуры, при этом читаются и кэшируются данные, обработка моделей не производится; |
| ProcessClearStructure(очистка структуры) | использование этой операции в отношении структуры приведет к тому, что кэш структуры будет очищен от исходных данных, но содержащиеся в ней модели сохранятся в обработанном состоянии; |
| Unprocess (отмена обработки) | переводит объект в необработанное состояние; в случаеструктуры, из кэшей будут удалены данные и содержащиеся в структуре модели будут переведены в необработанное состояние. |
Запускаем полную обработку для созданной структуры с настройками по умолчанию. И получаем сообщение об ошибке, что в источнике данных указано значение ).
(рис 28.12) Сообщение об ошибке при попытке обработать структуру
В лабораторной работе №10, посвященной созданию источника данных, отмечалось, что к настройке ). На вкладке Impersonation Information вместо установленного ранее "Usethecredentialsof the current user" выбираем вариант "Inherit" (наследовать). Как отмечается в справке. В этом варианте будет использоваться различные учетные записи (пользователя, службы) в зависимости от выполняемой операции.
После изменения настройки, повторно запускаем полную обработку структуры, которая сейчас должна завершиться успешно.
(рис 28.13) Открываем источник данных в редакторе
(рис 28.14) Меняем настройку Impersonation Information
(рис 28.15) Результат успешной обработки структуры
После обработки можно открыть в редакторе структуру и на вкладке ). Инструмент ) позволяет увидеть характеристики выявленных кластеров. Например, кластер 4 объединяет клиентов старшего возраста (средний возраст около 63 лет), работающих в сфере управления (EnglishOccupation='Management').
Здесь же можно переименовать кластеры, провести детализацию (опция DrillThrough в контекстном меню), чтобы увидеть записи, относимые к каждому кластеру.
(рис 28.16) Просмотр модели - диаграмма кластеров
(рис 28.17) Просмотр характеристик выявленных кластеров
Теперь рассмотрим, как можно получить список клиентов с идентификаторами присвоенных им кластеров. Для этого можно использовать конструкцию прогнозирующего соединения (PREDICTIONJOIN) и функцию Cluster().
В среде BIDevStudio в окне просмотра модели перейдем на вкладку , а его код представлен ниже.
(рис 28.18) Конструктор прогнозирующих запросов
(рис 28.19) Результат выполнения запроса
SELECT
t.[CustomerKey],
t.[FirstName],
t.[MiddleName],
t.[LastName],
t.[Region],
Cluster()
From
[vTargetMail_Cl]
PREDICTIONJOIN
OPENQUERY([Adventure Works DW],
'SELECT
[CustomerKey],
[FirstName],
[MiddleName],
[LastName],
[Region],
[Gender],
[YearlyIncome],
[TotalChildren],
[NumberChildrenAtHome],
[EnglishEducation],
[EnglishOccupation],
[NumberCarsOwned],
[CommuteDistance],
[Age],
[BikeBuyer]
FROM
[dbo].[vTargetMail]
') AS t
ON
[vTargetMail_Cl].[Gender] = t.[Gender] AND
[vTargetMail_Cl].[Yearly Income] = t.[YearlyIncome] AND
[vTargetMail_Cl].[Total Children] = t.[TotalChildren] AND
[vTargetMail_Cl].[Number Children At Home] = t.[NumberChildrenAtHome] AND
[vTargetMail_Cl].[English Education] = t.[EnglishEducation] AND
[vTargetMail_Cl].[English Occupation] = t.[EnglishOccupation] AND
[vTargetMail_Cl].[Number Cars Owned] = t.[NumberCarsOwned] AND
[vTargetMail_Cl].[Commute Distance] = t.[CommuteDistance] AND
[vTargetMail_Cl].[Region] = t.[Region] AND
[vTargetMail_Cl].[Age] = t.[Age] AND
[vTargetMail_Cl].[Bike Buyer] = t.[BikeBuyer]
Задание 3. По аналогии с рассмотренным примером, выведите список клиентов с идентификаторами кластеров, к которым их относит модель.
Воспользуйтесь функцией ClusterProbability, чтобы получить оценку вероятности того, что данный вариант находится в указанном кластере.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.