В проектировании онтологий условно можно выделить два направления, до некоторого времени развивавшихся отдельно. Первое связано с представлением онтологии как формальной системы, основанной на математически точных аксиомах. Второе направление развивалось в рамках компьютерной лингвистики и когнитивной науки. Там онтология понималась как система абстрактных понятий, существующих только в сознании человека, которая может быть выражена на естественном языке (или средствами какой-то другой системы символов). При этом обычно не делается предположений о точности или непротиворечивости такой системы.
Таким образом, существует два альтернативных подхода к созданию и исследованию онтологий. Первый (формальный) основан на логике (предикатов первого порядка, дескриптивной, модальной и т.п.). Второй (лингвистический) основан на изучении естественного языка (в частности, семантики) и построении онтологий на больших текстовых массивах, так называемых корпусах.
В настоящее время данные подходы тесно взаимодействуют. Идет поиск связей, позволяющих комбинировать соответствующие методы. Поэтому иногда бывает сложно отделить лексические онтологии с элементами формальных аксиоматик от логических систем с включениями лингвистических знаний.
Независимо от различных подходов можно выделить 3 основных принципа классификации онтологий:
Рассмотрим соответствующие классификации по порядку.
Обычно люди и компьютерные агенты (программы) имеют некоторое представление о значениях терминов. Программные агенты иногда предоставляют спецификацию входных и выходных данных, которые также могут быть использованы как
(рис 2.1) Спектр онтологий. Косая черта разделяет системы, предоставляющие "человеко-понятные" (выше черты) и "машино-понятные" (ниже черты) описанияНа рис. 2.1 изображен так называемый спектр онтологий по степени формальности представления, использованию тех или иных синтаксических конструкций. Каждая точка соответствует наличию некоторых ключевых структур в онтологии, отличающих ее от других точек на спектре. Косая черта условно отделяет онтологии от других ресурсов, имеющих онтологический характер.
Первой точке на спектре соответствует
Другой спецификацией онтологии может быть
предметы одежды ". Затем " платье " определялось как вид (женской) одежды. Явная иерархия Yahoo не соответствовала в точности формальным свойствам иерархического отношения ПОДКЛАСС-КЛАСС. В таких иерархиях может встретиться ситуация, в которой экземпляр класса-потомка не является экземпляром класса-предка. Например, общая категория " предметы одежды " имеет подкатегорию " женские " (которая должна была бы более точно называться " женские предметы одежды "), а эта категория, в свою очередь, включает подкатегории " аксессуары " и " платья ". Ясно, что аксессуары, например " броши ", не являются предметами одежды. Здесь не выполняется важное свойство отношения ПОДКЛАСС-КЛАСС - транзитивность.
Далее следует точка ПОДКЛАСС-КЛАСС (обозначаемого как isA )isA: если A является подклассом класса B, то каждый подкласс класса A также является подклассом класса B. Строгая иерархия классов необходима при использовании наследования для процедуры логического вывода.
Следующая точка спектра - наличие в онтологической системе формального отношения ЭКЗЕМПЛЯР-КЛАСС (обозначаемого как isInstanceOf ). Некоторые классификации включают только имена классов, другие содержат на нижнем уровне экземпляры (индивиды). Для отношения ЭКЗЕМПЛЯР-КЛАСС выполняется так называемая "наследуемость" вдоль отношения isA: если A является подклассом класса B, то каждый экземпляр класса A также является экземпляром класса B. Поэтому в приведенном выше примере " броши " не могут быть помещены в иерархии ниже " предмет одежды ", даже в подкатегорию " женские предметы одежды ", или стать экземпляром этой категории.
Далее среди структурных элементов появляются предмет одежды " может иметь свойства " цена ", " сделан из ". Свойства бывают особенно полезными, когда они определены на верхних уровнях иерархии и наследуются подклассами. Так, в потребительской иерархии класс " продукт " может иметь свойство " цена ", которое получат все его подклассы.
Большей выразительностью обладают онтологии, включающие ограничения на область значений свойств. Значения свойств берутся из некоторого предопределенного множества (целые числа, символьные константы) или из подмножества концептов онтологии (множество экземпляров данного класса, множество классов). Можно ввести дополнительные ограничения на то, что может заполнять свойство. Например, для свойства " сделан из " класса " предмет одежды " значения могут быть ограничены экземплярами класса " материал ". Легко увидеть проблемы, которые могут возникнуть в этом случае при использовании нестрогой таксономии. Если " духи " - потомок класса " предмет одежды ", то он унаследует свойство " сделан из " вместе с ограничением на его значения (" материал ").
В целом с необходимостью описывать более сложные факты выразительные средства онтологии (и ее структура) усложняются. Например, может потребоваться заполнить значение какого-либо свойства экземпляра, используя математическое выражение, основанное на значениях других свойств данного экземпляра или значениях свойств других экземпляров. Многие онтологии позволяют объявлять два и более класса дизъюнктивными (непересекающимися). Это означает, что у данных классов не существует общих экземпляров.
Некоторые языки описания онтологий позволяют делать произвольные логические утверждения о концептах -
Языки описания онтологий, такие как CycL и Ontolingua, позволяют фиксировать утверждения на языке логики предикатов первого порядка (FOL).
В рамках этой классификации выделяют 4 уровня (см. рис. 2.2): онтология представления, онтология верхнего уровня, онтология предметной области и прикладная онтология.
(рис 2.2) Классификация онтологий по цели созданияЦель ее создания - описать область представления знаний, создать язык для спецификации других онтологий более низких уровней. Пример: описание понятий языка средствами RDF / RDFS (рис. 2.3). В данном описании определяются такие понятия, как "класс", "отношение", "ограничение на значение свойства", "домен", "диапазон" и т.п.
(рис 2.3) Онтология представления для языка OWL
Ее назначение - в создании единой "правильной" онтологии, фиксирующей знания, общие для нескольких предметных областей, и в многократном использовании данной онтологии. Существует несколько крупных онтологий верхнего уровня: Cyc, , SUMO, онтология Джона Совы (J.Sowa) и другие. Но в целом попытки создать онтологию верхнего уровня на все случаи жизни пока не привели к ожидаемым результатам. Многие онтологии верхнего уровня похожи друг на друга. Они содержат одни и те же концепты: сущность, явление, процесс, объект, роль, пространство, время, материя, событие, действие и т.п.
(рис 2.4) Верхний уровень иерархии онтологии SUMO
Другое название - онтология домена. Назначение схоже с назначением онтологии верхнего уровня, но область интереса ограничена одной предметной областью (т.н. доменом), например, авиация, медицина, культура, дистанционное обучение, Интернет-технологии. Онтология предметной области обобщает понятия, использующиеся в некоторых задачах домена, абстрагируясь от самих задач (так, онтология автомобилей независима от любых особенностей конкретных марок машин). Во многих дисциплинах сейчас разрабатываются стандартные онтологии, которые могут использоваться экспертами по предметным областям для совместного использования и аннотирования информации в своей области.
Например, в области медицины созданы большие стандартные, структурированные словари, такие как SNOMED CT (UMLS (Unified Medical Language System - семантическая сеть Системы Унифицированного Медицинского Языка). Также появляются обширные общецелевые онтологии. Так, программа ООН по развитию (United Nations Development Program) и компания DunBradstreet объединили усилия для разработки онтологии UNSPSC, которая предоставляет терминологию товаров и услуг (www.unspsc.org). Еще один пример - онтология в области документации в сфере культурного наследия CIDOC CRM, которая будет рассмотрена в лекции 5.
Назначение такой онтологий в том, чтобы описать концептуальную модель конкретной задачи или приложения. Прикладные онтологии описывают концепты, которые зависят как от онтологии задач (см. ниже), так и от онтологии предметной области. Примером может служить онтология для автомобилей, строительных материалов, вычислительной техники. Такие онтологии содержат наиболее специфичную информацию. Примеры: онтологии проектов TOVE, Plinius.
TOVE (Toronto Virtual Enterprise). Цель проекта - создание модели данных, которая должна:
TOVE должно обеспечить построение интегрированной модели некоторой предметной области, состоящей из следующих онтологии: операций, состояний и времени, организации, ресурсов, продуктов, сервиса, производства, цены, количества.
Plinus. Целью проекта является полуавтоматическое
(рис 2.5) Классификация онтологий по содержимомуДанная классификация очень похожа на предыдущую, но здесь акцент смещается на реальное содержимое онтологии, а не на абстрактную цель, преследуемую авторами.
Для того чтобы применить онтологию для автоматической обработки текстов, в частности, для решения задач информационного поиска, необходимо понятиям онтологии сопоставить набор языковых выражений (слов и словосочетаний), которыми понятия могут выражаться в тексте.
Процедура сопоставления понятий онтологий и языковых выражений может быть осуществлена различными способами.
Предлагается создавать онтологию путем логического анализа, "сверху-вниз". При этом имена вводимых понятий (желательно) должны отражать те признаки, которые заложены в основу деления. В результате получаются имена понятий достаточно громоздкие, неестественные, с ними трудно оперировать как разработчикам, так и возможным пользователям.
Другая проблема такого подхода: приписывая языковые выражения логически обоснованной системе понятий, мы получаем, что одно и то же слово может соответствовать слишком большому количеству таких "правильных" понятий в зависимости от контекста, а значит, возникает излишняя многозначность лексической единицы.
Кроме того, тогда как небольшие онтологии могут быть построены методом сверху-вниз, разработка подробных онтологий для реальных приложений - задача нетривиальная. Более того, во многих предметных областях знание, нужное для распространения и интеграции, содержится в основном в текстах. Из-за внутренних свойств человеческого языка непростой задачей является связать знания, содержащиеся в текстах, с онтологиями, даже если бы была построена подробная онтология предметной области.
Некоторые исследователи, такие как известный британский лингвист Йорик Вилкс, считают, что "несмотря на то, что все авторы статей по онтологиям подчеркивают, что понятия являются кирпичиками любой онтологии, мы манипулируем понятиями посредством слов. Во всех онтологиях, которые известны, слова используются для того, чтобы представлять понятия. Следовательно, то множество явлений в мире, которые не вербализованы, не могут быть смоделированы. Мы можем описать это явление как Онтологическую гипотезу Сепира-Уорфа, то есть то, что не описывается словами, не может быть отражено в онтологии:".
Главной характеристикой лингвистических онтологий является то, что они привязаны к значениям ("are bound to the semantics") языковых выражений (слов, именных групп и т.п.). Лингвистические онтологии охватывают большинство слов языка и одновременно имеют онтологическую структуру, проявляющуюся в отношениях между понятиями. Поэтому лингвистические онтологии могут рассматриваться как особый вид лексической базы данных и особый тип онтологии.
Лингвистические онтологии отличаются от формальных онтологий по степени формализации. Поэтому предполагается, что разработчики такого рода ресурсов разрабатывают иерархию лексических значений естественного языка, а для более строгого описания знаний о мире необходимо сопоставить такие ресурсы с какими-либо формальными онтологиями.
Так, содержанием одного из проектов является установление отношений между WordNet и EuroWordNet, c одной стороны, и формальной онтологией SUMO - Standardized Upper Merged Ontology - с другой. Проект состоит в том, чтобы установить соответствие между синсетами WordNet и понятиями онтологии, при котором каждый синсет WordNet либо напрямую сопоставляется с понятием онтологии, либо является гипонимом для некоторого понятия или экземпляром (элементом) понятия онтологии.
Участники другого проекта - OntoWordNet - считают, что недостаточно провести формальную склейку ресурса типа WordNet и формальной онтологии: необходима значительная реструктуризация исходного лексического ресурса. Аналогичная работа проводится и в проекте Cyc.
В проектировании онтологий условно можно выделить два направления, до некоторого времени развивавшихся отдельно. Первое связано с представлением онтологии как формальной системы, основанной на математически точных аксиомах. Второе направление развивалось в рамках компьютерной лингвистики и когнитивной науки. Там онтология понималась как система абстрактных понятий, существующих только в сознании человека, которая может быть выражена на естественном языке (или средствами какой-то другой системы символов). При этом обычно не делается предположений о точности или непротиворечивости такой системы.
Таким образом, существует два альтернативных подхода к созданию и исследованию онтологий. Первый (формальный) основан на логике (предикатов первого порядка, дескриптивной, модальной и т.п.). Второй (лингвистический) основан на изучении естественного языка (в частности, семантики) и построении онтологий на больших текстовых массивах, так называемых корпусах.
В настоящее время данные подходы тесно взаимодействуют. Идет поиск связей, позволяющих комбинировать соответствующие методы. Поэтому иногда бывает сложно отделить лексические онтологии с элементами формальных аксиоматик от логических систем с включениями лингвистических знаний.
Независимо от различных подходов можно выделить 3 основных принципа классификации онтологий:
Рассмотрим соответствующие классификации по порядку.
Обычно люди и компьютерные агенты (программы) имеют некоторое представление о значениях терминов. Программные агенты иногда предоставляют спецификацию входных и выходных данных, которые также могут быть использованы как
(рис 2.1) Спектр онтологий. Косая черта разделяет системы, предоставляющие "человеко-понятные" (выше черты) и "машино-понятные" (ниже черты) описанияНа рис. 2.1 изображен так называемый спектр онтологий по степени формальности представления, использованию тех или иных синтаксических конструкций. Каждая точка соответствует наличию некоторых ключевых структур в онтологии, отличающих ее от других точек на спектре. Косая черта условно отделяет онтологии от других ресурсов, имеющих онтологический характер.
Первой точке на спектре соответствует
Другой спецификацией онтологии может быть
предметы одежды ". Затем " платье " определялось как вид (женской) одежды. Явная иерархия Yahoo не соответствовала в точности формальным свойствам иерархического отношения ПОДКЛАСС-КЛАСС. В таких иерархиях может встретиться ситуация, в которой экземпляр класса-потомка не является экземпляром класса-предка. Например, общая категория " предметы одежды " имеет подкатегорию " женские " (которая должна была бы более точно называться " женские предметы одежды "), а эта категория, в свою очередь, включает подкатегории " аксессуары " и " платья ". Ясно, что аксессуары, например " броши ", не являются предметами одежды. Здесь не выполняется важное свойство отношения ПОДКЛАСС-КЛАСС - транзитивность.
Далее следует точка ПОДКЛАСС-КЛАСС (обозначаемого как isA )isA: если A является подклассом класса B, то каждый подкласс класса A также является подклассом класса B. Строгая иерархия классов необходима при использовании наследования для процедуры логического вывода.
Следующая точка спектра - наличие в онтологической системе формального отношения ЭКЗЕМПЛЯР-КЛАСС (обозначаемого как isInstanceOf ). Некоторые классификации включают только имена классов, другие содержат на нижнем уровне экземпляры (индивиды). Для отношения ЭКЗЕМПЛЯР-КЛАСС выполняется так называемая "наследуемость" вдоль отношения isA: если A является подклассом класса B, то каждый экземпляр класса A также является экземпляром класса B. Поэтому в приведенном выше примере " броши " не могут быть помещены в иерархии ниже " предмет одежды ", даже в подкатегорию " женские предметы одежды ", или стать экземпляром этой категории.
Далее среди структурных элементов появляются предмет одежды " может иметь свойства " цена ", " сделан из ". Свойства бывают особенно полезными, когда они определены на верхних уровнях иерархии и наследуются подклассами. Так, в потребительской иерархии класс " продукт " может иметь свойство " цена ", которое получат все его подклассы.
Большей выразительностью обладают онтологии, включающие ограничения на область значений свойств. Значения свойств берутся из некоторого предопределенного множества (целые числа, символьные константы) или из подмножества концептов онтологии (множество экземпляров данного класса, множество классов). Можно ввести дополнительные ограничения на то, что может заполнять свойство. Например, для свойства " сделан из " класса " предмет одежды " значения могут быть ограничены экземплярами класса " материал ". Легко увидеть проблемы, которые могут возникнуть в этом случае при использовании нестрогой таксономии. Если " духи " - потомок класса " предмет одежды ", то он унаследует свойство " сделан из " вместе с ограничением на его значения (" материал ").
В целом с необходимостью описывать более сложные факты выразительные средства онтологии (и ее структура) усложняются. Например, может потребоваться заполнить значение какого-либо свойства экземпляра, используя математическое выражение, основанное на значениях других свойств данного экземпляра или значениях свойств других экземпляров. Многие онтологии позволяют объявлять два и более класса дизъюнктивными (непересекающимися). Это означает, что у данных классов не существует общих экземпляров.
Некоторые языки описания онтологий позволяют делать произвольные логические утверждения о концептах -
Языки описания онтологий, такие как CycL и Ontolingua, позволяют фиксировать утверждения на языке логики предикатов первого порядка (FOL).
В рамках этой классификации выделяют 4 уровня (см. рис. 2.2): онтология представления, онтология верхнего уровня, онтология предметной области и прикладная онтология.
(рис 2.2) Классификация онтологий по цели созданияЦель ее создания - описать область представления знаний, создать язык для спецификации других онтологий более низких уровней. Пример: описание понятий языка средствами RDF / RDFS (рис. 2.3). В данном описании определяются такие понятия, как "класс", "отношение", "ограничение на значение свойства", "домен", "диапазон" и т.п.
(рис 2.3) Онтология представления для языка OWL
Ее назначение - в создании единой "правильной" онтологии, фиксирующей знания, общие для нескольких предметных областей, и в многократном использовании данной онтологии. Существует несколько крупных онтологий верхнего уровня: Cyc, , SUMO, онтология Джона Совы (J.Sowa) и другие. Но в целом попытки создать онтологию верхнего уровня на все случаи жизни пока не привели к ожидаемым результатам. Многие онтологии верхнего уровня похожи друг на друга. Они содержат одни и те же концепты: сущность, явление, процесс, объект, роль, пространство, время, материя, событие, действие и т.п.
(рис 2.4) Верхний уровень иерархии онтологии SUMO
Другое название - онтология домена. Назначение схоже с назначением онтологии верхнего уровня, но область интереса ограничена одной предметной областью (т.н. доменом), например, авиация, медицина, культура, дистанционное обучение, Интернет-технологии. Онтология предметной области обобщает понятия, использующиеся в некоторых задачах домена, абстрагируясь от самих задач (так, онтология автомобилей независима от любых особенностей конкретных марок машин). Во многих дисциплинах сейчас разрабатываются стандартные онтологии, которые могут использоваться экспертами по предметным областям для совместного использования и аннотирования информации в своей области.
Например, в области медицины созданы большие стандартные, структурированные словари, такие как SNOMED CT (UMLS (Unified Medical Language System - семантическая сеть Системы Унифицированного Медицинского Языка). Также появляются обширные общецелевые онтологии. Так, программа ООН по развитию (United Nations Development Program) и компания DunBradstreet объединили усилия для разработки онтологии UNSPSC, которая предоставляет терминологию товаров и услуг (www.unspsc.org). Еще один пример - онтология в области документации в сфере культурного наследия CIDOC CRM, которая будет рассмотрена в лекции 5.
Назначение такой онтологий в том, чтобы описать концептуальную модель конкретной задачи или приложения. Прикладные онтологии описывают концепты, которые зависят как от онтологии задач (см. ниже), так и от онтологии предметной области. Примером может служить онтология для автомобилей, строительных материалов, вычислительной техники. Такие онтологии содержат наиболее специфичную информацию. Примеры: онтологии проектов TOVE, Plinius.
TOVE (Toronto Virtual Enterprise). Цель проекта - создание модели данных, которая должна:
TOVE должно обеспечить построение интегрированной модели некоторой предметной области, состоящей из следующих онтологии: операций, состояний и времени, организации, ресурсов, продуктов, сервиса, производства, цены, количества.
Plinus. Целью проекта является полуавтоматическое
(рис 2.5) Классификация онтологий по содержимомуДанная классификация очень похожа на предыдущую, но здесь акцент смещается на реальное содержимое онтологии, а не на абстрактную цель, преследуемую авторами.
Для того чтобы применить онтологию для автоматической обработки текстов, в частности, для решения задач информационного поиска, необходимо понятиям онтологии сопоставить набор языковых выражений (слов и словосочетаний), которыми понятия могут выражаться в тексте.
Процедура сопоставления понятий онтологий и языковых выражений может быть осуществлена различными способами.
Предлагается создавать онтологию путем логического анализа, "сверху-вниз". При этом имена вводимых понятий (желательно) должны отражать те признаки, которые заложены в основу деления. В результате получаются имена понятий достаточно громоздкие, неестественные, с ними трудно оперировать как разработчикам, так и возможным пользователям.
Другая проблема такого подхода: приписывая языковые выражения логически обоснованной системе понятий, мы получаем, что одно и то же слово может соответствовать слишком большому количеству таких "правильных" понятий в зависимости от контекста, а значит, возникает излишняя многозначность лексической единицы.
Кроме того, тогда как небольшие онтологии могут быть построены методом сверху-вниз, разработка подробных онтологий для реальных приложений - задача нетривиальная. Более того, во многих предметных областях знание, нужное для распространения и интеграции, содержится в основном в текстах. Из-за внутренних свойств человеческого языка непростой задачей является связать знания, содержащиеся в текстах, с онтологиями, даже если бы была построена подробная онтология предметной области.
Некоторые исследователи, такие как известный британский лингвист Йорик Вилкс, считают, что "несмотря на то, что все авторы статей по онтологиям подчеркивают, что понятия являются кирпичиками любой онтологии, мы манипулируем понятиями посредством слов. Во всех онтологиях, которые известны, слова используются для того, чтобы представлять понятия. Следовательно, то множество явлений в мире, которые не вербализованы, не могут быть смоделированы. Мы можем описать это явление как Онтологическую гипотезу Сепира-Уорфа, то есть то, что не описывается словами, не может быть отражено в онтологии:".
Главной характеристикой лингвистических онтологий является то, что они привязаны к значениям ("are bound to the semantics") языковых выражений (слов, именных групп и т.п.). Лингвистические онтологии охватывают большинство слов языка и одновременно имеют онтологическую структуру, проявляющуюся в отношениях между понятиями. Поэтому лингвистические онтологии могут рассматриваться как особый вид лексической базы данных и особый тип онтологии.
Лингвистические онтологии отличаются от формальных онтологий по степени формализации. Поэтому предполагается, что разработчики такого рода ресурсов разрабатывают иерархию лексических значений естественного языка, а для более строгого описания знаний о мире необходимо сопоставить такие ресурсы с какими-либо формальными онтологиями.
Так, содержанием одного из проектов является установление отношений между WordNet и EuroWordNet, c одной стороны, и формальной онтологией SUMO - Standardized Upper Merged Ontology - с другой. Проект состоит в том, чтобы установить соответствие между синсетами WordNet и понятиями онтологии, при котором каждый синсет WordNet либо напрямую сопоставляется с понятием онтологии, либо является гипонимом для некоторого понятия или экземпляром (элементом) понятия онтологии.
Участники другого проекта - OntoWordNet - считают, что недостаточно провести формальную склейку ресурса типа WordNet и формальной онтологии: необходима значительная реструктуризация исходного лексического ресурса. Аналогичная работа проводится и в проекте Cyc.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.