Информационные системы: определение и применение
Области применения информационных систем можно разделить на две крупные. Первая — выполнение вычислений разной степени сложности. Вторая — создание автоматизированных информационных систем, таких как
ERP (Enterprise Resource Planning — планирование ресурсов предприятия) и
CRM (Customer Relationship Management — управление взаимоотношениями с клиентами).
Информационная система (ИС) — это совокупность структурированных данных и комплекса программно-аппаратных средств для их хранения и манипулирования. Для работы необходимы и программный код, реализующий бизнес-логику, и «железо», на котором эта логика выполняется.
Классы информационных систем
Выделяют три крупных класса.
1.
Информационно-поисковые системы ориентированы на поиск в больших объёмах данных. Главное — наличие поискового критерия. Данные возвращаются в том виде, в котором хранятся, без сложной модификации. Задача системы — обеспечить хранение, индексацию и инструмент ввода запросов. Современные системы поддерживают запросы на естественном языке без перевода на
SQL (Structured Query Language).
2.
Системы обработки данных фокусируются на преобразовании информации из одной формы в другую. Пользователя интересует результат обработки, а не исходные данные. Вывод промежуточных результатов необязателен. Пример: стемминг текста — приведение слов к нормальной форме и удаление стоп-слов (союзов, предлогов). Полученный набор нормализованных слов подаётся на вход алгоритму анализа; сам по себе он ценности не представляет.
3.
Информационно-аналитические системы нацелены на многомерный анализ. Пользователь получает результат в виде сводных таблиц, графиков или ключевых показателей эффективности —
KPI (Key Performance Indicators). Вывод информации обязателен. Современные BI-решения (Business Intelligence) нередко объединяют полный цикл — загрузку, хранение, обработку и анализ — в рамках одной платформы. Следующая ступень — системы поддержки принятия решений с имитационным моделированием.
Виды информационных систем
По видам ИС делятся на три типа.
•
Фактографические системы регистрируют конкретные значения параметров объектов реального мира. Информация строго структурирована, ответы однозначны. Пример — системы сбора климатических показателей (температура, давление, влажность).
•
Документальные системы работают с совокупностью неструктурированных документов: текстов, графики, видео. «Документ» понимается абстрактно. Результатом запроса является перечень документов, в той или иной мере удовлетворяющих условиям. Интерпретация содержания для получения окончательного ответа остаётся за человеком. Выделение структуры (заглавия, разделов) — задача дополнительной обработки, не реализуемая на уровне хранения.
•
Аналитические системы оперируют структурированными данными, включая результаты обработки исходных документов. Формируется набор метрик, позволяющих оценить объекты в соответствии с бизнес-задачей (например, степень юридического соответствия документа). Пользователь получает не документ целиком, а конкретный релевантный фрагмент или показатель. Для анализа текстов применяются методы вроде
TF-IDF (Term Frequency-Inverse Document Frequency) и рекуррентные нейронные сети.
Базовые понятия: объект, данные, KPI
•
Объект — нечто существующее и различимое. Уровень детализации (грануляция) диктуется предметной областью и бизнес-задачей. Например, упаковка воды может рассматриваться как один объект или как совокупство объектов-бутылок.
•
Данные — исходные показатели, характеризующие объект и принимающие конкретные значения для каждого его экземпляра. Это цифровая форма зафиксированных характеристик.
•
Ключевые показатели (KPI) — производные величины, вычисляемые на основе первичных данных.
Структурирование информации
Структурирование — введение соглашений о способе представления информации. Один и тот же набор сведений может быть представлен в разной структурированной форме. Например, данные о человеке можно записать в одно поле «ФИО» или разделить на «Фамилия», «Имя», «Отчество». Выбор влияет на возможности дальнейшего анализа.
Структурирование тесно связано с принципом
атомарности, являющимся требованием
первой нормальной формы. Оно предполагает, что каждое поле содержит только неделимую информацию. Однако если элемент данных (например, ФИО) используется исключительно как справочный реквизит и впоследствии деперсонализируется, допустимо хранить его слитно, жертвуя атомарностью ради удобства. Когда же требуется анализ по отдельным компонентам (поиск по фамилии), разделение обязательно.
Файловая организация данных
Традиционный подход к хранению — использование файлов.
Файл — это именованная область внешней памяти, в которую можно записывать и из которой можно считывать данные.
Стандартные операции любой файловой системы:
• создание файла (иногда с указанием типа и размера);
• открытие ранее созданного файла;
• чтение записей: текущей, следующей, предыдущей, первой, последней;
• запись на место текущей записи или добавление новой строки.
Типы файлов
1.
Файл последовательного доступа. Записи могут иметь произвольную длину. Поля внутри строки разделяются
разделителем — символом пунктуации (запятая, точка с запятой, двоеточие). Ключевое требование: символ-разделитель не должен встречаться внутри самих данных, иначе машина не сможет правильно определить границы полей. Записи добавляются, как правило, в конец. Недостаток — невозможность упорядочить строки; для поиска нужной записи приходится последовательно просматривать весь файл.
2.
Файл произвольного доступа. Записи имеют фиксированную длину, задаваемую при создании. Строки нумеруются, что существенно ускоряет поиск и допускает сортировку. Плата за быстродействие — невозможность добавить поле переменной длины; все записи обязаны укладываться в установленный лимит.
Краткие итоги
Понимание информационных систем начинается с осознания их двойственной природы: это и инструмент вычислений, и среда автоматизации бизнес-процессов. Такое разделение определяет архитектурные решения. Классификация на поисковые, обрабатывающие и аналитические системы задаёт спектр работы с данными — от простого извлечения до многомерного анализа, где результат становится основой для принятия решений. Практическая ценность типологии в том, что она помогает проектировщику выбрать адекватный инструментарий: когда достаточно индексации и поиска, а когда требуется глубокая аналитическая платформа.
Видовая классификация — фактография, документы, аналитика — добавляет измерение структурированности информации. Фактографические системы дают однозначность и строгую формализацию, документальные — гибкость неструктурированного поиска с последующей интерпретацией человеком, аналитические — метрики и готовые выводы. Эти различия прямо влияют на ожидания пользователя и формат ответа системы, а значит, должны быть учтены на этапе постановки задачи.
Переход к понятиям объекта, данных и KPI формирует базовый словарь моделирования: любая предметная область сводится к различению сущностей, их атрибутов и расчётных показателей. Именно здесь возникает ключевая дилемма структурирования — компромисс между атомарностью и удобством использования. Первая нормальная форма не является догмой; она зависит от аналитических задач. Если атрибут не будет分解яться, его можно хранить слитно, снижая избыточность. Этот принцип напрямую связывается с обсуждением файловых систем.
Файлы последовательного доступа с разделителями допускают произвольную длину полей, но жертвуют скоростью поиска и сортировкой; файлы произвольного доступа требуют фиксированной длины, однако обеспечивают быстрый доступ. Перед нами классический компромисс между гибкостью и производительностью, с которым сталкиваются при проектировании даже простых хранилищ.
В совокупности материал выстраивает логическую цепочку: от бизнес-потребности и типа системы через определение сущностей и их атрибутов к конкретному способу физического хранения. Такой взгляд позволяет принимать обоснованные решения на ранних этапах моделирования данных — будь то выбор между документной и фактографической системой или определение подходящей файловой структуры для прототипа.
1. Информационная система объединяет данные, программные и аппаратные средства для хранения и манипулирования информацией.
2. Два магистральных применения ИС — вычисления и создание автоматизированных систем (ERP, CRM).
3. Информационно-поисковые системы извлекают данные по критерию, не преобразуя их; ключевую роль играет индексация.
4. Системы обработки данных трансформируют информацию; промежуточный результат может не иметь самостоятельной ценности.
5. Информационно-аналитические системы нацелены на многомерный анализ и визуализацию, предоставляя основу для принятия решений.
6. Фактографические системы оперируют строго структурированными данными с однозначными ответами.
7. Документальные системы возвращают неструктурированные документы; интерпретация содержания остаётся за пользователем.
8. Аналитические системы выдают не целые документы, а метрики и конкретные результаты анализа.
9. Объект, данные и KPI — базовые элементы описания предметной области; уровень их детализации диктуется бизнес-задачей.
10. Структурирование информации — договорённость о формате, влияющая на возможности анализа; один и тот же набор данных может быть представлен по-разному.
11. Атомарность (первая нормальная форма) не абсолютна: объединение допустимо, если элементы не анализируются по отдельности.
12. Файлы последовательного доступа удобны для данных переменной длины, но медленны в поиске; произвольный доступ требует фиксированной длины, обеспечивая скорость и сортировку.
1. Какие две основные области применения выделяют для информационных систем?
2. В чём главное отличие информационно-поисковой системы от системы обработки данных с точки зрения результата для пользователя?
3. Какую задачу решают информационно-аналитические системы и в какой форме обычно выдаётся результат?
4. Чем фактографическая система принципиально отличается от документальной по характеру хранимых данных?
5. Почему в документальных системах невозможно получить однозначный ответ на запрос без участия человека?
6. Что такое ключевые показатели (KPI) и как они связаны с первичными данными?
7. От чего зависит выбор уровня атомарности при структурировании данных?
8. Какие стандартные операции должна поддерживать любая файловая система?
9. Каким образом файл последовательного доступа решает проблему хранения записей разной длины?
10. Почему в файле произвольного доступа записи должны иметь фиксированную длину?
11. В какой ситуации целесообразно предпочесть файл последовательного доступа файлу произвольного доступа?
12. Как принцип атомарности связан с первой нормальной формой?