Самый распространенный тип данных в компьютерном мире - это
Первая заключается в сложности единообразного представления символов текста. Для представления английских текстов достаточно ASCII. Для работы с другими языками на основе латинского алфавита, языками на основе кириллицы и некоторыми другими нужно уже несколько десятков наборов расширенного ASCII. Это означает, что одному и тому же коду, большему 127, в каждом наборе соответствует свой символ. Ситуацию усложняет и то, что для некоторых языков, в частности, русского существует несколько наборов ASCII+. Кроме того, необходимо, чтобы все символы каждого языка помещались в один набор, что невозможно для таких языков, как китайский или японский. Таблица кодировки Unicode, предназначенная для постепенной замены ASCII, - 16-разрядная, что позволяет представить 65536 кодов. Она широко используется в Linux и Microsoft Windows. Варианты Unicode позволяют использовать 31-разрядное кодирование. Использование Unicode требует переделки всех программ, рассчитанных для работы с текстами ASCII.
Для того, чтобы увидеть символы, соответствующие кодам из текстового файла, каждому коду нужно сопоставить визуальное представление символа из выбранного шрифта.
Компьютерный шрифт - это набор именованных кодами рисунков знаков.
Таким образом, чтобы интерактивно работать с текстовым файлом необходимо знать его кодировку (из текстовых файлов, как правило, прямой информации о кодировке получить нельзя - ее надо знать или угадать!) и иметь в системе шрифт, соответствующий этой кодировке.
Вторая проблема связана с тем, что такие средства как курсивный, полужирный или подчеркнутый текст, а также графики, диаграммы, примечания, звук, видео и т.п. элементы электронных документов, выходят за рамки естественных, интуитивных элементов текста и требуют соглашений по их использованию, что приводит к возникновению различных форматов текстовых данных. Последние иногда даже не ориентированы на непосредственную работу с ними человека, фактически не отличаясь по назначению в таких случаях, от бинарных данных.
Внесение в простой текст (
При физической разметке точно указывается, что нужно сделать с выбранным фрагментом текста: показать курсивным, приподнять, центрировать, сжать, подчеркнуть и т.п. При логической разметке указывается структурный смысл выбранного фрагмента: примечание, начало раздела, конец подраздела, ссылка на другой фрагмент и т.п.
Для печати документа на принтере или показе на экране используется физическая разметка. Исторически она появилась первой, но имеет очевидные недостатки. Например, в Америке и Европе существуют разные стандарты на размер писчей бумаги, наборы шрифтов и размер экрана меняются от системы к системе, - подобные обстоятельства требуют трудоемкого изменения физической разметки текста при использовании одного и того же документа на разных компьютерах. Кроме того, физическая разметка, как правило, привязана к конкретным программным средствам, время жизни которых ограничено, что не позволяет вести архивы документации без риска через несколько десятков лет остаться без средств для работы с ними.
Логическую разметку всегда можно преобразовать в физическую, используя
Основные форматы текста с разметкой:
Документы в Internet часто публикуются в обработанном программами сжатия данных виде. Наиболее используемые форматы сжатия - это zip и tgz (tar.gz). Формат tgz - это результат конвейерного применения команд: сначала tar (собирает файлы и каталоги в один файл с сохранением структуры каталогов) и затем gzip.
Часто в Internet нужно преобразовывать бинарные данные в текстовые (для
отправке по электронной почте, например) и затем наоборот. Для этого, в
частности, служат программы
World Wide Web (WWW, всемирная паутина) базируется на трех стандартах:
URI (Universal Resource Identifier, универсальный идентификатор ресурса,
раньше назывался URL) - предоставляет стандартный способ
задания местоположения любого ресурса Internet, HTTP (Hyper Text Transfer
Protocol,
HTML - язык логической разметки, хотя и допускающий возможность рекомендовать ту или иную физическую разметку выбранного фрагмента текста. Конкретная физическая разметка документа зависит от программы-браузера (browser), используемой для его просмотра. Документы HTML из-за содержащихся в них, как правило, большого количества ссылок на другие документы HTML, с которыми они образуют единое целое, мало приспособлены для распечатки на принтере.
Имя файла с документом HTML имеет обычно расширение html или htm. Существуют ряд программ, позволяющих создавать документы HTML в визуальном режиме и не требующих от их пользователя знания HTML. Но создать сложный интерактивный документ без такого знания непросто.
<A HREF="http://www.linux.org"> имеет имя A (anchor, якорь),
атрибут HREF со значением "http://www.linux.org".
Некоторые теги самодостаточны, например, тег разрыва строки <BR>
(break), но большинство тегов - это пары из A, то имя закрывающего - /A. Открывающий и закрывающий теги обрамляют некоторый фрагмент текста,
вместе с которым они образуют
Парные теги EM (STRONG (особо выделить), CITE
(цитата или ссылка), CODE (компьютерная программа), (sample, текст
примера), STRIKE (зачеркнуть) и некоторые другие позволяют логически
выделить фрагменты текста, а парные теги B (bold, полужирный), I (italic,
курсив), U (undelined, подчеркнутый), TT (SUB
(SUP (
Полный документ представляет собой один элемент текста HTML. Заголовки -
это элементы H1, H2, H3 и т.д. Число после H (header) - это уровень
вложенности заголовка, т.е. H1 - это заголовок всего документа, H2 -
H3 - подраздела и т.д. Абзацы - это
элементы P (paragraph). Элементы PRE (preformatted) должны отображаться
браузером с таким же разбиением на строки как и в исходном документе.
Специальные символы можно ввести в документ, используя их имена (entity),
заключенные между знаками и точка с запятой. Например, сам знак можно
ввести как amp;, а знак кавычка - quot;.
Ссылки и маркеры, объявляются при помощи атрибутов HREF и NAME
соответственно. Например, элемент <A NAME="chapter3"></A> - это метка, на которую
можно ссылаться по имени chapter3, используя, например, ссылку <A HREF="\#chapter3">Глава 3</A>.
Тег IMG (image, образ) позволяет вставить SRC (source, источник) для указания URI
файла с графикой и ALT (alternative, альтернатива) для указания
альтернативного текста, показываемого вместо картинки, в случае, когда файл
с графикой недоступен или его тип неизвестен браузеру.
Документы HTML могут быть использованы для интерактивной работы. Например,
элемент FORM позволяет пользователю web-страницы передать введенную в
страницу информацию на HTTP-сервер. Элемент FORM может содержать
разнообразные кнопки, списки, всплывающие меню, однострочные и
многострочные текстовые поля и другие компоненты. Обработкой введенных,
переданных на сервер данных и созданием динамических HTML-документов в ответ
на них занимаются специальные программы,
Комментарии вводятся между символами <!-{}- и -{}->.
HTML содержит средства для описания данных в виде таблиц и использования
таблиц стилей. HTML использует стандартные
Имена файлов-документов SGML, как правило, имеют расширение sgml. SGML с начала 1970-х разрабатывался фирмой IBM, а с 1986 года принят в качестве международного стандарта (ISO 8879) для формата документов с логической разметкой. Сначала документ SGML содержит описание вида кодирования и разметки текста и затем сам размеченный текст. HTML - это SGML с фиксированной разметкой. Создатели технологии WWW отказались от полной поддержки SGML только потому, что в начале 1990-х системы, которые могли работать с SGML в реальном времени были очень дороги.
Элементы SGML делятся на четыре категории:
H1, P, A, IMG и т.п.;amp;<! и заканчивать знаком >>. Примером
конструкции, определяющей ссылку ref; на словосочетание "The Reference"
будет <!ENTITY ref "The Reference"> ;<? и > - они вводят элементы текста, ориентированного на
конкретную, зависящую от системы обработку (физическую разметку). В HTML
с их помощью, например, вставляют код для обработки на сервере WWW страниц.Документы SGML можно конвертировать как в гипертекст, так и в любой формат, ориентированный на распечатку, например, TeX или Microsoft Word. Ведение документации в формате SGML во многих отношениях оптимально.
С 1996 официально идет разработка формата XML - подмножества SGML, которое предполагается использовать в Internet наряду с HTML. Преимущество XML перед HTML в его четкой связи с SGML, что позволяет стандартным образом вводить в документ новые конструкции, избегая тем самым неконтролируемого введения в язык новых возможностей, как это происходит с HTML.
Упражнение 53 Как на HTML описать заголовок первого уровня "Глава 2", на который можно будет ссылаться по имени "2"?
Известный американский математик и теоретик программирования Дональд Кнут
(D. E. Knuth) более 10 лет с конца 1970-х годов разрабатывал систему верстки
книг TeX (произносится "тех"). Существует множество расширений
возможностей базового (plain) TeX. TeX популярен прежде всего
в академических кругах, т.к. в целом он весьма сложен
для изучения. В отличие от систем, ориентированных на интерпретацию
разметки, подобных Microsoft Word или Sun Star Writer, TeX -
компилирующая система. Результат компиляции документа TeX - это файл в
бинарном формате \ означает центрировать
строку-абзац "Это мой заголовок", напечатав слово "мой" в нем курсивом,
а запись $$\int_1^{}x\{dt\ over t}=\ln
x$$ - формулу$$\int_1^x{dt \over t}=\ln x.$$
TeX - это особый
язык программирования. Энтузиасты TeX написали на нем интерпретатор языка
Бэйсик. Документы TeX могут иметь очень сложную структуру и
из-за этого их в общем случае нельзя конвертировать в другие форматы.
Документы HTML или Microsoft Word теоретически можно всегда конвертировать в
формат TeX.
Система GNU texinfo основана на TeX, но использует совершенно другой набор макросов. Макросы в этой системе должны начинаться со знака @. Документы texinfo можно преобразовать как в документ HTML, так и в качественную распечатку. В отличие от SGML, средства для такого преобразования - это часть системы texinfo. Возможности texinfo для верстки документов несколько ограниченней по сравнению с другими развитыми TeX-системами.
Расширения имен файлов документов TeX - tex; LaTeX - tex, latex,
ltx, sty (стили) и др.; METAFONT - mf (исходные программы шрифтов), tfm
(метрики шрифтов, нужны на этапе компиляции документа TeX), pk (матрицы
шрифтов, нужны при печати
PostScript - это универсальный язык программирования (имеет много
общего с языками Форт и
PostScript-программы можно писать вручную, но обычно текст
PostScript генерируется автоматически программами вывода данных. Расширения
имен файлов с PostScript-программой - это, как правило, ps, eps
(Encapsulated PostScript, файл-картинка с заданными размерами), pfa (шрифт),
pfb (бинарное представление pfa),
Преимущество формата PostScript в том, что он, как и формат
Файлы PostScript можно вручную корректировать, но из-за сложности языка - это очень не просто, особенно если используются символы, не входящие в ASCII. Фактически эти файлы можно рассматривать как "только для чтения" и использовать для распространения информации, не подлежащей изменению. Комментарии в PostScript, как и в TeX, начинаются знаком % и заканчиваются концом строки. Первая строчка PostScript-программы обычно содержит точное название формата файла. Собственно программа начинается в файле с символов %! и заканчивается символами %%EOF. PostScript-программы кроме собственной системы шрифтов могут использовать шрифты True Type фирм Apple и Microsoft.
Различают уровни (levels) языка PostScript. Уровень 1 может поддерживать только черно-белую графику. Уровень 2 может работать с цветом. Уровень 3 - это современное состояние языка.
Данные из файла PostScript можно показывать по мере их поступления, что удобно для использования в Internet. Однако есть две причины, по которым документы PostScript сравнительно редко включаются в web-страницы:
Файлы в формате PDF лишены двух означенных недостатков: они сжаты и из них сложно извлечь отдельные шрифты, - поэтому они стали фактическим стандартом Internet для обмена документами, не подлежащими изменению. Программы для просмотра PDF-файлов доступны бесплатно. Наиболее используемая из них - это Adobe Acrobat Reader. Первая строчка файла в формате PDF начинается со знака %, за которым следует идентификационная запись версии формата PDF, используемой в этом файле. Далее, как правило, идут бинарные данные. Расширение имени PDF-файла - pdf.
Между документами PostScript и PDF можно осуществлять взаимно-однозначное преобразование, хотя PDF в отличие от PostScript - это не язык программирования, а скорее язык описания документа.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.