Открыть сервис

Text Encoding Initiative

Text Encoding Initiative (TEI) — это международный консорциум и одновременно разрабатываемый им стандарт цифровой разметки текстов, предназначенный для представления гуманитарных, лингвистических и исторических документов в машиночитаемом формате. Стандарт TEI определяет набор правил, схем и рекомендаций (Guidelines) для кодирования текстов с использованием языка разметки XML (Extensible Markup Language). TEI обеспечивает унифицированный подход к описанию структуры, содержания, метаданных и особенностей текстовых источников, что позволяет создавать устойчивые, интероперабельные и долговременно сохраняемые цифровые коллекции.

История

Предпосылки и создание

Необходимость в едином стандарте для цифрового представления текстов возникла в 1980-х годах в связи с развитием компьютерных технологий и ростом объёмов оцифрованных гуманитарных материалов. Разрозненные проекты (например, Thesaurus Linguae Graecae, женевский проект по кодированию французской литературы) использовали собственные форматы, что затрудняло обмен данными и их долгосрочное хранение. В 1987 году на конференции Ассоциации гуманитарных вычислений (ACH) и Ассоциации компьютерной лингвистики (ACL) было принято решение о создании рабочей группы для разработки общего стандарта. В 1988 году при поддержке Национального гуманитарного центра (США) и ряда европейских организаций был учреждён консорциум Text Encoding Initiative. Первая версия руководства (P1 — Poughkeepsie Guidelines) была опубликована в 1990 году.

Развитие версий

Стандарт TEI постоянно эволюционирует. Ключевые версии:

  • P1 (1990) — первая версия, содержавшая базовые рекомендации для кодирования прозы, поэзии и драмы.
  • P2 (1992) — расширенная версия, включившая поддержку лингвистических корпусов, словарей и критических изданий.
  • P3 (1994) — первая стабильная версия, опубликованная в виде двухтомного печатного издания. Она заложила основу для последующего развития.
  • P4 (2002) — переход на XML (вместо SGML) и интеграция с XML Schema. Версия стала широко применяться в цифровых архивах.
  • P5 (2007, с регулярными обновлениями) — действующая версия. Она включает модульную архитектуру, поддержку Unicode, улучшенные средства для работы с факсимиле, рукописями, лингвистическими аннотациями и метаданными. Последнее обновление (P5: 4.7.0) вышло в 2023 году.

Структура и принципы стандарта

Модульная архитектура

TEI построен по модульному принципу. Базовый набор элементов (core) включает обязательные теги для разметки заголовков, абзацев, списков, выделений и ссылок. Дополнительные модули (например, tei.drama, tei.transcr, tei.linguistics) подключаются по необходимости и предоставляют специализированные элементы для кодирования драматических произведений, транскрипции рукописей, лингвистических корпусов и т.д. Это позволяет адаптировать стандарт под конкретные проекты, не перегружая схему.

Основные элементы

  • TEI Header (<teiHeader>) — обязательный элемент, содержащий метаданные о документе: название, автор, дата, источник, редактор, права доступа, описание кодирования. Он играет роль «паспорта» текста.
  • Text (<text>) — основной контейнер для содержания. Включает:
  • Front — предисловие, посвящение, эпиграф.
  • Body — основная часть текста (главы, разделы, абзацы).
  • Back — приложения, глоссарии, указатели.
  • Elements for structure<div> (раздел), <p> (абзац), <head> (заголовок), <l> (строка стиха), <sp> (реплика в драме).
  • Elements for content<name> (имя собственное), <date> (дата), <place> (место), <persName> (имя лица), <rs> (ссылка на объект).
  • Critical apparatus — элементы для кодирования вариантов текста (например, <app>, <rdg>, <lem>) в критических изданиях.
  • Linguistic annotation<w> (слово), <c> (символ), <seg> (сегмент), <fs> (структура признаков) для разметки корпусов.
  • Transcription<surface>, <zone>, <line> для описания физических характеристик рукописей.

Принципы кодирования

  • Иерархичность: текст разбивается на вложенные структурные единицы (документ → раздел → абзац → предложение).
  • Независимость от представления: разметка описывает содержание и структуру, а не внешний вид (шрифт, размер). Стилизация выполняется через CSS или XSLT.
  • Расширяемость: пользователи могут создавать собственные элементы (через механизм @type или @subtype) при условии соблюдения общей логики TEI.
  • Сохранение оригинального текста: TEI не требует исправления ошибок или нормализации орфографии — все изменения (например, исправление опечаток) кодируются специальными элементами (<sic>, <corr>).

Применение

Цифровые архивы и библиотеки

TEI широко используется в цифровых гуманитарных проектах. Примеры:

  • Perseus Digital Library (Туфтский университет) — коллекция античных текстов на греческом и латинском языках, размеченных в TEI.
  • Women Writers Project (Северо-Восточный университет, США) — архив произведений женщин-писательниц XVII–XIX веков.
  • TextGrid (Германия) — платформа для создания и публикации научных изданий на основе TEI.
  • Корпус русского языка (ruscorpora.ru) — использует TEI-подобную разметку для лингвистической аннотации.

Лингвистические корпуса

TEI является основой для многих языковых корпусов, включая:

  • Британский национальный корпус (BNC) — один из первых крупных корпусов, размеченных по TEI.
  • Корпус современного американского английского (COCA).
  • Национальный корпус русского языка (НКРЯ) — использует расширенную версию TEI для морфологической и синтаксической разметки.

Критические издания

TEI позволяет создавать сложные издания, включающие:

  • Транскрипции рукописей с указанием разночтений.
  • Факсимиле (изображения страниц).
  • Комментарии и примечания.
  • Аппарат вариантов (критический аппарат).

Образование и исследования

TEI используется в университетских курсах по цифровым гуманитарным наукам, компьютерной лингвистике и текстологии. Студенты обучаются разметке текстов, созданию цифровых изданий и работе с TEI-инструментами (например, oXygen XML Editor, TEI Publisher).

Инструменты и программное обеспечение

Редакторы и валидаторы

  • oXygen XML Editor — коммерческий редактор с поддержкой TEI-схем, подсветкой синтаксиса и автодополнением.
  • TEI Publisher — веб-приложение для публикации TEI-документов в формате HTML, EPUB или PDF.
  • TEI Validator — онлайн-инструмент для проверки соответствия документа схеме TEI.
  • Visual Studio Code с расширениями — бесплатный редактор с поддержкой XML и TEI.

Библиотеки и API

  • TEI Boilerplate — JavaScript-библиотека для отображения TEI-документов в браузере.
  • CETEIcean — библиотека для рендеринга TEI в веб-страницах.
  • TEI Processing Model — механизм для преобразования TEI в другие форматы (XSLT).

Критика и ограничения

Сложность и порог входа

TEI считается одним из самых сложных стандартов цифровой разметки. Полное руководство (Guidelines) насчитывает более 2000 страниц, а количество элементов превышает 500. Это требует от пользователей значительного времени на обучение и понимания XML-технологий.

Избыточность для простых проектов

Для небольших текстов (например, личных дневников или блогов) использование TEI может быть избыточным. В таких случаях часто применяются более лёгкие форматы (Markdown, HTML, TEI Simple).

Совместимость и версионирование

Разные версии TEI (P3, P4, P5) не полностью совместимы между собой. Миграция проектов с устаревших версий на новые требует дополнительных усилий. Кроме того, TEI-документы, созданные в разных проектах, могут отличаться по степени детализации и использованию расширений, что затрудняет автоматический обмен данными.

Зависимость от XML

XML-формат, хотя и является стандартом, критикуется за избыточность (большой объём файлов) и сложность обработки по сравнению с JSON или YAML. Однако для гуманитарных проектов XML остаётся предпочтительным из-за поддержки иерархических структур и метаданных.

Интересные факты

  • TEI поддерживается более чем 40 организациями, включая университеты, библиотеки и исследовательские центры по всему миру.
  • Стандарт TEI используется для кодирования текстов на более чем 100 языках, включая мёртвые (латынь, древнегреческий, санскрит).
  • TEI является основой для многих национальных и международных проектов, таких как «Европейская библиотека» (Europeana) и «Корпус средневековых текстов» (The Medieval Corpus).
  • В 2020 году TEI был включён в список «Стандартов для цифровых гуманитарных наук» Международной ассоциации цифровых гуманитарных наук (ADHO).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →