Text Encoding Initiative
Text Encoding Initiative (TEI) — это международный консорциум и одновременно разрабатываемый им стандарт цифровой разметки текстов, предназначенный для представления гуманитарных, лингвистических и исторических документов в машиночитаемом формате. Стандарт TEI определяет набор правил, схем и рекомендаций (Guidelines) для кодирования текстов с использованием языка разметки XML (Extensible Markup Language). TEI обеспечивает унифицированный подход к описанию структуры, содержания, метаданных и особенностей текстовых источников, что позволяет создавать устойчивые, интероперабельные и долговременно сохраняемые цифровые коллекции.
История
Предпосылки и создание
Необходимость в едином стандарте для цифрового представления текстов возникла в 1980-х годах в связи с развитием компьютерных технологий и ростом объёмов оцифрованных гуманитарных материалов. Разрозненные проекты (например, Thesaurus Linguae Graecae, женевский проект по кодированию французской литературы) использовали собственные форматы, что затрудняло обмен данными и их долгосрочное хранение. В 1987 году на конференции Ассоциации гуманитарных вычислений (ACH) и Ассоциации компьютерной лингвистики (ACL) было принято решение о создании рабочей группы для разработки общего стандарта. В 1988 году при поддержке Национального гуманитарного центра (США) и ряда европейских организаций был учреждён консорциум Text Encoding Initiative. Первая версия руководства (P1 — Poughkeepsie Guidelines) была опубликована в 1990 году.
Развитие версий
Стандарт TEI постоянно эволюционирует. Ключевые версии:
- P1 (1990) — первая версия, содержавшая базовые рекомендации для кодирования прозы, поэзии и драмы.
- P2 (1992) — расширенная версия, включившая поддержку лингвистических корпусов, словарей и критических изданий.
- P3 (1994) — первая стабильная версия, опубликованная в виде двухтомного печатного издания. Она заложила основу для последующего развития.
- P4 (2002) — переход на XML (вместо SGML) и интеграция с XML Schema. Версия стала широко применяться в цифровых архивах.
- P5 (2007, с регулярными обновлениями) — действующая версия. Она включает модульную архитектуру, поддержку Unicode, улучшенные средства для работы с факсимиле, рукописями, лингвистическими аннотациями и метаданными. Последнее обновление (P5: 4.7.0) вышло в 2023 году.
Структура и принципы стандарта
Модульная архитектура
TEI построен по модульному принципу. Базовый набор элементов (core) включает обязательные теги для разметки заголовков, абзацев, списков, выделений и ссылок. Дополнительные модули (например, tei.drama, tei.transcr, tei.linguistics) подключаются по необходимости и предоставляют специализированные элементы для кодирования драматических произведений, транскрипции рукописей, лингвистических корпусов и т.д. Это позволяет адаптировать стандарт под конкретные проекты, не перегружая схему.
Основные элементы
- TEI Header (
<teiHeader>) — обязательный элемент, содержащий метаданные о документе: название, автор, дата, источник, редактор, права доступа, описание кодирования. Он играет роль «паспорта» текста. - Text (
<text>) — основной контейнер для содержания. Включает: - Front — предисловие, посвящение, эпиграф.
- Body — основная часть текста (главы, разделы, абзацы).
- Back — приложения, глоссарии, указатели.
- Elements for structure —
<div>(раздел),<p>(абзац),<head>(заголовок),<l>(строка стиха),<sp>(реплика в драме). - Elements for content —
<name>(имя собственное),<date>(дата),<place>(место),<persName>(имя лица),<rs>(ссылка на объект). - Critical apparatus — элементы для кодирования вариантов текста (например,
<app>,<rdg>,<lem>) в критических изданиях. - Linguistic annotation —
<w>(слово),<c>(символ),<seg>(сегмент),<fs>(структура признаков) для разметки корпусов. - Transcription —
<surface>,<zone>,<line>для описания физических характеристик рукописей.
Принципы кодирования
- Иерархичность: текст разбивается на вложенные структурные единицы (документ → раздел → абзац → предложение).
- Независимость от представления: разметка описывает содержание и структуру, а не внешний вид (шрифт, размер). Стилизация выполняется через CSS или XSLT.
- Расширяемость: пользователи могут создавать собственные элементы (через механизм
@typeили@subtype) при условии соблюдения общей логики TEI. - Сохранение оригинального текста: TEI не требует исправления ошибок или нормализации орфографии — все изменения (например, исправление опечаток) кодируются специальными элементами (
<sic>,<corr>).
Применение
Цифровые архивы и библиотеки
TEI широко используется в цифровых гуманитарных проектах. Примеры:
- Perseus Digital Library (Туфтский университет) — коллекция античных текстов на греческом и латинском языках, размеченных в TEI.
- Women Writers Project (Северо-Восточный университет, США) — архив произведений женщин-писательниц XVII–XIX веков.
- TextGrid (Германия) — платформа для создания и публикации научных изданий на основе TEI.
- Корпус русского языка (ruscorpora.ru) — использует TEI-подобную разметку для лингвистической аннотации.
Лингвистические корпуса
TEI является основой для многих языковых корпусов, включая:
- Британский национальный корпус (BNC) — один из первых крупных корпусов, размеченных по TEI.
- Корпус современного американского английского (COCA).
- Национальный корпус русского языка (НКРЯ) — использует расширенную версию TEI для морфологической и синтаксической разметки.
Критические издания
TEI позволяет создавать сложные издания, включающие:
- Транскрипции рукописей с указанием разночтений.
- Факсимиле (изображения страниц).
- Комментарии и примечания.
- Аппарат вариантов (критический аппарат).
Образование и исследования
TEI используется в университетских курсах по цифровым гуманитарным наукам, компьютерной лингвистике и текстологии. Студенты обучаются разметке текстов, созданию цифровых изданий и работе с TEI-инструментами (например, oXygen XML Editor, TEI Publisher).
Инструменты и программное обеспечение
Редакторы и валидаторы
- oXygen XML Editor — коммерческий редактор с поддержкой TEI-схем, подсветкой синтаксиса и автодополнением.
- TEI Publisher — веб-приложение для публикации TEI-документов в формате HTML, EPUB или PDF.
- TEI Validator — онлайн-инструмент для проверки соответствия документа схеме TEI.
- Visual Studio Code с расширениями — бесплатный редактор с поддержкой XML и TEI.
Библиотеки и API
- TEI Boilerplate — JavaScript-библиотека для отображения TEI-документов в браузере.
- CETEIcean — библиотека для рендеринга TEI в веб-страницах.
- TEI Processing Model — механизм для преобразования TEI в другие форматы (XSLT).
Критика и ограничения
Сложность и порог входа
TEI считается одним из самых сложных стандартов цифровой разметки. Полное руководство (Guidelines) насчитывает более 2000 страниц, а количество элементов превышает 500. Это требует от пользователей значительного времени на обучение и понимания XML-технологий.
Избыточность для простых проектов
Для небольших текстов (например, личных дневников или блогов) использование TEI может быть избыточным. В таких случаях часто применяются более лёгкие форматы (Markdown, HTML, TEI Simple).
Совместимость и версионирование
Разные версии TEI (P3, P4, P5) не полностью совместимы между собой. Миграция проектов с устаревших версий на новые требует дополнительных усилий. Кроме того, TEI-документы, созданные в разных проектах, могут отличаться по степени детализации и использованию расширений, что затрудняет автоматический обмен данными.
Зависимость от XML
XML-формат, хотя и является стандартом, критикуется за избыточность (большой объём файлов) и сложность обработки по сравнению с JSON или YAML. Однако для гуманитарных проектов XML остаётся предпочтительным из-за поддержки иерархических структур и метаданных.
Интересные факты
- TEI поддерживается более чем 40 организациями, включая университеты, библиотеки и исследовательские центры по всему миру.
- Стандарт TEI используется для кодирования текстов на более чем 100 языках, включая мёртвые (латынь, древнегреческий, санскрит).
- TEI является основой для многих национальных и международных проектов, таких как «Европейская библиотека» (Europeana) и «Корпус средневековых текстов» (The Medieval Corpus).
- В 2020 году TEI был включён в список «Стандартов для цифровых гуманитарных наук» Международной ассоциации цифровых гуманитарных наук (ADHO).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →