Британский национальный корпус¶
Британский национальный корпус (British National Corpus, BNC) — это собрание текстов на британском варианте английского языка, предназначенное для лингвистических исследований, лексикографии, разработки систем обработки естественного языка и преподавания. Корпус представляет собой репрезентативную выборку письменных и устных текстов, созданных в период с 1960-х по 1993 год, и содержит около 100 миллионов словоупотреблений. BNC является одним из наиболее авторитетных и широко используемых корпусов английского языка, наряду с Корпусом современного американского английского (COCA) и Национальным корпусом русского языка (НКРЯ).
¶История создания
Проект по созданию Британского национального корпуса был инициирован в 1991 году консорциумом, в который вошли издательства (Oxford University Press, Longman, Chambers), университеты (Ланкастерский университет, Оксфордский университет) и научные организации (Британская библиотека). Финансирование осуществлялось за счёт грантов и коммерческих продаж лицензий на использование корпуса. Основной целью было создание универсального инструмента для изучения современного британского английского языка, который мог бы использоваться как в академической среде, так и в коммерческой лексикографии.
Сбор текстов проводился в 1991–1994 годах. Первая версия корпуса (BNC1) была выпущена в 1994 году на компакт-дисках. В 2001 году вышла вторая версия (BNC World), содержавшая исправления и дополнения. В 2007 году была опубликована третья версия (BNC XML Edition), в которой тексты были приведены к единому формату XML. В 2014 году Оксфордский университет выпустил обновлённую версию — BNC2014, которая включает тексты, созданные в 2010-х годах, и содержит около 100 миллионов слов, но не является прямым продолжением оригинального BNC, а представляет собой отдельный корпус.
¶Состав и структура
Корпус состоит из двух основных частей: письменной (около 90 % объёма) и устной (около 10 %). Письменная часть включает образцы художественной литературы, научных и публицистических текстов, официальных документов, переписки, рекламы, а также тексты из газет, журналов и книг. Устная часть содержит транскрипции спонтанной речи, записанные в различных социальных контекстах: беседы, интервью, лекции, деловые переговоры, радиопередачи.
¶Классификация текстов
Тексты в BNC классифицируются по нескольким параметрам:
- Жанр (художественная литература, научная проза, публицистика, официальные документы и т. д.).
- Тематика (искусство, наука, политика, спорт, бытовая тематика и др.).
- Регистр (формальный, неформальный, нейтральный).
- Демографические характеристики авторов и говорящих (возраст, пол, социальный класс, регион происхождения).
Для устной части дополнительно указываются:
- Тип речи (монолог, диалог, полилог).
- Ситуация общения (частная беседа, публичное выступление, телефонный разговор).
- Социальные роли участников (равные, начальник-подчинённый, учитель-ученик).
¶Разметка и аннотация
Каждый текст в корпусе снабжён метаданными, описывающими его происхождение, жанр, автора и условия создания. Тексты проходят лингвистическую разметку, которая включает:
- Лемматизацию — приведение слов к начальной форме (например, «говорил», «говорит» → «говорить»).
- Частеречную разметку (POS-tagging) — присвоение каждому слову грамматической категории (существительное, глагол, прилагательное и т. д.).
- Синтаксический анализ (для некоторых подкорпусов) — разбиение предложений на составляющие (группы подлежащего, сказуемого и т. д.).
Для устной части дополнительно выполняется фонетическая транскрипция и разметка пауз, интонации и речевых ошибок.
¶Использование в лингвистике
BNC является основой для многих лингвистических исследований:
- Лексикография — на основе корпуса составляются словари (например, Oxford English Dictionary, Longman Dictionary of Contemporary English), где указываются частотность слов, типичные сочетания и контексты употребления.
- Грамматика — корпус позволяет изучать реальное употребление грамматических конструкций, например, использование временных форм, модальных глаголов, пассивного залога.
- Социолингвистика — анализ вариативности языка в зависимости от возраста, пола, социального статуса и региона говорящих.
- Дискурс-анализ — исследование структуры диалогов, стратегий вежливости, речевых актов.
- Корпусная лингвистика — разработка методов автоматического извлечения лингвистической информации, таких как коллокации (частотные сочетания слов), n-граммы (последовательности слов) и ключевые слова.
¶Применение в технологиях
Корпус активно используется в компьютерной лингвистике и обработке естественного языка (NLP):
- Обучение языковых моделей — BNC служит источником данных для тренировки статистических и нейросетевых моделей, таких как n-граммовые модели, Word2Vec, BERT.
- Машинный перевод — корпус используется для создания параллельных корпусов и оценки качества переводов.
- Распознавание речи — устная часть корпуса применяется для обучения акустических моделей и систем распознавания спонтанной речи.
- Автоматическое реферирование — на основе корпуса разрабатываются алгоритмы выделения ключевых предложений и генерации кратких изложений.
¶Доступ и лицензирование
Оригинальный BNC (версии 1994–2007 годов) распространяется на условиях лицензии BNC, которая разрешает некоммерческое использование в образовательных и исследовательских целях. Для коммерческого использования требуется приобретение лицензии. Корпус доступен для скачивания на сайте Оксфордского университета и через специализированные корпусные менеджеры, такие как CQPweb, Sketch Engine и AntConc.
BNC2014, выпущенный в 2014 году, также распространяется под лицензией, но его использование ограничено для некоммерческих целей. В отличие от оригинального корпуса, BNC2014 не включает устную часть и содержит только письменные тексты, созданные после 2010 года.
¶Критика и ограничения
Несмотря на широкое признание, BNC имеет ряд ограничений:
- Устаревание — тексты корпуса отражают язык конца XX века, что ограничивает его применимость для изучения современных языковых тенденций (например, влияния интернета и социальных сетей).
- Представительность — устная часть корпуса относительно невелика (около 10 миллионов слов) и не охватывает все региональные диалекты и социальные группы Великобритании.
- Авторские права — из-за ограничений авторского права корпус не включает полные тексты многих произведений, а только их фрагменты, что может затруднять анализ целостных текстов.
- Отсутствие мультимодальности — корпус содержит только текстовую информацию, без аудио- и видеозаписей, что ограничивает исследования устной речи (интонация, жесты, мимика).
¶Сравнение с другими корпусами
BNC часто сравнивают с другими крупными корпусами английского языка:
- Корпус современного американского английского (COCA) — содержит более 1 миллиарда слов, регулярно обновляется, включает тексты с 1990 года по настоящее время. В отличие от BNC, COCA ориентирован на американский вариант английского и имеет большую долю устной речи.
- Национальный корпус русского языка (НКРЯ) — аналогичный проект для русского языка, созданный в 2003 году. НКРЯ также включает письменные и устные тексты, но его объём (около 600 миллионов слов) меньше, чем у BNC.
- Британский национальный корпус 2014 (BNC2014) — более современный, но менее разнообразный по жанрам корпус, не содержащий устной части.
¶Интересные факты
- BNC стал первым крупным корпусом английского языка, который был полностью размечен вручную для частеречной разметки. Это обеспечило высокую точность, но потребовало значительных трудовых затрат.
- В корпусе представлены тексты более 4000 авторов и 7000 говорящих.
- Общий объём корпуса составляет около 100 миллионов слов, что эквивалентно примерно 1000 книгам среднего размера.
- BNC используется в преподавании английского языка как иностранного: на его основе разработаны учебные материалы, словари и тесты, такие как Oxford Bookworms и Cambridge English Corpus.
¶Источники
- Aston, G., & Burnard, L. (1998). The BNC Handbook: Exploring the British National Corpus with SARA. Edinburgh University Press.
- Burnard, L. (2007). Reference Guide for the British National Corpus (XML Edition). Oxford University Computing Services.
- Leech, G., Rayson, P., & Wilson, A. (2001). Word Frequencies in Written and Spoken English: Based on the British National Corpus. Longman.
- Официальный сайт Британского национального корпуса (Oxford University).
- Корпусная лингвистика: учебное пособие / под ред. В. П. Захарова. — М.: Либроком, 2011.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


