Открыть сервис

Корпус современного американского английского

Корпус современного американского английского (Corpus of Contemporary American English, COCA) — это крупнейший и наиболее широко используемый в мире лингвистический корпус, представляющий собой структурированное собрание текстов на американском варианте английского языка, охватывающее период с 1990 года по настоящее время. COCA создан и поддерживается профессором Марком Дэвисом (Университет Бригама Янга, США) и предназначен для изучения лексики, грамматики, частотности слов, коллокаций и диахронических изменений в языке. Корпус регулярно пополняется, насчитывает более 1 миллиарда слов (по состоянию на 2025 год) и доступен онлайн через веб-интерфейс.

История создания

Разработка COCA началась в 2005 году под руководством Марка Дэвиса, ранее создавшего корпус исторического американского английского (COHA). Первая версия корпуса была запущена в 2008 году и содержала около 400 миллионов слов. Основной целью было создание сбалансированного, репрезентативного и постоянно обновляемого ресурса для анализа современного американского английского. В отличие от более ранних корпусов (например, Британского национального корпуса), COCA ориентирован исключительно на американский вариант языка и охватывает короткий, но интенсивно документированный период.

К 2019 году объём корпуса достиг 1 миллиарда слов, а в 2023 году была добавлена возможность поиска по текстам из социальных сетей и блогов. COCA финансируется за счёт грантов и подписок, однако базовая версия доступна бесплатно для академических пользователей.

Структура и состав

COCA состоит из восьми жанровых категорий, которые обеспечивают сбалансированное представительство различных типов речи:

  • Разговорная речь (Spoken) — транскрипты теле- и радиопередач (например, CNN, NBC, PBS), а также записи неформальных бесед (около 20% корпуса).
  • Художественная литература (Fiction) — романы, рассказы, пьесы, опубликованные в США (около 20%).
  • Популярные журналы (Magazines) — статьи из более чем 100 журналов (например, Time, Newsweek, The New Yorker) — около 20%.
  • Газеты (Newspapers) — материалы из 10 крупных американских газет (The New York Times, The Washington Post, USA Today) — около 20%.
  • Академические тексты (Academic) — научные статьи, диссертации, учебники из 100 рецензируемых журналов (около 20%).
  • Блоги (Blogs) — тексты из блогов и форумов (добавлены в 2020 году).
  • Веб-страницы (Web) — случайная выборка сайтов общего содержания (добавлены в 2023 году).
  • Социальные сети (Social Media) — посты из Twitter и Reddit (добавлены в 2024 году).

Каждая категория включает тексты, созданные носителями американского английского, и равномерно распределена по годам (примерно по 20 миллионов слов в год на категорию до 2020 года). Это позволяет проводить диахронические исследования — например, отслеживать рост популярности слова «selfie» после 2010 года.

Функциональные возможности

COCA предоставляет несколько типов поиска:

  • Поиск по слову или фразе — показывает частотность, контекстные примеры (KWIC — ключевое слово в контексте) и распределение по жанрам.
  • Поиск по коллокациям — выявляет слова, которые наиболее часто встречаются рядом с заданным словом (например, «strong» + «coffee»).
  • Сравнение частот — позволяет сопоставить употребление двух слов или конструкций (например, «start to do» vs «start doing»).
  • Диахронический анализ — график изменения частотности по годам.
  • Поиск по грамматическим шаблонам — с использованием частей речи (например, найти все прилагательные, стоящие перед существительным «problem»).
  • Создание списков слов — по частотности, жанру или временному периоду.

Интерфейс корпуса поддерживает регулярные выражения, фильтрацию по жанрам и годам, а также экспорт результатов в CSV.

Применение

COCA используется в нескольких областях:

  • Лексикография — для составления словарей (например, Merriam-Webster) и уточнения значений слов на основе реального употребления.
  • Преподавание английского языка — для создания учебных материалов, основанных на реальных данных (data-driven learning), и для демонстрации студентам типичных коллокаций.
  • Переводоведение — для проверки переводческих решений и поиска эквивалентов.
  • Лингвистические исследования — для изучения грамматических изменений (например, рост употребления «like» как дискурсивного маркера), семантических сдвигов и региональных вариаций (хотя COCA не различает диалекты внутри США).
  • Корпусная лингвистика — как эталонный ресурс для сравнения с другими корпусами (например, Британским национальным корпусом).

Критика и ограничения

Несмотря на широкое признание, COCA имеет ряд недостатков:

  • Неполнота разговорной речи — транскрипты телепередач не полностью отражают спонтанную устную речь, а записи неформальных бесед ограничены.
  • Дисбаланс жанров — академические и газетные тексты перепредставлены по сравнению с разговорной речью.
  • Отсутствие метаданных — корпус не содержит информации о возрасте, поле, образовании или регионе говорящих, что ограничивает социолингвистические исследования.
  • Авторские права — тексты защищены копирайтом, поэтому корпус не может быть свободно скачан; доступ только через веб-интерфейс.
  • Акцент на письменную речь — несмотря на включение устных транскриптов, доля письменных текстов значительно выше.

Сравнение с другими корпусами

COCA часто сравнивают с Британским национальным корпусом (BNC, 100 миллионов слов, 1980-1993) и Корпусом глобального английского (GloWbE, 1,9 миллиарда слов, 20 стран). В отличие от BNC, COCA охватывает более поздний период и постоянно обновляется. GloWbE шире по географии, но не сбалансирован по жанрам и не имеет диахронической разметки. COCA остаётся стандартом для изучения именно американского английского.

Доступность

COCA доступен по адресу corpus.byu.edu/coca. Бесплатный аккаунт позволяет выполнять до 100 запросов в день; платная подписка (от 25 долларов в год) снимает ограничения и даёт доступ к расширенным функциям (например, загрузка результатов). Корпус также интегрирован в некоторые лингвистические программы (AntConc, Sketch Engine) через API.

Интересные факты

  • COCA используется в судебной лингвистике: например, для определения авторства текстов или проверки подлинности документов.
  • С помощью корпуса было выявлено, что слово «they» в единственном числе (как гендерно-нейтральное местоимение) резко увеличило частотность после 2015 года.
  • Наиболее частое существительное в COCA — «time» (более 2,5 миллионов вхождений), а наиболее частый глагол — «be» (в различных формах).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →