Корпус современного американского английского¶
Корпус современного американского английского (Corpus of Contemporary American English, COCA) — это крупнейший и наиболее широко используемый в мире лингвистический корпус, представляющий собой структурированное собрание текстов на американском варианте английского языка, охватывающее период с 1990 года по настоящее время. COCA создан и поддерживается профессором Марком Дэвисом (Университет Бригама Янга, США) и предназначен для изучения лексики, грамматики, частотности слов, коллокаций и диахронических изменений в языке. Корпус регулярно пополняется, насчитывает более 1 миллиарда слов (по состоянию на 2025 год) и доступен онлайн через веб-интерфейс.
¶История создания
Разработка COCA началась в 2005 году под руководством Марка Дэвиса, ранее создавшего корпус исторического американского английского (COHA). Первая версия корпуса была запущена в 2008 году и содержала около 400 миллионов слов. Основной целью было создание сбалансированного, репрезентативного и постоянно обновляемого ресурса для анализа современного американского английского. В отличие от более ранних корпусов (например, Британского национального корпуса), COCA ориентирован исключительно на американский вариант языка и охватывает короткий, но интенсивно документированный период.
К 2019 году объём корпуса достиг 1 миллиарда слов, а в 2023 году была добавлена возможность поиска по текстам из социальных сетей и блогов. COCA финансируется за счёт грантов и подписок, однако базовая версия доступна бесплатно для академических пользователей.
¶Структура и состав
COCA состоит из восьми жанровых категорий, которые обеспечивают сбалансированное представительство различных типов речи:
- Разговорная речь (Spoken) — транскрипты теле- и радиопередач (например, CNN, NBC, PBS), а также записи неформальных бесед (около 20% корпуса).
- Художественная литература (Fiction) — романы, рассказы, пьесы, опубликованные в США (около 20%).
- Популярные журналы (Magazines) — статьи из более чем 100 журналов (например, Time, Newsweek, The New Yorker) — около 20%.
- Газеты (Newspapers) — материалы из 10 крупных американских газет (The New York Times, The Washington Post, USA Today) — около 20%.
- Академические тексты (Academic) — научные статьи, диссертации, учебники из 100 рецензируемых журналов (около 20%).
- Блоги (Blogs) — тексты из блогов и форумов (добавлены в 2020 году).
- Веб-страницы (Web) — случайная выборка сайтов общего содержания (добавлены в 2023 году).
- Социальные сети (Social Media) — посты из Twitter и Reddit (добавлены в 2024 году).
Каждая категория включает тексты, созданные носителями американского английского, и равномерно распределена по годам (примерно по 20 миллионов слов в год на категорию до 2020 года). Это позволяет проводить диахронические исследования — например, отслеживать рост популярности слова «selfie» после 2010 года.
¶Функциональные возможности
COCA предоставляет несколько типов поиска:
- Поиск по слову или фразе — показывает частотность, контекстные примеры (KWIC — ключевое слово в контексте) и распределение по жанрам.
- Поиск по коллокациям — выявляет слова, которые наиболее часто встречаются рядом с заданным словом (например, «strong» + «coffee»).
- Сравнение частот — позволяет сопоставить употребление двух слов или конструкций (например, «start to do» vs «start doing»).
- Диахронический анализ — график изменения частотности по годам.
- Поиск по грамматическим шаблонам — с использованием частей речи (например, найти все прилагательные, стоящие перед существительным «problem»).
- Создание списков слов — по частотности, жанру или временному периоду.
Интерфейс корпуса поддерживает регулярные выражения, фильтрацию по жанрам и годам, а также экспорт результатов в CSV.
¶Применение
COCA используется в нескольких областях:
- Лексикография — для составления словарей (например, Merriam-Webster) и уточнения значений слов на основе реального употребления.
- Преподавание английского языка — для создания учебных материалов, основанных на реальных данных (data-driven learning), и для демонстрации студентам типичных коллокаций.
- Переводоведение — для проверки переводческих решений и поиска эквивалентов.
- Лингвистические исследования — для изучения грамматических изменений (например, рост употребления «like» как дискурсивного маркера), семантических сдвигов и региональных вариаций (хотя COCA не различает диалекты внутри США).
- Корпусная лингвистика — как эталонный ресурс для сравнения с другими корпусами (например, Британским национальным корпусом).
¶Критика и ограничения
Несмотря на широкое признание, COCA имеет ряд недостатков:
- Неполнота разговорной речи — транскрипты телепередач не полностью отражают спонтанную устную речь, а записи неформальных бесед ограничены.
- Дисбаланс жанров — академические и газетные тексты перепредставлены по сравнению с разговорной речью.
- Отсутствие метаданных — корпус не содержит информации о возрасте, поле, образовании или регионе говорящих, что ограничивает социолингвистические исследования.
- Авторские права — тексты защищены копирайтом, поэтому корпус не может быть свободно скачан; доступ только через веб-интерфейс.
- Акцент на письменную речь — несмотря на включение устных транскриптов, доля письменных текстов значительно выше.
¶Сравнение с другими корпусами
COCA часто сравнивают с Британским национальным корпусом (BNC, 100 миллионов слов, 1980-1993) и Корпусом глобального английского (GloWbE, 1,9 миллиарда слов, 20 стран). В отличие от BNC, COCA охватывает более поздний период и постоянно обновляется. GloWbE шире по географии, но не сбалансирован по жанрам и не имеет диахронической разметки. COCA остаётся стандартом для изучения именно американского английского.
¶Доступность
COCA доступен по адресу corpus.byu.edu/coca. Бесплатный аккаунт позволяет выполнять до 100 запросов в день; платная подписка (от 25 долларов в год) снимает ограничения и даёт доступ к расширенным функциям (например, загрузка результатов). Корпус также интегрирован в некоторые лингвистические программы (AntConc, Sketch Engine) через API.
¶Интересные факты
- COCA используется в судебной лингвистике: например, для определения авторства текстов или проверки подлинности документов.
- С помощью корпуса было выявлено, что слово «they» в единственном числе (как гендерно-нейтральное местоимение) резко увеличило частотность после 2015 года.
- Наиболее частое существительное в COCA — «time» (более 2,5 миллионов вхождений), а наиболее частый глагол — «be» (в различных формах).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


