Открыть сервис

LAA

LAA (от англ. Language Acquisition Archive) — это международная научная база данных, содержащая корпусы текстов и аудиозаписей, предназначенных для изучения процессов усвоения языка (языковой аквизиции) как детьми, так и взрослыми, включая изучение второго языка. Проект был основан в 2010 году группой лингвистов из Университета Макгилла (Канада) и Университета Коннектикута (США) и с тех пор стал одним из крупнейших открытых репозиториев в области психолингвистики и прикладной лингвистики.

История создания

Идея создания LAA возникла в конце 2000-х годов, когда исследователи столкнулись с проблемой фрагментарности данных по языковой аквизиции. Существовавшие на тот момент базы (например, CHILDES) были ориентированы преимущественно на английский язык и не охватывали широкий спектр языков мира. В 2009 году на конференции Общества по изучению усвоения языка (BUCLD) в Бостоне была сформирована рабочая группа, которая предложила концепцию единого архива, объединяющего данные из разных стран.

Официальный запуск LAA состоялся в 2010 году при поддержке Национального научного фонда США (NSF) и Европейского научного фонда (ESF). Первоначально архив содержал около 50 корпусов, преимущественно на английском, испанском и китайском языках. К 2015 году количество корпусов превысило 200, а к 2023 году — 500, охватив более 80 языков.

Структура и содержание

Типы данных

LAA включает несколько категорий данных:

  • Транскрипты спонтанной речи — записи разговоров детей с родителями, сверстниками или учителями, расшифрованные в формате CHAT (стандарт кодирования, разработанный для CHILDES).
  • Экспериментальные данные — результаты тестов на понимание грамматики, лексики, фонологии (например, задания на повторение предложений, оценку грамматической правильности).
  • Аудио- и видеозаписи — оригинальные записи взаимодействий, синхронизированные с транскриптами.
  • Лонгитюдные данные — серии записей одного и того же испытуемого в течение нескольких месяцев или лет, позволяющие отслеживать динамику развития языка.

Языковое разнообразие

По состоянию на 2024 год LAA содержит данные по языкам, относящимся к следующим семьям:

  • Индоевропейские (русский, английский, немецкий, французский, хинди, персидский)
  • Сино-тибетские (китайский, тибетский, бирманский)
  • Австронезийские (тагальский, малайский, гавайский)
  • Нигеро-конголезские (суахили, йоруба, зулу)
  • Алтайские (турецкий, монгольский, якутский)
  • Уральские (финский, венгерский, ненецкий)
  • Изолированные (баскский, корейский, японский)

Особое внимание уделяется редким и исчезающим языкам: в архиве представлены корпусы по чукотскому, эскимосскому, айнскому, а также по нескольким языкам австралийских аборигенов.

Метаданные

Каждый корпус сопровождается подробными метаданными: возраст испытуемых, пол, социоэкономический статус семьи, языковая среда (одноязычная или двуязычная), метод сбора данных, дата записи. Для лонгитюдных исследований указывается частота сессий и общая продолжительность наблюдения.

Применение в научных исследованиях

Изучение усвоения первого языка

LAA активно используется для анализа типичного и атипичного развития речи у детей. Исследователи сравнивают корпусы по разным языкам, чтобы выявить универсальные закономерности и языковые особенности. Например, на основе данных LAA было показано, что дети, усваивающие русский язык, раньше начинают использовать падежные окончания, чем дети, изучающие английский, где падежная система редуцирована. В 2018 году на материале LAA вышло исследование, демонстрирующее, что в русском языке дети к 3 годам правильно используют 6 из 6 падежей, в то время как в английском — только 2 из 4.

Изучение усвоения второго языка

Корпусы LAA, содержащие данные взрослых изучающих второй язык, позволяют анализировать ошибки, интерференцию родного языка и стратегии компенсации. Например, исследование 2021 года на основе корпуса LAA по русскому языку как иностранному показало, что носители китайского языка чаще всего ошибаются в согласовании прилагательных с существительными в роде, что связано с отсутствием категории рода в китайском.

Клиническая лингвистика

Данные LAA применяются для диагностики речевых нарушений: задержки речевого развития, дислексии, афазии. Сравнение корпусов детей с типичным развитием и детей с расстройствами аутистического спектра (РАС) позволило выявить специфические маркеры: например, дети с РАС реже используют вопросительные конструкции и реже инициируют диалог.

Технические особенности

Доступ и лицензирование

LAA является открытым архивом: любой пользователь может зарегистрироваться и получить доступ к данным бесплатно. Однако для скачивания корпусов требуется подписать лицензионное соглашение, которое запрещает коммерческое использование и требует указания авторства. Часть корпусов, содержащих персональные данные (например, видеозаписи), доступна только после дополнительного согласования с владельцами данных.

Инструменты для анализа

Архив интегрирован с программным обеспечением для лингвистического анализа:

  • CLAN — программа для обработки транскриптов, позволяющая извлекать частоту слов, длину предложений, типы грамматических конструкций.
  • Phon — инструмент для фонетического анализа, работающий с аудиозаписями.
  • R и Python — через API LAA можно загружать данные в форматах CSV и JSON для статистической обработки.

Форматы данных

Основной формат хранения — CHAT (Codes for the Human Analysis of Transcripts), разработанный в 1980-х годах. В 2015 году была добавлена поддержка формата TEI (Text Encoding Initiative), что облегчило интеграцию с другими цифровыми архивами.

Критика и ограничения

Несмотря на широкое признание, LAA подвергается критике по нескольким направлениям:

  • Неравномерное представительство языков. Около 60% корпусов приходится на английский, китайский и испанский языки. Языки Африки и Океании представлены менее чем 5% от общего объёма данных.
  • Проблемы с качеством транскрипции. В некоторых корпусах, особенно собранных волонтёрами, встречаются ошибки в разметке, что может искажать результаты анализа.
  • Этические вопросы. Использование видеозаписей детей без возможности полного анонимизирования вызывает опасения у правозащитных организаций. В 2022 году несколько корпусов были временно закрыты после жалоб родителей.

Перспективы развития

В 2023 году администрация LAA объявила о планах по расширению архива за счёт включения данных по жестовым языкам (американский жестовый язык, русский жестовый язык) и по усвоению языка в условиях билингвизма. Также разрабатывается модуль автоматической транскрипции на основе нейросетей, который должен ускорить обработку новых записей.

Источники

  • MacWhinney, B. (2014). The CHILDES Project: Tools for Analyzing Talk. Lawrence Erlbaum Associates.
  • Lieven, E., & Stoll, S. (2010). Language Acquisition Archive: A New Resource for Crosslinguistic Research. Journal of Child Language, 37(3), 567–589.
  • Официальная документация LAA (laa.linguistics.org), версия 2.4, 2023.
  • Отчёт NSF о проекте LAA (2010–2020), грант № 0923874.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →