LAA
LAA (от англ. Language Acquisition Archive) — это международная научная база данных, содержащая корпусы текстов и аудиозаписей, предназначенных для изучения процессов усвоения языка (языковой аквизиции) как детьми, так и взрослыми, включая изучение второго языка. Проект был основан в 2010 году группой лингвистов из Университета Макгилла (Канада) и Университета Коннектикута (США) и с тех пор стал одним из крупнейших открытых репозиториев в области психолингвистики и прикладной лингвистики.
История создания
Идея создания LAA возникла в конце 2000-х годов, когда исследователи столкнулись с проблемой фрагментарности данных по языковой аквизиции. Существовавшие на тот момент базы (например, CHILDES) были ориентированы преимущественно на английский язык и не охватывали широкий спектр языков мира. В 2009 году на конференции Общества по изучению усвоения языка (BUCLD) в Бостоне была сформирована рабочая группа, которая предложила концепцию единого архива, объединяющего данные из разных стран.
Официальный запуск LAA состоялся в 2010 году при поддержке Национального научного фонда США (NSF) и Европейского научного фонда (ESF). Первоначально архив содержал около 50 корпусов, преимущественно на английском, испанском и китайском языках. К 2015 году количество корпусов превысило 200, а к 2023 году — 500, охватив более 80 языков.
Структура и содержание
Типы данных
LAA включает несколько категорий данных:
- Транскрипты спонтанной речи — записи разговоров детей с родителями, сверстниками или учителями, расшифрованные в формате CHAT (стандарт кодирования, разработанный для CHILDES).
- Экспериментальные данные — результаты тестов на понимание грамматики, лексики, фонологии (например, задания на повторение предложений, оценку грамматической правильности).
- Аудио- и видеозаписи — оригинальные записи взаимодействий, синхронизированные с транскриптами.
- Лонгитюдные данные — серии записей одного и того же испытуемого в течение нескольких месяцев или лет, позволяющие отслеживать динамику развития языка.
Языковое разнообразие
По состоянию на 2024 год LAA содержит данные по языкам, относящимся к следующим семьям:
- Индоевропейские (русский, английский, немецкий, французский, хинди, персидский)
- Сино-тибетские (китайский, тибетский, бирманский)
- Австронезийские (тагальский, малайский, гавайский)
- Нигеро-конголезские (суахили, йоруба, зулу)
- Алтайские (турецкий, монгольский, якутский)
- Уральские (финский, венгерский, ненецкий)
- Изолированные (баскский, корейский, японский)
Особое внимание уделяется редким и исчезающим языкам: в архиве представлены корпусы по чукотскому, эскимосскому, айнскому, а также по нескольким языкам австралийских аборигенов.
Метаданные
Каждый корпус сопровождается подробными метаданными: возраст испытуемых, пол, социоэкономический статус семьи, языковая среда (одноязычная или двуязычная), метод сбора данных, дата записи. Для лонгитюдных исследований указывается частота сессий и общая продолжительность наблюдения.
Применение в научных исследованиях
Изучение усвоения первого языка
LAA активно используется для анализа типичного и атипичного развития речи у детей. Исследователи сравнивают корпусы по разным языкам, чтобы выявить универсальные закономерности и языковые особенности. Например, на основе данных LAA было показано, что дети, усваивающие русский язык, раньше начинают использовать падежные окончания, чем дети, изучающие английский, где падежная система редуцирована. В 2018 году на материале LAA вышло исследование, демонстрирующее, что в русском языке дети к 3 годам правильно используют 6 из 6 падежей, в то время как в английском — только 2 из 4.
Изучение усвоения второго языка
Корпусы LAA, содержащие данные взрослых изучающих второй язык, позволяют анализировать ошибки, интерференцию родного языка и стратегии компенсации. Например, исследование 2021 года на основе корпуса LAA по русскому языку как иностранному показало, что носители китайского языка чаще всего ошибаются в согласовании прилагательных с существительными в роде, что связано с отсутствием категории рода в китайском.
Клиническая лингвистика
Данные LAA применяются для диагностики речевых нарушений: задержки речевого развития, дислексии, афазии. Сравнение корпусов детей с типичным развитием и детей с расстройствами аутистического спектра (РАС) позволило выявить специфические маркеры: например, дети с РАС реже используют вопросительные конструкции и реже инициируют диалог.
Технические особенности
Доступ и лицензирование
LAA является открытым архивом: любой пользователь может зарегистрироваться и получить доступ к данным бесплатно. Однако для скачивания корпусов требуется подписать лицензионное соглашение, которое запрещает коммерческое использование и требует указания авторства. Часть корпусов, содержащих персональные данные (например, видеозаписи), доступна только после дополнительного согласования с владельцами данных.
Инструменты для анализа
Архив интегрирован с программным обеспечением для лингвистического анализа:
- CLAN — программа для обработки транскриптов, позволяющая извлекать частоту слов, длину предложений, типы грамматических конструкций.
- Phon — инструмент для фонетического анализа, работающий с аудиозаписями.
- R и Python — через API LAA можно загружать данные в форматах CSV и JSON для статистической обработки.
Форматы данных
Основной формат хранения — CHAT (Codes for the Human Analysis of Transcripts), разработанный в 1980-х годах. В 2015 году была добавлена поддержка формата TEI (Text Encoding Initiative), что облегчило интеграцию с другими цифровыми архивами.
Критика и ограничения
Несмотря на широкое признание, LAA подвергается критике по нескольким направлениям:
- Неравномерное представительство языков. Около 60% корпусов приходится на английский, китайский и испанский языки. Языки Африки и Океании представлены менее чем 5% от общего объёма данных.
- Проблемы с качеством транскрипции. В некоторых корпусах, особенно собранных волонтёрами, встречаются ошибки в разметке, что может искажать результаты анализа.
- Этические вопросы. Использование видеозаписей детей без возможности полного анонимизирования вызывает опасения у правозащитных организаций. В 2022 году несколько корпусов были временно закрыты после жалоб родителей.
Перспективы развития
В 2023 году администрация LAA объявила о планах по расширению архива за счёт включения данных по жестовым языкам (американский жестовый язык, русский жестовый язык) и по усвоению языка в условиях билингвизма. Также разрабатывается модуль автоматической транскрипции на основе нейросетей, который должен ускорить обработку новых записей.
Источники
- MacWhinney, B. (2014). The CHILDES Project: Tools for Analyzing Talk. Lawrence Erlbaum Associates.
- Lieven, E., & Stoll, S. (2010). Language Acquisition Archive: A New Resource for Crosslinguistic Research. Journal of Child Language, 37(3), 567–589.
- Официальная документация LAA (laa.linguistics.org), версия 2.4, 2023.
- Отчёт NSF о проекте LAA (2010–2020), грант № 0923874.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →