Открыть сервис

Common Voice

Common Voice — это краудсорсинговый проект Mozilla Foundation (организация признана в РФ нежелательной), направленный на создание свободной и открытой многоязычной базы голосовых данных для обучения систем распознавания речи и синтеза речи. Проект основан на принципах открытого исходного кода и добровольного участия, позволяя любому желающему записывать и проверять голосовые фрагменты.

История

Проект Common Voice был запущен Mozilla Foundation в 2017 году как ответ на доминирование коммерческих, закрытых голосовых баз данных, таких как те, что используются в продуктах Google, Amazon и Apple. Основной целью было демократизировать доступ к технологиям распознавания речи, сделав их доступными для разработчиков, исследователей и стартапов, особенно в языках, которые не обслуживаются крупными корпорациями.

Первый публичный релиз набора данных состоялся в 2017 году и содержал около 400 000 записанных фраз на английском языке. В последующие годы проект быстро расширялся: к 2019 году в нём участвовало более 50 000 добровольцев, а база данных включала 29 языков. К 2023 году Common Voice стал крупнейшим публично доступным набором голосовых данных в мире, содержащим более 20 000 часов записей на более чем 100 языках. В 2023 году Mozilla Foundation передала управление проектом независимой некоммерческой организации Common Voice Foundation, чтобы обеспечить его долгосрочную устойчивость и независимость.

Архитектура и принципы работы

Сбор данных

Проект использует веб-интерфейс (сайт commonvoice.mozilla.org) и мобильные приложения для сбора голосовых записей. Процесс состоит из двух основных этапов:

  1. Запись: Пользователь читает предложения, отображаемые на экране, и записывает свой голос через микрофон. Каждое предложение обычно длится от 2 до 10 секунд.
  2. Проверка: Другие пользователи прослушивают записанные фрагменты и подтверждают, что они соответствуют тексту, не содержат посторонних шумов и имеют приемлемое качество звука. Каждая запись должна быть проверена как минимум двумя разными людьми, прежде чем быть включённой в итоговый набор данных.

Технические характеристики

Каждая запись в наборе данных Common Voice содержит:

  • Аудиофайл в формате MP3 (с частотой дискретизации 48 кГц, моно).
  • Транскрипцию (текст, который был произнесён).
  • Метаданные: демографическую информацию о говорящем (возраст, пол, акцент), если пользователь предоставил её добровольно, а также идентификатор языка и уникальный идентификатор записи.

Все данные распространяются под лицензией Creative Commons Zero (CC0), что означает отказ от всех авторских прав и позволяет использовать их без ограничений, в том числе в коммерческих целях.

Языки и участие

Поддержка языков

Common Voice поддерживает широкий спектр языков, от распространённых (английский, испанский, французский, немецкий) до редких и исчезающих (например, баскский, кечуа, тамильский). Включение нового языка в проект требует от сообщества носителей этого языка выполнения нескольких условий:

  • Наличие текстовых предложений, которые можно записать (обычно из открытых источников, таких как Википедия или проекты по сбору текстов).
  • Минимальное количество активных участников (обычно не менее 10–20 человек) для записи и проверки.
  • Создание языкового сообщества, которое будет поддерживать и развивать проект на этом языке.

Участие сообщества

Проект полностью зависит от добровольцев, которые могут участвовать в нескольких ролях:

  • Записывающие: Люди, которые читают и записывают предложения.
  • Проверяющие: Люди, которые прослушивают и оценивают качество записей.
  • Переводчики: Люди, которые переводят интерфейс сайта и предложения на новые языки.
  • Модераторы: Опытные участники, которые помогают управлять сообществом и поддерживать качество данных.

Применение

Данные Common Voice используются в различных областях, связанных с обработкой естественного языка (NLP) и речевыми технологиями:

Обучение моделей распознавания речи (ASR)

Основное применение — обучение моделей автоматического распознавания речи (ASR). Разработчики и исследователи могут использовать открытые наборы данных для создания систем, которые понимают устную речь на разных языках, акцентах и диалектах. Например, на основе Common Voice были обучены модели в проектах DeepSpeech (Mozilla) и Coqui STT.

Синтез речи (TTS)

Данные также используются для обучения систем синтеза речи (Text-to-Speech, TTS), которые преобразуют письменный текст в естественно звучащую речь. Это позволяет создавать голосовые помощники, аудиокниги и системы озвучивания для людей с ограниченными возможностями.

Исследования в области лингвистики и социолингвистики

Поскольку набор данных включает демографические метаданные, он может использоваться для изучения вариативности речи в зависимости от возраста, пола и географического положения. Исследователи могут анализировать акценты, произношение и другие лингвистические особенности.

Разработка приложений для редких языков

Common Voice особенно ценен для языков, которые не имеют коммерческих голосовых баз данных. Он позволяет создавать речевые интерфейсы для малых народов, способствуя сохранению и развитию их языков в цифровой среде.

Критика и ограничения

Несмотря на успех, проект Common Voice сталкивается с рядом критических замечаний и ограничений:

Качество данных

Поскольку записи делаются в домашних условиях без контроля качества, многие фрагменты содержат фоновый шум, эхо, искажения или неразборчивую речь. Это может снижать точность моделей, обученных на этих данных, по сравнению с моделями, обученными на профессионально записанных корпусах.

Демографический дисбаланс

Участники проекта не являются репрезентативной выборкой населения. Большинство добровольцев — молодые люди, владеющие английским языком, из развитых стран. Это приводит к тому, что данные для многих языков и акцентов представлены неравномерно, что может создавать предвзятость в обученных моделях.

Ограниченный объём для некоторых языков

Для многих редких языков объём собранных данных остаётся крайне малым (менее 10 часов), что недостаточно для обучения качественных моделей ASR или TTS. Проект требует постоянного притока новых участников для поддержания и расширения этих языковых корпусов.

Проблемы с конфиденциальностью

Хотя проект собирает только добровольно предоставленные данные, существуют опасения по поводу возможности идентификации говорящих по голосовым отпечаткам. Mozilla Foundation утверждает, что принимает меры для анонимизации данных, но полная гарантия отсутствует.

Интересные факты

  • По состоянию на 2024 год, Common Voice содержит записи на более чем 120 языках, включая такие редкие, как инуктитут (язык эскимосов Канады) и маори (язык коренного населения Новой Зеландии).
  • Проект использовался для создания голосовых помощников для людей с нарушениями зрения, а также для обучения систем распознавания речи в автомобилях и умных колонках.
  • В 2020 году Common Voice был включён в список «100 лучших изобретений 2020 года» по версии журнала Time.

Источники

  • Официальный сайт проекта Common Voice (commonvoice.mozilla.org)
  • «Mozilla Common Voice: A Large-Scale, Open-Source, Multilingual Speech Corpus» (статья в журнале Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing)
  • «Common Voice: A Community-Driven Speech Corpus» (доклад на конференции Interspeech 2019)
  • «The Mozilla Common Voice Dataset: A Large-Scale, Open-Source, Multilingual Speech Corpus» (статья в журнале Language Resources and Evaluation, 2021)
  • «Time 100 Best Inventions of 2020» (журнал Time, 2020)

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →