Synthesia
Synthesia — это британская технологическая компания, основанная в 2017 году, и одноимённая платформа на основе искусственного интеллекта для создания видеороликов с синтезированными аватарами (диджитал-двойниками) и голосовым озвучиванием. Сервис позволяет пользователям генерировать видео с «виртуальными ведущими», которые читают текст, введённый пользователем, без необходимости привлекать реальных актёров, операторов или студийное оборудование. Платформа относится к категории генеративных нейросетей и используется в корпоративном обучении, маркетинге, создании презентаций и новостных выпусков.
История
Компания Synthesia была основана в Лондоне предпринимателями Виктором Риппарбелли, Матиасом Ниджамом, Штеффеном Тьоннеландом и Лурдес Агирре. Первоначально проект развивался как исследовательский стартап в области компьютерного зрения и синтеза речи. В 2019 году Synthesia привлекла начальные инвестиции от венчурных фондов, включая First Minute Capital и LDV Capital.
Ключевой прорыв произошёл в 2020 году, когда компания выпустила публичную бета-версию платформы, позволяющую создавать видео с цифровыми аватарами на основе одного изображения лица. В 2021 году Synthesia получила $12,5 млн в рамках раунда серии A, возглавляемого венчурным фондом Balderton Capital. В 2023 году компания завершила раунд серии C на сумму $90 млн, достигнув оценки в $1 млрд, что сделало её «единорогом» в сфере генеративного ИИ.
В 2024 году Synthesia запустила функцию «персонализированных аватаров» (Custom Avatars), позволяющую пользователям создавать цифровые копии реальных людей на основе короткой видеозаписи (от 2 до 5 минут). Также была представлена поддержка более 140 языков и диалектов, включая русский.
Технология
Генерация аватаров
Основой Synthesia является нейросетевая модель, обученная на тысячах часов видеозаписей человеческих лиц. Процесс создания аватара включает:
- Запись эталонного видео — пользователь записывает себя на камеру, читая заданный текст.
- Извлечение лицевых параметров — алгоритм анализирует мимику, артикуляцию, движение губ и глаз, а также текстуру кожи.
- Синтез движения — на основе введённого текста нейросеть генерирует последовательность кадров, в которых аватар синхронизирует движения губ с произносимыми словами (липсинк).
- Рендеринг — итоговое видео собирается в реальном времени или в пакетном режиме.
Озвучивание
Для генерации голоса используется технология text-to-speech (TTS) на основе нейросетей. Платформа поддерживает как предустановленные голоса (с различными тембрами, акцентами и темпами речи), так и возможность клонирования голоса пользователя (с его согласия) для создания персонализированного озвучивания.
Интерфейс
Пользовательский интерфейс Synthesia построен по принципу «видеоредактора без монтажа»: пользователь выбирает аватара, вводит текст в текстовое поле, настраивает фон, добавляет субтитры и медиафайлы (изображения, видео, музыка). Платформа автоматически генерирует готовое видео, которое можно скачать или опубликовать.
Виды аватаров
Synthesia предлагает несколько категорий цифровых аватаров:
- Готовые аватары (Stock Avatars) — библиотека из более чем 150 предустановленных персонажей, созданных на основе лиц профессиональных актёров. Доступны в различных возрастах, полах и этнических типах.
- Персонализированные аватары (Custom Avatars) — создаются по заказу пользователя на основе его собственного видео. Требуют согласия человека, чьё лицо используется.
- Аватары-ведущие (Presenter Avatars) — оптимизированы для чтения новостей, лекций или презентаций. Обычно изображаются в деловом стиле.
- Анимированные аватары — стилизованные персонажи (например, мультяшные или в стиле 3D-графики), которые не требуют фотореалистичности.
Применение
Корпоративное обучение и L&D (Learning & Development)
Synthesia активно используется крупными компаниями (например, IKEA, BBC, Heineken, Xerox) для создания учебных видеороликов. Преимущество — возможность быстро локализовать контент на десятки языков, не привлекая дикторов и переводчиков. Типичные сценарии: инструктажи по технике безопасности, обучение работе с ПО, корпоративные регламенты.
Маркетинг и реклама
Маркетологи применяют Synthesia для создания персонализированных видеороликов (например, обращений к клиентам по имени) и A/B-тестирования креативов. Платформа позволяет генерировать видео с разными аватарами и сценариями за минуты.
Новостные и информационные выпуски
Некоторые медиа (например, издания в ОАЭ и Индии) используют Synthesia для создания автоматических новостных выпусков, где аватар-ведущий зачитывает сводку новостей. Это снижает затраты на производство контента.
Образование
Образовательные платформы и онлайн-курсы применяют Synthesia для создания видеоуроков с виртуальным преподавателем. В отличие от записи реального лектора, такой подход позволяет легко обновлять материал.
Развлечения и социальные сети
Синтезированные аватары используются в создании коротких видео для TikTok, Instagram (продукт Meta, признанной экстремистской и запрещённой в РФ) и YouTube, а также в интерактивных играх и виртуальных ассистентах.
Ограничения и критика
Качество и реалистичность
Несмотря на прогресс, аватары Synthesia могут демонстрировать эффект «зловещей долины» (uncanny valley) — неестественные движения глаз, отсутствие тонкой мимики (например, морщин вокруг глаз при улыбке) и неидеальную синхронизацию губ при сложных фонемах. На 2025 год качество генерации значительно улучшилось, но всё ещё уступает профессиональной видеозаписи.
Этические проблемы
Основной этический вызов — возможность создания дипфейков (deepfakes) без согласия человека. Synthesia ввела политику «согласия на аватар»: для создания персонализированного аватара требуется явное разрешение модели, а платформа проверяет личность через верификацию. Однако критики указывают, что технология может быть использована для создания фальшивых видео с политиками, знаменитостями или обычными людьми. В 2023 году компания ужесточила модерацию, запретив создание аватаров без подтверждения прав.
Зависимость от интернета и облачных вычислений
Synthesia работает как облачный сервис (SaaS). Для генерации видео требуется стабильное интернет-соединение, а обработка данных происходит на серверах компании. Это вызывает вопросы о конфиденциальности: пользовательские видео и тексты хранятся на серверах Synthesia (в зашифрованном виде, по заявлению компании).
Юридические аспекты
В ряде стран (включая государства Евросоюза и Китай) действуют законы, регулирующие использование синтезированных лиц и голосов. Например, в ЕС требуется маркировка контента, созданного ИИ. Synthesia внедрила автоматическое добавление водяных знаков и метаданных, указывающих на искусственное происхождение видео.
Конкуренты
На рынке синтезированных видео Synthesia конкурирует с рядом платформ:
- HeyGen — китайско-американский сервис, также предлагающий генерацию аватаров и озвучивание. Отличается более низкой ценой и поддержкой китайского языка.
- Colossyan — венгерская платформа, ориентированная на корпоративное обучение.
- Elai.io — сервис, позволяющий создавать видео с аватарами на основе текста и изображений.
- DeepBrain AI — южнокорейская компания, специализирующаяся на «AI-ведущих» для новостей и рекламы.
Интересные факты
- В 2023 году Synthesia запустила «Академию аватаров» — программу обучения для актёров, желающих стать «лицами» для готовых аватаров. Компания выплачивает им роялти за использование их изображений.
- Платформа поддерживает генерацию видео в формате 4K, но для этого требуется подписка уровня Enterprise.
- В 2024 году Synthesia представила функцию «живых аватаров» (Live Avatars), позволяющую вести прямые эфиры с синтезированным ведущим, управляемым в реальном времени.
Источники
- Официальный сайт Synthesia (synthesia.io)
- Статья «Synthesia raises $90M to become a unicorn in generative AI video» — TechCrunch, 2023
- Документация Synthesia: «How Custom Avatars Work»
- Отчёт «The State of AI Video Generation 2024» — Gartner
- Материалы конференции NeurIPS 2022: «Realistic Lip-Sync with Neural Networks»
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →