Открыть сервисСервис

Новостной диктор на ИИ

Новостной диктор на ИИ — это программный или аппаратно-программный комплекс, использующий технологии искусственного интеллекта (ИИ) для синтеза речи, генерации изображения или анимации человека, который зачитывает новостные тексты. Такие системы предназначены для автоматизации процесса создания видеоновостей, заменяя собой традиционного телеведущего или радиодиктора. В зависимости от реализации, новостной диктор на ИИ может быть представлен в виде анимированного аватара, реалистичной 3D-модели человека или синтезированного голоса, наложенного на статичное изображение или видеоряд.

История развития

Ранние эксперименты

Первые попытки автоматизировать чтение новостей относятся к 1980-м годам, когда появились системы синтеза речи по тексту (Text-to-Speech, TTS). Однако качество голоса было низким, механическим, и такие системы не использовались в эфире. В 1990-х годах с развитием компьютерной графики начали появляться виртуальные ведущие, например, «Ананова» (Ananova) — анимированный персонаж, запущенный в 2000 году британской компанией Press Association. Ананова представляла собой 3D-модель женщины, которая читала новости, но её анимация была ограниченной, а синтез речи — неестественным.

Современный этап (2010-е — 2020-е)

Прорыв в области глубокого обучения (deep learning) привёл к созданию систем, способных генерировать реалистичную речь и изображение. В 2018 году китайское государственное информационное агентство «Синьхуа» (Xinhua) совместно с компанией Sogou представило первого в мире новостного диктора на ИИ, основанного на технологии deepfake. Диктор был создан на основе реального ведущего Чжана Чжао (Zhang Zhao) и мог читать тексты, синхронизируя движения губ. В 2020 году российский телеканал «Россия-24» (входит в ВГТРК) начал использовать виртуального ведущего по имени «Снежана» — анимированного персонажа, который читал прогноз погоды и новости. В 2023 году технология стала массовой: ряд российских региональных телеканалов (например, «Вести-Томск», «Вести-Кузбасс») внедрили дикторов на ИИ для выпусков новостей, а также появились сервисы, позволяющие создавать таких дикторов самостоятельно.

Технологическая основа

Синтез речи

Основой новостного диктора на ИИ является система синтеза речи по тексту. Современные TTS-модели (например, Tacotron, WaveNet, FastSpeech, а также российские разработки, такие как «Яндекс.Голос» или Silero) используют нейронные сети для генерации человеческой речи с заданными интонациями, тембром и темпом. Для новостных дикторов часто применяется так называемый «нейронный дипфейк» голоса — копирование голоса конкретного человека или создание уникального синтезированного голоса.

Генерация изображения

Для визуального представления диктора используются две основные технологии:

  • Анимированный аватар — 3D-модель персонажа, созданная с помощью технологий компьютерной графики (CGI). Анимация лица и тела управляется алгоритмами, которые синхронизируют движения губ с синтезированной речью.
  • Deepfake-видео — технология, при которой на основе видео реального человека (диктора) создаётся модель, способная генерировать новые видеоролики с его лицом, но с произвольным текстом. Для этого используются генеративно-состязательные сети (GAN) и автоэнкодеры.

Обработка текста

Перед синтезом текст новости обрабатывается системами NLP (Natural Language Processing). Они выполняют:

  • разбивку на предложения и абзацы;
  • расстановку пауз и ударений;
  • анализ эмоциональной окраски (для выбора тона голоса);
  • адаптацию под стиль новостного вещания (чёткое произношение, отсутствие разговорных элементов).

Классификация

По способу визуализации

  • Аудиодикторы — только голос, без визуального образа. Используются в радиоэфире или подкастах.
  • Анимированные аватары — стилизованные 3D-персонажи (например, мультяшные или реалистичные). Часто применяются в интернет-новостях и молодёжных каналах.
  • Фотореалистичные дикторы — модели, созданные на основе deepfake или CGI, максимально похожие на реального человека. Используются в телевизионных новостях.

По степени автономности

  • Полностью автоматические — система самостоятельно генерирует текст (на основе данных из ленты новостей), синтезирует речь и создаёт видео. Пример — дикторы агентства «Синьхуа».
  • Полуавтоматические — текст пишется редактором, а ИИ только озвучивает и визуализирует. Такой подход распространён в российских региональных телеканалах.

Применение

Телевидение и радио

В России новостные дикторы на ИИ используются в основном на региональных телеканалах, где не хватает бюджета на содержание штата ведущих. Например, в 2023 году телеканал «Вести-Томск» запустил виртуального ведущего для выпуска новостей, а «Вести-Кузбасс» — для прогноза погоды. В Китае агентство «Синьхуа» использует ИИ-дикторов для круглосуточного вещания новостей на нескольких языках. В Индии телеканал India Today в 2023 году представил диктора на ИИ для выпусков на хинди.

Интернет-СМИ и подкасты

Многие новостные сайты и блоги используют синтезированные голоса для озвучивания статей. Например, сервис «Яндекс.Браузер» позволяет озвучивать любые тексты голосом Алисы. В подкастах ИИ-дикторы применяются для чтения новостных дайджестов.

Чрезвычайные ситуации

В условиях, когда реальный ведущий не может выйти в эфир (например, из-за болезни или в зоне боевых действий), ИИ-диктор может обеспечить непрерывность вещания. В 2020 году, во время пандемии COVID-19, некоторые китайские телеканалы использовали ИИ-дикторов для замены заболевших сотрудников.

Преимущества и недостатки

Преимущества

  • Экономия ресурсов — не требуется оплата труда ведущего, гримёров, операторов.
  • Круглосуточная работа — ИИ-диктор может работать 24/7 без перерывов.
  • Многоязычность — одна система может генерировать новости на десятках языков без найма переводчиков.
  • Скорость — текст новости может быть озвучен и визуализирован за секунды после поступления в ленту.

Недостатки

  • Отсутствие эмоций — даже современные системы не могут полностью передать человеческие интонации, паузы и эмоциональную окраску, что делает новости «сухими».
  • Технические ограничения — возможны ошибки в синхронизации губ, неестественные движения глаз, мимики.
  • Этические проблемы — использование deepfake может вводить зрителей в заблуждение, создавая иллюзию присутствия реального человека. В некоторых странах (например, в Китае) требуется маркировка контента, созданного ИИ.
  • Риск дезинформации — ИИ-диктор может быть использован для распространения фейковых новостей, если система взломана или текст подаётся без проверки.

Критика и регулирование

Этика и доверие

Использование ИИ-дикторов вызывает опасения у журналистов и зрителей. В 2023 году Союз журналистов России высказывал обеспокоенность тем, что замена реальных ведущих на ИИ может снизить доверие к новостям, так как зритель не видит живого человека, который несёт ответственность за сказанное. В ряде стран (например, в странах Евросоюза) обсуждается введение обязательной маркировки контента, созданного с помощью ИИ.

Юридические аспекты

В России законодательство об ИИ находится в стадии формирования. На 2024 год не существует специальных норм, регулирующих использование новостных дикторов на ИИ. Однако общие законы о СМИ (Закон РФ «О средствах массовой информации») требуют, чтобы редакция несла ответственность за достоверность информации, независимо от способа её подачи. В случае использования deepfake-диктора, созданного на основе реального человека, необходимо согласие этого человека на использование его образа (статья 152.1 Гражданского кодекса РФ).

Примеры реализаций

Китай

  • Xinhua AI Anchor (2018) — первый в мире новостной диктор на ИИ, созданный на основе deepfake. Работает на нескольких языках, включая английский, арабский, русский.
  • CCTV AI Anchor (2021) — диктор Центрального телевидения Китая, использовавшийся для выпусков новостей во время зимних Олимпийских игр в Пекине.

Россия

  • «Снежана» (Россия-24, 2020) — анимированный аватар для прогноза погоды.
  • «Вести-Томск» (2023) — виртуальный ведущий, созданный на основе технологии deepfake с использованием голоса реального диктора.
  • «Вести-Кузбасс» (2023) — ИИ-диктор для выпуска новостей, разработанный совместно с компанией «Цифровые технологии».

Другие страны

  • India Today AI Anchor (2023) — диктор на хинди, созданный с помощью технологий синтеза речи и анимации.
  • Fox News AI Anchor (2023) — экспериментальный диктор для выпуска коротких новостей в социальных сетях.

Перспективы развития

Ожидается, что к 2030 году новостные дикторы на ИИ станут обычным явлением в региональных и нишевых СМИ. Развитие технологий генерации эмоций и реалистичной анимации позволит создать дикторов, неотличимых от реальных людей. В то же время, вероятно усиление регулирования: введение обязательной маркировки, ограничений на использование deepfake без согласия, а также стандартов качества для предотвращения дезинформации.

Источники

  • «Синьхуа запускает первого в мире новостного диктора на ИИ» — официальный сайт агентства Синьхуа, 2018.
  • «Вести-Томск: виртуальный ведущий в эфире» — сайт ГТРК «Томск», 2023.
  • «Искусственный интеллект в журналистике: вызовы и перспективы» — доклад Союза журналистов России, 2023.
  • «Технологии синтеза речи: от Tacotron до WaveNet» — статья в журнале «Компьютерные науки», 2022.
  • «Правовое регулирование deepfake в России» — обзор на сайте «Право.ру», 2023.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru