Открыть сервис

FusionBrain: нейросеть для генерации изображений

FusionBrain — российская нейросетевая платформа для генерации и обработки изображений, разработанная компанией «Сбер» и доступная в открытом доступе с 2023 года. Сервис позволяет создавать изображения по текстовому описанию (prompt), а также выполнять ряд задач по редактированию фотографий. Платформа функционирует на базе семейства генеративных моделей Kandinsky, созданных в исследовательском центре Sber AI.

История и разработка

Разработка моделей семейства Kandinsky велась с 2021 года совместными усилиями Sber AI и компании «Сбер Девки» (впоследствии — SberDevices). В основе первой версии, Kandinsky 1.0, лежала архитектура, объединяющая латентную диффузионную модель и текстовый энкодер CLIP. В апреле 2023 года был представлен Kandinsky 2.1, который лёг в основу публичного сервиса FusionBrain. Запуск платформы состоялся в том же году в рамках стратегии «Сбера» по развитию открытых генеративных технологий.

Ключевым отличием FusionBrain от зарубежных аналогов (таких как Midjourney или DALL-E) стала ориентация на русскоязычную аудиторию: модели обучались на больших массивах текстов на русском языке, что обеспечивает более точное понимание запросов без необходимости перевода. К 2024 году на платформе было зарегистрировано более 5 миллионов пользователей, а суммарное количество сгенерированных изображений превысило 100 миллионов.

Технические характеристики

Архитектура моделей

FusionBrain использует несколько версий генеративной модели Kandinsky. Третья версия (Kandinsky 3.0), представленная в конце 2023 года, основана на диффузионной модели с архитектурой U-Net и текстовым энкодером, способным обрабатывать запросы длиной до 1000 токенов. Модель поддерживает генерацию изображений с разрешением до 1024×1024 пикселей.

Функциональные возможности

Платформа предоставляет пользователям следующие инструменты:

  • Генерация по текстовому описанию — создание изображения с нуля на основе запроса на русском или английском языке.
  • Редактирование изображений — изменение отдельных фрагментов фотографии по текстовой инструкции (inpainting).
  • Дорисовка и расширение — увеличение изображения за пределы исходных границ (outpainting).
  • Смешивание изображенийобъединение двух изображений в одно с сохранением ключевых элементов.
  • Улучшение качества — повышение разрешения и детализации загруженных изображений (upscaling).
  • Стилизация — применение художественных стилей к фотографиям.

Интерфейс и доступ

FusionBrain доступен через веб-интерфейс на сайте fusionbrain.ai, а также через API для интеграции в сторонние приложения. Для разработчиков предоставляется документация и примеры кода на Python. Пользовательский интерфейс включает поле для ввода текстового запроса, выбор соотношения сторон, количества вариантов и параметров стилизации. Генерация одного изображения занимает в среднем от 5 до 15 секунд в зависимости от нагрузки на серверы.

Ограничения и модерация

Как и большинство современных генеративных сервисов, FusionBrain использует систему фильтрации запросов. Модерация осуществляется на двух уровнях: автоматическая проверка текстового запроса на запрещённую тематику (насилие, порнография, пропаганда наркотиков) и постмодерация сгенерированных изображений. В соответствии с законодательством Российской Федерации, платформа блокирует запросы, нарушающие требования федеральных законов.

Сервис также ограничивает генерацию изображений реальных публичных личностей без явного согласия, а также изображений, нарушающих авторские права. В правилах платформы указано, что пользователь несёт ответственность за контент, созданный с использованием сервиса.

Применение

FusionBrain нашёл применение в различных сферах:

  • Дизайн и реклама — создание концептов, макетов, иллюстраций для коммерческих проектов.
  • Образование — визуализация учебных материалов, создание наглядных пособий.
  • Развлекательный контент — иллюстрации для книг, комиксов, игр.
  • Научная визуализация — создание схематических изображений для презентаций и публикаций.

В 2023 году «Сбер» интегрировал технологии FusionBrain в свою экосистему, включая виртуального ассистента Салют и ряд корпоративных сервисов для создания маркетинговых материалов.

Критика и ограничения

Несмотря на популярность, сервис подвергается критике по нескольким направлениям. Пользователи отмечают, что качество генерации сложных сцен с множеством объектов и корректное отображение текста на изображениях уступает зарубежным аналогам. Художественное сообщество высказывает обеспокоенность вопросами авторских прав на изображения, созданные нейросетью, и потенциальным сокращением спроса на услуги иллюстраторов.

Технические ограничения включают невозможность генерации видео и отсутствие функции точного контроля композиции (например, указания точного расположения объектов). Также сервис не поддерживает генерацию изображений в сверхвысоком разрешении (более 1024×1024) без последующего увеличения.

Развитие и перспективы

В 2024 году «Сбер» анонсировал работу над четвёртой версией модели Kandinsky, которая должна улучшить понимание сложных запросов и повысить реалистичность изображений. Планируется расширение функциональности FusionBrain за счёт добавления инструментов для генерации 3D-моделей и анимации. Также ведётся работа по оптимизации моделей для запуска на персональных компьютерах пользователей без необходимости обращения к облачным серверам.

Источники

  1. Официальный сайт и документация платформы FusionBrain (fusionbrain.ai).
  2. Публикации исследовательского центра Sber AI о моделях семейства Kandinsky.
  3. Материалы конференции AI Journey 2023, Москва.
  4. Публичные отчёты «Сбера» о развитии генеративных технологий за 2023–2024 годы.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →