FusionBrain: нейросеть для генерации изображений¶
FusionBrain — российская нейросетевая платформа для генерации и обработки изображений, разработанная компанией «Сбер» и доступная в открытом доступе с 2023 года. Сервис позволяет создавать изображения по текстовому описанию (prompt), а также выполнять ряд задач по редактированию фотографий. Платформа функционирует на базе семейства генеративных моделей Kandinsky, созданных в исследовательском центре Sber AI.
¶История и разработка
Разработка моделей семейства Kandinsky велась с 2021 года совместными усилиями Sber AI и компании «Сбер Девки» (впоследствии — SberDevices). В основе первой версии, Kandinsky 1.0, лежала архитектура, объединяющая латентную диффузионную модель и текстовый энкодер CLIP. В апреле 2023 года был представлен Kandinsky 2.1, который лёг в основу публичного сервиса FusionBrain. Запуск платформы состоялся в том же году в рамках стратегии «Сбера» по развитию открытых генеративных технологий.
Ключевым отличием FusionBrain от зарубежных аналогов (таких как Midjourney или DALL-E) стала ориентация на русскоязычную аудиторию: модели обучались на больших массивах текстов на русском языке, что обеспечивает более точное понимание запросов без необходимости перевода. К 2024 году на платформе было зарегистрировано более 5 миллионов пользователей, а суммарное количество сгенерированных изображений превысило 100 миллионов.
¶Технические характеристики
¶Архитектура моделей
FusionBrain использует несколько версий генеративной модели Kandinsky. Третья версия (Kandinsky 3.0), представленная в конце 2023 года, основана на диффузионной модели с архитектурой U-Net и текстовым энкодером, способным обрабатывать запросы длиной до 1000 токенов. Модель поддерживает генерацию изображений с разрешением до 1024×1024 пикселей.
¶Функциональные возможности
Платформа предоставляет пользователям следующие инструменты:
- Генерация по текстовому описанию — создание изображения с нуля на основе запроса на русском или английском языке.
- Редактирование изображений — изменение отдельных фрагментов фотографии по текстовой инструкции (inpainting).
- Дорисовка и расширение — увеличение изображения за пределы исходных границ (outpainting).
- Смешивание изображений — объединение двух изображений в одно с сохранением ключевых элементов.
- Улучшение качества — повышение разрешения и детализации загруженных изображений (upscaling).
- Стилизация — применение художественных стилей к фотографиям.
¶Интерфейс и доступ
FusionBrain доступен через веб-интерфейс на сайте fusionbrain.ai, а также через API для интеграции в сторонние приложения. Для разработчиков предоставляется документация и примеры кода на Python. Пользовательский интерфейс включает поле для ввода текстового запроса, выбор соотношения сторон, количества вариантов и параметров стилизации. Генерация одного изображения занимает в среднем от 5 до 15 секунд в зависимости от нагрузки на серверы.
¶Ограничения и модерация
Как и большинство современных генеративных сервисов, FusionBrain использует систему фильтрации запросов. Модерация осуществляется на двух уровнях: автоматическая проверка текстового запроса на запрещённую тематику (насилие, порнография, пропаганда наркотиков) и постмодерация сгенерированных изображений. В соответствии с законодательством Российской Федерации, платформа блокирует запросы, нарушающие требования федеральных законов.
Сервис также ограничивает генерацию изображений реальных публичных личностей без явного согласия, а также изображений, нарушающих авторские права. В правилах платформы указано, что пользователь несёт ответственность за контент, созданный с использованием сервиса.
¶Применение
FusionBrain нашёл применение в различных сферах:
- Дизайн и реклама — создание концептов, макетов, иллюстраций для коммерческих проектов.
- Образование — визуализация учебных материалов, создание наглядных пособий.
- Развлекательный контент — иллюстрации для книг, комиксов, игр.
- Научная визуализация — создание схематических изображений для презентаций и публикаций.
В 2023 году «Сбер» интегрировал технологии FusionBrain в свою экосистему, включая виртуального ассистента Салют и ряд корпоративных сервисов для создания маркетинговых материалов.
¶Критика и ограничения
Несмотря на популярность, сервис подвергается критике по нескольким направлениям. Пользователи отмечают, что качество генерации сложных сцен с множеством объектов и корректное отображение текста на изображениях уступает зарубежным аналогам. Художественное сообщество высказывает обеспокоенность вопросами авторских прав на изображения, созданные нейросетью, и потенциальным сокращением спроса на услуги иллюстраторов.
Технические ограничения включают невозможность генерации видео и отсутствие функции точного контроля композиции (например, указания точного расположения объектов). Также сервис не поддерживает генерацию изображений в сверхвысоком разрешении (более 1024×1024) без последующего увеличения.
¶Развитие и перспективы
В 2024 году «Сбер» анонсировал работу над четвёртой версией модели Kandinsky, которая должна улучшить понимание сложных запросов и повысить реалистичность изображений. Планируется расширение функциональности FusionBrain за счёт добавления инструментов для генерации 3D-моделей и анимации. Также ведётся работа по оптимизации моделей для запуска на персональных компьютерах пользователей без необходимости обращения к облачным серверам.
¶Источники
- Официальный сайт и документация платформы FusionBrain (fusionbrain.ai).
- Публикации исследовательского центра Sber AI о моделях семейства Kandinsky.
- Материалы конференции AI Journey 2023, Москва.
- Публичные отчёты «Сбера» о развитии генеративных технологий за 2023–2024 годы.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
