Открыть сервис

Look-alike модели

Look-alike модели — это класс алгоритмов машинного обучения, предназначенных для поиска и сегментации аудитории, наиболее похожей на заданную эталонную группу пользователей (так называемое «ядро» или «seed-аудитория»). Основная цель таких моделей — автоматическое расширение выборки за счёт пользователей, которые по поведенческим, демографическим и иным признакам максимально близки к исходной группе, но при этом не входят в неё. Look-alike модели широко применяются в цифровом маркетинге, рекламе и рекомендательных системах для повышения эффективности таргетинга и привлечения новых клиентов.

История и развитие

Концепция look-alike моделирования возникла в середине 2000-х годов с развитием интернет-рекламы и появлением крупных рекламных платформ, таких как Google AdWords и Facebook (продукт Meta, признанной экстремистской и запрещённой в РФ) Ads (организация Meta признана экстремистской и запрещена в РФ). Первоначально для поиска похожих пользователей использовались простые методы, основанные на ручном задании правил (например, «пользователи, которые совершили покупку в том же магазине, что и ядро»). Однако с ростом объёмов данных и усложнением поведенческих паттернов возникла потребность в автоматизированных алгоритмах.

Ключевым этапом стало внедрение методов машинного обучения, в частности логистической регрессии, случайного леса и градиентного бустинга. В 2010-х годах, с появлением глубокого обучения, look-alike модели начали использовать нейронные сети, что позволило учитывать нелинейные зависимости и высокоразмерные признаки (например, последовательности кликов, историю просмотров, тексты запросов). В России активное развитие look-alike технологий приходится на 2015–2020 годы, когда крупные рекламные сети (Яндекс.Директ, myTarget) и платформы управления данными (DMP) начали предлагать сервисы автоматического поиска похожей аудитории.

Принцип работы

Look-alike модели решают задачу бинарной классификации: для каждого пользователя из общего пула (например, всех посетителей сайта или всех зарегистрированных пользователей платформы) модель оценивает вероятность того, что он принадлежит к эталонной группе. Пользователи с наибольшей вероятностью (выше заданного порога) включаются в итоговую look-alike аудиторию.

Основные этапы построения модели

  1. Формирование эталонной выборки (seed-аудитории). Заказчик (рекламодатель) предоставляет набор пользователей, которые уже совершили целевое действие (покупку, подписку, регистрацию) или являются наиболее ценными клиентами. Размер seed-аудитории обычно варьируется от нескольких сотен до десятков тысяч человек.
  2. Сбор и агрегация признаков. Для каждого пользователя из общего пула собираются данные: демографические (возраст, пол, геолокация), поведенческие (частота посещений, время на сайте, категории просмотренных товаров), транзакционные (сумма покупок, средний чек), контекстные (источник трафика, устройство). Признаки могут быть как числовыми, так и категориальными (например, интересы, теги).
  3. Обучение модели. На основе seed-аудитории и случайной выборки «нецелевых» пользователей строится классификатор. Модель обучается различать эталонных пользователей и всех остальных, выявляя ключевые закономерности.
  4. Применение модели. Обученная модель обрабатывает весь пул пользователей, присваивая каждому оценку (score) — вероятность принадлежности к seed-аудитории. Пользователи ранжируются по убыванию оценки, и отбирается заданное количество (например, 1% или 10% от общего пула) с наивысшими значениями.
  5. Валидация и оптимизация. Результаты проверяются на контрольных данных (например, A/B-тестирование рекламных кампаний). При необходимости корректируются порог отбора, набор признаков или архитектура модели.

Типы моделей

Look-alike модели можно классифицировать по используемым алгоритмам и подходам:

По алгоритму

  • Логистическая регрессия — простой и интерпретируемый метод, хорошо работающий при линейной разделимости данных. Часто используется как базовый эталон.
  • Деревья решений и ансамбли (случайный лес, градиентный бустинг) — учитывают нелинейные взаимодействия признаков, устойчивы к выбросам. Популярны в коммерческих системах (например, CatBoost, XGBoost).
  • Нейронные сети — позволяют обрабатывать разреженные и высокоразмерные данные (например, последовательности действий пользователя). Используются в сложных сценариях, где требуется высокая точность.
  • Методы на основе графов — учитывают социальные связи (например, «друзья» в соцсетях) или совместные покупки. Пользователи считаются похожими, если они связаны с одними и теми же объектами (товарами, страницами).

По типу входных данных

  • Поведенческие модели — используют только историю действий пользователя (клики, просмотры, покупки). Наиболее распространены в рекламе.
  • Демографические модели — опираются на возраст, пол, доход, регион. Часто комбинируются с поведенческими.
  • Контентные модели — анализируют тексты запросов, описания товаров или интересы, извлечённые из профилей.
  • Гибридные модели — объединяют все доступные типы данных.

Применение

Look-alike модели находят применение в различных областях, где требуется персонализация и расширение аудитории:

Цифровая реклама

Наиболее массовое применение. Рекламодатели используют look-alike модели для поиска новых потенциальных клиентов, похожих на тех, кто уже совершил конверсию. Например, интернет-магазин может загрузить список покупателей дорогих товаров и получить аудиторию, с высокой вероятностью заинтересованную в премиум-сегменте. Платформы (Яндекс.Директ, myTarget, VK Реклама) предоставляют встроенные инструменты look-alike, где рекламодатель задаёт seed-аудиторию и желаемый объём.

Рекомендательные системы

В сервисах потокового видео (например, Кинопоиск, Okko) look-alike модели помогают рекомендовать контент пользователям, которые не смотрели определённый жанр, но по поведению похожи на его поклонников. В музыкальных сервисах (Яндекс.Музыка) — подбирать треки и плейлисты.

Банкинг и финтех

Банки используют look-alike модели для поиска клиентов, похожих на держателей премиальных карт или заёмщиков с хорошей кредитной историей. Это позволяет предлагать целевые продукты (кредиты, депозиты) без массового спама.

E-commerce

Маркетплейсы (Ozon, Wildberries) применяют look-alike для показа товаров, которые покупали похожие пользователи, или для поиска аудитории под новые коллекции.

Политический маркетинг и социальные проекты

Хотя это менее распространено, look-alike модели могут использоваться для таргетинга агитационных материалов или социальной рекламы (например, привлечение доноров крови, похожих на активных участников).

Преимущества и ограничения

Преимущества

  • Автоматизация — модель сама находит закономерности, не требуя ручного задания правил.
  • Масштабируемость — можно обрабатывать миллионы пользователей за секунды.
  • Адаптивность — при изменении поведения аудитории модель можно переобучить.
  • Эффективность — как правило, look-alike аудитории показывают более высокую конверсию по сравнению с произвольной выборкой.

Ограничения

  • Зависимость от качества seed-аудитории — если эталонная группа мала или нерепрезентативна, модель будет выдавать шум.
  • Проблема «холодного старта» — для новых продуктов или категорий без истории покупок look-alike модели неэффективны.
  • Риск переобучения — при избыточном количестве признаков модель может запомнить шум, а не общие паттерны.
  • Этические и правовые вопросы — использование персональных данных без согласия пользователей может нарушать законодательство (например, 152-ФЗ «О персональных данных» в РФ). Кроме того, модели могут усиливать дискриминацию, если seed-аудитория содержит смещение (например, по полу или возрасту).

Критика и этические аспекты

Применение look-alike моделей вызывает дискуссии в области конфиденциальности и справедливости. Критики отмечают, что такие модели могут использоваться для манипуляции поведением пользователей (например, навязывание дорогих товаров уязвимым группам). Также существует риск, что модель будет воспроизводить и усиливать существующие предубеждения (например, если seed-аудитория состоит преимущественно из мужчин, то look-alike аудитория также будет преимущественно мужской, что может привести к гендерной дискриминации в рекламе).

В России с 2021 года усилилось регулирование таргетированной рекламы: рекламодатели обязаны получать согласие пользователей на обработку данных (Федеральный закон от 30.12.2020 № 519-ФЗ). При использовании look-alike моделей необходимо обеспечивать анонимизацию данных и возможность отзыва согласия.

Примеры реализации

  • Яндекс.Аудитории — сервис, позволяющий загрузить список клиентов (например, по email или телефону) и получить look-alike аудиторию для показа рекламы в Яндексе. Поддерживает настройку порога схожести и объёма.
  • myTarget Look-alike — инструмент от VK (организация признана экстремистской и запрещена в РФ), который использует данные социальной сети и поведенческие сигналы для поиска похожих пользователей.
  • Google Similar Audiences — в рекламной сети Google (Google Ads) позволяет расширять списки ремаркетинга на основе look-alike моделирования.
  • Открытые библиотеки — для самостоятельной реализации моделей используются библиотеки Python (scikit-learn, XGBoost, PyTorch) и специализированные решения (например, Look-alike Model от компании «Data Insight»).

Перспективы развития

С развитием технологий обработки естественного языка (NLP) и компьютерного зрения look-alike модели начинают учитывать не только структурированные данные, но и неструктурированные (тексты отзывов, изображения товаров). Внедрение методов федеративного обучения (federated learning) позволяет обучать модели без передачи персональных данных на сервер, что снижает риски утечек. Также ожидается рост использования look-alike моделей в офлайн-ритейле (например, на основе данных о покупках по картам лояльности) и в сфере телемедицины (поиск пациентов, похожих на успешно пролеченных).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →