Look-alike модели¶
Look-alike модели — это класс алгоритмов машинного обучения, предназначенных для поиска и сегментации аудитории, наиболее похожей на заданную эталонную группу пользователей (так называемое «ядро» или «seed-аудитория»). Основная цель таких моделей — автоматическое расширение выборки за счёт пользователей, которые по поведенческим, демографическим и иным признакам максимально близки к исходной группе, но при этом не входят в неё. Look-alike модели широко применяются в цифровом маркетинге, рекламе и рекомендательных системах для повышения эффективности таргетинга и привлечения новых клиентов.
¶История и развитие
Концепция look-alike моделирования возникла в середине 2000-х годов с развитием интернет-рекламы и появлением крупных рекламных платформ, таких как Google AdWords и Facebook (продукт Meta, признанной экстремистской и запрещённой в РФ) Ads (организация Meta признана экстремистской и запрещена в РФ). Первоначально для поиска похожих пользователей использовались простые методы, основанные на ручном задании правил (например, «пользователи, которые совершили покупку в том же магазине, что и ядро»). Однако с ростом объёмов данных и усложнением поведенческих паттернов возникла потребность в автоматизированных алгоритмах.
Ключевым этапом стало внедрение методов машинного обучения, в частности логистической регрессии, случайного леса и градиентного бустинга. В 2010-х годах, с появлением глубокого обучения, look-alike модели начали использовать нейронные сети, что позволило учитывать нелинейные зависимости и высокоразмерные признаки (например, последовательности кликов, историю просмотров, тексты запросов). В России активное развитие look-alike технологий приходится на 2015–2020 годы, когда крупные рекламные сети (Яндекс.Директ, myTarget) и платформы управления данными (DMP) начали предлагать сервисы автоматического поиска похожей аудитории.
¶Принцип работы
Look-alike модели решают задачу бинарной классификации: для каждого пользователя из общего пула (например, всех посетителей сайта или всех зарегистрированных пользователей платформы) модель оценивает вероятность того, что он принадлежит к эталонной группе. Пользователи с наибольшей вероятностью (выше заданного порога) включаются в итоговую look-alike аудиторию.
¶Основные этапы построения модели
- Формирование эталонной выборки (seed-аудитории). Заказчик (рекламодатель) предоставляет набор пользователей, которые уже совершили целевое действие (покупку, подписку, регистрацию) или являются наиболее ценными клиентами. Размер seed-аудитории обычно варьируется от нескольких сотен до десятков тысяч человек.
- Сбор и агрегация признаков. Для каждого пользователя из общего пула собираются данные: демографические (возраст, пол, геолокация), поведенческие (частота посещений, время на сайте, категории просмотренных товаров), транзакционные (сумма покупок, средний чек), контекстные (источник трафика, устройство). Признаки могут быть как числовыми, так и категориальными (например, интересы, теги).
- Обучение модели. На основе seed-аудитории и случайной выборки «нецелевых» пользователей строится классификатор. Модель обучается различать эталонных пользователей и всех остальных, выявляя ключевые закономерности.
- Применение модели. Обученная модель обрабатывает весь пул пользователей, присваивая каждому оценку (score) — вероятность принадлежности к seed-аудитории. Пользователи ранжируются по убыванию оценки, и отбирается заданное количество (например, 1% или 10% от общего пула) с наивысшими значениями.
- Валидация и оптимизация. Результаты проверяются на контрольных данных (например, A/B-тестирование рекламных кампаний). При необходимости корректируются порог отбора, набор признаков или архитектура модели.
¶Типы моделей
Look-alike модели можно классифицировать по используемым алгоритмам и подходам:
¶По алгоритму
- Логистическая регрессия — простой и интерпретируемый метод, хорошо работающий при линейной разделимости данных. Часто используется как базовый эталон.
- Деревья решений и ансамбли (случайный лес, градиентный бустинг) — учитывают нелинейные взаимодействия признаков, устойчивы к выбросам. Популярны в коммерческих системах (например, CatBoost, XGBoost).
- Нейронные сети — позволяют обрабатывать разреженные и высокоразмерные данные (например, последовательности действий пользователя). Используются в сложных сценариях, где требуется высокая точность.
- Методы на основе графов — учитывают социальные связи (например, «друзья» в соцсетях) или совместные покупки. Пользователи считаются похожими, если они связаны с одними и теми же объектами (товарами, страницами).
¶По типу входных данных
- Поведенческие модели — используют только историю действий пользователя (клики, просмотры, покупки). Наиболее распространены в рекламе.
- Демографические модели — опираются на возраст, пол, доход, регион. Часто комбинируются с поведенческими.
- Контентные модели — анализируют тексты запросов, описания товаров или интересы, извлечённые из профилей.
- Гибридные модели — объединяют все доступные типы данных.
¶Применение
Look-alike модели находят применение в различных областях, где требуется персонализация и расширение аудитории:
¶Цифровая реклама
Наиболее массовое применение. Рекламодатели используют look-alike модели для поиска новых потенциальных клиентов, похожих на тех, кто уже совершил конверсию. Например, интернет-магазин может загрузить список покупателей дорогих товаров и получить аудиторию, с высокой вероятностью заинтересованную в премиум-сегменте. Платформы (Яндекс.Директ, myTarget, VK Реклама) предоставляют встроенные инструменты look-alike, где рекламодатель задаёт seed-аудиторию и желаемый объём.
¶Рекомендательные системы
В сервисах потокового видео (например, Кинопоиск, Okko) look-alike модели помогают рекомендовать контент пользователям, которые не смотрели определённый жанр, но по поведению похожи на его поклонников. В музыкальных сервисах (Яндекс.Музыка) — подбирать треки и плейлисты.
¶Банкинг и финтех
Банки используют look-alike модели для поиска клиентов, похожих на держателей премиальных карт или заёмщиков с хорошей кредитной историей. Это позволяет предлагать целевые продукты (кредиты, депозиты) без массового спама.
¶E-commerce
Маркетплейсы (Ozon, Wildberries) применяют look-alike для показа товаров, которые покупали похожие пользователи, или для поиска аудитории под новые коллекции.
¶Политический маркетинг и социальные проекты
Хотя это менее распространено, look-alike модели могут использоваться для таргетинга агитационных материалов или социальной рекламы (например, привлечение доноров крови, похожих на активных участников).
¶Преимущества и ограничения
¶Преимущества
- Автоматизация — модель сама находит закономерности, не требуя ручного задания правил.
- Масштабируемость — можно обрабатывать миллионы пользователей за секунды.
- Адаптивность — при изменении поведения аудитории модель можно переобучить.
- Эффективность — как правило, look-alike аудитории показывают более высокую конверсию по сравнению с произвольной выборкой.
¶Ограничения
- Зависимость от качества seed-аудитории — если эталонная группа мала или нерепрезентативна, модель будет выдавать шум.
- Проблема «холодного старта» — для новых продуктов или категорий без истории покупок look-alike модели неэффективны.
- Риск переобучения — при избыточном количестве признаков модель может запомнить шум, а не общие паттерны.
- Этические и правовые вопросы — использование персональных данных без согласия пользователей может нарушать законодательство (например, 152-ФЗ «О персональных данных» в РФ). Кроме того, модели могут усиливать дискриминацию, если seed-аудитория содержит смещение (например, по полу или возрасту).
¶Критика и этические аспекты
Применение look-alike моделей вызывает дискуссии в области конфиденциальности и справедливости. Критики отмечают, что такие модели могут использоваться для манипуляции поведением пользователей (например, навязывание дорогих товаров уязвимым группам). Также существует риск, что модель будет воспроизводить и усиливать существующие предубеждения (например, если seed-аудитория состоит преимущественно из мужчин, то look-alike аудитория также будет преимущественно мужской, что может привести к гендерной дискриминации в рекламе).
В России с 2021 года усилилось регулирование таргетированной рекламы: рекламодатели обязаны получать согласие пользователей на обработку данных (Федеральный закон от 30.12.2020 № 519-ФЗ). При использовании look-alike моделей необходимо обеспечивать анонимизацию данных и возможность отзыва согласия.
¶Примеры реализации
- Яндекс.Аудитории — сервис, позволяющий загрузить список клиентов (например, по email или телефону) и получить look-alike аудиторию для показа рекламы в Яндексе. Поддерживает настройку порога схожести и объёма.
- myTarget Look-alike — инструмент от VK (организация признана экстремистской и запрещена в РФ), который использует данные социальной сети и поведенческие сигналы для поиска похожих пользователей.
- Google Similar Audiences — в рекламной сети Google (Google Ads) позволяет расширять списки ремаркетинга на основе look-alike моделирования.
- Открытые библиотеки — для самостоятельной реализации моделей используются библиотеки Python (scikit-learn, XGBoost, PyTorch) и специализированные решения (например, Look-alike Model от компании «Data Insight»).
¶Перспективы развития
С развитием технологий обработки естественного языка (NLP) и компьютерного зрения look-alike модели начинают учитывать не только структурированные данные, но и неструктурированные (тексты отзывов, изображения товаров). Внедрение методов федеративного обучения (federated learning) позволяет обучать модели без передачи персональных данных на сервер, что снижает риски утечек. Также ожидается рост использования look-alike моделей в офлайн-ритейле (например, на основе данных о покупках по картам лояльности) и в сфере телемедицины (поиск пациентов, похожих на успешно пролеченных).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


