Similar: понятие, применение и принцип работы¶
Similar (от англ. similar — «похожий», «подобный») — многозначный термин, используемый в математике, информатике, лингвистике и дизайне для обозначения свойства или процесса установления сходства между объектами, явлениями или данными. В широком смысле понятие описывает отношение эквивалентности, при котором объекты обладают общими признаками, но не являются идентичными. В зависимости от контекста термин может обозначать алгоритм поиска, функцию сравнения, критерий классификации или характеристику геометрических фигур.
¶История и происхождение термина
Слово восходит к латинскому similis («подобный»), которое через старофранцузский язык перешло в английский в XIV веке. Изначально термин использовался в философии и риторике для описания аналогий. С развитием точных наук понятие получило строгие формальные определения. В математике подобие фигур изучалось ещё в «Началах» Евклида (около 300 года до н. э.), где были сформулированы признаки подобия треугольников. В XX веке с появлением вычислительной техники термин приобрёл новое значение — как мера близости данных в информационных системах.
¶Подобие в математике
В геометрии подобие определяется как преобразование плоскости или пространства, при котором сохраняются углы и пропорции расстояний. Две фигуры называются подобными, если одну можно получить из другой путём гомотетии (равномерного масштабирования) с возможным поворотом, переносом или отражением. Коэффициент подобия — число, показывающее, во сколько раз изменяются линейные размеры. Признаки подобия треугольников (по двум углам, по двум пропорциональным сторонам и углу между ними, по трём пропорциональным сторонам) являются базовым материалом школьного курса геометрии.
В аналитической геометрии и топологии понятие обобщается до отношения подобия — бинарного отношения, обладающего свойствами рефлексивности, симметричности и транзитивности. Такое отношение разбивает множество объектов на классы эквивалентности, внутри которых объекты считаются подобными по заданному критерию.
¶Similar в информатике и анализе данных
В программировании термин используется для обозначения функций и алгоритмов сравнения строк, чисел, изображений и других типов данных. Ключевая задача — количественно оценить степень сходства, выразив её числом (обычно от 0 до 1, где 1 — полное совпадение).
¶Метрики сходства строк
Наиболее распространённые алгоритмы:
- Расстояние Левенштейна — минимальное количество операций вставки, удаления и замены символов, необходимых для превращения одной строки в другую.
- Расстояние Хэмминга — число позиций, в которых символы двух строк равной длины различаются.
- Коэффициент Жаккара — отношение размера пересечения множеств (например, наборов символов или n-грамм) к размеру их объединения.
- Косинусная мера — косинус угла между векторами признаков, часто применяется для текстов после векторизации (например, методом TF-IDF).
¶Поиск similar-изображений
В компьютерном зрении задача поиска похожих изображений решается через извлечение дескрипторов — компактных числовых векторов, описывающих цвет, текстуру, форму или глубокие признаки нейросети. Популярные методы включают ORB, SIFT, а также эмбеддинги свёрточных нейронных сетей. Для сравнения векторов используются метрики евклидова расстояния или косинусной близости. Такие технологии лежат в основе обратного поиска по картинке в поисковых системах и системах распознавания лиц.
¶Рекомендательные системы
Принцип «похожие пользователи или товары» (collaborative filtering) используется в онлайн-магазинах и стриминговых сервисах. Алгоритмы вычисляют сходство профилей пользователей или характеристик объектов и на основе этого предлагают новые позиции. Методы включают k-ближайших соседей (k-NN), матричную факторизацию и нейросетевые модели.
¶Similar в лингвистике и обработке естественного языка
В NLP термин применяется для описания семантической близости слов, предложений или документов. Различают:
- Лексическое сходство — основано на совпадении словоформ или корней (например, «бег» и «бегать»).
- Семантическое сходство — учитывает смысл, например, через векторные представления слов (word2vec, GloVe) или тезаурусы (WordNet).
- Синтаксическое сходство — сравнивает структуру предложений (деревья зависимостей).
Для оценки сходства текстов используются метрики BLEU, ROUGE и более современные модели на основе трансформеров, вычисляющие косинусную близость эмбеддингов предложений (например, SBERT).
¶Similar в веб-поиске и базах данных
В реляционных базах данных оператор LIKE в SQL выполняет поиск по шаблону, а для нечёткого поиска применяются функции вроде SIMILAR TO (стандарт PostgreSQL) или полнотекстовый поиск с ранжированием по релевантности. Поисковые системы, такие как Google или Яндекс, используют алгоритмы, определяющие «похожие страницы» на основе анализа ссылочной структуры, совпадения ключевых слов и поведенческих факторов. Функция «Похожие товары» в интернет-магазинах также реализуется через запросы к векторным базам данных (например, FAISS или Milvus), оптимизированным для поиска ближайших соседей.
¶Similar в дизайне и психологии восприятия
В гештальтпсихологии принцип подобия — один из базовых законов группировки визуальных элементов. Объекты, схожие по цвету, форме, размеру или ориентации, воспринимаются человеком как единая группа. Этот принцип активно используется в UI/UX-дизайне для организации интерфейсов, создания иерархии и облегчения навигации. Например, одинаковые кнопки или одинаковый цвет ссылок сигнализируют об их функциональной общности.
¶Критика и ограничения
Основная проблема при использовании метрик сходства — выбор адекватного порога и меры. Разные метрики могут давать противоречивые результаты для одних и тех же данных. Например, расстояние Левенштейна чувствительно к длине строк, а коэффициент Жаккара игнорирует порядок символов. В машинном обучении существует риск переобучения под конкретную метрику, что снижает обобщающую способность моделей. Кроме того, понятие «похожести» субъективно и зависит от контекста: для человека два изображения могут быть похожи по смыслу, а для алгоритма — по цветовой гамме, и наоборот.
¶Источники
- Атанасян Л. С., Бутузов В. Ф. и др. «Геометрия. 7–9 классы» — разделы о подобии фигур.
- Рассел С., Норвиг П. «Искусственный интеллект: современный подход» — главы о поиске и метриках.
- Маннинг К., Рагхаван П., Шютце Х. «Введение в информационный поиск» — описание метрик сходства и ранжирования.
- Документация PostgreSQL: оператор
SIMILAR TO. - Кёлер К. «Гештальтпсихология» — принципы группировки, включая подобие.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →
