Открыть сервис

Similar: понятие, применение и принцип работы

Similar (от англ. similar — «похожий», «подобный») — многозначный термин, используемый в математике, информатике, лингвистике и дизайне для обозначения свойства или процесса установления сходства между объектами, явлениями или данными. В широком смысле понятие описывает отношение эквивалентности, при котором объекты обладают общими признаками, но не являются идентичными. В зависимости от контекста термин может обозначать алгоритм поиска, функцию сравнения, критерий классификации или характеристику геометрических фигур.

История и происхождение термина

Слово восходит к латинскому similis («подобный»), которое через старофранцузский язык перешло в английский в XIV веке. Изначально термин использовался в философии и риторике для описания аналогий. С развитием точных наук понятие получило строгие формальные определения. В математике подобие фигур изучалось ещё в «Началах» Евклида (около 300 года до н. э.), где были сформулированы признаки подобия треугольников. В XX веке с появлением вычислительной техники термин приобрёл новое значение — как мера близости данных в информационных системах.

Подобие в математике

В геометрии подобие определяется как преобразование плоскости или пространства, при котором сохраняются углы и пропорции расстояний. Две фигуры называются подобными, если одну можно получить из другой путём гомотетии (равномерного масштабирования) с возможным поворотом, переносом или отражением. Коэффициент подобия — число, показывающее, во сколько раз изменяются линейные размеры. Признаки подобия треугольников (по двум углам, по двум пропорциональным сторонам и углу между ними, по трём пропорциональным сторонам) являются базовым материалом школьного курса геометрии.

В аналитической геометрии и топологии понятие обобщается до отношения подобия — бинарного отношения, обладающего свойствами рефлексивности, симметричности и транзитивности. Такое отношение разбивает множество объектов на классы эквивалентности, внутри которых объекты считаются подобными по заданному критерию.

Similar в информатике и анализе данных

В программировании термин используется для обозначения функций и алгоритмов сравнения строк, чисел, изображений и других типов данных. Ключевая задача — количественно оценить степень сходства, выразив её числом (обычно от 0 до 1, где 1 — полное совпадение).

Метрики сходства строк

Наиболее распространённые алгоритмы:

  • Расстояние Левенштейна — минимальное количество операций вставки, удаления и замены символов, необходимых для превращения одной строки в другую.
  • Расстояние Хэмминга — число позиций, в которых символы двух строк равной длины различаются.
  • Коэффициент Жаккара — отношение размера пересечения множеств (например, наборов символов или n-грамм) к размеру их объединения.
  • Косинусная мера — косинус угла между векторами признаков, часто применяется для текстов после векторизации (например, методом TF-IDF).

Поиск similar-изображений

В компьютерном зрении задача поиска похожих изображений решается через извлечение дескрипторов — компактных числовых векторов, описывающих цвет, текстуру, форму или глубокие признаки нейросети. Популярные методы включают ORB, SIFT, а также эмбеддинги свёрточных нейронных сетей. Для сравнения векторов используются метрики евклидова расстояния или косинусной близости. Такие технологии лежат в основе обратного поиска по картинке в поисковых системах и системах распознавания лиц.

Рекомендательные системы

Принцип «похожие пользователи или товары» (collaborative filtering) используется в онлайн-магазинах и стриминговых сервисах. Алгоритмы вычисляют сходство профилей пользователей или характеристик объектов и на основе этого предлагают новые позиции. Методы включают k-ближайших соседей (k-NN), матричную факторизацию и нейросетевые модели.

Similar в лингвистике и обработке естественного языка

В NLP термин применяется для описания семантической близости слов, предложений или документов. Различают:

  • Лексическое сходство — основано на совпадении словоформ или корней (например, «бег» и «бегать»).
  • Семантическое сходство — учитывает смысл, например, через векторные представления слов (word2vec, GloVe) или тезаурусы (WordNet).
  • Синтаксическое сходство — сравнивает структуру предложений (деревья зависимостей).

Для оценки сходства текстов используются метрики BLEU, ROUGE и более современные модели на основе трансформеров, вычисляющие косинусную близость эмбеддингов предложений (например, SBERT).

Similar в веб-поиске и базах данных

В реляционных базах данных оператор LIKE в SQL выполняет поиск по шаблону, а для нечёткого поиска применяются функции вроде SIMILAR TO (стандарт PostgreSQL) или полнотекстовый поиск с ранжированием по релевантности. Поисковые системы, такие как Google или Яндекс, используют алгоритмы, определяющие «похожие страницы» на основе анализа ссылочной структуры, совпадения ключевых слов и поведенческих факторов. Функция «Похожие товары» в интернет-магазинах также реализуется через запросы к векторным базам данных (например, FAISS или Milvus), оптимизированным для поиска ближайших соседей.

Similar в дизайне и психологии восприятия

В гештальтпсихологии принцип подобия — один из базовых законов группировки визуальных элементов. Объекты, схожие по цвету, форме, размеру или ориентации, воспринимаются человеком как единая группа. Этот принцип активно используется в UI/UX-дизайне для организации интерфейсов, создания иерархии и облегчения навигации. Например, одинаковые кнопки или одинаковый цвет ссылок сигнализируют об их функциональной общности.

Критика и ограничения

Основная проблема при использовании метрик сходства — выбор адекватного порога и меры. Разные метрики могут давать противоречивые результаты для одних и тех же данных. Например, расстояние Левенштейна чувствительно к длине строк, а коэффициент Жаккара игнорирует порядок символов. В машинном обучении существует риск переобучения под конкретную метрику, что снижает обобщающую способность моделей. Кроме того, понятие «похожести» субъективно и зависит от контекста: для человека два изображения могут быть похожи по смыслу, а для алгоритма — по цветовой гамме, и наоборот.

Источники

  • Атанасян Л. С., Бутузов В. Ф. и др. «Геометрия. 7–9 классы» — разделы о подобии фигур.
  • Рассел С., Норвиг П. «Искусственный интеллект: современный подход» — главы о поиске и метриках.
  • Маннинг К., Рагхаван П., Шютце Х. «Введение в информационный поиск» — описание метрик сходства и ранжирования.
  • Документация PostgreSQL: оператор SIMILAR TO.
  • Кёлер К. «Гештальтпсихология» — принципы группировки, включая подобие.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →