Открыть сервис

Google Объектив: визуальный поиск

Google Объектив (англ. Google Lens) — технология компьютерного зрения, разработанная корпорацией Google и позволяющая распознавать объекты, текст и сцены на изображениях с помощью камеры смартфона или загруженных фотографий. Инструмент объединяет оптическое распознавание символов (OCR), машинное обучение и визуальный поиск, предоставляя пользователю сведения об объекте съёмки, перевод надписей, поиск товаров и копирование текста.

История

Технология была представлена на конференции Google I/O в мае 2017 года под названием Google Lens. Первоначально функция работала только в приложении Google Фото и была доступна ограниченному кругу пользователей на устройствах Pixel. В 2018 году поддержку добавили в приложение Google Assistant, а затем — в стандартное приложение камеры на смартфонах Android. В 2019 году Google Lens стал доступен на устройствах iOS через приложение Google. В дальнейшем функциональность расширялась: появились режимы перевода в реальном времени, распознавания текста, поиска товаров и работы с дополненной реальностью.

Принцип работы

Google Объектив использует нейросетевые модели, обученные на больших массивах изображений. Процесс включает несколько этапов:

  1. Захват изображения камерой устройства или выбор готового снимка.
  2. Предобработка и выделение характерных признаков объектов.
  3. Классификация и распознавание — определение типа объекта, текста или сцены.
  4. Сопоставление с базой данных и формирование результатов: ссылок, переводов, товарных предложений.

Обработка значительной части задач выполняется на серверах Google, что требует подключения к интернету, хотя отдельные функции (например, распознавание текста) могут работать частично на устройстве.

Основные возможности

  • Распознавание текста (OCR) — извлечение надписей с фотографий, документов, вывесок, визиток с возможностью копирования и перевода.
  • Перевод — мгновенный перевод иностранного текста прямо через камеру.
  • Поиск товаров — определение модели одежды, мебели, техники и поиск мест продажи.
  • Идентификация объектов — распознавание растений, животных, достопримечательностей, произведений искусства.
  • Работа с документами — сканирование страниц, копирование номеров телефонов, адресов, дат.
  • Решение задач — распознавание математических выражений и подсказка решения.
  • Дополненная реальность — наложение информации поверх изображения с камеры.

Применение

Google Объектив используется в повседневных сценариях: перевод меню и указателей за границей, поиск цен на товары в магазине, определение растений во время прогулки, оцифровка бумажных документов, изучение архитектурных памятников. Инструмент интегрирован в приложения Google Фото, Google Assistant, «Камеру» на Android, а также доступен через поисковую строку Google.

Доступность и платформы

Функция поддерживается на смартфонах Android (начиная с версии 6.0 и выше) и на устройствах Apple с iOS. На отдельных моделях Pixel часть обработки выполняется локально с помощью специализированного чипа. Google Объектив доступен более чем на 100 языках, включая русский. В России сервис работает, однако часть функций, связанных с покупками и интеграцией с сервисами Google, может быть ограничена.

Ограничения и критика

Точность распознавания зависит от качества снимка, освещения и ракурса. Сложные рукописные тексты, редкие объекты и специализированные термины распознаются с ошибками. Существуют опасения по поводу конфиденциальности: обработка изображений на серверах компании вызывает вопросы о хранении и использовании пользовательских данных. Кроме того, технология может ошибочно идентифицировать людей или объекты, что порождает этические вопросы.

Аналоги

Схожие функции развивают другие компании: Apple предлагает визуальный поиск в приложении «Камера» и «Фото», Яндекс разработал сервис «Яндекс.Картинки» с поиском по изображению, Samsung интегрирует визуальный поиск Bixby Vision. Китайские платформы (Baidu, Alibaba) также имеют собственные системы распознавания изображений.

Значение

Google Объектив стал одним из массовых примеров применения компьютерного зрения в потребительских устройствах. Технология упрощает доступ к информации, устраняя языковые и информационные барьеры, и демонстрирует практическое применение нейросетей в повседневной жизни.

Источники: официальная документация Google, материалы конференций Google I/O, обзоры технологических изданий, публикации о компьютерном зрении.

Загружаем BFOmetr…