Открыть сервис

Объектив Google: история и характеристики

Объектив Google (Google Lens) — это технология компьютерного зрения, разработанная компанией Google, которая позволяет распознавать объекты на изображениях, получаемых с камеры смартфона или из фотографий, и предоставлять пользователю релевантную информацию о них. Сервис интегрирован в поисковую систему Google, приложения Google и операционную систему Android, выступая инструментом визуального поиска.

История

Анонс технологии состоялся 17 мая 2017 года в ходе ежегодной конференции для разработчиков Google I/O. Изначально функция была доступна только владельцам смартфонов Google Pixel, а в 2018 году Google объявила о распространении поддержки на другие устройства на базе Android и iOS. В том же году сервис был интегрирован в приложение Google Фото и мессенджер Google Messages.

В 2021 году компания объявила о внедрении функции поиска по экрану (Search Your Screen) в браузере Google Chrome для настольных компьютеров, что позволило выделять и искать объекты прямо на веб-страницах. В 2022 году технология была объединена с мультимодальной нейросетью LaMDA для создания функции «Мультипоиск» (Multisearch), позволяющей комбинировать текстовые и визуальные запросы.

Принцип работы

Объектив Google использует глубокие нейронные сети (сверточные нейросети), обученные на миллионах размеченных изображений. Алгоритм анализирует пиксели изображения, выделяет ключевые признаки объекта (форму, цвет, текстуру, границы) и сопоставляет их с базой данных. Процесс распознавания включает несколько этапов:

  • Сегментация изображенияразделение кадра на отдельные объекты.
  • Извлечение признаковопределение характерных особенностей каждого объекта.
  • Классификация — сопоставление признаков с известными категориями (растения, животные, здания, товары).
  • Поиск информации — формирование поискового запроса и выдача релевантных результатов из индекса Google.

Для повышения точности система учитывает контекст: геолокацию устройства, время суток, историю предыдущих запросов пользователя.

Функциональные возможности

Основные сценарии использования сервиса включают:

  • Распознавание растений и животных — определение вида по фотографии листа, цветка или животного.
  • Перевод текста — наведение камеры на иностранный текст с последующим наложением перевода в режиме реального времени (используется технология дополненной реальности).
  • Поиск товаровсканирование штрихкодов, обложек книг, этикеток и поиск аналогичных товаров в интернет-магазинах.
  • Определение достопримечательностей — получение исторической справки о зданиях и памятниках.
  • Решение задач — сканирование математических примеров и уравнений с выдачей пошагового решения.
  • Распознавание текста (OCR) — извлечение текста из документов, визитных карточек, экранов для последующего копирования.
  • Поиск по экранувыделение объектов на скриншотах и в браузере без переключения между приложениями.

Интеграция в экосистему Google

Объектив Google доступен в нескольких точках входа:

  • Приложение Google — иконка камеры в строке поиска.
  • Google Карты — функция просмотра улиц и определения объектов вокруг пользователя.
  • Google Фото — поиск по содержимому фотографий (например, «собака на пляже»).
  • Androidбыстрый доступ через шторку уведомлений или долгое нажатие на иконку приложения.
  • iOS — встроен в приложение Google, вызывается через меню.

Технологические ограничения

Несмотря на высокую точность распознавания (по данным Google, более 90% для популярных категорий), технология имеет ограничения:

  • Зависимость от качества изображения: размытые, затемненные или слишком мелкие объекты распознаются с ошибками.
  • Требование стабильного интернет-соединения для обработки запросов (полностью офлайн работает только распознавание текста в ограниченном режиме).
  • Недостаточная точность при распознавании редких видов растений или животных, мало представленных в обучающей выборке.
  • Проблемы с распознаванием объектов с высокой степенью схожести (например, пород кошек или сортов винограда).

Конфиденциальность и обработка данных

При использовании сервиса изображения передаются на серверы Google для обработки. Компания заявляет, что фотографии, отправленные в Объектив Google, не используются для рекламной персонализации и хранятся в течение ограниченного времени (обычно до 30 дней). Пользователи могут удалить историю визуальных запросов через настройки аккаунта Google. В 2023 году компания внедрила функцию автоматического размытия лиц и номерных знаков на снимках, загружаемых в сервис.

Развитие и перспективы

С 2023 года технология активно используется в экспериментальных функциях искусственного интеллекта Google, включая генеративные ответы в поиске. В 2024 году анонсирована интеграция Объектива Google с мультимодальной моделью Gemini, что позволит отвечать на сложные вопросы об окружающем мире в диалоговом режиме. Ожидается, что дальнейшее развитие сервиса будет направлено на улучшение распознавания трехмерных сцен и видео в реальном времени.

Критика

Основные претензии к сервису связаны с вопросами приватности: правозащитные организации выражали обеспокоенность возможностью использования технологии для массового наблюдения и идентификации людей без их согласия. Google неоднократно опровергала эти опасения, отмечая, что функция распознавания лиц в Объективе Google отключена по умолчанию и не предоставляет информацию о личности человека по фотографии.