Текст на фото: бесплатные способы распознавания¶
Текст на фото — это текстовая информация, зафиксированная в виде изображения (снимок документа, скриншот, фотография страницы, вывеска, таблица). Задача извлечения такого текста в машиночитаемый вид называется оптическим распознаванием символов (OCR, Optical Character Recognition). Бесплатные способы получить текст с фото существуют в нескольких категориях: встроенные инструменты операционных систем, облачные сервисы, мобильные приложения и локальные программы с открытым исходным кодом.
¶Принцип работы OCR
OCR-система анализирует изображение, выделяет на нём области с текстом, сегментирует строки и символы, а затем сопоставляет их с эталонными шрифтовыми моделями. Качество результата зависит от разрешения снимка, контраста, наклона, наличия шумов и языка текста. Современные системы используют нейронные сети, что позволяет распознавать рукописный текст и сложные макеты.
¶Встроенные средства операционных систем
¶Windows
В Windows 10 и 11 встроен сервис «Распознавание текста» (Windows OCR), доступный через приложение «Фотографии» и контекстное меню. Пользователь открывает изображение, нажимает кнопку «Извлечь текст» и копирует результат. Поддерживаются десятки языков, включая русский. Другой вариант — «Снайперский снимок» (Snipping Tool) с функцией захвата области экрана и извлечения текста.
¶macOS
В macOS Mojave и новее функция «Взгляд» (Live Text) позволяет выделять текст прямо на изображении или даже в видео. Текст копируется как обычный фрагмент. Поддерживается русский язык.
¶Android
На смартфонах с Android 8.0 и выше текст извлекается из фото через Google Lens или встроенную функцию камеры Google. На устройствах без Google-сервисов аналогичную роль играет «Распознавание текста» в галерее.
¶iOS
Начиная с iOS 15 функция Live Text работает в камере, галерее и системном поиске. Текст выделяется пальцем, переводится и копируется.
¶Облачные сервисы
Бесплатные онлайн-конвертеры изображений в текст работают по модели «загрузил — получил результат». К числу известных относятся:
- Online OCR — поддерживает русский и английский, ограничение до 15 страниц в час в бесплатном режиме.
- Google Переводчик — функция «Камера» распознаёт текст с фото и переводит его, извлечение текста доступно без регистрации.
- Яндекс.Переводчик — режим «Изображение» позволяет распознать текст на русском и перевести.
- Microsoft Bing Visual Search — поиск по изображению с извлечением текста.
- NewOCR — бесплатный сервис без регистрации, поддерживает русский язык.
Основной недостаток облачных инструментов — необходимость загружать изображение на сторонний сервер, что не подходит для конфиденциальных документов.
¶Мобильные приложения
Бесплатные приложения для распознавания текста с фото:
| Приложение | Платформа | Особенности |
|---|---|---|
| Google Lens | Android, iOS | Распознавание, перевод, поиск по изображению |
| Microsoft Lens | Android, iOS | Сканирование документов, экспорт в Word |
| ABBYY FineReader (пробная версия) | Android, iOS | Точное распознавание, работа с таблицами |
| Text Fairy | Android | Бесплатно, без рекламы, офлайн-распознавание |
| Text Scanner | Android, iOS | Простой интерфейс, быстрое распознавание |
¶Локальные программы и библиотеки
Для работы без интернета и полного контроля над данными используются десктопные OCR-программы и библиотеки:
- Tesseract OCR — бесплатная открытая библиотека от Google, поддерживает более 100 языков, включая русский. Работает на Windows, macOS и Linux. Требует настройки, но не отправляет данные на сервер.
- ABBYY FineReader (пробная версия) — профессиональный редактор PDF с OCR.
- Cuneiform — российская бесплатная программа для распознавания текста, разработанная в 1990-е годы, поддерживает русский и английский.
- OCRmyPDF — бесплатная утилита для Linux, добавляет текстовый слой в PDF-файлы на основе Tesseract.
¶Качество распознавания
Точность OCR зависит от нескольких факторов:
- Разрешение изображения — оптимально 300 dpi и выше.
- Контраст — чёрный текст на белом фоне даёт лучший результат.
- Ориентация — изображение должно быть выровнено.
- Шрифт — печатный текст распознаётся точнее рукописного.
- Язык — системы, обученные на русском, работают с кириллицей заметно лучше универсальных.
При низком качестве исходного изображения рекомендуется предварительная обработка: повышение контраста, удаление шумов, кадрирование.
¶Применение
Бесплатное распознавание текста с фото используется в повседневной жизни и профессиональной деятельности: оцифровка бумажных документов, копирование цитат из книг, извлечение данных из скриншотов, перевод текста с иностранных вывесок и меню, доступность для людей с нарушениями зрения.
Источники:
- Tesseract OCR Documentation
- Microsoft Support: Windows OCR
- Apple Support: Live Text
- Google Lens Help
- Online OCR Service Documentation
- Cuneiform OCR Project