Открыть сервис

Scrapinghub

Scrapinghub — это платформа для сбора и обработки веб-данных, предоставляющая облачные сервисы, программное обеспечение с открытым исходным кодом и решения для промышленного веб-скрапинга. Компания была основана в 2011 году разработчиками библиотеки Scrapy (Shane Evans, Pablo Hoffman, Daniel Graña) и первоначально базировалась в Ирландии. Scrapinghub известна как создатель и основной мейнтейнер фреймворка Scrapy, а также как оператор облачного сервиса Scrapinghub Cloud (ранее — Scrapinghub Platform).

История

Компания Scrapinghub была основана в 2011 году в Дублине (Ирландия) тремя разработчиками: Шейном Эвансом (Shane Evans), Пабло Хоффманом (Pablo Hoffman) и Даниэлем Граньей (Daniel Graña). Все трое ранее участвовали в создании фреймворка Scrapy, который в 2008 году был выпущен как проект с открытым исходным кодом. Первоначальная цель компании заключалась в коммерциализации Scrapy — предоставлении облачной инфраструктуры для запуска пауков и хранения результатов.

В 2012 году Scrapinghub запустила первый публичный облачный сервис — Scrapinghub Cloud, который позволял пользователям развёртывать и запускать проекты Scrapy без необходимости управления собственными серверами. В 2013 году компания привлекла инвестиции в размере 1,2 миллиона долларов от ряда венчурных фондов, включая Atlantic Bridge и Enterprise Ireland.

В 2015 году Scrapinghub выпустила Splash — легковесный браузерный движок для рендеринга JavaScript, предназначенный для сбора данных с сайтов, активно использующих динамический контент. В 2016 году был запущен сервис Scrapinghub Data Hub — платформа для хранения и управления собранными данными.

В 2018 году Scrapinghub приобрела компанию Portia (разработчика одноимённого визуального инструмента для создания скраперов), а также запустила сервис Scrapinghub App — мобильное приложение для управления задачами сбора данных. В 2019 году компания объявила о партнёрстве с Google Cloud, что позволило интегрировать Scrapinghub Cloud с облачной инфраструктурой Google.

В 2021 году Scrapinghub была переименована в Zyte (бренд сохранился для коммерческих продуктов), однако название «Scrapinghub» продолжает использоваться для обозначения сообщества разработчиков и открытых проектов. По состоянию на 2023 год компания остаётся одним из ведущих поставщиков решений для веб-скрапинга, обслуживая клиентов из различных отраслей, включая электронную коммерцию, финансы, логистику и аналитику.

Продукты и сервисы

Scrapy

Scrapy — это фреймворк с открытым исходным кодом для веб-скрапинга, написанный на языке Python. Он предоставляет инструменты для извлечения данных из веб-сайтов, обработки HTML/XML, управления очередями запросов и экспорта результатов. Scrapy поддерживает асинхронную обработку, что позволяет обрабатывать тысячи страниц в минуту. Фреймворк является основным продуктом Scrapinghub и используется как в открытых проектах, так и в коммерческих решениях компании.

Scrapinghub Cloud (Zyte Scrapy Cloud)

Scrapinghub Cloud — это облачная платформа для запуска и управления проектами Scrapy. Пользователи могут загружать код пауков, настраивать расписание, мониторить выполнение и получать результаты в виде структурированных данных (CSV, JSON, XML). Платформа автоматически масштабирует ресурсы в зависимости от нагрузки. Сервис предоставляется по модели «плати за использование» (pay-as-you-go) с оплатой за количество запущенных пауков и объём обработанных данных.

Splash

Splash — это легковесный браузерный движок, разработанный Scrapinghub для рендеринга JavaScript. Он позволяет собирать данные с сайтов, которые загружают контент динамически (например, через AJAX-запросы). Splash работает как HTTP-сервер и может использоваться совместно с Scrapy или другими инструментами. Он поддерживает выполнение произвольного JavaScript-кода, управление куками и сессиями, а также работу с прокси.

Portia

Portia — это визуальный инструмент для создания веб-скраперов без написания кода. Пользователь может открыть веб-страницу в браузере, выделить нужные элементы (текст, ссылки, изображения) и указать, какие данные следует извлекать. Portia автоматически генерирует код Scrapy-паука. Инструмент был приобретён Scrapinghub в 2018 году и интегрирован в облачную платформу.

Scrapinghub Data Hub

Scrapinghub Data Hub — это сервис для хранения, управления и экспорта собранных данных. Он предоставляет API для доступа к данным, возможность фильтрации, сортировки и экспорта в различные форматы. Data Hub интегрирован с Scrapinghub Cloud и позволяет пользователям хранить результаты скрапинга до 30 дней (в бесплатном тарифе) или неограниченно долго (в платных тарифах).

Применение

Scrapinghub и её продукты используются для решения широкого круга задач, связанных со сбором веб-данных:

  • Мониторинг цен и ассортимента — компании электронной коммерции собирают данные о ценах, наличии товаров и описаниях с сайтов конкурентов для анализа рынка и оптимизации ценообразования.
  • Аналитика рынкасбор данных о товарах, отзывах, рейтингах и продажах для выявления трендов и прогнозирования спроса.
  • Сбор данных для машинного обучениявеб-скрапинг используется для создания датасетов, необходимых для обучения моделей в области NLP, компьютерного зрения и рекомендательных систем.
  • Мониторинг новостей и социальных медиа — сбор статей, постов, комментариев и метаданных для анализа общественного мнения, отслеживания упоминаний брендов и выявления фейковых новостей.
  • Финансовый анализ — сбор данных о котировках, отчётах компаний, макроэкономических показателях и новостях для построения торговых стратегий и оценки рисков.
  • Логистика и цепочки поставок — мониторинг таможенных данных, цен на перевозки, наличия товаров на складах и маршрутов доставки.

Критика и ограничения

Scrapinghub, как и другие инструменты для веб-скрапинга, сталкивается с рядом этических и юридических вопросов. Основные претензии касаются:

  • Нарушение условий использования — многие веб-сайты запрещают автоматический сбор данных в своих условиях обслуживания. Использование Scrapinghub для обхода таких ограничений может рассматриваться как нарушение контракта.
  • Нагрузка на серверы — интенсивный скрапинг может создавать значительную нагрузку на инфраструктуру целевых сайтов, что приводит к замедлению работы или отказу в обслуживании для обычных пользователей.
  • Правовые риски — в ряде юрисдикций (например, в США и Европейском союзе) веб-скрапинг может быть признан незаконным, если он нарушает авторские права, законы о защите данных (например, GDPR) или антимонопольное законодательство. В России сбор данных без согласия владельца сайта может быть квалифицирован как нарушение закона «О персональных данных» (ФЗ-152) или Гражданского кодекса РФ (ст. 1260, 1270).
  • Этические аспекты — сбор данных с сайтов, которые не предоставляют API или явно не разрешают скрапинг, может рассматриваться как неэтичное поведение, особенно если данные используются для конкуренции с владельцем сайта.

Scrapinghub рекомендует своим пользователям соблюдать законы и условия использования целевых сайтов, а также использовать инструменты с уважением к ресурсам серверов (например, настраивать задержки между запросами).

См. также

Источники

  • Официальный сайт Scrapinghub (Zyte) — zyte.com
  • Документация Scrapy — docs.scrapy.org
  • Репозиторий Scrapy на GitHub — github.com/scrapy/scrapy
  • Статья «Scrapinghub: The Company Behind Scrapy» на сайте Scrapinghub (архив)
  • Интервью с основателями Scrapinghub на портале «The Startup» (2018)
  • Материалы конференции PyCon (2013, 2015) — доклады о Scrapy и Scrapinghub
  • Закон РФ «О персональных данных» (ФЗ-152) — статья 6, 9, 10
  • Гражданский кодекс РФ — часть 4, глава 70 (авторское право)

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →