Scoop.it — не безымянный скрапер, а публичная платформа контент-курации из Сан-Франциско с историей до 2007 года, а к июлю 2013-го, по данным VentureBeat, её посетили уже более 75 миллионов человек. За именем scoopit-crawler стоит именно её поисковый движок: по собственным данным компании, каждый день система обходит свыше 40 миллионов веб-страниц, чтобы находить контент по темам, которые пользователи Scoop.it хотят курировать и публиковать на своих тематических страницах.
Как устроена курация и при чём тут краулер
Scoop.it работает так: пользователь платформы задаёт ключевые слова или тему интереса (например, «контент-маркетинг» или конкретное словосочетание с точным совпадением), а внутренний движок семантических подсказок ищет по всему проиндексированному вебу материалы, которые этой теме соответствуют, и предлагает их пользователю для «скупа» — добавления на его тематическую страницу с собственным комментарием. Отсюда и задача краулера: не разово посетить сайт, а систематически поддерживать актуальный срез контента по огромному множеству тем, которые задают тысячи разных пользователей платформы одновременно.
Официальная страница Scoop.it с описанием ботов прямо разделяет два сценария обхода: часть запросов идёт полностью автоматически по расписанию суggestion-движка, а часть запускается напрямую действием конкретного пользователя — например, когда он вручную добавляет URL для курации через букмарклет или форму. Это значит, что не каждый визит бота — часть массового фонового сканирования; часть обращений — прямой, разовый результат интереса живого человека к конкретной странице сайта.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | scoopit-crawler (у Scoop.it задокументирован целый набор строк UA для разных сценариев обхода) |
| Оператор | Scoop.it, Inc. — компания контент-маркетинга и курации, Сан-Франциско |
| Масштаб обхода | По собственным данным компании — свыше 40 млн страниц в день суммарно по всей платформе |
| Два типа запросов | Автоматический обход по suggestion-движку И запросы, инициированные напрямую действием конкретного пользователя платформы |
| Список IP-адресов | ❌ Отдельного официального фида не найдено |
| Официальная страница ботов | Scoop.it публикует список распространённых строк User-Agent своих краулеров на отдельной служебной странице |
Стоит ли волноваться из-за этого бота
По оценке профильных источников по анализу трафика, у краулинга Scoop.it есть три практических риска для владельца сайта, помимо стандартной нагрузки на сервер: возможное создание проблем с дублированным контентом, если платформа отображает крупные фрагменты исходного материала на сторонней странице курации, что теоретически может размывать восприятие поисковыми системами оригинального источника; риск при неаккуратном или избыточном обходе — повышенный расход трафика; и репутационный риск при некорректном представлении контента вне контекста оригинала. При этом сама модель Scoop.it по умолчанию рассчитана на добавление куратором собственного комментария поверх найденного материала, а не на дублирование содержимого целиком — то есть на практике вероятность серьёзной проблемы с дублирующимся контентом ниже, чем у прямого копирования, но не нулевая.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
grep -i "scoopit-crawler" /var/log/nginx/access.log
Поскольку у компании нет официального публичного списка IP, при подозрении на подделку строки User-Agent стоит свериться с ASN конкретных адресов через whois:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Стоит ли блокировать
Здесь стоит взвесить конкретную выгоду против конкретного риска, а не действовать по шаблону:
- если сайт заинтересован в дополнительной видимости через курацию (например, отраслевой блог, экспертный контент, материалы, которые логично попадать в тематические подборки Scoop.it) — присутствие в системе может приносить дополнительные переходы от аудитории платформы, и в этом случае блокировка отсекает потенциальный источник трафика;
- если контент сайта уникален и монетизируется напрямую (платный доступ, эксклюзивные материалы) — стоит внимательнее отнестись к тому, как именно платформа отображает материал в чужих подборках курации;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет напрямую — это отдельная от классической поисковой индексации система.
Как настроить доступ
Явное разрешение, если присутствие в курации Scoop.it желательно:
User-agent: scoopit-crawler
Allow: /
Стандартный запрет с дублированием на уровне сервера, если сайт не заинтересован в подобной видимости:
User-agent: scoopit-crawler
Disallow: /
if ($http_user_agent ~* "scoopit-crawler") {
return 403;
}
Если полный запрет кажется избыточным, а беспокоит лишь фоновая нагрузка от систематического обхода 40-миллионного суточного суggestion-движка, разумная промежуточная мера — ограничение частоты запросов вместо жёсткой блокировки:
limit_req_zone $binary_remote_addr zone=scoopit:10m rate=10r/m;
location / {
if ($http_user_agent ~* "scoopit-crawler") {
limit_req zone=scoopit burst=20 nodelay;
}
}Частые вопросы
Кто владеет краулером scoopit-crawler?
Все ли запросы бота — автоматическое сканирование?
Может ли этот бот навредить SEO из-за дублированного контента?
Может ли присутствие в Scoop.it принести сайту пользу?
Есть ли у Scoop.it официальный список IP-адресов?
Как поступить, если полная блокировка кажется избыточной?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.