Боты5 мин чтения·11 августа 2026 г.·обновлено 8 сентября 2026 г.

Scoopit-crawler: бот платформы контент-курации Scoop.it — блокировать или использовать как источник трафика

scoopit-crawler принадлежит Scoop.it — публичной платформе контент-курации из Сан-Франциско с 75+ миллионами посетителей к 2013 году, чей движок обходит свыше 40 млн страниц в день. Разбираем разницу между автоматическим обходом и запросами по прямому действию пользователя, реальные риски дублированного контента и когда присутствие в курации может быть источником трафика, а не просто фоновой

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота scoopit-crawler: нежелательный прочие краулеры и сервисы

Scoop.it — не безымянный скрапер, а публичная платформа контент-курации из Сан-Франциско с историей до 2007 года, а к июлю 2013-го, по данным VentureBeat, её посетили уже более 75 миллионов человек. За именем scoopit-crawler стоит именно её поисковый движок: по собственным данным компании, каждый день система обходит свыше 40 миллионов веб-страниц, чтобы находить контент по темам, которые пользователи Scoop.it хотят курировать и публиковать на своих тематических страницах.

Как устроена курация и при чём тут краулер

Scoop.it работает так: пользователь платформы задаёт ключевые слова или тему интереса (например, «контент-маркетинг» или конкретное словосочетание с точным совпадением), а внутренний движок семантических подсказок ищет по всему проиндексированному вебу материалы, которые этой теме соответствуют, и предлагает их пользователю для «скупа» — добавления на его тематическую страницу с собственным комментарием. Отсюда и задача краулера: не разово посетить сайт, а систематически поддерживать актуальный срез контента по огромному множеству тем, которые задают тысячи разных пользователей платформы одновременно.

Официальная страница Scoop.it с описанием ботов прямо разделяет два сценария обхода: часть запросов идёт полностью автоматически по расписанию суggestion-движка, а часть запускается напрямую действием конкретного пользователя — например, когда он вручную добавляет URL для курации через букмарклет или форму. Это значит, что не каждый визит бота — часть массового фонового сканирования; часть обращений — прямой, разовый результат интереса живого человека к конкретной странице сайта.

Параметры бота

Параметр Значение
User-Agent / паттерн scoopit-crawler (у Scoop.it задокументирован целый набор строк UA для разных сценариев обхода)
Оператор Scoop.it, Inc. — компания контент-маркетинга и курации, Сан-Франциско
Масштаб обхода По собственным данным компании — свыше 40 млн страниц в день суммарно по всей платформе
Два типа запросов Автоматический обход по suggestion-движку И запросы, инициированные напрямую действием конкретного пользователя платформы
Список IP-адресов ❌ Отдельного официального фида не найдено
Официальная страница ботов Scoop.it публикует список распространённых строк User-Agent своих краулеров на отдельной служебной странице

Стоит ли волноваться из-за этого бота

По оценке профильных источников по анализу трафика, у краулинга Scoop.it есть три практических риска для владельца сайта, помимо стандартной нагрузки на сервер: возможное создание проблем с дублированным контентом, если платформа отображает крупные фрагменты исходного материала на сторонней странице курации, что теоретически может размывать восприятие поисковыми системами оригинального источника; риск при неаккуратном или избыточном обходе — повышенный расход трафика; и репутационный риск при некорректном представлении контента вне контекста оригинала. При этом сама модель Scoop.it по умолчанию рассчитана на добавление куратором собственного комментария поверх найденного материала, а не на дублирование содержимого целиком — то есть на практике вероятность серьёзной проблемы с дублирующимся контентом ниже, чем у прямого копирования, но не нулевая.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти бота в логах

grep -i "scoopit-crawler" /var/log/nginx/access.log

Поскольку у компании нет официального публичного списка IP, при подозрении на подделку строки User-Agent стоит свериться с ASN конкретных адресов через whois:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

Стоит ли блокировать

Здесь стоит взвесить конкретную выгоду против конкретного риска, а не действовать по шаблону:

  • если сайт заинтересован в дополнительной видимости через курацию (например, отраслевой блог, экспертный контент, материалы, которые логично попадать в тематические подборки Scoop.it) — присутствие в системе может приносить дополнительные переходы от аудитории платформы, и в этом случае блокировка отсекает потенциальный источник трафика;
  • если контент сайта уникален и монетизируется напрямую (платный доступ, эксклюзивные материалы) — стоит внимательнее отнестись к тому, как именно платформа отображает материал в чужих подборках курации;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет напрямую — это отдельная от классической поисковой индексации система.

Как настроить доступ

Явное разрешение, если присутствие в курации Scoop.it желательно:

User-agent: scoopit-crawler
Allow: /

Стандартный запрет с дублированием на уровне сервера, если сайт не заинтересован в подобной видимости:

User-agent: scoopit-crawler
Disallow: /
if ($http_user_agent ~* "scoopit-crawler") {
    return 403;
}

Если полный запрет кажется избыточным, а беспокоит лишь фоновая нагрузка от систематического обхода 40-миллионного суточного суggestion-движка, разумная промежуточная мера — ограничение частоты запросов вместо жёсткой блокировки:

limit_req_zone $binary_remote_addr zone=scoopit:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "scoopit-crawler") {
        limit_req zone=scoopit burst=20 nodelay;
    }
}

Частые вопросы

Кто владеет краулером scoopit-crawler?
Scoop.it, Inc. — платформа контент-курации и маркетинга из Сан-Франциско, основанная в 2007 году.
Все ли запросы бота — автоматическое сканирование?
Нет, часть запросов инициируется напрямую действием конкретного пользователя платформы, например при ручном добавлении URL для курации.
Может ли этот бот навредить SEO из-за дублированного контента?
Теоретический риск есть, если платформа отображает крупные фрагменты материала на странице курации, но модель Scoop.it рассчитана на добавление куратором собственного комментария, а не на полное копирование.
Может ли присутствие в Scoop.it принести сайту пользу?
Да, для отраслевого или экспертного контента курация может стать дополнительным источником переходов от аудитории платформы.
Есть ли у Scoop.it официальный список IP-адресов?
Нет, отдельного публичного фида не найдено — для проверки подлинности стоит смотреть ASN через whois.
Как поступить, если полная блокировка кажется избыточной?
Использовать ограничение частоты запросов (rate-limit) вместо полного запрета — это снизит фоновую нагрузку, не отсекая присутствие в курации полностью.
#scoopit-crawler#Scoop.it#контент-курация#дублированный контент#бот-энциклопедия#robots.txt#nginx#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil