В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а ScourRSSBot с User-Agent вида ScourRSSBot/1.0 (+https://scour.ing/bot). Это краулер сервиса Scour — персонализированной RSS-читалки, которая использует AI/ML для подбора контента под интересы конкретного пользователя. Трафик пропорционален числу читателей ленты: чем больше людей подписалось на ваш фид через Scour, тем чаще заходит бот.
1. Что такое ScourRSSBot
У бота есть официальная страница-документация на scour.ing/bot с чёткой политикой поведения. Ключевая особенность: Scour не сканирует и не скрапит весь сайт подряд — обход запускается только тогда, когда конкретный пользователь сервиса сам добавил URL вашей ленты для отслеживания обновлений. Если добавленный URL не распознан как поддерживаемый тип фида, Scour автоматически проверяет типовые адреса (/rss.xml, /atom.xml, /feed.json, /feed и похожие); отдельно сервис поддерживает и блоги без RSS-ленты вовсе — в этом случае бот читает саму страницу со списком постов, чтобы отследить новые публикации по заголовкам и датам.
| Название | ScourRSSBot |
| User-Agent / паттерн | scourrssbot — официальные варианты: ScourRSSBot/1.0 (+https://scour.ing/bot), Scour/1.0 (+https://scour.ing/bot), ScourBot/1.0 (+https://scour.ing/bot) |
| Оператор | Scour (scour.ing) — персонализированная RSS-читалка с AI/ML-подбором контента |
| Роль | Проверяет обновления по фидам, которые пользователи Scour сами добавили для отслеживания; для сайтов без RSS может читать страницу со списком постов напрямую |
| Документация / ориентир | scour.ing/bot — официальная страница с UA-строками и ссылкой на список исходящих IP-адресов бота |
| Список IP | ✅ Официально публикуется — ссылка на актуальный список IP указана прямо на странице scour.ing/bot |
| robots.txt | Данные расходятся: сторонний каталог ботов указывает, что бот не соблюдает robots.txt, тогда как для него в принципе можно прописать стандартное правило блокировки — на практике не полагайтесь на файл как на гарантированную меру |
| Пометка TrafficVeil | Легитимный / RSS и фиды |
2. Зачем ScourRSSBot приходит на сайт
В отличие от многих ботов этой категории, ScourRSSBot принципиально не обходит сайты по собственной инициативе — он реагирует на действие конкретного человека, который добавил вашу ленту в свою читалку Scour. Появление бота в логах — прямой сигнал, что у сайта есть хотя бы один реальный подписчик через этот сервис.
- Какие зоны чаще трогает: /feed/, /rss/, /atom.xml, /blog/feed — а при отсутствии распознаваемого фида бот пробует типовые адреса (/rss.xml, /feed.json) или переходит к чтению страницы со списком постов;
- Что ищет: новые записи и обновления, которые затем ранжируются AI/ML-алгоритмом Scour под интересы конкретного подписчика;
- Чем отличается от браузерного пользователя: нет нормальной сессии, обход методичный и ограничен именно теми URL, что нужны для отслеживания добавленной пользователем ленты.
Типичный кейс: CDN-трафик дорожает, origin CPU нагружен рендерингом HTML. Фильтр по scourrssbot показывает, что бот вычитывает /feed/, /rss/, /atom.xml, /blog/feed — учитывая user-initiated природу бота, само его присутствие означает, что кто-то реально читает ваш контент через Scour, а не просто «фоновый шум».
3. Нагрузка и риски именно для ScourRSSBot
Отдельной строки в публичной сводке top-bot TrafficVeil у scourrssbot может не быть, но в категории «RSS и фиды» такие агенты дают характерный фон: лишние опросы feed URL, редко критичные по нагрузке. Поскольку обход запускается только по добавленным конкретными пользователями лентам, а не сканированием домена целиком, серьёзной нагрузки от одного сайта ScourRSSBot обычно не создаёт — риск скорее в накопленном эффекте, если у ленты много подписчиков через сервис одновременно.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти ScourRSSBot в логах
Не ищите «просто ботов» — ищите конкретный токен scourrssbot и рядом смотрите соседей по семейству фид-ридеров.
# Базовый поиск по всем вариантам UA
grep -iE "scourrssbot|scourbot|scour\.ing" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "scourrssbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA — сверьте со списком на scour.ing/bot
grep -i "scourrssbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "scourrssbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отделить от похожих строк семейства фид-ридеров
grep -iE "scourrssbot|automattic feed fetcher|feedbin|feedburner" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку: UA + IP + частоту + набор URL. У Scour есть официальный, редкий для этой категории список исходящих IP — сверяйтесь именно с ним по ссылке на scour.ing/bot, а не только по строке UA.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для ScourRSSBot
# Жёсткий запрет
User-agent: scourrssbot
Disallow: /
# Разрешить всё
User-agent: scourrssbot
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: scourrssbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: ставьте Disallow или 403 для scourrssbot, если пользы нет. Поскольку данные о соблюдении robots.txt этим ботом расходятся у разных источников, для надёжного результата переходите к правилам на уровне nginx/Apache или к запрету в TrafficVeil, если полная блокировка критична.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "scourrssbot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=scourrssbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "scourrssbot") {
limit_req zone=scourrssbot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} scourrssbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите scourrssbot в ботах домена или в разделе /system/bots;
- Для нежелательного сценария выберите категорию «запретить»; для мягкого варианта — rate-limit;
- Allow оставляйте только при явной пользе от распространения через Scour — учитывая user-initiated природу бота, его присутствие уже означает наличие реальных подписчиков;
- После изменения сверьте логи: хиты ScourRSSBot должны уйти в блок или лимит, а нужные поисковики — остаться без изменений.
7. Рекомендации: что делать с ScourRSSBot
- Если пользы нет — Disallow/403 для scourrssbot;
- Если польза есть — Allow только при явной пользе от ScourRSSBot; помните, что в отличие от многих RSS-ботов этот запускается по инициативе реального читателя, а не фоновым сканированием;
- Если нагрузка мешает — сначала rate-limit, затем полный запрет;
- Не режьте слишком широко правилом User-agent: *, чтобы случайно не закрыть Googlebot или YandexBot;
- Что вы теряете при блокировке: часть распространения через агрегаторы и читалки — в данном случае через реальных, уже подписавшихся пользователей Scour.
8. С кем не путать ScourRSSBot
| Бот / сосед | Кластер | UA | Комментарий |
| Automattic Feed Fetcher | RSS и фиды | automattic feed fetcher | легитимный |
| FeedBurner | RSS и фиды | feedburner | легитимный |
| FeedFlow | RSS и фиды | feedflow | легитимный |
| Feedbin | RSS и фиды | feedbin | легитимный |
| Feeder | RSS и фиды | feeder | легитимный |
9. Стратегия allow/deny для ScourRSSBot
| Ситуация | Действие |
| Есть реальные подписчики через Scour | Allow + закрыть /admin /cart /api |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil |
| Нужен доступ, но пики по ночам | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Сверять с официальным списком IP на scour.ing/bot, не доверять только строке UA |
Частые вопросы
ScourRSSBot сканирует сайты сам по себе?
Значит ли присутствие бота в логах, что у сайта есть реальный читатель?
Что бот делает, если у сайта нет RSS-ленты?
Публикует ли Scour официальный список IP-адресов бота?
Можно ли положиться на robots.txt для полной блокировки этого бота?
Что теряет сайт при блокировке ScourRSSBot?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.