WebScraperBot — обобщённый User-Agent, под которым в логах ходят скрейперы / автоматизация сбора данных. В отличие от Ahrefs, Serpstat или Yandex, у этого имени нет устойчивой официальной страницы оператора, публичного IP-feed и процедуры верификации. На практике строка легко подделывается: за ней может быть облачный scraper, чужой скрипт или разовый парсер. Важно: не путайте с брендом no-code «Web Scraper» (webscraper.io) и случайными open-source ботами с похожим названием. Совпадение слова «WebScraper» в маркетинге ≠ доказательство, кто именно бьёт ваш origin.
Что известно о WebScraperBot
| Параметр | Значение |
|---|---|
| User-Agent (токен) | WebScraperBot |
| Типичные варианты | Mozilla/5.0 (compatible; WebScraperBot/1.0), WebScraperBot/0.1 (+domain-check) и др. |
| Оператор | Не фиксирован публично (generic scraper UA) |
| Назначение | Обычно извлечение данных / обход URL, не поисковый индекс |
| Официальная документация | ❌ Нет надёжного первоисточника оператора |
| Соблюдение robots.txt | Не гарантировано (для generic scrapers часто игнорируется) |
| Список IP / rDNS | ❌ Нет; IP разнородные (хостинги/VPS) |
| Влияние на SEO Google/Yandex | Нет прямой связи |
Парадокс «честного» имени
Стоит знать любопытную деталь из практики этичного скрейпинга: часть открытых руководств для разработчиков прямо советует **самим** честно указывать в UA, что их клиент — скрейпер, объясняя это прозрачностью перед владельцами сайтов. Это создаёт неочевидный, но полезный ориентир: узнаваемое, «говорящее» имя вроде WebScraperBot иногда может принадлежать более прозрачному, не пытающемуся скрыться автору, тогда как по-настоящему недобросовестные скрейперы чаще маскируются под обычный браузер Chrome/Safari, а не используют самоописательное название. Это не повод автоматически доверять токену, но полезная поправка к интуиции «раз бот — значит скрывается».
Ещё одна причина не доверять одному UA
По анализу индустрии бот-трафика за 2026 год, среди запросов, представляющихся известными AI-краулерами и скрейперами, около 5,7% оказались подделкой строки UA. Если даже узнаваемые, документированные имена подделывают в заметной доле случаев, полностью анонимный generic-токен вроде WebScraperBot тем более нельзя принимать на веру без проверки поведения.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
WebScraperBot vs легитимные краулеры
| Бот | Официальный оператор | Верификация | robots.txt |
|---|---|---|---|
| WebScraperBot | Неясен | ❌ Нет | Ненадёжно |
| DataForSeoBot / Barkrowler | Да | IP / rDNS | Заявлено да |
| Googlebot / YandexBot | Да | Официальный DNS/IP check | Да (с нюансами у части Яндекс-ботов) |
| python-requests / curl | Библиотека / CLI | ❌ | Нет |
Практика: относитесь к WebScraperBot как к нежелательному scraper-трафику, пока не доказано обратное (контракт, ваши же джобы, allowlist IP).
Нагрузка на сервер
По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) паттерн webscraperbot набрал порядка 512 тысяч запросов — почти все в мае (~479 тыс.), март ~0, апрель ~7 тыс., июнь ~27 тыс. Такой профиль похож на волну/кампанию скрейпинга, а не на стабильный поисковый краул. Свежесть: сверьте июль–август; если волна ушла, политика может быть мягче, но deny по умолчанию обычно безопасен.
Обнаружение в логах
grep -i "WebScraperBot" /var/log/nginx/access.log
# Топ IP и URL — главное для расследования
grep -i "WebScraperBot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
grep -i "WebScraperBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Рядом с другими generic-клиентами
grep -iE "WebScraperBot|python-requests|scrapy|httpx|curl/" /var/log/nginx/access.log | wc -l
Без официального IP-листа верификация = анализ IP/ASN, частоты, глубины обхода и того, бьют ли служебные/ценовые URL.
robots.txt
User-agent: WebScraperBot
Disallow: /
Имеет смысл как сигнал и для тех редких клиентов, что robots читают. Не считайте это защитой: generic scrapers часто игнорируют файл. Дублируйте запрет на Nginx/Apache/TrafficVeil.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "WebScraperBot") {
return 403;
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} WebScraperBot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите webscraperbot / WebScraperBot
- Базовая рекомендация — запретить (категория нежелательный)
- При повторных волнах с новых IP — усиливайте поведенческие правила / rate-limit на аномальную автоматизацию, не только UA
- Если это ваши джобы — allowlist конкретных IP, а не открывайте UA всем
Рекомендации
- По умолчанию блокируйте WebScraperBot на сервере/TrafficVeil
- Не доверяйте одному UA — смотрите IP и паттерн; помните про 5,7% подделок даже у известных имён
- robots.txt недостаточен как единственный контроль
- Закройте ценные эндпоинты (прайсы, API, выгрузки) авторизацией, не только Disallow
- Не путайте с Googlebot — блок scraper-UA на поиск не влияет
С кем не путать
| Сигнал | Почему путают | Чем отличается |
|---|---|---|
| webscraper.io / Cloud Scraper | Похожее имя | Другой продукт; нет доказательства связи с этим UA |
| python-requests / Scrapy | Тоже скрейпинг | Другие UA; та же логика: deny без allowlist |
| SEO-краулеры с docs | «Ещё бот» | У них есть оператор и IP/rDNS |
| Googlebot | Автоматизация в логах | Официальная верификация; не банить «заодно» |
Сводная стратегия
| Цель | Действие |
|---|---|
| Убрать скрейпинг по этому UA | 403/deny WebScraperBot + мониторинг IP |
| Свои легитимные джобы | Allowlist IP; отдельный служебный UA |
| Волна сменила UA | Поведенческий антибот / rate-limit, не только строка WebScraperBot |
Частые вопросы
Почему узнаваемое имя вроде WebScraperBot не всегда хуже маскировки под браузер?
Насколько часто подделывают UA даже у известных AI-ботов?
Связан ли WebScraperBot с брендом webscraper.io?
Стоит ли полагаться на robots.txt для контроля WebScraperBot?
Что показал майский всплеск трафика WebScraperBot?
Как лучше всего защитить ценные страницы (цены, API) от подобных ботов?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.