TrafficVeil
Боты 7 мин24 августа 2026 г.

SkroutzBot в логах сайта: когда он легитимен, а когда нет

SkroutzBot в базе TrafficVeil по умолчанию помечен как нежелательный, но по официальной документации оператора — это конкретный краулер греческого маркетплейса Skroutz, который приходит только на сайты, явно подключившие товарный XML-фид, и публикует список своих IP-диапазонов. Разбираемся, чем он отличается от обычного скрапера, как проверить его подлинность по IP и почему для настоящих партнёров Skroutz правильная реакция — не блокировка, а внесение в белый список.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое SkroutzBot на самом деле
  2. Зачем SkroutzBot приходит на сайт
  3. Почему пометка «нежелательный» верна не всегда
  4. Официальные IP-диапазоны для верификации
  5. Технические требования, о которых редко пишут
  6. Нагрузка: чего ждать на практике
  7. Как найти SkroutzBot в логах
  8. robots.txt: почему на него нельзя полагаться полностью
  9. Блокировка вручную и через TrafficVeil
  10. С кем можно перепутать SkroutzBot
  11. Что в итоге делать со SkroutzBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Строка skroutzbot в access.log почти всегда попадает в общую корзину «нежелательных прочих ботов» — по умолчанию не поисковик, не соцсеть, значит подозрительный. На практике это не так: SkroutzBot — официальный краулер греческого маркетплейса Skroutz, документированный лучше большинства ботов из этой категории, вплоть до публичного списка IP-диапазонов. Проблема не в самом боте, а в том, откуда он взялся на конкретном сайте: у него узкая, чётко описанная задача, и понимание этой задачи меняет весь разговор про allow/deny в TrafficVeil.

Что такое SkroutzBot на самом деле

Skroutz — крупнейший онлайн-маркетплейс и сервис сравнения цен в Греции, основан в 2005 году, штаб-квартира в Неа-Ионии; по данным на середину 2025 года это самый посещаемый маркетплейс страны и один из пяти самых посещаемых сайтов Греции в целом. SkroutzBot — официальный инструмент компании для загрузки товарных XML-фидов от продавцов, зарегистрированных в программе Skroutz: именно так магазин попадает в каталог сравнения цен.

Параметр Значение
Название SkroutzBot
User-Agent / паттерн skroutzbot (также отдельный агент Skroutz ImageBot v1 для изображений)
Оператор Skroutz S.A., Греция
Категория TrafficVeil Легитимный при наличии зарегистрированного фида; вне контекста e-commerce — повод проверить на спуфинг
Что делает на сайте Скачивает конкретный XML-фид, изображения товаров из него и выборочно — страницы отдельных товаров для контроля качества
Список IP ✅ Официально опубликован (см. ниже) и доступен в JSON
robots.txt Сам оператор прямо пишет, что бот не соответствует стандартному определению robotstxt.org — полагаться на него как на единственный механизм контроля не стоит
Пометка TrafficVeil Контекстно-зависимая: легитимный для партнёров Skroutz, подозрительный при отсутствии связи с площадкой

Зачем SkroutzBot приходит на сайт

Бот не обходит сайт целиком и не ищет контент «на всякий случай». По официальной документации Skroutz для разработчиков, SkroutzBot обращается ровно к трём типам URL: адресу самого XML-фида, ссылкам на изображения товаров внутри этого фида (скачиваются все) и небольшой выборке страниц отдельных товаров — для ручной проверки качества данных. Если магазин не подключил XML-фид к Skroutz, у бота попросту нет причины идти на этот сайт.

Почему пометка «нежелательный» верна не всегда

Для интернет-магазина, который сам зарегистрировал товарный фид в Skroutz ради присутствия в сравнении цен, визиты SkroutzBot — это именно та функция, ради которой фид и подключали, а не паразитная нагрузка. Другое дело — сайт, не имеющий отношения к продаже физических товаров в Греции или Европе: там появление этой строки в логах — сигнал скорее проверить IP на соответствие официальным диапазонам, чем на реальный визит настоящего SkroutzBot. Правильная классификация зависит от контекста сайта, а не от одной строки UA.

Официальные IP-диапазоны для верификации

В отличие от большинства ботов из категории «прочие краулеры», у SkroutzBot есть открыто опубликованный список сетей — это редкость и веский повод сверяться именно с ним, а не только с UA.

Тип Диапазон
IPv4 185.6.76.0/22
IPv4 3.73.204.153/32
IPv4 3.72.204.195/32
IPv4 3.67.183.221/32
IPv4 63.34.193.172/32
IPv4 54.195.53.34/32
IPv4 108.129.50.199/32
IPv6 2a03:e40::/32

Оператор также публикует эти диапазоны в машиночитаемом JSON — удобно для автоматической сверки в антибот-правилах, а не только для ручной проверки через whois. Диапазоны периодически могут обновляться, поэтому для постоянной автоматизированной защиты лучше опираться на актуальный JSON, а не хранить список статично.

Технические требования, о которых редко пишут

SkroutzBot принимает только HTTPS-соединения с полной цепочкой сертификата до корневого CA — самоподписанные или неполные цепочки бот не примет. Аутентификация (базовая HTTP-авторизация и любая другая) не поддерживается: если доступ к фиду нужно ограничить, правильный способ — список разрешённых IP, а не логин/пароль. Бот отправляет заголовок Accept-Encoding и умеет работать с gzip/zip, поэтому сервер не должен блокировать его только за то, что отдаёт фид в сжатом виде.

Нагрузка: чего ждать на практике

По собственному заявлению оператора, SkroutzBot поддерживает разумную частоту запросов, а поскольку его работа ограничена фидом, изображениями из него и выборкой карточек товара, а не сплошным обходом сайта, реальная нагрузка обычно ниже, чем у типичных поисковых или AI-краулеров. Официальная рекомендация для партнёров Skroutz — не применять к диапазонам бота rate-limit вообще, чтобы не мешать регулярному обновлению фида; при использовании внешних антибот-инструментов (включая CDN-защиту) IP-диапазоны SkroutzBot стоит явно занести в белый список.

Как найти SkroutzBot в логах

# Базовый поиск
grep -i "skroutzbot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот (обычно это адрес фида и товарные страницы)
grep -i "skroutzbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — сверяем с официальными диапазонами
grep -i "skroutzbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Распределение по времени суток
grep -i "skroutzbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Для верификации сравните IP запроса с официальными диапазонами напрямую, а не только по UA:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt: почему на него нельзя полагаться полностью

Сам оператор прямо предупреждает: SkroutzBot называется ботом, но не соответствует стандартному определению robotstxt.org. На практике это значит, что классическая директива в robots.txt — не гарантированный способ его остановить.

# Формальная директива (может быть недостаточной)
User-agent: skroutzbot
Disallow: /

# Компромисс для партнёров: не трогать фид и его ресурсы
User-agent: skroutzbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Allow: /feed/

Если нужно гарантированно ограничить доступ, надёжнее работать не через robots.txt, а через список IP на уровне сервера или TrafficVeil — благо диапазоны бота официально известны.

Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "skroutzbot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=skroutzbot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "skroutzbot") {
        limit_req zone=skroutzbot burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} skroutzbot [NC]
RewriteRule ^ - [F,L]

TrafficVeil: найдите skroutzbot в списке ботов домена или в разделе /system/bots. Для реальных партнёров Skroutz — категория «легитимный» и внесение официальных IP-диапазонов в белый список без rate-limit; для сайтов без связи с площадкой — «запретить» по умолчанию, с точечным allow только при подтверждённой деловой необходимости. После изменения правила сверьте логи: хиты с IP вне официальных диапазонов Skroutz должны уходить в блок, а подтверждённый трафик — проходить свободно.

С кем можно перепутать SkroutzBot

Бот Оператор Особенность
Skroutz ImageBot v1 Skroutz S.A. Отдельный агент того же оператора специально для скачивания изображений товаров — не «сосед», а часть той же инфраструктуры
Storebot-Google Google (Merchant Center) Аналог по назначению — проверяет посадочные страницы товаров для Google Shopping; тоже требует явного разрешения в robots.txt и работает только с зарегистрированными фидами
Спуфер под именем skroutzbot Неизвестен Любой скрипт может подделать UA; единственный надёжный признак — совпадение IP с официальными диапазонами Skroutz

Что в итоге делать со SkroutzBot

Ситуация Действие
Сайт — партнёр Skroutz с зарегистрированным XML-фидом Белый список по официальным IP-диапазонам, без rate-limit, HTTPS с корректной цепочкой сертификата
Сайт не связан с продажей товаров в Skroutz, но бот всё равно заходит Сверить IP с официальным списком; при несовпадении — блокировать как спуфинг
IP совпадает с диапазонами, но нагрузка кажется избыточной Обратиться в поддержку Skroutz, а не глушить рейт-лимитом — официально бот и так держит разумную частоту
Требуется полностью исключить участие в Skroutz Отозвать фид на стороне Skroutz и точечно закрыть доступ по IP/UA как для нежелательного бота

Не полагайтесь на одну лишь директиву в robots.txt как на способ остановить SkroutzBot — сам оператор предупреждает, что бот не следует стандарту в полной мере; для реального контроля нужна проверка по официальным IP-диапазонам.

Частые вопросы

Правда ли, что SkroutzBot всегда стоит блокировать как нежелательный трафик?

Нет, для интернет-магазинов, зарегистрировавших товарный фид в Skroutz, визиты этого бота — именно та функция, ради которой фид подключали, а не паразитная нагрузка.

Чем Skroutz ImageBot отличается от самого SkroutzBot?

Это два разных агента одного оператора: SkroutzBot забирает XML-фид и карточки товаров, а Skroutz ImageBot v1 отдельно скачивает изображения из этого фида.

Сколько IP-диапазонов официально закреплено за SkroutzBot?

Семь диапазонов IPv4 и один диапазон IPv6, плюс машиночитаемый JSON-список для автоматической сверки в антибот-правилах.

Что делать, если SkroutzBot заходит на сайт, никак не связанный с продажей товаров в Греции?

В такой ситуации стоит в первую очередь сверить IP запроса с официальными диапазонами Skroutz — если он не совпадает, это, скорее всего, подделка UA, а не настоящий бот.

Почему нельзя полностью полагаться на robots.txt для ограничения SkroutzBot?

Сам оператор прямо предупреждает, что бот не соответствует стандартному определению robotstxt.org, поэтому для надёжного контроля доступа нужна проверка по официальным IP, а не только директива в файле.

Стоит ли по умолчанию включать rate-limit для SkroutzBot?

Нет, оператор официально просит не ограничивать частоту запросов для подтверждённых IP-диапазонов бота, поскольку он и так поддерживает разумный темп обращений.

#SkroutzBot#боты#краулеры#антибот#robots.txt#e-commerce#XML-фид#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

SkroutzBot в логах: что это, IP-диапазоны и настройка