Строка skroutzbot в access.log почти всегда попадает в общую корзину «нежелательных прочих ботов» — по умолчанию не поисковик, не соцсеть, значит подозрительный. На практике это не так: SkroutzBot — официальный краулер греческого маркетплейса Skroutz, документированный лучше большинства ботов из этой категории, вплоть до публичного списка IP-диапазонов. Проблема не в самом боте, а в том, откуда он взялся на конкретном сайте: у него узкая, чётко описанная задача, и понимание этой задачи меняет весь разговор про allow/deny в TrafficVeil.
Что такое SkroutzBot на самом деле
Skroutz — крупнейший онлайн-маркетплейс и сервис сравнения цен в Греции, основан в 2005 году, штаб-квартира в Неа-Ионии; по данным на середину 2025 года это самый посещаемый маркетплейс страны и один из пяти самых посещаемых сайтов Греции в целом. SkroutzBot — официальный инструмент компании для загрузки товарных XML-фидов от продавцов, зарегистрированных в программе Skroutz: именно так магазин попадает в каталог сравнения цен.
| Параметр | Значение |
| Название | SkroutzBot |
| User-Agent / паттерн | skroutzbot (также отдельный агент Skroutz ImageBot v1 для изображений) |
| Оператор | Skroutz S.A., Греция |
| Категория TrafficVeil | Легитимный при наличии зарегистрированного фида; вне контекста e-commerce — повод проверить на спуфинг |
| Что делает на сайте | Скачивает конкретный XML-фид, изображения товаров из него и выборочно — страницы отдельных товаров для контроля качества |
| Список IP | ✅ Официально опубликован (см. ниже) и доступен в JSON |
| robots.txt | Сам оператор прямо пишет, что бот не соответствует стандартному определению robotstxt.org — полагаться на него как на единственный механизм контроля не стоит |
| Пометка TrafficVeil | Контекстно-зависимая: легитимный для партнёров Skroutz, подозрительный при отсутствии связи с площадкой |
Зачем SkroutzBot приходит на сайт
Бот не обходит сайт целиком и не ищет контент «на всякий случай». По официальной документации Skroutz для разработчиков, SkroutzBot обращается ровно к трём типам URL: адресу самого XML-фида, ссылкам на изображения товаров внутри этого фида (скачиваются все) и небольшой выборке страниц отдельных товаров — для ручной проверки качества данных. Если магазин не подключил XML-фид к Skroutz, у бота попросту нет причины идти на этот сайт.
Почему пометка «нежелательный» верна не всегда
Для интернет-магазина, который сам зарегистрировал товарный фид в Skroutz ради присутствия в сравнении цен, визиты SkroutzBot — это именно та функция, ради которой фид и подключали, а не паразитная нагрузка. Другое дело — сайт, не имеющий отношения к продаже физических товаров в Греции или Европе: там появление этой строки в логах — сигнал скорее проверить IP на соответствие официальным диапазонам, чем на реальный визит настоящего SkroutzBot. Правильная классификация зависит от контекста сайта, а не от одной строки UA.
Официальные IP-диапазоны для верификации
В отличие от большинства ботов из категории «прочие краулеры», у SkroutzBot есть открыто опубликованный список сетей — это редкость и веский повод сверяться именно с ним, а не только с UA.
| Тип | Диапазон |
| IPv4 | 185.6.76.0/22 |
| IPv4 | 3.73.204.153/32 |
| IPv4 | 3.72.204.195/32 |
| IPv4 | 3.67.183.221/32 |
| IPv4 | 63.34.193.172/32 |
| IPv4 | 54.195.53.34/32 |
| IPv4 | 108.129.50.199/32 |
| IPv6 | 2a03:e40::/32 |
Оператор также публикует эти диапазоны в машиночитаемом JSON — удобно для автоматической сверки в антибот-правилах, а не только для ручной проверки через whois. Диапазоны периодически могут обновляться, поэтому для постоянной автоматизированной защиты лучше опираться на актуальный JSON, а не хранить список статично.
Технические требования, о которых редко пишут
SkroutzBot принимает только HTTPS-соединения с полной цепочкой сертификата до корневого CA — самоподписанные или неполные цепочки бот не примет. Аутентификация (базовая HTTP-авторизация и любая другая) не поддерживается: если доступ к фиду нужно ограничить, правильный способ — список разрешённых IP, а не логин/пароль. Бот отправляет заголовок Accept-Encoding и умеет работать с gzip/zip, поэтому сервер не должен блокировать его только за то, что отдаёт фид в сжатом виде.
Нагрузка: чего ждать на практике
По собственному заявлению оператора, SkroutzBot поддерживает разумную частоту запросов, а поскольку его работа ограничена фидом, изображениями из него и выборкой карточек товара, а не сплошным обходом сайта, реальная нагрузка обычно ниже, чем у типичных поисковых или AI-краулеров. Официальная рекомендация для партнёров Skroutz — не применять к диапазонам бота rate-limit вообще, чтобы не мешать регулярному обновлению фида; при использовании внешних антибот-инструментов (включая CDN-защиту) IP-диапазоны SkroutzBot стоит явно занести в белый список.
Как найти SkroutzBot в логах
# Базовый поиск
grep -i "skroutzbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот (обычно это адрес фида и товарные страницы)
grep -i "skroutzbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA — сверяем с официальными диапазонами
grep -i "skroutzbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Распределение по времени суток
grep -i "skroutzbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Для верификации сравните IP запроса с официальными диапазонами напрямую, а не только по UA:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt: почему на него нельзя полагаться полностью
Сам оператор прямо предупреждает: SkroutzBot называется ботом, но не соответствует стандартному определению robotstxt.org. На практике это значит, что классическая директива в robots.txt — не гарантированный способ его остановить.
# Формальная директива (может быть недостаточной)
User-agent: skroutzbot
Disallow: /
# Компромисс для партнёров: не трогать фид и его ресурсы
User-agent: skroutzbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Allow: /feed/
Если нужно гарантированно ограничить доступ, надёжнее работать не через robots.txt, а через список IP на уровне сервера или TrafficVeil — благо диапазоны бота официально известны.
Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "skroutzbot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=skroutzbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "skroutzbot") {
limit_req zone=skroutzbot burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} skroutzbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil: найдите skroutzbot в списке ботов домена или в разделе /system/bots. Для реальных партнёров Skroutz — категория «легитимный» и внесение официальных IP-диапазонов в белый список без rate-limit; для сайтов без связи с площадкой — «запретить» по умолчанию, с точечным allow только при подтверждённой деловой необходимости. После изменения правила сверьте логи: хиты с IP вне официальных диапазонов Skroutz должны уходить в блок, а подтверждённый трафик — проходить свободно.
С кем можно перепутать SkroutzBot
| Бот | Оператор | Особенность |
| Skroutz ImageBot v1 | Skroutz S.A. | Отдельный агент того же оператора специально для скачивания изображений товаров — не «сосед», а часть той же инфраструктуры |
| Storebot-Google | Google (Merchant Center) | Аналог по назначению — проверяет посадочные страницы товаров для Google Shopping; тоже требует явного разрешения в robots.txt и работает только с зарегистрированными фидами |
| Спуфер под именем skroutzbot | Неизвестен | Любой скрипт может подделать UA; единственный надёжный признак — совпадение IP с официальными диапазонами Skroutz |
Что в итоге делать со SkroutzBot
| Ситуация | Действие |
| Сайт — партнёр Skroutz с зарегистрированным XML-фидом | Белый список по официальным IP-диапазонам, без rate-limit, HTTPS с корректной цепочкой сертификата |
| Сайт не связан с продажей товаров в Skroutz, но бот всё равно заходит | Сверить IP с официальным списком; при несовпадении — блокировать как спуфинг |
| IP совпадает с диапазонами, но нагрузка кажется избыточной | Обратиться в поддержку Skroutz, а не глушить рейт-лимитом — официально бот и так держит разумную частоту |
| Требуется полностью исключить участие в Skroutz | Отозвать фид на стороне Skroutz и точечно закрыть доступ по IP/UA как для нежелательного бота |
Не полагайтесь на одну лишь директиву в robots.txt как на способ остановить SkroutzBot — сам оператор предупреждает, что бот не следует стандарту в полной мере; для реального контроля нужна проверка по официальным IP-диапазонам.