Боты7 мин чтения·10 августа 2026 г.

SerpstatBot строит базу из 952 миллиардов ссылок — вот зачем

Постоянная работа этого краулера собрала одну из крупнейших ссылочных баз в SEO-индустрии — 168 миллионов доменов и ежедневный прирост в 2 миллиарда ссылок. Разбираем, почему 403 на robots.txt не блокирует бота, а наоборот.

TVTrafficVeil TeamЭксперты по защите веб-трафика

SerpstatBot (в документации чаще serpstatbot) — SEO-краулер платформы Serpstat для модуля анализа ссылок. Он постоянно обходит веб, чтобы добавлять и перепроверять ссылки в backlink-индексе Serpstat. Это не Googlebot и не превью-бот соцсетей: блокировка не роняет выдачу Google/Yandex, но убирает или устаревает ваш сайт в данных Serpstat. Уточнение: в некоторых справочниках бота описывают как «запускается только при аудите пользователя». По официальному FAQ это постоянный краулер ссылочного индекса, а не разовый Site Audit по кнопке. Не путайте с одноразовыми SEO-чекерами.

Масштаб базы, которую строит этот бот

По официальным данным Serpstat, непрерывная работа бота позволила собрать одну из крупнейших ссылочных баз в нише SEO-инструментов: 952 миллиарда ссылок по 168 миллионам доменов, с ежедневным приростом ещё на 2 миллиарда новых ссылок. На основе этой базы можно как контролировать собственный ссылочный профиль, так и изучать стратегии линкбилдинга конкурентов — отсюда и постоянный, не разовый характер обхода.

Что такое SerpstatBot / serpstatbot

Параметр Значение
User-Agent (токен в robots.txt) serpstatbot
Типичные полные UA serpstatbot/2.1 (advanced backlink tracking bot; https://serpstatbot.com/; abuse@serpstatbot.com) (встречаются также 2.0 / 1.0)
Оператор Serpstat (Serpstat Global LTD)
Назначение Пополнение и мониторинг backlink-индекса / Link Analysis
Официальная документация serpstatbot.com, serpstat.com/bot, FAQ на serpstat.com
Соблюдение robots.txt Заявлено да; Crawl-delay до 20 сек (больше режется до 20)
Список IP Публичный plaintext: serpstatbot.com/serpstatbot-ip.txt (~80 IPv4 на момент проверки). Параллельно в FAQ пишут, что «фиксированного набора» нет — список нужно обновлять
Доп. верификация По запросу на abuse@serpstatbot.com / serpstatbot@serpstatbot.com — персональный идентификатор в заголовке CRAWLER-IDENT или в UA (только для вашего домена)
nofollow / 301 / 404 nofollow — всё равно ходит; 301/404 перепроверяет (исторические данные)
Влияние на SEO Google/Yandex Нет прямой связи
Бот Оператор Задача IP / verification
serpstatbot Serpstat Backlink index serpstatbot-ip.txt + опционально CRAWLER-IDENT
DataForSeoBot DataForSEO Backlinks API Официальные /29 + rDNS crawling-gateway-*.dataforseo.com
Barkrowler Babbar Web-graph / SEO metrics JSON префиксов + rDNS *.babbar.eu
SERankingBacklinksBot SE Ranking Backlinks api.seranking.com/backlinks-bot-ips
AhrefsBot / SemrushBot Ahrefs / Semrush SEO / backlinks Свои IP feeds

Практика: бан Serpstat не останавливает Ahrefs/Semrush/DataForSEO. Настраивайте по UA serpstatbot (и при желании по IP-листу), не «всех SEO разом».

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка на сервер

По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) паттерн serpstat набрал порядка 1,1 млн запросов (март ~41 тыс., апрель ~99 тыс., май ~886 тыс., июнь ~88 тыс.). Майский всплеск типичен для SEO-harvest. Официально: сайт может сканироваться несколькими экземплярами serpstatbot одновременно — один Crawl-delay не превращает обход в строго последовательный. Плюс повторные заходы на 301/404. Свежесть: перед жёстким баном сверьте июль–август в аналитике TrafficVeil.

Обнаружение в логах и верификация

# Токен UA (регистр разный)
grep -i "serpstatbot" /var/log/nginx/access.log

# URL / contact из UA
grep -i "serpstatbot.com" /var/log/nginx/access.log

# Топ URL и IP
grep -i "serpstatbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
grep -i "serpstatbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Персональный идентификатор (если заказывали)
grep -i "CRAWLER-IDENT" /var/log/nginx/access.log

Список IP

curl -s https://serpstatbot.com/serpstatbot-ip.txt

Примеры адресов из файла (список меняется): 136.243.144.81, 138.201.194.13, 94.130.10.218 … Не хардкодьте навсегда — обновляйте по cron. Надёжная схема: UA содержит serpstatbot + IP есть в актуальном serpstatbot-ip.txt. Одного UA недостаточно (spoofing). Если IP вне списка, а нагрузка похожа на краулер — запросите доменный CRAWLER-IDENT у Serpstat или режьте по UA на сервере. Контакты по инцидентам / несоблюдению robots: abuse@serpstatbot.com, serpstatbot@serpstatbot.com (в логах приложите URL и строки access.log).

robots.txt — критичные нюансы

# Замедлить (макс. учитывается 20)
User-agent: serpstatbot
Crawl-delay: 10

# Закрыть служебное
User-agent: serpstatbot
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /

# Полный запрет
User-agent: serpstatbot
Disallow: /

robots.txt должен быть доступен боту (лучше HTTP 200). Если файл недоступен, бот по умолчанию краулит сайт. По детальному FAQ / serpstatbot.com: ошибка получения robots.txt вроде 403 Forbidden трактуется как отсутствие запретов — бот идёт по доступным страницам. Не «закрывайте» robots.txt 403, думая, что запретили краулера. Редирект robots.txt только в пределах того же домена; off-site redirect бот не следует. Поддержка простых wildcards * в Disallow (Yahoo-style); более длинный Allow побеждает Disallow. Crawl-delay для User-agent: * тоже учитывается; если видят Crawl-delay у других ботов — могут сами замедлиться. nofollow не останавливает переход: закрывайте цель через Disallow, если не хотите визитов.

Управление на уровне сервера

Nginx

if ($http_user_agent ~* "serpstatbot") {
    return 403;
}

# Мягкий вариант
limit_req_zone $binary_remote_addr zone=serpstat:10m rate=6r/m;
location / {
    if ($http_user_agent ~* "serpstatbot") {
        limit_req zone=serpstat burst=12 nodelay;
    }
}

При allowlist сверяйте IP с serpstatbot-ip.txt (список обновляйте). Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} serpstatbot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите serpstat / SerpstatBot в ботах домена или /system/bots
  • При нагрузке без пользы от Serpstat — запретить или rate-limit; на Google/Yandex не влияет
  • Убедитесь, что robots.txt отдаётся 200 (иначе Disallow может не сработать по их правилам)
  • Для строгой верификации — IP-лист + опциональный CRAWLER-IDENT

Рекомендации

  • Нужна видимость в Serpstat Link Analysis — Allow + Crawl-delay (до 20); помните про параллельные инстансы
  • Пользы нет — Disallow + 403 / deny в TrafficVeil (и не отдавайте robots.txt 403)
  • Много хитов на 404/редиректы — ожидаемо по FAQ; чините цепочки и мёртвые URL, не только баньте
  • Подозрение на spoofing — сверяйте IP-лист / заказывайте CRAWLER-IDENT
  • Не режьте Googlebot «заодно» широким User-agent: * / Disallow: /

С кем не путать

Бот / сигнал Почему путают Чем отличается
DataForSeoBot / Barkrowler / AhrefsBot Тоже backlinks SEO Другие операторы и IP feeds
Разовый Site Audit / checker Название «Serpstat» serpstatbot — постоянный индексный краулер
Googlebot «Краулер = поиск» Поисковый индекс; нельзя резать «заодно»
Поддельный UA serpstatbot Легко спуфить IP вне serpstatbot-ip.txt, нет вашего CRAWLER-IDENT

Сводная стратегия

Цель Действие
Оставить в индексе Serpstat, снизить нагрузку Crawl-delay (≤20) + rate-limit; robots.txt = 200
Полностью убрать краулинг Disallow + 403/deny по UA (+ IP из txt)
Подозрение на spoofing UA + IP-лист; опционально CRAWLER-IDENT
Disallow «не работает» Проверить доступность robots.txt (не 403), same-domain redirect, логи по доменам

Частые вопросы

Насколько велика ссылочная база, которую строит SerpstatBot?
По официальным данным Serpstat, это 952 миллиарда ссылок по 168 миллионам доменов с ежедневным приростом ещё на 2 миллиарда новых ссылок.
Что произойдёт, если robots.txt отдаёт код 403 вместо 200?
Бот трактует это как отсутствие каких-либо запретов и продолжает краулинг по доступным страницам — то есть 403 не блокирует, а фактически открывает доступ.
Может ли сайт сканироваться несколькими экземплярами serpstatbot одновременно?
Да, официально это подтверждено — один настроенный Crawl-delay не превращает обход в строго последовательный процесс.
Какое максимальное значение Crawl-delay учитывает бот?
20 секунд — более высокие значения автоматически урезаются до этого лимита.
Следует ли бот директиве nofollow на ссылках?
Нет, serpstatbot всё равно переходит по таким ссылкам ради полноты сбора данных — если не хотите визитов, нужно закрывать цель через Disallow.
Как получить персональную верификацию для своего домена?
Запросить идентификатор CRAWLER-IDENT напрямую у Serpstat через abuse@serpstatbot.com или serpstatbot@serpstatbot.com.
#SerpstatBot#Serpstat#backlink-индекс#SEO-краулеры#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil