Боты7 мин чтения·9 августа 2026 г.

DataForSeoBot просит не спешить с блокировкой — и вот почему это разумно

DataForSeoBot собирает данные для Backlinks API компании DataForSEO. Разбираем двусторонний эффект блокировки, официальную классификацию Cloudflare Radar и разницу с OnPage-краулером RSiteAuditor.

TVTrafficVeil TeamЭксперты по защите веб-трафика

DataForSeoBot (официально DataForSEO Link Bot) — backlink-краулер компании DataForSEO. Он обходит веб, чтобы находить и перепроверять ссылки для Backlinks API и ссылочной базы платформы. Это не Googlebot и не превью-бот соцсетей: блокировка не роняет выдачу Google/Yandex, но убирает или устаревает ваш сайт в данных DataForSEO и продуктах, построенных на их API. Главное уточнение: у DataForSEO есть как минимум два краулера. DataForSeoBot — link/backlinks bot с официальной страницей и подсетями. Отдельно OnPage API ходит с UA RSiteAuditor (клиент может его кастомизировать) и другим списком IP. Бан только DataForSeoBot не останавливает OnPage-аудит; и наоборот.

Что такое DataForSeoBot

Параметр Значение
User-Agent (токен) DataForSeoBot
Полная строка UA (официально) Mozilla/5.0 (compatible; DataForSeoBot/1.0; +https://dataforseo.com/dataforseo-bot)
Оператор DataForSEO
Тип (по документации) backlink checker bot, версия 1.0; официально классифицируется как «Good Bot»
Назначение Сбор и проверка ссылок для backlink-базы и Backlinks API
Официальная документация dataforseo.com/dataforseo-bot
Соблюдение robots.txt Да; поддерживает Crawl-delay и Disallow, парсит robots.txt перед обходом по RFC 9309
Crawl-delay по умолчанию ~5 сек между визитами (можно менять в robots.txt)
IPv4-подсети (официально) 136.243.220.208/29, 136.243.228.176/29, 136.243.228.192/29
IPv6-подсети (официально) 2a01:4f8:2b03:38b::2/64, 2a01:4f8:2b03:38c::2/64, 2a01:4f8:2b03:38d::2/64
Reverse DNS маска crawling-gateway-*.dataforseo.com
Использование для обучения ИИ Официально не заявлено — в отличие от многих других краулеров, документация DataForSEO не упоминает такое применение собранных данных
Влияние на SEO Google/Yandex Нет прямой связи

Почему оператор просит не спешить с блокировкой

Сама DataForSEO на официальной странице бота прямо обращается к вебмастерам: не торопитесь сразу идти в robots.txt блокировать их UA — бот относится к категории «хороших ботов» и полностью подчиняется настройкам, которые вы задаёте. Логика простая: тысячи владельцев сайтов используют Backlinks API для анализа своей же ссылочной массы, и обход, который вы видите в логах, обслуживает в том числе таких же вебмастеров, как вы сами.

DataForSeoBot vs OnPage (RSiteAuditor) и другие SEO-краулеры

Бот Оператор / продукт UA IP / verification
DataForSeoBot (Link Bot) DataForSEO Backlinks DataForSeoBot Подсети /29 + IPv6 выше; rDNS crawling-gateway-*.dataforseo.com
OnPage Crawler DataForSEO OnPage API по умолчанию Mozilla/5.0 (compatible; RSiteAuditor) (клиент может сменить) Отдельный список IP в docs OnPage (Hetzner/DO и др.: 94.130.93.30, 168.119.*, 68.183.*…)
Barkrowler Babbar Barkrowler JSON префиксов + rDNS *.babbar.eu
SERankingBacklinksBot SE Ranking SERankingBacklinksBot api.seranking.com/backlinks-bot-ips
AhrefsBot / SemrushBot Ahrefs / Semrush свои UA свои IP feeds

Практика: в логах ищите отдельно DataForSeoBot и RSiteAuditor. Паттерн энциклопедии TrafficVeil «dataforseo» может цеплять оба (и URL в UA) — перед баном смотрите полный User-Agent. Официальная терминология, которая помогает разобраться в разнице: Cloudflare Radar классифицирует DataForSeoBot как бота с «direct» access — он управляется напрямую оператором DataForSEO по единым правилам. А вот OnPage/RSiteAuditor относится к категории «intermediary» — конечный клиент API может влиять на его поведение через параметры запроса. Отсюда и главный нюанс OnPage: клиент API может выставить robots_txt_merge_mode: override и свой custom_robots_txt — тогда ваш robots.txt для OnPage-задачи не обязательно соблюдается. Для публичного Link Bot (DataForSeoBot) официально заявлены обычные правила robots.txt без такой возможности обхода.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Двусторонний компромисс при блокировке

Решение о запрете стоит взвешивать в обе стороны. Заблокировав DataForSeoBot, вы убираете свой сайт из собственного индекса DataForSEO — но одновременно **другие клиенты сервиса теряют возможность увидеть ссылки, ведущие на ваш сайт с чужих доменов**. Если для вашего бизнеса важно, чтобы партнёры или потенциальные клиенты могли через DataForSEO обнаружить, кто на вас ссылается (что часто работает как бесплатный сигнал доверия и охвата), блокировка лишает их этой возможности так же, как и вас.

Нагрузка на сервер

По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) паттерн dataforseo набрал порядка 1,1 млн запросов (март ~82 тыс., апрель ~438 тыс., май ~421 тыс., июнь ~190 тыс.). Это фоновый SEO-harvest под backlink-базу и/или OnPage-задачи клиентов API — без конверсий на сайте. Официально у Link Bot ~5 сек между визитами; на слабом origin плюс параллельные клиентские OnPage-краулы картина в логах может быть заметно плотнее. Свежесть: перед жёстким баном сверьте июль–август в аналитике TrafficVeil.

Обнаружение в логах и верификация

# Link Bot
grep -i "DataForSeoBot" /var/log/nginx/access.log

# Отделить от OnPage
grep -iE "DataForSeoBot|RSiteAuditor|dataforseo" /var/log/nginx/access.log | \
  sed -n 's/.*"\([^"]*\)".*/\1/p' | sort | uniq -c | sort -rn

# Топ URL и IP
grep -i "DataForSeoBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
grep -i "DataForSeoBot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# rDNS (ожидаемая маска)
host 136.243.228.176
# → crawling-gateway-136-243-228-176.dataforseo.com
# IPv4
136.243.220.208/29
136.243.228.176/29
136.243.228.192/29

# IPv6
2a01:4f8:2b03:38b::2/64
2a01:4f8:2b03:38c::2/64
2a01:4f8:2b03:38d::2/64

Надёжная схема для Link Bot: UA содержит DataForSeoBot + IP в официальных подсетях или rDNS вида crawling-gateway-*.dataforseo.com. Одного UA недостаточно (спуфинг). Для OnPage сверяйте список IP из OnPage overview и UA RSiteAuditor (если клиент его не переопределил). На странице бота DataForSEO есть форма «force-reload robots.txt» — имеет смысл воспользоваться после смены правил, если видите старое поведение краула.

robots.txt

# Замедлить (официальный пример — 5)
User-agent: DataForSeoBot
Crawl-delay: 5

# Закрыть служебное / страницу
User-agent: DataForSeoBot
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Disallow: /example-page
Allow: /

# Полный запрет Link Bot
User-agent: DataForSeoBot
Disallow: /

# OnPage по умолчанию смотрит на RSiteAuditor (если UA не кастомизирован)
User-agent: RSiteAuditor
Disallow: /

Отдельные секции для каждого бота. Не режьте User-agent: * / Disallow: /, думая, что «отрежете только DataForSEO». Помните про OnPage override: robots.txt на origin не всегда последний аргумент для клиентских аудитов — тогда нужен deny на сервере/TrafficVeil по UA/IP.

Управление на уровне сервера

Nginx

# Link Bot
if ($http_user_agent ~* "DataForSeoBot") {
    return 403;
}

# OnPage (если тоже не нужен)
if ($http_user_agent ~* "RSiteAuditor") {
    return 403;
}

# Мягкий вариант для Link Bot
limit_req_zone $binary_remote_addr zone=dfsbot:10m rate=6r/m;
location / {
    if ($http_user_agent ~* "DataForSeoBot") {
        limit_req zone=dfsbot burst=12 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} DataForSeoBot [NC]
RewriteRule ^ - [F,L]

RewriteCond %{HTTP_USER_AGENT} RSiteAuditor [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите dataforseo / DataForSeoBot в ботах домена или /system/bots
  • При нагрузке без пользы от Backlinks API — запретить или rate-limit; на Google/Yandex не влияет
  • Если у вас (или агентства) идут OnPage-задачи DataForSEO по вашему сайту — не режьте RSiteAuditor / OnPage IP вслепую
  • Верификация Link Bot: подсети + rDNS crawling-gateway-*.dataforseo.com

Рекомендации

  • Нужна видимость в Backlinks API / кабинетах на DataForSEO — Allow DataForSeoBot, при нагрузке добавьте Crawl-delay
  • Пользы нет, нагрузка мешает — Disallow + 403 / deny в TrafficVeil
  • Взвесьте двусторонний эффект: блокировка убирает и вашу видимость входящих ссылок для других пользователей DataForSEO, а не только исходящих данных о вас
  • Разделяйте Link Bot и OnPage — разные UA и разные IP
  • OnPage может обойти robots.txt через параметры API клиента — для гарантии дублируйте deny на WAF/TrafficVeil
  • Не путайте с Googlebot — блок DataForSeoBot не влияет на классический поиск
  • Обновляйте списки IP по официальным страницам DataForSEO (подсети Link Bot и список OnPage живут раздельно)

С кем не путать

Бот / сигнал Почему путают Чем отличается
RSiteAuditor (OnPage) Тот же вендор DataForSEO Аудит по запросу клиента API; другой UA и IP; относится к «intermediary» access
Barkrowler / AhrefsBot / SemrushBot Тоже SEO / links Другие операторы и verification
Googlebot «Краулер = поиск» Поисковый индекс; нельзя резать «заодно»
Поддельный UA DataForSeoBot Легко спуфить строку Нет rDNS crawling-gateway / IP вне подсетей

Сводная стратегия

Цель Действие
Оставить в backlink-базе, снизить нагрузку Crawl-delay или rate-limit для DataForSeoBot
Убрать Link Bot, оставить OnPage-аудиты Disallow/403 DataForSeoBot; Allow RSiteAuditor + OnPage IP
Убрать оба контура DataForSEO Deny DataForSeoBot + RSiteAuditor (+ их IP)
Подозрение на spoofing UA + подсеть / rDNS crawling-gateway-*.dataforseo.com

Частые вопросы

Почему сама DataForSEO просит не блокировать своего бота сразу?
Потому что классифицирует его как «Good Bot», полностью подчиняющийся настройкам сайта, и объясняет, что обход помогает тысячам таких же вебмастеров анализировать свою ссылочную массу.
Что теряет сайт, если заблокировать DataForSeoBot?
Не только собственную видимость в индексе DataForSEO, но и возможность других пользователей сервиса увидеть ссылки, ведущие на этот сайт с чужих доменов.
В чём разница между «direct» и «intermediary» доступом у ботов DataForSEO?
DataForSeoBot управляется напрямую оператором по единым правилам («direct»), а OnPage-краулер RSiteAuditor настраивается конечными клиентами API через параметры запроса («intermediary»).
Может ли клиент API обойти robots.txt сайта через OnPage-краулер?
Да, если клиент задаст параметр robots_txt_merge_mode: override и свой custom_robots_txt — тогда правила сайта для OnPage-задачи не обязательно применяются.
Как достоверно проверить, что запрос действительно от DataForSeoBot, а не подделка?
По связке UA плюс официальные подсети IPv4/IPv6 или reverse DNS вида crawling-gateway-*.dataforseo.com.
Использует ли DataForSEO собранные данные для обучения ИИ-моделей?
Официально это нигде не заявлено — в отличие от многих других краулеров, документация DataForSEO не упоминает такое применение.
#DataForSeoBot#DataForSEO#Backlinks API#RSiteAuditor#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil