Боты7 мин чтения·10 августа 2026 г.

Sogou web spider: что это за бот и нужно ли его блокировать

Sogou web spider — поисковый робот китайской системы Sogou. Разбираемся, зачем он сканирует сайт, как проверить настоящий SogouBot по логам и DNS, какую нагрузку он создаёт и когда выбирать Allow, Rate Limit или Block.

TVTrafficVeil TeamЭксперты по защите веб-трафика

Sogou web spider — официальный поисковый краулер Sogou (搜狗), китайской поисковой системы, входящей в экосистему Tencent. Робот обходит публичные страницы сайтов, обнаруживает URL, обновляет сведения о ранее найденных документах и формирует индекс, используемый поиском Sogou.

Для владельца сайта его ценность зависит прежде всего от аудитории. Если проект ориентирован на пользователей в Китае и рассчитывает на видимость в Sogou, блокировать подтверждённого Sogou spider обычно не следует. Если китайский поиск для проекта не имеет значения, обход может оказаться дополнительной нагрузкой без заметной бизнес-пользы.

Параметр Значение
Название Sogou web spider
Оператор Sogou / экосистема Tencent
Категория Поисковые роботы
User-Agent Sogou web spider
Связанный официальный UA Sogou inst spider
Назначение Обход и индексирование веб-страниц для поиска Sogou
robots.txt Поддерживается по официальной документации Sogou
Влияние на SEO Имеет значение для видимости в Sogou; прямого влияния на Google или Яндекс нет
Рекомендация TrafficVeil Allow для проектов с CN/Sogou-аудиторией; Monitor, Rate Limit или Block — если такой трафик не нужен

Какие User-Agent использует Sogou

В актуальной справке Sogou указаны два основных идентификатора поискового робота:

  • Sogou web spider;
  • Sogou inst spider.

В реальных логах широко встречается версия Sogou web spider/4.0. Исторические строки User-Agent также могли содержать ссылку на старую документацию Sogou.

Для TrafficVeil разумно хранить семейство Sogou отдельно от одного точного UA. При этом слишком широкий поиск только по подстроке sogou увеличивает вероятность ложных совпадений, поэтому итоговая идентификация должна учитывать дополнительные признаки.

Зачем Sogou web spider приходит на сайт

Главная задача Sogou spider — поддерживать поисковый индекс. Робот обнаруживает страницы, получает их содержимое и периодически возвращается к уже известным URL, чтобы проверить изменения.

Официальная документация Sogou отмечает, что частота повторного обхода зависит от важности страницы и истории её изменений. Уже проиндексированная страница не обязательно скачивается снова при каждом визите робота.

Sogou также указывает факторы, которые помогают роботу работать с сайтом:

  • качественный и уникальный контент;
  • не слишком глубокая структура ссылок;
  • разумное количество параметров в динамических URL;
  • умеренная длина URL;
  • минимум лишних перенаправлений.

Кому нужен трафик Sogou

Для русскоязычного или европейского проекта Sogou обычно значительно менее важен, чем Google или Яндекс. Но это не делает робота вредоносным.

Разрешать Sogou особенно логично, если:

  • сайт имеет китайскую версию;
  • есть пользователи или клиенты из Китая;
  • компания развивает SEO под китайские поисковые системы;
  • страницы должны обнаруживаться через Sogou;
  • Китай является значимым рынком проекта.

Если ни одной из этих задач нет, владелец сайта может решить, что дополнительный crawl traffic не приносит достаточной пользы.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Sogou, Baidu, Google и Яндекс: в чём разница

Краулер Поисковая система Основная ценность Типичная стратегия
Sogou web spider Sogou Китайская аудитория Sogou Allow при стратегии под Sogou
Baiduspider Baidu Китайский поиск Allow при стратегии под Baidu
Googlebot Google Глобальный поиск Google Обычно Allow
YandexBot Яндекс Поиск Яндекса Обычно Allow для проектов с соответствующей аудиторией

Блокировка Sogou сама по себе не означает блокировку Googlebot, YandexBot или Baiduspider. Главное — использовать отдельное правило, а не запрещать всех роботов через User-agent: *.

Какую нагрузку создаёт Sogou spider

Поисковый робот способен создать заметное число HTTP-запросов, особенно на крупных сайтах с большим количеством страниц, фильтров, пагинации и автоматически генерируемых URL.

В официальной справке Sogou говорится, что для одного IP-адреса серверного хоста spider устанавливает одно соединение, а интервалы обхода контролируются на уровне нескольких секунд. Если робот начинает непрерывно находить новые URL, Sogou рекомендует проверить, не генерирует ли сайт новые ссылки при каждом обращении.

Для оценки реальной нагрузки смотрите не только количество запросов, но и:

  • RPS и RPM;
  • число уникальных URL;
  • объём переданного трафика;
  • долю cache HIT/MISS;
  • нагрузку на origin;
  • количество 404 и других ошибочных ответов;
  • обход параметрических и бесконечно генерируемых URL.

Как найти Sogou в access.log

Базовый поиск:

grep -i "Sogou web spider" /var/log/nginx/access.log

Если требуется увидеть разные варианты семейства:

grep -iE "Sogou (web|inst) spider" /var/log/nginx/access.log

Топ URL:

grep -i "Sogou web spider" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -30

Топ IP:

grep -i "Sogou web spider" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head -30

Коды ответа:

grep -i "Sogou web spider" /var/log/nginx/access.log | awk '{print $9}' | sort | uniq -c | sort -rn

Почему одного User-Agent недостаточно

Строку Sogou web spider/4.0 способен отправить любой HTTP-клиент. Поэтому TrafficVeil не должен автоматически присваивать запросу статус доверенного поискового робота только из-за совпадения UA.

Для верификации полезно сопоставлять:

  1. User-Agent;
  2. IP и ASN;
  3. reverse DNS;
  4. повторное прямое DNS-разрешение найденного hostname;
  5. характер запрашиваемых URL;
  6. частоту и последовательность обхода;
  7. TLS/HTTP fingerprint и историю источника.

В наблюдаемом трафике Sogou встречаются PTR-имена формата sogouspider-...crawl.sogou.com. Такой rDNS является полезным сигналом, но для безопасной проверки одного reverse lookup недостаточно.

Как правильно проверить reverse DNS

Сначала получите PTR для IP:

host 123.125.109.138

Если результат указывает на ожидаемый домен Sogou, выполните forward lookup полученного имени:

host sogouspider-123-125-109-138.crawl.sogou.com

Полученный IP должен совпасть с исходным адресом. Такая forward-confirmed reverse DNS проверка снижает риск доверия поддельной PTR-записи.

При этом TrafficVeil лучше не превращать конкретный hostname-шаблон в единственный критерий: инфраструктура поисковой системы может меняться.

robots.txt для Sogou web spider

Sogou официально заявляет поддержку robots.txt. Чтобы полностью запретить обход:

User-agent: Sogou web spider
Disallow: /

Если Sogou нужен, но определённые зоны индексировать не следует:

User-agent: Sogou web spider
Disallow: /admin/
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Disallow: /search/

После изменения robots.txt результат может проявиться не сразу. В справке Sogou предупреждается, что обновлённые правила иногда начинают полностью учитываться только через несколько недель.

Почему запрет в robots.txt не сразу удаляет страницу из Sogou

Остановка crawling и удаление документа из поискового индекса — разные процессы. Если страница уже была известна Sogou, запись о ней может оставаться в поисковой базе после того, как spider прекратил её скачивать.

Sogou предупреждает, что обновление индексной базы занимает время и ранее созданная информация о странице может исчезать значительно дольше, чем прекращается сам обход.

Нужно ли использовать Crawl-delay

В старых рекомендациях по Sogou часто встречается Crawl-delay. Однако в актуальной официальной справке Sogou основной совет при чрезмерном обходе — проверить генерацию URL и при необходимости обратиться в Sogou с фрагментами access.log.

Поэтому TrafficVeil не стоит обещать владельцу сайта, что Crawl-delay гарантированно ограничит современный Sogou spider. Если требуется технически гарантировать частоту запросов, надёжнее использовать rate limiting на reverse proxy или WAF.

Блокировка Sogou на Nginx

if ($http_user_agent ~* "Sogou (web|inst) spider") {
    return 403;
}

Блокировка Sogou через Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} "Sogou (web|inst) spider" [NC]
RewriteRule ^ - [F,L]

Такие правила блокируют по заявленному User-Agent. Они удобны для простой политики доступа, но не являются способом доказать личность робота.

Как обрабатывать Sogou в TrafficVeil

В TrafficVeil Sogou web spider логично относить к категории «Поисковые роботы» со статусом легитимный при подтверждённой идентификации.

В карточке бота полезно показывать:

  • User-Agent и обнаруженный вариант Sogou spider;
  • IP и ASN;
  • организацию сети;
  • результат rDNS/FCRDNS-проверки;
  • число запросов;
  • RPS/RPM;
  • топ URL;
  • объём трафика;
  • процент 2xx, 3xx, 4xx и 5xx;
  • рекомендацию Allow, Rate Limit или Block.

Если сайт ориентирован на китайский рынок, подтверждённого Sogou spider разумно разрешать. Если Sogou не приносит проекту поисковой ценности, владелец сайта может отключить его без прямого влияния на индексирование Google или Яндекса.

Как распознать поддельный SogouBot

Признак Ожидаемый поисковый crawler Подозрительный клиент
UA Известный Sogou spider UA только имитирует название
DNS Инфраструктура согласуется с Sogou Несвязанный PTR/ASN
URL Публичные индексируемые страницы /.env, backups, админки, exploit paths
Поведение Последовательный поисковый обход Перебор уязвимостей или хаотичный scraping
Частота Контролируемый crawl Аномальные всплески

Если запрос представляется Sogou, но одновременно перебирает конфигурационные файлы, резервные копии или известные уязвимые endpoint, TrafficVeil должен классифицировать его по реальному поведению, а не доверять названию поисковой системы.

Allow, Rate Limit или Block: итоговая стратегия

Ситуация Рекомендация
Сайт ориентирован на китайскую аудиторию и Sogou Allow
Sogou нужен, но создаёт заметную нагрузку Rate Limit с осторожностью и анализ crawl-паттерна
Китайская поисковая аудитория проекту не нужна Disallow или Block по решению владельца
Нужно закрыть отдельные технические разделы Ограничить конкретные пути
UA не проходит проверку происхождения Не присваивать доверенный статус
Под видом Sogou идёт vulnerability scanning Block по фактическому поведению

Итог

Sogou web spider — легитимный поисковый краулер Sogou. Его присутствие в access.log само по себе не является атакой или признаком вредоносной активности. Он нужен для обнаружения и обновления страниц в поисковой системе Sogou.

Для сайтов с китайской аудиторией такой бот может быть полезен и его следует рассматривать как обычного поискового робота. Для проектов, которым Sogou не приносит трафик и не входит в SEO-стратегию, обход можно ограничить, особенно если он создаёт измеримую нагрузку.

Главное для антибот-системы — отделять заявленный User-Agent от подтверждённой идентичности. TrafficVeil должен учитывать UA, IP, ASN, DNS, fingerprint и фактический характер обхода. Тогда настоящий Sogou spider останется поисковым роботом, а клиент, который только притворяется им, не получит автоматического доверия.

Частые вопросы

Что такое Sogou web spider?
Sogou web spider — официальный поисковый робот Sogou. Он обходит веб-страницы и используется для формирования и обновления поискового индекса. В актуальной документации Sogou также указан Sogou inst spider.
Нужно ли блокировать Sogou web spider?
Зависит от аудитории сайта. Для проекта, которому важна видимость в Sogou и китайском поиске, подтверждённого робота лучше разрешить. Если Sogou не входит в SEO-стратегию и создаёт ненужную нагрузку, его можно ограничить. Блокировка отдельного Sogou spider сама по себе не блокирует Googlebot или YandexBot.
Какой User-Agent использует Sogou?
Sogou официально указывает Sogou web spider и Sogou inst spider. В логах также распространён вариант Sogou web spider/4.0. Поэтому TrafficVeil лучше распознавать семейство Sogou, а не полагаться на одну строго заданную полную строку UA.
Соблюдает ли Sogou robots.txt?
Sogou официально заявляет поддержку robots.txt. При этом изменения могут вступать в силу не сразу — справка предупреждает, что обновлённому robots.txt иногда требуется несколько недель, чтобы полностью повлиять на обход.
Почему страница остаётся в Sogou после запрета через robots.txt?
Прекращение crawling и удаление уже известной страницы из поисковой базы — разные процессы. Sogou объясняет, что после остановки обхода ранее созданная индексная информация может сохраняться ещё некоторое время; её удаление из базы способно занять месяцы.
Как отличить настоящий Sogou spider от подделки?
Одного User-Agent недостаточно. Нужно проверить IP, ASN, reverse DNS, выполнить обратное разрешение hostname в IP и сопоставить результат с исходным адресом. У наблюдаемых Sogou crawler встречаются PTR вида sogouspider-...crawl.sogou.com. Дополнительно TrafficVeil стоит анализировать fingerprint и поведение: настоящий поисковик должен обходить публичный контент, а не перебирать .env, backup-файлы и уязвимые административные URL.
#Прочие краулеры и сервисы#sogou
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil