Sogou web spider — официальный поисковый краулер Sogou (搜狗), китайской поисковой системы, входящей в экосистему Tencent. Робот обходит публичные страницы сайтов, обнаруживает URL, обновляет сведения о ранее найденных документах и формирует индекс, используемый поиском Sogou.
Для владельца сайта его ценность зависит прежде всего от аудитории. Если проект ориентирован на пользователей в Китае и рассчитывает на видимость в Sogou, блокировать подтверждённого Sogou spider обычно не следует. Если китайский поиск для проекта не имеет значения, обход может оказаться дополнительной нагрузкой без заметной бизнес-пользы.
| Параметр | Значение |
|---|---|
| Название | Sogou web spider |
| Оператор | Sogou / экосистема Tencent |
| Категория | Поисковые роботы |
| User-Agent | Sogou web spider |
| Связанный официальный UA | Sogou inst spider |
| Назначение | Обход и индексирование веб-страниц для поиска Sogou |
| robots.txt | Поддерживается по официальной документации Sogou |
| Влияние на SEO | Имеет значение для видимости в Sogou; прямого влияния на Google или Яндекс нет |
| Рекомендация TrafficVeil | Allow для проектов с CN/Sogou-аудиторией; Monitor, Rate Limit или Block — если такой трафик не нужен |
Какие User-Agent использует Sogou
В актуальной справке Sogou указаны два основных идентификатора поискового робота:
Sogou web spider;Sogou inst spider.
В реальных логах широко встречается версия Sogou web spider/4.0. Исторические строки User-Agent также могли содержать ссылку на старую документацию Sogou.
Для TrafficVeil разумно хранить семейство Sogou отдельно от одного точного UA. При этом слишком широкий поиск только по подстроке sogou увеличивает вероятность ложных совпадений, поэтому итоговая идентификация должна учитывать дополнительные признаки.
Зачем Sogou web spider приходит на сайт
Главная задача Sogou spider — поддерживать поисковый индекс. Робот обнаруживает страницы, получает их содержимое и периодически возвращается к уже известным URL, чтобы проверить изменения.
Официальная документация Sogou отмечает, что частота повторного обхода зависит от важности страницы и истории её изменений. Уже проиндексированная страница не обязательно скачивается снова при каждом визите робота.
Sogou также указывает факторы, которые помогают роботу работать с сайтом:
- качественный и уникальный контент;
- не слишком глубокая структура ссылок;
- разумное количество параметров в динамических URL;
- умеренная длина URL;
- минимум лишних перенаправлений.
Кому нужен трафик Sogou
Для русскоязычного или европейского проекта Sogou обычно значительно менее важен, чем Google или Яндекс. Но это не делает робота вредоносным.
Разрешать Sogou особенно логично, если:
- сайт имеет китайскую версию;
- есть пользователи или клиенты из Китая;
- компания развивает SEO под китайские поисковые системы;
- страницы должны обнаруживаться через Sogou;
- Китай является значимым рынком проекта.
Если ни одной из этих задач нет, владелец сайта может решить, что дополнительный crawl traffic не приносит достаточной пользы.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Sogou, Baidu, Google и Яндекс: в чём разница
| Краулер | Поисковая система | Основная ценность | Типичная стратегия |
|---|---|---|---|
| Sogou web spider | Sogou | Китайская аудитория Sogou | Allow при стратегии под Sogou |
| Baiduspider | Baidu | Китайский поиск | Allow при стратегии под Baidu |
| Googlebot | Глобальный поиск Google | Обычно Allow | |
| YandexBot | Яндекс | Поиск Яндекса | Обычно Allow для проектов с соответствующей аудиторией |
Блокировка Sogou сама по себе не означает блокировку Googlebot, YandexBot или Baiduspider. Главное — использовать отдельное правило, а не запрещать всех роботов через User-agent: *.
Какую нагрузку создаёт Sogou spider
Поисковый робот способен создать заметное число HTTP-запросов, особенно на крупных сайтах с большим количеством страниц, фильтров, пагинации и автоматически генерируемых URL.
В официальной справке Sogou говорится, что для одного IP-адреса серверного хоста spider устанавливает одно соединение, а интервалы обхода контролируются на уровне нескольких секунд. Если робот начинает непрерывно находить новые URL, Sogou рекомендует проверить, не генерирует ли сайт новые ссылки при каждом обращении.
Для оценки реальной нагрузки смотрите не только количество запросов, но и:
- RPS и RPM;
- число уникальных URL;
- объём переданного трафика;
- долю cache HIT/MISS;
- нагрузку на origin;
- количество 404 и других ошибочных ответов;
- обход параметрических и бесконечно генерируемых URL.
Как найти Sogou в access.log
Базовый поиск:
grep -i "Sogou web spider" /var/log/nginx/access.log
Если требуется увидеть разные варианты семейства:
grep -iE "Sogou (web|inst) spider" /var/log/nginx/access.log
Топ URL:
grep -i "Sogou web spider" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -30
Топ IP:
grep -i "Sogou web spider" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head -30
Коды ответа:
grep -i "Sogou web spider" /var/log/nginx/access.log | awk '{print $9}' | sort | uniq -c | sort -rn
Почему одного User-Agent недостаточно
Строку Sogou web spider/4.0 способен отправить любой HTTP-клиент. Поэтому TrafficVeil не должен автоматически присваивать запросу статус доверенного поискового робота только из-за совпадения UA.
Для верификации полезно сопоставлять:
- User-Agent;
- IP и ASN;
- reverse DNS;
- повторное прямое DNS-разрешение найденного hostname;
- характер запрашиваемых URL;
- частоту и последовательность обхода;
- TLS/HTTP fingerprint и историю источника.
В наблюдаемом трафике Sogou встречаются PTR-имена формата sogouspider-...crawl.sogou.com. Такой rDNS является полезным сигналом, но для безопасной проверки одного reverse lookup недостаточно.
Как правильно проверить reverse DNS
Сначала получите PTR для IP:
host 123.125.109.138
Если результат указывает на ожидаемый домен Sogou, выполните forward lookup полученного имени:
host sogouspider-123-125-109-138.crawl.sogou.com
Полученный IP должен совпасть с исходным адресом. Такая forward-confirmed reverse DNS проверка снижает риск доверия поддельной PTR-записи.
При этом TrafficVeil лучше не превращать конкретный hostname-шаблон в единственный критерий: инфраструктура поисковой системы может меняться.
robots.txt для Sogou web spider
Sogou официально заявляет поддержку robots.txt. Чтобы полностью запретить обход:
User-agent: Sogou web spider
Disallow: /
Если Sogou нужен, но определённые зоны индексировать не следует:
User-agent: Sogou web spider
Disallow: /admin/
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Disallow: /search/
После изменения robots.txt результат может проявиться не сразу. В справке Sogou предупреждается, что обновлённые правила иногда начинают полностью учитываться только через несколько недель.
Почему запрет в robots.txt не сразу удаляет страницу из Sogou
Остановка crawling и удаление документа из поискового индекса — разные процессы. Если страница уже была известна Sogou, запись о ней может оставаться в поисковой базе после того, как spider прекратил её скачивать.
Sogou предупреждает, что обновление индексной базы занимает время и ранее созданная информация о странице может исчезать значительно дольше, чем прекращается сам обход.
Нужно ли использовать Crawl-delay
В старых рекомендациях по Sogou часто встречается Crawl-delay. Однако в актуальной официальной справке Sogou основной совет при чрезмерном обходе — проверить генерацию URL и при необходимости обратиться в Sogou с фрагментами access.log.
Поэтому TrafficVeil не стоит обещать владельцу сайта, что Crawl-delay гарантированно ограничит современный Sogou spider. Если требуется технически гарантировать частоту запросов, надёжнее использовать rate limiting на reverse proxy или WAF.
Блокировка Sogou на Nginx
if ($http_user_agent ~* "Sogou (web|inst) spider") {
return 403;
}
Блокировка Sogou через Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} "Sogou (web|inst) spider" [NC]
RewriteRule ^ - [F,L]
Такие правила блокируют по заявленному User-Agent. Они удобны для простой политики доступа, но не являются способом доказать личность робота.
Как обрабатывать Sogou в TrafficVeil
В TrafficVeil Sogou web spider логично относить к категории «Поисковые роботы» со статусом легитимный при подтверждённой идентификации.
В карточке бота полезно показывать:
- User-Agent и обнаруженный вариант Sogou spider;
- IP и ASN;
- организацию сети;
- результат rDNS/FCRDNS-проверки;
- число запросов;
- RPS/RPM;
- топ URL;
- объём трафика;
- процент 2xx, 3xx, 4xx и 5xx;
- рекомендацию Allow, Rate Limit или Block.
Если сайт ориентирован на китайский рынок, подтверждённого Sogou spider разумно разрешать. Если Sogou не приносит проекту поисковой ценности, владелец сайта может отключить его без прямого влияния на индексирование Google или Яндекса.
Как распознать поддельный SogouBot
| Признак | Ожидаемый поисковый crawler | Подозрительный клиент |
|---|---|---|
| UA | Известный Sogou spider | UA только имитирует название |
| DNS | Инфраструктура согласуется с Sogou | Несвязанный PTR/ASN |
| URL | Публичные индексируемые страницы | /.env, backups, админки, exploit paths |
| Поведение | Последовательный поисковый обход | Перебор уязвимостей или хаотичный scraping |
| Частота | Контролируемый crawl | Аномальные всплески |
Если запрос представляется Sogou, но одновременно перебирает конфигурационные файлы, резервные копии или известные уязвимые endpoint, TrafficVeil должен классифицировать его по реальному поведению, а не доверять названию поисковой системы.
Allow, Rate Limit или Block: итоговая стратегия
| Ситуация | Рекомендация |
|---|---|
| Сайт ориентирован на китайскую аудиторию и Sogou | Allow |
| Sogou нужен, но создаёт заметную нагрузку | Rate Limit с осторожностью и анализ crawl-паттерна |
| Китайская поисковая аудитория проекту не нужна | Disallow или Block по решению владельца |
| Нужно закрыть отдельные технические разделы | Ограничить конкретные пути |
| UA не проходит проверку происхождения | Не присваивать доверенный статус |
| Под видом Sogou идёт vulnerability scanning | Block по фактическому поведению |
Итог
Sogou web spider — легитимный поисковый краулер Sogou. Его присутствие в access.log само по себе не является атакой или признаком вредоносной активности. Он нужен для обнаружения и обновления страниц в поисковой системе Sogou.
Для сайтов с китайской аудиторией такой бот может быть полезен и его следует рассматривать как обычного поискового робота. Для проектов, которым Sogou не приносит трафик и не входит в SEO-стратегию, обход можно ограничить, особенно если он создаёт измеримую нагрузку.
Главное для антибот-системы — отделять заявленный User-Agent от подтверждённой идентичности. TrafficVeil должен учитывать UA, IP, ASN, DNS, fingerprint и фактический характер обхода. Тогда настоящий Sogou spider останется поисковым роботом, а клиент, который только притворяется им, не получит автоматического доверия.
Частые вопросы
Что такое Sogou web spider?
Нужно ли блокировать Sogou web spider?
Какой User-Agent использует Sogou?
Соблюдает ли Sogou robots.txt?
Почему страница остаётся в Sogou после запрета через robots.txt?
Как отличить настоящий Sogou spider от подделки?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.