SeznamBot — официальный поисковый веб-краулер компании Seznam.cz. Он обходит интернет, находит новые страницы и обновляет информацию о документах, которые уже известны поисковой системе Seznam.
В официальной документации Seznam прямо называет SeznamBot своим crawler для поисковой системы и публикует его User-Agent, IP-диапазоны и правила верификации.
Это делает SeznamBot одним из относительно хорошо документированных поисковых роботов: владельцу сайта не приходится определять его только по поведению или неизвестному User-Agent.
| Параметр | Значение |
|---|---|
| Название | SeznamBot |
| Оператор | Seznam.cz, a.s. |
| Категория | Search Crawlers |
| Основной UA | SeznamBot/4.0 |
| Назначение | Индексация страниц для поиска Seznam.cz |
| Fresh crawler | FreshBot |
| robots.txt | Поддерживается официально |
| Request-rate | Поддерживается официально |
| PTR | fulltextrobot-*.seznam.cz |
| IP JSON | Публикуется Seznam |
| TrafficVeil default | Allow / Monitor |
Как выглядит User-Agent SeznamBot
Seznam публикует следующую строку:
Mozilla/5.0 (compatible; SeznamBot/4.0; +https://o-seznam.cz/napoveda/vyhledavani/en/seznambot-crawler/)
Для первичного поиска в логах достаточно устойчивого токена:
SeznamBot
Но для trusted-идентификации одного User-Agent недостаточно, поскольку его способен подделать любой HTTP-клиент.
Официальный UA подтверждён документацией самого Seznam.
Зачем SeznamBot приходит на сайт
Основная задача SeznamBot — поисковая индексация.
Упрощённо процесс выглядит так:
SeznamBot
↓
получает страницу
↓
анализирует контент и ссылки
↓
обнаруживает новые URL
↓
обновляет индекс Seznam.cz
↓
страница может появиться в результатах поиска
Это классическая поисковая модель, сопоставимая по назначению с Googlebot, Bingbot или YandexBot.
Поэтому SeznamBot не следует относить к:
AI crawlers
scrapers
RSS readers
link preview bots
security scanners
Правильная категория:
Search Crawlers
→ Regional Search Engines
→ Seznam.cz
→ SeznamBot
Что такое FreshBot
Помимо основного SeznamBot, Seznam официально описывает FreshBot.
FreshBot — быстрый crawler, предназначенный для страниц и RSS-источников, где регулярно появляется новый контент, представляющий интерес для большого числа пользователей.
Seznam отдельно отмечает, что это прежде всего:
- новостные сайты;
- часто обновляемые страницы;
- RSS-источники;
- другой свежий контент.
То есть FreshBot нужен для уменьшения задержки между публикацией нового материала и его обнаружением поиском.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
SeznamBot и FreshBot — не одно и то же по назначению
| Параметр | SeznamBot | FreshBot |
|---|---|---|
| Основная задача | Общий поисковый crawl | Быстрое обнаружение свежего контента |
| Типичные сайты | Любые индексируемые сайты | Новости и часто обновляемые ресурсы |
| RSS | Может использоваться как источник URL | Отдельно упоминается Seznam |
| SEO-роль | Основной индекс Seznam | Ускорение freshness |
При этом официальная страница Seznam публикует конкретный полный User-Agent именно для SeznamBot. FreshBot на той же странице описывается по назначению, но отдельная техническая UA-строка там не приводится. Поэтому TrafficVeil не стоит придумывать отдельную сигнатуру FreshBot без подтверждения.
Официальные IPv4 SeznamBot
Seznam публикует следующие IPv4-сети для основного crawler:
77.75.76.0/24
77.75.77.0/24
77.75.78.0/24
77.75.79.0/24
В официальной таблице они представлены как:
77.75.76.x
77.75.77.x
77.75.78.x
77.75.79.x
Это позволяет TrafficVeil выполнять гораздо более надёжную проверку, чем простое совпадение UA.
Официальные IPv6 SeznamBot
Seznam также публикует IPv6-диапазоны:
2a02:598:64:8a00::302:340/120
2a02:598:96:8a00::b00:80/118
Их также стоит учитывать при верификации crawler, иначе часть настоящего SeznamBot может ошибочно попасть в категорию Unverified.
Тестовые адреса SeznamBot
Отдельно Seznam публикует адреса тестовой версии:
77.75.73.26
77.75.72.26
и IPv6:
2a02:598:64:8a00::f00:0/123
2a02:598:96:8a00::1200:100/123
Поэтому TrafficVeil может отделять production crawler от тестовой инфраструктуры Seznam.
Не путайте IndexNow IP с crawler
На той же официальной странице Seznam перечисляет IP, используемые для проверки ключей IndexNow:
77.75.72.74
77.75.73.74
Это не следует автоматически интерпретировать как обычные crawling IP.
Для TrafficVeil полезно хранить разные роли:
Seznam Search Crawler
Seznam Test Crawler
Seznam IndexNow Verification
Так классификация будет точнее.
Официальный JSON со списком IP
Особенно удобно, что Seznam публикует полный список используемых IP в JSON-формате.
Это означает, что TrafficVeil может не хранить диапазоны исключительно вручную, а периодически синхронизировать официальные данные оператора.
В базе можно хранить:
verification_source = official_json
last_ip_sync = timestamp
verification_confidence = high
Факт существования официального JSON подтверждён страницей SeznamBot.
Как выглядит reverse DNS SeznamBot
Seznam также публикует шаблоны PTR.
Для IPv4:
fulltextrobot-77-75-77-xxx.seznam.cz
Для IPv6:
fulltextrobot-2a02-598-64-8a00--302-340.seznam.cz
Для тестового crawler:
fulltextrobot-test-77-75-73-26.seznam.cz
Официальная документация говорит, что используемые IP SeznamBot должны иметь reverse DNS в таком формате.
Как правильно верифицировать SeznamBot
Оптимальная схема TrafficVeil:
UA содержит SeznamBot
+
IP входит в официальный диапазон
+
PTR соответствует *.seznam.cz
=
Verified SeznamBot
Для особенно строгой проверки можно сделать forward-confirmation:
IP
↓
PTR
↓
fulltextrobot-....seznam.cz
↓
DNS lookup hostname
↓
полученный IP должен совпасть с исходным
Это защищает от простого PTR spoofing.
Как проверить IP вручную
IP="77.75.77.100"
host "$IP"
dig +short -x "$IP"
whois -h whois.cymru.com " -v $IP"
Ожидаемый PTR должен соответствовать опубликованной Seznam схеме.
Почему одного UA недостаточно
Любой скрипт способен отправить:
User-Agent: Mozilla/5.0 (compatible; SeznamBot/4.0; ...)
Поэтому правило:
contains SeznamBot
→ unconditional allow
создаёт простой способ обхода антибот-защиты.
Гораздо правильнее:
UA + IP + PTR
→ Verified
Как выглядит поддельный SeznamBot
Например:
User-Agent: SeznamBot/4.0
IP: residential ISP
PTR: отсутствует
GET /.env
GET /.git/config
GET /wp-login.php
GET /backup.sql
Это явно не соответствует нормальному профилю поискового crawler.
TrafficVeil должен показывать:
Claimed: SeznamBot
Verification: Failed
Behavior: Security scanning
Как найти SeznamBot в access.log
Базовый поиск:
grep -i "SeznamBot" /var/log/nginx/access.log
Количество запросов:
grep -ic "SeznamBot" /var/log/nginx/access.log
Топ URL:
grep -i "SeznamBot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
Топ IP:
grep -i "SeznamBot" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
HTTP-коды:
grep -i "SeznamBot" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn
Как проверить распределение по IP
grep -i "SeznamBot" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn
Далее адреса можно автоматически проверить против официальных сетей Seznam.
Как выглядит нормальное поведение SeznamBot
| Признак | Ожидаемый профиль |
|---|---|
| UA | SeznamBot/4.0 |
| IP | Официальная сеть Seznam |
| PTR | fulltextrobot-*.seznam.cz |
| URL | Публичные индексируемые страницы |
| Навигация | Поисковый crawl |
| robots.txt | Соблюдает |
Соблюдает ли SeznamBot robots.txt
Да.
Seznam официально пишет, что SeznamBot полностью соблюдает robots exclusion standard.
Через robots.txt можно:
- полностью запретить crawler;
- закрыть отдельные страницы;
- закрыть директории;
- использовать Allow;
- использовать wildcard;
- ограничить скорость через Request-rate.
Это подтверждено официальной crawling-control документацией Seznam.
Как полностью заблокировать SeznamBot
User-agent: SeznamBot
Disallow: /
Seznam приводит именно этот пример в своей документации.
Как закрыть отдельный раздел
User-agent: SeznamBot
Disallow: /admin/
Disallow: /account/
Disallow: /internal/
Публичные страницы при этом останутся доступны поисковому crawler.
SeznamBot поддерживает Allow
Помимо стандартного Disallow, SeznamBot понимает директиву:
Allow:
Например:
User-agent: SeznamBot
Disallow: /
Allow: /public/
Так можно закрыть большую часть сайта и оставить crawler доступ только к выбранному разделу.
SeznamBot поддерживает wildcard
Seznam документирует:
*
для произвольной последовательности символов и:
$
для конца URL.
Например:
User-agent: SeznamBot
Disallow: *.pdf$
закрывает PDF-файлы от crawling SeznamBot.
Request-rate — важное преимущество SeznamBot
Если crawler нужен для SEO, но создаёт слишком много запросов, нет необходимости сразу его блокировать.
SeznamBot официально поддерживает:
Request-rate
Синтаксис:
Request-rate: количество/период
Например:
User-agent: SeznamBot
Request-rate: 100/15m
Это означает максимум 100 документов за 15 минут.
Seznam прямо заявляет, что SeznamBot полностью соблюдает эту директиву.
Примеры Request-rate
Request-rate: 1/10s
Request-rate: 100/15m
Request-rate: 400/1h
Request-rate: 9000/1d
Можно даже ограничивать crawler только в определённое время суток:
Request-rate: 1/10s 1800-1900
Время в документации Seznam указывается в UTC.
Минимальный поддерживаемый Request-rate
Seznam указывает важное ограничение:
минимум = 1 документ / 10 секунд
Если задать более медленный rate, SeznamBot всё равно интерпретирует его как один документ каждые 10 секунд.
Почему Request-rate лучше серверного 429
Если crawler нужен для SEO, декларативное ограничение обычно удобнее постоянного принудительного Rate Limit.
Вместо:
SeznamBot
↓
слишком много запросов
↓
429
↓
retry
можно заранее сообщить crawler:
User-agent: SeznamBot
Request-rate: 100/15m
и снизить нагрузку более предсказуемо.
Sitemap и SeznamBot
Seznam также поддерживает Sitemap.
Через sitemap можно сообщить crawler:
- какие URL существуют;
- какие страницы обновлялись;
- какую структуру имеет сайт.
Директива robots.txt выглядит стандартно:
Sitemap: https://example.com/sitemap.xml
Поддержка sitemap официально описана Seznam.
robots.txt и noindex — разные задачи
Если задача владельца сайта не запретить crawling, а убрать страницу из индекса, одного Disallow может быть недостаточно.
Seznam отдельно документирует robots meta tag:
<meta name="robots" content="noindex, nofollow">
Но crawler должен иметь возможность загрузить страницу, чтобы увидеть директиву noindex.
Если одновременно сделать:
robots.txt → Disallow
и:
meta robots → noindex
crawler может не получить HTML и, следовательно, не увидеть noindex. Seznam прямо предупреждает об этом.
Почему URL может остаться в выдаче после Disallow
Seznam указывает, что если запретить crawling, сам URL теоретически всё ещё может появляться в результатах поиска, если на него ведут ссылки с других страниц.
Если нужно именно убрать страницу из индекса, лучше использовать index-control механизмы, позволяя crawler получить соответствующую директиву.
Нагрузка SeznamBot
По внутренней сводке TrafficVeil у SeznamBot наблюдалось порядка 3,2 тыс. запросов.
Такую цифру в интерфейсе стоит обязательно показывать вместе с периодом измерения:
SeznamBot
3 214 requests
Period: 30 days
Ещё полезнее добавить:
- Verified Requests;
- Unique URLs;
- Unique IP;
- Cache HIT Ratio;
- Origin Requests;
- RPS/RPM;
- Response Codes;
- Bandwidth.
Когда SeznamBot действительно создаёт проблему
Само количество hits мало о чём говорит.
Например:
10 000 requests
98% cache HIT
200 origin requests
могут почти не нагружать приложение.
А:
1000 requests
0% cache HIT
1000 dynamic renders
могут создавать заметную CPU/DB нагрузку.
Поэтому TrafficVeil лучше показывать Origin Impact, а не только request count.
Что делать, если SeznamBot слишком активен
Порядок действий:
- проверить, настоящий ли это SeznamBot;
- посмотреть Cache HIT;
- измерить Origin Requests;
- проверить самые тяжёлые URL;
- настроить Request-rate;
- только после этого применять жёсткий server-side Rate Limit или Block.
Seznam сам рекомендует использовать robots.txt rate controls, если crawler создаёт чрезмерную нагрузку.
Стоит ли блокировать SeznamBot
Зависит прежде всего от географии и SEO-стратегии сайта.
Seznam.cz — чешская поисковая система, поэтому для сайта с аудиторией в Чехии SeznamBot может иметь прямую поисковую ценность.
Если сайт ориентирован на:
- Чехию;
- чешский язык;
- чешских пользователей;
- локальный бизнес в Чехии;
обычно правильная стратегия:
Allow / Monitor
а при нагрузке:
Request-rate
Когда Block оправдан
Block может быть разумен, если:
- чешская аудитория полностью нецелевой рынок;
- присутствие в Seznam Search не представляет ценности;
- crawler создаёт нагрузку, которую невозможно решить ограничением скорости;
- политика сайта исключает данный поисковик.
Но перед блокировкой стоит понимать последствие: Seznam прямо предупреждает, что пользователи его поиска могут перестать видеть страницы сайта в результатах.
Блокировка через Nginx
Если требуется технический запрет по UA:
if ($http_user_agent ~* "SeznamBot") {
return 403;
}
Но для подтверждённого поискового crawler robots.txt обычно предпочтительнее.
Блокировка по IP
Можно ограничить официальные IPv4-сети:
deny 77.75.76.0/24;
deny 77.75.77.0/24;
deny 77.75.78.0/24;
deny 77.75.79.0/24;
Однако это жёсткое сетевое решение. Для обычного SEO-контроля лучше использовать robots.txt.
Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} SeznamBot [NC]
RewriteRule ^ - [F,L]
Почему не стоит банить весь чешский трафик
Если задача — ограничить только SeznamBot, блокировка всей страны или всех IP Seznam будет слишком широкой.
TrafficVeil должен разделять:
Country
ASN
Operator
Bot Identity
Bot Policy
и применять правило именно к crawler.
Повлияет ли блокировка SeznamBot на Google
Нет прямой связи.
Правило:
User-agent: SeznamBot
Disallow: /
не является правилом для:
Googlebot
YandexBot
Bingbot
Поэтому прямого технического влияния на индексацию другими поисковыми системами нет.
SeznamBot и Googlebot — разные поисковые системы
| Параметр | SeznamBot | Googlebot |
|---|---|---|
| Оператор | Seznam.cz | |
| Основной рынок | Особенно Чехия | Глобальный |
| Назначение | Search indexing | Search indexing |
| Общий UA | Нет | Нет |
Поэтому в TrafficVeil их следует хранить как независимые bot identities.
С кем не путать SeznamBot
| Агент | Назначение |
|---|---|
| SeznamBot | Основной поисковый crawler Seznam.cz |
| FreshBot | Быстрый crawler свежего контента/RSS |
| Googlebot | Google Search crawler |
| Bingbot | Bing Search crawler |
| YandexBot | Yandex Search crawler |
Рекомендуемая карточка TrafficVeil
| Поле | Значение |
|---|---|
| Name | SeznamBot |
| Operator | Seznam.cz, a.s. |
| Category | Search Crawlers |
| Subtype | Regional Search Engine |
| User-Agent | SeznamBot/4.0 |
| IPv4 | 77.75.76.0/24 – 77.75.79.0/24 |
| IPv6 | Published officially |
| PTR | fulltextrobot-*.seznam.cz |
| Official IP JSON | Yes |
| robots.txt | Yes |
| Allow directive | Yes |
| Wildcards | Yes |
| Request-rate | Yes |
| Default action | Allow / Monitor |
| Human analytics | Exclude |
| Search analytics | Include |
Стратегия Allow / Limit / Block
| Ситуация | Рекомендация |
|---|---|
| Сайт ориентирован на Чехию | Allow |
| Seznam приносит поисковый трафик | Allow |
| Crawler создаёт нагрузку | Request-rate |
| Нужны не все разделы | Частичный Disallow |
| Нужно убрать страницу из индекса | noindex с разрешённым crawl |
| Чешский поиск полностью не нужен | Disallow / Block |
| UA SeznamBot, но IP/PTR не совпадают | Failed verification |
| Под UA идёт vulnerability scanning | Block / reclassify |
Что показывать пользователю TrafficVeil
Вместо общего:
«SeznamBot — легитимный поисковый бот. Разрешайте при наличии аудитории в Чехии.»
лучше вывести:
SeznamBot — официальный поисковый crawler Seznam.cz. Настоящий бот можно проверить по User-Agent, официальным IP-диапазонам и PTR вида fulltextrobot-*.seznam.cz. Если вам нужна видимость в поиске Seznam, рекомендуем Allow. При высокой нагрузке используйте поддерживаемую Seznam директиву Request-rate вместо полного запрета.
Итог
SeznamBot — хорошо документированный и верифицируемый поисковый crawler Seznam.cz. Seznam публикует полный User-Agent, IPv4/IPv6-сети, шаблоны PTR и JSON со всеми crawler IP.
Отдельно существует FreshBot — быстрый crawler для свежих страниц и RSS, особенно новостных ресурсов.
SeznamBot полностью поддерживает robots.txt и предоставляет владельцу сайта необычно гибкие средства управления: Allow, wildcard, Sitemap и Request-rate. Последняя директива позволяет ограничивать crawling без потери поисковой видимости.
Поэтому для TrafficVeil оптимальная классификация:
Search Crawlers
→ Regional Search Engines
→ Seznam.cz
→ SeznamBot
Identity: Verified by UA + IP + PTR
Default: Allow / Monitor
Для сайтов с чешской аудиторией блокировать его по умолчанию не стоит. Если же Seznam.cz не представляет бизнес-ценности, crawler можно ограничить отдельным правилом, не затрагивая Googlebot, YandexBot или Bingbot.
```
Частые вопросы
Что такое SeznamBot?
Что такое FreshBot?
Как проверить настоящий SeznamBot?
Соблюдает ли SeznamBot robots.txt?
Как ограничить нагрузку SeznamBot без блокировки?
Стоит ли блокировать SeznamBot?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.