TrafficVeil
Боты 6 мин21 августа 2026 г.

SEO Robot: бот без подтверждённой личности, а не легитимный AI-краулер

В отличие от GPTBot или ClaudeBot, за токеном seo robot не стоит ни один известный оператор — ни каталоги ботов, ни документация AI-компаний не подтверждают его существование как реального сервиса. Разбираемся, почему присвоенная категория «легитимный AI-краулер» не выдерживает проверки и какая стратегия безопаснее при полном отсутствии публичной идентичности бота.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое SEO Robot на самом деле
  2. 2. Зачем SEO Robot приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти SEO Robot в логах
  5. 5. robots.txt для SEO Robot
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. Открытый вопрос по категоризации
  9. 9. Стратегия allow/deny для SEO Robot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

У большинства ботов в этой энциклопедии за строкой UA стоит конкретная компания или открытый проект с документацией. У «seo robot» такой опоры нет: ни один открытый каталог краулеров, ни один вендор бот-аналитики не связывает этот токен с известным сервисом или оператором. Это не «ещё один легитимный AI-краулер», как можно было бы предположить по названию, а обезличенный автоматический клиент без публично подтверждённой личности — и относиться к нему стоит соответственно осторожнее.

1. Что такое SEO Robot на самом деле

По открытым источникам — каталогам известных ботов, базам User-Agent, документации крупных операторов AI-краулеров (OpenAI, Anthropic, Google, Meta, Perplexity и другие публикуют официальные списки своих UA) — токен seo robot нигде не фигурирует как опознанный, задокументированный краулер. Это отличает его от подавляющего большинства других записей в категории «AI и LLM-краулеры», где за каждым именем стоит конкретная компания с публичной политикой доступа.

Наиболее вероятное объяснение — самодельный или коммерческий скрипт-скрейпер, который использует общее, ничего не раскрывающее название вместо честной идентификации (сравните с честным подходом: GPTBot, ClaudeBot, PerplexityBot — имя сразу называет оператора). Такое поведение само по себе не доказывает злого умысла, но и не даёт оснований считать бота автоматически безопасным только потому, что в названии есть слово «SEO».

Параметр Значение
Название SEO Robot
User-Agent / паттерн seo robot
Оператор Не подтверждён ни одним открытым каталогом ботов — реальная личность неизвестна
Связь с AI/LLM-продуктами Не подтверждена ничем, кроме предположения по названию — ни один известный AI-вендор такой UA не публикует
Документация Отсутствует
robots.txt Нет данных о соблюдении — при отсутствии публичной идентичности полагаться на добросовестность бота не стоит
Рекомендуемая пометка Требует пересмотра — присвоенная категория «Легитимный / AI и LLM-краулеры» не подтверждается фактами (см. раздел 8)

2. Зачем SEO Robot приходит на сайт

Поскольку официальной цели у бота нет, о назначении можно судить только по поведению:

  • обход публичных URL, иногда каталога и пагинации — паттерн, характерный и для честных SEO-инструментов, и для примитивных скрейперов контента;
  • отсутствие нормальной сессии и повторяемый path-паттерн — типично для автоматизации в целом, не говорит ничего конкретного о цели;
  • сам факт использования расплывчатого названия вместо честного самопредставления — сигнал, что оператор, вероятно, не заинтересован в том, чтобы вы могли его identifицировать и написать с вопросом о цели обхода, как это можно сделать с крупными операторами.

Типичный кейс: в аналитике фиксируется рост хитов без конверсий, в access.log под этим временем — seo robot на пагинации и карточках. В отличие от случаев с задокументированными ботами, здесь нельзя с уверенностью сказать, что происходит — снятие технических метрик, копирование контента для стороннего сервиса или что-то ещё.

3. Нагрузка и риски

Главный риск здесь — не столько нагрузка, сколько неопределённость: без публичной документации нельзя достоверно исключить сбор контента для republishing, построение ссылочного графа для чужого SEO-инструмента или любую другую цель, которую заявленные операторы обычно раскрывают сами.

Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на служебных или листовых страницах — при отсутствии официальной идентичности эти поведенческие сигналы становятся единственным источником информации о боте.

4. Как найти SEO Robot в логах

# Базовый поиск
grep -i "seo robot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "seo robot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — при отсутствии официального диапазона это единственный ориентир
grep -i "seo robot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "seo robot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверка на совпадение IP с известными датацентрами/облаками — частый признак скрейпера без честной идентификации
grep -i "seo robot" /var/log/nginx/access.log | awk '{print $1}' | sort -u

Верификация. Здесь верификация важнее, чем для большинства других записей в энциклопедии: строку UA подделать может любой скрипт, а поскольку у «seo robot» нет ни официального оператора, ни опубликованных IP-диапазонов, единственный доступный метод — смотреть ASN и поведение целиком, не доверяя самому факту наличия «правдоподобного» имени в UA:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для SEO Robot

Поскольку публичного оператора нет, надеяться на добросовестное соблюдение robots.txt не стоит — правило имеет смысл выставить на всякий случай, но полагаться нужно на серверную блокировку.

# Жёсткий запрет
User-agent: seo robot
Disallow: /

# Компромисс: закрыть личный кабинет и служебные разделы, если решите не блокировать полностью
User-agent: seo robot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "seo robot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=seorobot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "seo robot") {
        limit_req zone=seorobot burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} "seo robot" [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите seo robot в разделе ботов домена или в /system/bots;
  • поскольку у бота нет подтверждённой полезной функции и нет способа связаться с оператором, стандартная рекомендация — Disallow плюс запрет, а не выжидательный allow «на всякий случай»;
  • если решите оставить мягкий режим — используйте rate-limit, а не полный allow, чтобы ограничить возможный ущерб при неясной цели обхода;
  • после изменения сверьте логи: хиты seo robot должны уйти в блок/лимит, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Нет подтверждённой личности оператора и нет делового обоснования для allow — блокируйте по умолчанию, это самый безопасный вариант;
  • Заметили конкретную пользу от этого трафика (например, реферальные переходы с явно идентифицируемого источника) — прежде чем разрешать, попробуйте выяснить, кто реальный оператор, через анализ IP/ASN;
  • Нагрузка минимальна и роли не играет — можно отложить решение и просто мониторить, не давая полный allow;
  • Не путайте отсутствие вреда с подтверждённой легитимностью — это разные вещи, особенно когда у бота нет публичной документации;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. Открытый вопрос по категоризации

Стоит отдельно обратить внимание: присвоенная категория «Легитимный / AI и LLM-краулеры» для этого бота не подтверждается ничем, кроме предположения по названию токена. Ни один открытый каталог краулеров, ни документация известных AI-операторов не связывают «seo robot» с реальным AI/LLM-продуктом. Учитывая это, категория и статус легитимности этой записи, по всей видимости, стоит пересмотреть — возможно, в сторону «неопознанный» или «нежелательный по умолчанию», а не «легитимный» наравне с ботами, у которых есть подтверждённый оператор.

Бот / сосед Кластер UA Комментарий
GPTBot AI и LLM-краулеры gptbot легитимный, оператор OpenAI официально задокументирован
ClaudeBot AI и LLM-краулеры claudebot легитимный, оператор Anthropic официально задокументирован
PerplexityBot AI и LLM-краулеры perplexitybot легитимный, оператор Perplexity официально задокументирован
AI Article Writer AI и LLM-краулеры (черновая запись) ai article writer Требует такой же проверки, как и SEO Robot — расплывчатое название без подтверждённого оператора
AI SEO Crawler AI и LLM-краулеры (черновая запись) ai seo crawler Тот же паттерн — стоит перепроверить перед публикацией отдельной статьи

9. Стратегия allow/deny для SEO Robot

Ситуация Действие
Оператор не подтверждён, деловой пользы не видно Disallow + запрет в TrafficVeil — рекомендуемый вариант по умолчанию
Нужно сначала понять, кто реально стоит за трафиком Смотреть IP/ASN, не давать allow до выяснения
Нагрузка незначительна, но остаётся неопределённость Rate-limit вместо allow — ограничивает риск, не требует немедленного решения
Появились новые публичные данные об операторе Пересмотреть решение и обновить эту запись в энциклопедии
Подозрение на подделку UA под более авторитетное имя Не доверять строке UA целиком; сверять с IP/ASN известных легитимных операторов

Частые вопросы

Правда ли, что SEO Robot связан с AI-продуктами и обучением моделей?

Нет, эта связь ничем не подтверждена — ни один известный AI-оператор (OpenAI, Anthropic, Google, Perplexity) такой UA не публикует.

Есть ли у SEO Robot официальный сайт или документация?

Нет, открытые каталоги краулеров и базы User-Agent не связывают этот токен ни с одним известным сервисом.

Почему нельзя просто довериться пометке «легитимный» в базе?

Потому что при отсутствии подтверждённого оператора и публичной документации нет фактической основы для такой оценки, а есть только предположение по названию.

Как в этом случае вообще понять, что за трафик идёт под этим UA?

Единственный надёжный способ — смотреть IP/ASN и поведенческий паттерн обхода, а не полагаться на саму строку User-Agent.

Какая стратегия безопаснее при полном отсутствии данных об операторе?

Блокировка по умолчанию через robots.txt и серверные правила, а не выжидательный allow «на всякий случай».

Стоит ли пересмотреть похожие записи вроде «AI Article Writer» или «AI SEO Crawler»?

Да, они построены по той же схеме — расплывчатое название без проверяемого оператора, — и заслуживают такой же проверки перед публикацией.

#SEO Robot#User-Agent#неопознанные боты#AI-краулеры#антибот#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.