TrafficVeil
Боты 6 мин13 августа 2026 г.

AI Search Engine: обобщённое имя вместо настоящих AI-поисковиков

Разбираем токен AI Search Engine — не совпадает ни с одним реальным документированным AI-поисковым краулером. Показываем, какие настоящие токены (PerplexityBot, OAI-SearchBot, Google-Extended) стоит разрешать вместо него, если цель — цитирования в AI-ответах.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое AI Search Engine
  2. 2. Зачем AI Search Engine приходит на сайт
  3. 3. Нагрузка и риски именно для AI Search Engine
  4. 4. Как найти AI Search Engine в логах
  5. 5. robots.txt для AI Search Engine
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с AI Search Engine
  8. 8. С кем не путать AI Search Engine
  9. 9. Стратегия allow/deny для AI Search Engine
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

AI Search Engine стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «AI и LLM-краулеры». Важное уточнение по итогам проверки: реальные AI-поисковики идентифицируют себя конкретными, документированными именами — PerplexityBot у Perplexity, OAI-SearchBot у OpenAI, Google-Extended у Google и подобные — а не обобщённой фразой «AI Search Engine». Это тот же тип записи, что и соседние токены из этой же категории («AI Article Writer», «AI Dungeon», «AI Content Detector») — узнаваемое по смыслу название без привязки к единому подтверждённому оператору.

1. Что такое AI Search Engine

У всех крупных, реально задокументированных AI-поисковых краулеров есть собственные, уникальные имена и first-party страницы с описанием: PerplexityBot — для поискового движка Perplexity, OAI-SearchBot — отдельный поисковый краулер OpenAI (не путать с тренировочным GPTBot), Google-Extended — токен Google для генеративных продуктов. Обобщённая фраза «AI Search Engine» в этот ряд не входит ни у одного из известных операторов — это скорее описательное имя, которое встречается в широких community-блоклистах AI-ботов вместе с сотнями похожих generic-записей.

Название AI Search Engine
User-Agent / паттерн ai search engine
Оператор Не установлен — ни один из известных операторов реальных AI-поисковиков (Perplexity, OpenAI, Google) не использует именно эту обобщённую фразу как свой UA
Роль По шаблону категории — наполнение AI-индекса; но без подтверждённого оператора нельзя сказать, что за конкретным продуктом или пайплайном стоит этот токен
Документация / ориентир Публичной документации для этого конкретного токена не найдено; для сравнения — у настоящих AI-поисковиков документация всегда есть под их собственным уникальным именем
Список IP ❌ Официального списка нет
robots.txt Поведение непредсказуемо — нет подтверждённого единого оператора, который мог бы задать политику
Пометка TrafficVeil Легитимный / AI и LLM-краулеры — присвоено по шаблону категории, конкретных оснований для доверия меньше, чем для документированных AI-краулеров вроде PerplexityBot

2. Зачем AI Search Engine приходит на сайт

Шаблонное объяснение категории — ваш контент интересен как сырьё для AI-продукта. Возможно, это и так, но стоит понимать: раз конкретный оператор не подтверждён, невозможно оценить ни цель использования данных, ни то, приведёт ли присутствие в чьём-то индексе к цитированию с атрибуцией (как это делают документированные AI-поисковики вроде Perplexity) или контент просто уйдёт в закрытый пайплайн без всякой отдачи.

  • Какие зоны чаще трогает: /blog/, /product/, /category/, /news/, /api/ (если открыто), пагинация каталога;
  • Что ищет: контент, метаданные, availability или ссылочный граф — конкретная цель не подтверждена официальной документацией;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн.

Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по ai search engine показывает системный обход блога, каталога и новостей — прежде чем решить, что «раз это AI-поисковик, стоит разрешить ради цитирований», стоит вспомнить, что у подтверждённых AI-поисковиков (Perplexity, OpenAI) есть собственные уникальные токены, и если бы это был один из них, он бы так и назывался.

3. Нагрузка и риски именно для AI Search Engine

Отдельной строки в публичной сводке top-bot TrafficVeil у ai search engine может не быть, но в категории «AI и LLM-краулеры» такие агенты дают характерный фон: нагрузка может быть «тихой» — не DDoS в классическом смысле, но постоянный съём HTML и рост bandwidth. Для этого токена риск неопределённости выше среднего: раз нет подтверждённого оператора, нет и способа оценить, оправдывает ли потенциальная выгода (цитирования, трафик) отдачу контента.

4. Как найти AI Search Engine в логах

Не ищите «просто ботов» — ищите конкретный токен ai search engine и рядом смотрите на настоящие, документированные AI-поисковые краулеры.

# Базовый поиск
grep -i "ai search engine" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверить полную строку UA — есть ли ссылка на реального оператора
grep -io "ai search engine[^\"]*" /var/log/nginx/access.log | sort -u | head

# Сравнить с настоящими, документированными AI-поисковыми краулерами
grep -iE "perplexitybot|oai-searchbot|google-extended" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет, поэтому смотрите на полную строку UA целиком: у реальных AI-поисковиков всегда есть ссылка на документацию оператора (openai.com, perplexity.ai и подобные). Если такой ссылки нет — доверять названию не стоит.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для AI Search Engine

# Жёсткий запрет
User-agent: ai search engine
Disallow: /

# Разрешить всё
User-agent: ai search engine
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: ai search engine
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: ставьте Disallow или 403 для ai search engine, если пользы нет — с учётом отсутствия подтверждённого оператора это разумный default. Если вы всё же хотите быть видимыми для реальных AI-поисковиков, настройте отдельные правила под их настоящие, документированные токены (PerplexityBot, OAI-SearchBot и подобные), а не под этот обобщённый.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "ai search engine") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=aisearchengine:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "ai search engine") {
        limit_req zone=aisearchengine burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ai search engine [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите ai search engine в ботах домена или в /system/bots;
  • Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
  • Allow только при явной, подтверждённой пользе — и отдельно проверьте, не стоило бы вместо этого настроить правила под реальные AI-поисковики;
  • После изменения сверьте логи: хиты ai search engine должны уйти в блок или лимит, а настоящие документированные AI-краулеры (если вы хотите их видимость) — остаться без изменений.

7. Рекомендации: что делать с AI Search Engine

  • Если пользы нет — Disallow/403 для ai search engine, если пользы нет;
  • Если цель — видимость в AI-ответах, настройте правила под настоящие токены (PerplexityBot, OAI-SearchBot, Google-Extended), а не под этот обобщённый;
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: скорее всего ничего не теряете в смысле цитирований в AI-ответах, поскольку настоящие AI-поисковики используют другие, собственные токены.

8. С кем не путать AI Search Engine

Бот / сосед Кластер UA Комментарий
PerplexityBot AI и LLM-краулеры perplexitybot реальный, документированный поисковый краулер Perplexity
OAI-SearchBot AI и LLM-краулеры oai-searchbot реальный поисковый краулер OpenAI, отдельный от тренировочного GPTBot
Google-Extended AI и LLM-краулеры google-extended реальный токен Google для генеративных AI-продуктов
AI Article Writer AI и LLM-краулеры ai article writer такой же обобщённый токен без единого подтверждённого оператора
AI Content Detector AI и LLM-краулеры ai content detector такой же обобщённый токен без единого подтверждённого оператора

9. Стратегия allow/deny для AI Search Engine

Ситуация Действие
Хотите видимость в реальных AI-ответах Настроить правила под настоящие токены (PerplexityBot, OAI-SearchBot и подобные), не под ai search engine
Только мешает и жрёт ресурсы Disallow + запрет в TrafficVeil
Нужен доступ, но пики по ночам Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Высокое по умолчанию — обобщённое имя без подтверждённой связи с оператором скорее повод для проверки, чем для доверия

Частые вопросы

AI Search Engine — это Perplexity, ChatGPT или другой известный AI-поисковик?

Нет, ни один из реальных AI-поисковиков не использует эту обобщённую фразу как свой User-Agent — у каждого есть собственное уникальное документированное имя.

Как называются настоящие AI-поисковые краулеры?

PerplexityBot у Perplexity, OAI-SearchBot у OpenAI (отдельно от тренировочного GPTBot), Google-Extended у Google — у всех есть first-party документация под их собственным именем.

Если хочу цитирования в AI-ответах, что мне разрешать в robots.txt?

Настоящие документированные токены — PerplexityBot, OAI-SearchBot, Google-Extended и подобные, а не обобщённый ai search engine, который не гарантирует связи ни с одним из них.

Стоит ли по умолчанию блокировать этот токен?

Да, при отсутствии дополнительных подтверждений это разумный default — как и для других обобщённых AI-имён без единого верифицированного оператора.

Как проверить полную строку UA на признаки настоящего оператора?

Смотреть на наличие ссылки на официальный домен (openai.com, perplexity.ai) — у реальных AI-поисковиков она есть всегда, у обобщённых токенов обычно отсутствует.

Потеряю ли я цитирования в AI-ответах, заблокировав ai search engine?

Скорее всего нет — настоящие AI-поисковики используют другие, собственные токены, поэтому блокировка этого обобщённого имени на них не влияет.

#AI Search Engine#PerplexityBot#OAI-SearchBot#Google-Extended#generic-боты#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.