Боты6 мин чтения·13 августа 2026 г.

AI Search Engine: обобщённое имя вместо настоящих AI-поисковиков

Разбираем токен AI Search Engine — не совпадает ни с одним реальным документированным AI-поисковым краулером. Показываем, какие настоящие токены (PerplexityBot, OAI-SearchBot, Google-Extended) стоит разрешать вместо него, если цель — цитирования в AI-ответах.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота AI Search Engine: легитимный ai и llm-краулеры

AI Search Engine стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «AI и LLM-краулеры». Важное уточнение по итогам проверки: реальные AI-поисковики идентифицируют себя конкретными, документированными именами — PerplexityBot у Perplexity, OAI-SearchBot у OpenAI, Google-Extended у Google и подобные — а не обобщённой фразой «AI Search Engine». Это тот же тип записи, что и соседние токены из этой же категории («AI Article Writer», «AI Dungeon», «AI Content Detector») — узнаваемое по смыслу название без привязки к единому подтверждённому оператору.

1. Что такое AI Search Engine

У всех крупных, реально задокументированных AI-поисковых краулеров есть собственные, уникальные имена и first-party страницы с описанием: PerplexityBot — для поискового движка Perplexity, OAI-SearchBot — отдельный поисковый краулер OpenAI (не путать с тренировочным GPTBot), Google-Extended — токен Google для генеративных продуктов. Обобщённая фраза «AI Search Engine» в этот ряд не входит ни у одного из известных операторов — это скорее описательное имя, которое встречается в широких community-блоклистах AI-ботов вместе с сотнями похожих generic-записей.

Название AI Search Engine
User-Agent / паттерн ai search engine
Оператор Не установлен — ни один из известных операторов реальных AI-поисковиков (Perplexity, OpenAI, Google) не использует именно эту обобщённую фразу как свой UA
Роль По шаблону категории — наполнение AI-индекса; но без подтверждённого оператора нельзя сказать, что за конкретным продуктом или пайплайном стоит этот токен
Документация / ориентир Публичной документации для этого конкретного токена не найдено; для сравнения — у настоящих AI-поисковиков документация всегда есть под их собственным уникальным именем
Список IP ❌ Официального списка нет
robots.txt Поведение непредсказуемо — нет подтверждённого единого оператора, который мог бы задать политику
Пометка TrafficVeil Легитимный / AI и LLM-краулеры — присвоено по шаблону категории, конкретных оснований для доверия меньше, чем для документированных AI-краулеров вроде PerplexityBot

2. Зачем AI Search Engine приходит на сайт

Шаблонное объяснение категории — ваш контент интересен как сырьё для AI-продукта. Возможно, это и так, но стоит понимать: раз конкретный оператор не подтверждён, невозможно оценить ни цель использования данных, ни то, приведёт ли присутствие в чьём-то индексе к цитированию с атрибуцией (как это делают документированные AI-поисковики вроде Perplexity) или контент просто уйдёт в закрытый пайплайн без всякой отдачи.

  • Какие зоны чаще трогает: /blog/, /product/, /category/, /news/, /api/ (если открыто), пагинация каталога;
  • Что ищет: контент, метаданные, availability или ссылочный граф — конкретная цель не подтверждена официальной документацией;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн.

Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по ai search engine показывает системный обход блога, каталога и новостей — прежде чем решить, что «раз это AI-поисковик, стоит разрешить ради цитирований», стоит вспомнить, что у подтверждённых AI-поисковиков (Perplexity, OpenAI) есть собственные уникальные токены, и если бы это был один из них, он бы так и назывался.

3. Нагрузка и риски именно для AI Search Engine

Отдельной строки в публичной сводке top-bot TrafficVeil у ai search engine может не быть, но в категории «AI и LLM-краулеры» такие агенты дают характерный фон: нагрузка может быть «тихой» — не DDoS в классическом смысле, но постоянный съём HTML и рост bandwidth. Для этого токена риск неопределённости выше среднего: раз нет подтверждённого оператора, нет и способа оценить, оправдывает ли потенциальная выгода (цитирования, трафик) отдачу контента.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти AI Search Engine в логах

Не ищите «просто ботов» — ищите конкретный токен ai search engine и рядом смотрите на настоящие, документированные AI-поисковые краулеры.

# Базовый поиск
grep -i "ai search engine" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверить полную строку UA — есть ли ссылка на реального оператора
grep -io "ai search engine[^\"]*" /var/log/nginx/access.log | sort -u | head

# Сравнить с настоящими, документированными AI-поисковыми краулерами
grep -iE "perplexitybot|oai-searchbot|google-extended" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет, поэтому смотрите на полную строку UA целиком: у реальных AI-поисковиков всегда есть ссылка на документацию оператора (openai.com, perplexity.ai и подобные). Если такой ссылки нет — доверять названию не стоит.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для AI Search Engine

# Жёсткий запрет
User-agent: ai search engine
Disallow: /

# Разрешить всё
User-agent: ai search engine
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: ai search engine
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: ставьте Disallow или 403 для ai search engine, если пользы нет — с учётом отсутствия подтверждённого оператора это разумный default. Если вы всё же хотите быть видимыми для реальных AI-поисковиков, настройте отдельные правила под их настоящие, документированные токены (PerplexityBot, OAI-SearchBot и подобные), а не под этот обобщённый.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "ai search engine") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=aisearchengine:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "ai search engine") {
        limit_req zone=aisearchengine burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ai search engine [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите ai search engine в ботах домена или в /system/bots;
  • Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
  • Allow только при явной, подтверждённой пользе — и отдельно проверьте, не стоило бы вместо этого настроить правила под реальные AI-поисковики;
  • После изменения сверьте логи: хиты ai search engine должны уйти в блок или лимит, а настоящие документированные AI-краулеры (если вы хотите их видимость) — остаться без изменений.

7. Рекомендации: что делать с AI Search Engine

  • Если пользы нет — Disallow/403 для ai search engine, если пользы нет;
  • Если цель — видимость в AI-ответах, настройте правила под настоящие токены (PerplexityBot, OAI-SearchBot, Google-Extended), а не под этот обобщённый;
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: скорее всего ничего не теряете в смысле цитирований в AI-ответах, поскольку настоящие AI-поисковики используют другие, собственные токены.

8. С кем не путать AI Search Engine

Бот / сосед Кластер UA Комментарий
PerplexityBot AI и LLM-краулеры perplexitybot реальный, документированный поисковый краулер Perplexity
OAI-SearchBot AI и LLM-краулеры oai-searchbot реальный поисковый краулер OpenAI, отдельный от тренировочного GPTBot
Google-Extended AI и LLM-краулеры google-extended реальный токен Google для генеративных AI-продуктов
AI Article Writer AI и LLM-краулеры ai article writer такой же обобщённый токен без единого подтверждённого оператора
AI Content Detector AI и LLM-краулеры ai content detector такой же обобщённый токен без единого подтверждённого оператора

9. Стратегия allow/deny для AI Search Engine

Ситуация Действие
Хотите видимость в реальных AI-ответах Настроить правила под настоящие токены (PerplexityBot, OAI-SearchBot и подобные), не под ai search engine
Только мешает и жрёт ресурсы Disallow + запрет в TrafficVeil
Нужен доступ, но пики по ночам Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Высокое по умолчанию — обобщённое имя без подтверждённой связи с оператором скорее повод для проверки, чем для доверия

Частые вопросы

AI Search Engine — это Perplexity, ChatGPT или другой известный AI-поисковик?
Нет, ни один из реальных AI-поисковиков не использует эту обобщённую фразу как свой User-Agent — у каждого есть собственное уникальное документированное имя.
Как называются настоящие AI-поисковые краулеры?
PerplexityBot у Perplexity, OAI-SearchBot у OpenAI (отдельно от тренировочного GPTBot), Google-Extended у Google — у всех есть first-party документация под их собственным именем.
Если хочу цитирования в AI-ответах, что мне разрешать в robots.txt?
Настоящие документированные токены — PerplexityBot, OAI-SearchBot, Google-Extended и подобные, а не обобщённый ai search engine, который не гарантирует связи ни с одним из них.
Стоит ли по умолчанию блокировать этот токен?
Да, при отсутствии дополнительных подтверждений это разумный default — как и для других обобщённых AI-имён без единого верифицированного оператора.
Как проверить полную строку UA на признаки настоящего оператора?
Смотреть на наличие ссылки на официальный домен (openai.com, perplexity.ai) — у реальных AI-поисковиков она есть всегда, у обобщённых токенов обычно отсутствует.
Потеряю ли я цитирования в AI-ответах, заблокировав ai search engine?
Скорее всего нет — настоящие AI-поисковики используют другие, собственные токены, поэтому блокировка этого обобщённого имени на них не влияет.
#AI Search Engine#PerplexityBot#OAI-SearchBot#Google-Extended#generic-боты#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil