AI Search Engine стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «AI и LLM-краулеры». Важное уточнение по итогам проверки: реальные AI-поисковики идентифицируют себя конкретными, документированными именами — PerplexityBot у Perplexity, OAI-SearchBot у OpenAI, Google-Extended у Google и подобные — а не обобщённой фразой «AI Search Engine». Это тот же тип записи, что и соседние токены из этой же категории («AI Article Writer», «AI Dungeon», «AI Content Detector») — узнаваемое по смыслу название без привязки к единому подтверждённому оператору.
1. Что такое AI Search Engine
У всех крупных, реально задокументированных AI-поисковых краулеров есть собственные, уникальные имена и first-party страницы с описанием: PerplexityBot — для поискового движка Perplexity, OAI-SearchBot — отдельный поисковый краулер OpenAI (не путать с тренировочным GPTBot), Google-Extended — токен Google для генеративных продуктов. Обобщённая фраза «AI Search Engine» в этот ряд не входит ни у одного из известных операторов — это скорее описательное имя, которое встречается в широких community-блоклистах AI-ботов вместе с сотнями похожих generic-записей.
| Название | AI Search Engine |
| User-Agent / паттерн | ai search engine |
| Оператор | Не установлен — ни один из известных операторов реальных AI-поисковиков (Perplexity, OpenAI, Google) не использует именно эту обобщённую фразу как свой UA |
| Роль | По шаблону категории — наполнение AI-индекса; но без подтверждённого оператора нельзя сказать, что за конкретным продуктом или пайплайном стоит этот токен |
| Документация / ориентир | Публичной документации для этого конкретного токена не найдено; для сравнения — у настоящих AI-поисковиков документация всегда есть под их собственным уникальным именем |
| Список IP | ❌ Официального списка нет |
| robots.txt | Поведение непредсказуемо — нет подтверждённого единого оператора, который мог бы задать политику |
| Пометка TrafficVeil | Легитимный / AI и LLM-краулеры — присвоено по шаблону категории, конкретных оснований для доверия меньше, чем для документированных AI-краулеров вроде PerplexityBot |
2. Зачем AI Search Engine приходит на сайт
Шаблонное объяснение категории — ваш контент интересен как сырьё для AI-продукта. Возможно, это и так, но стоит понимать: раз конкретный оператор не подтверждён, невозможно оценить ни цель использования данных, ни то, приведёт ли присутствие в чьём-то индексе к цитированию с атрибуцией (как это делают документированные AI-поисковики вроде Perplexity) или контент просто уйдёт в закрытый пайплайн без всякой отдачи.
- Какие зоны чаще трогает: /blog/, /product/, /category/, /news/, /api/ (если открыто), пагинация каталога;
- Что ищет: контент, метаданные, availability или ссылочный граф — конкретная цель не подтверждена официальной документацией;
- Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн.
Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по ai search engine показывает системный обход блога, каталога и новостей — прежде чем решить, что «раз это AI-поисковик, стоит разрешить ради цитирований», стоит вспомнить, что у подтверждённых AI-поисковиков (Perplexity, OpenAI) есть собственные уникальные токены, и если бы это был один из них, он бы так и назывался.
3. Нагрузка и риски именно для AI Search Engine
Отдельной строки в публичной сводке top-bot TrafficVeil у ai search engine может не быть, но в категории «AI и LLM-краулеры» такие агенты дают характерный фон: нагрузка может быть «тихой» — не DDoS в классическом смысле, но постоянный съём HTML и рост bandwidth. Для этого токена риск неопределённости выше среднего: раз нет подтверждённого оператора, нет и способа оценить, оправдывает ли потенциальная выгода (цитирования, трафик) отдачу контента.
4. Как найти AI Search Engine в логах
Не ищите «просто ботов» — ищите конкретный токен ai search engine и рядом смотрите на настоящие, документированные AI-поисковые краулеры.
# Базовый поиск
grep -i "ai search engine" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "ai search engine" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверить полную строку UA — есть ли ссылка на реального оператора
grep -io "ai search engine[^\"]*" /var/log/nginx/access.log | sort -u | head
# Сравнить с настоящими, документированными AI-поисковыми краулерами
grep -iE "perplexitybot|oai-searchbot|google-extended" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет, поэтому смотрите на полную строку UA целиком: у реальных AI-поисковиков всегда есть ссылка на документацию оператора (openai.com, perplexity.ai и подобные). Если такой ссылки нет — доверять названию не стоит.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для AI Search Engine
# Жёсткий запрет
User-agent: ai search engine
Disallow: /
# Разрешить всё
User-agent: ai search engine
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: ai search engine
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: ставьте Disallow или 403 для ai search engine, если пользы нет — с учётом отсутствия подтверждённого оператора это разумный default. Если вы всё же хотите быть видимыми для реальных AI-поисковиков, настройте отдельные правила под их настоящие, документированные токены (PerplexityBot, OAI-SearchBot и подобные), а не под этот обобщённый.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "ai search engine") {
return 403;
}
limit_req_zone $binary_remote_addr zone=aisearchengine:10m rate=10r/m;
location / {
if ($http_user_agent ~* "ai search engine") {
limit_req zone=aisearchengine burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ai search engine [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите ai search engine в ботах домена или в /system/bots;
- Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
- Allow только при явной, подтверждённой пользе — и отдельно проверьте, не стоило бы вместо этого настроить правила под реальные AI-поисковики;
- После изменения сверьте логи: хиты ai search engine должны уйти в блок или лимит, а настоящие документированные AI-краулеры (если вы хотите их видимость) — остаться без изменений.
7. Рекомендации: что делать с AI Search Engine
- Если пользы нет — Disallow/403 для ai search engine, если пользы нет;
- Если цель — видимость в AI-ответах, настройте правила под настоящие токены (PerplexityBot, OAI-SearchBot, Google-Extended), а не под этот обобщённый;
- Если нагрузка мешает — сначала rate-limit, затем полный запрет;
- Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
- Что будет при блокировке: скорее всего ничего не теряете в смысле цитирований в AI-ответах, поскольку настоящие AI-поисковики используют другие, собственные токены.
8. С кем не путать AI Search Engine
| Бот / сосед | Кластер | UA | Комментарий |
| PerplexityBot | AI и LLM-краулеры | perplexitybot | реальный, документированный поисковый краулер Perplexity |
| OAI-SearchBot | AI и LLM-краулеры | oai-searchbot | реальный поисковый краулер OpenAI, отдельный от тренировочного GPTBot |
| Google-Extended | AI и LLM-краулеры | google-extended | реальный токен Google для генеративных AI-продуктов |
| AI Article Writer | AI и LLM-краулеры | ai article writer | такой же обобщённый токен без единого подтверждённого оператора |
| AI Content Detector | AI и LLM-краулеры | ai content detector | такой же обобщённый токен без единого подтверждённого оператора |
9. Стратегия allow/deny для AI Search Engine
| Ситуация | Действие |
| Хотите видимость в реальных AI-ответах | Настроить правила под настоящие токены (PerplexityBot, OAI-SearchBot и подобные), не под ai search engine |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil |
| Нужен доступ, но пики по ночам | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Высокое по умолчанию — обобщённое имя без подтверждённой связи с оператором скорее повод для проверки, чем для доверия |