AI Content Detector стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «AI и LLM-краулеры». Важное уточнение по итогам проверки: индустрия AI-детекторов контента реальна и хорошо развита (GPTZero, Copyleaks, Originality.ai, ZeroGPT и другие) — но ни одна из этих известных компаний не задокументирована как оператор краулера именно под буквальным, обобщённым именем «AI Content Detector». Похоже, это тот же тип записи, что и соседние токены («AI Article Writer», «AI Dungeon», «AI Writer») — узнаваемое по смыслу название без привязки к единому подтверждённому оператору.
1. Что такое AI Content Detector
Существующие продукты категории «детектор AI-контента» в основном работают иначе, чем предполагает обобщённое название бота: пользователь сам вставляет текст или загружает документ на проверку через веб-интерфейс или API, а не сервис фоново обходит случайные сайты в поисках контента для анализа. Есть исключение, о котором стоит знать: компания Originality.ai заявляет поддержку полного сканирования сайтов (full site scans) как отдельную функцию для издателей — то есть у части индустрии реальные краулеры действительно существуют, просто, по всей видимости, под собственными именованными UA, а не под общим токеном «AI Content Detector».
| Название | AI Content Detector |
| User-Agent / паттерн | ai content detector |
| Оператор | Не установлен — крупные реальные игроки категории (GPTZero, Copyleaks, Originality.ai) не задокументированы как использующие именно этот буквальный токен |
| Роль | По шаблону категории — наполнение AI-индекса или обучающей/retrieval-выборки; но логика самого продукта «детектор AI-текста» не требует систематического обхода чужих сайтов — обычно это user-initiated проверка конкретного текста |
| Документация / ориентир | Публичной документации для этого конкретного токена не найдено |
| Список IP | ❌ Официального списка нет |
| robots.txt | Поведение непредсказуемо — нет подтверждённого единого оператора, который мог бы задать политику |
| Пометка TrafficVeil | Легитимный / AI и LLM-краулеры — присвоено по шаблону категории, конкретных оснований для доверия меньше, чем для документированных AI-краулеров вроде GPTBot |
2. Зачем AI Content Detector приходит на сайт
Шаблонное объяснение категории — сбор контента для AI-индекса или обучающей выборки, а не ради SEO. Но для этого конкретного токена стоит добавить скепсис: реальные детекторы AI-контента по своей природе работают по запросу пользователя над конкретным текстом, а не через постоянный фоновый обход блогов, каталогов и новостных разделов случайных сайтов. Систематический обход, описанный в типичном кейсе категории, больше похож на поведение краулера для построения датасета, чем на инструмент проверки текста — то есть даже если за токеном стоит реальный игрок рынка AI-детекции, цель его обхода (если он вообще происходит) скорее не совпадает с основной функцией продукта.
- Какие зоны чаще трогает: /blog/, /product/, /category/, /news/, /api/ (если открыто), пагинация каталога;
- Что ищет: контент и метаданные — конкретная цель не подтверждена официальной документацией;
- Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн.
Типичный кейс: ночью RPS растёт, конверсий нет. В access.log доминирует ai content detector на пагинации и карточках — прежде чем расслабленно отнести это к «в целом безобидной AI-категории», стоит вспомнить, что подтверждённой связи с конкретным известным сервисом детекции AI-контента здесь нет.
3. Нагрузка и риски именно для AI Content Detector
Отдельной строки в публичной сводке top-bot TrafficVeil у ai content detector может не быть, но в категории «AI и LLM-краулеры» такие агенты дают характерный фон: риск отдать уникальные тексты, описания товаров и статьи в чужой AI-контур без кликов и атрибуции. Для этого токена риск усилен неопределённостью оператора: раз нет подтверждённой компании, стоящей за именем, невозможно оценить ни её политику использования данных, ни её репутацию.
4. Как найти AI Content Detector в логах
Не ищите «просто ботов» — ищите конкретный токен ai content detector и рядом смотрите соседей по семейству обобщённых AI-имён.
# Базовый поиск
grep -i "ai content detector" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "ai content detector" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "ai content detector" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "ai content detector" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверить полную строку UA — есть ли ссылка на известного игрока рынка (GPTZero, Copyleaks, Originality.ai)
grep -io "ai content detector[^\"]*" /var/log/nginx/access.log | sort -u | head
# Отделить от похожих строк семейства обобщённых AI-имён
grep -iE "ai content detector|ai article writer|ai writer|ai dungeon" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет. Обязательно смотрите полную строку UA целиком: если в ней есть ссылка на реального известного игрока рынка (gptzero.me, copyleaks.com, originality.ai), это меняет картину — но голый токен без такой ссылки не даёт оснований доверять названию.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для AI Content Detector
# Жёсткий запрет
User-agent: ai content detector
Disallow: /
# Разрешить всё
User-agent: ai content detector
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: ai content detector
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: ставьте Disallow или 403 для ai content detector, если пользы нет — с учётом отсутствия подтверждённого оператора это разумный default. Если агент игнорирует robots.txt, переходите к nginx/Apache или запрету в TrafficVeil.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "ai content detector") {
return 403;
}
limit_req_zone $binary_remote_addr zone=aicontentdetector:10m rate=10r/m;
location / {
if ($http_user_agent ~* "ai content detector") {
limit_req zone=aicontentdetector burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ai content detector [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите ai content detector в ботах домена или в /system/bots;
- Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
- Allow только при явной, подтверждённой пользе — и не полагайтесь на «в целом безобидное» звучание названия;
- После изменения сверьте логи: хиты ai content detector должны уйти в блок или лимит, а нужные поисковики остаться.
7. Рекомендации: что делать с AI Content Detector
- Если пользы нет — Disallow/403 для ai content detector, если пользы нет;
- Если польза есть — Allow только при явной пользе от AI Content Detector;
- Если нагрузка мешает — сначала rate-limit, затем полный запрет;
- Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
- Что будет при блокировке: блокировка почти не бьёт по классическому SEO Google/Yandex, зато ограничивает использование контента в неподтверждённом AI-контуре, скрывающемся за узнаваемым по смыслу именем.
8. С кем не путать AI Content Detector
| Бот / сосед | Кластер | UA | Комментарий |
| AI Article Writer | AI и LLM-краулеры | ai article writer | такой же обобщённый токен без единого подтверждённого оператора |
| AI Dungeon | AI и LLM-краулеры | ai dungeon | совпадает с названием реального продукта, но без подтверждённого краулера под этим именем |
| AI SEO Crawler | AI и LLM-краулеры | ai seo crawler | такой же обобщённый токен без единого подтверждённого оператора |
| AI Search Engine | AI и LLM-краулеры | ai search engine | такой же обобщённый токен без единого подтверждённого оператора |
| AI Writer | AI и LLM-краулеры | ai writer | такой же обобщённый токен без единого подтверждённого оператора |
9. Стратегия allow/deny для AI Content Detector
| Ситуация | Действие |
| Нужна подтверждённая польза от конкретного известного детектора (GPTZero, Copyleaks, Originality.ai) | Allow точечно, только после проверки полного UA на ссылку на официальный домен |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil |
| Нужен доступ, но пики по ночам | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Высокое по умолчанию — обобщённое имя без подтверждённой связи с оператором скорее повод для проверки, чем для доверия |