Anyword в логах легко спутать с массовым AI-краулером вроде GPTBot — черновая категория «AI и LLM-краулеры» намекает именно на это. Но реальная компания за этим именем — Anyword (anyword.com), известная AI-платформа предиктивного копирайтинга для маркетологов, а не поставщик данных для обучения языковых моделей. Судя по устройству её продукта, обращения к сайтам, скорее всего, привязаны к конкретному действию конкретного пользователя платформы, а не к фоновому массовому обходу веба.
1. Что такое Anyword на самом деле
Anyword — SaaS-платформа для маркетологов, которая генерирует и предсказывает эффективность рекламных текстов: заголовки, объявления, email, посты в соцсетях. Ключевая функция, которая, вероятно, объясняет обращения к сторонним сайтам — Brand Vocabulary и Tone of Voice Insights: клиент платформы загружает раздел брендбука в формате PDF или URL, и Anyword автоматически превращает его в модель фирменного словаря и тона голоса, которая затем используется для генерации на-брендовых текстов.
Официальной документации по краулеру или списка IP-диапазонов у Anyword не нашлось. Но по функции продукта картина складывается иначе, чем в черновике: это не постоянный фоновый обход блога/каталога ради «сырья для AI-пайплайна», а разовая выборка страницы, которую конкретный клиент платформы явно указал системе — саму свою страницу с брендбуком, посадочную страницу для анализа тона или конкурента для сравнения.
| Параметр | Значение |
| Название | Anyword |
| Оператор | Anyword (anyword.com) — платформа предиктивного AI-копирайтинга для маркетологов |
| Вероятная роль | Пользовательский fetcher, привязанный к действию клиента платформы (импорт брендбука/URL для Brand Vocabulary, анализ тона голоса, сравнение с конкурентом) — а не фоновый массовый сбор данных для обучения модели |
| User-Agent / паттерн | anyword |
| Официальная документация | Отсутствует |
| robots.txt | Нет публичных данных о соблюдении |
| Пометка TrafficVeil | Легитимный / AI и LLM-краулеры — категория условно верна по типу компании, но логика поведения ближе к user-triggered fetcher, чем к training-краулеру вроде GPTBot (см. раздел 8) |
2. Зачем Anyword приходит на сайт
- клиент платформы загружает URL страницы с брендбуком или гайдлайнами, чтобы Anyword построил модель Brand Vocabulary для его аккаунта;
- клиент анализирует тон голоса существующего контента (своего или чужого — например, для сравнения с конкурентом) через функцию Tone of Voice Insights;
- в отличие от training-краулеров, которые системно проходят /blog/, /product/, /category/ по расписанию, эти запросы, вероятнее всего, единичны и привязаны к конкретному моменту, когда пользователь платформы указал именно этот URL.
Если в логах фиксируется постоянный систематический обход широкого набора страниц сайта, а не единичные точечные запросы к конкретным URL — это может говорить и о другом сценарии использования, который не описан в открытых источниках платформы; в таком случае стоит опираться на наблюдаемое поведение, а не на предположение о разовом fetcher-запросе.
3. Нагрузка и риски
Если гипотеза о user-triggered fetcher верна, нагрузка от Anyword должна быть эпизодической и точечной — по одному-два запроса на конкретный URL, а не систематический краулинг каталога. Формулировка черновика про «рискуете отдать уникальные тексты... в чужой AI-контур без кликов и атрибуции» больше подходит для bulk-краулеров вроде GPTBot, которые системно индексируют контент для обучения модели — для user-triggered fetcher это не совсем точное описание риска: здесь скорее конкретный пользователь Anyword (возможно, ваш конкурент) разово анализирует именно вашу страницу для собственных маркетинговых целей.
Тем не менее, поскольку официальной документации нет, нельзя полностью исключить и более широкий сбор данных для тренировки предиктивных моделей платформы — Anyword прямо заявляет о предиктивной аналитике эффективности текстов, для которой в принципе нужен большой массив примеров реальных рекламных текстов.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти Anyword в логах
# Базовый поиск
grep -i "anyword" /var/log/nginx/access.log
# Топ URL — если гипотеза о fetcher верна, ожидаем немного точечных URL, а не широкий обход
grep -i "anyword" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "anyword" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность — эпизодические точечные хиты vs регулярный фон
grep -i "anyword" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверка гипотезы: сколько уникальных URL всего запрошено этим UA
grep -i "anyword" /var/log/nginx/access.log | awk '{print $7}' | sort -u | wc -l
Верификация. Строку UA подделать может любой скрипт. Для решения allow/deny смотрите связку UA + IP/ASN + частоту + набор URL — при отсутствии официальных диапазонов для Anyword это единственный доступный способ:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Anyword
# Жёсткий запрет
User-agent: anyword
Disallow: /
# Разрешить всё
User-agent: anyword
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: anyword
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "anyword") {
return 403;
}
limit_req_zone $binary_remote_addr zone=anyword:10m rate=10r/m;
location / {
if ($http_user_agent ~* "anyword") {
limit_req zone=anyword burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} anyword [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите anyword в разделе ботов домена или в /system/bots;
- если наблюдаемый паттерн — единичные запросы к конкретным URL, а не системный обход — это, скорее всего, безобидный разовый fetcher по чужому пользовательскому запросу, и жёсткая блокировка не даст заметного эффекта на общую нагрузку;
- если наблюдается систематический обход каталога/блога — это не соответствует ожидаемому паттерну user-triggered fetcher, и здесь уже уместнее относиться к боту как к обычному AI-краулеру и решать по стандартной логике категории;
- после изменения сверьте логи: хиты Anyword должны уйти в блок/лимит, а нужные поисковики остаться.
7. Что делать: короткий алгоритм
- Сначала посмотрите на паттерн: единичные точечные URL или широкий систематический обход — от этого зависит вся дальнейшая логика;
- Паттерн точечный, нагрузка минимальна — можно не трогать, реального риска для контента как при training-краулерах здесь меньше;
- Паттерн широкий и системный — относитесь как к обычному AI-краулеру: Disallow, если польза не нужна;
- Нагрузка мешает независимо от паттерна — rate-limit как промежуточный шаг;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. Открытый вопрос по категоризации
Категория «AI и LLM-краулеры» формально не ошибочна — Anyword действительно AI-компания. Но стоит иметь в виду принципиальное различие внутри этой категории: training-краулеры (GPTBot, ClaudeBot, CCBot) системно обходят веб для обучения моделей и создают предсказуемый фоновый паттерн, а user-triggered fetcher-ы (к этому типу, судя по функциям продукта, ближе Anyword) делают точечные запросы по прямому указанию конечного пользователя платформы. Возможно, для таких ботов стоит завести отдельную под-категорию с иной логикой оценки риска — на данный момент оставляю это на ваше усмотрение.
| Бот / сосед | Кластер | UA | Комментарий |
| GPTBot | AI и LLM-краулеры | gptbot | Настоящий training-краулер с системным фоновым обходом — отличается от вероятной модели поведения Anyword |
| ChatGPT-User | AI и LLM-краулеры | chatgpt-user | Официально задокументированный user-triggered fetcher — ближайший по логике аналог предполагаемого поведения Anyword |
| PerplexityBot | AI и LLM-краулеры | perplexitybot | Training/индексирующий краулер, документирован официально |
| AI Article Writer | AI и LLM-краулеры (черновая запись) | ai article writer | Расплывчатое название без подтверждённого оператора — стоит проверить так же, как ранее проверялся SEO Robot |
9. Стратегия allow/deny для Anyword
| Ситуация | Действие |
| Паттерн точечный, единичные URL, минимальная нагрузка | Не трогать — похоже на безобидный разовый fetcher по запросу стороннего пользователя платформы |
| Паттерн широкий, систематический обход каталога/блога | Disallow + запрет в TrafficVeil, если польза не нужна — вести себя как с обычным AI-краулером |
| Нужен доступ, но пики нерегулярны | Rate-limit на nginx/TrafficVeil |
| Хотите цитирования/упоминания через Anyword-контур | Allow, но это не подтверждённая функция платформы — скорее гипотетический сценарий |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP/ASN и то, насколько узкий или широкий набор URL запрашивается |
Частые вопросы
Anyword собирает контент моего сайта для обучения своей AI-модели?
Чем это отличается от GPTBot или других AI-краулеров?
Как на практике отличить один паттерн от другого?
Соблюдает ли Anyword правила robots.txt?
Значит ли это, что Anyword можно не блокировать?
Есть ли официальная документация по этому крауleру от самой Anyword?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.