Боты6 мин чтения·10 августа 2026 г.

ApifyWebsiteContentCrawler: одно имя носят сразу несколько разных ботов

На маркетплейсе Apify под почти одинаковым названием существует целое семейство конкурирующих инструментов с разной политикой robots.txt. Разбираем официальный Actor с криптографической подписью и его многочисленных сторонних тёзок.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота ApifyWebsiteContentCrawler: нежелательный прочие краулеры и сервисы

ApifyWebsiteContentCrawler стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «Прочие краулеры и сервисы». Но прежде чем настраивать единое правило под этот токен, стоит знать: за одинаковым названием может стоять сразу несколько разных инструментов.

Не один продукт, а целое семейство похожих Actor'ов

На маркетплейсе Apify одновременно существует множество независимых, конкурирующих между собой инструментов с почти идентичным названием — «Website Content Crawler», «Website to Markdown» и похожие вариации, опубликованные разными сторонними разработчиками. У каждого свой движок, своя реализация проверки robots.txt, своя логика работы. Один из таких конкурентов даже прямо рекламирует себя фразой «robots.txt always on» — подразумевая, что у части других похожих инструментов это не гарантировано по умолчанию. Есть и официальный Actor от самой компании Apify (apify/website-content-crawler) — именно его строка UA ApifyWebsiteContentCrawler/1.0 зафиксирована в каталоге Cloudflare Radar. У него современная криптографическая подпись запросов через протокол Web Bot Auth (HTTP Message Signatures, публикуемый ключ по адресу api.apify.com/.well-known/http-message-signatures-directory), и он классифицируется как «direct access» — то есть управляется напрямую самой Apify, а не настройками конечного пользователя платформы.

Что такое ApifyWebsiteContentCrawler

Параметр Значение
Название ApifyWebsiteContentCrawler
User-Agent / паттерн apifywebsitecontentcrawler (официальный вариант — ApifyWebsiteContentCrawler/1.0 (+https://apify.com/apify/website-content-crawler))
Оператор Apify как платформа реальна и хорошо документирована, но конкретный токен может принадлежать как официальному Actor'у самой Apify, так и одному из множества похожих сторонних инструментов на её маркетплейсе
Роль Комплексный обход сайта с извлечением текстового содержимого и конвертацией в Markdown — специально под LLM/RAG-пайплайны, векторные базы, базы знаний
Документация / ориентир apify.com/apify/website-content-crawler — официальный Actor; десятки похожих неофициальных вариантов от сторонних разработчиков той же платформы
Список IP ❌ Редко бывает отдельный полный список именно для этого UA; проверяйте ASN/официальные диапазоны оператора и не доверяйте только строке UA
robots.txt У официального Actor'а поддержка есть, но опциональна и, по собственной документации Apify, пока не использует специфический идентификатор UA и не поддерживает Crawl-delay. У сторонних клонов поведение может кардинально различаться — один из конкурентов даже рекламирует себя фразой «robots.txt always on», намекая, что это не гарантировано у аналогов
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

Зачем ApifyWebsiteContentCrawler приходит на сайт

ApifyWebsiteContentCrawler выполняет сервисный автоматический обход с идентификатором apifywebsitecontentcrawler.

  • Какие зоны чаще трогает: публичные URL, иногда API и статику
  • Что ищет: контент, метаданные, availability или ссылочный граф — в логике категории «Прочие краулеры и сервисы»; конкретно этот инструмент нацелен на извлечение чистого текста для скармливания языковым моделям
  • Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн

Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по apifywebsitecontentcrawler показывает, что бот вычитывает разделы: публичные URL, иногда API и статику.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка и риски именно для ApifyWebsiteContentCrawler

Отдельной строки в публичной сводке top-bot TrafficVeil у apifywebsitecontentcrawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на служебных или листовых страницах. Учитывая, что за токеном может стоять любой из множества похожих сторонних инструментов, паттерн поведения может заметно различаться от одного визита к другому.

Как найти ApifyWebsiteContentCrawler в логах

# Базовый поиск
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация

Подделать User-Agent может любой скрипт. Для официального Actor'а Apify дополнительно доступна криптографическая верификация через Web Bot Auth (проверка подписи по ключу с api.apify.com/.well-known/http-message-signatures-directory) — но она применима только к официальному инструменту, а не к сторонним клонам с похожим названием. Для остальных случаев смотрите связку UA + ASN/IP + частоту + набор URL.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для ApifyWebsiteContentCrawler

# Жёсткий запрет
User-agent: apifywebsitecontentcrawler
Disallow: /

# Разрешить всё
User-agent: apifywebsitecontentcrawler
Allow: /

# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: apifywebsitecontentcrawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: Disallow/403 для apifywebsitecontentcrawler, если пользы нет. Учитывая, что за токеном может стоять любой из множества похожих сторонних Actor'ов с разной степенью уважения к robots.txt, не удивляйтесь, если один визит уважает запрет, а другой — полностью его игнорирует. Если агент игнорирует robots.txt, переходите к nginx/Apache или запрету в TrafficVeil.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "apifywebsitecontentcrawler") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=apifywebsiteconten:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "apifywebsitecontentcrawler") {
        limit_req zone=apifywebsiteconten burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} apifywebsitecontentcrawler [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите apifywebsitecontentcrawler / ApifyWebsiteContentCrawler в ботах домена или в /system/bots
  • Для нежелательного сценария — категория «запретить»; для мягкого — rate-limit
  • Allow только при явной пользе от ApifyWebsiteContentCrawler
  • После изменения сверьте логи: хиты ApifyWebsiteContentCrawler должны уйти в блок/лимит, а нужные поисковики остаться

Рекомендации: что делать с ApifyWebsiteContentCrawler

  • Если пользы нет — Disallow/403 для apifywebsitecontentcrawler
  • Если польза есть — Allow только при явной пользе от ApifyWebsiteContentCrawler
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot
  • Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент

С кем не путать ApifyWebsiteContentCrawler

Бот / сосед Кластер UA Комментарий
ApifyBot Прочие краулеры и сервисы apifybot Общий сервисный краулер той же платформы, отдельный от специализированного content-краулера
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный

Стратегия allow/deny для ApifyWebsiteContentCrawler

Ситуация Действие
Нужна польза от оператора (известный и проверенный конкретный случай) Allow + закрыть /admin /cart /api
Только мешает и жрёт ресурсы Disallow + запрет в TrafficVeil
Нужен доступ, но пики по ночам Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и поведение

Частые вопросы

Один ли это инструмент или несколько разных под одним названием?
Несколько: на маркетплейсе Apify независимо друг от друга опубликовано множество конкурирующих Actor'ов с почти идентичным названием «Website Content Crawler», у каждого своя политика и движок.
Чем официальный Actor Apify отличается от сторонних клонов?
У официального есть криптографическая подпись запросов через Web Bot Auth и классификация «direct access», управляемая напрямую самой Apify, а не настройками пользователя.
Поддерживает ли официальный краулер директиву Crawl-delay?
Нет, по собственной документации Apify это пока не реализовано, как и специфический идентификатор User-Agent.
Можно ли доверять заявлению «robots.txt always on» у одного из сторонних инструментов?
Это маркетинговая формулировка конкретного разработчика, которая косвенно намекает, что у аналогичных инструментов других авторов гарантии может не быть.
Как проверить подлинность именно официального Actor'а Apify?
Через проверку криптографической подписи по ключу, публикуемому на api.apify.com/.well-known/http-message-signatures-directory — но это применимо только к официальному инструменту.
Стоит ли ожидать одинакового поведения при каждом визите ApifyWebsiteContentCrawler?
Нет, поскольку за токеном может стоять любой из множества похожих инструментов с разной степенью уважения к robots.txt.
#ApifyWebsiteContentCrawler#Apify#Web Bot Auth#LLM-краулеры#RAG#robots.txt
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil