ApifyWebsiteContentCrawler стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «Прочие краулеры и сервисы». Но прежде чем настраивать единое правило под этот токен, стоит знать: за одинаковым названием может стоять сразу несколько разных инструментов.
Не один продукт, а целое семейство похожих Actor'ов
На маркетплейсе Apify одновременно существует множество независимых, конкурирующих между собой инструментов с почти идентичным названием — «Website Content Crawler», «Website to Markdown» и похожие вариации, опубликованные разными сторонними разработчиками. У каждого свой движок, своя реализация проверки robots.txt, своя логика работы. Один из таких конкурентов даже прямо рекламирует себя фразой «robots.txt always on» — подразумевая, что у части других похожих инструментов это не гарантировано по умолчанию. Есть и официальный Actor от самой компании Apify (apify/website-content-crawler) — именно его строка UA ApifyWebsiteContentCrawler/1.0 зафиксирована в каталоге Cloudflare Radar. У него современная криптографическая подпись запросов через протокол Web Bot Auth (HTTP Message Signatures, публикуемый ключ по адресу api.apify.com/.well-known/http-message-signatures-directory), и он классифицируется как «direct access» — то есть управляется напрямую самой Apify, а не настройками конечного пользователя платформы.
Что такое ApifyWebsiteContentCrawler
| Параметр | Значение |
|---|---|
| Название | ApifyWebsiteContentCrawler |
| User-Agent / паттерн | apifywebsitecontentcrawler (официальный вариант — ApifyWebsiteContentCrawler/1.0 (+https://apify.com/apify/website-content-crawler)) |
| Оператор | Apify как платформа реальна и хорошо документирована, но конкретный токен может принадлежать как официальному Actor'у самой Apify, так и одному из множества похожих сторонних инструментов на её маркетплейсе |
| Роль | Комплексный обход сайта с извлечением текстового содержимого и конвертацией в Markdown — специально под LLM/RAG-пайплайны, векторные базы, базы знаний |
| Документация / ориентир | apify.com/apify/website-content-crawler — официальный Actor; десятки похожих неофициальных вариантов от сторонних разработчиков той же платформы |
| Список IP | ❌ Редко бывает отдельный полный список именно для этого UA; проверяйте ASN/официальные диапазоны оператора и не доверяйте только строке UA |
| robots.txt | У официального Actor'а поддержка есть, но опциональна и, по собственной документации Apify, пока не использует специфический идентификатор UA и не поддерживает Crawl-delay. У сторонних клонов поведение может кардинально различаться — один из конкурентов даже рекламирует себя фразой «robots.txt always on», намекая, что это не гарантировано у аналогов |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Зачем ApifyWebsiteContentCrawler приходит на сайт
ApifyWebsiteContentCrawler выполняет сервисный автоматический обход с идентификатором apifywebsitecontentcrawler.
- Какие зоны чаще трогает: публичные URL, иногда API и статику
- Что ищет: контент, метаданные, availability или ссылочный граф — в логике категории «Прочие краулеры и сервисы»; конкретно этот инструмент нацелен на извлечение чистого текста для скармливания языковым моделям
- Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн
Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по apifywebsitecontentcrawler показывает, что бот вычитывает разделы: публичные URL, иногда API и статику.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка и риски именно для ApifyWebsiteContentCrawler
Отдельной строки в публичной сводке top-bot TrafficVeil у apifywebsitecontentcrawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на служебных или листовых страницах. Учитывая, что за токеном может стоять любой из множества похожих сторонних инструментов, паттерн поведения может заметно различаться от одного визита к другому.
Как найти ApifyWebsiteContentCrawler в логах
# Базовый поиск
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "apifywebsitecontentcrawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Подделать User-Agent может любой скрипт. Для официального Actor'а Apify дополнительно доступна криптографическая верификация через Web Bot Auth (проверка подписи по ключу с api.apify.com/.well-known/http-message-signatures-directory) — но она применима только к официальному инструменту, а не к сторонним клонам с похожим названием. Для остальных случаев смотрите связку UA + ASN/IP + частоту + набор URL.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для ApifyWebsiteContentCrawler
# Жёсткий запрет
User-agent: apifywebsitecontentcrawler
Disallow: /
# Разрешить всё
User-agent: apifywebsitecontentcrawler
Allow: /
# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: apifywebsitecontentcrawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: Disallow/403 для apifywebsitecontentcrawler, если пользы нет. Учитывая, что за токеном может стоять любой из множества похожих сторонних Actor'ов с разной степенью уважения к robots.txt, не удивляйтесь, если один визит уважает запрет, а другой — полностью его игнорирует. Если агент игнорирует robots.txt, переходите к nginx/Apache или запрету в TrafficVeil.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "apifywebsitecontentcrawler") {
return 403;
}
limit_req_zone $binary_remote_addr zone=apifywebsiteconten:10m rate=10r/m;
location / {
if ($http_user_agent ~* "apifywebsitecontentcrawler") {
limit_req zone=apifywebsiteconten burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} apifywebsitecontentcrawler [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите apifywebsitecontentcrawler / ApifyWebsiteContentCrawler в ботах домена или в /system/bots
- Для нежелательного сценария — категория «запретить»; для мягкого — rate-limit
- Allow только при явной пользе от ApifyWebsiteContentCrawler
- После изменения сверьте логи: хиты ApifyWebsiteContentCrawler должны уйти в блок/лимит, а нужные поисковики остаться
Рекомендации: что делать с ApifyWebsiteContentCrawler
- Если пользы нет — Disallow/403 для apifywebsitecontentcrawler
- Если польза есть — Allow только при явной пользе от ApifyWebsiteContentCrawler
- Если нагрузка мешает — сначала rate-limit, затем полный запрет
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot - Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент
С кем не путать ApifyWebsiteContentCrawler
| Бот / сосед | Кластер | UA | Комментарий |
|---|---|---|---|
| ApifyBot | Прочие краулеры и сервисы | apifybot | Общий сервисный краулер той же платформы, отдельный от специализированного content-краулера |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
Стратегия allow/deny для ApifyWebsiteContentCrawler
| Ситуация | Действие |
|---|---|
| Нужна польза от оператора (известный и проверенный конкретный случай) | Allow + закрыть /admin /cart /api |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil |
| Нужен доступ, но пики по ночам | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP/ASN и поведение |
Частые вопросы
Один ли это инструмент или несколько разных под одним названием?
Чем официальный Actor Apify отличается от сторонних клонов?
Поддерживает ли официальный краулер директиву Crawl-delay?
Можно ли доверять заявлению «robots.txt always on» у одного из сторонних инструментов?
Как проверить подлинность именно официального Actor'а Apify?
Стоит ли ожидать одинакового поведения при каждом визите ApifyWebsiteContentCrawler?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.