ApifyBot стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «Прочие краулеры и сервисы». ApifyBot принадлежит Apify — известной платформе веб-скрапинга и автоматизации, на которой тысячи разработчиков и компаний запускают собственные скрипты-боты (на платформе их называют «Actors») для самых разных задач: от SEO-аудита robots.txt конкурентов до сбора данных под LLM и RAG-приложения. Оператор: Apify — платформа веб-скрапинга и автоматизации. Классификация: сама компания хорошо документирована и даже продаёт собственные инструменты для аудита robots.txt чужих краулеров, но конкретная цель визита под этим UA может сильно различаться от случая к случаю — на платформе одновременно работают тысячи разных клиентов с разными задачами.
Что такое ApifyBot
| Параметр | Значение |
|---|---|
| Название | ApifyBot |
| User-Agent / паттерн | Mozilla/5.0 (compatible; ApifyBot/1.0; +https://apify.com/bot) |
| Оператор | Apify — платформа веб-скрапинга и автоматизации |
| Роль | Собирает данные сайта для широкого круга задач клиентов платформы: сбор контента для AI/LLM, RAG-пайплайнов, автоматизации workflow и аналитики |
| Документация / ориентир | apify.com/bot |
| Список IP | ❌ Редко бывает отдельный полный список именно для этого UA; проверяйте ASN/поведение и не доверяйтесь только строке UA |
| robots.txt | Крупные операторы чаще соблюдают; технические клиенты и user-initiated fetchers — не всегда |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Не путать с ApifyWebsiteContentCrawler
У того же оператора есть отдельный, широко используемый инструмент — ApifyWebsiteContentCrawler, конкретный Actor платформы Apify, который извлекает и скачивает полное содержимое сайта, конвертируя его в markdown специально для LLM-приложений. Это не то же самое, что общий ApifyBot: если видите в логах именно этот токен, речь идёт о более целенаправленном, глубоком скрапинге контента под конкретную AI-задачу, а не об общем сервисном обходе.
Зачем ApifyBot приходит на сайт
ApifyBot выполняет сервисный автоматический обход с идентификатором apifybot.
- Какие зоны чаще трогает: публичные URL, иногда API и статику
- Что ищет: контент, метаданные, availability или ссылочный граф — в логике категории «Прочие краулеры и сервисы»
- Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн
Типичный кейс: ночью RPS растёт, конверсий нет. В access.log доминирует apifybot на пагинации и карточках. После rate-limit/запрета в TrafficVeil origin остывает, а SEO-роботы Google/Yandex продолжают ходить. Важно понимать: поскольку Apify — общая платформа для тысяч разных клиентов, задача конкретного визита ApifyBot может быть какой угодно — от легитимного SEO-аудита вашего же сайта (если вы или ваше агентство используете Apify) до стороннего сбора данных без вашего ведома. Одно и то же имя бота не гарантирует одинаковое намерение при разных визитах.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка и риски именно для ApifyBot
Отдельной строки в публичной сводке top-bot TrafficVeil у apifybot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на служебных или листовых страницах.
Как найти ApifyBot в логах
# Базовый поиск
grep -i "apifybot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "apifybot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "apifybot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "apifybot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отделить ApifyBot от ApifyWebsiteContentCrawler и похожих строк
grep -iE "apifybot|apifywebsitecontentcrawler" /var/log/nginx/access.log | \
sed -n 's/.*"\([^"]*\)".*/\1/p' | sort | uniq -c | sort -rn
Верификация
Подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку: UA + ASN/IP + частоту + набор URL. Если оператор публикует диапазоны — сверяйте их; если нет, опирайтесь на поведение и политику TrafficVeil.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для ApifyBot
# Жёсткий запрет
User-agent: ApifyBot
Disallow: /
# Разрешить всё
User-agent: ApifyBot
Allow: /
# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: ApifyBot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
# Если нужно отдельно контролировать content-краулер того же оператора:
User-agent: ApifyWebsiteContentCrawler
Disallow: /
Важно: Disallow/403 для apifybot, если пользы нет. Если агент игнорирует robots.txt, переходите к nginx/Apache или запрету в TrafficVeil.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "apifybot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=apifybot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "apifybot") {
limit_req zone=apifybot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} apifybot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите apifybot / ApifyBot в ботах домена или в /system/bots
- Для нежелательного сценария — категория «запретить»; для мягкого — rate-limit
- Allow только при явной пользе от ApifyBot — например, если вы сами или ваше агентство используете Apify для аудита собственного сайта
- После изменения сверьте логи: хиты ApifyBot должны уйти в блок/лимит, а нужные поисковики остаться
Рекомендации: что делать с ApifyBot
- Если пользы нет — Disallow/403 для apifybot
- Если польза есть (свой аккаунт Apify для SEO-аудита или мониторинга) — Allow только при явной пользе от ApifyBot
- Если нагрузка мешает — сначала rate-limit, затем полный запрет
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot - Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент
С кем не путать ApifyBot
| Бот / сосед | Оператор | Комментарий |
|---|---|---|
| ApifyWebsiteContentCrawler | Apify (тот же) | Отдельный Actor для глубокого извлечения контента сайта под LLM-задачи — не общий сервисный обход, а целенаправленный сбор |
| Diffbot | Diffbot | Другой оператор — структурирует контент через AI-визуальное понимание для knowledge graph, не связан с Apify |
| FirecrawlAgent | Firecrawl | Другой оператор — извлекает контент под LLM/AI-приложения, независимая платформа |
Стратегия allow/deny для ApifyBot
| Ситуация | Действие |
|---|---|
| Нужна польза от оператора (свой SEO-аудит через Apify) | Allow + закрыть /admin /cart /api |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil |
| Нужен доступ, но пики по ночам | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP/ASN и поведение |
Частые вопросы
Кто оператор ApifyBot и насколько он публично известен?
Почему цель визита ApifyBot может отличаться от случая к случаю?
Чем ApifyWebsiteContentCrawler отличается от обычного ApifyBot?
Может ли ApifyBot быть связан с моим же аккаунтом на платформе?
Публикует ли Apify официальный список IP для верификации ApifyBot?
Что будет, если заблокировать ApifyBot на сайте без Apify-аккаунта?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.