Боты5 мин чтения·10 августа 2026 г.

ApifyBot: один бренд, тысячи разных задач за ним

За ApifyBot стоит известная платформа автоматизации, а не анонимный оператор — но конкретная цель визита каждый раз может быть другой, потому что на платформе работают тысячи разных клиентов. Разбираем отличие от ApifyWebsiteContentCrawler.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота ApifyBot: нежелательный прочие краулеры и сервисы

ApifyBot стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «Прочие краулеры и сервисы». ApifyBot принадлежит Apify — известной платформе веб-скрапинга и автоматизации, на которой тысячи разработчиков и компаний запускают собственные скрипты-боты (на платформе их называют «Actors») для самых разных задач: от SEO-аудита robots.txt конкурентов до сбора данных под LLM и RAG-приложения. Оператор: Apify — платформа веб-скрапинга и автоматизации. Классификация: сама компания хорошо документирована и даже продаёт собственные инструменты для аудита robots.txt чужих краулеров, но конкретная цель визита под этим UA может сильно различаться от случая к случаю — на платформе одновременно работают тысячи разных клиентов с разными задачами.

Что такое ApifyBot

Параметр Значение
Название ApifyBot
User-Agent / паттерн Mozilla/5.0 (compatible; ApifyBot/1.0; +https://apify.com/bot)
Оператор Apify — платформа веб-скрапинга и автоматизации
Роль Собирает данные сайта для широкого круга задач клиентов платформы: сбор контента для AI/LLM, RAG-пайплайнов, автоматизации workflow и аналитики
Документация / ориентир apify.com/bot
Список IP ❌ Редко бывает отдельный полный список именно для этого UA; проверяйте ASN/поведение и не доверяйтесь только строке UA
robots.txt Крупные операторы чаще соблюдают; технические клиенты и user-initiated fetchers — не всегда
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

Не путать с ApifyWebsiteContentCrawler

У того же оператора есть отдельный, широко используемый инструмент — ApifyWebsiteContentCrawler, конкретный Actor платформы Apify, который извлекает и скачивает полное содержимое сайта, конвертируя его в markdown специально для LLM-приложений. Это не то же самое, что общий ApifyBot: если видите в логах именно этот токен, речь идёт о более целенаправленном, глубоком скрапинге контента под конкретную AI-задачу, а не об общем сервисном обходе.

Зачем ApifyBot приходит на сайт

ApifyBot выполняет сервисный автоматический обход с идентификатором apifybot.

  • Какие зоны чаще трогает: публичные URL, иногда API и статику
  • Что ищет: контент, метаданные, availability или ссылочный граф — в логике категории «Прочие краулеры и сервисы»
  • Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн

Типичный кейс: ночью RPS растёт, конверсий нет. В access.log доминирует apifybot на пагинации и карточках. После rate-limit/запрета в TrafficVeil origin остывает, а SEO-роботы Google/Yandex продолжают ходить. Важно понимать: поскольку Apify — общая платформа для тысяч разных клиентов, задача конкретного визита ApifyBot может быть какой угодно — от легитимного SEO-аудита вашего же сайта (если вы или ваше агентство используете Apify) до стороннего сбора данных без вашего ведома. Одно и то же имя бота не гарантирует одинаковое намерение при разных визитах.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка и риски именно для ApifyBot

Отдельной строки в публичной сводке top-bot TrafficVeil у apifybot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на служебных или листовых страницах.

Как найти ApifyBot в логах

# Базовый поиск
grep -i "apifybot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "apifybot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "apifybot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "apifybot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить ApifyBot от ApifyWebsiteContentCrawler и похожих строк
grep -iE "apifybot|apifywebsitecontentcrawler" /var/log/nginx/access.log | \
  sed -n 's/.*"\([^"]*\)".*/\1/p' | sort | uniq -c | sort -rn

Верификация

Подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку: UA + ASN/IP + частоту + набор URL. Если оператор публикует диапазоны — сверяйте их; если нет, опирайтесь на поведение и политику TrafficVeil.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для ApifyBot

# Жёсткий запрет
User-agent: ApifyBot
Disallow: /

# Разрешить всё
User-agent: ApifyBot
Allow: /

# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: ApifyBot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

# Если нужно отдельно контролировать content-краулер того же оператора:
User-agent: ApifyWebsiteContentCrawler
Disallow: /

Важно: Disallow/403 для apifybot, если пользы нет. Если агент игнорирует robots.txt, переходите к nginx/Apache или запрету в TrafficVeil.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "apifybot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=apifybot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "apifybot") {
        limit_req zone=apifybot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} apifybot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите apifybot / ApifyBot в ботах домена или в /system/bots
  • Для нежелательного сценария — категория «запретить»; для мягкого — rate-limit
  • Allow только при явной пользе от ApifyBot — например, если вы сами или ваше агентство используете Apify для аудита собственного сайта
  • После изменения сверьте логи: хиты ApifyBot должны уйти в блок/лимит, а нужные поисковики остаться

Рекомендации: что делать с ApifyBot

  • Если пользы нет — Disallow/403 для apifybot
  • Если польза есть (свой аккаунт Apify для SEO-аудита или мониторинга) — Allow только при явной пользе от ApifyBot
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot
  • Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент

С кем не путать ApifyBot

Бот / сосед Оператор Комментарий
ApifyWebsiteContentCrawler Apify (тот же) Отдельный Actor для глубокого извлечения контента сайта под LLM-задачи — не общий сервисный обход, а целенаправленный сбор
Diffbot Diffbot Другой оператор — структурирует контент через AI-визуальное понимание для knowledge graph, не связан с Apify
FirecrawlAgent Firecrawl Другой оператор — извлекает контент под LLM/AI-приложения, независимая платформа

Стратегия allow/deny для ApifyBot

Ситуация Действие
Нужна польза от оператора (свой SEO-аудит через Apify) Allow + закрыть /admin /cart /api
Только мешает и жрёт ресурсы Disallow + запрет в TrafficVeil
Нужен доступ, но пики по ночам Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и поведение

Частые вопросы

Кто оператор ApifyBot и насколько он публично известен?
Apify, известная платформа веб-скрапинга и автоматизации — компания хорошо документирована и даже продаёт собственные инструменты для аудита robots.txt чужих краулеров.
Почему цель визита ApifyBot может отличаться от случая к случаю?
Потому что на платформе Apify одновременно работают тысячи разных клиентов с разными задачами — общий бренд бота один, а конкретные намерения за каждым визитом разные.
Чем ApifyWebsiteContentCrawler отличается от обычного ApifyBot?
Это отдельный, более целенаправленный инструмент того же оператора для глубокого извлечения контента сайта специально под LLM-задачи, а не общий сервисный обход.
Может ли ApifyBot быть связан с моим же аккаунтом на платформе?
Да, если вы или ваше агентство используете Apify для SEO-аудита или мониторинга собственного сайта — в этом случае разумно оставить allow.
Публикует ли Apify официальный список IP для верификации ApifyBot?
Нет, отдельного полного списка обычно нет — для проверки подлинности стоит смотреть связку UA, ASN/IP и поведение.
Что будет, если заблокировать ApifyBot на сайте без Apify-аккаунта?
Обычно ничего критичного для SEO не теряете, поскольку это не поисковый краулер и не сервисный агент вашего сайта.
#ApifyBot#Apify#ApifyWebsiteContentCrawler#web scraping платформы#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil