TrafficVeil
Боты 5 мин25 августа 2026 г.

parsely.com: тот же оператор, что и parse.ly, но своё правило

Токен parsely.com в access.log принадлежит тому же краулеру Parse.ly (сервис контент-аналитики издателей в составе Automattic), что и токен parse.ly — но требует отдельной настройки в системе. Разбираем, почему оба варианта нужно блокировать синхронно, и как настроить allow, rate-limit или запрет через TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое parsely.com
  2. Зачем parsely.com приходит на сайт
  3. Нагрузка и риски именно для parsely.com
  4. Как найти parsely.com в логах
  5. robots.txt для parsely.com
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать parsely.com
  11. Стратегия allow/deny для parsely.com
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Токен parsely.com в access.log принадлежит тому же оператору, что и токен parse.ly, — оба относятся к краулеру компании Parse.ly, сервиса контент-аналитики, основанного в 2009 году и сейчас входящего в состав Automattic (той же компании, что владеет WordPress.com). В системе TrafficVeil это отдельная запись под свой UA-паттерн, поэтому и правило для неё стоит настраивать отдельно, даже если оператор один и тот же.

Что такое parsely.com

Parse.ly — платформа контент-аналитики для издателей: измеряет вовлечённость читателей, эффективность тем и авторов, источники трафика. Официальная документация сервиса описывает поведение краулера подробно: он не исполняет JavaScript и забирает только то, что уже присутствует в исходном HTML-коде страницы, а также группирует разные представления одного материала (например, обычную версию и AMP) через единый canonical URL, чтобы аналитика не дробилась.

Основная аудитория Parse.ly — новостные редакции и контентные издатели. Для сети сайтов, не связанных с журналистикой (в том числе для гемблинг-проектов), визит этого краулера — не типичный сценарий, и прежде чем считать его ожидаемым, стоит уточнить, действительно ли домен подключён к сервису как клиент.

Параметр Значение
Название Parse.ly Crawler (запись parsely.com)
User-Agent / паттерн parsely.com (тот же оператор, что и у паттерна parse.ly; официальная строка: Mozilla/5.0 (compatible; parse.ly scraper/0.16; +http://parsely.com))
Оператор Parse.ly (входит в состав Automattic)
Роль Сбор метаданных из HTML для контент-аналитики: темы, авторы, вовлечённость читателей; не исполняет JS
Документация / ориентир Официальная техническая документация на docs.parse.ly
Список IP ❌ Отдельного публичного списка IP не обнаружено; проверяйте ASN и не доверяйте только строке UA
robots.txt Как крупный оператор с открытой документацией, обычно соблюдает директивы; трафик часто идёт по расписанию, похожему на cron
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

Зачем parsely.com приходит на сайт

Если сайт подключён к Parse.ly, краулер регулярно вычитывает публичные страницы, чтобы обновлять данные о содержании и вовлечённости читателей — часть штатной работы аналитической системы, привязанная к фиксированным интервалам, похожим на cron-задачу. Затрагивает обычно публичные URL, иногда открытый API и статику.

Если интеграции с сервисом нет, наиболее вероятное объяснение — след от прошлого подрядчика, тестовой настройки или редизайна, а не активная связь с текущим сайтом.

Нагрузка и риски именно для parsely.com

Отдельной строки в публичной сводке топ-ботов TrafficVeil у parsely.com может не быть, но для категории «Прочие краулеры и сервисы» в целом характерен фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на:

  • регулярность интервалов — поведение, близкое к cron-задаче, типично для этого краулера;
  • ограниченность набора URL — содержательные публичные страницы, а не весь каталог;
  • отсутствие cookie и признаков сессии.

Как найти parsely.com в логах

Ищите именно этот вариант токена отдельно от parse.ly — в системе это разные записи, и совпадение оператора не означает совпадение правил фильтрации логов.

# Базовый поиск
grep -i "parsely.com" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "parsely.com" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "parsely.com" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "parsely.com" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Официальная строка UA известна и легко сверяется — если заголовок в логах заметно отличается, это повод присмотреться внимательнее. Для окончательного решения смотрите связку UA + ASN/IP + частота + набор URL:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для parsely.com

# Жёсткий запрет
User-agent: parsely.com
Disallow: /

# Разрешить всё
User-agent: parsely.com
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: parsely.com
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Если сайт не является клиентом Parse.ly, полный запрет ничего не сломает — краулер просто перестанет вычитывать страницы, аналитика которых всё равно не используется на вашей стороне. Учитывая, что оператор один и тот же, что и у токена parse.ly, имеет смысл настраивать оба правила синхронно, чтобы не закрыть один вариант UA и оставить открытым другой.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "parsely.com") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=parselycom:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "parsely.com") {
        limit_req zone=parselycom burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} parsely.com [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите parsely.com в ботах домена или в /system/bots — отдельно от записи parse.ly;
  • если сайт не подключён к Parse.ly как клиент — категория «запретить» для обоих вариантов токена; если подключён, но нагрузка мешает — rate-limit;
  • allow оставляйте только при подтверждённой активной подписке на сервис;
  • после изменения сверьте логи по обоим паттернам — parse.ly и parsely.com — хиты должны уйти синхронно.

С кем не путать parsely.com

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный
Agent Прочие краулеры и сервисы agent легитимный
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный

Стратегия allow/deny для parsely.com

Ситуация Действие
Сайт подключён к Parse.ly как клиент сервиса Allow + закрыть /admin /cart /api — синхронно с правилом для parse.ly
Сайт к Parse.ly не подключён Disallow + запрет в TrafficVeil для обоих вариантов токена
Интеграция есть, но нагрузка избыточна Rate-limit на nginx/TrafficVeil
Непонятно, осталась ли интеграция от прошлого подрядчика Уточнить у команды, прежде чем менять правила — deny по умолчанию до выяснения
UA в логах заметно отличается от официальной строки Не доверять заголовку; смотреть IP/ASN и поведение — вероятен спуфинг

Главное, что стоит помнить про parsely.com: это не отдельный бот, а альтернативный UA-паттерн того же оператора, что и parse.ly. Решение allow/deny должно быть одинаковым для обоих вариантов — иначе есть риск заблокировать один паттерн, оставив другой открытым, что сведёт на нет смысл правила.

Частые вопросы

Чем токен parsely.com отличается от токена parse.ly по существу?

Ничем — это один и тот же оператор, краулер Parse.ly, просто зафиксированный в системе как отдельная запись под свой UA-паттерн.

Что будет, если заблокировать только один из двух вариантов токена?

Один паттерн уйдёт в блок, а другой останется открытым, что фактически сведёт на нет смысл ограничения — правила нужно настраивать синхронно.

Типична ли аудитория Parse.ly для сети гемблинг-сайтов?

Нет — основная аудитория сервиса это новостные редакции и контентные издатели, поэтому визит стоит сначала объяснить, а не считать ожидаемым.

Что стоит проверить перед блокировкой parsely.com, если сайт вроде бы не подключён к сервису?

Уточнить у команды, не осталась ли интеграция от прошлого подрядчика или редизайна, прежде чем принимать решение.

Исполняет ли краулер parsely.com JavaScript на странице?

Нет — по официальной документации он читает только то, что уже присутствует в исходном HTML-коде, без выполнения скриптов.

Что теряет сайт при блокировке parsely.com, если он не клиент сервиса?

Ничего — краулер просто перестанет вычитывать страницы, аналитика которых всё равно не используется на вашей стороне.

#parsely.com#Parse.ly#Automattic#контент-аналитика#боты на сайте#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Podimo: европейский бот, которому нужен подкаст-фид

Podimo — реальный сервис подписки на подкасты, чей бот узко специализирован на чтении RSS-фидов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

panscient.com: вежливый бот с коммерческой целью

panscient.com — реальная компания бизнес-разведки, которая собирает и перепродаёт корпоративные данные с сайтов, но при этом технически аккуратно соблюдает robots.txt и лимит запросов. Разбираем, почему проблема здесь не в нагрузке, а в согласии на использование данных, и как настроить блокировку через robots.txt и TrafficVeil.

6 мин

TweetmemeBot: бот, переживший свой первоначальный сервис

TweetmemeBot начинал в 2009 году как краулер сервиса TweetMeme, но сегодня по данным современных каталогов ботов ассоциируется с Meltwater — платформой медиа-мониторинга для бизнеса. Разбираем историю смены владельцев, отсутствие механизма верификации и настройку allow, rate-limit или блокировки через TrafficVeil.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

parsely.com в access.log: второй UA того же краулера