Боты5 мин чтения·25 августа 2026 г.

Parse.ly в логах: аналитика издателей, а не ваш сервис

Parse.ly — известный сервис контент-аналитики для новостных издателей (сейчас в составе Automattic), а не анонимный сервисный обход. Разбираем реальную техническую роль краулера, почему визит нетипичен для гемблинг-сайта, и настройку allow, rate-limit или блокировки через TrafficVeil.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота parse.ly: легитимный прочие краулеры и сервисы

Токен parse.ly в access.log относится не к анонимному «сервисному обходу», а к краулеру давно известной компании: Parse.ly — сервис контент-аналитики, основанный в 2009 году и с некоторых пор входящий в состав Automattic (той же компании, что владеет WordPress.com). В каталоге TrafficVeil бот отмечен как легитимный в категории «Прочие краулеры и сервисы».

Что такое parse.ly на самом деле

Parse.ly — платформа контент-аналитики для издателей: она измеряет, как читатели взаимодействуют с материалами, какие темы и авторы работают лучше, откуда приходит трафик. Основная аудитория сервиса — новостные редакции и контентные издатели, а не e-commerce или, например, гемблинг-проекты, поэтому визит этого краулера на нетипичный для отрасли сайт стоит сначала проверить, а не сразу считать ожидаемой интеграцией.

Официальная документация Parse.ly раскрывает техническое поведение краулера: он не исполняет JavaScript и забирает только то, что уже присутствует в исходном HTML-коде страницы. Ещё одна особенность — краулер группирует разные представления одного и того же материала (например, обычную страницу и её AMP-версию, или несколько страниц одной фотогалереи) через так называемый Parse.ly canonical URL, чтобы аналитика не дробилась на части.

Параметр Значение
Название Parse.ly Crawler
User-Agent / паттерн parse.ly (официальная строка: Mozilla/5.0 (compatible; parse.ly scraper/0.16; +http://parsely.com); номер версии может меняться)
Оператор Parse.ly (входит в состав Automattic)
Роль Сбор метаданных из HTML для контент-аналитики: темы, авторы, вовлечённость читателей; не исполняет JS
Документация / ориентир Официальная техническая документация на docs.parse.ly
Список IP ❌ Отдельного публичного списка IP не обнаружено; проверяйте ASN и не доверяйте только строке UA
robots.txt Как крупный оператор с открытой документацией, обычно соблюдает директивы; трафик часто идёт по расписанию, похожему на cron
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

Зачем parse.ly приходит на сайт

Если сайт действительно подключён к Parse.ly как клиент сервиса, краулер регулярно вычитывает страницы, чтобы обновлять данные о содержании и вовлечённости — это часть штатной работы аналитической системы. Активность обычно привязана к фиксированным интервалам, как задача по расписанию, и концентрируется на публичных URL, иногда затрагивая открытый API и статику.

Если же ваш сайт к Parse.ly не подключён — а для сети гемблинг-проектов это более вероятный сценарий, чем для новостного издания, — стоит в первую очередь выяснить, не осталась ли интеграция от прошлого подрядчика или редизайна, прежде чем считать этот трафик ожидаемым.

Нагрузка и риски именно для parse.ly

Отдельной строки в публичной сводке топ-ботов TrafficVeil у parse.ly может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на:

  • регулярность интервалов — поведение, близкое к cron-задаче, типично именно для этого краулера;
  • ограниченность набора URL — публичные страницы с содержательным материалом, а не весь каталог целиком;
  • отсутствие cookie и признаков сессии.
Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти parse.ly в логах

Ищите конкретный токен parse.ly, а не общее слово «bot».

# Базовый поиск
grep -i "parse.ly" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "parse.ly" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "parse.ly" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "parse.ly" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Официальная строка UA известна и легко проверяется на соответствие — если заголовок в логах существенно от неё отличается, это повод присмотреться внимательнее. Тем не менее для окончательного решения смотрите связку UA + ASN/IP + частота + набор URL, а не один заголовок:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для parse.ly

# Жёсткий запрет
User-agent: parse.ly
Disallow: /

# Разрешить всё
User-agent: parse.ly
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: parse.ly
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: если сайт не является клиентом Parse.ly, полный запрет ничего не сломает — краулер просто перестанет вычитывать страницы, аналитика которых всё равно никому не нужна на вашей стороне.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "parse.ly") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=parsely:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "parse.ly") {
        limit_req zone=parsely burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} parse.ly [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите parse.ly в ботах домена или в /system/bots;
  • если сайт не подключён к Parse.ly как клиент — категория «запретить»; если подключён, но нагрузка мешает — rate-limit;
  • allow оставляйте только при подтверждённой активной подписке на сервис;
  • после изменения сверьте логи: хиты parse.ly должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.

С кем не путать parse.ly

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный
Agent Прочие краулеры и сервисы agent легитимный
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный

Стратегия allow/deny для parse.ly

Ситуация Действие
Сайт подключён к Parse.ly как клиент сервиса Allow + закрыть /admin /cart /api
Сайт к Parse.ly не подключён Disallow + запрет в TrafficVeil — заметной пользы или вреда от этого не будет
Интеграция есть, но нагрузка избыточна Rate-limit на nginx/TrafficVeil
Непонятно, осталась ли интеграция от прошлого подрядчика Уточнить у команды, прежде чем менять правила — deny по умолчанию до выяснения
UA в логах заметно отличается от официальной строки Не доверять заголовку; смотреть IP/ASN и поведение — вероятен спуфинг

Главный вывод по parse.ly: это открытый, легко проверяемый оператор с понятной технической документацией — но для сети сайтов, не связанных с контентной журналистикой, сам факт визита стоит сначала объяснить, а уже потом решать между allow и запретом.

Частые вопросы

Исполняет ли краулер Parse.ly JavaScript на странице?
Нет — по официальной документации он забирает только то, что уже присутствует в исходном HTML-коде, без выполнения скриптов.
Зачем Parse.ly группирует разные URL одного материала через canonical-адрес?
Чтобы аналитика по AMP-версии или страницам одной фотогалереи не дробилась на отдельные записи, а собиралась в единую статистику по материалу.
Типична ли аудитория Parse.ly для гемблинг-сайтов?
Нет — основная аудитория сервиса это новостные редакции и контентные издатели, поэтому визит на нетипичный для отрасли сайт стоит сначала объяснить.
Что стоит проверить перед блокировкой parse.ly, если сайт вроде бы не подключён к сервису?
Уточнить у команды, не осталась ли интеграция от прошлого подрядчика или редизайна, прежде чем принимать решение.
Что означает поведение краулера parse.ly, похожее на cron-задачу?
Регулярные, привязанные к фиксированным интервалам визиты — это ожидаемая часть штатной работы аналитической системы, а не аномалия.
Что теряет сайт при блокировке parse.ly, если он не является клиентом сервиса?
Ничего — краулер просто перестанет вычитывать страницы, аналитика которых всё равно не используется на вашей стороне.
#Parse.ly#Automattic#контент-аналитика#боты на сайте#robots.txt#защита от ботов#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil