TrafficVeil
Боты 5 мин25 августа 2026 г.

Parse.ly в логах: аналитика издателей, а не ваш сервис

Parse.ly — известный сервис контент-аналитики для новостных издателей (сейчас в составе Automattic), а не анонимный сервисный обход. Разбираем реальную техническую роль краулера, почему визит нетипичен для гемблинг-сайта, и настройку allow, rate-limit или блокировки через TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое parse.ly на самом деле
  2. Зачем parse.ly приходит на сайт
  3. Нагрузка и риски именно для parse.ly
  4. Как найти parse.ly в логах
  5. robots.txt для parse.ly
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать parse.ly
  11. Стратегия allow/deny для parse.ly
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Токен parse.ly в access.log относится не к анонимному «сервисному обходу», а к краулеру давно известной компании: Parse.ly — сервис контент-аналитики, основанный в 2009 году и с некоторых пор входящий в состав Automattic (той же компании, что владеет WordPress.com). В каталоге TrafficVeil бот отмечен как легитимный в категории «Прочие краулеры и сервисы».

Что такое parse.ly на самом деле

Parse.ly — платформа контент-аналитики для издателей: она измеряет, как читатели взаимодействуют с материалами, какие темы и авторы работают лучше, откуда приходит трафик. Основная аудитория сервиса — новостные редакции и контентные издатели, а не e-commerce или, например, гемблинг-проекты, поэтому визит этого краулера на нетипичный для отрасли сайт стоит сначала проверить, а не сразу считать ожидаемой интеграцией.

Официальная документация Parse.ly раскрывает техническое поведение краулера: он не исполняет JavaScript и забирает только то, что уже присутствует в исходном HTML-коде страницы. Ещё одна особенность — краулер группирует разные представления одного и того же материала (например, обычную страницу и её AMP-версию, или несколько страниц одной фотогалереи) через так называемый Parse.ly canonical URL, чтобы аналитика не дробилась на части.

Параметр Значение
Название Parse.ly Crawler
User-Agent / паттерн parse.ly (официальная строка: Mozilla/5.0 (compatible; parse.ly scraper/0.16; +http://parsely.com); номер версии может меняться)
Оператор Parse.ly (входит в состав Automattic)
Роль Сбор метаданных из HTML для контент-аналитики: темы, авторы, вовлечённость читателей; не исполняет JS
Документация / ориентир Официальная техническая документация на docs.parse.ly
Список IP ❌ Отдельного публичного списка IP не обнаружено; проверяйте ASN и не доверяйте только строке UA
robots.txt Как крупный оператор с открытой документацией, обычно соблюдает директивы; трафик часто идёт по расписанию, похожему на cron
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

Зачем parse.ly приходит на сайт

Если сайт действительно подключён к Parse.ly как клиент сервиса, краулер регулярно вычитывает страницы, чтобы обновлять данные о содержании и вовлечённости — это часть штатной работы аналитической системы. Активность обычно привязана к фиксированным интервалам, как задача по расписанию, и концентрируется на публичных URL, иногда затрагивая открытый API и статику.

Если же ваш сайт к Parse.ly не подключён — а для сети гемблинг-проектов это более вероятный сценарий, чем для новостного издания, — стоит в первую очередь выяснить, не осталась ли интеграция от прошлого подрядчика или редизайна, прежде чем считать этот трафик ожидаемым.

Нагрузка и риски именно для parse.ly

Отдельной строки в публичной сводке топ-ботов TrafficVeil у parse.ly может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на:

  • регулярность интервалов — поведение, близкое к cron-задаче, типично именно для этого краулера;
  • ограниченность набора URL — публичные страницы с содержательным материалом, а не весь каталог целиком;
  • отсутствие cookie и признаков сессии.

Как найти parse.ly в логах

Ищите конкретный токен parse.ly, а не общее слово «bot».

# Базовый поиск
grep -i "parse.ly" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "parse.ly" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "parse.ly" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "parse.ly" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Официальная строка UA известна и легко проверяется на соответствие — если заголовок в логах существенно от неё отличается, это повод присмотреться внимательнее. Тем не менее для окончательного решения смотрите связку UA + ASN/IP + частота + набор URL, а не один заголовок:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для parse.ly

# Жёсткий запрет
User-agent: parse.ly
Disallow: /

# Разрешить всё
User-agent: parse.ly
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: parse.ly
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: если сайт не является клиентом Parse.ly, полный запрет ничего не сломает — краулер просто перестанет вычитывать страницы, аналитика которых всё равно никому не нужна на вашей стороне.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "parse.ly") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=parsely:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "parse.ly") {
        limit_req zone=parsely burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} parse.ly [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите parse.ly в ботах домена или в /system/bots;
  • если сайт не подключён к Parse.ly как клиент — категория «запретить»; если подключён, но нагрузка мешает — rate-limit;
  • allow оставляйте только при подтверждённой активной подписке на сервис;
  • после изменения сверьте логи: хиты parse.ly должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.

С кем не путать parse.ly

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный
Agent Прочие краулеры и сервисы agent легитимный
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный

Стратегия allow/deny для parse.ly

Ситуация Действие
Сайт подключён к Parse.ly как клиент сервиса Allow + закрыть /admin /cart /api
Сайт к Parse.ly не подключён Disallow + запрет в TrafficVeil — заметной пользы или вреда от этого не будет
Интеграция есть, но нагрузка избыточна Rate-limit на nginx/TrafficVeil
Непонятно, осталась ли интеграция от прошлого подрядчика Уточнить у команды, прежде чем менять правила — deny по умолчанию до выяснения
UA в логах заметно отличается от официальной строки Не доверять заголовку; смотреть IP/ASN и поведение — вероятен спуфинг

Главный вывод по parse.ly: это открытый, легко проверяемый оператор с понятной технической документацией — но для сети сайтов, не связанных с контентной журналистикой, сам факт визита стоит сначала объяснить, а уже потом решать между allow и запретом.

Частые вопросы

Исполняет ли краулер Parse.ly JavaScript на странице?

Нет — по официальной документации он забирает только то, что уже присутствует в исходном HTML-коде, без выполнения скриптов.

Зачем Parse.ly группирует разные URL одного материала через canonical-адрес?

Чтобы аналитика по AMP-версии или страницам одной фотогалереи не дробилась на отдельные записи, а собиралась в единую статистику по материалу.

Типична ли аудитория Parse.ly для гемблинг-сайтов?

Нет — основная аудитория сервиса это новостные редакции и контентные издатели, поэтому визит на нетипичный для отрасли сайт стоит сначала объяснить.

Что стоит проверить перед блокировкой parse.ly, если сайт вроде бы не подключён к сервису?

Уточнить у команды, не осталась ли интеграция от прошлого подрядчика или редизайна, прежде чем принимать решение.

Что означает поведение краулера parse.ly, похожее на cron-задачу?

Регулярные, привязанные к фиксированным интервалам визиты — это ожидаемая часть штатной работы аналитической системы, а не аномалия.

Что теряет сайт при блокировке parse.ly, если он не является клиентом сервиса?

Ничего — краулер просто перестанет вычитывать страницы, аналитика которых всё равно не используется на вашей стороне.

#Parse.ly#Automattic#контент-аналитика#боты на сайте#robots.txt#защита от ботов#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Podimo: европейский бот, которому нужен подкаст-фид

Podimo — реальный сервис подписки на подкасты, чей бот узко специализирован на чтении RSS-фидов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

panscient.com: вежливый бот с коммерческой целью

panscient.com — реальная компания бизнес-разведки, которая собирает и перепродаёт корпоративные данные с сайтов, но при этом технически аккуратно соблюдает robots.txt и лимит запросов. Разбираем, почему проблема здесь не в нагрузке, а в согласии на использование данных, и как настроить блокировку через robots.txt и TrafficVeil.

6 мин

TweetmemeBot: бот, переживший свой первоначальный сервис

TweetmemeBot начинал в 2009 году как краулер сервиса TweetMeme, но сегодня по данным современных каталогов ботов ассоциируется с Meltwater — платформой медиа-мониторинга для бизнеса. Разбираем историю смены владельцев, отсутствие механизма верификации и настройку allow, rate-limit или блокировки через TrafficVeil.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Parse.ly: что за краулер и нужен ли он вашему сайту