Paqlebot принадлежит датской компании Paqle A/S — платформе медиа-разведки, которая ежедневно мониторит порядка 130 000 медиаресурсов по всему миру и уже построила профили более чем на миллион датских физлиц и 850 тысяч датских компаний. Задача бота предельно конкретна: находить, кого и в каком контексте упоминают в новостных публикациях, чтобы затем показывать клиентам компании рейтинги — например, какая компания в отрасли чаще всего мелькает в СМИ или какой политик в конкретном муниципалитете получает больше всего медийного внимания.
Что стоит за продуктом Paqle
Платформа глубоко интегрирована с датским государственным реестром юрлиц CVR, что даёт ей ежедневные обновления о новых деловых связях, изменениях в руководстве и структуре собственности компаний — и позволяет сопоставлять эти официальные данные с тем, что о человеке или компании пишут в открытых медиа. Иными словами, Paqlebot — это не просто текстовый скрапер: собранные им упоминания становятся частью более широкой системы бизнес- и медиа-аналитики, которая связывает публичные новости с официальными корпоративными данными.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 (compatible; Paqlebot/2.0; +http://www.paqle.dk/about/paqlebot) |
| Оператор | Paqle A/S, Дания |
| Официальная документация | paqle.dk/about/paqlebot |
| Заявленная частота обхода | Максимум 1 страница в минуту; на практике обычно заметно реже — порядка раза в час |
| Верификация подлинности | Обратный DNS-запрос по IP должен указывать на поддомен *.paqle.net — само по себе совпадение строки UA без подтверждения rDNS не считается достаточным доказательством подлинности |
| Поведение при отсутствии правил | Если в robots.txt нет отдельной секции для Paqlebot, бот, по собственному заявлению оператора, ориентируется на правила, заданные для Googlebot |
Ловушка с fallback на правила Googlebot
Это, вероятно, самая практически важная деталь во всём разборе. Если администратор сайта хочет закрыть от индексации какой-то раздел именно для Google (например, через User-agent: Googlebot / Disallow: /some-section/) и не задаёт отдельного правила для Paqlebot, то Paqlebot автоматически унаследует то же самое ограничение — просто потому что не нашёл собственной секции и упал обратно на правила Google. Хуже того, обратная ситуация работает так же незаметно: администратор, который хочет ограничить видимость в Google каким-то разделом, рискует случайно вместе с этим ограничить и media-мониторинг Paqle, даже не подозревая об этом, если никогда явно не прописывал для Paqlebot собственных правил.
Рабочая схема для тех, кому нужна полная выдача Google, но не нужен параллельный индекс Paqle для медиа-мониторинга, — прописать оба правила явно и раздельно, а не полагаться на поведение по умолчанию.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Сколько трафика он создаёт
По сводке TrafficVeil, паттерн запросов paqlebot на подключённых доменах составил порядка 22 тысяч за март–июнь 2026 года (июнь — по 14 число). Это заметный, но не чрезмерный объём для бота, который по заявлению оператора ограничивает себя одной страницей в минуту в пиковом режиме и обычно работает существенно реже.
Как найти бота в логах и проверить подлинность
grep -i "Paqlebot" /var/log/nginx/access.log
Для проверки конкретного IP на соответствие официальной инфраструктуре Paqle:
host 5.161.68.201
# ожидаемый результат — что-то вроде paqlebot-*.paqle.net
Если reverse DNS не приводит к поддомену paqle.net, перед вами, вероятно, не настоящий Paqlebot, а сторонний скрипт, представившийся его именем — в этом случае стоит применять политику как к неверифицированному боту, а не как к задокументированному media-краулеру.
Как настроить robots.txt
Ограничение скорости для легитимного бота, если полный запрет избыточен:
User-agent: Paqlebot
Crawl-delay: 10
Стоит иметь в виду: директива Crawl-delay не является универсальным стандартом, который соблюдают все боты без исключения, но у Paqle уже есть собственный заявленный лимит в одну страницу в минуту — так что явная директива в этом случае, скорее, служит дополнительным сигналом политики сайта, а не единственным механизмом ограничения.
Полный запрет с обязательным явным разделением от правил для Googlebot:
User-agent: Googlebot
Allow: /
User-agent: Paqlebot
Disallow: /
if ($http_user_agent ~* "Paqlebot") {
return 403;
}
Стратегия по сценариям
| Цель | Действие |
| Закрыть media-индекс Paqle полностью | Отдельный явный Disallow для Paqlebot + блокировка на сервере |
| Оставить выдачу Google, но убрать Paqle | Не трогать правила для Googlebot; отдельно и явно запретить Paqlebot, не полагаясь на общий блок |
| Разрешить упоминания бренда в медиа-профилях Paqle | Allow — нагрузка при заявленном лимите бота обычно умеренная; периодически сверять IP по rDNS *.paqle.net |
На ранжирование в органической выдаче Google, Bing или Яндекса присутствие или отсутствие Paqlebot не влияет напрямую — это отдельная от классической поисковой индексации система медиа-мониторинга.
Частые вопросы
Чем занимается компания за ботом Paqlebot?
Что произойдёт, если не задать отдельное правило для Paqlebot в robots.txt?
Как проверить, что запрос действительно от настоящего Paqlebot?
С какой частотой Paqlebot обходит сайт?
Как оставить полную выдачу Google, но убрать медиа-индексацию Paqle?
Влияет ли этот бот на ранжирование в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.