Боты5 мин чтения·11 августа 2026 г.

Paqlebot: датский краулер медиа-разведки — и скрытая ловушка с fallback на правила Googlebot

Paqlebot принадлежит Paqle A/S — датской платформе медиа-разведки, мониторящей 130 000 медиаресурсов и связывающей упоминания в СМИ с официальным реестром юрлиц CVR. Разбираем главную практическую опасность: если для Paqlebot нет отдельного правила в robots.txt, бот по умолчанию следует правилам для Googlebot — а значит, ограничение для Google незаметно ограничивает и медиа-мониторинг, и наоборот.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота PaqleBot: нежелательный прочие краулеры и сервисы

Paqlebot принадлежит датской компании Paqle A/S — платформе медиа-разведки, которая ежедневно мониторит порядка 130 000 медиаресурсов по всему миру и уже построила профили более чем на миллион датских физлиц и 850 тысяч датских компаний. Задача бота предельно конкретна: находить, кого и в каком контексте упоминают в новостных публикациях, чтобы затем показывать клиентам компании рейтинги — например, какая компания в отрасли чаще всего мелькает в СМИ или какой политик в конкретном муниципалитете получает больше всего медийного внимания.

Что стоит за продуктом Paqle

Платформа глубоко интегрирована с датским государственным реестром юрлиц CVR, что даёт ей ежедневные обновления о новых деловых связях, изменениях в руководстве и структуре собственности компаний — и позволяет сопоставлять эти официальные данные с тем, что о человеке или компании пишут в открытых медиа. Иными словами, Paqlebot — это не просто текстовый скрапер: собранные им упоминания становятся частью более широкой системы бизнес- и медиа-аналитики, которая связывает публичные новости с официальными корпоративными данными.

Параметры бота

Параметр Значение
User-Agent Mozilla/5.0 (compatible; Paqlebot/2.0; +http://www.paqle.dk/about/paqlebot)
Оператор Paqle A/S, Дания
Официальная документация paqle.dk/about/paqlebot
Заявленная частота обхода Максимум 1 страница в минуту; на практике обычно заметно реже — порядка раза в час
Верификация подлинности Обратный DNS-запрос по IP должен указывать на поддомен *.paqle.net — само по себе совпадение строки UA без подтверждения rDNS не считается достаточным доказательством подлинности
Поведение при отсутствии правил Если в robots.txt нет отдельной секции для Paqlebot, бот, по собственному заявлению оператора, ориентируется на правила, заданные для Googlebot

Ловушка с fallback на правила Googlebot

Это, вероятно, самая практически важная деталь во всём разборе. Если администратор сайта хочет закрыть от индексации какой-то раздел именно для Google (например, через User-agent: Googlebot / Disallow: /some-section/) и не задаёт отдельного правила для Paqlebot, то Paqlebot автоматически унаследует то же самое ограничение — просто потому что не нашёл собственной секции и упал обратно на правила Google. Хуже того, обратная ситуация работает так же незаметно: администратор, который хочет ограничить видимость в Google каким-то разделом, рискует случайно вместе с этим ограничить и media-мониторинг Paqle, даже не подозревая об этом, если никогда явно не прописывал для Paqlebot собственных правил.

Рабочая схема для тех, кому нужна полная выдача Google, но не нужен параллельный индекс Paqle для медиа-мониторинга, — прописать оба правила явно и раздельно, а не полагаться на поведение по умолчанию.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Сколько трафика он создаёт

По сводке TrafficVeil, паттерн запросов paqlebot на подключённых доменах составил порядка 22 тысяч за март–июнь 2026 года (июнь — по 14 число). Это заметный, но не чрезмерный объём для бота, который по заявлению оператора ограничивает себя одной страницей в минуту в пиковом режиме и обычно работает существенно реже.

Как найти бота в логах и проверить подлинность

grep -i "Paqlebot" /var/log/nginx/access.log

Для проверки конкретного IP на соответствие официальной инфраструктуре Paqle:

host 5.161.68.201
# ожидаемый результат — что-то вроде paqlebot-*.paqle.net

Если reverse DNS не приводит к поддомену paqle.net, перед вами, вероятно, не настоящий Paqlebot, а сторонний скрипт, представившийся его именем — в этом случае стоит применять политику как к неверифицированному боту, а не как к задокументированному media-краулеру.

Как настроить robots.txt

Ограничение скорости для легитимного бота, если полный запрет избыточен:

User-agent: Paqlebot
Crawl-delay: 10

Стоит иметь в виду: директива Crawl-delay не является универсальным стандартом, который соблюдают все боты без исключения, но у Paqle уже есть собственный заявленный лимит в одну страницу в минуту — так что явная директива в этом случае, скорее, служит дополнительным сигналом политики сайта, а не единственным механизмом ограничения.

Полный запрет с обязательным явным разделением от правил для Googlebot:

User-agent: Googlebot
Allow: /

User-agent: Paqlebot
Disallow: /
if ($http_user_agent ~* "Paqlebot") {
    return 403;
}

Стратегия по сценариям

Цель Действие
Закрыть media-индекс Paqle полностью Отдельный явный Disallow для Paqlebot + блокировка на сервере
Оставить выдачу Google, но убрать Paqle Не трогать правила для Googlebot; отдельно и явно запретить Paqlebot, не полагаясь на общий блок
Разрешить упоминания бренда в медиа-профилях Paqle Allow — нагрузка при заявленном лимите бота обычно умеренная; периодически сверять IP по rDNS *.paqle.net

На ранжирование в органической выдаче Google, Bing или Яндекса присутствие или отсутствие Paqlebot не влияет напрямую — это отдельная от классической поисковой индексации система медиа-мониторинга.

Частые вопросы

Чем занимается компания за ботом Paqlebot?
Paqle A/S — датская платформа медиа-разведки, которая мониторит около 130 000 медиаресурсов и строит профили упоминаний людей и компаний, интегрированные с государственным реестром юрлиц CVR.
Что произойдёт, если не задать отдельное правило для Paqlebot в robots.txt?
Бот, по собственному заявлению оператора, будет ориентироваться на правила, заданные для Googlebot — а значит, ограничение для Google незаметно затронет и его.
Как проверить, что запрос действительно от настоящего Paqlebot?
Сделать обратный DNS-запрос по IP — он должен указывать на поддомен paqle.net; одного совпадения строки User-Agent недостаточно.
С какой частотой Paqlebot обходит сайт?
По заявлению оператора, максимум одна страница в минуту, но на практике обычно заметно реже — порядка раза в час.
Как оставить полную выдачу Google, но убрать медиа-индексацию Paqle?
Прописать оба правила явно и раздельно — не полагаться на правила по умолчанию только для одного из ботов.
Влияет ли этот бот на ранжирование в поисковых системах?
Нет, это отдельная от классической поисковой индексации система медиа-мониторинга.
#paqlebot#Paqle A/S#медиа-мониторинг#media intelligence#бот-энциклопедия#robots.txt#rDNS#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil