TrafficVeil
Боты 6 мин25 августа 2026 г.

panscient.com: вежливый бот с коммерческой целью

panscient.com — реальная компания бизнес-разведки, которая собирает и перепродаёт корпоративные данные с сайтов, но при этом технически аккуратно соблюдает robots.txt и лимит запросов. Разбираем, почему проблема здесь не в нагрузке, а в согласии на использование данных, и как настроить блокировку через robots.txt и TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое panscient.com на самом деле
  2. Зачем panscient.com приходит на сайт
  3. Нагрузка и риски именно для panscient.com
  4. Как найти panscient.com в логах
  5. robots.txt для panscient.com
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать panscient.com
  11. Стратегия allow/deny для panscient.com
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

panscient.com — редкий случай, когда «нежелательный» статус бота объясняется не техническим поведением, а самой бизнес-моделью оператора. Panscient — реальная, давно работающая компания, которая целенаправленно собирает данные о компаниях и людях с сайтов, а затем продаёт эти базы третьим лицам. Бот при этом технически «вежливый» и честно соблюдает robots.txt — проблема не в манерах, а в том, что именно и зачем он забирает. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».

Что такое panscient.com на самом деле

Panscient — компания из Нью-Йорка, основанная в 2002 году, специализирующаяся на бизнес-разведке, поиске людей и компаний, лидогенерации и машинном обучении. Её краулер систематически обходит миллионы сайтов, извлекая корпоративную информацию: названия компаний, адреса, биографии руководителей, вакансии, описания продуктов — а также генеалогические данные: записи о рождении, браке, смерти, некрологи и переписи. Собранные базы данных лицензируются авторизованным реселлерам и третьим лицам для маркетинга, продаж и управления контактами.

Практическая деталь, которая многое объясняет: Panscient обходит весь список зарегистрированных доменов .com (и ряд других зон), публично доступный через Verisign, — то есть если вы просто зарегистрировали домен, краулер рано или поздно периодически проверит его на бизнес-информацию, независимо от того, приглашали вы его или нет.

Параметр Значение
Название panscient.com
User-Agent / паттерн panscient.com (также встречается тестовый вариант pantest)
Оператор Panscient — компания бизнес-разведки и лидогенерации (Нью-Йорк, с 2002 года)
Роль Извлечение и перепродажа корпоративных данных: компании, руководители, вакансии, продукты; также генеалогические записи
Документация / ориентир Официальный FAQ на panscient.com/faq.htm
Список IP ❌ Официального публичного списка IP не публикуется; проверяйте ASN и не доверяйте только строке UA
robots.txt По официальному заявлению оператора — строго соблюдает Robot Exclusion Standard и не забирает контент с закрытых путей
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

Зачем panscient.com приходит на сайт

Ответ здесь необычно прямой: краулер целенаправленно ищет корпоративную и биографическую информацию, чтобы включить её в коммерческую базу данных, которую затем продают маркетологам, отделам продаж и рекрутерам. Если на сайте есть страницы «О компании», «Команда», «Вакансии» или карточки сотрудников с контактами — именно они и представляют наибольший интерес для этого бота.

Ещё одна практическая деталь: краулер иногда пытается извлекать ссылки из JavaScript и других скриптов на странице, что может приводить к запросам несуществующих URL. Это не попытка обойти защиту, а просто неточная интерпретация скриптового контента — не стоит путать такие 404-запросы с разведкой уязвимостей.

Нагрузка и риски именно для panscient.com

По собственному заявлению оператора, краулер ограничивает себя максимум одним запросом в секунду с одного домена или IP — то есть по чистой нагрузке это один из самых аккуратных ботов в категории. Реальный риск здесь не в CPU и bandwidth, а в другом:

  • публичная бизнес-информация с сайта (контакты руководителей, структура команды) может попасть в коммерческую базу данных без вашего явного согласия;
  • если на сайте случайно опубликованы более подробные персональные данные, чем планировалось, они тоже могут быть извлечены как «бизнес-информация»;
  • отдельные запросы к несуществующим URL из-за парсинга JS — не признак атаки, а особенность работы краулера.

Как найти panscient.com в логах

Ищите оба возможных токена — рабочий panscient.com и тестовый pantest.

# Базовый поиск
grep -i "panscient.com" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Если в топе URL заметны страницы команды, вакансий или контактов — это подтверждает профиль бота: он действительно охотится за бизнес-данными, а не за произвольным контентом. Для проверки подлинности используйте связку с ASN и обратным DNS:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для panscient.com

# Жёсткий запрет
User-agent: panscient.com
Disallow: /

# Разрешить всё
User-agent: panscient.com
Allow: /

# Компромисс: закрыть страницы команды/контактов, оставить остальное
User-agent: panscient.com
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Disallow: /team/
Disallow: /careers/
Allow: /

В отличие от многих других записей в категории «Прочие краулеры и сервисы», здесь robots.txt действительно работает как заявленный оператором механизм контроля — по официальному описанию Panscient строго его соблюдает, поэтому это едва ли не самый надёжный инструмент именно для этого бота.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "panscient.com") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=panscientcom:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "panscient.com") {
        limit_req zone=panscientcom burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} panscient.com [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите panscient.com в ботах домена или в /system/bots;
  • если публикация бизнес-данных в сторонних базах нежелательна — категория «запретить», учитывая, что robots.txt здесь и так должен сработать надёжно;
  • allow имеет смысл только если присутствие в базах бизнес-разведки и лидогенерации действительно приносит пользу (например, для видимости B2B-контактов сайта);
  • после изменения сверьте логи: хиты panscient.com должны уйти в блок, а нужные поисковики остаться нетронутыми.

С кем не путать panscient.com

Бот / сосед Кластер UA Комментарий
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

Стратегия allow/deny для panscient.com

Ситуация Действие
Видимость бизнес-контактов в сторонних базах не нужна Disallow + запрет в TrafficVeil — здесь robots.txt должен сработать надёжно
Присутствие в базах бизнес-разведки полезно для B2B-видимости Allow, при желании — точечно закрыть личные страницы сотрудников
На сайте есть страницы с более подробными персональными данными, чем планировалось Сначала пересмотреть публикацию этих данных, а не только настройки бота
Встречены запросы к несуществующим URL от этого UA Не тревога — типичная особенность парсинга JS-ссылок краулером, а не разведка уязвимостей
Подозрение на спуфинг UA Проверить лимит частоты — легитимный Panscient не должен превышать один запрос в секунду с одного IP

Главный вывод по panscient.com: это редкий пример технически аккуратного, но коммерчески настороживающего бота — решение allow/deny здесь стоит принимать исходя из готовности видеть бизнес-данные сайта перепроданными в сторонние базы, а не из опасений за нагрузку на сервер.

Частые вопросы

Почему panscient.com не создаёт заметной нагрузки на сервер?

Оператор ограничивает краулер максимум одним запросом в секунду с одного домена или IP — по нагрузке это один из самых аккуратных ботов в категории.

В чём тогда реальная проблема с этим ботом, если не в нагрузке?

Публичная бизнес-информация с сайта — контакты руководителей, структура команды — может попасть в коммерческую базу данных и быть перепродана третьим лицам.

Почему panscient.com посещает сайт, даже если никто не запрашивал такую проверку?

Краулер обходит весь публично доступный список зарегистрированных доменов .com через Verisign, периодически проверяя их на бизнес-информацию.

Что означают запросы этого бота к несуществующим страницам сайта?

Это не попытка разведки уязвимостей, а особенность парсинга ссылок из JavaScript, которая иногда приводит к неточной интерпретации скриптового контента.

Можно ли надёжно заблокировать panscient.com через robots.txt?

Да — в отличие от многих других ботов в этой категории, оператор по собственному заявлению строго соблюдает Robot Exclusion Standard.

Какие страницы сайта стоит закрыть в первую очередь, если полная блокировка нежелательна?

Разделы команды, вакансий и контактов сотрудников — именно они представляют наибольший интерес для бизнес-разведки этого бота.

#panscient.com#Panscient#бизнес-разведка#боты на сайте#robots.txt#конфиденциальность данных#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Podimo: европейский бот, которому нужен подкаст-фид

Podimo — реальный сервис подписки на подкасты, чей бот узко специализирован на чтении RSS-фидов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

TweetmemeBot: бот, переживший свой первоначальный сервис

TweetmemeBot начинал в 2009 году как краулер сервиса TweetMeme, но сегодня по данным современных каталогов ботов ассоциируется с Meltwater — платформой медиа-мониторинга для бизнеса. Разбираем историю смены владельцев, отсутствие механизма верификации и настройку allow, rate-limit или блокировки через TrafficVeil.

6 мин

PodchaserParser: бот, которому нужен именно подкаст-фид

PodchaserParser — реальный бот каталога подкастов Podchaser, узко специализированный на чтении RSS-фидов подкастов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

panscient.com: зачем бот собирает бизнес-данные сайта