Боты6 мин чтения·25 августа 2026 г.·обновлено 8 сентября 2026 г.

Panscient.com: вежливый бот с коммерческой целью

panscient.com — реальная компания бизнес-разведки, которая собирает и перепродаёт корпоративные данные с сайтов, но при этом технически аккуратно соблюдает robots.txt и лимит запросов. Разбираем, почему проблема здесь не в нагрузке, а в согласии на использование данных, и как настроить блокировку через robots.txt и TrafficVeil.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота panscient.com: нежелательный прочие краулеры и сервисы

panscient.com — редкий случай, когда «нежелательный» статус бота объясняется не техническим поведением, а самой бизнес-моделью оператора. Panscient — реальная, давно работающая компания, которая целенаправленно собирает данные о компаниях и людях с сайтов, а затем продаёт эти базы третьим лицам. Бот при этом технически «вежливый» и честно соблюдает robots.txt — проблема не в манерах, а в том, что именно и зачем он забирает. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».

Что такое panscient.com на самом деле

Panscient — компания из Нью-Йорка, основанная в 2002 году, специализирующаяся на бизнес-разведке, поиске людей и компаний, лидогенерации и машинном обучении. Её краулер систематически обходит миллионы сайтов, извлекая корпоративную информацию: названия компаний, адреса, биографии руководителей, вакансии, описания продуктов — а также генеалогические данные: записи о рождении, браке, смерти, некрологи и переписи. Собранные базы данных лицензируются авторизованным реселлерам и третьим лицам для маркетинга, продаж и управления контактами.

Практическая деталь, которая многое объясняет: Panscient обходит весь список зарегистрированных доменов .com (и ряд других зон), публично доступный через Verisign, — то есть если вы просто зарегистрировали домен, краулер рано или поздно периодически проверит его на бизнес-информацию, независимо от того, приглашали вы его или нет.

Параметр Значение
Название panscient.com
User-Agent / паттерн panscient.com (также встречается тестовый вариант pantest)
Оператор Panscient — компания бизнес-разведки и лидогенерации (Нью-Йорк, с 2002 года)
Роль Извлечение и перепродажа корпоративных данных: компании, руководители, вакансии, продукты; также генеалогические записи
Документация / ориентир Официальный FAQ на panscient.com/faq.htm
Список IP ❌ Официального публичного списка IP не публикуется; проверяйте ASN и не доверяйте только строке UA
robots.txt По официальному заявлению оператора — строго соблюдает Robot Exclusion Standard и не забирает контент с закрытых путей
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

Зачем panscient.com приходит на сайт

Ответ здесь необычно прямой: краулер целенаправленно ищет корпоративную и биографическую информацию, чтобы включить её в коммерческую базу данных, которую затем продают маркетологам, отделам продаж и рекрутерам. Если на сайте есть страницы «О компании», «Команда», «Вакансии» или карточки сотрудников с контактами — именно они и представляют наибольший интерес для этого бота.

Ещё одна практическая деталь: краулер иногда пытается извлекать ссылки из JavaScript и других скриптов на странице, что может приводить к запросам несуществующих URL. Это не попытка обойти защиту, а просто неточная интерпретация скриптового контента — не стоит путать такие 404-запросы с разведкой уязвимостей.

Нагрузка и риски именно для panscient.com

По собственному заявлению оператора, краулер ограничивает себя максимум одним запросом в секунду с одного домена или IP — то есть по чистой нагрузке это один из самых аккуратных ботов в категории. Реальный риск здесь не в CPU и bandwidth, а в другом:

  • публичная бизнес-информация с сайта (контакты руководителей, структура команды) может попасть в коммерческую базу данных без вашего явного согласия;
  • если на сайте случайно опубликованы более подробные персональные данные, чем планировалось, они тоже могут быть извлечены как «бизнес-информация»;
  • отдельные запросы к несуществующим URL из-за парсинга JS — не признак атаки, а особенность работы краулера.
Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти panscient.com в логах

Ищите оба возможных токена — рабочий panscient.com и тестовый pantest.

# Базовый поиск
grep -i "panscient.com" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Если в топе URL заметны страницы команды, вакансий или контактов — это подтверждает профиль бота: он действительно охотится за бизнес-данными, а не за произвольным контентом. Для проверки подлинности используйте связку с ASN и обратным DNS:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для panscient.com

# Жёсткий запрет
User-agent: panscient.com
Disallow: /

# Разрешить всё
User-agent: panscient.com
Allow: /

# Компромисс: закрыть страницы команды/контактов, оставить остальное
User-agent: panscient.com
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Disallow: /team/
Disallow: /careers/
Allow: /

В отличие от многих других записей в категории «Прочие краулеры и сервисы», здесь robots.txt действительно работает как заявленный оператором механизм контроля — по официальному описанию Panscient строго его соблюдает, поэтому это едва ли не самый надёжный инструмент именно для этого бота.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "panscient.com") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=panscientcom:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "panscient.com") {
        limit_req zone=panscientcom burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} panscient.com [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите panscient.com в ботах домена или в /system/bots;
  • если публикация бизнес-данных в сторонних базах нежелательна — категория «запретить», учитывая, что robots.txt здесь и так должен сработать надёжно;
  • allow имеет смысл только если присутствие в базах бизнес-разведки и лидогенерации действительно приносит пользу (например, для видимости B2B-контактов сайта);
  • после изменения сверьте логи: хиты panscient.com должны уйти в блок, а нужные поисковики остаться нетронутыми.

С кем не путать panscient.com

Бот / сосед Кластер UA Комментарий
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

Стратегия allow/deny для panscient.com

Ситуация Действие
Видимость бизнес-контактов в сторонних базах не нужна Disallow + запрет в TrafficVeil — здесь robots.txt должен сработать надёжно
Присутствие в базах бизнес-разведки полезно для B2B-видимости Allow, при желании — точечно закрыть личные страницы сотрудников
На сайте есть страницы с более подробными персональными данными, чем планировалось Сначала пересмотреть публикацию этих данных, а не только настройки бота
Встречены запросы к несуществующим URL от этого UA Не тревога — типичная особенность парсинга JS-ссылок краулером, а не разведка уязвимостей
Подозрение на спуфинг UA Проверить лимит частоты — легитимный Panscient не должен превышать один запрос в секунду с одного IP

Главный вывод по panscient.com: это редкий пример технически аккуратного, но коммерчески настороживающего бота — решение allow/deny здесь стоит принимать исходя из готовности видеть бизнес-данные сайта перепроданными в сторонние базы, а не из опасений за нагрузку на сервер.

Частые вопросы

Почему panscient.com не создаёт заметной нагрузки на сервер?
Оператор ограничивает краулер максимум одним запросом в секунду с одного домена или IP — по нагрузке это один из самых аккуратных ботов в категории.
В чём тогда реальная проблема с этим ботом, если не в нагрузке?
Публичная бизнес-информация с сайта — контакты руководителей, структура команды — может попасть в коммерческую базу данных и быть перепродана третьим лицам.
Почему panscient.com посещает сайт, даже если никто не запрашивал такую проверку?
Краулер обходит весь публично доступный список зарегистрированных доменов .com через Verisign, периодически проверяя их на бизнес-информацию.
Что означают запросы этого бота к несуществующим страницам сайта?
Это не попытка разведки уязвимостей, а особенность парсинга ссылок из JavaScript, которая иногда приводит к неточной интерпретации скриптового контента.
Можно ли надёжно заблокировать panscient.com через robots.txt?
Да — в отличие от многих других ботов в этой категории, оператор по собственному заявлению строго соблюдает Robot Exclusion Standard.
Какие страницы сайта стоит закрыть в первую очередь, если полная блокировка нежелательна?
Разделы команды, вакансий и контактов сотрудников — именно они представляют наибольший интерес для бизнес-разведки этого бота.
#panscient.com#Panscient#бизнес-разведка#боты на сайте#robots.txt#конфиденциальность данных#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil