panscient.com — редкий случай, когда «нежелательный» статус бота объясняется не техническим поведением, а самой бизнес-моделью оператора. Panscient — реальная, давно работающая компания, которая целенаправленно собирает данные о компаниях и людях с сайтов, а затем продаёт эти базы третьим лицам. Бот при этом технически «вежливый» и честно соблюдает robots.txt — проблема не в манерах, а в том, что именно и зачем он забирает. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое panscient.com на самом деле
Panscient — компания из Нью-Йорка, основанная в 2002 году, специализирующаяся на бизнес-разведке, поиске людей и компаний, лидогенерации и машинном обучении. Её краулер систематически обходит миллионы сайтов, извлекая корпоративную информацию: названия компаний, адреса, биографии руководителей, вакансии, описания продуктов — а также генеалогические данные: записи о рождении, браке, смерти, некрологи и переписи. Собранные базы данных лицензируются авторизованным реселлерам и третьим лицам для маркетинга, продаж и управления контактами.
Практическая деталь, которая многое объясняет: Panscient обходит весь список зарегистрированных доменов .com (и ряд других зон), публично доступный через Verisign, — то есть если вы просто зарегистрировали домен, краулер рано или поздно периодически проверит его на бизнес-информацию, независимо от того, приглашали вы его или нет.
| Параметр | Значение |
| Название | panscient.com |
| User-Agent / паттерн | panscient.com (также встречается тестовый вариант pantest) |
| Оператор | Panscient — компания бизнес-разведки и лидогенерации (Нью-Йорк, с 2002 года) |
| Роль | Извлечение и перепродажа корпоративных данных: компании, руководители, вакансии, продукты; также генеалогические записи |
| Документация / ориентир | Официальный FAQ на panscient.com/faq.htm |
| Список IP | ❌ Официального публичного списка IP не публикуется; проверяйте ASN и не доверяйте только строке UA |
| robots.txt | По официальному заявлению оператора — строго соблюдает Robot Exclusion Standard и не забирает контент с закрытых путей |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Зачем panscient.com приходит на сайт
Ответ здесь необычно прямой: краулер целенаправленно ищет корпоративную и биографическую информацию, чтобы включить её в коммерческую базу данных, которую затем продают маркетологам, отделам продаж и рекрутерам. Если на сайте есть страницы «О компании», «Команда», «Вакансии» или карточки сотрудников с контактами — именно они и представляют наибольший интерес для этого бота.
Ещё одна практическая деталь: краулер иногда пытается извлекать ссылки из JavaScript и других скриптов на странице, что может приводить к запросам несуществующих URL. Это не попытка обойти защиту, а просто неточная интерпретация скриптового контента — не стоит путать такие 404-запросы с разведкой уязвимостей.
Нагрузка и риски именно для panscient.com
По собственному заявлению оператора, краулер ограничивает себя максимум одним запросом в секунду с одного домена или IP — то есть по чистой нагрузке это один из самых аккуратных ботов в категории. Реальный риск здесь не в CPU и bandwidth, а в другом:
- публичная бизнес-информация с сайта (контакты руководителей, структура команды) может попасть в коммерческую базу данных без вашего явного согласия;
- если на сайте случайно опубликованы более подробные персональные данные, чем планировалось, они тоже могут быть извлечены как «бизнес-информация»;
- отдельные запросы к несуществующим URL из-за парсинга JS — не признак атаки, а особенность работы краулера.
Как найти panscient.com в логах
Ищите оба возможных токена — рабочий panscient.com и тестовый pantest.
# Базовый поиск
grep -i "panscient.com" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "panscient.com" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Если в топе URL заметны страницы команды, вакансий или контактов — это подтверждает профиль бота: он действительно охотится за бизнес-данными, а не за произвольным контентом. Для проверки подлинности используйте связку с ASN и обратным DNS:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt для panscient.com
# Жёсткий запрет User-agent: panscient.com Disallow: / # Разрешить всё User-agent: panscient.com Allow: / # Компромисс: закрыть страницы команды/контактов, оставить остальное User-agent: panscient.com Disallow: /admin/ Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /api/ Disallow: /team/ Disallow: /careers/ Allow: /
В отличие от многих других записей в категории «Прочие краулеры и сервисы», здесь robots.txt действительно работает как заявленный оператором механизм контроля — по официальному описанию Panscient строго его соблюдает, поэтому это едва ли не самый надёжный инструмент именно для этого бота.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "panscient.com") {
return 403;
}
limit_req_zone $binary_remote_addr zone=panscientcom:10m rate=10r/m;
location / {
if ($http_user_agent ~* "panscient.com") {
limit_req zone=panscientcom burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} panscient.com [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- найдите panscient.com в ботах домена или в
/system/bots; - если публикация бизнес-данных в сторонних базах нежелательна — категория «запретить», учитывая, что robots.txt здесь и так должен сработать надёжно;
- allow имеет смысл только если присутствие в базах бизнес-разведки и лидогенерации действительно приносит пользу (например, для видимости B2B-контактов сайта);
- после изменения сверьте логи: хиты panscient.com должны уйти в блок, а нужные поисковики остаться нетронутыми.
С кем не путать panscient.com
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Стратегия allow/deny для panscient.com
| Ситуация | Действие |
| Видимость бизнес-контактов в сторонних базах не нужна | Disallow + запрет в TrafficVeil — здесь robots.txt должен сработать надёжно |
| Присутствие в базах бизнес-разведки полезно для B2B-видимости | Allow, при желании — точечно закрыть личные страницы сотрудников |
| На сайте есть страницы с более подробными персональными данными, чем планировалось | Сначала пересмотреть публикацию этих данных, а не только настройки бота |
| Встречены запросы к несуществующим URL от этого UA | Не тревога — типичная особенность парсинга JS-ссылок краулером, а не разведка уязвимостей |
| Подозрение на спуфинг UA | Проверить лимит частоты — легитимный Panscient не должен превышать один запрос в секунду с одного IP |
Главный вывод по panscient.com: это редкий пример технически аккуратного, но коммерчески настороживающего бота — решение allow/deny здесь стоит принимать исходя из готовности видеть бизнес-данные сайта перепроданными в сторонние базы, а не из опасений за нагрузку на сервер.