factset-spyderbot — не безымянный скрейпер с неясным оператором, как описывает черновик. Токен прямо называет компанию: это краулер FactSet Research Systems Inc. (NYSE: FDS) — одного из крупнейших мировых поставщиков финансовых данных и аналитики, прямого конкурента Bloomberg Terminal и Refinitiv. Оператор известен, вопрос лишь в том, какую конкретно пользу этот трафик приносит вашему сайту — и ответ здесь обычно отрицательный.
1. Что такое factset-spyderbot на самом деле
FactSet — публичная компания (NYSE: FDS), которая продаёт финансовым организациям — инвестбанкам, управляющим активами, хедж-фондам — данные, аналитику и терминалы для принятия инвестиционных решений. Чтобы наполнять эти продукты, компании нужен постоянный приток свежих данных о компаниях, рынках и новостях — отсюда и краулер.
По классификации сообщества, отслеживающего краулеры для AI-продуктов (проект ai-robots-txt и независимые каталоги ботов), factset-spyderbot числится в одном ряду с GPTBot, ClaudeBot и другими AI-краулерами — то есть его относят именно к сбору контента для AI-функций продуктов компании, а не к узкому техническому мониторингу. У FactSet в терминалах уже есть AI-функции (суммаризация новостей, анализ отчётности, sentiment-анализ) — собранные данные, вероятно, питают именно их.
| Параметр | Значение |
| Название | factset-spyderbot (Factset_spyderbot) |
| Оператор | FactSet Research Systems Inc. (NYSE: FDS) — крупный публичный поставщик финансовых данных и аналитики |
| Вероятная роль | Сбор данных о компаниях, рынках и новостях для аналитических продуктов и AI-функций финансовых терминалов FactSet |
| User-Agent / паттерн | factset-spyderbot / Factset_spyderbot |
| Официальная документация от FactSet | Не найдена — идентификация основана на классификации независимых сообществ, отслеживающих краулеры (ai-robots-txt и аналогичные каталоги), а не на официальной странице оператора |
| robots.txt | Нет прямых данных о соблюдении; большинство публичных списков рекомендуют полный Disallow для этого токена |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем factset-spyderbot приходит на сайт
- сбор публичной информации о компаниях (новости, релизы, отчётность, упоминания) для финансовых баз данных и терминалов FactSet;
- вероятно, пополнение данных для AI-функций продукта — суммаризации, аналитики и sentiment-оценок, которые FactSet предлагает институциональным клиентам;
- сайт для этого краулера интересен не как аудитория, а как источник сырых данных — переток трафика или атрибуция владельцу контента не предусмотрены.
Типичный кейс: бот концентрируется на новостных разделах, страницах компаний, пресс-релизах и блоге — там, где может быть свежая информация, полезная для финансовой аналитики, а не на технических или служебных страницах.
3. Нагрузка и риски
Поскольку сайту эти данные не возвращаются ни в виде трафика, ни в виде атрибуции, а уходят в коммерческий продукт FactSet, который продаётся институциональным клиентам за деньги, прямой пользы для владельца контента нет практически никогда — за исключением случаев, когда сам сайт заинтересован в присутствии в финансовых базах данных (например, публичная компания, которой важно попадать в аналитику инвесторов).
Дополнительный нюанс: раз FactSet группируется вместе с AI-краулерами в независимых каталогах, тот же риск, что и с GPTBot/ClaudeBot — уникальный контент может быть переработан и использован в AI-функциях платного продукта без клика на исходный сайт и без атрибуции.
4. Как найти factset-spyderbot в логах
# Базовый поиск
grep -i "factset-spyderbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "factset-spyderbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "factset-spyderbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "factset-spyderbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверка гипотезы: концентрация на новостных/корпоративных разделах
grep -i "factset-spyderbot" /var/log/nginx/access.log | grep -icE "/news/|/press/|/investor"
Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов от FactSet не найдено, поэтому для верификации остаётся связка UA + IP/ASN + характерная концентрация на новостных/корпоративных разделах:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для factset-spyderbot
# Жёсткий запрет — рекомендуемый вариант по умолчанию
User-agent: factset-spyderbot
Disallow: /
# Разрешить всё — только если сайт заинтересован в присутствии в финансовой аналитике
User-agent: factset-spyderbot
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичные новости
User-agent: factset-spyderbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Крупные независимые каталоги краулеров (ai-robots-txt и аналогичные) по умолчанию рекомендуют полный Disallow для этого токена — это стоит воспринимать как сигнал, что для подавляющего большинства сайтов пользы от allow нет.
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "factset-spyderbot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=factsetspyderbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "factset-spyderbot") {
limit_req zone=factsetspyderbot burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} factset-spyderbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите factset-spyderbot в разделе ботов домена или в /system/bots;
- для подавляющего большинства сайтов — категория «запретить» обоснована сразу, без промежуточного rate-limit, поскольку пользы для контента практически никогда нет;
- исключение — публичные компании или эмитенты, которым важно присутствие в финансовой аналитике FactSet, для них allow может быть осмысленным бизнес-решением;
- после изменения сверьте логи: хиты factset-spyderbot должны уйти в блок, а нужные поисковики остаться.
7. Что делать: короткий алгоритм
- Сайт не публичная компания и не заинтересован в финансовой аналитике — блокируйте по умолчанию, это самый безопасный вариант;
- Сайт — эмитент, для которого присутствие в базах FactSet имеет коммерческий смысл — рассмотрите allow как сознательное бизнес-решение, а не «на всякий случай»;
- Заметна концентрация именно на новостных/корпоративных разделах — это подтверждает финансово-аналитическую природу бота, а не повод для особого исключения;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. С кем не путать factset-spyderbot
| Бот / сосед | Кластер | Комментарий |
| aiHitBot | AI и LLM-краулеры / финансовые данные | Похожая природа — собирает данные о компаниях для построения бизнес-профилей с помощью AI |
| GPTBot | AI и LLM-краулеры | Официально задокументированный training-краулер OpenAI — в отличие от factset-spyderbot, у него есть открытая публичная политика |
| 360Spider | Прочие краулеры и сервисы | нежелательный, но другая природа — поисковый краулер китайской системы, а не сборщик финансовых данных |
| A360-Search | Прочие краулеры и сервисы | нежелательный |
9. Стратегия allow/deny для factset-spyderbot
| Ситуация | Действие |
| Обычный сайт без интереса к финансовой аналитике | Disallow + запрет в TrafficVeil — рекомендуемый вариант по умолчанию |
| Публичная компания/эмитент, заинтересованный в присутствии в базах FactSet | Allow — осознанное бизнес-решение |
| Нагрузка заметна, но решение по allow/deny ещё не принято | Rate-limit как временная мера |
| Подозрение на spoofing UA под легитимный финансовый краулер | Не доверять строке UA; смотреть IP/ASN и концентрацию на новостных/корпоративных разделах |