TrafficVeil
Боты 6 мин21 августа 2026 г.

factset-spyderbot: краулер FactSet, а не анонимный сборщик данных

Токен в UA прямо называет оператора — это краулер FactSet, крупного публичного поставщика финансовых данных и аналитики для институциональных инвесторов. Разбираемся, зачем компании нужен сбор контента с обычных сайтов, почему независимые каталоги относят его к той же категории, что GPTBot, и когда allow всё же может быть осмысленным решением, а не исключением из общего правила.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое factset-spyderbot на самом деле
  2. 2. Зачем factset-spyderbot приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти factset-spyderbot в логах
  5. 5. robots.txt для factset-spyderbot
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. С кем не путать factset-spyderbot
  9. 9. Стратегия allow/deny для factset-spyderbot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

factset-spyderbot — не безымянный скрейпер с неясным оператором, как описывает черновик. Токен прямо называет компанию: это краулер FactSet Research Systems Inc. (NYSE: FDS) — одного из крупнейших мировых поставщиков финансовых данных и аналитики, прямого конкурента Bloomberg Terminal и Refinitiv. Оператор известен, вопрос лишь в том, какую конкретно пользу этот трафик приносит вашему сайту — и ответ здесь обычно отрицательный.

1. Что такое factset-spyderbot на самом деле

FactSet — публичная компания (NYSE: FDS), которая продаёт финансовым организациям — инвестбанкам, управляющим активами, хедж-фондам — данные, аналитику и терминалы для принятия инвестиционных решений. Чтобы наполнять эти продукты, компании нужен постоянный приток свежих данных о компаниях, рынках и новостях — отсюда и краулер.

По классификации сообщества, отслеживающего краулеры для AI-продуктов (проект ai-robots-txt и независимые каталоги ботов), factset-spyderbot числится в одном ряду с GPTBot, ClaudeBot и другими AI-краулерами — то есть его относят именно к сбору контента для AI-функций продуктов компании, а не к узкому техническому мониторингу. У FactSet в терминалах уже есть AI-функции (суммаризация новостей, анализ отчётности, sentiment-анализ) — собранные данные, вероятно, питают именно их.

Параметр Значение
Название factset-spyderbot (Factset_spyderbot)
Оператор FactSet Research Systems Inc. (NYSE: FDS) — крупный публичный поставщик финансовых данных и аналитики
Вероятная роль Сбор данных о компаниях, рынках и новостях для аналитических продуктов и AI-функций финансовых терминалов FactSet
User-Agent / паттерн factset-spyderbot / Factset_spyderbot
Официальная документация от FactSet Не найдена — идентификация основана на классификации независимых сообществ, отслеживающих краулеры (ai-robots-txt и аналогичные каталоги), а не на официальной странице оператора
robots.txt Нет прямых данных о соблюдении; большинство публичных списков рекомендуют полный Disallow для этого токена
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

2. Зачем factset-spyderbot приходит на сайт

  • сбор публичной информации о компаниях (новости, релизы, отчётность, упоминания) для финансовых баз данных и терминалов FactSet;
  • вероятно, пополнение данных для AI-функций продукта — суммаризации, аналитики и sentiment-оценок, которые FactSet предлагает институциональным клиентам;
  • сайт для этого краулера интересен не как аудитория, а как источник сырых данных — переток трафика или атрибуция владельцу контента не предусмотрены.

Типичный кейс: бот концентрируется на новостных разделах, страницах компаний, пресс-релизах и блоге — там, где может быть свежая информация, полезная для финансовой аналитики, а не на технических или служебных страницах.

3. Нагрузка и риски

Поскольку сайту эти данные не возвращаются ни в виде трафика, ни в виде атрибуции, а уходят в коммерческий продукт FactSet, который продаётся институциональным клиентам за деньги, прямой пользы для владельца контента нет практически никогда — за исключением случаев, когда сам сайт заинтересован в присутствии в финансовых базах данных (например, публичная компания, которой важно попадать в аналитику инвесторов).

Дополнительный нюанс: раз FactSet группируется вместе с AI-краулерами в независимых каталогах, тот же риск, что и с GPTBot/ClaudeBot — уникальный контент может быть переработан и использован в AI-функциях платного продукта без клика на исходный сайт и без атрибуции.

4. Как найти factset-spyderbot в логах

# Базовый поиск
grep -i "factset-spyderbot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "factset-spyderbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "factset-spyderbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "factset-spyderbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверка гипотезы: концентрация на новостных/корпоративных разделах
grep -i "factset-spyderbot" /var/log/nginx/access.log | grep -icE "/news/|/press/|/investor"

Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов от FactSet не найдено, поэтому для верификации остаётся связка UA + IP/ASN + характерная концентрация на новостных/корпоративных разделах:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для factset-spyderbot

# Жёсткий запрет — рекомендуемый вариант по умолчанию
User-agent: factset-spyderbot
Disallow: /

# Разрешить всё — только если сайт заинтересован в присутствии в финансовой аналитике
User-agent: factset-spyderbot
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичные новости
User-agent: factset-spyderbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Крупные независимые каталоги краулеров (ai-robots-txt и аналогичные) по умолчанию рекомендуют полный Disallow для этого токена — это стоит воспринимать как сигнал, что для подавляющего большинства сайтов пользы от allow нет.

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "factset-spyderbot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=factsetspyderbot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "factset-spyderbot") {
        limit_req zone=factsetspyderbot burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} factset-spyderbot [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите factset-spyderbot в разделе ботов домена или в /system/bots;
  • для подавляющего большинства сайтов — категория «запретить» обоснована сразу, без промежуточного rate-limit, поскольку пользы для контента практически никогда нет;
  • исключение — публичные компании или эмитенты, которым важно присутствие в финансовой аналитике FactSet, для них allow может быть осмысленным бизнес-решением;
  • после изменения сверьте логи: хиты factset-spyderbot должны уйти в блок, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Сайт не публичная компания и не заинтересован в финансовой аналитике — блокируйте по умолчанию, это самый безопасный вариант;
  • Сайт — эмитент, для которого присутствие в базах FactSet имеет коммерческий смысл — рассмотрите allow как сознательное бизнес-решение, а не «на всякий случай»;
  • Заметна концентрация именно на новостных/корпоративных разделах — это подтверждает финансово-аналитическую природу бота, а не повод для особого исключения;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. С кем не путать factset-spyderbot

Бот / сосед Кластер Комментарий
aiHitBot AI и LLM-краулеры / финансовые данные Похожая природа — собирает данные о компаниях для построения бизнес-профилей с помощью AI
GPTBot AI и LLM-краулеры Официально задокументированный training-краулер OpenAI — в отличие от factset-spyderbot, у него есть открытая публичная политика
360Spider Прочие краулеры и сервисы нежелательный, но другая природа — поисковый краулер китайской системы, а не сборщик финансовых данных
A360-Search Прочие краулеры и сервисы нежелательный

9. Стратегия allow/deny для factset-spyderbot

Ситуация Действие
Обычный сайт без интереса к финансовой аналитике Disallow + запрет в TrafficVeil — рекомендуемый вариант по умолчанию
Публичная компания/эмитент, заинтересованный в присутствии в базах FactSet Allow — осознанное бизнес-решение
Нагрузка заметна, но решение по allow/deny ещё не принято Rate-limit как временная мера
Подозрение на spoofing UA под легитимный финансовый краулер Не доверять строке UA; смотреть IP/ASN и концентрацию на новостных/корпоративных разделах

Частые вопросы

Кто на самом деле управляет factset-spyderbot?

FactSet Research Systems Inc. (NYSE: FDS) — крупный публичный поставщик финансовых данных и аналитики для инвестбанков и управляющих активами.

Зачем финансовой компании собирать данные с обычных сайтов?

Скорее всего, для наполнения аналитических продуктов и AI-функций терминалов — суммаризации новостей, анализа отчётности и sentiment-оценок.

Есть ли официальная документация бота от самой FactSet?

Нет, идентификация основана на классификации независимых сообществ, отслеживающих краулеры, а не на официальной странице оператора.

Стоит ли блокировать этот краулер по умолчанию?

Да, для большинства сайтов это рекомендуемый вариант — данные уходят в платный коммерческий продукт без атрибуции и трафика для самого сайта.

Есть ли ситуации, когда allow имеет смысл?

Да, если сайт принадлежит публичной компании-эмитенту, которой важно присутствие в финансовой аналитике для инвесторов.

Соблюдает ли factset-spyderbot правила robots.txt?

Прямых данных об этом нет, поэтому для гарантированного результата запись в файле стоит дублировать блокировкой на сервере.

#factset-spyderbot#FactSet#финансовые данные#AI-краулеры#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.