ResearchBot — обобщённый токен в логах: разные academic/research-скрипты подписываются похожим образом, и устойчивой единой first-party политики за этим именем обычно нет. Проверка подтвердила эту гипотезу: в отличие от многих ботов в этой энциклопедии, ни один известный университет, исследовательский проект или коммерческий оператор не задокументирован как использующий именно голое имя «ResearchBot» в качестве официального UA.
1. Что такое ResearchBot
Слово «research» в UA — популярный и совершенно незащищённый выбор для самописных скриптов: любой студент, аспирант или небольшая исследовательская группа, пишущая свой собственный краулер для курсовой, диссертации или личного проекта, вполне может назвать его буквально «ResearchBot», не оглядываясь на то, что это имя уже где-то используется. Отдельно стоит знать про реально задокументированный, но более специфичный сосед — thesis-research-bot: это отдельный, узнаваемый по названию академический краулер, который систематически обходит сайты для сбора данных под конкретную научную работу; его стоит отличать от голого «ResearchBot», у которого такой специфики и адресности в названии нет.
| Название | ResearchBot |
| User-Agent / паттерн | ResearchBot |
| Оператор | ❌ Не подтверждён единый — токен используют разные, не связанные друг с другом academic/research-скрипты |
| Роль | По названию — сбор данных для исследовательских целей; конкретная задача зависит от того, чей именно скрипт стоит за токеном на вашем домене |
| Документация / ориентир | Единой first-party документации нет — в отличие от специфичных академических краулеров вроде thesis-research-bot, у которых есть узнаваемое назначение |
| Список IP | ❌ Официального списка нет |
| robots.txt | Поведение непредсказуемо — самописные учебные и исследовательские скрипты часто вообще не проверяют robots.txt, поскольку пишутся без учёта таких best practices |
| Пометка TrafficVeil | Deny по умолчанию; на Google не влияет |
2. Зачем ResearchBot приходит на сайт
Причина обхода целиком зависит от того, какой конкретно скрипт скрывается за токеном на вашем домене. Правдоподобные сценарии: сбор данных для курсовой или диссертации, учебный проект по программированию (краулер — классическое учебное задание на курсах по веб-разработке или анализу данных), или небольшой некоммерческий исследовательский инструмент, который никогда не был рассчитан на широкое использование и потому не публиковал никакой политики.
- Какие зоны чаще трогает: непредсказуемо — зависит от конкретной цели исследования, стоящего за скриптом;
- Что ищет: данные, релевантные конкретному исследовательскому проекту — неизвестно без разбора полной строки UA и поведения;
- Чем отличается от браузерного пользователя: нет нормальной сессии, как у большинства автоматизированных клиентов.
Типичный кейс: в логах регулярно встречается ResearchBot, но проверить его происхождение не удаётся ни по одному открытому источнику. В отличие от многих ботов этой энциклопедии, здесь нет смысла долго искать «легитимную академическую пользу» — раз оператор не установлен, оценивать эту пользу попросту не от чего оттолкнуться.
3. Нагрузка и риски именно для ResearchBot
Публичных данных о типичной нагрузке нет. Основной риск здесь — не объём трафика, а неопределённость: самописные исследовательские скрипты часто пишутся студентами или начинающими разработчиками без оглядки на best practices (задержки между запросами, соблюдение robots.txt, ограничение глубины обхода), поэтому даже небольшой по замыслу проект может создавать непропорционально агрессивную нагрузку просто по неопытности автора, а не по злому умыслу.
4. Как найти ResearchBot в логах
Ищите конкретный токен ResearchBot и обязательно смотрите полную строку UA целиком — именно там может обнаружиться реальная зацепка (контакт автора, ссылка на проект, название учебного заведения).
# Базовый поиск
grep -i "ResearchBot" /var/log/nginx/access.log
# Полная строка UA — ищите контакт, ссылку на проект или учебное заведение
grep -io "researchbot[^\"]*" /var/log/nginx/access.log | sort -u | head
# Топ URL, которые вычитывает бот
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отделить от более специфичного, реально задокументированного соседа
grep -iE "researchbot|thesis-research-bot" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет и не может быть у токена без установленного оператора. Единственный практический шаг — whois по IP: часто это выведет на конкретный университет, исследовательский центр или хостинг-провайдера, что даёт хоть какую-то зацепку в отсутствие first-party документации.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для ResearchBot
User-agent: ResearchBot
Disallow: /
Важно: поскольку оператор не подтверждён, а самописные academic-скрипты часто вообще не проверяют robots.txt, этот файл — не гарантия результата. Если правило не действует, переходите сразу к блокировке на уровне сервера.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "ResearchBot") {
return 403;
}
TrafficVeil
- Найдите ResearchBot в ботах домена или в /system/bots;
- Deny по умолчанию — без единого установленного оператора искать «явную пользу» бессмысленно;
- После изменения сверьте логи и убедитесь, что видимость в Google не затронута — этот токен с поисковой индексацией не связан.
7. Рекомендации: что делать с ResearchBot
- Deny по умолчанию — без явной пользы токен без установленного оператора не заслуживает доверия;
- На Google это правило не влияет;
- Если объём трафика значим или полная строка UA содержит контакт/ссылку — можно попробовать связаться с автором напрямую, прежде чем блокировать;
- Не путайте с более специфичными, реально задокументированными академическими краулерами вроде thesis-research-bot — у них другая, узнаваемая политика.
8. С кем не путать ResearchBot
| Бот / сосед | Кластер | UA | Комментарий |
| thesis-research-bot | Академические краулеры | thesis-research-bot | отдельный, более специфично названный академический краулер с задокументированным назначением — не путать с голым ResearchBot |
| AI2Bot | AI и LLM-краулеры | ai2bot | другой оператор (Allen Institute for AI), настоящий некоммерческий исследовательский краулер с документацией |
| CCBot | AI и LLM-краулеры | ccbot | другой оператор (Common Crawl), открытый общий веб-корпус, используемый в том числе для академических исследований |
9. Стратегия allow/deny для ResearchBot
| Ситуация | Действие |
| Стандартная ситуация — оператор не установлен | Deny по умолчанию |
| В полной строке UA нашёлся контакт или ссылка на проект | Можно связаться напрямую перед блокировкой, если это интересно |
| Нужно не задеть поисковые системы | Блокировать строго по токену ResearchBot, не трогать Googlebot/YandexBot |
| Спутали с thesis-research-bot или другим специфичным академическим краулером | Проверить точное название токена — у них разная степень задокументированности |