Боты5 мин чтения·13 августа 2026 г.

ResearchBot: generic-токен без единого оператора

Разбираем ResearchBot — обобщённый токен, под которым подписываются разные, не связанные друг с другом academic-скрипты. Показываем отличие от реально задокументированного thesis-research-bot, и почему deny по умолчанию — разумная реакция.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота ResearchBot: нежелательный поисковые роботы

ResearchBot — обобщённый токен в логах: разные academic/research-скрипты подписываются похожим образом, и устойчивой единой first-party политики за этим именем обычно нет. Проверка подтвердила эту гипотезу: в отличие от многих ботов в этой энциклопедии, ни один известный университет, исследовательский проект или коммерческий оператор не задокументирован как использующий именно голое имя «ResearchBot» в качестве официального UA.

1. Что такое ResearchBot

Слово «research» в UA — популярный и совершенно незащищённый выбор для самописных скриптов: любой студент, аспирант или небольшая исследовательская группа, пишущая свой собственный краулер для курсовой, диссертации или личного проекта, вполне может назвать его буквально «ResearchBot», не оглядываясь на то, что это имя уже где-то используется. Отдельно стоит знать про реально задокументированный, но более специфичный сосед — thesis-research-bot: это отдельный, узнаваемый по названию академический краулер, который систематически обходит сайты для сбора данных под конкретную научную работу; его стоит отличать от голого «ResearchBot», у которого такой специфики и адресности в названии нет.

Название ResearchBot
User-Agent / паттерн ResearchBot
Оператор ❌ Не подтверждён единый — токен используют разные, не связанные друг с другом academic/research-скрипты
Роль По названию — сбор данных для исследовательских целей; конкретная задача зависит от того, чей именно скрипт стоит за токеном на вашем домене
Документация / ориентир Единой first-party документации нет — в отличие от специфичных академических краулеров вроде thesis-research-bot, у которых есть узнаваемое назначение
Список IP ❌ Официального списка нет
robots.txt Поведение непредсказуемо — самописные учебные и исследовательские скрипты часто вообще не проверяют robots.txt, поскольку пишутся без учёта таких best practices
Пометка TrafficVeil Deny по умолчанию; на Google не влияет

2. Зачем ResearchBot приходит на сайт

Причина обхода целиком зависит от того, какой конкретно скрипт скрывается за токеном на вашем домене. Правдоподобные сценарии: сбор данных для курсовой или диссертации, учебный проект по программированию (краулер — классическое учебное задание на курсах по веб-разработке или анализу данных), или небольшой некоммерческий исследовательский инструмент, который никогда не был рассчитан на широкое использование и потому не публиковал никакой политики.

  • Какие зоны чаще трогает: непредсказуемо — зависит от конкретной цели исследования, стоящего за скриптом;
  • Что ищет: данные, релевантные конкретному исследовательскому проекту — неизвестно без разбора полной строки UA и поведения;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, как у большинства автоматизированных клиентов.

Типичный кейс: в логах регулярно встречается ResearchBot, но проверить его происхождение не удаётся ни по одному открытому источнику. В отличие от многих ботов этой энциклопедии, здесь нет смысла долго искать «легитимную академическую пользу» — раз оператор не установлен, оценивать эту пользу попросту не от чего оттолкнуться.

3. Нагрузка и риски именно для ResearchBot

Публичных данных о типичной нагрузке нет. Основной риск здесь — не объём трафика, а неопределённость: самописные исследовательские скрипты часто пишутся студентами или начинающими разработчиками без оглядки на best practices (задержки между запросами, соблюдение robots.txt, ограничение глубины обхода), поэтому даже небольшой по замыслу проект может создавать непропорционально агрессивную нагрузку просто по неопытности автора, а не по злому умыслу.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти ResearchBot в логах

Ищите конкретный токен ResearchBot и обязательно смотрите полную строку UA целиком — именно там может обнаружиться реальная зацепка (контакт автора, ссылка на проект, название учебного заведения).

# Базовый поиск
grep -i "ResearchBot" /var/log/nginx/access.log

# Полная строка UA — ищите контакт, ссылку на проект или учебное заведение
grep -io "researchbot[^\"]*" /var/log/nginx/access.log | sort -u | head

# Топ URL, которые вычитывает бот
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить от более специфичного, реально задокументированного соседа
grep -iE "researchbot|thesis-research-bot" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет и не может быть у токена без установленного оператора. Единственный практический шаг — whois по IP: часто это выведет на конкретный университет, исследовательский центр или хостинг-провайдера, что даёт хоть какую-то зацепку в отсутствие first-party документации.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для ResearchBot

User-agent: ResearchBot
Disallow: /

Важно: поскольку оператор не подтверждён, а самописные academic-скрипты часто вообще не проверяют robots.txt, этот файл — не гарантия результата. Если правило не действует, переходите сразу к блокировке на уровне сервера.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "ResearchBot") {
    return 403;
}

TrafficVeil

  • Найдите ResearchBot в ботах домена или в /system/bots;
  • Deny по умолчанию — без единого установленного оператора искать «явную пользу» бессмысленно;
  • После изменения сверьте логи и убедитесь, что видимость в Google не затронута — этот токен с поисковой индексацией не связан.

7. Рекомендации: что делать с ResearchBot

  • Deny по умолчанию — без явной пользы токен без установленного оператора не заслуживает доверия;
  • На Google это правило не влияет;
  • Если объём трафика значим или полная строка UA содержит контакт/ссылку — можно попробовать связаться с автором напрямую, прежде чем блокировать;
  • Не путайте с более специфичными, реально задокументированными академическими краулерами вроде thesis-research-bot — у них другая, узнаваемая политика.

8. С кем не путать ResearchBot

Бот / сосед Кластер UA Комментарий
thesis-research-bot Академические краулеры thesis-research-bot отдельный, более специфично названный академический краулер с задокументированным назначением — не путать с голым ResearchBot
AI2Bot AI и LLM-краулеры ai2bot другой оператор (Allen Institute for AI), настоящий некоммерческий исследовательский краулер с документацией
CCBot AI и LLM-краулеры ccbot другой оператор (Common Crawl), открытый общий веб-корпус, используемый в том числе для академических исследований

9. Стратегия allow/deny для ResearchBot

Ситуация Действие
Стандартная ситуация — оператор не установлен Deny по умолчанию
В полной строке UA нашёлся контакт или ссылка на проект Можно связаться напрямую перед блокировкой, если это интересно
Нужно не задеть поисковые системы Блокировать строго по токену ResearchBot, не трогать Googlebot/YandexBot
Спутали с thesis-research-bot или другим специфичным академическим краулером Проверить точное название токена — у них разная степень задокументированности

Частые вопросы

ResearchBot — это университетский краулер?
Нет подтверждения единого оператора — токен используют разные самописные academic-скрипты, никак не связанные друг с другом.
Чем ResearchBot отличается от thesis-research-bot?
thesis-research-bot — отдельный, более конкретно названный и задокументированный академический краулер под определённую научную работу, а голый ResearchBot такой специфики не имеет.
Почему такие скрипты иногда создают заметную нагрузку?
Самописные учебные и исследовательские инструменты часто пишутся без учёта best practices — задержек между запросами, соблюдения robots.txt, ограничения глубины обхода.
Стоит ли искать «академическую пользу» перед блокировкой?
Особого смысла нет — без установленного оператора оценивать пользу попросту не от чего оттолкнуться, поэтому deny по умолчанию — разумное быстрое решение.
Что делать, если в полной строке UA нашёлся контакт автора?
Можно попробовать связаться напрямую, если это интересно, прежде чем применять блокировку — иногда за такими скриптами стоят вполне отвечающие на письма студенты или исследователи.
Влияет ли блокировка ResearchBot на позиции сайта в поиске?
Нет, этот токен не связан с поисковой индексацией, поэтому блокировка не отражается на видимости в Google или Яндекс.
#ResearchBot#thesis-research-bot#академические краулеры#generic-боты#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil