TrafficVeil
Боты 5 мин13 августа 2026 г.

ResearchBot: generic-токен без единого оператора

Разбираем ResearchBot — обобщённый токен, под которым подписываются разные, не связанные друг с другом academic-скрипты. Показываем отличие от реально задокументированного thesis-research-bot, и почему deny по умолчанию — разумная реакция.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое ResearchBot
  2. 2. Зачем ResearchBot приходит на сайт
  3. 3. Нагрузка и риски именно для ResearchBot
  4. 4. Как найти ResearchBot в логах
  5. 5. robots.txt для ResearchBot
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с ResearchBot
  8. 8. С кем не путать ResearchBot
  9. 9. Стратегия allow/deny для ResearchBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

ResearchBot — обобщённый токен в логах: разные academic/research-скрипты подписываются похожим образом, и устойчивой единой first-party политики за этим именем обычно нет. Проверка подтвердила эту гипотезу: в отличие от многих ботов в этой энциклопедии, ни один известный университет, исследовательский проект или коммерческий оператор не задокументирован как использующий именно голое имя «ResearchBot» в качестве официального UA.

1. Что такое ResearchBot

Слово «research» в UA — популярный и совершенно незащищённый выбор для самописных скриптов: любой студент, аспирант или небольшая исследовательская группа, пишущая свой собственный краулер для курсовой, диссертации или личного проекта, вполне может назвать его буквально «ResearchBot», не оглядываясь на то, что это имя уже где-то используется. Отдельно стоит знать про реально задокументированный, но более специфичный сосед — thesis-research-bot: это отдельный, узнаваемый по названию академический краулер, который систематически обходит сайты для сбора данных под конкретную научную работу; его стоит отличать от голого «ResearchBot», у которого такой специфики и адресности в названии нет.

Название ResearchBot
User-Agent / паттерн ResearchBot
Оператор ❌ Не подтверждён единый — токен используют разные, не связанные друг с другом academic/research-скрипты
Роль По названию — сбор данных для исследовательских целей; конкретная задача зависит от того, чей именно скрипт стоит за токеном на вашем домене
Документация / ориентир Единой first-party документации нет — в отличие от специфичных академических краулеров вроде thesis-research-bot, у которых есть узнаваемое назначение
Список IP ❌ Официального списка нет
robots.txt Поведение непредсказуемо — самописные учебные и исследовательские скрипты часто вообще не проверяют robots.txt, поскольку пишутся без учёта таких best practices
Пометка TrafficVeil Deny по умолчанию; на Google не влияет

2. Зачем ResearchBot приходит на сайт

Причина обхода целиком зависит от того, какой конкретно скрипт скрывается за токеном на вашем домене. Правдоподобные сценарии: сбор данных для курсовой или диссертации, учебный проект по программированию (краулер — классическое учебное задание на курсах по веб-разработке или анализу данных), или небольшой некоммерческий исследовательский инструмент, который никогда не был рассчитан на широкое использование и потому не публиковал никакой политики.

  • Какие зоны чаще трогает: непредсказуемо — зависит от конкретной цели исследования, стоящего за скриптом;
  • Что ищет: данные, релевантные конкретному исследовательскому проекту — неизвестно без разбора полной строки UA и поведения;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, как у большинства автоматизированных клиентов.

Типичный кейс: в логах регулярно встречается ResearchBot, но проверить его происхождение не удаётся ни по одному открытому источнику. В отличие от многих ботов этой энциклопедии, здесь нет смысла долго искать «легитимную академическую пользу» — раз оператор не установлен, оценивать эту пользу попросту не от чего оттолкнуться.

3. Нагрузка и риски именно для ResearchBot

Публичных данных о типичной нагрузке нет. Основной риск здесь — не объём трафика, а неопределённость: самописные исследовательские скрипты часто пишутся студентами или начинающими разработчиками без оглядки на best practices (задержки между запросами, соблюдение robots.txt, ограничение глубины обхода), поэтому даже небольшой по замыслу проект может создавать непропорционально агрессивную нагрузку просто по неопытности автора, а не по злому умыслу.

4. Как найти ResearchBot в логах

Ищите конкретный токен ResearchBot и обязательно смотрите полную строку UA целиком — именно там может обнаружиться реальная зацепка (контакт автора, ссылка на проект, название учебного заведения).

# Базовый поиск
grep -i "ResearchBot" /var/log/nginx/access.log

# Полная строка UA — ищите контакт, ссылку на проект или учебное заведение
grep -io "researchbot[^\"]*" /var/log/nginx/access.log | sort -u | head

# Топ URL, которые вычитывает бот
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "ResearchBot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить от более специфичного, реально задокументированного соседа
grep -iE "researchbot|thesis-research-bot" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет и не может быть у токена без установленного оператора. Единственный практический шаг — whois по IP: часто это выведет на конкретный университет, исследовательский центр или хостинг-провайдера, что даёт хоть какую-то зацепку в отсутствие first-party документации.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для ResearchBot

User-agent: ResearchBot
Disallow: /

Важно: поскольку оператор не подтверждён, а самописные academic-скрипты часто вообще не проверяют robots.txt, этот файл — не гарантия результата. Если правило не действует, переходите сразу к блокировке на уровне сервера.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "ResearchBot") {
    return 403;
}

TrafficVeil

  • Найдите ResearchBot в ботах домена или в /system/bots;
  • Deny по умолчанию — без единого установленного оператора искать «явную пользу» бессмысленно;
  • После изменения сверьте логи и убедитесь, что видимость в Google не затронута — этот токен с поисковой индексацией не связан.

7. Рекомендации: что делать с ResearchBot

  • Deny по умолчанию — без явной пользы токен без установленного оператора не заслуживает доверия;
  • На Google это правило не влияет;
  • Если объём трафика значим или полная строка UA содержит контакт/ссылку — можно попробовать связаться с автором напрямую, прежде чем блокировать;
  • Не путайте с более специфичными, реально задокументированными академическими краулерами вроде thesis-research-bot — у них другая, узнаваемая политика.

8. С кем не путать ResearchBot

Бот / сосед Кластер UA Комментарий
thesis-research-bot Академические краулеры thesis-research-bot отдельный, более специфично названный академический краулер с задокументированным назначением — не путать с голым ResearchBot
AI2Bot AI и LLM-краулеры ai2bot другой оператор (Allen Institute for AI), настоящий некоммерческий исследовательский краулер с документацией
CCBot AI и LLM-краулеры ccbot другой оператор (Common Crawl), открытый общий веб-корпус, используемый в том числе для академических исследований

9. Стратегия allow/deny для ResearchBot

Ситуация Действие
Стандартная ситуация — оператор не установлен Deny по умолчанию
В полной строке UA нашёлся контакт или ссылка на проект Можно связаться напрямую перед блокировкой, если это интересно
Нужно не задеть поисковые системы Блокировать строго по токену ResearchBot, не трогать Googlebot/YandexBot
Спутали с thesis-research-bot или другим специфичным академическим краулером Проверить точное название токена — у них разная степень задокументированности

Частые вопросы

ResearchBot — это университетский краулер?

Нет подтверждения единого оператора — токен используют разные самописные academic-скрипты, никак не связанные друг с другом.

Чем ResearchBot отличается от thesis-research-bot?

thesis-research-bot — отдельный, более конкретно названный и задокументированный академический краулер под определённую научную работу, а голый ResearchBot такой специфики не имеет.

Почему такие скрипты иногда создают заметную нагрузку?

Самописные учебные и исследовательские инструменты часто пишутся без учёта best practices — задержек между запросами, соблюдения robots.txt, ограничения глубины обхода.

Стоит ли искать «академическую пользу» перед блокировкой?

Особого смысла нет — без установленного оператора оценивать пользу попросту не от чего оттолкнуться, поэтому deny по умолчанию — разумное быстрое решение.

Что делать, если в полной строке UA нашёлся контакт автора?

Можно попробовать связаться напрямую, если это интересно, прежде чем применять блокировку — иногда за такими скриптами стоят вполне отвечающие на письма студенты или исследователи.

Влияет ли блокировка ResearchBot на позиции сайта в поиске?

Нет, этот токен не связан с поисковой индексацией, поэтому блокировка не отражается на видимости в Google или Яндекс.

#ResearchBot#thesis-research-bot#академические краулеры#generic-боты#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.