Боты8 мин чтения·10 августа 2026 г.

OI-Crawler: что это за бот OpenINTEL и нужно ли его блокировать

OI-Crawler — исследовательский веб-краулер проекта OpenINTEL, который получает landing page доменов для интернет-измерений. Разбираемся, зачем он приходит на сайт, как работает с robots.txt, как определить настоящий OI-Crawler/Nutch и когда использовать Allow, Rate Limit или Block.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота OI-Crawler: нежелательный прочие краулеры и сервисы

OI-Crawler — исследовательский веб-краулер проекта OpenINTEL. В access.log он обычно определяется по User-Agent:

OI-Crawler/Nutch (https://openintel.nl/webcrawl/)

В основе crawler используется Apache Nutch. OpenINTEL применяет его для ограниченного автоматизированного получения публичных веб-страниц в рамках интернет-измерений. Официальная страница проекта отдельно объясняет владельцам сайтов, какой трафик они могут видеть и как crawler работает с robots.txt. :contentReference[oaicite:8]{index=8}

Это не поисковый робот Google, не AI-краулер OpenAI и не обычный пользователь браузера. Для TrafficVeil его правильнее относить к категории Research / Internet Measurement Crawlers.

Параметр Значение
Название OI-Crawler
Полный UA OI-Crawler/Nutch (https://openintel.nl/webcrawl/)
Оператор OpenINTEL
Проект University of Twente, SIDN, NLnet Labs и SURF
Категория Research / Internet Measurement
Crawler engine Apache Nutch
robots.txt Соблюдает по официальной документации
Публичный IP feed Нет; заявлена инфраструктура в пределах IPv4 /26
Базовая политика TrafficVeil Allow / Monitor

Что такое OpenINTEL

OpenINTEL — исследовательская инфраструктура для крупномасштабных интернет-измерений. Проект существует с 2015 года и собирает большие объёмы данных о состоянии DNS и других элементах интернет-инфраструктуры. OpenINTEL является совместным проектом University of Twente, SIDN, NLnet Labs и SURF. :contentReference[oaicite:9]{index=9}

Основная специализация проекта — активные измерения интернета и предоставление полученных данных исследователям.

Web crawling является одним из вспомогательных измерительных сценариев OpenINTEL.

Зачем OI-Crawler приходит на сайт

Официальная документация OpenINTEL описывает довольно ограниченный сценарий crawling.

Если apex domain присутствует в списке измерения, crawler:

  1. пытается получить robots.txt;
  2. интерпретирует правила;
  3. учитывает их при дальнейшей работе;
  4. пытается получить landing page apex-домена;
  5. следует HTTP redirect, если он присутствует.

OpenINTEL отдельно подчёркивает, что отправляет ограниченное количество HTTP GET и старается поддерживать частоту обращений значительно ниже обычного пользовательского трафика. :contentReference[oaicite:10]{index=10}

OI-Crawler не является обычным массовым scraper

Это важное отличие от исходного описания.

Не стоит автоматически предполагать, что OI-Crawler:

  • проходит весь ссылочный граф;
  • выкачивает тысячи страниц каждого сайта;
  • индексирует интернет для поисковой выдачи;
  • собирает контент для LLM;
  • сканирует API сайта;
  • ищет приватные данные.

Официально описанный сценарий OpenINTEL гораздо уже: ограниченный web measurement, связанный прежде всего с landing page домена. :contentReference[oaicite:11]{index=11}

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как выглядит User-Agent OI-Crawler

Наблюдаемый полный UA:

OI-Crawler/Nutch (https://openintel.nl/webcrawl/)

Для первичного поиска в логах можно использовать:

OI-Crawler

или:

oi-crawler

Но TrafficVeil лучше дополнительно проверять наличие Nutch и ссылки на openintel.nl/webcrawl/, чтобы повысить точность классификации. :contentReference[oaicite:12]{index=12}

Как найти OI-Crawler в access.log

Базовый поиск:

grep -i "OI-Crawler" /var/log/nginx/access.log

Или более широкий вариант:

grep -iE "OI-Crawler|oi-crawler" /var/log/nginx/access.log

Топ URL:

grep -i "OI-Crawler" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

Топ IP:

grep -i "OI-Crawler" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

HTTP-коды:

grep -i "OI-Crawler" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn

Как выглядит нормальное поведение OI-Crawler

У официального crawler OpenINTEL ожидается достаточно специфичный профиль.

Признак Ожидаемое поведение
HTTP methods Ограниченное количество GET
Первичный ресурс robots.txt
Основная цель Landing page apex domain
Redirects Может следовать
Частота Низкая
Глубокий crawl Не является базовым описанным сценарием

Такое поведение существенно упрощает обнаружение spoofing.

Как распознать поддельный OI-Crawler

User-Agent можно подделать даже у хорошо документированного crawler.

Например:

User-Agent: OI-Crawler/Nutch (https://openintel.nl/webcrawl/)

GET /.env
GET /.git/config
GET /wp-login.php
GET /backup.zip
GET /phpmyadmin/

такой профиль не соответствует официальному описанию web measurement OpenINTEL.

TrafficVeil не должен автоматически выдавать trusted-статус только из-за совпадения UA.

Как верифицировать OI-Crawler

OpenINTEL сообщает, что web crawler traffic происходит из инфраструктуры внутри одного IPv4 /26. Конкретные crawler-хосты публично не перечисляются; при необходимости проект может предоставить владельцу сайта дополнительные сведения напрямую. :contentReference[oaicite:13]{index=13}

Поэтому TrafficVeil может использовать несколько уровней проверки:

  1. UA содержит OI-Crawler/Nutch;
  2. ссылка в UA ведёт на OpenINTEL;
  3. IP/ASN соответствует ранее наблюдаемой инфраструктуре;
  4. поведение совпадает с ограниченным web measurement;
  5. fingerprint стабилен между визитами.

Почему нельзя публиковать observed IP как официальный диапазон

Даже если TrafficVeil регулярно наблюдает OI-Crawler с одного адреса, это ещё не превращает его в официальный публичный IP feed.

Статус Что означает
Observed IP TrafficVeil видел OI-Crawler с этого адреса
Probable IP Поведение и инфраструктура стабильно соответствуют OpenINTEL
Verified range Диапазон подтверждён самим оператором

OpenINTEL прямо говорит о происхождении crawling traffic из IPv4 /26, но не публикует конкретные crawler-хосты на странице. :contentReference[oaicite:14]{index=14}

Соблюдает ли OI-Crawler robots.txt

Да. Это один из тех случаев, где политика подтверждена самим оператором.

OpenINTEL пишет, что используемый crawler первым делом пытается получить, интерпретировать и соблюдать robots.txt. :contentReference[oaicite:15]{index=15}

Для полного запрета:

User-agent: OI-Crawler
Disallow: /

Можно использовать и конкретный токен, совпадающий с UA crawler.

Как закрыть только часть сайта

User-agent: OI-Crawler
Disallow: /admin/
Disallow: /account/
Disallow: /internal/
Disallow: /api/private/
Allow: /

Однако с учётом описанного OpenINTEL поведения глубокий обход этих зон и так не является нормальным базовым сценарием.

Что делать, если crawler создаёт нагрузку

OpenINTEL отдельно публикует процедуру для владельцев сайтов, которые считают, что crawling оказывает влияние на инфраструктуру.

Проект просит сообщить:

  • название организации;
  • контакт;
  • IP затронутого сервера;
  • описание нагрузки;
  • время возникновения проблемы;
  • исходные IP crawler.

Команда OpenINTEL пишет, что старается отвечать на такие обращения в течение одного рабочего дня. :contentReference[oaicite:16]{index=16}

Нужно ли сразу блокировать OI-Crawler

Обычно нет необходимости начинать с жёсткого Block.

Это хорошо документированный исследовательский crawler, оператор которого заявляет ответственную политику crawling и соблюдение robots.txt.

Базовая стратегия:

Ситуация Действие
Обычный подтверждённый OpenINTEL crawl Allow / Monitor
Не хотите участвовать в web measurement Disallow
Возникает нагрузка Сначала robots.txt / анализ / обращение к оператору
UA не соответствует поведению Проверить spoofing
Security scanning под UA OI-Crawler Block источник

Блокировка OI-Crawler через Nginx

Если нужен принудительный запрет:

if ($http_user_agent ~* "OI-Crawler") {
    return 403;
}

Но для официального crawler OpenINTEL разумнее сначала воспользоваться robots.txt, поскольку оператор явно заявляет его соблюдение. :contentReference[oaicite:17]{index=17}

Блокировка через Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} OI-Crawler [NC]
RewriteRule ^ - [F,L]

Нужен ли Rate Limit

В большинстве случаев специальный Rate Limit для настоящего OI-Crawler не должен быть необходим.

OpenINTEL заявляет, что запросы к одному host распределяются во времени и должны оставаться значительно ниже типичной интенсивности посещения сайта обычным пользователем. :contentReference[oaicite:18]{index=18}

Если TrafficVeil видит десятки или сотни запросов в секунду под этим UA, это уже сильный повод проверить, действительно ли источник относится к OpenINTEL.

Как оценивать нагрузку в TrafficVeil

Для исследовательского crawler полезно показывать:

  • Requests;
  • Unique IP;
  • ASN;
  • Top URLs;
  • RPS/RPM;
  • robots.txt requests;
  • redirect chains;
  • HTTP status;
  • Bandwidth;
  • Origin requests.

Особенно полезный показатель:

Landing-page concentration — какая доля запросов приходится на apex landing page и robots.txt.

У настоящего OpenINTEL этот показатель должен быть высоким.

OI-Crawler и OpenAI — это разные боты

Название легко перепутать визуально:

OI-Crawler
OAI-SearchBot

Но это совершенно разные сущности.

Бот Оператор Назначение
OI-Crawler OpenINTEL Internet measurement / research crawling
OAI-SearchBot OpenAI Поисковые функции OpenAI

OpenAI официально использует имя OAI-SearchBot для своего search crawler. :contentReference[oaicite:19]{index=19}

Нет прямой связи.

OI-Crawler — OpenINTEL, а не OpenAI. Поэтому:

User-agent: OI-Crawler
Disallow: /

не является правилом:

User-agent: OAI-SearchBot

и не должно рассматриваться как запрет crawler OpenAI. :contentReference[oaicite:20]{index=20}

Повлияет ли блокировка на Google или Яндекс

Нет. Точечное правило для OI-Crawler не относится к Googlebot или YandexBot.

Главное — не использовать слишком широкий запрет всех автоматизированных клиентов, если поисковая индексация нужна сайту.

Как учитывать OI-Crawler в аналитике

OI-Crawler не является человеческим посещением.

Для TrafficVeil оптимальная структура:

Automated Traffic → Research & Internet Measurement → OpenINTEL → OI-Crawler

Рекомендуется:

  • исключать из Human Traffic;
  • не считать конверсией;
  • не относить к Malicious Bots при подтверждении;
  • учитывать отдельно как research crawler;
  • сохранять статистику IP/ASN и поведения.

Рекомендуемая карточка TrafficVeil

Поле Значение
Name OI-Crawler
Full UA OI-Crawler/Nutch (https://openintel.nl/webcrawl/)
Operator OpenINTEL
Category Research / Internet Measurement
Project partners University of Twente, SIDN, NLnet Labs, SURF
Crawler engine Apache Nutch
robots.txt Yes — officially documented
Network IPv4 /26 according to operator
Public exact IP feed No
Default action Allow / Monitor
Human analytics Exclude

Что показывать пользователю TrafficVeil

Вместо:

«Неизвестный crawler. Оператор не подтверждён.»

правильнее выводить:

OI-Crawler — исследовательский crawler проекта OpenINTEL. Он выполняет ограниченные web-измерения, сначала проверяет robots.txt и обычно получает landing page домена. Блокировка не влияет на Google или OAI-SearchBot OpenAI.

Итог

OI-Crawler — не неизвестный crawler и не бот OpenAI. Это веб-краулер исследовательского проекта OpenINTEL, работающего при участии University of Twente, SIDN, NLnet Labs и SURF. :contentReference[oaicite:21]{index=21}

OpenINTEL достаточно подробно описывает его поведение: crawler использует Nutch, проверяет и соблюдает robots.txt, выполняет ограниченное количество HTTP GET, получает landing page apex-домена и следует редиректам. :contentReference[oaicite:22]{index=22}

Поэтому для TrafficVeil его базовый статус лучше изменить с Unknown / Deny на Legitimate Research Crawler / Allow or Monitor.

Если владелец сайта не хочет участвовать в измерениях OpenINTEL, корректный первый шаг — отдельный Disallow для OI-Crawler. Если же под этим UA наблюдается агрессивное сканирование или высокая частота запросов, необходимо проверить spoofing и оценивать источник уже по IP, ASN, fingerprint и реальному поведению.

Частые вопросы

Что такое OI-Crawler?
OI-Crawler — веб-краулер проекта OpenINTEL. В реальных логах встречается UA OI-Crawler/Nutch (https://openintel.nl/webcrawl/). OpenINTEL использует веб-измерения в рамках исследовательской инфраструктуры и отдельно публикует инструкции для владельцев сайтов, которые видят этот crawler.
Кто является оператором OI-Crawler?
Оператор связан с проектом OpenINTEL — совместной инициативой University of Twente, SIDN, NLnet Labs и SURF. То есть исходная пометка «оператор не подтверждён» для этого бота неверна.
Соблюдает ли OI-Crawler robots.txt?
Да. OpenINTEL прямо пишет, что используемый crawler сначала пытается получить, интерпретировать и соблюдать robots.txt, а уже затем обращается к landing page домена.
Что именно сканирует OI-Crawler?
Согласно OpenINTEL, crawler отправляет ограниченное количество HTTP GET для сайтов из списка измерения, получает apex-domain landing page и следует редиректам. Поэтому описывать его как массовый глубокий scraper всего сайта неправильно.
Есть ли официальный список IP?
OpenINTEL не публикует конкретные crawler-хосты открыто, но сообщает, что web-crawler traffic приходит из одного IPv4 /26. Конкретные адреса команда может раскрыть владельцу сайта при обращении.
OI-Crawler относится к OpenAI или ChatGPT Search?
Нет. OI-Crawler относится к OpenINTEL. У OpenAI собственный поисковый crawler называется OAI-SearchBot, поэтому эти User-Agent нельзя объединять одним правилом.
#OI-Crawler#OI-Crawler Nutch#OpenINTEL#openintel.nl#веб-краулер#Nutch crawler#research crawler#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil