OI-Crawler — исследовательский веб-краулер проекта OpenINTEL. В access.log он обычно определяется по User-Agent:
OI-Crawler/Nutch (https://openintel.nl/webcrawl/)
В основе crawler используется Apache Nutch. OpenINTEL применяет его для ограниченного автоматизированного получения публичных веб-страниц в рамках интернет-измерений. Официальная страница проекта отдельно объясняет владельцам сайтов, какой трафик они могут видеть и как crawler работает с robots.txt. :contentReference[oaicite:8]{index=8}
Это не поисковый робот Google, не AI-краулер OpenAI и не обычный пользователь браузера. Для TrafficVeil его правильнее относить к категории Research / Internet Measurement Crawlers.
| Параметр | Значение |
|---|---|
| Название | OI-Crawler |
| Полный UA | OI-Crawler/Nutch (https://openintel.nl/webcrawl/) |
| Оператор | OpenINTEL |
| Проект | University of Twente, SIDN, NLnet Labs и SURF |
| Категория | Research / Internet Measurement |
| Crawler engine | Apache Nutch |
| robots.txt | Соблюдает по официальной документации |
| Публичный IP feed | Нет; заявлена инфраструктура в пределах IPv4 /26 |
| Базовая политика TrafficVeil | Allow / Monitor |
Что такое OpenINTEL
OpenINTEL — исследовательская инфраструктура для крупномасштабных интернет-измерений. Проект существует с 2015 года и собирает большие объёмы данных о состоянии DNS и других элементах интернет-инфраструктуры. OpenINTEL является совместным проектом University of Twente, SIDN, NLnet Labs и SURF. :contentReference[oaicite:9]{index=9}
Основная специализация проекта — активные измерения интернета и предоставление полученных данных исследователям.
Web crawling является одним из вспомогательных измерительных сценариев OpenINTEL.
Зачем OI-Crawler приходит на сайт
Официальная документация OpenINTEL описывает довольно ограниченный сценарий crawling.
Если apex domain присутствует в списке измерения, crawler:
- пытается получить
robots.txt; - интерпретирует правила;
- учитывает их при дальнейшей работе;
- пытается получить landing page apex-домена;
- следует HTTP redirect, если он присутствует.
OpenINTEL отдельно подчёркивает, что отправляет ограниченное количество HTTP GET и старается поддерживать частоту обращений значительно ниже обычного пользовательского трафика. :contentReference[oaicite:10]{index=10}
OI-Crawler не является обычным массовым scraper
Это важное отличие от исходного описания.
Не стоит автоматически предполагать, что OI-Crawler:
- проходит весь ссылочный граф;
- выкачивает тысячи страниц каждого сайта;
- индексирует интернет для поисковой выдачи;
- собирает контент для LLM;
- сканирует API сайта;
- ищет приватные данные.
Официально описанный сценарий OpenINTEL гораздо уже: ограниченный web measurement, связанный прежде всего с landing page домена. :contentReference[oaicite:11]{index=11}
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как выглядит User-Agent OI-Crawler
Наблюдаемый полный UA:
OI-Crawler/Nutch (https://openintel.nl/webcrawl/)
Для первичного поиска в логах можно использовать:
OI-Crawler
или:
oi-crawler
Но TrafficVeil лучше дополнительно проверять наличие Nutch и ссылки на openintel.nl/webcrawl/, чтобы повысить точность классификации. :contentReference[oaicite:12]{index=12}
Как найти OI-Crawler в access.log
Базовый поиск:
grep -i "OI-Crawler" /var/log/nginx/access.log
Или более широкий вариант:
grep -iE "OI-Crawler|oi-crawler" /var/log/nginx/access.log
Топ URL:
grep -i "OI-Crawler" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
Топ IP:
grep -i "OI-Crawler" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
HTTP-коды:
grep -i "OI-Crawler" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn
Как выглядит нормальное поведение OI-Crawler
У официального crawler OpenINTEL ожидается достаточно специфичный профиль.
| Признак | Ожидаемое поведение |
|---|---|
| HTTP methods | Ограниченное количество GET |
| Первичный ресурс | robots.txt |
| Основная цель | Landing page apex domain |
| Redirects | Может следовать |
| Частота | Низкая |
| Глубокий crawl | Не является базовым описанным сценарием |
Такое поведение существенно упрощает обнаружение spoofing.
Как распознать поддельный OI-Crawler
User-Agent можно подделать даже у хорошо документированного crawler.
Например:
User-Agent: OI-Crawler/Nutch (https://openintel.nl/webcrawl/)
GET /.env
GET /.git/config
GET /wp-login.php
GET /backup.zip
GET /phpmyadmin/
такой профиль не соответствует официальному описанию web measurement OpenINTEL.
TrafficVeil не должен автоматически выдавать trusted-статус только из-за совпадения UA.
Как верифицировать OI-Crawler
OpenINTEL сообщает, что web crawler traffic происходит из инфраструктуры внутри одного IPv4 /26. Конкретные crawler-хосты публично не перечисляются; при необходимости проект может предоставить владельцу сайта дополнительные сведения напрямую. :contentReference[oaicite:13]{index=13}
Поэтому TrafficVeil может использовать несколько уровней проверки:
- UA содержит
OI-Crawler/Nutch; - ссылка в UA ведёт на OpenINTEL;
- IP/ASN соответствует ранее наблюдаемой инфраструктуре;
- поведение совпадает с ограниченным web measurement;
- fingerprint стабилен между визитами.
Почему нельзя публиковать observed IP как официальный диапазон
Даже если TrafficVeil регулярно наблюдает OI-Crawler с одного адреса, это ещё не превращает его в официальный публичный IP feed.
| Статус | Что означает |
|---|---|
| Observed IP | TrafficVeil видел OI-Crawler с этого адреса |
| Probable IP | Поведение и инфраструктура стабильно соответствуют OpenINTEL |
| Verified range | Диапазон подтверждён самим оператором |
OpenINTEL прямо говорит о происхождении crawling traffic из IPv4 /26, но не публикует конкретные crawler-хосты на странице. :contentReference[oaicite:14]{index=14}
Соблюдает ли OI-Crawler robots.txt
Да. Это один из тех случаев, где политика подтверждена самим оператором.
OpenINTEL пишет, что используемый crawler первым делом пытается получить, интерпретировать и соблюдать robots.txt. :contentReference[oaicite:15]{index=15}
Для полного запрета:
User-agent: OI-Crawler
Disallow: /
Можно использовать и конкретный токен, совпадающий с UA crawler.
Как закрыть только часть сайта
User-agent: OI-Crawler
Disallow: /admin/
Disallow: /account/
Disallow: /internal/
Disallow: /api/private/
Allow: /
Однако с учётом описанного OpenINTEL поведения глубокий обход этих зон и так не является нормальным базовым сценарием.
Что делать, если crawler создаёт нагрузку
OpenINTEL отдельно публикует процедуру для владельцев сайтов, которые считают, что crawling оказывает влияние на инфраструктуру.
Проект просит сообщить:
- название организации;
- контакт;
- IP затронутого сервера;
- описание нагрузки;
- время возникновения проблемы;
- исходные IP crawler.
Команда OpenINTEL пишет, что старается отвечать на такие обращения в течение одного рабочего дня. :contentReference[oaicite:16]{index=16}
Нужно ли сразу блокировать OI-Crawler
Обычно нет необходимости начинать с жёсткого Block.
Это хорошо документированный исследовательский crawler, оператор которого заявляет ответственную политику crawling и соблюдение robots.txt.
Базовая стратегия:
| Ситуация | Действие |
|---|---|
| Обычный подтверждённый OpenINTEL crawl | Allow / Monitor |
| Не хотите участвовать в web measurement | Disallow |
| Возникает нагрузка | Сначала robots.txt / анализ / обращение к оператору |
| UA не соответствует поведению | Проверить spoofing |
| Security scanning под UA OI-Crawler | Block источник |
Блокировка OI-Crawler через Nginx
Если нужен принудительный запрет:
if ($http_user_agent ~* "OI-Crawler") {
return 403;
}
Но для официального crawler OpenINTEL разумнее сначала воспользоваться robots.txt, поскольку оператор явно заявляет его соблюдение. :contentReference[oaicite:17]{index=17}
Блокировка через Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} OI-Crawler [NC]
RewriteRule ^ - [F,L]
Нужен ли Rate Limit
В большинстве случаев специальный Rate Limit для настоящего OI-Crawler не должен быть необходим.
OpenINTEL заявляет, что запросы к одному host распределяются во времени и должны оставаться значительно ниже типичной интенсивности посещения сайта обычным пользователем. :contentReference[oaicite:18]{index=18}
Если TrafficVeil видит десятки или сотни запросов в секунду под этим UA, это уже сильный повод проверить, действительно ли источник относится к OpenINTEL.
Как оценивать нагрузку в TrafficVeil
Для исследовательского crawler полезно показывать:
- Requests;
- Unique IP;
- ASN;
- Top URLs;
- RPS/RPM;
- robots.txt requests;
- redirect chains;
- HTTP status;
- Bandwidth;
- Origin requests.
Особенно полезный показатель:
Landing-page concentration — какая доля запросов приходится на apex landing page и robots.txt.
У настоящего OpenINTEL этот показатель должен быть высоким.
OI-Crawler и OpenAI — это разные боты
Название легко перепутать визуально:
OI-Crawler
OAI-SearchBot
Но это совершенно разные сущности.
| Бот | Оператор | Назначение |
|---|---|---|
| OI-Crawler | OpenINTEL | Internet measurement / research crawling |
| OAI-SearchBot | OpenAI | Поисковые функции OpenAI |
OpenAI официально использует имя OAI-SearchBot для своего search crawler. :contentReference[oaicite:19]{index=19}
Повлияет ли блокировка OI-Crawler на ChatGPT Search
Нет прямой связи.
OI-Crawler — OpenINTEL, а не OpenAI. Поэтому:
User-agent: OI-Crawler
Disallow: /
не является правилом:
User-agent: OAI-SearchBot
и не должно рассматриваться как запрет crawler OpenAI. :contentReference[oaicite:20]{index=20}
Повлияет ли блокировка на Google или Яндекс
Нет. Точечное правило для OI-Crawler не относится к Googlebot или YandexBot.
Главное — не использовать слишком широкий запрет всех автоматизированных клиентов, если поисковая индексация нужна сайту.
Как учитывать OI-Crawler в аналитике
OI-Crawler не является человеческим посещением.
Для TrafficVeil оптимальная структура:
Automated Traffic → Research & Internet Measurement → OpenINTEL → OI-Crawler
Рекомендуется:
- исключать из Human Traffic;
- не считать конверсией;
- не относить к Malicious Bots при подтверждении;
- учитывать отдельно как research crawler;
- сохранять статистику IP/ASN и поведения.
Рекомендуемая карточка TrafficVeil
| Поле | Значение |
|---|---|
| Name | OI-Crawler |
| Full UA | OI-Crawler/Nutch (https://openintel.nl/webcrawl/) |
| Operator | OpenINTEL |
| Category | Research / Internet Measurement |
| Project partners | University of Twente, SIDN, NLnet Labs, SURF |
| Crawler engine | Apache Nutch |
| robots.txt | Yes — officially documented |
| Network | IPv4 /26 according to operator |
| Public exact IP feed | No |
| Default action | Allow / Monitor |
| Human analytics | Exclude |
Что показывать пользователю TrafficVeil
Вместо:
«Неизвестный crawler. Оператор не подтверждён.»
правильнее выводить:
OI-Crawler — исследовательский crawler проекта OpenINTEL. Он выполняет ограниченные web-измерения, сначала проверяет robots.txt и обычно получает landing page домена. Блокировка не влияет на Google или OAI-SearchBot OpenAI.
Итог
OI-Crawler — не неизвестный crawler и не бот OpenAI. Это веб-краулер исследовательского проекта OpenINTEL, работающего при участии University of Twente, SIDN, NLnet Labs и SURF. :contentReference[oaicite:21]{index=21}
OpenINTEL достаточно подробно описывает его поведение: crawler использует Nutch, проверяет и соблюдает robots.txt, выполняет ограниченное количество HTTP GET, получает landing page apex-домена и следует редиректам. :contentReference[oaicite:22]{index=22}
Поэтому для TrafficVeil его базовый статус лучше изменить с Unknown / Deny на Legitimate Research Crawler / Allow or Monitor.
Если владелец сайта не хочет участвовать в измерениях OpenINTEL, корректный первый шаг — отдельный Disallow для OI-Crawler. Если же под этим UA наблюдается агрессивное сканирование или высокая частота запросов, необходимо проверить spoofing и оценивать источник уже по IP, ASN, fingerprint и реальному поведению.
Частые вопросы
Что такое OI-Crawler?
Кто является оператором OI-Crawler?
Соблюдает ли OI-Crawler robots.txt?
Что именно сканирует OI-Crawler?
Есть ли официальный список IP?
OI-Crawler относится к OpenAI или ChatGPT Search?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.