intelx.io_bot — краулер сервиса Intelligence X (intelx.io): индексирует и архивирует открытые данные (домены, URL, селекторы и т.п.) для поиска и threat intelligence. Это не Googlebot и не классический SEO-краулер — а часть инфраструктуры куда более специфического и чувствительного по характеру данных сервиса.
Параметры
| Параметр | Значение |
|---|---|
| User-Agent | Mozilla/5.0 (compatible; intelx.io_bot +https://intelx.io) |
| Токен | intelx.io_bot |
| Оператор | Intelligence X — независимая европейская технологическая компания, основана в 2018 году Петером Клайсснером, базируется в Праге, Чехия |
| Сайт | intelx.io |
| IP-лист | ❌ Компактного официального feed обычно нет |
| robots.txt | Ожидается соблюдение, но не доказательство — см. отдельный раздел про философию хранения данных ниже |
С чем сайт на самом деле имеет дело
Формулировка «домены, URL, селекторы» — не полная картина. Intelligence X — поисковик и архив, работающий с гораздо более широким и чувствительным набором источников: контент даркнета (сети Tor и I2P) — форумы, торговые площадки, сайты утечек программ-вымогателей; архивы данных из брешей и утечек, включая исходный код вредоносного ПО и персональные данные пострадавших; исторические записи WHOIS; DNS-записи; и отдельную категорию «Bot Logs» — данные, украденные вредоносным ПО (например, Azorult) и обычно продаваемые на теневых площадках вроде Genesis Market. Целевая аудитория сервиса — специалисты по OSINT, threat intelligence, цифровой криминалистике, журналисты-расследователи и государственные структуры. Публичный веб-краулинг (intelx.io_bot) — вероятно, только одна, относительно рядовая часть общей инфраструктуры сбора данных платформы; более чувствительные категории (даркнет, утечки) собираются, скорее всего, отдельными специализированными пайплайнами, а не этим конкретным ботом.
Почему это не Wayback Machine, даже философски
Ключевое отличие от Internet Archive, о котором стоит знать: Wayback Machine регулярно удаляет архивные снимки по запросу владельцев и в целом учитывает исключения через robots.txt (хотя тоже не идеально, как разбиралось в статье про archive.org_bot). Intelligence X занимает противоположную позицию — компания прямо заявляет о сохранении «токсичных» данных независимо от их характера, объясняя это именно тем, что другие архивы подобный контент удаляют, а исследователям и следователям нужен постоянный доступ к историческим версиям, даже если материал позже был убран из оригинального источника. Практическое следствие: не рассчитывайте, что запрет через robots.txt для этого бота работает так же надёжно, как для типового SEO-краулера, — общая философия платформы построена вокруг сохранения данных, а не их оперативного удаления по первому запросу.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Масштаб данных, с которыми оперирует сервис
В 2021 году сама платформа Intelligence X стала объектом атаки: злоумышленник вычерпал из публично проиндексированного раздела «Pastes» архив, содержащий свыше 92,6 миллиона email-записей (собранных с Pastebin, Pastie и Skidpaste). Сама компания охарактеризовала это как скрапинг публично проиндексированного контента, а не взлом основных систем. Это иллюстрирует масштаб и характер материала, с которым в принципе работает платформа — сайту стоит понимать этот контекст, даже если непосредственно intelx.io_bot просто индексирует публичные страницы.
Нагрузка
По сводке TrafficVeil паттерн intelx.io_bot — порядка 15 тысяч запросов (март–июнь 2026, июнь по 14.06).
Контроль
grep -i "intelx.io_bot" /var/log/nginx/access.log
User-agent: intelx.io_bot
Disallow: /
if ($http_user_agent ~* "intelx\.io_bot|intelx") {
return 403;
}
Рекомендации
- Не хотите попадать в индекс/архив Intelligence X — Disallow + deny; учитывая философию сервиса про сохранение данных, для гарантии дублируйте на уровне сервера, а не полагайтесь только на robots.txt
- Нужна видимость в их поиске — например, для OSINT-профессионалов или организаций, которые сами заинтересованы быть обнаруживаемыми через такие инструменты — Allow
- На ранжирование в Google блокировка не влияет
- Помните: даже если сам краулер indexes только публичные страницы, платформа в целом оперирует гораздо более широким и чувствительным набором данных — это не аналог обычного SEO-инструмента
- AhrefsBot: полное руководство
- Googlebot: полное руководство
- Googlebot-Image
- Googlebot-News
- Googlebot-Video
- Google AdsBot
- Storebot-Google
- Mediapartners-Google (AdSense)
- Feedfetcher-Google
- APIs-Google
- Google-Read-Aloud
- Google-Site-Verification и InspectionTool
- Bingbot (MSN Bot)
- YandexBot
- YandexMetrika
- Yandex Userproxy
- MJ12bot
- SemrushBot
- Amazonbot
- DotBot
- FacebookBot
- Amazon SearchBot
- Yandex Direct Fetcher
- Anthropic AI
- Cohere AI
- llmstxtscan
- HetrixTools
- ArchiveTeam ArchiveBot
- HeadlessChrome
- crawler_eb
- EECS498
- statdom.ru
- Website-info.net-Robot
Частые вопросы
Кто оператор intelx.io_bot и где базируется компания?
Индексирует ли Intelligence X только обычные публичные сайты?
Чем философия хранения данных у Intelligence X отличается от Wayback Machine?
Можно ли полагаться на robots.txt как на надёжный барьер для этого сервиса?
Случались ли инциденты безопасности с самой платформой Intelligence X?
Кому может быть выгодна видимость сайта в поиске Intelligence X?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.