Боты6 мин чтения·10 августа 2026 г.·обновлено 8 сентября 2026 г.

Intelx.io_bot — верхушка айсберга гораздо более серьёзной платформы

За скромным публичным краулером intelx.io_bot стоит сервис, архивирующий даркнет, утечки данных и логи вредоносного ПО без политики удаления «токсичного» контента. Разбираем, почему это принципиально не Wayback Machine.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота IntelX Bot: нежелательный бот

intelx.io_bot — краулер сервиса Intelligence X (intelx.io): индексирует и архивирует открытые данные (домены, URL, селекторы и т.п.) для поиска и threat intelligence. Это не Googlebot и не классический SEO-краулер — а часть инфраструктуры куда более специфического и чувствительного по характеру данных сервиса.

Параметры

Параметр Значение
User-Agent Mozilla/5.0 (compatible; intelx.io_bot +https://intelx.io)
Токен intelx.io_bot
Оператор Intelligence X — независимая европейская технологическая компания, основана в 2018 году Петером Клайсснером, базируется в Праге, Чехия
Сайт intelx.io
IP-лист ❌ Компактного официального feed обычно нет
robots.txt Ожидается соблюдение, но не доказательство — см. отдельный раздел про философию хранения данных ниже

С чем сайт на самом деле имеет дело

Формулировка «домены, URL, селекторы» — не полная картина. Intelligence X — поисковик и архив, работающий с гораздо более широким и чувствительным набором источников: контент даркнета (сети Tor и I2P) — форумы, торговые площадки, сайты утечек программ-вымогателей; архивы данных из брешей и утечек, включая исходный код вредоносного ПО и персональные данные пострадавших; исторические записи WHOIS; DNS-записи; и отдельную категорию «Bot Logs» — данные, украденные вредоносным ПО (например, Azorult) и обычно продаваемые на теневых площадках вроде Genesis Market. Целевая аудитория сервиса — специалисты по OSINT, threat intelligence, цифровой криминалистике, журналисты-расследователи и государственные структуры. Публичный веб-краулинг (intelx.io_bot) — вероятно, только одна, относительно рядовая часть общей инфраструктуры сбора данных платформы; более чувствительные категории (даркнет, утечки) собираются, скорее всего, отдельными специализированными пайплайнами, а не этим конкретным ботом.

Почему это не Wayback Machine, даже философски

Ключевое отличие от Internet Archive, о котором стоит знать: Wayback Machine регулярно удаляет архивные снимки по запросу владельцев и в целом учитывает исключения через robots.txt (хотя тоже не идеально, как разбиралось в статье про archive.org_bot). Intelligence X занимает противоположную позицию — компания прямо заявляет о сохранении «токсичных» данных независимо от их характера, объясняя это именно тем, что другие архивы подобный контент удаляют, а исследователям и следователям нужен постоянный доступ к историческим версиям, даже если материал позже был убран из оригинального источника. Практическое следствие: не рассчитывайте, что запрет через robots.txt для этого бота работает так же надёжно, как для типового SEO-краулера, — общая философия платформы построена вокруг сохранения данных, а не их оперативного удаления по первому запросу.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Масштаб данных, с которыми оперирует сервис

В 2021 году сама платформа Intelligence X стала объектом атаки: злоумышленник вычерпал из публично проиндексированного раздела «Pastes» архив, содержащий свыше 92,6 миллиона email-записей (собранных с Pastebin, Pastie и Skidpaste). Сама компания охарактеризовала это как скрапинг публично проиндексированного контента, а не взлом основных систем. Это иллюстрирует масштаб и характер материала, с которым в принципе работает платформа — сайту стоит понимать этот контекст, даже если непосредственно intelx.io_bot просто индексирует публичные страницы.

Нагрузка

По сводке TrafficVeil паттерн intelx.io_bot — порядка 15 тысяч запросов (март–июнь 2026, июнь по 14.06).

Контроль

grep -i "intelx.io_bot" /var/log/nginx/access.log
User-agent: intelx.io_bot
Disallow: /
if ($http_user_agent ~* "intelx\.io_bot|intelx") {
    return 403;
}

Рекомендации

  • Не хотите попадать в индекс/архив Intelligence X — Disallow + deny; учитывая философию сервиса про сохранение данных, для гарантии дублируйте на уровне сервера, а не полагайтесь только на robots.txt
  • Нужна видимость в их поиске — например, для OSINT-профессионалов или организаций, которые сами заинтересованы быть обнаруживаемыми через такие инструменты — Allow
  • На ранжирование в Google блокировка не влияет
  • Помните: даже если сам краулер indexes только публичные страницы, платформа в целом оперирует гораздо более широким и чувствительным набором данных — это не аналог обычного SEO-инструмента

Частые вопросы

Кто оператор intelx.io_bot и где базируется компания?
Независимая европейская технологическая компания Intelligence X, основанная в 2018 году Петером Клайсснером, базируется в Праге, Чехия.
Индексирует ли Intelligence X только обычные публичные сайты?
Нет, платформа в целом также архивирует контент даркнета, утечки данных, исходный код вредоносного ПО и логи, украденные стилерами — публичный веб-краулинг лишь часть общей инфраструктуры.
Чем философия хранения данных у Intelligence X отличается от Wayback Machine?
Wayback Machine регулярно удаляет снимки по запросу, а Intelligence X прямо заявляет о сохранении «токсичных» данных независимо от их характера именно потому, что другие архивы их убирают.
Можно ли полагаться на robots.txt как на надёжный барьер для этого сервиса?
Не стоит рассчитывать на это так же, как для типового SEO-краулера — общая философия платформы построена вокруг сохранения данных, а не оперативного удаления по запросу.
Случались ли инциденты безопасности с самой платформой Intelligence X?
Да, в 2021 году злоумышленник вычерпал из её публично проиндексированного раздела архив из свыше 92,6 миллиона email-записей.
Кому может быть выгодна видимость сайта в поиске Intelligence X?
В основном OSINT-специалистам, исследователям угроз и государственным структурам — организациям, которые сами заинтересованы быть обнаруживаемыми через подобные инструменты.
#intelx.io_bot#Intelligence X#threat intelligence#OSINT#даркнет-архивы#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil