Боты5 мин чтения·12 августа 2026 г.

MixrankBot: краулер бизнес-разведки с клиентами вроде Google и Amazon — почему robots.txt здесь ненадёжен

MixrankBot принадлежит MixRank — data-платформе бизнес-разведки из Y Combinator (2011), обрабатывающей петабайты данных ежемесячно для клиентов вроде Google, Amazon и Adobe. Разбираем, зачем технографическому датасету нужен обход сайтов, и почему на практике соблюдение robots.txt этим ботом ненадёжно — контроль лучше строить на уровне сервера

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота MixrankBot: нежелательный прочие краулеры и сервисы

MixrankBot принадлежит MixRank — data-платформе бизнес-разведки, основанной в Сан-Франциско в 2011 году и прошедшей через акселератор Y Combinator. Это не начинающий стартап: компания обрабатывает петабайты данных ежемесячно из веб-краулинга, Google Play, Apple App Store и социальных сетей, а среди её корпоративных клиентов открыто называют Google, Amazon, Facebook, Intel и Adobe.

Что именно собирает MixRank и зачем

MixRank продаёт доступ к нескольким крупным датасетам: данные о более чем 70 миллионах компаний, обновляемые ежемесячно; технографика — какие технологии установлены на сотнях миллионов сайтов; база мобильных приложений и интегрированных в них SDK; и данные о вакансиях (свыше 1,2 миллиарда объявлений). По собственному описанию компании, для построения технографического датасета MixRank обходит открытый веб и разбирает код страниц, чтобы определить, использует ли конкретный сайт ту или иную технологию, — то есть задача краулера концептуально похожа на уже разобранный в этой серии SMTBot от SimilarTech/Similarweb, только в рамках более широкой продуктовой линейки MixRank, охватывающей не только сайты, но и мобильные приложения, компании и вакансии.

Параметры бота

Параметр Значение
User-Agent Mozilla/5.0 (compatible; MixrankBot; crawler@mixrank.com)
Оператор MixRank (mixrank.com) — основана в 2011 году, выпускница Y Combinator (лето 2011)
Модель компании B2B-подписка: данные о компаниях, сотрудниках, вакансиях, мобильных приложениях и веб-технографике для отделов продаж, маркетинга, рекрутинга и инвестиционного анализа
Клиентская база От стартапов до крупных корпораций — публично называются Google, Amazon, Facebook, Intel, Adobe, а также венчурные и рекрутинговые фирмы
Назначение краулера Сканирование открытого веба для определения используемых на сайтах технологий (технографический датасет) и построения профилей компаний
Соблюдение robots.txt По независимым практическим наблюдениям — часто ненадёжно; для реального контроля обычно требуется блокировка на уровне сервера, а не только правило в файле политики
Список IP-адресов ❌ Официального фида обычно нет

Почему это меняет практическую оценку

В отличие от полностью анонимных ботов из этой серии, у MixrankBot есть конкретный, крупный и давно работающий оператор с открыто перечисленными enterprise-клиентами. Это не делает бота автоматически желанным гостем — прямой выгоды владельцу сайта присутствие в датасете MixRank не приносит, — но означает, что решение о блокировке принимается осознанно, а не вслепую: сайт становится источником данных для довольно обширной B2B-экосистемы продаж, рекрутинга и инвестиционной аналитики, а не жертвой непонятного скрапинга.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Сколько трафика он создаёт

По сводке TrafficVeil, паттерн запросов mixrankbot на подключённых доменах составил порядка 400. Это ожидаемо небольшой объём для технографического сканирования, которому обычно достаточно проанализировать код нескольких ключевых страниц сайта, а не обходить его целиком.

Как найти бота в логах

grep -i "MixrankBot" /var/log/nginx/access.log

Поскольку официального списка IP нет, а на практике соблюдение robots.txt этим ботом бывает ненадёжным, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois, а контроль строить на уровне сервера, а не только через файл политики.

Стоит ли блокировать

  • если технологический стек и корпоративный профиль сайта конфиденциальны и владелец не хочет, чтобы конкуренты или другие участники B2B-рынка узнавали об этом через подписки MixRank, — блокировка обоснована, и на практике эффективнее делать это на уровне сервера;
  • если попадание в подобные датасеты нейтрально или потенциально полезно (например, видимость среди потенциальных партнёров, инвесторов или поставщиков технологий, ищущих клиентов через такие базы) — можно оставить бота разрешённым;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это не поисковый краулер ни одной из систем.

Как настроить доступ

Правило в robots.txt как заявление политики:

User-agent: MixrankBot
Disallow: /

Поскольку соблюдение этого правила ботом на практике не гарантировано, для реального результата стоит дублировать его на уровне сервера:

if ($http_user_agent ~* "MixrankBot") {
    return 403;
}

Частые вопросы

Кто владеет краулером MixrankBot?
MixRank — data-платформа бизнес-разведки из Сан-Франциско, основанная в 2011 году, выпускница Y Combinator.
Кто клиенты этой компании?
Enterprise-клиенты вроде Google, Amazon, Facebook, Intel и Adobe, а также венчурные и рекрутинговые фирмы.
Зачем боту сканировать код сайтов?
Чтобы определить, какие технологии использует сайт, для построения технографического датасета — той же логики, что у SMTBot от Similarweb.
Соблюдает ли MixrankBot правила robots.txt?
На практике часто ненадёжно — для реального контроля обычно нужна блокировка на уровне сервера, а не только правило в файле политики.
Приносит ли присутствие бота пользу владельцу сайта?
Прямой выгоды обычно нет, но попадание в такие датасеты может быть нейтральным или даже полезным для видимости среди потенциальных партнёров и инвесторов.
Повлияет ли блокировка на позиции в поисковых системах?
Нет, этот бот не связан с индексацией Google, Bing или Яндекса.
#mixrankbot#MixRank#business intelligence#технографика#бот-энциклопедия#robots.txt#verification#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil