MixrankBot принадлежит MixRank — data-платформе бизнес-разведки, основанной в Сан-Франциско в 2011 году и прошедшей через акселератор Y Combinator. Это не начинающий стартап: компания обрабатывает петабайты данных ежемесячно из веб-краулинга, Google Play, Apple App Store и социальных сетей, а среди её корпоративных клиентов открыто называют Google, Amazon, Facebook, Intel и Adobe.
Что именно собирает MixRank и зачем
MixRank продаёт доступ к нескольким крупным датасетам: данные о более чем 70 миллионах компаний, обновляемые ежемесячно; технографика — какие технологии установлены на сотнях миллионов сайтов; база мобильных приложений и интегрированных в них SDK; и данные о вакансиях (свыше 1,2 миллиарда объявлений). По собственному описанию компании, для построения технографического датасета MixRank обходит открытый веб и разбирает код страниц, чтобы определить, использует ли конкретный сайт ту или иную технологию, — то есть задача краулера концептуально похожа на уже разобранный в этой серии SMTBot от SimilarTech/Similarweb, только в рамках более широкой продуктовой линейки MixRank, охватывающей не только сайты, но и мобильные приложения, компании и вакансии.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 (compatible; MixrankBot; crawler@mixrank.com) |
| Оператор | MixRank (mixrank.com) — основана в 2011 году, выпускница Y Combinator (лето 2011) |
| Модель компании | B2B-подписка: данные о компаниях, сотрудниках, вакансиях, мобильных приложениях и веб-технографике для отделов продаж, маркетинга, рекрутинга и инвестиционного анализа |
| Клиентская база | От стартапов до крупных корпораций — публично называются Google, Amazon, Facebook, Intel, Adobe, а также венчурные и рекрутинговые фирмы |
| Назначение краулера | Сканирование открытого веба для определения используемых на сайтах технологий (технографический датасет) и построения профилей компаний |
| Соблюдение robots.txt | По независимым практическим наблюдениям — часто ненадёжно; для реального контроля обычно требуется блокировка на уровне сервера, а не только правило в файле политики |
| Список IP-адресов | ❌ Официального фида обычно нет |
Почему это меняет практическую оценку
В отличие от полностью анонимных ботов из этой серии, у MixrankBot есть конкретный, крупный и давно работающий оператор с открыто перечисленными enterprise-клиентами. Это не делает бота автоматически желанным гостем — прямой выгоды владельцу сайта присутствие в датасете MixRank не приносит, — но означает, что решение о блокировке принимается осознанно, а не вслепую: сайт становится источником данных для довольно обширной B2B-экосистемы продаж, рекрутинга и инвестиционной аналитики, а не жертвой непонятного скрапинга.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Сколько трафика он создаёт
По сводке TrafficVeil, паттерн запросов mixrankbot на подключённых доменах составил порядка 400. Это ожидаемо небольшой объём для технографического сканирования, которому обычно достаточно проанализировать код нескольких ключевых страниц сайта, а не обходить его целиком.
Как найти бота в логах
grep -i "MixrankBot" /var/log/nginx/access.log
Поскольку официального списка IP нет, а на практике соблюдение robots.txt этим ботом бывает ненадёжным, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois, а контроль строить на уровне сервера, а не только через файл политики.
Стоит ли блокировать
- если технологический стек и корпоративный профиль сайта конфиденциальны и владелец не хочет, чтобы конкуренты или другие участники B2B-рынка узнавали об этом через подписки MixRank, — блокировка обоснована, и на практике эффективнее делать это на уровне сервера;
- если попадание в подобные датасеты нейтрально или потенциально полезно (например, видимость среди потенциальных партнёров, инвесторов или поставщиков технологий, ищущих клиентов через такие базы) — можно оставить бота разрешённым;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это не поисковый краулер ни одной из систем.
Как настроить доступ
Правило в robots.txt как заявление политики:
User-agent: MixrankBot
Disallow: /
Поскольку соблюдение этого правила ботом на практике не гарантировано, для реального результата стоит дублировать его на уровне сервера:
if ($http_user_agent ~* "MixrankBot") {
return 403;
}Частые вопросы
Кто владеет краулером MixrankBot?
Кто клиенты этой компании?
Зачем боту сканировать код сайтов?
Соблюдает ли MixrankBot правила robots.txt?
Приносит ли присутствие бота пользу владельцу сайта?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.