CheckMarkNetwork — краулер CheckMark Network, который обходит страницы, переходя по ссылкам, чтобы пополнять собственную knowledge base. Официальная политика оператора: краулер читает robots.txt, соблюдает умеренный темп обхода и ограничивает число страниц с одного хоста, чтобы не создавать заметной нагрузки на сервер.
Параметры
| Параметр | Значение |
|---|---|
| UA | CheckMarkNetwork/1.0 (+https://www.checkmarknetwork.com/spider.html) |
| Docs | checkmarknetwork.com/spider.html |
| Контакт | support@checkmarknetwork.com |
| IP | Меняются со временем; сам оператор рекомендует ориентироваться на UA, а не на IP |
| robots.txt | Да — интерпретирует файл «по спецификации Googlebot», как указано в официальной документации |
Чем предположительно занимается CheckMark Network
На странице с описанием краулера рядом фигурирует формулировка «Complete Brand Protection» — это намекает на вероятную бизнес-модель компании: похоже, CheckMark Network работает в сфере защиты бренда и мониторинга использования товарных знаков в интернете, а собственная knowledge base служит именно этой задаче, а не построению публичного поисковика. Прямого официального заявления об этом на странице спецификации краулера нет — это контекстная гипотеза, а не подтверждённый факт, но она объясняет, зачем компании вообще нужен собственный обход веба.
Как обходит сайты
Краулер обнаруживает новые страницы, переходя по ссылкам со страницы на страницу — классический способ обхода, а не по заранее заданному списку URL. По заявлению разработчиков, инструмент специально спроектирован с минимальным потреблением памяти и процессорного времени и создаёт очень небольшую нагрузку на посещаемые серверы — в частности, темп обхода намеренно умеренный, чтобы не мешать обслуживанию других посетителей сайта.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка
По сводке TrafficVeil — порядка 9 тысяч запросов. Для краулера с заявленно умеренным темпом обхода такой объём не выглядит аномальным.
Контроль
grep -i "CheckMarkNetwork" /var/log/nginx/access.log
User-agent: CheckMarkNetwork
Disallow: /
if ($http_user_agent ~* "CheckMarkNetwork") {
return 403;
}
Стоит знать перед решением
Этот UA уже встроен по умолчанию в ряд общедоступных шаблонов robots.txt, которые сайты используют для блокировки нежелательных краулеров списком — то есть многие площадки в интернете уже давно решили закрыть к себе доступ CheckMarkNetwork, не находя в его визитах прямой пользы для себя. Это не обязывающий аргумент, но полезный ориентир: если вы сомневаетесь, стоит ли разрешать обход, знайте, что закрытие этого краулера — довольно распространённая практика, а не редкое исключение.
Рекомендации
- Нет пользы от их knowledge base для вашего сайта — Disallow + deny, это самый частый сценарий
- Если вы сами заинтересованы в мониторинге бренда через подобный сервис — прежде чем банить, стоит уточнить, не связан ли этот краулер с инструментом, которым пользуется ваша же компания или юридический отдел
- На позиции в Google блокировка не влияет — краулер не имеет отношения к поисковой индексации
Частые вопросы
Зачем компании CheckMark Network вообще нужен собственный краулер?
Как краулер находит новые страницы для обхода?
Стоит ли доверять заявлению о низкой нагрузке от этого бота?
Правда ли, что многие сайты уже блокируют CheckMarkNetwork?
Как правильно идентифицировать этот краулер, если его IP-адреса меняются?
Повлияет ли блокировка CheckMarkNetwork на позиции сайта в Google?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.