Честный ответ по Assaybot короче, чем хотелось бы: в отличие от KStandBot или ImagesiftBot, у этого краулера нет ни официальной страницы оператора, ни упоминания в профильных каталогах ботов, ни задокументированной политики по robots.txt. Это тот случай, когда решение allow/deny приходится строить не на репутации бренда, а исключительно на поведении, которое видно в собственных логах сайта.
Что можно сказать о нём достоверно
Само имя происходит от английского assay — «проба», «анализ», термин, который в химии и металлургии означает испытание образца на состав. По аналогии можно предположить, что бот выполняет какой-то вид автоматизированного анализа страниц — контента, ссылочной структуры или технических параметров, — но подтверждённой информации о конкретном назначении, операторе или клиентском продукте, который стоит за этим именем, в открытых источниках нет. В отличие от предыдущих разборов в этой серии, здесь нечестно было бы выдавать правдоподобную догадку за факт: единственное, что можно сказать наверняка, — это то, что сайт, на который заходит этот бот, чем-то оказался интересен для чьей-то автоматизированной задачи, суть которой остаётся непрозрачной.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | assaybot |
| Оператор | Не установлен — отсутствует в публичных каталогах ботов и профильной документации |
| Официальная документация | ❌ Не найдена |
| Список IP-адресов | ❌ Отсутствует |
| Соблюдение robots.txt | Не подтверждено ни в одну, ни в другую сторону |
| Категория TrafficVeil | Прочие краулеры и сервисы — нежелательный |
Отсутствие документации само по себе — не приговор: часть нишевых или внутренних инструментов компаний просто никогда не публикует описание своих технических агентов. Но для владельца сайта это означает, что оценивать бота приходится по косвенным признакам, а не по заявленной политике оператора.
Как оценить бота по факту, а не по названию
При полном отсутствии официальной документации разумная методика — смотреть на четыре параметра одновременно, а не на что-то одно:
- Глубина обхода — точечные обращения к нескольким конкретным URL это одна история, а систематический проход по всей пагинации и каталогу — совсем другая;
- Повторяемость — вычитывает ли бот один и тот же набор адресов регулярно (похоже на мониторинг/аналитику) или каждый раз новые (похоже на массовый сбор данных);
- Сессионные признаки — отсутствие cookie и нормальной сессии, характерное для автоматизированных клиентов, в отличие от браузера живого пользователя;
- Принадлежность IP — датацентр общего назначения (облачный хостинг) с большей вероятностью говорит о стороннем скрапере, чем о специализированной инфраструктуре именованного сервиса.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "assaybot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "assaybot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "assaybot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "assaybot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Для проверки принадлежности IP при отсутствии официального фида — стандартная связка whois/rDNS:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Строку User-Agent при этом важно не принимать на веру: подделать её может любой скрипт, поэтому окончательное решение должно опираться на связку UA с частотой запросов, набором URL и принадлежностью IP, а не на одно только имя в логе.
Как заблокировать
При отсутствии подтверждённой пользы для сайта разумный подход по умолчанию — запрет:
User-agent: assaybot
Disallow: /
if ($http_user_agent ~* "assaybot") {
return 403;
}
Если требуется не полная блокировка, а контроль частоты — например, чтобы понаблюдать за поведением бота дольше, прежде чем принимать окончательное решение:
limit_req_zone $binary_remote_addr zone=assaybot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "assaybot") {
limit_req zone=assaybot burst=20 nodelay;
}
}
Итог
На позиции в поисковой выдаче Google, Bing или Яндекса присутствие или отсутствие Assaybot не влияет — это не поисковый краулер ни одной из известных систем. При отсутствии официальной документации и подтверждённой пользы для владельца сайта запрет по умолчанию — оправданная и низкорисковая позиция; если со временем появится больше данных о происхождении и назначении этого бота, политику можно будет пересмотреть точечно.
Частые вопросы
Кто владеет краулером Assaybot?
Что означает само название бота?
Как оценивать бота, если официальной документации нет?
Стоит ли доверять строке User-Agent при принятии решения?
Что делать при отсутствии подтверждённой пользы от бота?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.