За именами AwarioSmartBot и AwarioRssBot стоит платформа социального прослушивания Awario, чей масштаб операции впечатляет даже на фоне крупных игроков этой категории: по независимым данным, семейство её краулеров обходит свыше 13 миллиардов веб-страниц ежедневно, помогая интернет-маркетологам находить упоминания брендов по всему открытому вебу. Официальная страница awario.com/bots.html — образец редкой для этой категории прозрачности: подробное описание назначения, гарантии вежливого поведения и прямой контактный email для вопросов.
Почему у Awario не один бот, а целое маленькое семейство
AwarioBot, AwarioSmartBot и AwarioRssBot формально можно считать одним семейством с разделением задач внутри общей платформы социального прослушивания: они вместе отвечают за обнаружение и сбор нового или обновлённого публичного контента на сайтах, в блогах, на форумах, чтобы затем платформа могла показать клиентам, кто и где упоминает отслеживаемый бренд. По официальному описанию оператора, если краулер посетил конкретную страницу, это означает, что её содержимое либо никогда раньше не анализировалось, либо требовало обновления — именно поэтому повторные запросы к одной и той же странице не типичны для этого семейства.
Параметры ботов
| Параметр | Значение |
| User-Agent | AwarioSmartBot/1.0 (+https://awario.com/bots.html; bots@awario.com), родственный AwarioRssBot/1.0 (+https://awario.com/bots.html; bots@awario.com), а также базовый Mozilla/5.0 (compatible; AwarioBot/1.0; +https://awario.com/bots.html) |
| Оператор | Awario — платформа социального прослушивания и мониторинга упоминаний бренда |
| Официальная документация | awario.com/bots.html |
| Масштаб операции | По независимым оценкам, свыше 13 миллиардов страниц обходится ежедневно по всей платформе |
| Заявленная частота | Официально гарантировано: не более 1 запроса раз в 3 секунды на сайт, ещё реже — если задано в robots.txt через Crawl-delay |
| Что именно собирается | Только публично доступный текстовый контент — компания прямо просит убрать со страницы любые данные, которые владелец сайта считает чувствительными, если те оказались публично доступны |
| Верификация | Официально не по IP — компания прямо просит не пытаться идентифицировать бота по диапазонам адресов, так как последовательные блоки IP не используются; рекомендуемый метод — двойной DNS lookup |
| Соблюдение robots.txt | Да, официально подтверждено, включая поддержку Crawl-delay |
Что означает частота визитов для конкретного сайта
По независимому анализу поведения, у AwarioBot есть чёткая логика выбора целей: он «приходит со списком покупок» — точечно и повторно обращается именно к тем страницам, которые интересны клиентам платформы (например, страницы с ценами, объявлениями о продукте, анонсами), с частотой от почасовой до еженедельной, в зависимости от того, насколько активно отслеживается конкретный сайт. Сайты, не попавшие ни в чей watchlist, эти боты могут вообще никогда не посетить — то есть присутствие бота в логах уже само по себе сигнал: контент сайта кого-то интересует достаточно, чтобы отслеживать его регулярно.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Сколько трафика он создаёт
По сводке TrafficVeil, паттерн запросов awario на подключённых доменах составил порядка 300. Учитывая официально заявленное ограничение не более одного запроса в 3 секунды на сайт, это ожидаемо умеренный объём, полностью соответствующий заявленной модели «вежливого» краулинга.
Как найти бота в логах и проверить подлинность
grep -i "Awario" /var/log/nginx/access.log
Официальная рекомендация — двойной DNS lookup вместо попытки сверки по IP-диапазонам:
host <IP>
# полученный hostname
host <hostname>
# должен вернуть тот же исходный IP
Стоит ли блокировать
- если сайт заинтересован в том, чтобы упоминания его бренда или продукции обнаруживались клиентами платформ вроде Awario (что типично для компаний, активно отслеживающих собственную репутацию через такие же инструменты), — присутствие бота, скорее, нейтральный факт;
- если сайт не хочет, чтобы его публичный контент попадал в чужую коммерческую базу мониторинга упоминаний, — можно спокойно заблокировать: боты официально «безобидны», но это не означает, что присутствие в базе выгодно самому сайту;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого семейства не влияет.
Как настроить robots.txt
Полный запрет для всего семейства:
User-agent: AwarioBot
Disallow: /
User-agent: AwarioSmartBot
Disallow: /
User-agent: AwarioRssBot
Disallow: /
Ограничение скорости вместо полного запрета, если полная блокировка избыточна при и так умеренной нагрузке:
User-agent: AwarioSmartBot
Crawl-delay: 10
if ($http_user_agent ~* "Awario") {
return 403;
}Частые вопросы
Сколько страниц в день обходит семейство ботов Awario?
Как официально рекомендуется проверять подлинность запроса?
Почему эти боты редко повторно заходят на одну и ту же страницу?
Какая заявленная частота запросов у этих ботов?
Что означает, если бот вообще никогда не заходил на сайт?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.