SentiBot принадлежит SentiOne — платформе социального прослушивания (social listening) и анализа тональности, чей продукт SentiOne Listen ежедневно анализирует свыше 300 000 доменов из разных стран. Компания открыто публикует официальную страницу поддержки бота на sentibot.eu — редкий уровень прозрачности для этой категории, включая прямую форму обратной связи для администраторов сайтов, которые заметили нежелательный трафик.
Что делает SentiOne Listen и зачем нужен обход сайтов
SentiOne Listen — инструмент социального прослушивания: платформа отслеживает упоминания брендов, продуктов и тем в пользовательском контенте по всему открытому вебу, чтобы клиенты могли анализировать общественное настроение, отслеживать рыночные тренды и получать инсайты из UGC (user-generated content) — комментариев, форумов, отзывов и подобных источников. Отдельно компания указывает, что собранные данные также используются для развития собственных AI-моделей SentiOne — разговорных ботов, голосовых ассистентов и систем отслеживания тональности, то есть у краулера двойное назначение: сбор аналитических данных для клиентов платформы социального прослушивания и материал для обучения внутренних NLU-моделей компании.
Параметры бота
| Параметр | Значение |
| User-Agent | SentiBot www.sentibot.eu (compatible with Googlebot) |
| Оператор | SentiOne (SentiOne LLC / SentiOne s.r.o. в зависимости от источника) |
| Официальная документация | sentibot.eu — включает объяснение назначения, инструкции по настройке robots.txt и форму для сообщения о проблемах |
| Масштаб операции | Свыше 300 000 доменов анализируется ежедневно, по заявлению самой компании — с прямым обязательством минимизировать создаваемый трафик |
| Особенность поведения при отсутствии правил | Если для сайта не заданы явные правила именно для «sentibot», применяются ограничения, заданные для «googlebot» — та же логика fallback, что уже разбиралась для Paqlebot в этой серии |
| Поддерживаемые параметры robots.txt | Официально подтверждена поддержка и crawl-delay, и disallow |
| Задержка применения изменений | До 48 часов после обновления robots.txt — не мгновенно |
| Верификация | Официальная страница отдельно рекомендует проверять подлинность конкретного запроса, прежде чем принимать решение о блокировке — то есть компания сама признаёт риск подделки строки UA |
Почему упоминание Googlebot в самой строке UA — не попытка выдать себя за Google
Фраза «compatible with Googlebot» внутри строки User-Agent SentiBot часто вызывает у администраторов сайтов подозрение в маскировке под поискового робота Google. Но, судя по официальному объяснению самой компании, это не попытка ввести в заблуждение, а прямое указание на техническую логику fallback: если сайт не задал отдельного правила для «sentibot», бот будет следовать ограничениям, заданным для «googlebot», — то есть фраза в UA буквально описывает то, как бот сам себя ведёт по умолчанию, а не пытается выдать себя за другого оператора.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Практическая ловушка с fallback на правила Googlebot
Как и в случае с Paqlebot, здесь легко случайно создать нежелательный эффект: если администратор задал в robots.txt более мягкие правила специально для Googlebot (например, разрешив всё), а для SentiBot отдельной секции не прописал, бот унаследует именно эти мягкие правила Googlebot по умолчанию — даже если общее намерение владельца сайта было ограничить нежелательный сбор данных для чужих коммерческих сервисов. Чтобы этого избежать, правило для «sentibot» стоит задавать явно и отдельно, а не полагаться на поведение по умолчанию.
Как найти бота в логах
grep -i "sentibot" /var/log/nginx/access.log
Поскольку сама компания честно признаёт риск подделки UA, для проверки подлинности при аномальной активности стоит дополнительно свериться с ASN конкретных IP через whois, а не полагаться на одно лишь совпадение строки заголовка.
Стоит ли блокировать
- если сайт не заинтересован в том, чтобы его публичный пользовательский контент анализировался для чужих коммерческих отчётов социального прослушивания и обучения AI-моделей SentiOne, — блокировка обоснована;
- если сайт сам является клиентом SentiOne или заинтересован в присутствии в её базе (например, для собственного мониторинга упоминаний бренда через ту же платформу) — бота стоит явно разрешить;
- на позиции в поисковой выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — сходство с Googlebot касается только логики fallback в robots.txt, а не реального отношения к поисковой индексации.
Как настроить robots.txt
Явное, отдельное правило для SentiBot — важно не полагаться на fallback:
User-agent: sentibot
Disallow: /
Ограничение скорости вместо полного запрета, поскольку компания официально поддерживает эту директиву:
User-agent: sentibot
Crawl-delay: 10
if ($http_user_agent ~* "sentibot") {
return 403;
}
При изменении правил стоит учитывать заявленную задержку применения до 48 часов и, при срочной необходимости, обращаться напрямую через официальную форму на sentibot.eu.
Частые вопросы
SentiBot пытается выдать себя за Googlebot?
Зачем платформе SentiOne нужен этот краулер?
Как долго применяются изменения в robots.txt для этого бота?
В чём практическая ловушка с fallback на правила Googlebot?
Поддерживает ли SentiBot директиву Crawl-delay?
Куда обращаться при срочных проблемах с ботом?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.