SurdotlyBot — краулер Sur.ly: собирает данные для security-профиля сайта (метаданные, favicon, скриншот и т.п.) в рамках anti-spam / safe-link сервиса. Не Googlebot.
Параметры
| Параметр | Значение |
|---|---|
| UA | Mozilla/5.0 (compatible; SurdotlyBot/1.0; +http://sur.ly/bot.html) |
| Docs | sur.ly/bot.html |
| robots.txt | Официально заявлено полное соблюдение (allow/disallow/crawl-delay/host), но реальные полевые отчёты вебмастеров это оспаривают — см. ниже |
| Токен | SurdotlyBot |
Что бот на самом деле проверяет
По официальному описанию оператора, SurdotlyBot в первую очередь интересуется не содержимым самого сайта, а его **исходящими ссылками**: он проверяет, куда они ведут, сверяя адреса с базой известных угроз Sur.ly. Сайт для бота — скорее узел в сети связей, а не объект содержательного анализа; отсюда и типичные запросы к favicon и скриншоту главной страницы — они нужны для построения краткого security-профиля, который затем показывается пользователям, переходящим по ссылкам, ведущим на этот сайт с других ресурсов, использующих Sur.ly. Официальная страница отдельно и прямо заверяет: бот никогда не собирает email-адреса и любой другой контент, не относящийся напрямую к задачам безопасности.
Заявление о robots.txt и реальная практика расходятся
Официальная позиция Sur.ly — полное соблюдение стандартных директив robots.txt, включая allow, disallow, crawl-delay и host. Но в полевом отчёте на форуме вебмастеров зафиксирован конкретный случай: бот с этим UA и диапазона IP вообще не запрашивал robots.txt как минимум 30 дней, а позже, даже сменив сетевой блок, продолжал игнорировать уже настроенный запрет — вебмастер описывал ситуацию как «бесконечные 403 в логах» и прямо упрекал компанию в несоответствии заявленной позиции защитника сайтов реальному поведению краулера. Практический вывод: заявление о соблюдении robots.txt стоит воспринимать как официальную позицию оператора, а не как гарантию. Если после настройки Disallow визиты продолжаются — переходите к блокировке на уровне сервера, не ожидая, что файл сработает сам по себе.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Кому реально полезен Sur.ly
Sur.ly распространяется в том числе как плагин для WordPress и других CMS, который защищает сайты с пользовательским контентом (комментарии, форумы) от алгоритмических санкций Google за случайные ссылки на небезопасные или возрастные ресурсы, которые могли оставить сторонние пользователи. Для таких сайтов краулинг SurdotlyBot — часть штатной работы подключённого сервиса, а не посторонний трафик.
Нагрузка
По сводке TrafficVeil — порядка 1 тысячи запросов. Оператор описывает свой краулер как «вежливый» — с минимальным числом запросов к сайту, что в целом согласуется с этим объёмом.
Контроль
grep -i "SurdotlyBot" /var/log/nginx/access.log
User-agent: SurdotlyBot
Disallow: /
if ($http_user_agent ~* "SurdotlyBot") {
return 403;
}
Рекомендации
- Не участвуете в Sur.ly (не используете их плагин или сервис проверки ссылок) — Disallow, а при игнорировании директивы — deny на сервере, учитывая задокументированные случаи несоблюдения robots.txt
- Сайт использует Sur.ly для защиты от токсичных исходящих ссылок — Allow, это часть штатной работы подключённого сервиса
- На Google не влияет напрямую — но именно защита от «токсичных ссылок» опосредованно связана с алгоритмическими рисками Google для сайтов с пользовательским контентом
Частые вопросы
Что именно интересует SurdotlyBot на сайте — контент или что-то другое?
Собирает ли SurdotlyBot email-адреса или другой контент?
Действительно ли SurdotlyBot всегда соблюдает robots.txt, как заявлено официально?
Кому реально полезен сервис Sur.ly?
Что делать, если SurdotlyBot продолжает заходить после настройки Disallow?
Влияет ли этот краулер на позиции сайта в Google напрямую?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.