SemrushBot — один из самых документированных и прозрачных SEO-краулеров в индустрии: Semrush открыто публикует поведение бота, отвечает на вопросы вебмастеров через выделенный email и подробно объясняет даже неочевидные ситуации — например, почему бот пытается отправлять формы или логиниться на сайт. Понимание различий между подтипами этого бота критически важно для правильной настройки доступа.
1. Что такое SemrushBot
1.1 User-Agent строка основного бота
# Основной краулер (webgraph ссылок, общий обход):
Mozilla/5.0 (compatible; SemrushBot/7~bl; +http://www.semrush.com/bot.html)
# Историческая версия (также встречается):
Mozilla/5.0 (compatible; SemrushBot/6~bl; +http://www.semrush.com/bot.html)
1.2 Семейство ботов Semrush — это критически важно понимать
Самая частая ошибка вебмастеров — воспринимать SemrushBot как единого бота. На практике это целое семейство специализированных краулеров, каждый со своим User-Agent и назначением:
| User-Agent | Инструмент Semrush | Назначение |
|---|---|---|
SemrushBot |
Backlink Analytics | Построение публичного индекса обратных ссылок (webgraph) |
SiteAuditBot |
Site Audit | Технический аудит сайта по запросу конкретного пользователя |
SemrushBot-BA |
Backlink Audit | Поиск и анализ токсичных/опасных обратных ссылок |
SemrushBot-SWA |
SEO Writing Assistant | Проверка доступности URL для контент-инструментов |
SemrushBot-CT |
Content Toolkit | Сбор данных для контент-маркетинговых инструментов |
SemrushBot-OCOB |
Content Toolkit (расширенный) | Анализ контента для конкурентного исследования |
Главный практический вывод: блокировка SemrushBot в robots.txt не заблокирует SiteAuditBot или SemrushBot-BA — это разные строки User-Agent, требующие отдельных правил. Многие вебмастера ошибочно думают, что заблокировали все боты Semrush, указав только основной токен.
1.3 Кто стоит за SemrushBot
| Параметр | Значение |
|---|---|
| Оператор | Semrush Inc. |
| Контакт для вебмастеров | bot@semrush.com |
| Назначение | Сбор данных для SEO-платформы Semrush (позиции, ссылки, аудит, контент) |
| Уровень прозрачности | Высокий — подробная официальная документация и поддержка по email |
| Тип бота | SEO Crawler |
1.4 Место в экосистеме SEO-краулеров
| Краулер | Компания | Назначение | Влияет на SEO напрямую? |
|---|---|---|---|
| SemrushBot (семейство) | Semrush | Ссылки, аудит, контент, позиции | ✖ Нет, но влияет на видимость в SEO-инструментах |
| AhrefsBot | Ahrefs | Индекс ссылок, контента, технический аудит | ✖ Нет |
| MJ12Bot | Majestic | Анализ обратных ссылок (Trust Flow, Citation Flow) | ✖ Нет |
| DotBot | Moz | Анализ ссылочного профиля (Domain Authority) | ✖ Нет |
| SerpstatBot | Serpstat | Мониторинг позиций и аудит | ✖ Нет |
2. Как работает SemrushBot
2.1 Алгоритм обхода (основной SemrushBot)
Согласно официальной документации Semrush, процесс обхода устроен следующим образом:
- SemrushBot начинает с заранее составленного списка URL веб-страниц.
- При посещении этих URL бот сохраняет все гиперссылки со страницы для дальнейшего обхода.
- Обнаруженные ссылки добавляются в очередь — формируется граф связей (webgraph).
- Контент страницы анализируется для построения индекса Backlink Analytics, Site Intelligence и других продуктов.
- Данные регулярно обновляются и становятся доступны пользователям Semrush в соответствующих отчётах.
2.2 Как работает SiteAuditBot (принципиально иначе)
В отличие от автономного SemrushBot, SiteAuditBot запускается точечно, когда конкретный пользователь Semrush инициирует аудит сайта в своём личном кабинете:
- Пользователь Semrush создаёт проект Site Audit и указывает домен для проверки.
- SiteAuditBot методично обходит все доступные страницы сайта, имитируя поведение мобильного или десктопного браузера (в зависимости от настроек проекта).
- Анализируются более 130 технических и SEO-параметров: краулинг, разметка, внутренняя линковка, производительность, HTTPS, международное SEO.
- По завершении обхода пользователь получает детальный отчёт о найденных проблемах.
Важный нюанс: если вы видите SiteAuditBot в логах — это означает, что кто-то с аккаунтом Semrush анализирует именно ваш сайт прямо сейчас. Это может быть ваша собственная команда, нанятый консультант, либо конкурент, изучающий ваш сайт.
2.3 Что SemrushBot анализирует
| Элемент | Что извлекается | Важность |
|---|---|---|
| Гиперссылки на странице | Построение webgraph для Backlink Analytics | ⭐⭐⭐⭐⭐ Главная задача основного бота |
| Анкорный текст и атрибуты ссылок | Качество и контекст ссылочного профиля | ⭐⭐⭐⭐⭐ Критически важно |
| Технические SEO-параметры | 130+ факторов для Site Audit (HTTPS, скорость, разметка) | ⭐⭐⭐⭐⭐ Критически важно для SiteAuditBot |
| Контент страницы | Тематика для Content Toolkit и SEO Writing Assistant | ⭐⭐⭐⭐ Очень важно |
| Внутренняя линковка | Архитектура сайта для технического аудита | ⭐⭐⭐⭐ Очень важно |
| HTTP-статусы и редиректы | Техническое здоровье страниц | ⭐⭐⭐⭐ Очень важно |
| Формы с методом GET | Случайно обходятся как обычные URL (см. раздел 3.3) | ⚠ Источник недоразумений |
3. Странное поведение SemrushBot: официальные объяснения
Semrush — редкий пример SEO-инструмента, который открыто объясняет нетипичное поведение своего бота. Несколько ситуаций, которые регулярно вызывают вопросы у вебмастеров, имеют прямое объяснение в официальной документации.
3.1 Почему бот обходит несуществующие страницы
Если SemrushBot обнаруживает на сайте несуществующие страницы (404), он, как правило, перестаёт пытаться их обходить. Однако краулер может продолжать запрашивать давно удалённую страницу, если на неё всё ещё ссылаются другие сайты в интернете — то есть бот следует внешним ссылкам независимо от того, актуальны они или нет.
3.2 Почему бот «пытается логиниться» и отправлять формы
Это одна из самых частых жалоб вебмастеров, и у неё есть точное техническое объяснение: если форма логина или опроса на сайте использует метод GET вместо POST, введённые данные становятся частью URL и видны как обычная ссылка. SemrushBot, как и любой краулер, обходит такие URL как часть процесса индексации — он не «пытается» войти в систему осознанно, он просто переходит по ссылке, которая технически выглядит как обычный URL с параметрами.
<!-- ✖ Проблема: форма использует GET -->
<form action="/login" method="GET">
<input type="text" name="username">
<input type="password" name="password">
</form>
<!-- Результат: /login?username=test&password=123 становится URL,
который сохраняется в ссылках и обходится краулерами -->
<!-- ✔ Решение: использовать POST -->
<form action="/login" method="POST">
<input type="text" name="username">
<input type="password" name="password">
</form>
Semrush прямо рекомендует переключить такие формы на метод POST — это решает проблему не только с их ботом, но и с любыми другими краулерами, а также повышает безопасность (данные форм не сохраняются в истории браузера и логах сервера).
3.3 Почему бот не сразу учитывает изменения в robots.txt
SemrushBot не проверяет robots.txt перед каждым запросом в реальном времени — файл кешируется, и боту требуется некоторое время, чтобы обнаружить изменения. Если вы только что обновили robots.txt, не ожидайте мгновенной реакции бота.
3.4 Поведение после миграции сайта
Официально задокументированная особенность: после смены домена или крупной миграции сайта SemrushBot может временно не подчиняться правилам robots.txt в ожидаемом виде. Это связано с тем, как краулер обрабатывает изменение структуры URL и связанные с ней правила — рекомендуется внимательно следить за поведением бота в переходный период и быть готовым к временным аномалиям.
4. Нагрузка на сервер
4.1 Управление частотой запросов
Semrush предоставляет несколько официальных механизмов контроля нагрузки, что выгодно отличает этот бот от многих других SEO-краулеров:
| Механизм | Как работает |
|---|---|
| Crawl-delay в robots.txt | Поддерживается, максимум — 10 секунд между запросами (большие значения округляются вниз до 10 сек) |
| Автоматическая адаптация | Если Crawl-delay не указан, бот сам подстраивает частоту под текущую нагрузку сервера |
| Настройка через Site Audit (для SiteAuditBot) | Пользователь Semrush может выбрать: минимальную задержку, уважать robots.txt, или фиксировано 1 URL раз в 2 секунды |
# Ограничить скорость основного SemrushBot:
User-agent: SemrushBot
Crawl-delay: 10
# Значения выше 10 будут автоматически урезаны до 10 секунд
4.2 Факторы, увеличивающие нагрузку
- Несколько подтипов бота одновременно — SemrushBot, SiteAuditBot и SemrushBot-BA могут обходить сайт параллельно для разных задач
- Несколько пользователей Semrush анализируют один домен — каждый запуск Site Audit третьим лицом создаёт отдельную волну запросов
- Большой объём страниц на сайте — особенно при полном техническом аудите (Site Audit может проверять тысячи URL)
- Отсутствие Crawl-delay — без явного ограничения бот сам определяет частоту, ориентируясь на нагрузку сервера, но не всегда консервативно
- Включённый JS-рендеринг в Site Audit — рендеринг JavaScript требует больше ресурсов с обеих сторон
5. Обнаружение в логах
5.1 Как выглядит запись
# Основной SemrushBot:
185.191.171.1 - - [09/May/2026:12:10:33 +0000] \
"GET /blog/seo-tips/ HTTP/1.1" \
200 28432 "-" \
"Mozilla/5.0 (compatible; SemrushBot/7~bl; +http://www.semrush.com/bot.html)"
# SiteAuditBot (запущен конкретным пользователем Semrush):
85.208.98.140 - - [09/May/2026:12:11:00 +0000] \
"GET /pricing/ HTTP/1.1" \
200 18432 "-" \
"Mozilla/5.0 (compatible; SiteAuditBot/0.97; +http://www.semrush.com/bot.html)"
# SemrushBot-BA (анализ токсичных ссылок):
185.191.171.5 - - [09/May/2026:12:12:15 +0000] \
"GET /old-page/ HTTP/1.1" \
404 512 "-" \
"Mozilla/5.0 (compatible; SemrushBot-BA/1.0; +http://www.semrush.com/bot.html)"
5.2 Аналитика через grep
Найти все боты семейства Semrush:
grep -i 'semrush' /var/log/nginx/access.log
Разделить по подтипам:
grep -i 'semrush' access.log | grep -oE 'Semrush[A-Za-z-]*|SiteAuditBot' \
| sort | uniq -c | sort -nr
Только основной краулер (без SiteAuditBot и прочих):
grep -i 'SemrushBot/' access.log
Только SiteAuditBot (кто-то проверяет ваш сайт прямо сейчас):
grep -i 'SiteAuditBot' access.log
Подсчитать количество запросов:
grep -i 'semrush' access.log | wc -l
Топ обходимых страниц:
grep -i 'semrush' access.log \
| awk '{print $7}' | sort | uniq -c | sort -nr | head -30
HTTP-коды ответов:
grep -i 'semrush' access.log \
| awk '{print $9}' | sort | uniq -c | sort -nr
Live-мониторинг:
tail -f /var/log/nginx/access.log | grep --line-buffered -i 'semrush'
5.3 Верификация подлинности
⚠ Официальная рекомендация Semrush: компания прямо предупреждает не пытаться блокировать SemrushBot только по IP, так как бот не использует последовательные блоки адресов. Единственный официально подтверждённый IP-диапазон — для SiteAuditBot.
# Официальный IP-диапазон SiteAuditBot (только для этого подтипа):
85.208.98.128/25
# Для остальных подтипов (SemrushBot, SemrushBot-BA и др.)
# нет фиксированного диапазона — используйте reverse DNS:
#!/bin/bash
IP=$1
HOST=$(host $IP | awk '{print $NF}')
if [[ $HOST == *semrush* ]]; then
echo "✔ Похоже на настоящий Semrush-бот: $IP → $HOST"
else
echo "✖ Не подтверждено через DNS: $IP"
fi
6. Управление SemrushBot
6.1 Базовая блокировка через robots.txt
Согласно официальной документации, чтобы остановить обход основного SemrushBot для построения webgraph ссылок:
# Заблокировать основной SemrushBot (Backlink Analytics):
User-agent: SemrushBot
Disallow: /
# Заблокировать SiteAuditBot отдельно:
User-agent: SiteAuditBot
Disallow: /
# Заблокировать Backlink Audit бот:
User-agent: SemrushBot-BA
Disallow: /
# Заблокировать SEO Writing Assistant бот:
User-agent: SemrushBot-SWA
Disallow: /
# Заблокировать Content Toolkit боты:
User-agent: SemrushBot-CT
Disallow: /
User-agent: SemrushBot-OCOB
Disallow: /
⚠ Критически важно: robots.txt должен находиться в корневой директории именно того хоста, к которому применяется. Если у вас несколько поддоменов — каждому нужен собственный robots.txt, общий файл на основном домене не распространяется на поддомены автоматически.
6.2 Разрешить только Site Audit, заблокировав остальное
Частый сценарий: вы сами используете Semrush для своего сайта, но не хотите, чтобы конкуренты анализировали ваш ссылочный профиль через Backlink Analytics:
User-agent: SiteAuditBot
Allow: /
User-agent: SemrushBot
Disallow: /
User-agent: SemrushBot-BA
Disallow: /
6.3 Ограничение скорости вместо блокировки
User-agent: SemrushBot
Crawl-delay: 10
Disallow: /admin/
Disallow: /checkout/
Allow: /
User-agent: SiteAuditBot
Crawl-delay: 10
Allow: /
6.4 Whitelisting SiteAuditBot для собственного аудита
Если ваш сайт защищён файрволом или WAF, который блокирует подозрительный трафик, для использования собственного Site Audit вам нужно явно разрешить IP-диапазон бота:
# Добавить в allowlist firewall/CDN:
85.208.98.128/25
# Этот диапазон используется ИСКЛЮЧИТЕЛЬНО SiteAuditBot.
# Порты: стандартные 80 (HTTP) и 443 (HTTPS).
# Если используете CDN (Cloudflare и др.) или плагины CMS (WordPress) —
# разрешение нужно настроить отдельно в каждой системе.
6.5 Альтернативный способ обхода блокировки для собственного аудита
Если ваш robots.txt блокирует SemrushBot, но вы хотите проверить технические аспекты своего же сайта, Semrush предоставляет два официальных решения без необходимости редактировать robots.txt:
- Смена User-Agent в настройках Site Audit — можно переключить краулер на имитацию GoogleBot (десктоп или мобильная версия), и сайт, скорее всего, пропустит его, так как разрешает Google
- Опция «игнорировать robots.txt» — доступна после верификации владения сайтом, позволяет обходить запрещённые директивы специально для аудита
# В интерфейсе Semrush Site Audit:
# Settings (шестерёнка) → User Agent →
# выбрать SemrushBot / GoogleBot, Desktop / Mobile
# Опция "Crawl behind login" — для аудита закрытых паролем разделов
# (требует ввода учётных данных в настройках проекта)
7. Диагностика проблем
7.1 Типичные проблемы и решения
| Проблема | Причина | Решение |
|---|---|---|
| Site Audit не может проверить сайт | robots.txt блокирует SiteAuditBot | Добавить Allow для SiteAuditBot или сменить User-Agent на GoogleBot в настройках |
| Бот «пытается войти» на сайт | Форма логина использует метод GET | Переключить форму на метод POST |
| Бот обходит давно удалённые страницы | Внешние сайты всё ещё ссылаются на них | Вернуть HTTP 410 Gone вместо 404 для окончательного удаления |
| Изменения в robots.txt не подействовали сразу | Боту нужно время обнаружить обновлённый файл | Подождать (кеш robots.txt обновляется не мгновенно) |
| Бот игнорирует robots.txt после миграции | Задокументированная особенность поведения после смены домена | Временно допустимо, мониторить и сообщить в bot@semrush.com при долгой проблеме |
| Хостинг не позволяет настроить whitelist | Shared hosting с ограничениями | Обратиться в поддержку хостинг-провайдера напрямую |
7.2 Пошаговая диагностика
Шаг 1 — Проверить robots.txt на наличие правил для Semrush-ботов:
curl https://example.com/robots.txt | grep -i 'semrush\|siteaudit'
Шаг 2 — Симулировать запрос конкретного подтипа бота:
curl -A "Mozilla/5.0 (compatible; SiteAuditBot/0.97; +http://www.semrush.com/bot.html)" \
-I https://example.com/
# Ожидается: HTTP/1.1 200 OK
Шаг 3 — Проверить настройки User-Agent в Site Audit:
- Зайти в проект Site Audit → настройки (шестерёнка) → User Agent
- Проверить, какой именно бот используется (SemrushBot или GoogleBot имитация)
- При необходимости переключить на менее ограничиваемый вариант
Шаг 4 — Связаться с поддержкой Semrush напрямую:
# Если проблема не решается стандартными методами:
Email: bot@semrush.com
# Semrush отвечает на вопросы вебмастеров по поводу
# нетипичного поведения краулера
8. SemrushBot vs другие SEO-краулеры
| Краулер | Компания | Подтипы | Crawl-delay | Whitelisting по IP |
|---|---|---|---|---|
| SemrushBot | Semrush | 6 разных ботов под разные задачи | ✔ До 10 сек | Только для SiteAuditBot (85.208.98.128/25) |
| AhrefsBot | Ahrefs | AhrefsBot, AhrefsSiteAudit | ✔ Поддерживает | Публикует диапазоны IP |
| MJ12Bot | Majestic | Единый бот | ✔ Поддерживает | Не фиксировано |
| DotBot | Moz | Единый бот | ✔ Поддерживает | Не фиксировано |
| SerpstatBot | Serpstat | Единый бот | Частично | Не фиксировано |
Контекст из реальных данных: по статистике pbnshield за март–май 2026, SemrushBot занимает 16-е место среди всех ботов с долей 1.3% (1 366 040 запросов), демонстрируя резкий рост — с 50 870 запросов в марте до 1 074 180 в мае (рост ×21 за квартал). Это один из самых быстрорастущих SEO-краулеров в выборке, обгоняющий по динамике даже многие AI-краулеры.
9. Рекомендуемая стратегия
✔ Главный принцип: SemrushBot — это семейство, не один бот. Прежде чем настраивать правила, определите, какие именно подтипы вам нужны (или не нужны), и адресуйте каждый отдельно. Используйте Crawl-delay вместо полной блокировки там, где это возможно.
| Задача | Решение |
|---|---|
| Снизить нагрузку без блокировки | Crawl-delay: 10 для каждого нужного подтипа |
| Запретить конкурентам видеть ваши ссылки | Блокировать SemrushBot, оставить SiteAuditBot |
| Разрешить только собственный аудит | Whitelist IP 85.208.98.128/25 в firewall/CDN |
| Исправить «попытки логина» бота | Переключить формы логина с GET на POST |
| Остановить обход удалённых страниц | Возвращать HTTP 410 Gone вместо 404 |
| Провести аудит, не редактируя robots.txt | Сменить User-Agent на GoogleBot в настройках Site Audit |
| Обнаружить активность в логах | grep -i 'semrush' + разбивка по подтипам |
| Решить нестандартную проблему | Написать на bot@semrush.com |
Полезные ссылки: Официальная документация SemrushBot | Troubleshooting Site Audit | Semrush Site Audit API