TrafficVeil
Боты 6 мин13 августа 2026 г.

LighthouseBot в логах: возможно, ваш же аудит

Разбираем LighthouseBot и его вероятную связь с официальным Chrome-Lighthouse от Google — инструментом аудита производительности, который двигает PageSpeed Insights. Показываем, почему это чаще ваш собственный CI/CD-аудит, чем посторонний бот, и как настроить allow/deny.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое LighthouseBot
  2. 2. Зачем LighthouseBot приходит на сайт
  3. 3. Нагрузка и риски именно для LighthouseBot
  4. 4. Как найти LighthouseBot в логах
  5. 5. robots.txt для LighthouseBot
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с LighthouseBot
  8. 8. С кем не путать LighthouseBot
  9. 9. Стратегия allow/deny для LighthouseBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а LighthouseBot с User-Agent lighthousebot. Важное уточнение по итогам проверки: официальный инструмент Google для аудита страниц — открытый Lighthouse, который двигает PageSpeed Insights, — использует UA-токен Chrome-Lighthouse, а не буквально «lighthousebot». Возможно, вы видите именно его под другим именем в каталоге ботов, а возможно — это другой, менее известный инструмент; стоит разбираться отдельно, а не считать это автоматически синонимом одного и того же.

1. Что такое LighthouseBot

Настоящий Lighthouse — открытый (open-source) инструмент Google для аудита производительности, доступности, соответствия PWA и SEO-параметров страницы; работает через Chrome DevTools, командную строку, Node-модуль или в CI/CD-пайплайнах, и именно он лежит в основе Google PageSpeed Insights. Важный практический нюанс: примерно с 10-й версии Lighthouse токен «Chrome-Lighthouse» перестал стабильно попадать в UA — PageSpeed Insights в части случаев теперь маскируется под реальные устройства (конкретные строки вида Chrome на Android или macOS), а не идентифицирует себя явно. Это значит, что часть современного трафика от инструментов семейства Lighthouse может вообще не выглядеть как «бот» по UA.

Название LighthouseBot (возможно, отсылка к Chrome-Lighthouse от Google)
User-Agent / паттерн lighthousebot; официальный, задокументированный токен настоящего инструмента Google — Chrome-Lighthouse, а не буквально «lighthousebot»
Оператор Если речь о настоящем инструменте — Google (открытый проект Lighthouse, часть PageSpeed Insights); для токена именно «lighthousebot» отдельного подтверждения не найдено
Роль Аудит производительности, доступности, PWA и SEO страницы — обычно запускается по инициативе владельца сайта, его команды или CI/CD, а не сторонним наблюдателем
Документация / ориентир developer.chrome.com/docs/lighthouse — официальная документация Google по Chrome-Lighthouse
Список IP ❌ Официального списка нет; в одном из технических обсуждений разработчиков упоминался временный допуск блока 66.249.84.0/24 (из адресного пространства, близкого к Google) для PageSpeed, но это не заменяет полноценную верификацию
robots.txt Chrome-Lighthouse не публикует официального метода верификации — по признанию независимых каталогов ботов, совпадение UA само по себе не доказательство, любой клиент может заявить эту строку
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

2. Зачем LighthouseBot приходит на сайт

Если это действительно связано с настоящим Lighthouse/Chrome-Lighthouse, по наблюдению независимых каталогов ботов типичная причина — кто-то (чаще всего именно ваша собственная команда) направил PageSpeed Insights, DevTools-аудит или CI/CD-проверку на конкретный сайт: инструменты мониторинга производительности и аудита обычно проверяют только те сайты, на которые их явно настроили, а не сканируют произвольные домены сами по себе.

  • Какие зоны чаще трогает: публичные URL, иногда API и статику — конкретную страницу, которую тестируют;
  • Что ищет: метрики производительности, доступности, PWA-соответствия и SEO-параметры страницы;
  • Чем отличается от браузерного пользователя: нет нормальной сессии; по независимым наблюдениям — регулярные проверки одних и тех же страниц или эндпоинтов, часто с интервалом в несколько минут.

Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — LighthouseBot. Прежде чем реагировать, стоит уточнить у команды разработки, не запускает ли кто-то регулярные PageSpeed/Lighthouse-проверки сайта сам — это куда более вероятный сценарий, чем постороннее сканирование.

3. Нагрузка и риски именно для LighthouseBot

Отдельной строки в публичной сводке top-bot TrafficVeil у lighthousebot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. Если это настоящий Chrome-Lighthouse, независимый каталог отмечает бота как верифицированный и уважаемый SEO-сообществом, а блокировка не влияет на позиции в поисковой выдаче — риск здесь скорее в том, что можно случайно заблокировать собственный инструмент мониторинга производительности, чем в угрозе со стороны бота.

4. Как найти LighthouseBot в логах

Не ищите «просто ботов» — ищите оба варианта токена: заявленный lighthousebot и официальный Chrome-Lighthouse, а также будьте готовы, что современные версии инструмента могут маскироваться под обычный браузер.

# Базовый поиск по обоим вариантам
grep -iE "lighthousebot|chrome-lighthouse" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -iE "lighthousebot|chrome-lighthouse" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -iE "lighthousebot|chrome-lighthouse" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность — штатный паттерн: регулярные проверки одних и тех же страниц
grep -iE "lighthousebot|chrome-lighthouse" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверить, не маскируется ли PageSpeed под обычный мобильный/десктопный Chrome
grep -iE "moto g power|Macintosh.*Chrome/109" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального метода верификации у Chrome-Lighthouse нет и у токена lighthousebot тем более — совпадение UA само по себе не доказательство. Прежде всего уточните у собственной команды, не настроен ли у вас регулярный аудит через PageSpeed Insights или CI/CD.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для LighthouseBot

# Жёсткий запрет
User-agent: lighthousebot
Disallow: /

# Разрешить всё
User-agent: lighthousebot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: lighthousebot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: ставьте Disallow или 403 для lighthousebot, если пользы нет — но прежде уточните у команды, не сломает ли это собственный CI/CD-аудит производительности. Если это действительно настоящий Chrome-Lighthouse, блокировка не повлияет на позиции в поиске — сообщество считает его безопасным для запрета, если он вам не нужен.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "lighthousebot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=lighthousebot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "lighthousebot") {
        limit_req zone=lighthousebot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} lighthousebot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите lighthousebot в ботах домена или в /system/bots;
  • Прежде чем блокировать — уточните у команды разработки, не используется ли PageSpeed Insights, Lighthouse CLI или CI/CD-аудит для этого сайта;
  • Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
  • После изменения сверьте логи и убедитесь, что собственный мониторинг производительности (если он есть) продолжает работать.

7. Рекомендации: что делать с LighthouseBot

  • Если пользы нет — Disallow/403 для lighthousebot, если пользы нет;
  • Сначала уточните у своей же команды — большинство визитов инструментов семейства Lighthouse инициировано владельцем сайта, а не посторонним;
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент — но если это ваш собственный аудит производительности, вы просто перестанете его получать.

8. С кем не путать LighthouseBot

Бот / сосед Кластер UA Комментарий
Chrome-Lighthouse Инструменты аудита сайтов chrome-lighthouse официальный, документированный токен настоящего инструмента Google Lighthouse/PageSpeed Insights
360Spider Прочие краулеры и сервисы 360spider нежелательный, другой оператор
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный

9. Стратегия allow/deny для LighthouseBot

Ситуация Действие
Это ваш собственный CI/CD или PageSpeed-аудит Allow, уточнив у команды перед блокировкой
Пользы не найдено, посторонний источник Disallow + запрет в TrafficVeil
Нужен доступ, но пики мешают Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Официальной верификации нет ни у токена, ни у настоящего Chrome-Lighthouse — совпадение UA не доказательство

Частые вопросы

LighthouseBot и Chrome-Lighthouse — это одно и то же?

Возможно, но не точно установлено — официальный, задокументированный токен настоящего инструмента Google называется именно Chrome-Lighthouse, а не буквально lighthousebot.

Кто обычно запускает такие проверки?

По наблюдению независимых каталогов ботов, чаще всего это собственная команда сайта через PageSpeed Insights, DevTools или CI/CD-пайплайн, а не посторонний наблюдатель.

Почему современный трафик Lighthouse может не выглядеть как бот?

С определённой версии инструмент местами перестал стабильно указывать себя в UA и может маскироваться под обычный браузер на конкретном устройстве, например Android-смартфоне или MacBook.

Повлияет ли блокировка на позиции сайта в поиске?

Нет, это инструмент аудита производительности и SEO-параметров, а не поисковый краулер — блокировка не отражается на позициях в выдаче.

Есть ли официальный способ проверить подлинность запроса?

Нет, метод верификации не публикуется ни для настоящего Chrome-Lighthouse, ни тем более для токена lighthousebot — совпадение строки UA само по себе не доказательство.

Что стоит сделать перед блокировкой этого бота?

Уточнить у собственной команды разработки, не используется ли сейчас PageSpeed Insights или CI/CD-аудит производительности для этого сайта — блокировка может случайно сломать ваш же мониторинг.

#LighthouseBot#Chrome-Lighthouse#PageSpeed Insights#аудит производительности#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.