Статус, скорость ответа, DNS и TLS, ошибки и влияние ботов — в одном контуре. Мониторинг видит не только факт падения, но и раннюю деградацию: когда сайт ещё открывается, но отвечает вдвое дольше обычного.
Проверка идёт с независимых точек: инцидентом считается только то, что подтвердили минимум три из них.
Полноценная проверка складывается из нескольких уровней: доступность, производительность, корректность цепочки доставки и устойчивость к аномальному трафику.
Смотрим не только «открылось или нет»: фиксируем код ответа, цепочку редиректов и подмену на страницу-заглушку хостинга.
Важно не только то, что сайт открыт, но и насколько быстро он отвечает людям и роботам. Держим историю TTFB по каждому маршруту.
Проверяем, что в ответе есть ожидаемый фрагмент. Пустая страница с кодом 200 и белый экран после деплоя тоже считаются падением.
Срок действия, целостность цепочки доверия и параметры TLS. Предупреждение приходит заранее, а не в день, когда сертификат уже истёк.
Ответы NS, значения TTL и задержка резолва. Проверяется вся связка DNS -> SSL -> origin, а не одна её видимая часть.
Доля ошибок и их распределение по URL. Отдельно смотрим, не мешают ли правила WAF и лимитов живому трафику.
Шесть частых причин нестабильной доступности. В половине случаев дело не в сервере, а в том, что стоит перед ним.
Истёкшие или сломанные записи, таймаут DNS, ошибки у NS-провайдера, расхождение в конфигурации зон.
Сертификат истёк, цепочка доверия повреждена, параметры OCSP и TLS настроены некорректно.
CPU, память и база упираются в лимиты: растут ответы 5xx, а время ответа скачет на пиках трафика.
Проблемы в коде, деплое, миграциях, интеграциях и внешних API ломают критичные страницы точечно.
Неправильный upstream, фаервол, reverse proxy, конфликт с CDN или проблемы маршрутизации.
Агрессивные сканеры, парсеры и всплески трафика создают деградацию без явного «падения» сайта.
От быстрой онлайн-диагностики до понятного плана действий для разработки и эксплуатации.
Фиксируем статус HTTP, DNS, TLS и ключевые страницы: главная, вход, API, корзина и формы.
Сравниваем аптайм, время ответа, долю ошибок 4xx и 5xx и поведение сайта по регионам.
Понятно, что ломается, когда и почему, и какие действия быстрее всего вернут стабильность.
Интервал зависит от тарифа, точки — общие для всех: инцидентом считается отказ, подтверждённый минимум с трёх точек.
Разовая проверка показывает проблему, но стабильность держится на постоянном контроле аптайма, отклика и ошибок.
О падении узнаёте вы, а не ваши клиенты. Первое сообщение уходит через несколько секунд после подтверждения отказа.
Основной канал: сообщение приходит в личку или в командный чат, там же кнопка «открыть отчёт».
Дублирующий канал для тех, кто не сидит в мессенджере, и для истории переписки по инциденту.
Если инцидент не закрыт, круг оповещения расширяется по шагам — сообщения не теряются в чате.
По каждому падению остаётся таймлайн: когда началось, чем подтверждено, кого оповестили и когда сайт вернулся.
Ранний признак: время ответа главной выросло в шесть раз при обычном объёме запросов. Инцидент ещё не объявлен, метка деградации поставлена.
Первая точка получила ошибку шлюза. Опрос автоматически учащается до одного раза в 15 секунд, остальные точки идут на перепроверку.
Москва, Ростов-на-Дону и Франкфурт отдают 502. Проблема признана глобальной, а не сетевой особенностью одной локации, — инцидент открыт.
Сообщение в Telegram дежурному и в командный чат. Через пять минут инцидент был бы продублирован письмом — не понадобилось.
DNS и TLS в норме, ошибок на границе нет. Origin не принимал соединения: пул процессов не поднялся после ротации логов.
Три подряд успешные проверки с кодом 200 и откликом 190 мс. Инцидент закрыт автоматически, в чат ушло сообщение о восстановлении.
Подключите домен, задайте адреса для проверки и получайте сообщение о падении раньше, чем о нём напишет первый клиент.
Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.