ГлавнаяБлогАналитика
Аналитика11 мин чтения·21 сентября 2026 г.

Аналитика бот-трафика за 8 месяцев. Исследование TrafficVeil

Боты дают треть запросов к сайту, но съедают половину процессорного времени сервера. Разбираем по логам 165 млн запросов, какие боты приходят чаще всего, какие скачивают больше всего данных и какие обходятся origin-серверу дороже остальных.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Аналитика бот-трафика за 8 месяцев. Исследование TrafficVeil
Когда владелец сайта смотрит на счётчик посещаемости, он видит людей. Когда мы смотрим на логи reverse proxy, мы видим совсем другую картину: примерно каждый третий HTTP-запрос к защищаемому сайту приходит не от человека, а от автоматического клиента. При этом боты занимают больше половины процессорного времени origin-сервера — больше, чем весь остальной трафик вместе взятый.
Период наблюдения: 25 мая — 21 сентября 2026 (120 дней)
Детальное окно: 22 августа — 21 сентября 2026 (30 дней подробных логов)
Объём выборки: 165,0 млн дедуплицированных HTTP-запросов, 2537 доменов, 1065 доменов в длинном окне, 256 распознанных семейств ботов

Это исследование отвечает на два вопроса, которые почти никогда не задают вместе. Первый: какие боты приходят чаще всего. Второй: какие боты создают больше всего нагрузки. Ответы на них не совпадают, и именно в этом расхождении находится практический смысл управления бот-трафиком.

Бот, который делает 22 млн запросов, может быть дешевле для сервера, чем бот, который делает 2 млн. И наоборот: краулер с умеренной частотой способен выкачать больше данных, чем самый заметный клиент в логах. Поэтому мы измеряли не одну метрику, а четыре: количество запросов, отданный объём в байтах, суммарное время генерации ответа на origin и доля ошибочных обращений.

Ключевые цифры за период наблюдения

34,8%
всех HTTP-запросов сделали опознанные боты
51,6%
процессорного времени origin ушло на ботов
1,29 ТБ
трафика отдано автоматическим клиентам за 30 дней
256
различных семейств ботов за 120 дней

Главное наблюдение исследования формулируется одной фразой: боты потребляют мало трафика и много времени. За 30 дней автоматические клиенты сгенерировали 34,8% запросов, скачали 18,4% байт, но заняли 51,6% суммарного времени, которое origin-серверы потратили на формирование ответов.

Боты дешевле людей по каналу и дороже по процессору. Средний бот-запрос весит 22,4 КБ и обрабатывается 933 мс. Средний остальной запрос весит 53,2 КБ и обрабатывается 467 мс. Бот скачивает в 2,4 раза меньше, а занимает сервер в 2 раза дольше.

Причина расхождения простая. Люди в основном забирают статику: картинки, шрифты, CSS и JavaScript отдаются из кэша быстро и весят много. Боты идут по HTML-страницам, часто по глубоким и редко посещаемым URL, которых нет в кэше — каждый такой запрос заставляет приложение и базу данных выполнять реальную работу.

Методика исследования

Мы описываем методику подробно, потому что в аналитике бот-трафика легко получить цифру, завышенную в два раза, и не заметить этого.

  • Два окна наблюдения. Долгое окно — 120 дней агрегированной статистики по семействам ботов. Детальное окно — 30 дней сырых логов с байтами, временем ответа и кодами статуса. Абсолютные величины нагрузки приводятся только по детальному окну.
  • Дедупликация. Инфраструктура логирования пишет часть запросов дважды — из основного пайплайна и из пайплайна безопасности. Все расчёты сделаны только по полным записям с заполненным URL: 165,0 млн строк из 296,8 млн. Без этой поправки любая цифра завышена примерно в 1,8 раза.
  • Классификация по User-Agent. Бот считается опознанным, если его User-Agent содержит подпись известного семейства. Классификатор охватывает 31 семейство и намеренно не включает маскирующиеся клиенты, пустые User-Agent и самописные скрипты. Это значит, что реальная доля автоматического трафика выше приведённой.
  • Нагрузка на origin. Измеряется как сумма времени формирования ответа по всем запросам семейства. Это прямая оценка того, сколько секунд процессорного времени приложения потратил бот.
  • Без верификации по обратному DNS. Мы не разделяли настоящие и поддельные User-Agent. Все цифры описывают трафик, который представился конкретным ботом, потому что именно на этот трафик сервер тратит ресурсы независимо от того, кто его отправил.

Кто приходит чаще всего

За 30 дней опознанные боты сделали 57,5 млн запросов. Распределение оказалось крайне неравномерным: на первую десятку семейств приходится 80,5% всего бот-трафика, а один-единственный клиент забирает больше трети.

Топ ботов по количеству запросов
Детальное окно: 30 дней, дедуплицированные логи
Meta ExternalAgent
 
21,99 млн
WordPress.com / Jetpack
 
4,77 млн
GPTBot
 
4,30 млн
 
2,54 млн
ClaudeBot
 
2,42 млн
PetalBot
 
2,40 млн
Bytespider
 
2,15 млн
 
1,99 млн
 
1,95 млн
 
1,73 млн
 
1,49 млн
YandexImages
 
1,20 млн
Учитываются только запросы с полной записью в логе. Один бот может обращаться с тысяч IP-адресов.
Бот Запросов Доля бот-трафика IP Доменов
Meta ExternalAgent 21,99 млн 38,3% 2655 597
WordPress.com / Jetpack 4,77 млн 8,3% 5316 292
GPTBot 4,30 млн 7,5% 2187 683
Googlebot 2,54 млн 4,4% 16 978 643
ClaudeBot 2,42 млн 4,2% 2643 660
PetalBot 2,40 млн 4,2% 2010 441
Bytespider 2,15 млн 3,7% 16 648 604
Amazonbot 1,99 млн 3,5% 3835 614
Bingbot 1,95 млн 3,4% 1176 628
AhrefsBot 1,73 млн 3,0% 11 893 330
FacebookBot 1,49 млн 2,6% 5763 574
YandexImages 1,20 млн 2,1% 1012 303
SemrushBot 1,11 млн 1,9% 1494 422
DotBot 996 тыс. 1,7% 324 329
YandexBot 888 тыс. 1,5% 672 541
Applebot 884 тыс. 1,5% 8898 654
BaiduSpider 684 тыс. 1,2% 1637 505
MJ12bot 580 тыс. 1,0% 1012 591
SE Ranking Bot 550 тыс. 1,0% 430 356
SerpstatBot 490 тыс. 0,9% 35 101
Meta ExternalAgent — краулер Meta для сбора данных под обучение моделей — один делает больше запросов, чем Googlebot, Bingbot, YandexBot, BaiduSpider и PetalBot вместе взятые. При этом он обращается всего с 2655 IP-адресов, то есть в среднем по 8284 запроса с адреса.

Частота посещений и охват доменов — разные вещи

Самый частый бот не обязательно самый вездесущий. За 120 дней наблюдения Meta ExternalAgent заходил на 691 домен, а OpenAI SearchBot — на 832, хотя запросов сделал в сто раз меньше. Это две принципиально разные стратегии обхода: одна глубокая и тяжёлая, другая широкая и лёгкая.

Бот Доменов за 120 дней Дней активности Доля бот-трафика за 120 дней
OpenAI SearchBot 832 120 из 120 0,4%
ClaudeBot 814 120 из 120 3,8%
GPTBot 807 120 из 120 6,1%
Googlebot 792 120 из 120 3,9%
Bingbot 756 120 из 120 4,5%
Applebot 752 120 из 120 2,3%
YandexBot 719 120 из 120 2,2%
Amazonbot 716 120 из 120 3,9%
Bytespider 697 120 из 120 5,5%
Meta ExternalAgent 691 120 из 120 38,5%
PetalBot 459 120 из 120 7,4%

Обратите внимание на колонку «Дней активности». Ни один крупный бот не пропустил ни одного дня из 120. Автоматический обход — не событие и не всплеск, а непрерывный процесс, который идёт круглосуточно всё время существования сайта.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Частота не равна нагрузке

Если ранжировать те же семейства не по количеству запросов, а по объёму отданных данных, таблица лидеров полностью меняется. На первое место выходит Bingbot, которого нет даже в первой пятёрке по частоте.

Топ ботов по объёму скачанных данных
Гигабайты, отданные origin-серверами за 30 дней
 
189,8 ГБ
GPTBot
 
160,7 ГБ
 
141,2 ГБ
PetalBot
 
127,2 ГБ
Meta ExternalAgent
 
123,2 ГБ
 
81,3 ГБ
 
74,5 ГБ
ClaudeBot
 
55,9 ГБ
SE Ranking Bot
 
38,4 ГБ
Bytespider
 
37,1 ГБ
BaiduSpider
 
36,3 ГБ
YandexImages
 
34,6 ГБ

А если ранжировать по времени, которое origin потратил на обслуживание, картина меняется ещё радикальнее. Здесь разрыв между первым и вторым местом составляет четыре раза.

Топ ботов по нагрузке на origin-сервер
Суммарные часы генерации ответов за 30 дней
Meta ExternalAgent
 
6258 ч
PetalBot
 
1477 ч
 
1078 ч
GPTBot
 
943 ч
ClaudeBot
 
668 ч
WordPress.com / Jetpack
 
465 ч
 
449 ч
 
435 ч
 
334 ч
Bytespider
 
311 ч
Applebot
 
288 ч
 
271 ч
6258 часов — это 261 сутки непрерывной работы одного процессорного потока за календарный месяц.
На Meta ExternalAgent пришлось 42,0% всего времени, потраченного origin-серверами на ботов, и 21,7% всего процессорного времени сети целиком — включая обслуживание живых пользователей. Один краулер стоит дороже, чем каждый пятый запрос от человека.

Три рейтинга рядом

Сопоставление трёх метрик показывает, почему решение «блокировать по частоте» приводит к неверным приоритетам.

Бот Место по запросам Место по объёму Место по нагрузке
Meta ExternalAgent 1 5 1
Bingbot 9 1 7
GPTBot 3 2 4
Googlebot 4 3 12
PetalBot 6 4 2
FacebookBot 11 13 3
WordPress.com / Jetpack 2 26 6
DotBot 14 16 8
YandexImages 12 12 25

WordPress.com / Jetpack — второй по частоте клиент во всей сети, но по объёму данных он на 26-м месте: средний ответ ему весит 404 байта. Это служебные пинги, а не выкачивание сайта. Наоборот, FacebookBot с одиннадцатого места по частоте поднимается на третье по нагрузке, потому что каждый его запрос обрабатывается в среднем 2,6 секунды.

Сколько стоит один запрос каждого бота

Чтобы сравнивать ботов честно, нужно смотреть на удельную стоимость: сколько весит один ответ и сколько времени сервер его готовит.

Бот Средний ответ Среднее время ответа Запросов на один IP
PetalBot 53,0 КБ 2217 мс 1193
FacebookBot 22,8 КБ 2602 мс 259
SerpstatBot 8,7 КБ 1909 мс 14 011
Barkrowler 8,3 КБ 1884 мс 458
DotBot 21,0 КБ 1572 мс 3073
Sogou 8,6 КБ 1394 мс 233
MJ12bot 14,9 КБ 1294 мс 573
Applebot 14,8 КБ 1174 мс 99
Meta ExternalAgent 5,6 КБ 1024 мс 8284
YandexBot 34,6 КБ 1007 мс 1322
ClaudeBot 23,1 КБ 996 мс 914
Bingbot 97,5 КБ 830 мс 1656
SE Ranking Bot 69,9 КБ 855 мс 1278
GPTBot 37,3 КБ 789 мс 1968
Amazonbot 40,9 КБ 604 мс 519
Bytespider 17,3 КБ 521 мс 129
Googlebot 55,7 КБ 385 мс 149
GoogleOther 11,0 КБ 180 мс 227
Img2dataset 64,6 КБ 115 мс 5927
YandexImages 28,9 КБ 72 мс 1182
WordPress.com / Jetpack 0,4 КБ 351 мс 897
Между самым «лёгким» и самым «тяжёлым» ботом разница в 36 раз. YandexImages получает ответ за 72 мс, потому что забирает изображения прямо из кэша. FacebookBot ждёт 2602 мс, потому что дёргает страницы, которые приходится рендерить целиком. Это означает, что тысяча запросов от YandexImages стоит серверу дешевле, чем тридцать запросов от FacebookBot.

Концентрация по IP-адресам

Третья колонка таблицы показывает, насколько распределён источник запросов. Googlebot приходит со 16 978 адресов и делает всего 149 запросов с каждого — блокировать его по частоте с одного IP бесполезно, никакой rate limit не сработает. SerpstatBot, наоборот, использует 35 адресов и выжимает по 14 011 запросов с каждого — такой клиент отлично ловится ограничением частоты, и его не нужно заносить в чёрный список целиком.

Боты, которые ходят в пустоту

Отдельный класс нагрузки — запросы к несуществующим URL. За 30 дней боты сгенерировали 10,0 млн ответов 404: это 17,5% всего бот-трафика. Каждая такая страница всё равно требует работы приложения, записи в лог и, как правило, обращения к базе данных.

Доля запросов, завершившихся ошибкой 404
По семействам ботов, 30 дней
 
67,1%
ChatGPT-User
 
53,3%
SerpstatBot
 
51,9%
Barkrowler
 
44,1%
Meta ExternalAgent
 
27,4%
PetalBot
 
25,4%
Applebot
 
22,5%
BaiduSpider
 
18,2%
 
15,1%
 
8,7%
GPTBot
 
4,1%

Два лидера этого рейтинга — SEO-краулеры, которые обходят ссылочные базы. Они идут по ссылкам, собранным годами, и большая часть этих ссылок давно мертва. DotBot тратит две трети своих обращений на страницы, которых не существует, и всё равно занимает восьмое место по нагрузке на origin.

Отдельно стоит Meta ExternalAgent: 6,03 млн запросов в 404 за месяц. Это больше, чем весь месячный трафик Googlebot, Bingbot и YandexBot вместе взятых.

Боты не спят

Суточный профиль автоматического трафика принципиально отличается от человеческого. Люди дают классическую дневную кривую с двукратным разбросом между ночным минимумом и дневным максимумом. Боты идут почти ровной линией.

Показатель Боты Остальной трафик
Минимум в час 2,20 млн 2,93 млн
Максимум в час 2,69 млн 5,57 млн
Размах суточных колебаний 1,22× 1,90×
Доля ботов в трафике по часам суток
Процент бот-запросов от общего объёма, UTC
42,9
 
00
39,6
 
02
36,7
 
04
34,1
 
06
32,2
 
08
31,9
 
10
32,6
 
12
32,2
 
14
30,7
 
16
31,4
 
18
38,0
 
20
42,0
 
22
Значения на столбцах — доля ботов в процентах от всех запросов в этот час.

Ночью, когда посетителей мало, доля ботов доходит до 43,7%. В дневной пик она опускается до 30,0%. Но это следствие не роста активности ботов, а спада активности людей: в абсолютных числах боты держат ровные 2,2–2,7 млн запросов в час круглосуточно.

Практический вывод для эксплуатации: ночной «фоновый» расход CPU на сервере — это не утечка и не сбой планировщика. Это боты, которые продолжают обход, пока аудитория спит. Если сервер выбран по дневному пику, ночной запас прочности съедается автоматическим трафиком.

Из чего состоит бот-трафик

Мы разделили опознанные семейства на четыре класса и посчитали вклад каждого по всем трём метрикам сразу. Расхождение между колонками и есть главный результат исследования.

Класс ботов Доля запросов Доля объёма Доля нагрузки на origin
AI-краулеры и сборщики данных 61,0% 40,5% 60,1%
Поисковые системы 18,1% 44,1% 18,9%
Социальные сети и служебные сервисы 11,0% 2,8% 10,5%
SEO-краулеры 9,9% 12,7% 10,5%
Вклад классов ботов по трём метрикам
Доля от общего бот-трафика за 30 дней
AI — запросы
 
61,0%
AI — объём
 
40,5%
AI — нагрузка
 
60,1%
Поиск — запросы
 
18,1%
Поиск — объём
 
44,1%
Поиск — нагрузка
 
18,9%
SEO — запросы
 
9,9%
SEO — объём
 
12,7%
SEO — нагрузка
 
10,5%

Поисковые системы дают лучший обмен для сайта: 18,1% запросов приносят индексацию, а 44,1% объёма приходятся в основном на изображения, которые отдаются из кэша быстро и без нагрузки на приложение. AI-краулеры дают обратную картину: 61% запросов и 60% процессорного времени при 40% трафика, и при этом никакой обратной ссылки, переходов и измеримой отдачи для владельца сайта.

AI-краулеры детально

Бот Запросов Объём Нагрузка Доменов
Meta ExternalAgent 21,99 млн 123,2 ГБ 6258 ч 597
GPTBot 4,30 млн 160,7 ГБ 943 ч 683
ClaudeBot 2,42 млн 55,9 ГБ 668 ч 660
Bytespider 2,15 млн 37,1 ГБ 311 ч 604
Amazonbot 1,99 млн 81,3 ГБ 334 ч 614
Applebot 884 тыс. 13,1 ГБ 288 ч 654
Img2dataset 445 тыс. 28,7 ГБ 14 ч 128
TikTokSpider 354 тыс. 4,5 ГБ 35 ч 164
OpenAI SearchBot 311 тыс. 12,3 ГБ 61 ч 692
PerplexityBot 141 тыс. 2,9 ГБ 28 ч 600
ChatGPT-User 77 тыс. 1,2 ГБ 20 ч 608
Итого 35,06 млн 520,9 ГБ 8960 ч

Внутри класса тоже есть разделение. GPTBot скачивает 160,7 ГБ, но обходится сайту всего в 943 часа: он идёт по контентным страницам эффективно и почти не промахивается (4,1% ошибок 404 — лучший показатель среди всех крупных ботов). Meta ExternalAgent скачивает меньше данных, но тратит в семь раз больше времени сервера и каждый четвёртый его запрос уходит в никуда.

Правильная политика по AI-ботам — не «разрешить всё» и не «запретить всё», а раздельная настройка по семействам. OpenAI SearchBot приводит переходы из поиска ChatGPT и стоит 61 час в месяц. Meta ExternalAgent не приводит ничего и стоит 6258 часов. Это решения разного порядка, и принимать их одной галочкой нельзя.

Что видит типичный сайт

Все цифры выше — агрегаты по сети. Гораздо важнее понять, с чем сталкивается обычный сайт. Мы взяли 678 доменов, получивших не меньше 1000 запросов за детальное окно, и посчитали распределение по ним.

Метрика за 30 дней Средний сайт Медианный сайт
Всего запросов 243 511 49 808
Бот-запросов 84 762 10 960
Доля ботов в трафике 32,74% 29,70%
Доля ботов в нагрузке на origin 36,10%
Отдано ботам данных 237 МБ
Разных семейств ботов на домене 35,7 35

Близость среднего и медианного значения доли ботов — важный результат. Он означает, что высокая доля автоматического трафика — не свойство нескольких крупных сайтов, которые тянут статистику вверх, а свойство почти любого публичного сайта.

169
доменов, где боты дали больше половины трафика
334
домена, где боты дали больше трети трафика
35
семейств ботов видит медианный сайт
156
семейств ботов на самом «популярном» домене

Каждый второй сайт в выборке отдавал ботам больше трети своего трафика. Каждый четвёртый — больше половины. Речь при этом идёт об обычных сайтах: корпоративных, новостных, региональных, интернет-магазинах среднего размера.

Динамика за всё время наблюдения

Абсолютные объёмы сравнивать напрямую нельзя: количество защищаемых доменов за 120 дней выросло, и вместе с ним растёт и суммарное число запросов. Поэтому мы нормировали данные — считали среднее количество бот-запросов на один активный домен в сутки и привели к индексу, где май равен 100.

Интенсивность бот-обхода на один домен
Индекс, май 2026 = 100. Нормировано на количество активных доменов
100
 
май
98
 
июнь
83
 
июль
95
 
август
152
 
сентябрь
Сентябрь учтён по 21 число включительно.

Четыре месяца интенсивность держалась на одном уровне с небольшим летним провалом, а в сентябре выросла в полтора раза. Это рост именно нагрузки на отдельный сайт, а не эффект от подключения новых доменов: поправка на количество активных доменов уже внесена.

Состав трафика при этом тоже смещался. Доля Googlebot выросла более чем вдвое, GPTBot — в 1,7 раза, а PetalBot и Bytespider постепенно сокращали присутствие.

Месяц Meta ExternalAgent GPTBot ClaudeBot Googlebot Bingbot PetalBot
Май 33,8% 4,4% 3,9% 2,8% 4,4% 11,8%
Июнь 38,0% 5,3% 4,6% 2,3% 4,4% 10,3%
Июль 42,3% 7,3% 3,0% 2,4% 5,4% 9,0%
Август 39,1% 4,6% 3,0% 4,2% 4,4% 6,5%
Сентябрь 36,6% 7,4% 4,4% 5,9% 3,9% 4,1%
Доли от общего бот-трафика сети за соответствующий месяц.

Что это значит для владельца сайта

Автоматический трафик — не абстрактная угроза. Он конвертируется во вполне конкретные строки в счёте за хостинг и в конкретные секунды ожидания для живого посетителя.

  • Процессорное время. Половина мощности origin-сервера в среднем по сети уходит на клиентов, которые не покупают, не читают и не конвертируются. Это прямой перерасход тарифа хостинга.
  • Скорость для людей. Когда бот занимает воркер приложения на 2,6 секунды, живой посетитель в этот момент стоит в очереди. Именно так «необъяснимые» подтормаживания сайта связаны с бот-обходом.
  • Мусор в логах и аналитике. 10 млн ответов 404 за месяц забивают лог-файлы, искажают отчёты об ошибках и мешают увидеть настоящие проблемы.
  • Неконтролируемый сбор контента. 521 ГБ текста и изображений за месяц ушли в наборы данных для обучения моделей. Владелец сайта об этом чаще всего не знает.
  • Ночной расход ресурсов. Боты работают круглосуточно, поэтому «тихих часов», когда сервер отдыхает, у современного сайта просто нет.
  • Ложное ощущение роста. Если счётчик считает всё подряд, треть «посещаемости» окажется машинами.

Что делать с этими данными

Универсальное правило «блокировать ботов» не работает: часть из них нужна для индексации и корректного отображения ссылок в соцсетях. Правильная стратегия — сегментировать и назначить каждому классу свою политику.

Класс Что делать Почему
Поисковые системы Разрешить полностью, проверять подлинность 18% запросов дают индексацию и органический трафик, нагрузка умеренная
AI-краулеры обучения Решение по каждому семейству отдельно 60% нагрузки на origin без обратной отдачи для сайта
AI-поиск и агенты пользователя Обычно разрешить Приводят реальные переходы, стоят десятки часов в месяц
SEO-краулеры Ограничить частоту До 67% запросов в 404, польза только для сторонних сервисов
Служебные пинги и мониторинг Разрешить, исключить из аналитики Высокая частота при мизерном весе ответа
Неопознанные клиенты Проверка поведения и репутации Маскируются под браузеры, User-Agent не показателен

Обратите внимание: для двух классов правильный инструмент — это ограничение частоты, а не блокировка. Как показала таблица концентрации по IP, боты с высоким числом запросов на адрес отлично регулируются rate limit без потери индексации, а распределённые краулеры вроде Googlebot нужно, наоборот, проверять на подлинность, а не ограничивать.

Как TrafficVeil управляет бот-трафиком

TrafficVeil стоит перед сайтом как reverse proxy: входящий запрос сначала попадает в защитный слой, проходит классификацию и только потом уходит на origin-сервер. Все данные этого исследования получены именно из этого слоя — это рабочая телеметрия, а не отдельный эксперимент.

Для каждого запроса система определяет семейство бота по User-Agent, проверяет репутацию IP и принадлежность к сети дата-центра, сверяет заявленную личность бота с реальным источником, анализирует частоту и последовательность обращений. На основе этого применяется политика, заданная владельцем домена: пропустить, ограничить частоту, отправить на проверку или заблокировать.

В панели домена видно не «сколько было ботов вообще», а конкретный разрез: какие семейства пришли, сколько запросов сделали, сколько получили блокировок и по какому правилу. Это позволяет принимать решения по данным своего сайта, а не по общим рекомендациям.

Ключевая идея: бот-трафиком нужно управлять, а не воевать с ним. Полный запрет ломает индексацию и превью ссылок. Полное разрешение отдаёт половину сервера тем, кто за него не платит. Работает только раздельная настройка по семействам — и для неё нужны цифры по каждому боту отдельно.

Главные выводы исследования

  • 1. Треть запросов — и половина нагрузки. Опознанные боты дали 34,8% запросов, но заняли 51,6% процессорного времени origin-серверов. Реальная доля выше: маскирующиеся клиенты в подсчёт не вошли.
  • 2. Частота и нагрузка — разные рейтинги. Лидер по числу запросов, лидер по объёму данных и лидер по нагрузке на сервер — три разных бота. Приоритизировать защиту только по количеству запросов неверно.
  • 3. Один краулер может стоить дороже всех остальных. Meta ExternalAgent дал 38% бот-запросов и 42% всей бот-нагрузки, обращаясь всего с 2655 адресов.
  • 4. AI-краулеры стали главным классом. 61% бот-запросов и 60% нагрузки на origin при 40% трафика. Четыре месяца назад расклад был другим, и меняется он быстро.
  • 5. Каждый шестой бот-запрос уходит в 404. У SEO-краулеров показатель доходит до 67%. Сервер выполняет работу, результат которой никому не нужен.
  • 6. Боты не знают ночей и выходных. Все крупные семейства были активны 120 дней из 120, а суточные колебания их активности не превышают 22%.
  • 7. Размер сайта не защищает. Медианный сайт отдаёт ботам 29,7% трафика и 36,1% процессорного времени. Каждый четвёртый домен отдаёт больше половины.
  • 8. Инструмент нужно выбирать по профилю бота. Распределённые краулеры требуют проверки подлинности, сосредоточенные на десятках IP — ограничения частоты. Одна политика на всех не работает.

Заключение

Публичный сайт в 2026 году обслуживает две разные аудитории. Первая — люди, ради которых он создан. Вторая — машины: поисковые роботы, краулеры обучающих датасетов, SEO-сканеры, агенты пользователей и служебные пинги. Вторая аудитория не заходит в корзину, не читает статьи и не оставляет заявок, но потребляет больше половины мощности сервера.

За 30 дней наблюдения автоматические клиенты сделали 57,5 млн запросов к защищаемым сайтам, скачали 1,29 ТБ данных и заняли 14 903 часа процессорного времени. Это не атака и не аномалия — это нормальный режим работы любого сайта, доступного из интернета.

Разница между сайтом, который платит за это вслепую, и сайтом, который этим управляет, — только в наличии измерений. Пока владелец не видит, какой бот сколько стоит, он не может ни ограничить лишнее, ни сохранить полезное.

Бот-трафик нельзя отменить. Но его можно измерить, разложить по семействам и назначить каждому свою цену.

Частые вопросы

Какой бот приходит на сайты чаще всего?
Meta ExternalAgent — краулер Meta для сбора данных под обучение моделей. За 30 дней он сделал 21,99 млн запросов, это 38% всего бот-трафика сети: больше, чем Googlebot, Bingbot, YandexBot, BaiduSpider и PetalBot вместе взятые.
Какой бот создаёт больше всего нагрузки на сервер?
Тоже Meta ExternalAgent: 6258 часов процессорного времени origin за месяц, или 42% всей бот-нагрузки. Но по объёму скачанных данных лидирует Bingbot со 189,8 ГБ, а самое долгое время обработки одного запроса у FacebookBot — 2602 мс.
Почему боты потребляют мало трафика, но много процессорного времени?
Люди в основном забирают статику — картинки, CSS и шрифты отдаются из кэша быстро и весят много. Боты идут по HTML-страницам, часто по глубоким и редко посещаемым URL, которых в кэше нет, и каждый такой запрос заставляет приложение и базу выполнять реальную работу.
Нужно ли блокировать AI-краулеры?
Решение принимается по каждому семейству отдельно. OpenAI SearchBot приводит переходы из поиска ChatGPT и стоит сайту 61 час в месяц. Meta ExternalAgent не приводит ничего и стоит 6258 часов. Это решения разного порядка, и одной галочкой их принимать нельзя.
Какая доля бот-трафика у обычного сайта?
Медианный сайт отдаёт ботам 29,7% запросов и 36,1% процессорного времени. Среднее значение почти такое же — 32,7%, а значит высокая доля ботов характерна не для отдельных крупных проектов, а почти для любого публичного сайта. Каждый четвёртый домен в выборке отдавал ботам больше половины трафика.
Помогает ли ограничение частоты запросов против ботов?
Зависит от профиля бота. SerpstatBot работает с 35 адресов и делает по 14 тысяч запросов с каждого — такой клиент отлично регулируется rate limit. Googlebot приходит с 16 978 адресов и делает всего 149 запросов с каждого, поэтому ограничение частоты на него не подействует, и его нужно проверять на подлинность, а не лимитировать.
#боты#аналитика#исследование#нагрузка#AI-краулеры
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Аналитика» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil