
Это исследование отвечает на два вопроса, которые почти никогда не задают вместе. Первый: какие боты приходят чаще всего. Второй: какие боты создают больше всего нагрузки. Ответы на них не совпадают, и именно в этом расхождении находится практический смысл управления бот-трафиком.
Бот, который делает 22 млн запросов, может быть дешевле для сервера, чем бот, который делает 2 млн. И наоборот: краулер с умеренной частотой способен выкачать больше данных, чем самый заметный клиент в логах. Поэтому мы измеряли не одну метрику, а четыре: количество запросов, отданный объём в байтах, суммарное время генерации ответа на origin и доля ошибочных обращений.
Ключевые цифры за период наблюдения
Главное наблюдение исследования формулируется одной фразой: боты потребляют мало трафика и много времени. За 30 дней автоматические клиенты сгенерировали 34,8% запросов, скачали 18,4% байт, но заняли 51,6% суммарного времени, которое origin-серверы потратили на формирование ответов.
Причина расхождения простая. Люди в основном забирают статику: картинки, шрифты, CSS и JavaScript отдаются из кэша быстро и весят много. Боты идут по HTML-страницам, часто по глубоким и редко посещаемым URL, которых нет в кэше — каждый такой запрос заставляет приложение и базу данных выполнять реальную работу.
Методика исследования
Мы описываем методику подробно, потому что в аналитике бот-трафика легко получить цифру, завышенную в два раза, и не заметить этого.
- Два окна наблюдения. Долгое окно — 120 дней агрегированной статистики по семействам ботов. Детальное окно — 30 дней сырых логов с байтами, временем ответа и кодами статуса. Абсолютные величины нагрузки приводятся только по детальному окну.
- Дедупликация. Инфраструктура логирования пишет часть запросов дважды — из основного пайплайна и из пайплайна безопасности. Все расчёты сделаны только по полным записям с заполненным URL: 165,0 млн строк из 296,8 млн. Без этой поправки любая цифра завышена примерно в 1,8 раза.
- Классификация по User-Agent. Бот считается опознанным, если его User-Agent содержит подпись известного семейства. Классификатор охватывает 31 семейство и намеренно не включает маскирующиеся клиенты, пустые User-Agent и самописные скрипты. Это значит, что реальная доля автоматического трафика выше приведённой.
- Нагрузка на origin. Измеряется как сумма времени формирования ответа по всем запросам семейства. Это прямая оценка того, сколько секунд процессорного времени приложения потратил бот.
- Без верификации по обратному DNS. Мы не разделяли настоящие и поддельные User-Agent. Все цифры описывают трафик, который представился конкретным ботом, потому что именно на этот трафик сервер тратит ресурсы независимо от того, кто его отправил.
Кто приходит чаще всего
За 30 дней опознанные боты сделали 57,5 млн запросов. Распределение оказалось крайне неравномерным: на первую десятку семейств приходится 80,5% всего бот-трафика, а один-единственный клиент забирает больше трети.
| Бот | Запросов | Доля бот-трафика | IP | Доменов |
|---|---|---|---|---|
| Meta ExternalAgent | 21,99 млн | 38,3% | 2655 | 597 |
| WordPress.com / Jetpack | 4,77 млн | 8,3% | 5316 | 292 |
| GPTBot | 4,30 млн | 7,5% | 2187 | 683 |
| Googlebot | 2,54 млн | 4,4% | 16 978 | 643 |
| ClaudeBot | 2,42 млн | 4,2% | 2643 | 660 |
| PetalBot | 2,40 млн | 4,2% | 2010 | 441 |
| Bytespider | 2,15 млн | 3,7% | 16 648 | 604 |
| Amazonbot | 1,99 млн | 3,5% | 3835 | 614 |
| Bingbot | 1,95 млн | 3,4% | 1176 | 628 |
| AhrefsBot | 1,73 млн | 3,0% | 11 893 | 330 |
| FacebookBot | 1,49 млн | 2,6% | 5763 | 574 |
| YandexImages | 1,20 млн | 2,1% | 1012 | 303 |
| SemrushBot | 1,11 млн | 1,9% | 1494 | 422 |
| DotBot | 996 тыс. | 1,7% | 324 | 329 |
| YandexBot | 888 тыс. | 1,5% | 672 | 541 |
| Applebot | 884 тыс. | 1,5% | 8898 | 654 |
| BaiduSpider | 684 тыс. | 1,2% | 1637 | 505 |
| MJ12bot | 580 тыс. | 1,0% | 1012 | 591 |
| SE Ranking Bot | 550 тыс. | 1,0% | 430 | 356 |
| SerpstatBot | 490 тыс. | 0,9% | 35 | 101 |
Частота посещений и охват доменов — разные вещи
Самый частый бот не обязательно самый вездесущий. За 120 дней наблюдения Meta ExternalAgent заходил на 691 домен, а OpenAI SearchBot — на 832, хотя запросов сделал в сто раз меньше. Это две принципиально разные стратегии обхода: одна глубокая и тяжёлая, другая широкая и лёгкая.
| Бот | Доменов за 120 дней | Дней активности | Доля бот-трафика за 120 дней |
|---|---|---|---|
| OpenAI SearchBot | 832 | 120 из 120 | 0,4% |
| ClaudeBot | 814 | 120 из 120 | 3,8% |
| GPTBot | 807 | 120 из 120 | 6,1% |
| Googlebot | 792 | 120 из 120 | 3,9% |
| Bingbot | 756 | 120 из 120 | 4,5% |
| Applebot | 752 | 120 из 120 | 2,3% |
| YandexBot | 719 | 120 из 120 | 2,2% |
| Amazonbot | 716 | 120 из 120 | 3,9% |
| Bytespider | 697 | 120 из 120 | 5,5% |
| Meta ExternalAgent | 691 | 120 из 120 | 38,5% |
| PetalBot | 459 | 120 из 120 | 7,4% |
Обратите внимание на колонку «Дней активности». Ни один крупный бот не пропустил ни одного дня из 120. Автоматический обход — не событие и не всплеск, а непрерывный процесс, который идёт круглосуточно всё время существования сайта.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Частота не равна нагрузке
Если ранжировать те же семейства не по количеству запросов, а по объёму отданных данных, таблица лидеров полностью меняется. На первое место выходит Bingbot, которого нет даже в первой пятёрке по частоте.
А если ранжировать по времени, которое origin потратил на обслуживание, картина меняется ещё радикальнее. Здесь разрыв между первым и вторым местом составляет четыре раза.
Три рейтинга рядом
Сопоставление трёх метрик показывает, почему решение «блокировать по частоте» приводит к неверным приоритетам.
| Бот | Место по запросам | Место по объёму | Место по нагрузке |
|---|---|---|---|
| Meta ExternalAgent | 1 | 5 | 1 |
| Bingbot | 9 | 1 | 7 |
| GPTBot | 3 | 2 | 4 |
| Googlebot | 4 | 3 | 12 |
| PetalBot | 6 | 4 | 2 |
| FacebookBot | 11 | 13 | 3 |
| WordPress.com / Jetpack | 2 | 26 | 6 |
| DotBot | 14 | 16 | 8 |
| YandexImages | 12 | 12 | 25 |
WordPress.com / Jetpack — второй по частоте клиент во всей сети, но по объёму данных он на 26-м месте: средний ответ ему весит 404 байта. Это служебные пинги, а не выкачивание сайта. Наоборот, FacebookBot с одиннадцатого места по частоте поднимается на третье по нагрузке, потому что каждый его запрос обрабатывается в среднем 2,6 секунды.
Сколько стоит один запрос каждого бота
Чтобы сравнивать ботов честно, нужно смотреть на удельную стоимость: сколько весит один ответ и сколько времени сервер его готовит.
| Бот | Средний ответ | Среднее время ответа | Запросов на один IP |
|---|---|---|---|
| PetalBot | 53,0 КБ | 2217 мс | 1193 |
| FacebookBot | 22,8 КБ | 2602 мс | 259 |
| SerpstatBot | 8,7 КБ | 1909 мс | 14 011 |
| Barkrowler | 8,3 КБ | 1884 мс | 458 |
| DotBot | 21,0 КБ | 1572 мс | 3073 |
| Sogou | 8,6 КБ | 1394 мс | 233 |
| MJ12bot | 14,9 КБ | 1294 мс | 573 |
| Applebot | 14,8 КБ | 1174 мс | 99 |
| Meta ExternalAgent | 5,6 КБ | 1024 мс | 8284 |
| YandexBot | 34,6 КБ | 1007 мс | 1322 |
| ClaudeBot | 23,1 КБ | 996 мс | 914 |
| Bingbot | 97,5 КБ | 830 мс | 1656 |
| SE Ranking Bot | 69,9 КБ | 855 мс | 1278 |
| GPTBot | 37,3 КБ | 789 мс | 1968 |
| Amazonbot | 40,9 КБ | 604 мс | 519 |
| Bytespider | 17,3 КБ | 521 мс | 129 |
| Googlebot | 55,7 КБ | 385 мс | 149 |
| GoogleOther | 11,0 КБ | 180 мс | 227 |
| Img2dataset | 64,6 КБ | 115 мс | 5927 |
| YandexImages | 28,9 КБ | 72 мс | 1182 |
| WordPress.com / Jetpack | 0,4 КБ | 351 мс | 897 |
Концентрация по IP-адресам
Третья колонка таблицы показывает, насколько распределён источник запросов. Googlebot приходит со 16 978 адресов и делает всего 149 запросов с каждого — блокировать его по частоте с одного IP бесполезно, никакой rate limit не сработает. SerpstatBot, наоборот, использует 35 адресов и выжимает по 14 011 запросов с каждого — такой клиент отлично ловится ограничением частоты, и его не нужно заносить в чёрный список целиком.
Боты, которые ходят в пустоту
Отдельный класс нагрузки — запросы к несуществующим URL. За 30 дней боты сгенерировали 10,0 млн ответов 404: это 17,5% всего бот-трафика. Каждая такая страница всё равно требует работы приложения, записи в лог и, как правило, обращения к базе данных.
Два лидера этого рейтинга — SEO-краулеры, которые обходят ссылочные базы. Они идут по ссылкам, собранным годами, и большая часть этих ссылок давно мертва. DotBot тратит две трети своих обращений на страницы, которых не существует, и всё равно занимает восьмое место по нагрузке на origin.
Отдельно стоит Meta ExternalAgent: 6,03 млн запросов в 404 за месяц. Это больше, чем весь месячный трафик Googlebot, Bingbot и YandexBot вместе взятых.
Боты не спят
Суточный профиль автоматического трафика принципиально отличается от человеческого. Люди дают классическую дневную кривую с двукратным разбросом между ночным минимумом и дневным максимумом. Боты идут почти ровной линией.
| Показатель | Боты | Остальной трафик |
|---|---|---|
| Минимум в час | 2,20 млн | 2,93 млн |
| Максимум в час | 2,69 млн | 5,57 млн |
| Размах суточных колебаний | 1,22× | 1,90× |
Ночью, когда посетителей мало, доля ботов доходит до 43,7%. В дневной пик она опускается до 30,0%. Но это следствие не роста активности ботов, а спада активности людей: в абсолютных числах боты держат ровные 2,2–2,7 млн запросов в час круглосуточно.
Из чего состоит бот-трафик
Мы разделили опознанные семейства на четыре класса и посчитали вклад каждого по всем трём метрикам сразу. Расхождение между колонками и есть главный результат исследования.
| Класс ботов | Доля запросов | Доля объёма | Доля нагрузки на origin |
|---|---|---|---|
| AI-краулеры и сборщики данных | 61,0% | 40,5% | 60,1% |
| Поисковые системы | 18,1% | 44,1% | 18,9% |
| Социальные сети и служебные сервисы | 11,0% | 2,8% | 10,5% |
| SEO-краулеры | 9,9% | 12,7% | 10,5% |
Поисковые системы дают лучший обмен для сайта: 18,1% запросов приносят индексацию, а 44,1% объёма приходятся в основном на изображения, которые отдаются из кэша быстро и без нагрузки на приложение. AI-краулеры дают обратную картину: 61% запросов и 60% процессорного времени при 40% трафика, и при этом никакой обратной ссылки, переходов и измеримой отдачи для владельца сайта.
AI-краулеры детально
| Бот | Запросов | Объём | Нагрузка | Доменов |
|---|---|---|---|---|
| Meta ExternalAgent | 21,99 млн | 123,2 ГБ | 6258 ч | 597 |
| GPTBot | 4,30 млн | 160,7 ГБ | 943 ч | 683 |
| ClaudeBot | 2,42 млн | 55,9 ГБ | 668 ч | 660 |
| Bytespider | 2,15 млн | 37,1 ГБ | 311 ч | 604 |
| Amazonbot | 1,99 млн | 81,3 ГБ | 334 ч | 614 |
| Applebot | 884 тыс. | 13,1 ГБ | 288 ч | 654 |
| Img2dataset | 445 тыс. | 28,7 ГБ | 14 ч | 128 |
| TikTokSpider | 354 тыс. | 4,5 ГБ | 35 ч | 164 |
| OpenAI SearchBot | 311 тыс. | 12,3 ГБ | 61 ч | 692 |
| PerplexityBot | 141 тыс. | 2,9 ГБ | 28 ч | 600 |
| ChatGPT-User | 77 тыс. | 1,2 ГБ | 20 ч | 608 |
| Итого | 35,06 млн | 520,9 ГБ | 8960 ч | — |
Внутри класса тоже есть разделение. GPTBot скачивает 160,7 ГБ, но обходится сайту всего в 943 часа: он идёт по контентным страницам эффективно и почти не промахивается (4,1% ошибок 404 — лучший показатель среди всех крупных ботов). Meta ExternalAgent скачивает меньше данных, но тратит в семь раз больше времени сервера и каждый четвёртый его запрос уходит в никуда.
Что видит типичный сайт
Все цифры выше — агрегаты по сети. Гораздо важнее понять, с чем сталкивается обычный сайт. Мы взяли 678 доменов, получивших не меньше 1000 запросов за детальное окно, и посчитали распределение по ним.
| Метрика за 30 дней | Средний сайт | Медианный сайт |
|---|---|---|
| Всего запросов | 243 511 | 49 808 |
| Бот-запросов | 84 762 | 10 960 |
| Доля ботов в трафике | 32,74% | 29,70% |
| Доля ботов в нагрузке на origin | — | 36,10% |
| Отдано ботам данных | — | 237 МБ |
| Разных семейств ботов на домене | 35,7 | 35 |
Близость среднего и медианного значения доли ботов — важный результат. Он означает, что высокая доля автоматического трафика — не свойство нескольких крупных сайтов, которые тянут статистику вверх, а свойство почти любого публичного сайта.
Каждый второй сайт в выборке отдавал ботам больше трети своего трафика. Каждый четвёртый — больше половины. Речь при этом идёт об обычных сайтах: корпоративных, новостных, региональных, интернет-магазинах среднего размера.
Динамика за всё время наблюдения
Абсолютные объёмы сравнивать напрямую нельзя: количество защищаемых доменов за 120 дней выросло, и вместе с ним растёт и суммарное число запросов. Поэтому мы нормировали данные — считали среднее количество бот-запросов на один активный домен в сутки и привели к индексу, где май равен 100.
Четыре месяца интенсивность держалась на одном уровне с небольшим летним провалом, а в сентябре выросла в полтора раза. Это рост именно нагрузки на отдельный сайт, а не эффект от подключения новых доменов: поправка на количество активных доменов уже внесена.
Состав трафика при этом тоже смещался. Доля Googlebot выросла более чем вдвое, GPTBot — в 1,7 раза, а PetalBot и Bytespider постепенно сокращали присутствие.
| Месяц | Meta ExternalAgent | GPTBot | ClaudeBot | Googlebot | Bingbot | PetalBot |
|---|---|---|---|---|---|---|
| Май | 33,8% | 4,4% | 3,9% | 2,8% | 4,4% | 11,8% |
| Июнь | 38,0% | 5,3% | 4,6% | 2,3% | 4,4% | 10,3% |
| Июль | 42,3% | 7,3% | 3,0% | 2,4% | 5,4% | 9,0% |
| Август | 39,1% | 4,6% | 3,0% | 4,2% | 4,4% | 6,5% |
| Сентябрь | 36,6% | 7,4% | 4,4% | 5,9% | 3,9% | 4,1% |
Что это значит для владельца сайта
Автоматический трафик — не абстрактная угроза. Он конвертируется во вполне конкретные строки в счёте за хостинг и в конкретные секунды ожидания для живого посетителя.
- Процессорное время. Половина мощности origin-сервера в среднем по сети уходит на клиентов, которые не покупают, не читают и не конвертируются. Это прямой перерасход тарифа хостинга.
- Скорость для людей. Когда бот занимает воркер приложения на 2,6 секунды, живой посетитель в этот момент стоит в очереди. Именно так «необъяснимые» подтормаживания сайта связаны с бот-обходом.
- Мусор в логах и аналитике. 10 млн ответов 404 за месяц забивают лог-файлы, искажают отчёты об ошибках и мешают увидеть настоящие проблемы.
- Неконтролируемый сбор контента. 521 ГБ текста и изображений за месяц ушли в наборы данных для обучения моделей. Владелец сайта об этом чаще всего не знает.
- Ночной расход ресурсов. Боты работают круглосуточно, поэтому «тихих часов», когда сервер отдыхает, у современного сайта просто нет.
- Ложное ощущение роста. Если счётчик считает всё подряд, треть «посещаемости» окажется машинами.
Что делать с этими данными
Универсальное правило «блокировать ботов» не работает: часть из них нужна для индексации и корректного отображения ссылок в соцсетях. Правильная стратегия — сегментировать и назначить каждому классу свою политику.
| Класс | Что делать | Почему |
|---|---|---|
| Поисковые системы | Разрешить полностью, проверять подлинность | 18% запросов дают индексацию и органический трафик, нагрузка умеренная |
| AI-краулеры обучения | Решение по каждому семейству отдельно | 60% нагрузки на origin без обратной отдачи для сайта |
| AI-поиск и агенты пользователя | Обычно разрешить | Приводят реальные переходы, стоят десятки часов в месяц |
| SEO-краулеры | Ограничить частоту | До 67% запросов в 404, польза только для сторонних сервисов |
| Служебные пинги и мониторинг | Разрешить, исключить из аналитики | Высокая частота при мизерном весе ответа |
| Неопознанные клиенты | Проверка поведения и репутации | Маскируются под браузеры, User-Agent не показателен |
Обратите внимание: для двух классов правильный инструмент — это ограничение частоты, а не блокировка. Как показала таблица концентрации по IP, боты с высоким числом запросов на адрес отлично регулируются rate limit без потери индексации, а распределённые краулеры вроде Googlebot нужно, наоборот, проверять на подлинность, а не ограничивать.
Как TrafficVeil управляет бот-трафиком
TrafficVeil стоит перед сайтом как reverse proxy: входящий запрос сначала попадает в защитный слой, проходит классификацию и только потом уходит на origin-сервер. Все данные этого исследования получены именно из этого слоя — это рабочая телеметрия, а не отдельный эксперимент.
Для каждого запроса система определяет семейство бота по User-Agent, проверяет репутацию IP и принадлежность к сети дата-центра, сверяет заявленную личность бота с реальным источником, анализирует частоту и последовательность обращений. На основе этого применяется политика, заданная владельцем домена: пропустить, ограничить частоту, отправить на проверку или заблокировать.
В панели домена видно не «сколько было ботов вообще», а конкретный разрез: какие семейства пришли, сколько запросов сделали, сколько получили блокировок и по какому правилу. Это позволяет принимать решения по данным своего сайта, а не по общим рекомендациям.
Главные выводы исследования
- 1. Треть запросов — и половина нагрузки. Опознанные боты дали 34,8% запросов, но заняли 51,6% процессорного времени origin-серверов. Реальная доля выше: маскирующиеся клиенты в подсчёт не вошли.
- 2. Частота и нагрузка — разные рейтинги. Лидер по числу запросов, лидер по объёму данных и лидер по нагрузке на сервер — три разных бота. Приоритизировать защиту только по количеству запросов неверно.
- 3. Один краулер может стоить дороже всех остальных. Meta ExternalAgent дал 38% бот-запросов и 42% всей бот-нагрузки, обращаясь всего с 2655 адресов.
- 4. AI-краулеры стали главным классом. 61% бот-запросов и 60% нагрузки на origin при 40% трафика. Четыре месяца назад расклад был другим, и меняется он быстро.
- 5. Каждый шестой бот-запрос уходит в 404. У SEO-краулеров показатель доходит до 67%. Сервер выполняет работу, результат которой никому не нужен.
- 6. Боты не знают ночей и выходных. Все крупные семейства были активны 120 дней из 120, а суточные колебания их активности не превышают 22%.
- 7. Размер сайта не защищает. Медианный сайт отдаёт ботам 29,7% трафика и 36,1% процессорного времени. Каждый четвёртый домен отдаёт больше половины.
- 8. Инструмент нужно выбирать по профилю бота. Распределённые краулеры требуют проверки подлинности, сосредоточенные на десятках IP — ограничения частоты. Одна политика на всех не работает.
Заключение
Публичный сайт в 2026 году обслуживает две разные аудитории. Первая — люди, ради которых он создан. Вторая — машины: поисковые роботы, краулеры обучающих датасетов, SEO-сканеры, агенты пользователей и служебные пинги. Вторая аудитория не заходит в корзину, не читает статьи и не оставляет заявок, но потребляет больше половины мощности сервера.
За 30 дней наблюдения автоматические клиенты сделали 57,5 млн запросов к защищаемым сайтам, скачали 1,29 ТБ данных и заняли 14 903 часа процессорного времени. Это не атака и не аномалия — это нормальный режим работы любого сайта, доступного из интернета.
Разница между сайтом, который платит за это вслепую, и сайтом, который этим управляет, — только в наличии измерений. Пока владелец не видит, какой бот сколько стоит, он не может ни ограничить лишнее, ни сохранить полезное.
Бот-трафик нельзя отменить. Но его можно измерить, разложить по семействам и назначить каждому свою цену.
Частые вопросы
Какой бот приходит на сайты чаще всего?
Какой бот создаёт больше всего нагрузки на сервер?
Почему боты потребляют мало трафика, но много процессорного времени?
Нужно ли блокировать AI-краулеры?
Какая доля бот-трафика у обычного сайта?
Помогает ли ограничение частоты запросов против ботов?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.