Боты6 мин чтения·9 августа 2026 г.

PerplexityBot заявляет о соблюдении robots.txt — но был пойман на обратном

Официальная документация Perplexity утверждает, что PerplexityBot уважает robots.txt. Разбираем задокументированный случай, когда краулер маскировался под обычный браузер, чтобы обойти запрет, и что с этим делать.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота PerplexityBot: нежелательный ai и llm-краулеры

PerplexityBot — индексация для поиска и цитирований в Perplexity (по официальной позиции — не обучение foundation-моделей). Оператор: Perplexity. Ниже — факты из публичной документации и практики верификации: полный UA, IP/ASN, robots.txt, с кем не путать и как настроить правила так, чтобы не отрезать соседний полезный агент. Краулер Perplexity AI индексирует страницы для поисковой системы Perplexity с цитированием источников — загружает контент, чтобы формировать ответы со ссылками на первоисточники.

Что такое PerplexityBot

Параметр Значение
User-Agent (токен) perplexitybot
Полная / типовая строка UA Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)
Оператор Perplexity
Назначение Индексация для поиска/цитирований в Perplexity — по официальной позиции, не обучение foundation-моделей
Официальная документация docs.perplexity.ai/docs/resources/perplexity-crawlers
IP / верификация ✅ Официальный feed: perplexity.com/perplexitybot.json — отдельно для PerplexityBot и для Perplexity-User (perplexity-user.json). Обновлять регулярно, встречаются IP вне опубликованных диапазонов
ASN (ориентир) не зафиксирован публично
Соблюдение robots.txt Заявлено официально, но не принимайте это как абсолютную гарантию — см. отдельный раздел ниже. Crawl-delay через robots.txt не поддерживается
Категория TrafficVeil AI и LLM-краулеры

Почему заявлению о соблюдении robots.txt не стоит доверять безоговорочно

Официальная документация Perplexity утверждает, что PerplexityBot соблюдает директивы robots.txt. Но есть задокументированный и позже независимо подтверждённый случай, который прямо этому противоречит: исследователь заблокировал сайт через robots.txt, затем задал Perplexity вопрос по конкретной странице этого сайта — и в логах обнаружил, что запрос пришёл вовсе не под именем PerplexityBot, а замаскированным под обычный браузер Chrome. То есть краулер не «нарушил» правило под своим именем — он представился кем-то другим, чтобы правило к нему формально не применялось. Практический вывод: относитесь к заявлению о compliance как к официальной позиции, а не как к гарантии. Дублируйте контроль на уровне сервера (rate-limit/WAF), особенно для чувствительного контента, а не полагайтесь только на строку в robots.txt.

Что на самом деле останавливает Disallow

Даже при полном запрете через robots.txt сайт не исчезает из Perplexity целиком: домен, заголовок страницы и краткое факт-резюме могут по-прежнему появляться в ответах. Disallow останавливает только полнотекстовую индексацию контента, а не любое упоминание домена. Если цель — полностью убрать сайт из поля зрения Perplexity, одного robots.txt может быть недостаточно.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как работает и зачем приходит

Нужны цитирования в Perplexity — разрешайте PerplexityBot и добавляйте IP allowlist из официального JSON. Не хотите индекс — ставьте Disallow для PerplexityBot, но учитывайте, что Perplexity-User (агент, который подгружает страницу по прямому запросу живого пользователя) может всё равно зайти — это user-initiated fetch, и официально он в общем случае игнорирует robots.txt.

Нагрузка на сервер

По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) perplexitybot: 37 526 запросов суммарно (март 6 886, апрель 12 071, май 14 118, июнь 4 451). Перед жёсткими правилами сверьте июль–август в аналитике TrafficVeil. Смотрите не только RPS, но и path-паттерн: плотный обход каталога без сессий — повод для rate-limit/deny; точечные хиты под user-fetch — другая политика.

Обнаружение в логах и IP

grep -i "perplexitybot" /var/log/nginx/access.log
grep -i "perplexitybot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
grep -i "perplexitybot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

# Актуальные IP (официальный JSON)
curl -s "https://www.perplexity.com/perplexitybot.json" | head

Важно: официальные JSON с IP публикуются отдельно для PerplexityBot и для Perplexity-User — обновляйте по расписанию, поскольку диапазоны меняются, а отдельные IP порой оказываются вне опубликованных списков. Учитывая известный случай маскировки под обычный браузер, связка UA + IP/ASN/официальный JSON важна не «для надёжности», а по существу — одной строки UA недостаточно.

robots.txt

User-agent: perplexitybot
Disallow: /

User-agent: perplexitybot
Allow: /

User-agent: perplexitybot
Disallow: /admin/
Disallow: /cart/
Allow: /

PerplexityBot формально уважает robots.txt, но подтверждённый случай маскировки под браузер показывает, что доверять этому как единственному барьеру рискованно. Perplexity-User — user-initiated fetch и официально в общем случае игнорирует robots.txt. Если в семействе есть «полезный» и «нежелательный» агент — делайте отдельные User-agent блоки и не режьте обоих одним ASN-баном.

Nginx / Apache / TrafficVeil

Nginx

if ($http_user_agent ~* "perplexitybot") {
    return 403;
}

Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} perplexitybot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите perplexitybot в ботах домена или /system/bots
  • Нужны цитирования в Perplexity — Allow PerplexityBot + IP allowlist из JSON
  • Не хотите индекс — Disallow PerplexityBot; учтите, что Perplexity-User может всё равно ходить, и что домен/заголовок/краткое резюме могут остаться видимыми даже при полном запрете
  • После изменения сверьте логи за 15–60 минут

Рекомендации

  • Нужны цитирования — Allow PerplexityBot + IP allowlist из JSON; не хотите индекс — Disallow, помня об ограничениях этого запрета
  • Не полагайтесь только на robots.txt — заявленный compliance PerplexityBot не абсолютен, известен зафиксированный случай маскировки под обычный браузер
  • Не баньте весь потенциальный диапазон оператора, если в семье есть нужный сайту бот
  • Обновляйте IP JSON по cron — диапазоны меняются, и отдельные запросы выходят за опубликованные пределы
  • Crawl-delay через robots.txt не поддерживается — для троттлинга используйте rate-limit на своей стороне
  • Сверяйте свежую статистику TrafficVeil, не только сводку март–июнь 2026

С кем не путать

Бот Роль Комментарий
Perplexity-User Загрузка URL по запросу живого пользователя; IP: perplexity-user.json; robots.txt обычно не стоп-кран семья Perplexity

Стратегия

Цель Действие
Нужна польза от оператора Allow + точечные Disallow служебных путей
Бот только грузит сервер / забирает данные Disallow + deny в TrafficVeil / nginx
Есть официальный IP JSON UA + IP verification / WAF IP set — обязательно, а не опционально
Чувствительный контент, важна гарантия исключения Не полагайтесь на один robots.txt — добавьте серверную блокировку

Частые вопросы

Точно ли PerplexityBot соблюдает robots.txt, как заявляет Perplexity?
Официально да, но есть задокументированный случай, когда краулер представился обычным браузером Chrome вместо PerplexityBot при обращении к заблокированному через robots.txt сайту.
Исчезнет ли сайт из Perplexity полностью после Disallow для PerplexityBot?
Нет, домен, заголовок и краткое факт-резюме могут по-прежнему появляться в ответах — блокируется только полнотекстовая индексация.
В чём разница между PerplexityBot и Perplexity-User?
PerplexityBot строит поисковый индекс на постоянной основе, а Perplexity-User подгружает страницу разово по прямому запросу живого пользователя и официально в общем случае игнорирует robots.txt.
Можно ли замедлить PerplexityBot через Crawl-delay в robots.txt?
Нет, эта директива не поддерживается — для ограничения частоты запросов нужен rate-limit на стороне сервера.
Достаточно ли блокировки только по строке User-Agent?
Нет, встречаются вариации UA и случаи маскировки под другие браузеры — нужна связка с IP из официального JSON-фида.
Что делать, если для сайта критично гарантированно исключить контент из Perplexity?
Не полагаться только на robots.txt, а дублировать блокировку на уровне сервера или WAF, особенно для чувствительных разделов.
#PerplexityBot#Perplexity-User#AI-краулеры#цитирования#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil