TrafficVeil
Боты 11 мин25 августа 2026 г.

Quora-Bot: что известно о crawler Quora и как проверить его трафик

Разбираем Quora-Bot без неподтверждённых предположений: кто стоит за User-Agent, зачем Quora может получать внешние страницы, как отличить нормальный fetch от подмены и какую политику выбрать в TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Кому принадлежит Quora-Bot
  2. Зачем Quora может обращаться к внешнему сайту
  3. Quora-Bot: crawler или link-preview fetcher?
  4. Два разных профиля поведения
  5. Quora-Bot и Open Graph
  6. Не путайте Quora-Bot с посетителем из Quora
  7. Как выглядит User-Agent
  8. Как найти Quora-Bot в Nginx access.log
  9. Добавьте анализ HTTP-методов
  10. Как определить наиболее частые пары IP + URL
  11. Какая активность выглядит нормальной
  12. Какая активность требует проверки
  13. User-Agent Quora-Bot можно подделать
  14. Есть ли у Quora-Bot официальный список IP
  15. Почему нельзя разрешать весь AWS
  16. Как проверять источник без официального IP-feed
  17. Не связывайте Quora-Bot автоматически с Poe
  18. Почему поле «AI training» лучше заполнять как Unknown
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Quora-Bot — автоматизированный HTTP-клиент, связываемый с Quora, Inc. Он встречается в серверных логах при обращении к внешним веб-страницам и идентифицируется по токену Quora-Bot.

При этом вокруг его назначения существует больше неопределённости, чем у хорошо документированных агентов вроде Googlebot или GTmetrix. В открытых crawler-каталогах Quora-Bot чаще связывают с обработкой внешних ссылок и получением информации о страницах для функций Quora, однако встречается и более широкая классификация как web crawler.

Поэтому корректная энциклопедическая карточка должна разделять то, что подтверждается наблюдениями, и предположения о внутреннем использовании полученных данных.

Параметр Значение
Название Quora-Bot
Связанный оператор Quora, Inc.
Основной токен UA Quora-Bot
Известный вариант UA Quora-Bot/1.0 (http://www.quora.com)
Вероятный тип Social / Link Fetcher / Web Crawler
Получение публичных URL Да
Полный поисковый индекс Публично не подтверждён
AI training Для Quora-Bot публично не подтверждено
Актуальный официальный IP-feed Не подтверждён
robots.txt Надёжность соблюдения публично не установлена
Категория TrafficVeil Прочие краулеры и сервисы / Social Fetcher
Рекомендованный статус Контекстный: разрешать или ограничивать по поведению

Кому принадлежит Quora-Bot

Доступные базы User-Agent устойчиво связывают Quora-Bot с компанией Quora.

Исторически наблюдалась строка:

Quora-Bot/1.0 (http://www.quora.com)

Поэтому определять оператора как полностью неизвестного не стоит.

Однако между «User-Agent называется Quora-Bot» и «каждый такой запрос гарантированно пришёл от Quora» есть важная разница.

User-Agent не подписывается криптографически и может быть скопирован любым HTTP-клиентом.

Зачем Quora может обращаться к внешнему сайту

Наиболее убедительная практическая версия связана с обработкой внешних URL, которые появляются в Quora.

Когда пользователь публикует ссылку, сервису может потребоваться получить страницу, чтобы определить связанный с ней контент и корректно представить URL внутри продукта.

В зависимости от реализации могут быть полезны:

  • HTML страницы;
  • заголовок документа;
  • description;
  • Open Graph metadata;
  • изображение для preview;
  • canonical URL;
  • другая общедоступная информация документа.

Но без современной официальной технической документации Quora не следует утверждать, что каждый запрос Quora-Bot обязательно выполняет все перечисленные операции.

В открытых каталогах встречаются обе классификации.

Часть источников описывает Quora-Bot как fetcher, который получает конкретную страницу, когда внешний URL используется на Quora.

Другие классифицируют его шире — как crawler, способный получать публичный веб-контент.

Для владельца сервера важнее практический вывод: не определяйте нормальное поведение только по названию категории.

Посмотрите, что реально происходит в вашем access.log.

Два разных профиля поведения

Профиль Как может выглядеть
Получение конкретной ссылки Один или несколько запросов к отдельному опубликованному URL
Более широкий crawler Несколько связанных публичных страниц за одну сессию
Подозрительный источник Security scanning, перебор служебных файлов или высокий продолжительный RPS

TrafficVeil может классифицировать первые два варианта как автоматизированный трафик Quora с разным уровнем уверенности, а третий не должен получать привилегии только из-за знакомого User-Agent.

Quora-Bot и Open Graph

Если Quora использует внешний URL для preview или представления ссылки, качественная metadata помогает корректно описать страницу.

Для публичных материалов полезно иметь:

<meta property="og:title" content="Название страницы">
<meta property="og:description" content="Краткое описание">
<meta property="og:image" content="https://example.com/cover.jpg">
<meta property="og:url" content="https://example.com/article">

Эта разметка полезна не только Quora, но и многим социальным приложениям, мессенджерам и link-preview сервисам.

Не путайте Quora-Bot с посетителем из Quora

Автоматический запрос и реальный переход человека — разные события.

Например:

Quora-Bot → GET /article

означает, что автоматический клиент получил страницу.

А переход человека обычно будет выглядеть как обычный браузерный User-Agent:

Mozilla/5.0 ... Chrome/...

и может сопровождаться реферером или параметрами аналитики.

Поэтому Quora-Bot не следует включать в показатели реальных посетителей, конверсий и пользовательских сессий.

Как выглядит User-Agent

Наиболее известный вариант:

Quora-Bot/1.0 (http://www.quora.com)

Для детекции лучше использовать токен:

Quora-Bot

без жёсткой привязки к версии.

Так изменение:

Quora-Bot/1.0

на потенциальный будущий:

Quora-Bot/2.0

не сломает базовое обнаружение.

Как найти Quora-Bot в Nginx access.log

Все запросы:

grep -i "quora-bot" /var/log/nginx/access.log

Количество:

grep -ic "quora-bot" /var/log/nginx/access.log

Наиболее активные IP:

grep -i "quora-bot" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -nr \
| head -20

Топ URL:

grep -i "quora-bot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -nr \
| head -30

HTTP-статусы:

grep -i "quora-bot" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -nr

Добавьте анализ HTTP-методов

Для обычного получения публичного контента наиболее естественны безопасные методы вроде GET и иногда HEAD.

Посмотреть методы можно так:

grep -i "quora-bot" /var/log/nginx/access.log \
| awk -F'"' '{print $2}' \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -nr

Если заявленный Quora-Bot активно отправляет:

POST
PUT
PATCH
DELETE

на разнообразные служебные endpoints, это уже плохо соответствует обычному профилю получения публичной страницы.

Как определить наиболее частые пары IP + URL

grep -i "quora-bot" /var/log/nginx/access.log \
| awk '{print $1, $7}' \
| sort \
| uniq -c \
| sort -nr \
| head -50

Так становится видно, обращается ли один адрес повторно к одной публикации или выполняет широкий обход большого числа документов.

Какая активность выглядит нормальной

Нормальным или как минимум объяснимым выглядит:

  • получение публичной статьи;
  • обращение к URL, который мог быть опубликован на Quora;
  • небольшое число запросов вокруг одного документа;
  • HTTP GET;
  • ответы 200/3xx;
  • отсутствие попыток проникновения в административные разделы.

Какая активность требует проверки

Само слово Quora в User-Agent не должно объяснять любое поведение.

Например:

GET /.env
GET /.git/config
GET /wp-login.php
GET /xmlrpc.php
GET /backup.zip
GET /phpmyadmin/

не имеет очевидной связи с обработкой внешних ссылок Quora.

То же относится к:

  • массовому перебору несуществующих URL;
  • сканированию CVE endpoints;
  • credential stuffing;
  • аномальным POST-запросам;
  • очень высокому RPS;
  • последовательному перебору административных интерфейсов.

User-Agent Quora-Bot можно подделать

Это стандартное ограничение почти всех crawler-сигнатур.

Например:

curl -A "Quora-Bot/1.0 (http://www.quora.com)" https://example.com/

создаст серверный запрос, который по одному User-Agent выглядит как Quora.

Следовательно, TrafficVeil не должен реализовывать:

if user_agent == Quora-Bot:
    bypass_all_security

Есть ли у Quora-Bot официальный список IP

В открытых сторонних базах встречаются IP, на которых ранее наблюдался Quora-Bot.

Исторически такие обращения фиксировались в инфраструктуре Amazon AWS.

Но это не равно актуальному официальному IP-feed.

Без опубликованного и поддерживаемого оператором источника нельзя гарантировать:

  • что старый IP всё ещё принадлежит crawler;
  • что список полный;
  • что новые адреса не появились;
  • что весь AWS ASN принадлежит Quora.

Почему нельзя разрешать весь AWS

Это особенно опасная ошибка.

Если несколько наблюдавшихся IP Quora находились в Amazon EC2, из этого не следует:

AWS = Quora

Amazon обслуживает огромное количество независимых клиентов.

Allow всего ASN ради одного crawler создаст слишком широкое исключение.

Как проверять источник без официального IP-feed

При отсутствии строгой IP-верификации используйте совокупность признаков:

  • UA;
  • ASN;
  • reverse DNS;
  • URL;
  • метод;
  • частоту;
  • характер сессии;
  • историю этого IP;
  • совпадение со временем появления ссылки на Quora, если это можно установить.

Ни один из этих признаков по отдельности не обеспечивает абсолютной аутентификации, но их сочетание значительно лучше простого UA match.

Не связывайте Quora-Bot автоматически с Poe

Quora также развивает AI-продукты и сервис Poe, но это не означает, что любой crawler компании используется для обучения языковых моделей.

Это две разные сущности:

компания использует AI

и:

конкретный Quora-Bot собирает внешний веб для AI training

Второе утверждение требует отдельного доказательства.

Для Quora-Bot надёжного публичного подтверждения такого назначения нет.

Почему поле «AI training» лучше заполнять как Unknown

В бот-базе полезно различать как минимум три значения:

Значение Что означает
Yes Оператор прямо заявляет использование crawler для AI training
No Оператор прямо исключает такое назначение для конкретного агента
Unknown Надёжной публичной информации недостаточно

Для Quora-Bot наиболее корректным является последний вариант.

Соблюдает ли Quora-Bot robots.txt

Доступные сторонние каталоги расходятся.

Одни указывают, что Quora-Bot следует robots.txt, другие отмечают compliance как неизвестный или сообщают, что на него нельзя рассчитывать.

При отсутствии современной официальной спецификации Quora безопаснее не обещать пользователю гарантированное соблюдение.

Вы можете задать preference:

User-agent: Quora-Bot
Disallow: /

но после изменения обязательно проверьте access.log.

robots.txt не является firewall

Даже робот, который полностью уважает robots.txt, технически способен сделать запрос к файлу и получить правила.

А клиент, который решит директиву проигнорировать, не будет остановлен веб-сервером.

Поэтому для реального запрета используйте:

  • TrafficVeil;
  • WAF;
  • Nginx;
  • Apache;
  • firewall;
  • application access control.

Как заблокировать Quora-Bot через Nginx

Простое правило по UA:

if ($http_user_agent ~* "quora-bot") {
    return 403;
}

Оно гарантированно запрещает клиенту с таким заявленным User-Agent получить страницу через данный server block.

Однако оно не подтверждает, действительно ли клиент принадлежал Quora.

Apache .htaccess

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Quora-Bot [NC]
RewriteRule ^ - [F,L]

Результатом будет 403 Forbidden.

Стоит ли применять rate limit

Для небольшого количества fetch-запросов специально ограничивать Quora-Bot обычно нет необходимости.

Rate limit становится полезнее, когда наблюдается продолжительный автоматический обход и владелец хочет сохранить доступ, но уменьшить стоимость для origin.

Универсального значения вроде «15 запросов в минуту» нет.

Лимит зависит от:

  • мощности origin;
  • наличия cache;
  • стоимости генерации страниц;
  • объёма Quora-трафика;
  • характера запросов.

Корректный rate limit для Nginx

Для условного ограничения по User-Agent удобнее использовать map:

map $http_user_agent $quora_limit_key {
    default "";
    ~*Quora-Bot $binary_remote_addr;
}

limit_req_zone $quora_limit_key zone=quora_bot:10m rate=1r/s;

server {
    location / {
        limit_req zone=quora_bot burst=10;
    }
}

1r/s здесь является только примером синтаксиса, а не универсальной рекомендацией.

Нужно ли блокировать Quora-Bot

Единственного ответа для всех сайтов нет.

Если Quora потенциально приводит аудиторию и нормальные обращения Quora-Bot не создают заметной нагрузки, причин для автоматического deny немного.

Если владельцу не нужна связь с Quora, бот регулярно получает большое количество страниц или политика организации запрещает сторонние fetchers, блокировка допустима.

Что можно потерять при блокировке

Если Quora-Bot действительно используется для обработки внешних ссылок, запрет способен ухудшить представление вашего URL внутри Quora.

Потенциально это означает отсутствие или ухудшение:

  • title;
  • description;
  • thumbnail;
  • link preview;
  • других данных, получаемых при fetch.

При этом прямого влияния на индексацию Google или Yandex нет: Quora-Bot не является их поисковым crawler.

Как оценить реальную нагрузку Quora-Bot

Вместо одного RPS смотрите несколько показателей.

Метрика Зачем нужна
Requests/hour Показывает общий объём автоматизации
Unique URLs Отличает отдельные fetch от широкого обхода
Unique IPs Показывает сетевую структуру источника
HTTP methods Помогает найти нетипичные действия
4xx/5xx Выявляет блокировки и ошибки
Bandwidth Показывает сетевую стоимость
Origin response time Показывает вычислительную нагрузку
Cache HIT Помогает понять реальную стоимость запроса

Пример: 5 000 запросов могут означать совершенно разные вещи

Сценарий №1:

5 000 запросов
→ 3 публичные статьи
→ почти все Cache HIT

Это может быть интенсивное повторное получение небольшого количества популярных ссылок.

Сценарий №2:

5 000 запросов
→ 4 700 уникальных URL
→ категории, теги, пагинация

Это уже гораздо больше похоже на crawler activity.

Сценарий №3:

5 000 запросов
→ /.env
→ wp-login.php
→ xmlrpc.php
→ backups
→ phpMyAdmin

Это не следует считать нормальным Quora traffic независимо от User-Agent.

Quora-Bot в TrafficVeil

Для TrafficVeil Quora-Bot лучше классифицировать как известный social/web fetcher с ограниченной уверенностью сетевой идентификации.

Полезная модель:

  1. обнаружить Quora-Bot;
  2. сохранить полный UA;
  3. определить IP и ASN;
  4. посмотреть URL;
  5. проверить HTTP-метод;
  6. измерить частоту;
  7. определить breadth обхода;
  8. найти security-sensitive paths;
  9. назначить confidence score;
  10. только затем применять allow/deny.

Почему для Quora-Bot полезен confidence score

У некоторых ботов есть строгая верификация через официальные IP или reverse DNS.

Для Quora-Bot публично доступная модель слабее.

Поэтому TrafficVeil может использовать, например:

Уровень Пример
Высокий Известный UA + ожидаемая сеть + нормальный URL + нормальное поведение
Средний UA совпадает, сеть не подтверждена, поведение нормальное
Низкий Совпадает только User-Agent
Подозрительный UA совпадает, но выполняется security scanning

Это честнее, чем показывать пользователю бинарную отметку «100% настоящий Quora» без достаточных доказательств.

Как должна выглядеть карточка Quora-Bot в TrafficVeil

Поле Рекомендуемое значение
Название Quora-Bot
Оператор Quora, Inc.
Категория Social / Web Fetcher
Статус Контекстный
User-Agent Quora-Bot/1.0
AI training Не подтверждено
Официальный IP-feed Не подтверждён
robots.txt Поведение не подтверждено однозначно
Основная рекомендация Оценивать UA + сеть + URL + поведение

Когда Quora-Bot можно разрешить

Allow оправдан, если:

  • Quora потенциально является источником аудитории;
  • бот получает обычные публичные страницы;
  • объём запросов небольшой;
  • нет security scanning;
  • origin не испытывает нагрузки;
  • владельцу важна корректная обработка ссылок сторонними сервисами.

Когда его стоит ограничить

Rate limit или отдельная политика разумны, если:

  • обход становится широким;
  • частота заметно растёт;
  • бот обращается к дорогим динамическим страницам;
  • нагрузка начинает влиять на пользователей;
  • полный запрет пока нежелателен.

Когда лучше блокировать

Deny оправдан, если:

  • Quora не имеет для сайта никакой бизнес-ценности;
  • политика организации запрещает сторонний crawling;
  • источник создаёт неоправданную нагрузку;
  • клиент ведёт себя как vulnerability scanner;
  • UA явно используется как маскировка;
  • владелец сознательно не хочет отдавать контент Quora.

Практический чек-лист

  1. Не называйте оператора неизвестным. Quora-Bot устойчиво связывается с Quora, Inc.
  2. Ищите токен Quora-Bot. Не привязывайтесь только к версии 1.0.
  3. Не утверждайте AI training без доказательств.
  4. Не считайте каждый request посещением человека.
  5. Посмотрите число уникальных URL. Это помогает отличить fetch от широкого crawl.
  6. Проверьте методы. Необычные write-запросы требуют внимания.
  7. Не доверяйте AWS ASN целиком. Это слишком широкая сеть.
  8. Не рассчитывайте только на robots.txt. Проверьте фактическое поведение.
  9. Не давайте security bypass по UA.
  10. Выбирайте allow, limit или deny по реальной пользе и поведению.

Итог

Quora-Bot — автоматизированный клиент, связанный с Quora, Inc., но его современная публичная техническая документация заметно слабее, чем у крупнейших поисковых и сервисных роботов.

Известен User-Agent семейства Quora-Bot/1.0, а наиболее вероятные задачи связаны с получением и анализом публичных внешних URL для функций Quora. При этом утверждать без дополнительных доказательств, что бот строит полный поисковый индекс, занимается AI training или обязательно следует robots.txt, не стоит.

Актуального официального IP-feed также недостаточно для строгой сетевой аутентификации, поэтому TrafficVeil лучше использовать модель доверия на основе нескольких сигналов: User-Agent, IP/ASN, URL, методов, частоты и поведения.

Если Quora приносит сайту пользу и агент работает как обычный fetcher публичных страниц, его можно разрешить. Если активность бесполезна, создаёт нагрузку или превращается в security scanning, доступ можно ограничить независимо от заявленного имени Quora-Bot.

Частые вопросы

Кому принадлежит Quora-Bot?

Наблюдаемые базы User-Agent и crawler-каталоги связывают Quora-Bot с Quora, Inc.

Как выглядит User-Agent Quora-Bot?

Наиболее устойчиво задокументирован вариант Quora-Bot/1.0 (http://www.quora.com), хотя при детекции разумнее использовать токен Quora-Bot.

Использует ли Quora-Bot сайты для обучения искусственного интеллекта?

Надёжных публичных доказательств такого назначения именно для Quora-Bot нет, поэтому относить его к AI training crawler без дополнительных данных неправильно.

Соблюдает ли Quora-Bot robots.txt?

Актуальные сторонние источники противоречат друг другу, поэтому robots.txt лучше считать декларативной инструкцией, а не гарантированным способом блокировки.

Есть ли официальный список IP Quora-Bot?

Публичный актуальный официальный IP-feed мне подтвердить не удалось, а встречающиеся в сторонних базах адреса нельзя считать гарантированно действующими.

Нужно ли блокировать Quora-Bot по умолчанию?

Нет универсального правила: нормальный fetch публичной страницы можно разрешить, а подозрительное или бесполезное для владельца сайта поведение — ограничить через TrafficVeil.

#Quora-Bot#Quora Bot#Quora crawler#Quora#link preview#social crawler#User-Agent#веб-краулеры#автоматический трафик#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Quora-Bot — User-Agent, назначение и блокировка | TrafficVeil