Боты4 мин чтения·11 августа 2026 г.·обновлено 8 сентября 2026 г.

Redditbot: как craulер Reddit строит превью ссылок и почему стоит проверить og-теги

redditbot — точечный fetcher Reddit, который забирает Open Graph метаданные для карточки превью, когда кто-то публикует ссылку на сайт в посте или комментарии. Разбираем, как устроен процесс, почему часть выборки может идти через сторонний сервис вроде Embedly, и как настроить доступ через og-теги, robots.txt и nginx.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота redditbot: легитимный прочие краулеры и сервисы

redditbot — официальный краулер Reddit, который заходит на сайт по одной конкретной причине: кто-то опубликовал ссылку на вашу страницу в посте или комментарии, и платформе нужно построить карточку превью — заголовок, описание и картинку — прежде чем показать ссылку в ленте. Полная строка идентификации выглядит как Mozilla/5.0 (compatible; redditbot/1.0; +http://www.reddit.com/feedback), и в отличие от массовых краулеров, этот бот не индексирует сайт целиком, а точечно вычитывает именно ту страницу, на которую сослались.

Как это устроено на практике

Когда пользователь Reddit публикует ссылку как отдельный пост или вставляет её в комментарий, платформа обращается к целевому URL и разбирает HTML в поисках метатегов Open Graph — og:title, og:description, og:image. Именно из них строится карточка со ссылкой, которую видят другие пользователи в ленте: заголовок, короткое описание и миниатюра. Если эти теги на странице отсутствуют или заполнены некорректно, карточка получится пустой или с обрезанными данными — независимо от того, насколько хорош сам контент по этой ссылке.

Частота визитов redditbot напрямую привязана к активности вокруг конкретной ссылки: разовая публикация — разовый или несколько повторных запросов (например, при обновлении кеша превью), заметный вирусный пост с активным обсуждением — соответственно больше обращений к той же странице по мере роста интереса.

Параметры бота

Параметр Значение
User-Agent содержит redditbot, полная строка — Mozilla/5.0 (compatible; redditbot/1.0; +http://www.reddit.com/feedback)
Оператор Reddit, Inc.
Тип запроса Точечный fetch метаданных для карточки превью — не полноценный обход сайта
Что читает Метатеги Open Graph, при их отсутствии — доступные альтернативные источники метаданных на странице
Список IP-адресов ❌ Стабильного публичного фида, как правило, нет
Проверка подлинности Двойной DNS lookup — обратный запрос по IP должен резолвиться в хост, оканчивающийся на reddit.com, прямой запрос по этому имени должен вернуть тот же исходный IP

Отдельный нюанс: помимо собственного краулера, для части задач по обработке превью Reddit исторически делегировал разбор метаданных сторонним сервисам вроде Embedly — то есть в некоторых случаях сама первичная выборка данных о странице может идти не напрямую от инфраструктуры Reddit, что стоит иметь в виду при попытке строго верифицировать источник запроса.

Сколько трафика он создаёт

По сводке TrafficVeil, нагрузка от redditbot на подключённых доменах минимальна — порядка 100 запросов за отчётный период. Это ожидаемо для точечного fetch-бота: он не сканирует каталог и не заходит на страницы, на которые никто не ссылался с Reddit, поэтому объём трафика от него в принципе не может быть большим, если только контент сайта не оказывается вирусным на платформе регулярно.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Стоит ли блокировать

Решение здесь прямо связано с тем, важен ли сайту трафик с Reddit:

  • если ссылки на сайт хоть иногда публикуются на Reddit — блокировка бота приведёт к тому, что вместо аккуратной карточки с заголовком, описанием и картинкой пользователи увидят голый URL, что заметно снижает click-through по ссылке;
  • если платформа не является источником трафика и превью не нужны — блокировка ничего не портит и не за что переживать;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие redditbot не влияет — это отдельный от поисковой индексации механизм.

Как найти бота в логах

grep -i "redditbot" /var/log/nginx/access.log

Как настроить доступ

Если превью с Reddit важны, стоит не просто разрешить бота, а убедиться, что ключевые страницы отдают корректные Open Graph теги в исходном серверном HTML (а не подгружают их через клиентский JavaScript — краулеры превью, как правило, не выполняют скрипты так, как это делает полноценный браузер):

<meta property="og:title" content="Заголовок страницы" />
<meta property="og:description" content="Краткое описание страницы" />
<meta property="og:image" content="https://example.com/preview.jpg" />

Явное разрешение в robots.txt:

User-agent: redditbot
Allow: /

Если превью не нужны — блокировка с дублированием на уровне сервера:

User-agent: redditbot
Disallow: /
if ($http_user_agent ~* "redditbot") {
    return 403;
}

Частые вопросы

Почему redditbot зашёл на мой сайт?
Скорее всего, кто-то опубликовал ссылку на страницу сайта в посте или комментарии на Reddit, и платформе нужно построить карточку превью.
Что именно бот читает на странице?
В первую очередь метатеги Open Graph — og:title, og:description и og:image, из которых собирается карточка ссылки в ленте.
Почему превью может не отображаться, даже если бот заходил?
Если og-теги подгружаются через клиентский JavaScript, а не отдаются сразу в серверном HTML, краулер превью их может не увидеть.
Стоит ли блокировать redditbot, если трафик с Reddit не важен?
Да, в этом случае блокировка ничего не портит — просто ссылка будет отображаться как обычный URL без карточки.
Как проверить подлинность запроса от redditbot?
Через двойной DNS lookup: обратный запрос по IP должен резолвиться в хост reddit.com, а прямой запрос по этому имени — вернуть тот же исходный IP.
Влияет ли этот бот на позиции в поисковых системах?
Нет, redditbot не связан с индексацией Google, Bing или Яндекса — это отдельный механизм построения превью ссылок.
#redditbot#Reddit#link preview#og-теги#бот-энциклопедия#robots.txt#nginx#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil