redditbot — официальный краулер Reddit, который заходит на сайт по одной конкретной причине: кто-то опубликовал ссылку на вашу страницу в посте или комментарии, и платформе нужно построить карточку превью — заголовок, описание и картинку — прежде чем показать ссылку в ленте. Полная строка идентификации выглядит как Mozilla/5.0 (compatible; redditbot/1.0; +http://www.reddit.com/feedback), и в отличие от массовых краулеров, этот бот не индексирует сайт целиком, а точечно вычитывает именно ту страницу, на которую сослались.
Как это устроено на практике
Когда пользователь Reddit публикует ссылку как отдельный пост или вставляет её в комментарий, платформа обращается к целевому URL и разбирает HTML в поисках метатегов Open Graph — og:title, og:description, og:image. Именно из них строится карточка со ссылкой, которую видят другие пользователи в ленте: заголовок, короткое описание и миниатюра. Если эти теги на странице отсутствуют или заполнены некорректно, карточка получится пустой или с обрезанными данными — независимо от того, насколько хорош сам контент по этой ссылке.
Частота визитов redditbot напрямую привязана к активности вокруг конкретной ссылки: разовая публикация — разовый или несколько повторных запросов (например, при обновлении кеша превью), заметный вирусный пост с активным обсуждением — соответственно больше обращений к той же странице по мере роста интереса.
Параметры бота
| Параметр | Значение |
| User-Agent | содержит redditbot, полная строка — Mozilla/5.0 (compatible; redditbot/1.0; +http://www.reddit.com/feedback) |
| Оператор | Reddit, Inc. |
| Тип запроса | Точечный fetch метаданных для карточки превью — не полноценный обход сайта |
| Что читает | Метатеги Open Graph, при их отсутствии — доступные альтернативные источники метаданных на странице |
| Список IP-адресов | ❌ Стабильного публичного фида, как правило, нет |
| Проверка подлинности | Двойной DNS lookup — обратный запрос по IP должен резолвиться в хост, оканчивающийся на reddit.com, прямой запрос по этому имени должен вернуть тот же исходный IP |
Отдельный нюанс: помимо собственного краулера, для части задач по обработке превью Reddit исторически делегировал разбор метаданных сторонним сервисам вроде Embedly — то есть в некоторых случаях сама первичная выборка данных о странице может идти не напрямую от инфраструктуры Reddit, что стоит иметь в виду при попытке строго верифицировать источник запроса.
Сколько трафика он создаёт
По сводке TrafficVeil, нагрузка от redditbot на подключённых доменах минимальна — порядка 100 запросов за отчётный период. Это ожидаемо для точечного fetch-бота: он не сканирует каталог и не заходит на страницы, на которые никто не ссылался с Reddit, поэтому объём трафика от него в принципе не может быть большим, если только контент сайта не оказывается вирусным на платформе регулярно.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Стоит ли блокировать
Решение здесь прямо связано с тем, важен ли сайту трафик с Reddit:
- если ссылки на сайт хоть иногда публикуются на Reddit — блокировка бота приведёт к тому, что вместо аккуратной карточки с заголовком, описанием и картинкой пользователи увидят голый URL, что заметно снижает click-through по ссылке;
- если платформа не является источником трафика и превью не нужны — блокировка ничего не портит и не за что переживать;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие redditbot не влияет — это отдельный от поисковой индексации механизм.
Как найти бота в логах
grep -i "redditbot" /var/log/nginx/access.log
Как настроить доступ
Если превью с Reddit важны, стоит не просто разрешить бота, а убедиться, что ключевые страницы отдают корректные Open Graph теги в исходном серверном HTML (а не подгружают их через клиентский JavaScript — краулеры превью, как правило, не выполняют скрипты так, как это делает полноценный браузер):
<meta property="og:title" content="Заголовок страницы" />
<meta property="og:description" content="Краткое описание страницы" />
<meta property="og:image" content="https://example.com/preview.jpg" />
Явное разрешение в robots.txt:
User-agent: redditbot
Allow: /
Если превью не нужны — блокировка с дублированием на уровне сервера:
User-agent: redditbot
Disallow: /
if ($http_user_agent ~* "redditbot") {
return 403;
}Частые вопросы
Почему redditbot зашёл на мой сайт?
Что именно бот читает на странице?
Почему превью может не отображаться, даже если бот заходил?
Стоит ли блокировать redditbot, если трафик с Reddit не важен?
Как проверить подлинность запроса от redditbot?
Влияет ли этот бот на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.