TrafficVeil
Боты 7 мин21 августа 2026 г.

SimplePie в логах сайта: библиотека, фетчер и вопрос блокировки

Разбираемся, чем SimplePie-библиотека отличается от SimplePie-фетчера превью-ссылок, как их различить в access.log и когда стоит блокировать, а когда — нет.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое SimplePie на самом деле
  2. 2. Зачем SimplePie приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти SimplePie в логах
  5. 5. robots.txt для SimplePie
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. С кем не путать SimplePie
  9. 9. Стратегия allow/deny
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

SimplePie — не всегда один и тот же процесс за кулисами. Под этим User-Agent на сайт может приходить и открытая PHP-библиотека для чтения RSS/Atom-лент, встроенная в чужое приложение, и отдельно каталогизированный "фетчер" превью-ссылок, которого антибот-сервисы отслеживают как самостоятельного агента. Для владельца сайта разница практическая: от неё зависит, стоит ли ждать разовый всплеск или регулярный фон запросов.

1. Что такое SimplePie на самом деле

Исходно SimplePie — открытая PHP-библиотека для разбора RSS- и Atom-лент, которую разработчики с 2004 года встраивают в свои сайты и приложения: агрегаторы новостей, читалки подкастов, виджеты "последние публикации". Библиотека распространяется по BSD-лицензии, и именно поэтому у неё нет единого "оператора" — код запускают тысячи независимых проектов, и трафик от каждого из них выглядит как SimplePie, хотя стоит за ним разный бизнес.

Отдельно от библиотеки существует запись SimplePie в базах бот-трафика (в частности, в каталоге Known Agents), где его классифицируют как fetcher — агента, который подтягивает метаданные страницы для превью-карточек при расшаривании ссылки. Это не крауler в привычном смысле: такой запрос делается один раз в течение нескольких секунд после публикации ссылки, без обхода остальных страниц сайта.

Параметр Значение
Название SimplePie
Природа PHP-библиотека для RSS/Atom (открытый код) + отдельно каталогизированный fetcher для превью-ссылок
Типичный User-Agent SimplePie/x.x.x (Feed Parser; http://simplepie.org; Allow like Gecko) Build/... — номер версии и билд меняются, разработчик может переопределить строку через set_useragent()
Оператор Единого нет: библиотеку встраивают независимые сайты и приложения; fetcher-версию по данным Known Agents связывают с самим проектом SimplePie
Категория в энциклопедии TrafficVeil Прочие краулеры и сервисы (легитимный)
Соблюдение robots.txt По открытым данным — не соблюдается по умолчанию; правило в robots.txt воспринимайте как пожелание, а не как техническую защиту
Публичный список IP Отсутствует — сверяйте по ASN и поведению, а не по одной строке UA

2. Зачем SimplePie приходит на сайт

Есть два разных сценария, которые дают одинаковую строку в логах, но по-разному нагружают сайт.

  • Регулярный опрос ленты. Стороннее приложение с библиотекой SimplePie внутри периодически перечитывает один и тот же URL фида — раз в 15–60 минут, иногда чаще. На большом числе подписчиков это дает устойчивый фон запросов к /feed, /rss.xml или страницам пагинации, откуда фид собирается динамически.
  • Разовая выборка под превью. Кто-то поделился ссылкой на конкретную страницу сайта в мессенджере или соцсети — SimplePie-fetcher заходит один раз, забирает title, description и картинку для карточки, дальше по сайту не идёт. Всплеск трафика тут коррелирует не с активностью бота, а с тем, насколько ссылка разошлась у людей.

Типичный практический кейс: ночью на сайте растёт RPS без единой конверсии, в access.log под этим временем преобладает simplepie на карточках товаров или пагинации — это первый сценарий, регулярный опрос фида сторонним агрегатором, а не разовая выборка превью. После включения rate-limit в TrafficVeil фоновая нагрузка спадает, а обычные пользователи и поисковые боты продолжают заходить без изменений.

3. Нагрузка и риски

Отдельной строки в публичной сводке top-bot TrafficVeil у simplepie может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на части доменов серии запросов выглядят как небольшие волны автоматизации без единой конверсии.

Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookies и сессий, концентрация на служебных или листовых страницах. Разовый fetcher-запрос под превью почти всегда безобиден — риск создаёт именно повторяющийся опрос одного и того же адреса с частотой выше разумной.

Полезный внешний ориентир: по данным Known Agents, на fetcher-трафик в целом (не только SimplePie) сейчас приходится около 2% всего веб-трафика, а сам SimplePie как fetcher чаще всего замечен на сайтах недвижимости, спортивных, новостных и IT-тематик — если ваш проект в одной из этих категорий, регулярные визиты этого агента ожидаемы и сами по себе не повод для тревоги.

4. Как найти SimplePie в логах

Ищите не «ботов вообще», а конкретный токен simplepie, и сразу смотрите соседей по семейству — совпадение по времени с другими UA из категории «Прочие краулеры и сервисы» подскажет, идёт ли речь об одном источнике или о нескольких.

# Базовый поиск
grep -i "simplepie" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "simplepie" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "simplepie" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность — регулярный фон или разовый всплеск
grep -i "simplepie" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить от похожих строк
grep -iE "simplepie|bot" /var/log/nginx/access.log | wc -l

Верификация. Строку User-Agent может подделать любой скрипт, а у SimplePie, в отличие от Googlebot или Bingbot, нет опубликованного способа официально подтвердить подлинность запроса — сам факт совпадения UA в логе для Known Agents считается лишь косвенным признаком, а не доказательством. Для решения allow/deny смотрите связку UA + ASN/IP + частота + набор URL:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для SimplePie

Важная поправка к общим ожиданиям: по открытым данным SimplePie не гарантированно следует правилам robots.txt, поэтому запись в файле стоит воспринимать как пожелание для добросовестных клиентов библиотеки, а не как техническую защиту от нежелательного трафика. Тем не менее прописать её стоит — часть интеграций это правило всё же уважает.

# Жёсткий запрет
User-agent: simplepie
Disallow: /

# Разрешить всё
User-agent: simplepie
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичные страницы
User-agent: simplepie
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Если агент игнорирует это правило и продолжает ходить в закрытые разделы — переходите к блокировке на уровне nginx/Apache или к запрету в TrafficVeil, не полагаясь только на robots.txt.

6. Блокировка вручную и через TrafficVeil

Nginx — полный запрет или ограничение частоты:

if ($http_user_agent ~* "simplepie") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=simplepie:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "simplepie") {
        limit_req zone=simplepie burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} simplepie [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • Найдите simplepie в разделе ботов домена или в /system/bots;
  • Для нежелательного сценария — категория «запретить», для мягкого — rate-limit;
  • Полное разрешение (allow) имеет смысл, только если у превью-фетчера или у чужого агрегатора есть явная польза для сайта — например, реферальный трафик со страниц, где расшарили ссылку;
  • После изменения сверьте логи: хиты SimplePie должны уйти в блок или лимит, а поисковые роботы Google и Yandex — остаться без изменений.

7. Что делать: короткий алгоритм

  • Пользы нет, фон регулярный и заметный — Disallow в robots.txt + запрет на уровне сервера или TrafficVeil, не полагаясь только на первое;
  • Видимая польза есть (например, ссылки на сайт активно расшаривают и превью-карточки важны для CTR) — Allow, при этом закрыть /admin, /cart, /account, /api;
  • Нагрузка эпизодическая, но пиковая — начните с rate-limit, полный запрет держите как следующий шаг;
  • Не блокируйте по маске User-agent: * — так можно случайно закрыть доступ Googlebot и YandexBot;
  • Если решаете заблокировать — в подавляющем большинстве случаев для SEO это не критично, если только речь не о собственном фиде сайта, на который завязана внешняя аудитория.

8. С кем не путать SimplePie

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный, тоже относится к категории fetcher — собирает данные для кнопок шеринга
BazQux Прочие краулеры и сервисы bazqux легитимный, RSS-ридер: в отличие от SimplePie-библиотеки, отдельный публичный сервис с собственным опросом подписанных фидов
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный

9. Стратегия allow/deny

Ситуация Действие
Регулярный опрос фида сторонним агрегатором без видимой пользы для сайта Disallow в robots.txt + запрет в TrafficVeil (само правило в файле полагаться нельзя)
Разовые fetcher-запросы под превью при шеринге ссылок Allow — трафик минимальный и разовый, блокировка портит вид ссылки в соцсетях и мессенджерах
Нужен доступ, но пики нерегулярны и высоки Rate-limit на nginx или в TrafficVeil вместо полного запрета
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно, после проверки ASN
Подозрение на подделку UA Не доверять строке UA целиком; смотреть IP/ASN, частоту и набор запрашиваемых URL

Частые вопросы

SimplePie — это один и тот же бот везде?

Нет: под этим UA скрываются два разных явления — открытая PHP-библиотека, встроенная в чужие сайты и приложения, и отдельный fetcher для превью-ссылок, которых отслеживают антибот-сервисы.

Обязательно ли SimplePie слушается правил в robots.txt?

Нет, по открытым данным этот агент не гарантированно соблюдает robots.txt, поэтому файл стоит дополнять блокировкой на уровне сервера или TrafficVeil.

Почему трафик от SimplePie иногда идёт постоянным фоном, а иногда одним всплеском?

Постоянный фон обычно даёт сторонний агрегатор, который периодически перечитывает один и тот же фид, а разовый всплеск — fetcher, который один раз забирает превью после того, как ссылку кто-то расшарил.

Стоит ли полностью блокировать SimplePie ради безопасности?

Disallow/403 для simplepie, если пользы нет Альтернатива: Allow только при явной пользе от SimplePie

Можно ли доверять User-Agent SimplePie без дополнительной проверки?

Нет, строку легко подделать, и у SimplePie нет официального способа подтвердить подлинность запроса, поэтому решение allow/deny стоит принимать по связке UA, ASN, IP и частоты запросов.

Что будет с SEO, если заблокировать SimplePie?

Обычно ничего критичного не теряется, если это не поисковый робот и не сервис, от которого зависит переток аудитории на сайт через сторонний фид.

#SimplePie#User-Agent#боты#антибот#robots.txt#access.log#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.