SimplePie — не всегда один и тот же процесс за кулисами. Под этим User-Agent на сайт может приходить и открытая PHP-библиотека для чтения RSS/Atom-лент, встроенная в чужое приложение, и отдельно каталогизированный "фетчер" превью-ссылок, которого антибот-сервисы отслеживают как самостоятельного агента. Для владельца сайта разница практическая: от неё зависит, стоит ли ждать разовый всплеск или регулярный фон запросов.
1. Что такое SimplePie на самом деле
Исходно SimplePie — открытая PHP-библиотека для разбора RSS- и Atom-лент, которую разработчики с 2004 года встраивают в свои сайты и приложения: агрегаторы новостей, читалки подкастов, виджеты "последние публикации". Библиотека распространяется по BSD-лицензии, и именно поэтому у неё нет единого "оператора" — код запускают тысячи независимых проектов, и трафик от каждого из них выглядит как SimplePie, хотя стоит за ним разный бизнес.
Отдельно от библиотеки существует запись SimplePie в базах бот-трафика (в частности, в каталоге Known Agents), где его классифицируют как fetcher — агента, который подтягивает метаданные страницы для превью-карточек при расшаривании ссылки. Это не крауler в привычном смысле: такой запрос делается один раз в течение нескольких секунд после публикации ссылки, без обхода остальных страниц сайта.
| Параметр | Значение |
| Название | SimplePie |
| Природа | PHP-библиотека для RSS/Atom (открытый код) + отдельно каталогизированный fetcher для превью-ссылок |
| Типичный User-Agent | SimplePie/x.x.x (Feed Parser; http://simplepie.org; Allow like Gecko) Build/... — номер версии и билд меняются, разработчик может переопределить строку через set_useragent() |
| Оператор | Единого нет: библиотеку встраивают независимые сайты и приложения; fetcher-версию по данным Known Agents связывают с самим проектом SimplePie |
| Категория в энциклопедии TrafficVeil | Прочие краулеры и сервисы (легитимный) |
| Соблюдение robots.txt | По открытым данным — не соблюдается по умолчанию; правило в robots.txt воспринимайте как пожелание, а не как техническую защиту |
| Публичный список IP | Отсутствует — сверяйте по ASN и поведению, а не по одной строке UA |
2. Зачем SimplePie приходит на сайт
Есть два разных сценария, которые дают одинаковую строку в логах, но по-разному нагружают сайт.
- Регулярный опрос ленты. Стороннее приложение с библиотекой SimplePie внутри периодически перечитывает один и тот же URL фида — раз в 15–60 минут, иногда чаще. На большом числе подписчиков это дает устойчивый фон запросов к
/feed,/rss.xmlили страницам пагинации, откуда фид собирается динамически. - Разовая выборка под превью. Кто-то поделился ссылкой на конкретную страницу сайта в мессенджере или соцсети — SimplePie-fetcher заходит один раз, забирает title, description и картинку для карточки, дальше по сайту не идёт. Всплеск трафика тут коррелирует не с активностью бота, а с тем, насколько ссылка разошлась у людей.
Типичный практический кейс: ночью на сайте растёт RPS без единой конверсии, в access.log под этим временем преобладает simplepie на карточках товаров или пагинации — это первый сценарий, регулярный опрос фида сторонним агрегатором, а не разовая выборка превью. После включения rate-limit в TrafficVeil фоновая нагрузка спадает, а обычные пользователи и поисковые боты продолжают заходить без изменений.
3. Нагрузка и риски
Отдельной строки в публичной сводке top-bot TrafficVeil у simplepie может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на части доменов серии запросов выглядят как небольшие волны автоматизации без единой конверсии.
Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookies и сессий, концентрация на служебных или листовых страницах. Разовый fetcher-запрос под превью почти всегда безобиден — риск создаёт именно повторяющийся опрос одного и того же адреса с частотой выше разумной.
Полезный внешний ориентир: по данным Known Agents, на fetcher-трафик в целом (не только SimplePie) сейчас приходится около 2% всего веб-трафика, а сам SimplePie как fetcher чаще всего замечен на сайтах недвижимости, спортивных, новостных и IT-тематик — если ваш проект в одной из этих категорий, регулярные визиты этого агента ожидаемы и сами по себе не повод для тревоги.
4. Как найти SimplePie в логах
Ищите не «ботов вообще», а конкретный токен simplepie, и сразу смотрите соседей по семейству — совпадение по времени с другими UA из категории «Прочие краулеры и сервисы» подскажет, идёт ли речь об одном источнике или о нескольких.
# Базовый поиск
grep -i "simplepie" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "simplepie" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "simplepie" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность — регулярный фон или разовый всплеск
grep -i "simplepie" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отделить от похожих строк
grep -iE "simplepie|bot" /var/log/nginx/access.log | wc -l
Верификация. Строку User-Agent может подделать любой скрипт, а у SimplePie, в отличие от Googlebot или Bingbot, нет опубликованного способа официально подтвердить подлинность запроса — сам факт совпадения UA в логе для Known Agents считается лишь косвенным признаком, а не доказательством. Для решения allow/deny смотрите связку UA + ASN/IP + частота + набор URL:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для SimplePie
Важная поправка к общим ожиданиям: по открытым данным SimplePie не гарантированно следует правилам robots.txt, поэтому запись в файле стоит воспринимать как пожелание для добросовестных клиентов библиотеки, а не как техническую защиту от нежелательного трафика. Тем не менее прописать её стоит — часть интеграций это правило всё же уважает.
# Жёсткий запрет
User-agent: simplepie
Disallow: /
# Разрешить всё
User-agent: simplepie
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичные страницы
User-agent: simplepie
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Если агент игнорирует это правило и продолжает ходить в закрытые разделы — переходите к блокировке на уровне nginx/Apache или к запрету в TrafficVeil, не полагаясь только на robots.txt.
6. Блокировка вручную и через TrafficVeil
Nginx — полный запрет или ограничение частоты:
if ($http_user_agent ~* "simplepie") {
return 403;
}
limit_req_zone $binary_remote_addr zone=simplepie:10m rate=10r/m;
location / {
if ($http_user_agent ~* "simplepie") {
limit_req zone=simplepie burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} simplepie [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- Найдите simplepie в разделе ботов домена или в /system/bots;
- Для нежелательного сценария — категория «запретить», для мягкого — rate-limit;
- Полное разрешение (allow) имеет смысл, только если у превью-фетчера или у чужого агрегатора есть явная польза для сайта — например, реферальный трафик со страниц, где расшарили ссылку;
- После изменения сверьте логи: хиты SimplePie должны уйти в блок или лимит, а поисковые роботы Google и Yandex — остаться без изменений.
7. Что делать: короткий алгоритм
- Пользы нет, фон регулярный и заметный — Disallow в robots.txt + запрет на уровне сервера или TrafficVeil, не полагаясь только на первое;
- Видимая польза есть (например, ссылки на сайт активно расшаривают и превью-карточки важны для CTR) — Allow, при этом закрыть /admin, /cart, /account, /api;
- Нагрузка эпизодическая, но пиковая — начните с rate-limit, полный запрет держите как следующий шаг;
- Не блокируйте по маске
User-agent: *— так можно случайно закрыть доступ Googlebot и YandexBot; - Если решаете заблокировать — в подавляющем большинстве случаев для SEO это не критично, если только речь не о собственном фиде сайта, на который завязана внешняя аудитория.
8. С кем не путать SimplePie
| Бот / сосед | Кластер | UA | Комментарий |
| 2ip Bot | Прочие краулеры и сервисы | 2ip bot | легитимный |
| AccessStatus | Прочие краулеры и сервисы | accessstatus | легитимный |
| AddThis.com | Прочие краулеры и сервисы | addthis.com | легитимный, тоже относится к категории fetcher — собирает данные для кнопок шеринга |
| BazQux | Прочие краулеры и сервисы | bazqux | легитимный, RSS-ридер: в отличие от SimplePie-библиотеки, отдельный публичный сервис с собственным опросом подписанных фидов |
| AgentReadinessScanner | Прочие краулеры и сервисы | agentreadinessscanner | легитимный |
9. Стратегия allow/deny
| Ситуация | Действие |
| Регулярный опрос фида сторонним агрегатором без видимой пользы для сайта | Disallow в robots.txt + запрет в TrafficVeil (само правило в файле полагаться нельзя) |
| Разовые fetcher-запросы под превью при шеринге ссылок | Allow — трафик минимальный и разовый, блокировка портит вид ссылки в соцсетях и мессенджерах |
| Нужен доступ, но пики нерегулярны и высоки | Rate-limit на nginx или в TrafficVeil вместо полного запрета |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно, после проверки ASN |
| Подозрение на подделку UA | Не доверять строке UA целиком; смотреть IP/ASN, частоту и набор запрашиваемых URL |