Если фильтровать access.log по simpleasyncpagecrawler, часто всплывает целый пласт машинных хитов — это и есть SimpleAsyncPageCrawler. Честный итог проверки: это один из немногих случаев, когда за токеном действительно не удалось найти вообще ничего — ни компании, ни продукта, ни упоминания в каталогах ботов, ни на GitHub среди множества похожих по названию открытых .NET-библиотек для краулинга. Само имя по структуре («Simple» + «Async» + «PageCrawler») напоминает типовое название внутреннего класса из .NET-проекта, а не публичный бренд.
1. Что такое SimpleAsyncPageCrawler
В отличие от большинства ботов в этой энциклопедии, где хотя бы косвенно можно найти оператора через независимые каталоги, официальную документацию или упоминания в блоках обсуждений вебмастеров, для SimpleAsyncPageCrawler такого следа не нашлось нигде. Это не означает автоматически «вредоносный» — совпадение имени с типовым паттерном именования .NET-библиотек скорее говорит о небольшом, возможно внутреннем или учебном инструменте конкретного разработчика или небольшой компании, который никогда не публиковался широко и не попадал в общие реестры ботов.
| Название | SimpleAsyncPageCrawler |
| User-Agent / паттерн | simpleasyncpagecrawler |
| Оператор | Не установлен — ни в одном открытом источнике, каталоге ботов или технической документации упоминаний не найдено |
| Роль | Неизвестна — по названию похоже на простой асинхронный краулер страниц, вероятно, самописный или внутренний инструмент |
| Документация / ориентир | Отсутствует — first-party страницы для вебмастеров, официального сайта или упоминания в известных реестрах ботов не найдено |
| Список IP | ❌ Официального списка нет |
| robots.txt | Данных о соблюдении нет — при полном отсутствии публичной идентичности оператора рассчитывать на добросовестное поведение не стоит |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем SimpleAsyncPageCrawler приходит на сайт
Поскольку публичной информации об операторе и цели нет вообще, точную причину визита установить нельзя. Правдоподобные варианты: небольшой самописный инструмент кого-то, кто собирает данные для собственных нужд (мониторинг, исследование, личный проект); скрипт, который никогда не предназначался для широкого использования и не публиковал политику краулинга; или редкий случай инструмента, который сознательно не афиширует себя, полагаясь на то, что мало кто станет разбираться в происхождении малоизвестного токена.
- Какие зоны чаще трогает: публичные URL, иногда API и статику — конкретный паттерн для этого токена не задокументирован нигде;
- Что ищет: неизвестно — нет ни одного источника, который бы описывал цель сбора данных;
- Чем отличается от браузерного пользователя: нет нормальной сессии, как и у большинства автоматизированных клиентов.
Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — SimpleAsyncPageCrawler. В отличие от многих ботов этой энциклопедии, здесь нет смысла долго взвешивать «а вдруг это полезный сервис» — при полном отсутствии публичной идентичности решение стоит принимать быстро и по умолчанию в сторону ограничения.
3. Нагрузка и риски именно для SimpleAsyncPageCrawler
Отдельной строки в публичной сводке top-bot TrafficVeil у simpleasyncpagecrawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. Дополнительный риск именно здесь — полная непрозрачность: нет ни репутации, на которую можно опереться, ни официальной страницы, куда можно обратиться в случае проблем.
4. Как найти SimpleAsyncPageCrawler в логах
Не ищите «просто ботов» — ищите конкретный токен simpleasyncpagecrawler и внимательно смотрите полную строку UA целиком на предмет любых дополнительных деталей.
# Базовый поиск
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log
# Полная строка UA — ищите любые дополнительные подсказки (версия, контакт, ссылка)
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk -F'"' '{print $6}' | sort -u
# Топ URL, которые вычитывает бот
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет и не может быть у токена без установленного оператора — единственный практический шаг здесь: посмотреть на IP через whois и попробовать определить хотя бы хостинг-провайдера или организацию, стоящую за запросом, поскольку никакого другого способа верификации не существует.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для SimpleAsyncPageCrawler
User-agent: simpleasyncpagecrawler
Disallow: /
Важно: раз пользы для сайта не задокументировано нигде, а оператор неизвестен, Disallow — разумный default без необходимости искать компромиссы. Поскольку соблюдение robots.txt не подтверждено, для гарантированного результата дублируйте запрет на уровне сервера.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "simpleasyncpagecrawler") {
return 403;
}
limit_req_zone $binary_remote_addr zone=simpleasyncpagecra:10m rate=10r/m;
location / {
if ($http_user_agent ~* "simpleasyncpagecrawler") {
limit_req zone=simpleasyncpagecra burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} simpleasyncpagecrawler [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите simpleasyncpagecrawler в ботах домена или в /system/bots;
- Поскольку идентичность оператора не установлена нигде — по умолчанию категория «запретить»;
- После изменения сверьте логи: хиты SimpleAsyncPageCrawler должны уйти в блок или лимит, а нужные поисковики остаться.
7. Рекомендации: что делать с SimpleAsyncPageCrawler
- Блокируйте по умолчанию — при полном отсутствии публичной идентичности оператора искать «явную пользу» бессмысленно, её попросту неоткуда взять;
- Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
- Если объём трафика значим — стоит зафиксировать IP и полную строку UA отдельно, на случай если позже появятся дополнительные данные об этом токене в открытых источниках;
- Что будет при блокировке: скорее всего ничего не теряете — задокументированной пользы для сайта нет.
8. С кем не путать SimpleAsyncPageCrawler
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный, но хотя бы известен оператор |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный, оператор известен (Area360) |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный, но оператор известен (Apple) |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный, но оператор известен |
9. Стратегия allow/deny для SimpleAsyncPageCrawler
| Ситуация | Действие |
| Стандартная ситуация — оператор не установлен нигде | Deny по умолчанию, на nginx/Apache/TrafficVeil |
| Появилась подтверждённая деловая причина (например, это оказался ваш собственный внутренний инструмент) | Allow точечно, с фиксацией источника решения |
| Нужно не задеть поисковые системы | Блокировать строго по токену simpleasyncpagecrawler, не трогать Googlebot/YandexBot |
| Подозрение на spoofing UA | Смысла немного — у токена и так нет установленной «настоящей» версии, с которой можно было бы сравнивать |