Если фильтровать access.log по simpleasyncpagecrawler, часто всплывает целый пласт машинных хитов — это и есть SimpleAsyncPageCrawler. Честный итог проверки: это один из немногих случаев, когда за токеном действительно не удалось найти вообще ничего — ни компании, ни продукта, ни упоминания в каталогах ботов, ни на GitHub среди множества похожих по названию открытых .NET-библиотек для краулинга. Само имя по структуре («Simple» + «Async» + «PageCrawler») напоминает типовое название внутреннего класса из .NET-проекта, а не публичный бренд.
1. Что такое SimpleAsyncPageCrawler
В отличие от большинства ботов в этой энциклопедии, где хотя бы косвенно можно найти оператора через независимые каталоги, официальную документацию или упоминания в блоках обсуждений вебмастеров, для SimpleAsyncPageCrawler такого следа не нашлось нигде. Это не означает автоматически «вредоносный» — совпадение имени с типовым паттерном именования .NET-библиотек скорее говорит о небольшом, возможно внутреннем или учебном инструменте конкретного разработчика или небольшой компании, который никогда не публиковался широко и не попадал в общие реестры ботов.
| Название | SimpleAsyncPageCrawler |
| User-Agent / паттерн | simpleasyncpagecrawler |
| Оператор | Не установлен — ни в одном открытом источнике, каталоге ботов или технической документации упоминаний не найдено |
| Роль | Неизвестна — по названию похоже на простой асинхронный краулер страниц, вероятно, самописный или внутренний инструмент |
| Документация / ориентир | Отсутствует — first-party страницы для вебмастеров, официального сайта или упоминания в известных реестрах ботов не найдено |
| Список IP | ❌ Официального списка нет |
| robots.txt | Данных о соблюдении нет — при полном отсутствии публичной идентичности оператора рассчитывать на добросовестное поведение не стоит |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем SimpleAsyncPageCrawler приходит на сайт
Поскольку публичной информации об операторе и цели нет вообще, точную причину визита установить нельзя. Правдоподобные варианты: небольшой самописный инструмент кого-то, кто собирает данные для собственных нужд (мониторинг, исследование, личный проект); скрипт, который никогда не предназначался для широкого использования и не публиковал политику краулинга; или редкий случай инструмента, который сознательно не афиширует себя, полагаясь на то, что мало кто станет разбираться в происхождении малоизвестного токена.
- Какие зоны чаще трогает: публичные URL, иногда API и статику — конкретный паттерн для этого токена не задокументирован нигде;
- Что ищет: неизвестно — нет ни одного источника, который бы описывал цель сбора данных;
- Чем отличается от браузерного пользователя: нет нормальной сессии, как и у большинства автоматизированных клиентов.
Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — SimpleAsyncPageCrawler. В отличие от многих ботов этой энциклопедии, здесь нет смысла долго взвешивать «а вдруг это полезный сервис» — при полном отсутствии публичной идентичности решение стоит принимать быстро и по умолчанию в сторону ограничения.
3. Нагрузка и риски именно для SimpleAsyncPageCrawler
Отдельной строки в публичной сводке top-bot TrafficVeil у simpleasyncpagecrawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. Дополнительный риск именно здесь — полная непрозрачность: нет ни репутации, на которую можно опереться, ни официальной страницы, куда можно обратиться в случае проблем.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти SimpleAsyncPageCrawler в логах
Не ищите «просто ботов» — ищите конкретный токен simpleasyncpagecrawler и внимательно смотрите полную строку UA целиком на предмет любых дополнительных деталей.
# Базовый поиск
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log
# Полная строка UA — ищите любые дополнительные подсказки (версия, контакт, ссылка)
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk -F'"' '{print $6}' | sort -u
# Топ URL, которые вычитывает бот
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет и не может быть у токена без установленного оператора — единственный практический шаг здесь: посмотреть на IP через whois и попробовать определить хотя бы хостинг-провайдера или организацию, стоящую за запросом, поскольку никакого другого способа верификации не существует.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для SimpleAsyncPageCrawler
User-agent: simpleasyncpagecrawler
Disallow: /
Важно: раз пользы для сайта не задокументировано нигде, а оператор неизвестен, Disallow — разумный default без необходимости искать компромиссы. Поскольку соблюдение robots.txt не подтверждено, для гарантированного результата дублируйте запрет на уровне сервера.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "simpleasyncpagecrawler") {
return 403;
}
limit_req_zone $binary_remote_addr zone=simpleasyncpagecra:10m rate=10r/m;
location / {
if ($http_user_agent ~* "simpleasyncpagecrawler") {
limit_req zone=simpleasyncpagecra burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} simpleasyncpagecrawler [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите simpleasyncpagecrawler в ботах домена или в /system/bots;
- Поскольку идентичность оператора не установлена нигде — по умолчанию категория «запретить»;
- После изменения сверьте логи: хиты SimpleAsyncPageCrawler должны уйти в блок или лимит, а нужные поисковики остаться.
7. Рекомендации: что делать с SimpleAsyncPageCrawler
- Блокируйте по умолчанию — при полном отсутствии публичной идентичности оператора искать «явную пользу» бессмысленно, её попросту неоткуда взять;
- Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
- Если объём трафика значим — стоит зафиксировать IP и полную строку UA отдельно, на случай если позже появятся дополнительные данные об этом токене в открытых источниках;
- Что будет при блокировке: скорее всего ничего не теряете — задокументированной пользы для сайта нет.
8. С кем не путать SimpleAsyncPageCrawler
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный, но хотя бы известен оператор |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный, оператор известен (Area360) |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный, но оператор известен (Apple) |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный, но оператор известен |
9. Стратегия allow/deny для SimpleAsyncPageCrawler
| Ситуация | Действие |
| Стандартная ситуация — оператор не установлен нигде | Deny по умолчанию, на nginx/Apache/TrafficVeil |
| Появилась подтверждённая деловая причина (например, это оказался ваш собственный внутренний инструмент) | Allow точечно, с фиксацией источника решения |
| Нужно не задеть поисковые системы | Блокировать строго по токену simpleasyncpagecrawler, не трогать Googlebot/YandexBot |
| Подозрение на spoofing UA | Смысла немного — у токена и так нет установленной «настоящей» версии, с которой можно было бы сравнивать |
Частые вопросы
Кто оператор SimpleAsyncPageCrawler?
Почему название звучит так специфично технически?
Значит ли отсутствие информации, что бот точно вредоносный?
Стоит ли долго взвешивать «пользу» перед блокировкой этого токена?
Можно ли верифицировать подлинность запроса от этого токена?
Что делать, если позже появятся новые данные об этом токене?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.