TrafficVeil
Боты 5 мин13 августа 2026 г.

SimpleAsyncPageCrawler: токен без единого следа в открытых источниках

Разбираем SimpleAsyncPageCrawler — редкий случай, когда за токеном не нашлось ни компании, ни продукта, ни упоминания ни в одном каталоге ботов. Объясняем, почему это, вероятно, самописный инструмент, а не публичный сервис, и почему deny по умолчанию оправдан.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое SimpleAsyncPageCrawler
  2. 2. Зачем SimpleAsyncPageCrawler приходит на сайт
  3. 3. Нагрузка и риски именно для SimpleAsyncPageCrawler
  4. 4. Как найти SimpleAsyncPageCrawler в логах
  5. 5. robots.txt для SimpleAsyncPageCrawler
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с SimpleAsyncPageCrawler
  8. 8. С кем не путать SimpleAsyncPageCrawler
  9. 9. Стратегия allow/deny для SimpleAsyncPageCrawler
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Если фильтровать access.log по simpleasyncpagecrawler, часто всплывает целый пласт машинных хитов — это и есть SimpleAsyncPageCrawler. Честный итог проверки: это один из немногих случаев, когда за токеном действительно не удалось найти вообще ничего — ни компании, ни продукта, ни упоминания в каталогах ботов, ни на GitHub среди множества похожих по названию открытых .NET-библиотек для краулинга. Само имя по структуре («Simple» + «Async» + «PageCrawler») напоминает типовое название внутреннего класса из .NET-проекта, а не публичный бренд.

1. Что такое SimpleAsyncPageCrawler

В отличие от большинства ботов в этой энциклопедии, где хотя бы косвенно можно найти оператора через независимые каталоги, официальную документацию или упоминания в блоках обсуждений вебмастеров, для SimpleAsyncPageCrawler такого следа не нашлось нигде. Это не означает автоматически «вредоносный» — совпадение имени с типовым паттерном именования .NET-библиотек скорее говорит о небольшом, возможно внутреннем или учебном инструменте конкретного разработчика или небольшой компании, который никогда не публиковался широко и не попадал в общие реестры ботов.

Название SimpleAsyncPageCrawler
User-Agent / паттерн simpleasyncpagecrawler
Оператор Не установлен — ни в одном открытом источнике, каталоге ботов или технической документации упоминаний не найдено
Роль Неизвестна — по названию похоже на простой асинхронный краулер страниц, вероятно, самописный или внутренний инструмент
Документация / ориентир Отсутствует — first-party страницы для вебмастеров, официального сайта или упоминания в известных реестрах ботов не найдено
Список IP ❌ Официального списка нет
robots.txt Данных о соблюдении нет — при полном отсутствии публичной идентичности оператора рассчитывать на добросовестное поведение не стоит
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

2. Зачем SimpleAsyncPageCrawler приходит на сайт

Поскольку публичной информации об операторе и цели нет вообще, точную причину визита установить нельзя. Правдоподобные варианты: небольшой самописный инструмент кого-то, кто собирает данные для собственных нужд (мониторинг, исследование, личный проект); скрипт, который никогда не предназначался для широкого использования и не публиковал политику краулинга; или редкий случай инструмента, который сознательно не афиширует себя, полагаясь на то, что мало кто станет разбираться в происхождении малоизвестного токена.

  • Какие зоны чаще трогает: публичные URL, иногда API и статику — конкретный паттерн для этого токена не задокументирован нигде;
  • Что ищет: неизвестно — нет ни одного источника, который бы описывал цель сбора данных;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, как и у большинства автоматизированных клиентов.

Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — SimpleAsyncPageCrawler. В отличие от многих ботов этой энциклопедии, здесь нет смысла долго взвешивать «а вдруг это полезный сервис» — при полном отсутствии публичной идентичности решение стоит принимать быстро и по умолчанию в сторону ограничения.

3. Нагрузка и риски именно для SimpleAsyncPageCrawler

Отдельной строки в публичной сводке top-bot TrafficVeil у simpleasyncpagecrawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. Дополнительный риск именно здесь — полная непрозрачность: нет ни репутации, на которую можно опереться, ни официальной страницы, куда можно обратиться в случае проблем.

4. Как найти SimpleAsyncPageCrawler в логах

Не ищите «просто ботов» — ищите конкретный токен simpleasyncpagecrawler и внимательно смотрите полную строку UA целиком на предмет любых дополнительных деталей.

# Базовый поиск
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log

# Полная строка UA — ищите любые дополнительные подсказки (версия, контакт, ссылка)
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk -F'"' '{print $6}' | sort -u

# Топ URL, которые вычитывает бот
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "simpleasyncpagecrawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет и не может быть у токена без установленного оператора — единственный практический шаг здесь: посмотреть на IP через whois и попробовать определить хотя бы хостинг-провайдера или организацию, стоящую за запросом, поскольку никакого другого способа верификации не существует.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для SimpleAsyncPageCrawler

User-agent: simpleasyncpagecrawler
Disallow: /

Важно: раз пользы для сайта не задокументировано нигде, а оператор неизвестен, Disallow — разумный default без необходимости искать компромиссы. Поскольку соблюдение robots.txt не подтверждено, для гарантированного результата дублируйте запрет на уровне сервера.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "simpleasyncpagecrawler") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=simpleasyncpagecra:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "simpleasyncpagecrawler") {
        limit_req zone=simpleasyncpagecra burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} simpleasyncpagecrawler [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите simpleasyncpagecrawler в ботах домена или в /system/bots;
  • Поскольку идентичность оператора не установлена нигде — по умолчанию категория «запретить»;
  • После изменения сверьте логи: хиты SimpleAsyncPageCrawler должны уйти в блок или лимит, а нужные поисковики остаться.

7. Рекомендации: что делать с SimpleAsyncPageCrawler

  • Блокируйте по умолчанию — при полном отсутствии публичной идентичности оператора искать «явную пользу» бессмысленно, её попросту неоткуда взять;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Если объём трафика значим — стоит зафиксировать IP и полную строку UA отдельно, на случай если позже появятся дополнительные данные об этом токене в открытых источниках;
  • Что будет при блокировке: скорее всего ничего не теряете — задокументированной пользы для сайта нет.

8. С кем не путать SimpleAsyncPageCrawler

Бот / сосед Кластер UA Комментарий
360Spider Прочие краулеры и сервисы 360spider нежелательный, но хотя бы известен оператор
A360-Search Прочие краулеры и сервисы a360-search нежелательный, оператор известен (Area360)
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный, но оператор известен (Apple)
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный, но оператор известен

9. Стратегия allow/deny для SimpleAsyncPageCrawler

Ситуация Действие
Стандартная ситуация — оператор не установлен нигде Deny по умолчанию, на nginx/Apache/TrafficVeil
Появилась подтверждённая деловая причина (например, это оказался ваш собственный внутренний инструмент) Allow точечно, с фиксацией источника решения
Нужно не задеть поисковые системы Блокировать строго по токену simpleasyncpagecrawler, не трогать Googlebot/YandexBot
Подозрение на spoofing UA Смысла немного — у токена и так нет установленной «настоящей» версии, с которой можно было бы сравнивать

Частые вопросы

Кто оператор SimpleAsyncPageCrawler?

Установить не удалось — ни в одном открытом источнике, техническом каталоге ботов или документации упоминаний об этом токене не найдено.

Почему название звучит так специфично технически?

Структура имени («Simple» + «Async» + «PageCrawler») напоминает типовое название внутреннего класса из .NET-проекта, что говорит скорее о самописном инструменте, чем о публичном бренде.

Значит ли отсутствие информации, что бот точно вредоносный?

Не обязательно — это может быть небольшой личный или внутренний инструмент, который просто никогда не публиковался широко и не попадал в общие реестры ботов.

Стоит ли долго взвешивать «пользу» перед блокировкой этого токена?

Нет смысла — при полном отсутствии публичной идентичности оператора оценивать пользу попросту не от чего оттолкнуться, поэтому deny по умолчанию — разумное быстрое решение.

Можно ли верифицировать подлинность запроса от этого токена?

Практически нет — раз нет ни официального списка IP, ни задокументированной «настоящей» версии бота, сравнивать не с чем.

Что делать, если позже появятся новые данные об этом токене?

Стоит зафиксировать полную строку UA и IP отдельно на будущее — если объём трафика значим, эта информация может пригодиться, когда о боте станет известно больше.

#SimpleAsyncPageCrawler#неопознанные боты#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.