Боты5 мин чтения·13 августа 2026 г.

ShapBot в логах: краулер Parallel, а не Google

Разбираем ShapBot — краулер компании Parallel, который индексирует сайты для их поисковых и extraction web API. Показываем разницу с Shap-User, официальный список IP, как найти бота в access.log и настроить allow/deny.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота ShapBot: нежелательный прочие краулеры и сервисы

ShapBot — краулер компании Parallel (parallel.ai): собирает публично доступный веб-контент для discovery и индексации, которые питают поисковые и extraction-возможности их web API. Это не Googlebot и не связан с поисковой выдачей Google — отдельный, самостоятельный индекс для продуктов и разработчиков, построенных поверх API Parallel.

1. Что такое ShapBot

Parallel — компания, которая предоставляет разработчикам web API для поиска, извлечения структурированных данных (extraction) и «глубокого исследования» (deep research) по открытому вебу; ShapBot — их системный краулер обнаружения и индексации, независимый от классических поисковиков. Официальная документация Parallel прямо рекомендует владельцам сайтов разрешать ShapBot ради видимости именно в их API и поисковых продуктах — это позиционируется как SEO-аналог для экосистемы Parallel, а не только как AI-тренировочный сбор.

Название ShapBot
User-Agent / паттерн ShapBot — полная строка Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ShapBot/0.1.0
Оператор Parallel (parallel.ai) — официально подтверждено, включая в каталоге Cloudflare Radar (категория «Search», доступ «Direct»)
Роль Обнаруживает и индексирует сайты для web API Parallel (поиск, extraction, deep research); неясно, используется ли собранный контент также для обучения моделей — в документации Parallel об этом явно не сказано
Документация / ориентир docs.parallel.ai/resources/crawler — официальная страница для вебмастеров с UA-строкой, ссылкой на список IP и контактами
Список IP ✅ Официально публикуется в docs.parallel.ai/resources/shapbot.json; в логах сторонних вебмастеров реальные IP из этого списка относятся к диапазонам Google Cloud (34.x.x.x, 104.x.x.x) — сверяйте актуальный список именно по shapbot.json, а не по разовым наблюдениям
robots.txt Официально поддерживается, токен для правила — User-agent: ShapBot
Пометка TrafficVeil По вашей сводке — порядка 0,6 тыс. запросов; не Googlebot

2. Зачем ShapBot приходит на сайт

Бот обходит сайт систематически и объёмно, поскольку питает индекс, который используют многие клиенты Parallel через API — это не точечная выборочная проверка, а полноценное индексирование значительной части сайта. По наблюдениям сторонних каталогов ботов, всплески активности чаще связаны с запросом конкретного клиента Parallel на их стороне, а не с чем-то происходящим на вашем сайте.

  • Какие зоны чаще трогает: публичные страницы сайта широко — краулер нацелен на полноценную индексацию, а не на отдельные разделы;
  • Что ищет: текстовый и структурированный контент для построения поискового индекса Parallel и для их extraction/deep research API;
  • Чем отличается от браузерного пользователя: нет сессии, обход регулярный и охватывающий, привязанный к внутреннему расписанию индексации Parallel, а не к интересу конкретного человека.

Отдельно стоит знать про соседний токен — Shap-User. Это не тот же бот: Shap-User идентифицирует запросы, которые Parallel делает по инициативе конкретного пользователя их продукта (когда кто-то через ассистента на базе Parallel запрашивает именно вашу страницу), а не фоновый систематический обход. Поведение принципиально другое: одиночные разовые запросы к конкретным URL, а не регулярный полный обход сайта.

3. Нагрузка и риски именно для ShapBot

По вашей сводке TrafficVeil — порядка 0,6 тыс. запросов, что для систематического индексирующего краулера умеренный объём. Поскольку ShapBot нацелен на широкий обход, а не на отдельные страницы, при большом сайте кумулятивная нагрузка за цикл индексации может быть заметнее, чем у ботов точечного назначения — но конкретной публичной информации о частоте или лимитах запросов Parallel не раскрывает.

Отдельный практический момент для аудита: неясно, используется ли собранный контент только для построения поискового индекса или также для обучения моделей — документация Parallel описывает индексацию для web API, но explicitно не адресует вопрос тренировки. Если для вас принципиально не отдавать контент под возможное AI-обучение, это стоит учитывать при решении allow/deny наравне с чисто «поисковой» мотивацией.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти ShapBot в логах

Ищите оба токена семейства — ShapBot (систематический обход) и Shap-User (разовые запросы по инициативе пользователей Parallel).

# Базовый поиск
grep -i "ShapBot" /var/log/nginx/access.log

# Отдельно проверить Shap-User — другой паттерн поведения
grep -i "Shap-User" /var/log/nginx/access.log | wc -l

# Топ URL, которые вычитывает бот
grep -i "ShapBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — сверьте с официальным shapbot.json
grep -i "ShapBot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "ShapBot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Подделать User-Agent может любой скрипт — сам оператор подтверждает, что совпадение UA само по себе не доказательство. У Parallel есть официальный и обновляемый список IP по адресу docs.parallel.ai/resources/shapbot.json — сверяйте запросы именно по нему, а наблюдаемые IP из этого списка относятся к инфраструктуре Google Cloud.

5. robots.txt для ShapBot

# Жёсткий запрет
User-agent: ShapBot
Disallow: /

# Разрешить (рекомендация самого оператора для видимости в их API)
User-agent: ShapBot
Allow: /

Важно: нужна видимость в Parallel API и их поисковых продуктах — Allow, дополнительно занесите IP из shapbot.json в allowlist. Не хотите отдавать контент в их индекс — Disallow + deny. Публичной формы для опт-аута нет — при проблемах с ботом Parallel просит писать на support@parallel.ai с адреса, привязанного к домену, о котором идёт речь (для верификации обращения); по вопросам об индексе или участии в Index by Parallel — index@parallel.ai.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "ShapBot") {
    return 403;
}

TrafficVeil

  • Найдите ShapBot в ботах домена или в /system/bots;
  • Если контент не должен попадать в индекс Parallel — категория «запретить»;
  • Если нужна видимость в их web API — Allow + добавить актуальные IP из shapbot.json в allowlist;
  • После изменения сверьте логи и убедитесь, что видимость в Google Search не изменилась — это независимый краулер, не связанный с Google.

7. Рекомендации: что делать с ShapBot

  • Нужна видимость в Parallel APIs — Allow + IP из shapbot.json;
  • Не хотите отдавать контент в их индекс (в том числе из-за неясности с возможным использованием для обучения моделей) — Disallow + deny;
  • На Google не влияет — это отдельная, независимая от Google экосистема поиска и API;
  • Отдельно решайте по Shap-User — это не систематический обход, а запросы по инициативе конкретных пользователей продуктов Parallel, и логика allow/deny для него может быть другой;
  • Публичного опт-аута нет — при спорных случаях писать напрямую на support@parallel.ai с домена, о котором идёт речь.

8. С кем не путать ShapBot

Бот / сосед Кластер UA Комментарий
Shap-User AI-агенты shap-user тот же оператор (Parallel), но запросы по инициативе пользователя, а не систематический обход
AI2Bot-DeepResearchEval AI-агенты ai2bot-deepresearcheval другой оператор (Ai2), но аналогичная логика — агентный фетчер под живой запрос, не тренировочный краулер
ApifyBot AI-краулеры для обучения моделей apifybot другой оператор — сбор контента для AI/RAG-инфраструктуры сторонних клиентов Apify
Googlebot Поисковые системы googlebot основной краулер Google — полностью независим от ShapBot и Parallel

9. Стратегия allow/deny для ShapBot

Ситуация Действие
Нужна видимость в web API и поисковых продуктах Parallel Allow + добавить IP из shapbot.json в allowlist
Не хотите участвовать в индексе Parallel Disallow + deny в nginx/TrafficVeil
Встретился Shap-User Решать отдельно — это запросы по инициативе пользователя, а не систематический обход
Важно не отдавать контент под возможное AI-обучение Учитывать как отдельный фактор при Disallow — документация Parallel явно не описывает использование данных для тренировки
Подозрение на spoofing UA Сверять с официальным shapbot.json, не доверять только строке UA

Частые вопросы

ShapBot связан с Google или влияет на позиции в поиске?
Нет, это полностью независимый краулер компании Parallel для их собственных поисковых и extraction API, никак не связанный с индексацией в Google.
Чем Shap-User отличается от ShapBot?
ShapBot систематически обходит сайт целиком для построения индекса, а Shap-User делает разовые запросы к конкретным страницам по инициативе пользователей продуктов Parallel.
Публикует ли Parallel официальный список IP-адресов краулера?
Да, актуальный список доступен по адресу shapbot.json в документации Parallel, и на него стоит ориентироваться вместо разовых наблюдений из логов других сайтов.
Использует ли Parallel собранный контент для обучения AI-моделей?
В официальной документации это явно не описано — там говорится только про построение поискового индекса для web API, поэтому вопрос об обучении моделей остаётся открытым.
Что теряет сайт при блокировке ShapBot?
Видимость именно в поисковых и extraction продуктах Parallel — на позиции в Google Search блокировка не влияет никак.
Как связаться с Parallel по вопросам, связанным с ShapBot?
Через support@parallel.ai для проблем с самим краулером или index@parallel.ai по вопросам об индексе — при этом стоит писать с адреса, привязанного к домену, о котором идёт речь, для верификации.
#ShapBot#Parallel#Shap-User#AI-краулеры#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil