Если фильтровать access.log по sbintuitionsbot, часто всплывает целый пласт машинных хитов — это и есть SBIntuitionsBot. SBIntuitionsBot принадлежит SB Intuitions — японской ИИ-компании, дочерней структуре SoftBank Group. Краулер собирает публичный веб-контент для разработки и обучения больших языковых моделей, ориентированных на японский язык и японский рынок. Оператор: SB Intuitions (SoftBank Group). Классификация: AI-краулер с открытой официальной документацией и подтверждённым соблюдением robots.txt — не анонимный сканер.
Что такое SBIntuitionsBot
| Параметр | Значение |
|---|---|
| Название | SBIntuitionsBot |
| User-Agent / паттерн | sbintuitionsbot |
| Оператор | SB Intuitions Corp. — дочерняя ИИ-компания SoftBank Group (Япония) |
| Роль | Сбор данных для разработки и обучения LLM, ориентированных на японский язык и рынок |
| Документация / ориентир | sbintuitions.co.jp/en/bot/ — официальная страница краулера с примером robots.txt-директивы |
| Список IP | ❌ Отдельного полного списка не публикуется; проверяйте ASN/поведение и не доверяйтесь только строке UA |
| robots.txt | Официально подтверждено соблюдение стандарта RFC 9309 (Robots Exclusion Protocol) — независимо подтверждается несколькими трекерами AI-ботов со статусом «Yes» |
| Пометка TrafficVeil | Прочие краулеры и сервисы; фактически — документированный AI-краулер с прозрачной политикой |
Зачем SBIntuitionsBot приходит на сайт
- Какие зоны чаще трогает: публичные URL, иногда API и статику — обычный краулинговый паттерн для сбора текстового контента
- Что ищет: контент для обучающих датасетов и информационного анализа в рамках разработки ИИ-моделей SB Intuitions
- Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн
Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по sbintuitionsbot показывает, что бот вычитывает разделы: публичные URL, иногда API и статику.
Нагрузка и риски
Отдельной строки в публичной сводке top-bot TrafficVeil у sbintuitionsbot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на служебных или листовых страницах.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти SBIntuitionsBot в логах
# Базовый поиск
grep -i "sbintuitionsbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "sbintuitionsbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "sbintuitionsbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "sbintuitionsbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Официального компактного списка IP SB Intuitions не публикует, поэтому строке UA напрямую доверять нельзя — теоретически её может присвоить себе любой скрипт. Смотрите связку UA + ASN/IP + частоту + набор URL:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для SBIntuitionsBot
# Жёсткий запрет (официальный пример от SB Intuitions)
User-agent: SBIntuitionsBot
Disallow: /
# Разрешить всё
User-agent: SBIntuitionsBot
Allow: /
# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: SBIntuitionsBot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: соблюдение robots.txt здесь официально подтверждено самим оператором — это один из немногих AI-краулеров, где Disallow действительно работает как заявлено, а не требует обязательного дублирования на сервере «на всякий случай».
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "sbintuitionsbot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=sbintuitionsbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "sbintuitionsbot") {
limit_req zone=sbintuitionsbot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} sbintuitionsbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите sbintuitionsbot / SBIntuitionsBot в ботах домена или в /system/bots
- Для нежелательного сценария — категория «запретить»; учитывая подтверждённое соблюдение robots.txt, этого обычно достаточно без серверного дублирования
- Allow только при явной пользе от SBIntuitionsBot
- После изменения сверьте логи: хиты SBIntuitionsBot должны уйти в блок/лимит, а нужные поисковики остаться
Рекомендации: что делать с SBIntuitionsBot
- Если пользы нет — Disallow/403 для sbintuitionsbot; учитывая подтверждённое соблюдение robots.txt, одного файла обычно достаточно
- Если польза есть (например, важна видимость в японоязычных AI-продуктах) — Allow только при явной пользе от SBIntuitionsBot
- Если нагрузка мешает — сначала rate-limit, затем полный запрет
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot - Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент
Частые вопросы
Кто на самом деле управляет SBIntuitionsBot?
Для чего SB Intuitions собирает данные с сайтов?
Действительно ли этот бот соблюдает robots.txt, или это только заявление?
Нужно ли дублировать блокировку SBIntuitionsBot на сервере, если Disallow уже прописан?
Публикует ли SB Intuitions официальный список IP для верификации?
Стоит ли разрешать SBIntuitionsBot сайтам без японской аудитории?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.