Amzn-SearchBot — краулер Amazon для поисковых сценариев продуктов Amazon (в т.ч. Alexa и связанные search experiences). По официальной документации он не краулит контент для обучения generative AI — это отдельная роль у Amazonbot. Блокировка SearchBot снижает шанс появления контента в Amazon search surfaces, но не является полным opt-out от AI-training Amazon.
Что такое Amzn-SearchBot
| Параметр | Значение |
|---|---|
| User-Agent (токен) | Amzn-SearchBot |
| Пример UA | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amzn-SearchBot/0.1) Chrome/W.X.Y.Z Safari/537.36 |
| Оператор | Amazon |
| Назначение | Улучшение search experiences (Alexa и др.); не generative AI training |
| Документация | developer.amazon.com/amazonbot |
| Контакт | amazonbot@amazon.com — для вопросов по конкретным случаям краулинга |
| IP list | searchbot-ip-addresses (отдельный официальный список именно для SearchBot) |
| robots.txt | Да (Allow/Disallow); Crawl-delay не поддерживается |
| Кэш robots | До ~30 дней; изменения обычно применяются в течение ~24ч. Если файл не удаётся скачать вовсе — бот ведёт себя так, будто robots.txt не существует, то есть обходит без ограничений |
| Meta-теги | Учитывают noindex / noarchive / none; noarchive относится именно к использованию в model training |
Финансовый стимул, о котором редко упоминают
Помимо технической стороны, у разрешения Amazonbot (родственного бота, не самого SearchBot) есть конкретная коммерческая программа: если сайт разрешает Amazonbot в robots.txt, он может претендовать на участие в Amazon Content Partners — программе, которая даёт независимым создателям контента прибавку +1% к партнёрской комиссии на подходящие продажи, бесплатные хостинг-кредиты и инструменты управления AI-трафиком. Для площадок, работающих с партнёрскими программами Amazon, это прямой финансовый аргумент в пользу осознанного allow, а не просто «нейтральной терпимости» к обходу.
Семья Amazon: три бота
| Бот | Роль | AI training | IP list |
|---|---|---|---|
| Amazonbot | Продукты/сервисы Amazon | Может использоваться для AI models | отдельный feed |
| Amzn-SearchBot | Search / Alexa eligibility | Нет (по docs) | searchbot-ip-addresses |
| Amzn-User | Live fetch по запросу пользователя | Нет (по docs) | отдельный feed |
Стратегия: нужен Alexa/search, но не training — Allow SearchBot (+ User), Disallow Amazonbot. Режете SearchBot — теряете search eligibility, training этим не закрываете. Нюанс, подтверждённый официальной документацией дословно: если в robots.txt нет отдельных правил для Amzn-SearchBot, но разрешены другие search-боты, SearchBot будет следовать директивам, заданным для этих «других search-ботов» — то есть отсутствие явного правила не означает автоматического запрета.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка
По сводке TrafficVeil (март–июнь 2026, июнь по 14.06) паттерн amzn-searchbot — порядка 90 тысяч запросов (март 0, апрель ~67 тыс., май ~16 тыс., июнь ~7 тыс.). Резкий спад после апреля стоит сверить по свежим месяцам.
Логи и IP
grep -i "Amzn-SearchBot" /var/log/nginx/access.log
# сверяйте IP с официальным searchbot-ip-addresses
curl -sL https://developer.amazon.com/amazonbot/searchbot-ip-addresses | head
Верификация через reverse DNS
Официальный метод точнее, чем просто «домен amazon где-то в строке»: имя должно резолвиться конкретно в поддомен crawl.amazonbot.amazon, а затем forward-проверка должна вернуть тот же исходный IP:
host 12.34.56.789
# ожидается: ...crawl.amazonbot.amazon
host 12-34-56-789.crawl.amazonbot.amazon
# должен вернуть тот же исходный IP
robots.txt
# Только search (Alexa), без training-краулера
User-agent: Amazonbot
Disallow: /
User-agent: Amzn-SearchBot
Allow: /
User-agent: Amzn-User
Allow: /
# Убрать и search
User-agent: Amzn-SearchBot
Disallow: /
Crawl-delay игнорируется. Для тонкой настройки на уровне страниц — meta noarchive / noindex по документации Amazon.
Сервер / TrafficVeil
if ($http_user_agent ~* "Amzn-SearchBot") {
return 403;
}
Разделяйте Amazonbot / SearchBot / Amzn-User в правилах — у них разное назначение и разные последствия блокировки. Верификация: UA + IP из официального feed, в идеале дополненные reverse DNS проверкой на crawl.amazonbot.amazon.
Стратегия
| Цель | Действие |
|---|---|
| Alexa/search без AI-training | Allow Amzn-SearchBot; Disallow Amazonbot |
| Участие в Amazon Content Partners | Allow Amazonbot осознанно, проверив условия программы |
| Полный opt-out Amazon crawl | Disallow все три UA |
| Спуф | IP не из searchbot-ip-addresses или провал reverse DNS на crawl.amazonbot.amazon |
- AhrefsBot: полное руководство
- Googlebot: полное руководство
- Googlebot-Image
- Googlebot-News
- Googlebot-Video
- Google AdsBot
- Storebot-Google
- Mediapartners-Google (AdSense)
- Feedfetcher-Google
- APIs-Google
- Google-Read-Aloud
- Google-Site-Verification и InspectionTool
- Bingbot (MSN Bot)
- YandexBot
- YandexMetrika
- Yandex Userproxy
- MJ12bot
- SemrushBot
- Amazonbot
- DotBot
- FacebookBot
- Yandex Direct Fetcher
- Anthropic AI
- Cohere AI
- llmstxtscan
- HetrixTools
- ArchiveTeam ArchiveBot
- HeadlessChrome
- crawler_eb
- EECS498
- IntelX
- statdom.ru
- Website-info.net-Robot
Частые вопросы
Чем Amzn-SearchBot принципиально отличается от Amazonbot?
Что случится, если запретить только Amazonbot, оставив SearchBot разрешённым?
Какая финансовая программа связана с разрешением Amazonbot?
Что произойдёт, если в robots.txt нет отдельного правила для Amzn-SearchBot?
Как точно проверить, что запрос действительно от Amazon, а не подделка?
Что будет, если robots.txt сайта временно недоступен для скачивания?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.