По данным реальной аналитики бот-трафика, Amazonbot — один из самых заметных краулеров в современном интернете: согласно статистике trafficveil за март–май 2026 года, он занял 6-е место среди всех ботов с долей 5.3% от общего трафика — обходя по объёму такие известные имена, как AppleBot, BingBot и GoogleBot. Понимание природы и многоцелевого назначения этого бота критически важно для каждого владельца сайта.
1. Что такое Amazonbot
1.1 User-Agent строки
# Основная строка Amazonbot:
Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5
(KHTML, like Gecko) Version/8.0.2 Safari/600.2.5
(Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot)
# Amzn-SearchBot (отдельный бот для поисковых сервисов):
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible;
Amzn-SearchBot/0.1) Chrome/119.0.6045.214 Safari/537.36
1.2 Семейство ботов Amazon — это не один краулер
Как и у Semrush, у Amazon целое семейство специализированных краулеров под разные задачи. Согласно официальной документации Amazon Developer Portal, как минимум три из них напрямую касаются владельцев обычных сайтов:
| User-Agent | Назначение | Участвует в обучении AI? |
|---|---|---|
Amazonbot |
Основной краулер — Alexa, поиск Amazon, Rufus, обучение AI-моделей | ✔ Да, по последним данным 2026 года |
Amzn-SearchBot |
Улучшение поисковых функций Amazon-продуктов (включая ответы Alexa) | ✖ Официально нет — задокументировано явно |
Amzn-User |
Обработка пользовательских запросов в реальном времени (например, ответ Alexa на вопрос, требующий актуальной информации) | ✖ Нет — user-triggered fetcher |
По неофициальным данным сторонних агрегаторов, Amazon в общей сложности управляет десятками отдельных автоматизированных агентов под разные продуктовые направления (ритейл-площадка, AWS, рекламные технологии, голосовые сервисы), но именно Amazonbot, Amzn-SearchBot и Amzn-User — основные краулеры, с которыми сталкиваются обычные веб-мастера.
1.3 Эволюция назначения: от Alexa до AI-обучения
| Год | Назначение |
|---|---|
| 2022 (запуск) | Питание голосовых ответов Alexa |
| 2023–2024 | Расширение на поиск товаров и рекомендации Amazon |
| 2024 (запуск Rufus) | Данные для AI-шопинг-ассистента Rufus |
| 2025–2026 | Участие в обучении внутренних AI-моделей (AWS AI, Amazon Bedrock) |
Важный нюанс для классификации: сторонние агрегаторы бот-трафика по состоянию на 2026 год классифицируют основной Amazonbot как training crawler — краулер для обучения моделей, поведение которого принципиально отличается от классического поискового бота: контент не возвращает пользователей на ваш сайт (нет referral-трафика и атрибуции), а данные используются один раз и «впекаются» в модель.
1.4 Amzn-SearchBot — важное явное заявление Amazon
Отдельно стоит выделить официальную формулировку Amazon для Amzn-SearchBot: «Amzn-SearchBot does not crawl content for generative AI model training» («Amzn-SearchBot не обходит контент для обучения генеративных AI-моделей»). Это прямое и явное разграничение от основного Amazonbot — Amazon специально подчёркивает, что данный конкретный бот используется исключительно для улучшения поисковых функций (включая ответы Alexa), а не для AI-обучения.
2. Как работает Amazonbot
2.1 Этапы обхода
- Amazonbot проверяет robots.txt сайта перед началом обхода и следует указанным в нём правилам.
- Скачивает HTML-страницы, включая метаданные.
- Рендерит JavaScript-тяжёлые страницы — аналогично современным браузерам.
- Извлекает текстовый контент, структурированные данные, информацию о товарах и ценах.
- Собранные данные распределяются по различным сервисам Amazon: Alexa, поиск товаров, Rufus, конвейеры обучения AI-моделей.
2.2 Что Amazonbot анализирует
| Элемент | Для чего используется | Важность |
|---|---|---|
| Текстовый контент страницы | База знаний для ответов Alexa, обучение AI | ⭐⭐⭐⭐⭐ Критически важно |
| Структурированные данные (Schema.org) | Точность ответов, извлечение фактов | ⭐⭐⭐⭐ Очень важно |
| Информация о товарах и ценах | Улучшение поиска и рекомендаций Amazon | ⭐⭐⭐⭐⭐ Критически важно для e-commerce |
| Сравнительные обзоры и экспертный контент | Данные для Rufus (покупательские советы) | ⭐⭐⭐⭐ Очень важно |
| Метаданные страницы | Контекст и атрибуция источника | ⭐⭐⭐ Важно |
| JavaScript-контент | Полный рендеринг, как у современного браузера | ⭐⭐⭐⭐ Очень важно |
2.3 Alexa и атрибуция в голосовых ответах
Особенность голосового поиска: в отличие от текстовой выдачи, где пользователь видит список ссылок, Alexa обычно даёт один развёрнутый ответ. Если контент вашего сайта выбран в качестве источника, Alexa может явно сослаться на вас фразой вида «по данным [ваш сайт]...» — это создаёт узнаваемость бренда, но не гарантирует прямого перехода пользователя на сайт, как в случае с традиционной поисковой выдачей.
2.4 Частота визитов: разная природа разных задач
| Подтип / сценарий | Характер активности |
|---|---|
| Amazonbot (обучение AI) | Периодические волны — резкие всплески активности вокруг выпуска новых версий моделей, затем затишье между циклами обучения |
| Amzn-SearchBot | Более равномерный, систематический обход для поддержания актуальности поисковых данных |
| Amzn-User | Точечные запросы — срабатывает только когда конкретный пользователь Alexa задаёт вопрос, требующий свежих данных |
3. Соотношение трафика и реальной ценности для сайта
3.1 Главная особенность training-краулеров: отсутствие отдачи
Принципиальное отличие Amazonbot (в его роли обучающего краулера) от традиционных поисковых ботов — отсутствие реферального трафика. Согласно данным сторонней аналитики бот-трафика, на каждые 1000 запросов Amazonbot сайт получает в среднем всего около 0.23 реальных человеческих визита обратно. Контент потребляется один раз, «впекается» в модель и впоследствии проявляется в её ответах — как правило, без цитирования и без перехода пользователя на исходный сайт.
3.2 Контекст распространённости блокировки
По данным агрегаторов, отслеживающих практику блокировки ботов на крупных сайтах, по состоянию на середину 2026 года порядка 13% ведущих сайтов интернета блокируют Amazonbot в своих файлах robots.txt — заметная, хотя не доминирующая доля, отражающая растущую осторожность издателей по отношению к training-краулерам.
4. Нагрузка на сервер
4.1 Сравнение интенсивности
По общим оценкам индустрии, Amazonbot ведёт себя умереннее многих агрессивных AI-краулеров (таких как Bytespider). Большинство владельцев сайтов сообщают о разумной частоте запросов и минимальном влиянии на производительность сервера в обычном режиме.
4.2 Контекст из реальных данных pbnshield
Реальные продакшен-данные дают более тревожную картину масштаба, чем общие оценки «умеренности» бота. За период март–май 2026 года AmazonBot сгенерировал 5 519 234 запроса — 6-е место среди всех 100 зафиксированных ботов с долей 5.3%, демонстрируя устойчивый рост каждый месяц:
| Месяц | Запросов AmazonBot | Динамика |
|---|---|---|
| Март 2026 | 399 312 | — |
| Апрель 2026 | 1 793 668 | 📈 рост ×4.5 |
| Май 2026 | 3 326 254 | 📈 рост ×1.9 |
Это означает, что AmazonBot обгоняет по объёму AppleBot (4.5%), BingBot (3.6%) и GoogleBot (2.2%) — данные опровергают распространённое представление о том, что Amazonbot — некий второстепенный, малозаметный краулер. На практике это один из самых активных ботов в современном интернете.
4.3 Особенность поведения: волны вокруг релизов моделей
Если в логах наблюдается резкий, необъяснимый скачок активности Amazonbot, а затем спад — это типичное поведение training-краулера. Активность концентрируется вокруг циклов обучения новых версий AI-моделей Amazon, а не распределена равномерно во времени.
5. Обнаружение в логах
5.1 Как выглядит запись
# Основной Amazonbot:
52.94.236.248 - - [09/May/2026:13:20:11 +0000] \
"GET /reviews/best-laptops-2026/ HTTP/1.1" \
200 32480 "-" \
"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5 \
(KHTML, like Gecko) Version/8.0.2 Safari/600.2.5 \
(Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot)"
# Amzn-SearchBot:
52.94.236.250 - - [09/May/2026:13:21:00 +0000] \
"GET /product-comparison/ HTTP/1.1" \
200 28120 "-" \
"Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; \
Amzn-SearchBot/0.1) Chrome/119.0.6045.214 Safari/537.36"
5.2 Аналитика через grep
Найти все запросы Amazon-ботов:
grep -iE 'Amazonbot|Amzn-SearchBot|Amzn-User' /var/log/nginx/access.log
Разделить по подтипам:
echo "=== Amazonbot (training/AI) ==="
grep -i 'Amazonbot' access.log | grep -v 'Amzn-'
echo "=== Amzn-SearchBot ==="
grep -i 'Amzn-SearchBot' access.log
echo "=== Amzn-User ==="
grep -i 'Amzn-User' access.log
Подсчитать количество запросов:
grep -i 'amazonbot\|amzn-' access.log | wc -l
Топ обходимых страниц:
grep -i 'Amazonbot' access.log \
| awk '{print $7}' | sort | uniq -c | sort -nr | head -30
Поиск резких всплесков активности (training-волны):
grep -i 'Amazonbot' access.log \
| awk '{print $4}' | cut -d: -f1 | tr -d '[' \
| sort | uniq -c
HTTP-коды ответов:
grep -i 'Amazonbot' access.log \
| awk '{print $9}' | sort | uniq -c | sort -nr
Live-мониторинг:
tail -f /var/log/nginx/access.log | grep --line-buffered -iE 'Amazonbot|Amzn-'
5.3 Верификация подлинности
#!/bin/bash
# Проверка: настоящий ли Amazonbot?
# IP должен резолвиться в поддомен Amazon
IP=$1
HOST=$(host $IP | awk '{print $NF}')
if [[ $HOST == *amazon.com* ]] || [[ $HOST == *amazonbot* ]]; then
FWD=$(host $HOST | awk '{print $NF}')
if [[ $FWD == $IP ]]; then
echo "✔ Настоящий Amazonbot: $IP → $HOST"
else
echo "✖ Fake Amazonbot (DNS mismatch): $IP"
fi
else
echo "✖ Fake Amazonbot (нет подтверждающей PTR записи): $IP"
fi
Официальные опубликованные списки IP (для каждого подтипа отдельно):
# IP-адреса основного Amazonbot:
https://developer.amazon.com/amazonbot/ip-addresses/
# IP-адреса Amzn-SearchBot (отдельный список!):
https://developer.amazon.com/amazonbot/searchbot-ip-addresses/
# ВАЖНО: Amazonbot НЕ использует диапазоны AWS.
# Его IP-адреса отдельны от облачной инфраструктуры Amazon Web Services —
# это частая причина ошибочной идентификации при ручной проверке.
6. Управление Amazonbot
6.1 ⚠ Критическая особенность: задержка обновления robots.txt до 30 дней
Самый важный практический момент, отличающий Amazon-ботов от большинства других краулеров: согласно данным сторонних агрегаторов, отслеживающих поведение Amazon-ботов, обновление правил robots.txt может занять до 30 дней, прежде чем боты Amazon начнут следовать новым директивам. Это значительно дольше, чем у большинства других крупных краулеров, и должно учитываться при планировании изменений в стратегии доступа.
6.2 Базовая блокировка через robots.txt
# Блокировать основной Amazonbot полностью:
User-agent: Amazonbot
Disallow: /
# Блокировать Amzn-SearchBot отдельно:
User-agent: Amzn-SearchBot
Disallow: /
# Блокировать Amzn-User:
User-agent: Amzn-User
Disallow: /
6.3 Особенность поведения Amzn-SearchBot при отсутствии явных правил
Официально задокументированная особенность: если в robots.txt не упомянут Amzn-SearchBot, но при этом разрешены другие поисковые боты (например, Googlebot), то Amzn-SearchBot будет обходить сайт согласно правилам, заданным для других поисковых ботов. Это означает, что простое отсутствие явного правила не равно блокировке — нужно либо явно разрешить, либо явно запретить.
# Если хотите явно разрешить только Amzn-SearchBot, но не основной Amazonbot
# (например, чтобы попадать в ответы Alexa, но не участвовать в обучении AI):
User-agent: Amzn-SearchBot
Allow: /
User-agent: Amazonbot
Disallow: /
User-agent: Amzn-User
Allow: /
# Amzn-User отвечает на прямые запросы пользователей Alexa в реальном времени —
# блокировка может ухудшить актуальность голосовых ответов о вашем контенте
6.4 Точечная блокировка разделов
User-agent: Amazonbot
Disallow: /private/
Disallow: /admin/
Disallow: /checkout/
Allow: /
6.5 Блокировка через .htaccess (Apache)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} "Amazonbot|Amzn-SearchBot|Amzn-User" [NC]
RewriteRule .* - [F,L]
6.6 Блокировка через Nginx
map $http_user_agent $is_amazon_bot {
default 0;
"~*Amazonbot" 1;
"~*Amzn-SearchBot" 1;
"~*Amzn-User" 1;
}
if ($is_amazon_bot) {
return 403;
}
# Rate limiting вместо полной блокировки (предпочтительно для training-волн):
limit_req_zone $is_amazon_bot zone=amazon_limit:10m rate=2r/s;
location / {
limit_req zone=amazon_limit burst=10 nodelay;
}
6.7 Контакт для вебмастеров
# Если у вас вопросы о поведении конкретного бота Amazon
# (включая случаи кажущегося несоблюдения robots.txt):
Email: amazonbot@amazon.com
# Обязательно укажите релевантное доменное имя в сообщении
7. Стоит ли блокировать Amazonbot: ключевые соображения
| Фактор | За разрешение доступа | За блокировку |
|---|---|---|
| Атрибуция в Alexa | Возможность упоминания бренда в голосовых ответах | Без гарантии реального трафика взамен |
| Видимость в Rufus | Появление в рекомендациях AI-шопинг-ассистента | Конкуренты получают те же данные |
| Участие в обучении AI | Потенциальное косвенное влияние на будущие ответы моделей | Контент используется без компенсации и без указания авторства |
| SEO-влияние | Не относится — Amazonbot не передаёт данные в Google/Яндекс | Блокировка не повлияет на позиции в поиске |
| Нагрузка на сервер | В целом умеренная, но возможны training-волны | Снижение нагрузки в периоды активного обучения моделей |
Практический вывод: блокировка AI-краулеров для обучения моделей (как Amazonbot в этой роли) практически не влияет на позиции в поисковых системах — этот трафик не имеет отношения к индексации Google или Яндекса. Однако если контент вашего сайта используется для обучения моделей, которые впоследствии формируют AI-генерируемые ответы, блокировка может снизить ваше представление в этих ответах в будущем — это решение зависит от ваших приоритетов в вопросах авторства и компенсации за использование контента.
8. Диагностика проблем
8.1 Типичные проблемы и решения
| Проблема | Причина | Решение |
|---|---|---|
| Изменения в robots.txt не действуют сразу | Известная задержка обновления — до 30 дней | Подождать, заранее планировать изменения с запасом времени |
| Бот продолжает обходить сайт несмотря на Disallow | Возможна задержка применения правила или иной подтип бота | Проверить, какой именно подтип (Amazonbot/Amzn-SearchBot/Amzn-User) обходит сайт |
| Резкий скачок трафика без видимой причины | Training-волна перед релизом новой AI-модели | Это ожидаемое явление, временное — применить rate limiting при необходимости |
| Подозрение на подделку User-Agent | IP не из официального диапазона Amazon | Сверить с https://developer.amazon.com/amazonbot/ip-addresses/ |
| Путаница с диапазонами AWS | Ошибочное предположение, что Amazonbot использует AWS IP | Amazonbot использует отдельные, не связанные с AWS диапазоны |
8.2 Пошаговая диагностика
Шаг 1 — Проверить robots.txt:
curl https://example.com/robots.txt | grep -iE 'amazonbot|amzn-'
Шаг 2 — Симулировать запрос:
curl -A "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/600.2.5 \
(KHTML, like Gecko) Version/8.0.2 Safari/600.2.5 \
(Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot)" \
-I https://example.com/
# Ожидается: HTTP/1.1 200 OK (или 403, если намеренно блокируете)
Шаг 3 — Сверить IP с официальным списком:
curl -s https://developer.amazon.com/amazonbot/ip-addresses/ \
> amazonbot_ips.txt 2>/dev/null
grep "ваш_подозрительный_IP" amazonbot_ips.txt
Шаг 4 — Связаться с поддержкой при долгой проблеме:
Email: amazonbot@amazon.com
# Указать домен и подробное описание проблемы
9. Amazonbot vs другие крупные training-краулеры
| Краулер | Компания | Доля в данных pbnshield (март–май 2026) | Использует AWS IP? | Задержка обновления robots.txt |
|---|---|---|---|---|
| Amazonbot | Amazon | 5.3% (#6 место) | ✖ Нет, отдельные диапазоны | До 30 дней |
| GPTBot | OpenAI | 7.1% (#5 место) | — | Обычно быстрее |
| Bytespider | ByteDance | 8.4% (#2 место) | — | Известен агрессивным поведением |
| ClaudeBot | Anthropic | 3.6% (#9 место) | — | Обычно быстрее |
| AppleBot | Apple | 4.5% (#7 место) | — | Стандартная практика |
| Meta ExternalAgent | Meta | 26.6% (#1 место) | — | Стандартная практика |
Ключевой вывод из сравнения: Amazonbot занимает заметное место среди крупнейших training-краулеров, обходя по объёму GPTBot и ClaudeBot, но уступая Meta ExternalAgent и Bytespider. Особенность именно Amazon — нетипично долгая задержка применения изменений robots.txt, которую важно учитывать при планировании.
10. Рекомендуемая стратегия
✔ Главный принцип: Amazonbot — это не единый бот с единой целью, а семейство краулеров с разным назначением: от классического поиска (Amzn-SearchBot) до обучения AI-моделей (основной Amazonbot). Решение о блокировке должно приниматься осознанно для каждого подтипа, с учётом аномально долгой задержки применения правил.
| Задача | Решение |
|---|---|
| Появляться в ответах Alexa, не участвуя в обучении AI | Разрешить Amzn-SearchBot, заблокировать Amazonbot |
| Полностью исключить контент из AI-обучения Amazon | Заблокировать все три подтипа явно |
| Снизить нагрузку без полной блокировки | Rate limiting на уровне Nginx вместо Disallow |
| Защитить чувствительные разделы | Точечный Disallow для /admin/, /checkout/ и т.п. |
| Спланировать изменение правил доступа | Учесть задержку до 30 дней на применение новых правил |
| Верифицировать подлинность бота | Сверка с официальными IP-списками (раздельными для каждого подтипа) |
| Не путать с AWS-инфраструктурой | Amazonbot использует отдельные IP, не связанные с облаком AWS |
| Решить нестандартную проблему | Написать на amazonbot@amazon.com с указанием домена |
Полезные ссылки: Официальная документация Amazonbot | IP-адреса Amazonbot | IP-адреса Amzn-SearchBot | Cloudflare Radar — Amazonbot