Applebot-Extended — специальный токен для robots.txt, с помощью которого владелец сайта управляет использованием уже собранного Applebot контента для обучения foundation models Apple. Это принципиально отличает его от обычных веб-краулеров.
Applebot-Extended сам не обходит веб-страницы. У него нет отдельной задачи скачивать HTML, изображения или другие ресурсы сайта. Реальный обход выполняет Applebot — поисковый краулер Apple.
| Параметр | Значение |
|---|---|
| Название | Applebot-Extended |
| Оператор | Apple |
| Тип | robots.txt control token |
| Отдельный веб-краулер | Нет |
| Отдельный HTTP User-Agent | Нет |
| Токен robots.txt | Applebot-Extended |
| Фактический crawler | Applebot |
| Назначение | Управление использованием данных Applebot для обучения foundation models Apple |
| Влияние на поисковые функции Apple | Запрет Applebot-Extended сам по себе не запрещает Applebot |
| Категория TrafficVeil | AI training controls / robots.txt policies |
Applebot и Applebot-Extended — в чём разница
Эти два имени нельзя использовать как взаимозаменяемые.
| Applebot | Applebot-Extended | |
|---|---|---|
| Что это | Веб-краулер Apple | Токен управления использованием данных |
| Делает HTTP-запросы | Да | Нет как отдельный crawler |
| Появляется в access.log | Да | Не должен появляться как отдельный официальный crawler |
| Связан с поиском | Да | Не управляет поисковым crawling напрямую |
| Связан с AI training | Собранные им данные могут подпадать под политику Extended | Да, управляет разрешением такого использования |
Apple описывает Applebot как crawler для продуктов, включая Spotlight, Siri и Safari. Applebot-Extended добавлен отдельно, чтобы веб-мастер мог запретить использование собранных Applebot данных для обучения foundation models Apple, не закрывая сам поисковый crawler.
Зачем нужен Applebot-Extended
До появления подобных токенов владельцу сайта часто приходилось выбирать между полным доступом crawler и полной блокировкой. Applebot-Extended позволяет разделить два сценария:
- разрешить Applebot получать контент для функций Apple;
- одновременно запретить использование этих данных для обучения foundation models Apple.
По своей логике Applebot-Extended похож на Google-Extended: это механизм управления использованием данных, а не дополнительный бот, который самостоятельно приходит на сайт.
Как запретить использование контента для обучения моделей Apple
Для opt-out добавьте в robots.txt:
User-agent: Applebot-Extended
Disallow: /
Если при этом вы хотите оставить обычный Applebot доступным:
User-agent: Applebot
Allow: /
User-agent: Applebot-Extended
Disallow: /
Такое разделение позволяет сохранить crawling Applebot и одновременно выразить запрет на использование собранных данных в сценарии, который регулирует Extended.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Можно ли разрешить Applebot-Extended только для части сайта
Да. Apple указывает, что Applebot-Extended поддерживает стандартные директивы robots.txt. Поэтому правила можно применять не только ко всему домену, но и к отдельным путям.
Например:
User-agent: Applebot-Extended
Disallow: /articles/
Disallow: /research/
Allow: /public/
Такой вариант полезен, если политика сайта различается для разных типов контента.
Что произойдёт после Disallow Applebot-Extended
Запрет не означает автоматического исчезновения страниц из Spotlight, Siri или поисковых функций Safari. За получение страниц отвечает Applebot, а не Applebot-Extended.
Если Applebot продолжает быть разрешён, его crawling регулируется собственными правилами:
User-agent: Applebot
Allow: /
Это одна из самых важных особенностей Applebot-Extended: веб-мастер может отказаться от AI-training use без необходимости полностью закрывать Applebot.
Будет ли Applebot-Extended виден в access.log
Как отдельного официального crawler его там ожидать не следует. Apple прямо указывает, что Applebot-Extended не обходит веб-страницы.
Поэтому команда:
grep -i "Applebot-Extended" /var/log/nginx/access.log
не является способом измерить объём официального crawling Apple.
Для реальной нагрузки следует искать Applebot:
grep -i "Applebot" /var/log/nginx/access.log
При этом если строка Applebot-Extended всё же обнаружилась в HTTP User-Agent, TrafficVeil не должен автоматически считать такой запрос официальным Apple crawler. Это может быть сторонний клиент, сканер или просто подделанный UA.
Почему у Applebot-Extended нет собственной нагрузки
Поскольку Extended не выполняет отдельный crawl, ему нельзя корректно приписывать:
- RPS;
- число скачанных страниц;
- объём bandwidth;
- IP-адреса crawling-инфраструктуры;
- частоту обхода;
- нагрузку на origin.
Все эти показатели относятся к фактическому Applebot или другому HTTP-клиенту.
Если в статистике TrafficVeil у Applebot-Extended появляются тысячи «запросов», это повод проверить классификатор: возможно, система считает упоминание токена, правило robots.txt или ложный UA отдельным crawler.
Есть ли смысл блокировать Applebot-Extended через Nginx
Для официального Applebot-Extended — нет. Правило вида:
if ($http_user_agent ~* "Applebot-Extended") {
return 403;
}
не реализует предусмотренный Apple механизм opt-out, потому что Extended не является отдельным crawler, который нужно останавливать HTTP-кодом 403.
Правильный механизм — robots.txt.
А если запрос с UA Applebot-Extended всё-таки пришёл
Такой запрос нужно рассматривать отдельно. Поскольку Apple заявляет, что Applebot-Extended не выполняет crawling, появление этого токена непосредственно в User-Agent не является подтверждением официального трафика Apple.
TrafficVeil может пометить событие, например, как:
Applebot-Extended UA anomaly — token is not an official standalone crawler.
Дальше запрос следует оценивать по IP, ASN, fingerprint, URL и фактическому поведению.
Нужно ли проверять IP Applebot-Extended
Для самого Extended отдельный список crawling IP не требуется, поскольку он не выполняет самостоятельные запросы. IP-верификация имеет смысл для Applebot.
Apple публикует официальные IP-диапазоны Applebot и описывает DNS-проверку настоящего crawler. Эти данные следует использовать в карточке Applebot, а не переносить их на Applebot-Extended как на отдельного агента.
Как Apple применяет правила Applebot-Extended
Apple указывает несколько важных особенностей обработки правил:
- если правило для
Applebot-Extendedотсутствует, использование данных для обучения foundation models разрешено; - правила для обычного
Applebotне наследуются Applebot-Extended; - правила других User-Agent также не наследуются Extended;
- Applebot-Extended поддерживает стандартные директивы robots.txt.
Это означает, что для явного opt-out нужно добавить отдельную группу именно для Applebot-Extended.
Почему User-agent: * недостаточно
Для многих crawler веб-мастера привыкли использовать общий блок:
User-agent: *
Disallow: /private/
Но Apple отдельно указывает, что Applebot-Extended не наследует правила других user agents. Поэтому если задача — явно управлять использованием контента для обучения foundation models Apple, лучше прописывать Applebot-Extended отдельно.
Практические конфигурации
Разрешить Apple search и запретить AI training
User-agent: Applebot
Allow: /
User-agent: Applebot-Extended
Disallow: /
Разрешить оба сценария
User-agent: Applebot
Allow: /
User-agent: Applebot-Extended
Allow: /
Закрыть отдельный раздел от AI-training use
User-agent: Applebot-Extended
Disallow: /premium-content/
Disallow: /research/
Как отображать Applebot-Extended в TrafficVeil
Главное изменение для энциклопедии TrafficVeil — не показывать Applebot-Extended как обычного бота рядом с Googlebot, Bingbot или Applebot.
| Поле | Рекомендация |
|---|---|
| Название | Applebot-Extended |
| Оператор | Apple |
| Категория | AI training controls |
| Тип | robots.txt policy token |
| HTTP crawler | Нет |
| Нагрузка | Не применяется |
| IP ranges | Не применяются к Extended как отдельному crawler |
| Основное действие | Настроить robots.txt |
| Связанный crawler | Applebot |
Вместо кнопок Allow / Rate Limit / Block для Applebot-Extended логичнее показывать:
- Allow AI training use;
- Disallow AI training use;
- Edit robots.txt policy;
- ссылку на связанную карточку Applebot.
Applebot-Extended и Google-Extended
Эти механизмы концептуально похожи: оба дают владельцу сайта дополнительный контроль над использованием контента для AI-сценариев без необходимости блокировать основной поисковый crawler.
Для антибот-платформы это отдельный класс сущностей. Их правильнее называть не «AI bots», а AI usage control tokens или robots.txt AI policy tokens.
Итог
Applebot-Extended — не отдельный веб-краулер и не источник самостоятельной нагрузки. Это специальный robots.txt-токен Apple для управления тем, может ли контент, собранный Applebot, использоваться для обучения foundation models Apple.
Если владелец сайта хочет сохранить присутствие в функциях Apple, но отказаться от такого AI-training use, достаточно разделить политики: разрешить Applebot и запретить Applebot-Extended.
Для TrafficVeil Applebot-Extended следует хранить отдельно от обычной базы HTTP-ботов. Это не агент, которому нужен rate limit или IP-ban, а политика использования данных. Если же Applebot-Extended неожиданно появляется непосредственно в access.log как User-Agent, такой запрос следует считать аномалией и проверять отдельно.
Частые вопросы
Что такое Applebot-Extended?
Applebot-Extended самостоятельно сканирует сайты?
Как запретить Apple использовать контент для обучения AI?
Повлияет ли блокировка Applebot-Extended на Spotlight, Siri или Safari?
Почему Applebot-Extended не стоит блокировать через Nginx?
Что делать, если Applebot-Extended всё-таки появился в access.log как User-Agent?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.