Боты8 мин чтения·10 августа 2026 г.

Applebot-Extended: что это такое и как запретить использование контента для AI Apple

Applebot-Extended — не отдельный веб-краулер, а специальный токен robots.txt. Он позволяет запретить использование данных, собранных Applebot, для обучения foundation models Apple, не блокируя обычный поисковый краулер Apple.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота AppleBot Extended: легитимный поисковые роботы

Applebot-Extended — специальный токен для robots.txt, с помощью которого владелец сайта управляет использованием уже собранного Applebot контента для обучения foundation models Apple. Это принципиально отличает его от обычных веб-краулеров.

Applebot-Extended сам не обходит веб-страницы. У него нет отдельной задачи скачивать HTML, изображения или другие ресурсы сайта. Реальный обход выполняет Applebot — поисковый краулер Apple.

Параметр Значение
Название Applebot-Extended
Оператор Apple
Тип robots.txt control token
Отдельный веб-краулер Нет
Отдельный HTTP User-Agent Нет
Токен robots.txt Applebot-Extended
Фактический crawler Applebot
Назначение Управление использованием данных Applebot для обучения foundation models Apple
Влияние на поисковые функции Apple Запрет Applebot-Extended сам по себе не запрещает Applebot
Категория TrafficVeil AI training controls / robots.txt policies

Applebot и Applebot-Extended — в чём разница

Эти два имени нельзя использовать как взаимозаменяемые.

  Applebot Applebot-Extended
Что это Веб-краулер Apple Токен управления использованием данных
Делает HTTP-запросы Да Нет как отдельный crawler
Появляется в access.log Да Не должен появляться как отдельный официальный crawler
Связан с поиском Да Не управляет поисковым crawling напрямую
Связан с AI training Собранные им данные могут подпадать под политику Extended Да, управляет разрешением такого использования

Apple описывает Applebot как crawler для продуктов, включая Spotlight, Siri и Safari. Applebot-Extended добавлен отдельно, чтобы веб-мастер мог запретить использование собранных Applebot данных для обучения foundation models Apple, не закрывая сам поисковый crawler.

Зачем нужен Applebot-Extended

До появления подобных токенов владельцу сайта часто приходилось выбирать между полным доступом crawler и полной блокировкой. Applebot-Extended позволяет разделить два сценария:

  • разрешить Applebot получать контент для функций Apple;
  • одновременно запретить использование этих данных для обучения foundation models Apple.

По своей логике Applebot-Extended похож на Google-Extended: это механизм управления использованием данных, а не дополнительный бот, который самостоятельно приходит на сайт.

Как запретить использование контента для обучения моделей Apple

Для opt-out добавьте в robots.txt:

User-agent: Applebot-Extended
Disallow: /

Если при этом вы хотите оставить обычный Applebot доступным:

User-agent: Applebot
Allow: /

User-agent: Applebot-Extended
Disallow: /

Такое разделение позволяет сохранить crawling Applebot и одновременно выразить запрет на использование собранных данных в сценарии, который регулирует Extended.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Можно ли разрешить Applebot-Extended только для части сайта

Да. Apple указывает, что Applebot-Extended поддерживает стандартные директивы robots.txt. Поэтому правила можно применять не только ко всему домену, но и к отдельным путям.

Например:

User-agent: Applebot-Extended
Disallow: /articles/
Disallow: /research/
Allow: /public/

Такой вариант полезен, если политика сайта различается для разных типов контента.

Что произойдёт после Disallow Applebot-Extended

Запрет не означает автоматического исчезновения страниц из Spotlight, Siri или поисковых функций Safari. За получение страниц отвечает Applebot, а не Applebot-Extended.

Если Applebot продолжает быть разрешён, его crawling регулируется собственными правилами:

User-agent: Applebot
Allow: /

Это одна из самых важных особенностей Applebot-Extended: веб-мастер может отказаться от AI-training use без необходимости полностью закрывать Applebot.

Будет ли Applebot-Extended виден в access.log

Как отдельного официального crawler его там ожидать не следует. Apple прямо указывает, что Applebot-Extended не обходит веб-страницы.

Поэтому команда:

grep -i "Applebot-Extended" /var/log/nginx/access.log

не является способом измерить объём официального crawling Apple.

Для реальной нагрузки следует искать Applebot:

grep -i "Applebot" /var/log/nginx/access.log

При этом если строка Applebot-Extended всё же обнаружилась в HTTP User-Agent, TrafficVeil не должен автоматически считать такой запрос официальным Apple crawler. Это может быть сторонний клиент, сканер или просто подделанный UA.

Почему у Applebot-Extended нет собственной нагрузки

Поскольку Extended не выполняет отдельный crawl, ему нельзя корректно приписывать:

  • RPS;
  • число скачанных страниц;
  • объём bandwidth;
  • IP-адреса crawling-инфраструктуры;
  • частоту обхода;
  • нагрузку на origin.

Все эти показатели относятся к фактическому Applebot или другому HTTP-клиенту.

Если в статистике TrafficVeil у Applebot-Extended появляются тысячи «запросов», это повод проверить классификатор: возможно, система считает упоминание токена, правило robots.txt или ложный UA отдельным crawler.

Есть ли смысл блокировать Applebot-Extended через Nginx

Для официального Applebot-Extended — нет. Правило вида:

if ($http_user_agent ~* "Applebot-Extended") {
    return 403;
}

не реализует предусмотренный Apple механизм opt-out, потому что Extended не является отдельным crawler, который нужно останавливать HTTP-кодом 403.

Правильный механизм — robots.txt.

А если запрос с UA Applebot-Extended всё-таки пришёл

Такой запрос нужно рассматривать отдельно. Поскольку Apple заявляет, что Applebot-Extended не выполняет crawling, появление этого токена непосредственно в User-Agent не является подтверждением официального трафика Apple.

TrafficVeil может пометить событие, например, как:

Applebot-Extended UA anomaly — token is not an official standalone crawler.

Дальше запрос следует оценивать по IP, ASN, fingerprint, URL и фактическому поведению.

Нужно ли проверять IP Applebot-Extended

Для самого Extended отдельный список crawling IP не требуется, поскольку он не выполняет самостоятельные запросы. IP-верификация имеет смысл для Applebot.

Apple публикует официальные IP-диапазоны Applebot и описывает DNS-проверку настоящего crawler. Эти данные следует использовать в карточке Applebot, а не переносить их на Applebot-Extended как на отдельного агента.

Как Apple применяет правила Applebot-Extended

Apple указывает несколько важных особенностей обработки правил:

  • если правило для Applebot-Extended отсутствует, использование данных для обучения foundation models разрешено;
  • правила для обычного Applebot не наследуются Applebot-Extended;
  • правила других User-Agent также не наследуются Extended;
  • Applebot-Extended поддерживает стандартные директивы robots.txt.

Это означает, что для явного opt-out нужно добавить отдельную группу именно для Applebot-Extended.

Почему User-agent: * недостаточно

Для многих crawler веб-мастера привыкли использовать общий блок:

User-agent: *
Disallow: /private/

Но Apple отдельно указывает, что Applebot-Extended не наследует правила других user agents. Поэтому если задача — явно управлять использованием контента для обучения foundation models Apple, лучше прописывать Applebot-Extended отдельно.

Практические конфигурации

Разрешить Apple search и запретить AI training

User-agent: Applebot
Allow: /

User-agent: Applebot-Extended
Disallow: /

Разрешить оба сценария

User-agent: Applebot
Allow: /

User-agent: Applebot-Extended
Allow: /

Закрыть отдельный раздел от AI-training use

User-agent: Applebot-Extended
Disallow: /premium-content/
Disallow: /research/

Как отображать Applebot-Extended в TrafficVeil

Главное изменение для энциклопедии TrafficVeil — не показывать Applebot-Extended как обычного бота рядом с Googlebot, Bingbot или Applebot.

Поле Рекомендация
Название Applebot-Extended
Оператор Apple
Категория AI training controls
Тип robots.txt policy token
HTTP crawler Нет
Нагрузка Не применяется
IP ranges Не применяются к Extended как отдельному crawler
Основное действие Настроить robots.txt
Связанный crawler Applebot

Вместо кнопок Allow / Rate Limit / Block для Applebot-Extended логичнее показывать:

  • Allow AI training use;
  • Disallow AI training use;
  • Edit robots.txt policy;
  • ссылку на связанную карточку Applebot.

Applebot-Extended и Google-Extended

Эти механизмы концептуально похожи: оба дают владельцу сайта дополнительный контроль над использованием контента для AI-сценариев без необходимости блокировать основной поисковый crawler.

Для антибот-платформы это отдельный класс сущностей. Их правильнее называть не «AI bots», а AI usage control tokens или robots.txt AI policy tokens.

Итог

Applebot-Extended — не отдельный веб-краулер и не источник самостоятельной нагрузки. Это специальный robots.txt-токен Apple для управления тем, может ли контент, собранный Applebot, использоваться для обучения foundation models Apple.

Если владелец сайта хочет сохранить присутствие в функциях Apple, но отказаться от такого AI-training use, достаточно разделить политики: разрешить Applebot и запретить Applebot-Extended.

Для TrafficVeil Applebot-Extended следует хранить отдельно от обычной базы HTTP-ботов. Это не агент, которому нужен rate limit или IP-ban, а политика использования данных. Если же Applebot-Extended неожиданно появляется непосредственно в access.log как User-Agent, такой запрос следует считать аномалией и проверять отдельно.

Частые вопросы

Что такое Applebot-Extended?
Applebot-Extended — специальный User-Agent token для robots.txt, позволяющий владельцу сайта управлять тем, может ли Apple использовать данные, собранные Applebot, для обучения своих foundation models. Это не отдельный поисковый робот.
Applebot-Extended самостоятельно сканирует сайты?
Нет. Apple прямо указывает, что Applebot-Extended не выполняет crawling веб-страниц. Фактические HTTP-запросы к сайту выполняет Applebot. Поэтому отдельного официального crawl-трафика, bandwidth или RPS для Extended ожидать не нужно.
Как запретить Apple использовать контент для обучения AI?
В robots.txt нужно создать отдельное правило для Applebot-Extended и установить Disallow: /. При этом Applebot можно оставить разрешённым. Apple также указывает, что при отсутствии специального правила Applebot-Extended использование данных для обучения foundation models разрешено.
Повлияет ли блокировка Applebot-Extended на Spotlight, Siri или Safari?
Сама по себе — нет. Apple указывает, что запрет Applebot-Extended не влияет на включение контента в поисковые функции. Для crawling и поискового использования существует отдельный Applebot.
Почему Applebot-Extended не стоит блокировать через Nginx?
Потому что официальный Applebot-Extended не является самостоятельным HTTP crawler. Правило Nginx по его UA не реализует предусмотренный Apple opt-out. Правильный механизм управления — отдельная группа Applebot-Extended в robots.txt.
Что делать, если Applebot-Extended всё-таки появился в access.log как User-Agent?
Не считать его автоматически официальным ботом Apple. Поскольку Apple прямо заявляет, что Extended не сканирует веб-страницы, такой HTTP-запрос может быть сторонним клиентом или подделкой UA. TrafficVeil стоит проверить IP, ASN, fingerprint и фактическое поведение источника.
#Applebot-Extended#Applebot#Apple Intelligence#Apple AI#robots.txt#AI training#foundation models#AI crawler#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil