Боты6 мин чтения·9 августа 2026 г.·обновлено 8 сентября 2026 г.

Meta ExternalAgent: обучение ИИ Meta, а не превью для соцсетей

meta-externalagent собирает контент для обучения моделей Meta и продуктовой индексации — это не тот бот, что генерирует превью ссылок. Разбираем, почему заявленное соблюдение robots.txt стоит проверять, и как не задеть полезных соседей по семье Meta.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Meta ExternalAgent: легитимный прочие краулеры и сервисы

Meta ExternalAgent — обучение foundation-моделей Meta и продуктовая индексация контента напрямую по всему интернету. Это не превью ссылок при шеринге в Facebook, Instagram или WhatsApp — за ту задачу отвечает совсем другой бот семьи Meta. Оператор: Meta. Ниже — факты из публичной документации и практики верификации: полный UA, IP/ASN, поведение вокруг robots.txt, с кем не путать и как настроить правила так, чтобы не отрезать соседний полезный агент.

Что такое Meta ExternalAgent

Параметр Значение
User-Agent (токен) meta-externalagent
Полная / типовая строка UA meta-externalagent/1.1 или meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/web-crawlers)
Оператор Meta
Назначение Обучение foundation-моделей Meta и продуктовая индексация контента по всему открытому вебу — не превью ссылок
Официальная документация developers.facebook.com/documentation/sharing/webmasters/web-crawlers
IP / верификация ❌ Отдельного удобного официального списка «только meta-externalagent» нет. Верификация — по ASN Meta (AS32934) и geofeed Meta. Не путать с facebookexternalhit — у него своя, отдельная логика проверки
ASN (ориентир) AS32934
Соблюдение robots.txt Заявлено официально, но не безоговорочно — см. отдельный раздел ниже. Кэш правил на стороне Meta — до ~24 часов. Родственный meta-externalfetcher может обходить robots.txt при user-initiated fetch
Категория TrafficVeil Прочие краулеры и сервисы

Как работает и зачем приходит

Задача этого краулера — обучение foundation-моделей Meta и продуктовая индексация контента напрямую, а не генерация превью для шеринга. Практический приём для управления видимостью: можно разрешить meta-webindexer (он отвечает за поиск и цитирования в Meta AI) и одновременно запретить meta-externalagent — так сайт получает видимость в ответах Meta AI без передачи контента на обучение моделей. Не баньте весь ASN AS32934 целиком, если сайту важны превью ссылок через facebookexternalhit — это разные боты одной компании с разными задачами и разными последствиями блокировки.

Стоит ли доверять заявленному соблюдению robots.txt

Meta официально просит управлять доступом meta-externalagent через robots.txt, и в целом это работает как основной канал контроля. Но независимые наблюдения вебмастеров подсказывают быть внимательнее: в полевых обсуждениях встречаются едкие комментарии о том, что заявление о соблюдении robots.txt выглядело бы убедительнее, если бы сам краулер хоть раз действительно запросил файл robots.txt перед обходом. Похожие сомнения годами звучат и в адрес facebookexternalhit. Практический вывод: robots.txt настраивать нужно обязательно — это официальный и в целом рабочий канал, — но не считайте его единственной гарантией. Держите под рукой серверный уровень блокировки (nginx/Apache/TrafficVeil) на случай расхождения между заявленным и реальным поведением.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Реальный кейс: почему нельзя просто «разрешить всей семье Meta»

Один из вебмастеров описывал ситуацию, когда за полчаса зафиксировал около 3,5 тысяч визитов от facebookexternalhit и meta-externalfetcher под общим ASN Meta — с падением просмотров рекламы и общей нагрузкой на сервер, вызванной одновременной активностью нескольких агентов семьи. Это хорошая иллюстрация того, зачем в разделе рекомендаций ниже настаивается на отдельных правилах для каждого конкретного бота, а не на общем разрешении/запрете по всей компании.

Нагрузка на сервер

По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) meta-externalagent: 34 502 888 запросов суммарно (март 1 820 963, апрель 7 644 112, май 18 342 393, июнь 6 695 420). Перед жёсткими правилами сверьте июль–август в аналитике TrafficVeil — динамика этого агента заметно росла от месяца к месяцу. Смотрите не только RPS, но и path-паттерн: плотный обход каталога без сессий — повод для rate-limit/deny; точечные хиты под превью или user-fetch — совсем другая политика, требующая отдельного правила.

Обнаружение в логах и IP

grep -i "meta-externalagent" /var/log/nginx/access.log
grep -i "meta-externalagent" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
grep -i "meta-externalagent" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

Важно: отдельного статического списка «только meta-externalagent» нет. Верификация — ASN Meta AS32934 / geofeed Meta. User-Agent легко подделать — для решения allow/deny связка UA + IP/ASN/официальный JSON надёжнее одной строки UA.

robots.txt

User-agent: meta-externalagent
Disallow: /

User-agent: meta-externalagent
Allow: /

User-agent: meta-externalagent
Disallow: /admin/
Disallow: /cart/
Allow: /

Кэш правил на стороне Meta действует до ~24 часов, так что изменения применяются не мгновенно. Если в семье ботов есть «полезный» и «нежелательный» агент — делайте отдельные User-agent блоки на каждого и не режьте обоих одним ASN-баном.

Nginx / Apache / TrafficVeil

Nginx

if ($http_user_agent ~* "meta-externalagent") {
    return 403;
}

Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} meta-externalagent [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите meta-externalagent в ботах домена или /system/bots
  • Можно Allow meta-webindexer + Disallow meta-externalagent: видимость в Meta AI без отдачи контента на обучение
  • Не баньте весь AS32934, если сайту нужны превью через facebookexternalhit
  • После изменения сверьте логи за 15–60 минут

Рекомендации

  • Можно Allow meta-webindexer + Disallow meta-externalagent: видимость в Meta AI без отдачи на обучение
  • Не полагайтесь только на robots.txt, если compliance неоднозначный или агент user-initiated — держите серверный уровень блокировки про запас
  • Не баньте весь ASN оператора, если в семье есть нужный сайту бот (превью/поиск)
  • Обновляйте IP JSON (если появится официальный) по cron — диапазоны меняются
  • Сверяйте свежую статистику TrafficVeil, не только сводку март–июнь 2026 — трафик этого агента растёт заметными темпами

С кем не путать

Бот Роль Комментарий
meta-webindexer Поиск Meta AI / цитирования семья Meta
facebookexternalhit Превью ссылок Facebook/Instagram семья Meta
meta-externalfetcher User-initiated fetch, может игнорировать robots.txt семья Meta
meta-externalads Реклама / business products семья Meta

Стратегия

Цель Действие
Нужна польза от оператора Allow + точечные Disallow служебных путей
Бот только грузит сервер / забирает данные Disallow + deny в TrafficVeil / nginx
Есть официальный IP JSON UA + IP verification / WAF IP set
Официального IP нет UA + ASN/rDNS + поведение; не слепой ASN-ban семьи

Частые вопросы

Собирает ли meta-externalagent данные для превью ссылок в Facebook и Instagram?
Нет, за превью отвечает отдельный бот facebookexternalhit — meta-externalagent занимается обучением моделей и продуктовой индексацией контента.
Можно ли доверять заявлению Meta о соблюдении robots.txt этим краулером?
Стоит относиться с осторожностью: независимые наблюдения вебмастеров ставят под сомнение, действительно ли краулер сверяется с файлом перед каждым обходом, поэтому нужен и серверный уровень блокировки про запас.
Как разрешить сайту попадать в ответы Meta AI, не отдавая контент на обучение моделей?
Разрешить в robots.txt meta-webindexer и одновременно запретить meta-externalagent — это разделяет видимость в поиске Meta AI и передачу на обучение.
Что будет, если заблокировать весь ASN AS32934 целиком?
Сайт потеряет и превью ссылок через facebookexternalhit, поскольку весь диапазон принадлежит Meta, а не только meta-externalagent.
Как быстро применяются изменения в robots.txt для этого краулера?
Meta может кэшировать содержимое файла до ~24 часов, поэтому изменения вступают в силу не мгновенно.
Почему нельзя просто разрешить или запретить всю семью ботов Meta одним правилом?
Разные боты семьи решают разные задачи с разными последствиями блокировки — зафиксированы случаи, когда одновременная активность нескольких из них резко повышала нагрузку и снижала показатели рекламы на сайте.
#Meta ExternalAgent#Meta AI#AS32934#facebookexternalhit#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil