Meta ExternalAgent — обучение foundation-моделей Meta и продуктовая индексация контента напрямую по всему интернету. Это не превью ссылок при шеринге в Facebook, Instagram или WhatsApp — за ту задачу отвечает совсем другой бот семьи Meta. Оператор: Meta. Ниже — факты из публичной документации и практики верификации: полный UA, IP/ASN, поведение вокруг robots.txt, с кем не путать и как настроить правила так, чтобы не отрезать соседний полезный агент.
Что такое Meta ExternalAgent
| Параметр | Значение |
|---|---|
| User-Agent (токен) | meta-externalagent |
| Полная / типовая строка UA | meta-externalagent/1.1 или meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/web-crawlers) |
| Оператор | Meta |
| Назначение | Обучение foundation-моделей Meta и продуктовая индексация контента по всему открытому вебу — не превью ссылок |
| Официальная документация | developers.facebook.com/documentation/sharing/webmasters/web-crawlers |
| IP / верификация | ❌ Отдельного удобного официального списка «только meta-externalagent» нет. Верификация — по ASN Meta (AS32934) и geofeed Meta. Не путать с facebookexternalhit — у него своя, отдельная логика проверки |
| ASN (ориентир) | AS32934 |
| Соблюдение robots.txt | Заявлено официально, но не безоговорочно — см. отдельный раздел ниже. Кэш правил на стороне Meta — до ~24 часов. Родственный meta-externalfetcher может обходить robots.txt при user-initiated fetch |
| Категория TrafficVeil | Прочие краулеры и сервисы |
Как работает и зачем приходит
Задача этого краулера — обучение foundation-моделей Meta и продуктовая индексация контента напрямую, а не генерация превью для шеринга. Практический приём для управления видимостью: можно разрешить meta-webindexer (он отвечает за поиск и цитирования в Meta AI) и одновременно запретить meta-externalagent — так сайт получает видимость в ответах Meta AI без передачи контента на обучение моделей. Не баньте весь ASN AS32934 целиком, если сайту важны превью ссылок через facebookexternalhit — это разные боты одной компании с разными задачами и разными последствиями блокировки.
Стоит ли доверять заявленному соблюдению robots.txt
Meta официально просит управлять доступом meta-externalagent через robots.txt, и в целом это работает как основной канал контроля. Но независимые наблюдения вебмастеров подсказывают быть внимательнее: в полевых обсуждениях встречаются едкие комментарии о том, что заявление о соблюдении robots.txt выглядело бы убедительнее, если бы сам краулер хоть раз действительно запросил файл robots.txt перед обходом. Похожие сомнения годами звучат и в адрес facebookexternalhit. Практический вывод: robots.txt настраивать нужно обязательно — это официальный и в целом рабочий канал, — но не считайте его единственной гарантией. Держите под рукой серверный уровень блокировки (nginx/Apache/TrafficVeil) на случай расхождения между заявленным и реальным поведением.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Реальный кейс: почему нельзя просто «разрешить всей семье Meta»
Один из вебмастеров описывал ситуацию, когда за полчаса зафиксировал около 3,5 тысяч визитов от facebookexternalhit и meta-externalfetcher под общим ASN Meta — с падением просмотров рекламы и общей нагрузкой на сервер, вызванной одновременной активностью нескольких агентов семьи. Это хорошая иллюстрация того, зачем в разделе рекомендаций ниже настаивается на отдельных правилах для каждого конкретного бота, а не на общем разрешении/запрете по всей компании.
Нагрузка на сервер
По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) meta-externalagent: 34 502 888 запросов суммарно (март 1 820 963, апрель 7 644 112, май 18 342 393, июнь 6 695 420). Перед жёсткими правилами сверьте июль–август в аналитике TrafficVeil — динамика этого агента заметно росла от месяца к месяцу. Смотрите не только RPS, но и path-паттерн: плотный обход каталога без сессий — повод для rate-limit/deny; точечные хиты под превью или user-fetch — совсем другая политика, требующая отдельного правила.
Обнаружение в логах и IP
grep -i "meta-externalagent" /var/log/nginx/access.log
grep -i "meta-externalagent" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
grep -i "meta-externalagent" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Важно: отдельного статического списка «только meta-externalagent» нет. Верификация — ASN Meta AS32934 / geofeed Meta. User-Agent легко подделать — для решения allow/deny связка UA + IP/ASN/официальный JSON надёжнее одной строки UA.
robots.txt
User-agent: meta-externalagent
Disallow: /
User-agent: meta-externalagent
Allow: /
User-agent: meta-externalagent
Disallow: /admin/
Disallow: /cart/
Allow: /
Кэш правил на стороне Meta действует до ~24 часов, так что изменения применяются не мгновенно. Если в семье ботов есть «полезный» и «нежелательный» агент — делайте отдельные User-agent блоки на каждого и не режьте обоих одним ASN-баном.
Nginx / Apache / TrafficVeil
Nginx
if ($http_user_agent ~* "meta-externalagent") {
return 403;
}
Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} meta-externalagent [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите meta-externalagent в ботах домена или /system/bots
- Можно Allow meta-webindexer + Disallow meta-externalagent: видимость в Meta AI без отдачи контента на обучение
- Не баньте весь AS32934, если сайту нужны превью через facebookexternalhit
- После изменения сверьте логи за 15–60 минут
Рекомендации
- Можно Allow meta-webindexer + Disallow meta-externalagent: видимость в Meta AI без отдачи на обучение
- Не полагайтесь только на robots.txt, если compliance неоднозначный или агент user-initiated — держите серверный уровень блокировки про запас
- Не баньте весь ASN оператора, если в семье есть нужный сайту бот (превью/поиск)
- Обновляйте IP JSON (если появится официальный) по cron — диапазоны меняются
- Сверяйте свежую статистику TrafficVeil, не только сводку март–июнь 2026 — трафик этого агента растёт заметными темпами
С кем не путать
| Бот | Роль | Комментарий |
|---|---|---|
| meta-webindexer | Поиск Meta AI / цитирования | семья Meta |
| facebookexternalhit | Превью ссылок Facebook/Instagram | семья Meta |
| meta-externalfetcher | User-initiated fetch, может игнорировать robots.txt | семья Meta |
| meta-externalads | Реклама / business products | семья Meta |
Стратегия
| Цель | Действие |
|---|---|
| Нужна польза от оператора | Allow + точечные Disallow служебных путей |
| Бот только грузит сервер / забирает данные | Disallow + deny в TrafficVeil / nginx |
| Есть официальный IP JSON | UA + IP verification / WAF IP set |
| Официального IP нет | UA + ASN/rDNS + поведение; не слепой ASN-ban семьи |
Частые вопросы
Собирает ли meta-externalagent данные для превью ссылок в Facebook и Instagram?
Можно ли доверять заявлению Meta о соблюдении robots.txt этим краулером?
Как разрешить сайту попадать в ответы Meta AI, не отдавая контент на обучение моделей?
Что будет, если заблокировать весь ASN AS32934 целиком?
Как быстро применяются изменения в robots.txt для этого краулера?
Почему нельзя просто разрешить или запретить всю семью ботов Meta одним правилом?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.