Для веб-мастеров это ключевой агент, если цель — появляться в ответах Meta AI с цитированием: Meta официально указывает, что разрешение meta-webindexer в robots.txt помогает сервису цитировать и ссылаться на ваш контент в ответах Meta AI. Это не превью-бот Facebook и не обучающий краулер: его задача — качество поискового слоя Meta AI.
1. Что такое meta-webindexer
| Параметр | Значение |
|---|---|
| User-Agent (токен) | meta-webindexer |
| Полная строка UA | meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/web-crawlers)также встречается короткий вариант meta-webindexer/1.1 |
| Оператор | Meta (Facebook) |
| Назначение | Индексация публичного веба для повышения качества и релевантности поисковых ответов Meta AI, включая цитирование источников |
| Официальная документация | Meta for Developers — «Meta Web Crawlers» |
| Список IP-адресов | ❌ Отдельного статического списка для meta-webindexer нет; трафик идёт из сети Meta (AS32934), проверка — через ASN / geofeed Meta |
| Соблюдение robots.txt | Да, официально через стандартные Allow/Disallow; изменения могут применяться до 24 часов из‑за кеша crawler’а |
| Используется для обучения моделей | Нет (для обучения и продуктового индекса контента Meta указывает отдельный агент meta-externalagent) |
| Формирует цитируемые ссылки на источник | Да — при индексации Meta AI может цитировать и ссылаться на ваш контент в ответах |
2. Как работает meta-webindexer
- Обходит публичные страницы, чтобы улучшать качество поисковых результатов Meta AI;
- Анализирует онлайн-контент для повышения релевантности и точности ответов ассистента;
- Соблюдает стандартные директивы robots.txt (
Allow/Disallow); отдельный Crawl-delay в документации Meta для этого агента не описан; - Питает поисковый слой Meta AI — то есть влияет на то, сможет ли Meta AI найти и процитировать вашу страницу.
Важно не путать семейство Meta-краулеров:
meta-webindexer— индекс для поиска Meta AI;meta-externalagent— сбор/индексация контента, в т.ч. для обучения foundation-моделей;facebookexternalhit/ FacebookBot — превью ссылок при шеринге в Facebook, Instagram, Messenger;meta-externalfetcher— точечная загрузка URL по действию пользователя, может обходить robots.txt.
3. Нагрузка на сервер
По данным мониторинга bot-трафика TrafficVeil (ClickHouse, 696 доменов, март–июнь 2026) агент meta-webindexer зафиксирован на уровне сотен тысяч запросов за период (~714 000 суммарно по выборке), с заметными всплесками в отдельные месяцы. Это заметно меньше, чем у соседнего meta-externalagent (десятки миллионов запросов в той же выборке), но на отдельных доменах поведение всё равно может выглядеть как «волна» автоматических обращений: плотные серии запросов из IP Meta, обход многих URL подряд, рост CPU/bandwidth без роста реальных сессий пользователей.
Именно такие паттерны веб-мастера часто описывают как поведение, похожее на L7-нагрузку: сайт отвечает 200, но origin перегружен краулингом. Если одновременно активны несколько агентов Meta, эффект суммируется.
4. Обнаружение в логах
Поиск по User-Agent
# Все запросы от meta-webindexer
grep -i "meta-webindexer" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "meta-webindexer" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP-адреса
grep -i "meta-webindexer" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота визитов по дням
grep -i "meta-webindexer" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отличить от других Meta-агентов
grep -iE "meta-webindexer|meta-externalagent|facebookexternalhit|meta-externalfetcher" /var/log/nginx/access.log | \
sed -n 's/.*\"\([^\"]*\)\".*/\1/p' | sort | uniq -c | sort -rn
Верификация — почему одной блокировки по UA недостаточно
User-Agent легко подделать. Для Meta практическая проверка — принадлежность IP к AS32934 и/или geofeed Meta, а не только строка UA. Отдельного официального JSON со списком IP именно для meta-webindexer нет.
# Проверка ASN источника
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
# Вспомогательная проверка reverse DNS
dig +short -x "$IP"
5. robots.txt
# Разрешить индексацию для поиска Meta AI,
# запретить использование контента обучающим агентом Meta
User-agent: meta-webindexer
Allow: /
User-agent: meta-externalagent
Disallow: /
# Полная блокировка поисковой индексации Meta AI
User-agent: meta-webindexer
Disallow: /
# Точечное ограничение — закрыть служебные разделы
User-agent: meta-webindexer
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /
# Учтите: meta-externalfetcher может обходить robots.txt
# при пользовательских запросах; facebookexternalhit тоже
# может игнорировать robots.txt для security/integrity checks
Meta предупреждает: изменения robots.txt могут применяться до 24 часов из‑за кеширования на стороне краулеров. Вопросы по краулингу — webmasters@meta.com.
6. Управление на уровне сервера
Nginx
if ($http_user_agent ~* "meta-webindexer") {
return 403;
}
# Мягкий вариант — ограничение частоты запросов
limit_req_zone $binary_remote_addr zone=metawebindexer:10m rate=15r/m;
location / {
if ($http_user_agent ~* "meta-webindexer") {
limit_req zone=metawebindexer burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} meta-webindexer [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- В панели домена включите Bot Detection и найдите
meta-webindexer/ Meta WebIndexer в списке известных ботов; - Поставьте категорию «запретить» или ограничьте rate limit, если нужна мягкая политика;
- Для массовых операций используйте
/system/bots(разрешить/запретить, включить/выключить) — правило применится на уровне защитного контура без правки origin; - Проверьте логи после изменения: бот должен уходить в блок/лимит, при этом
facebookexternalhitможно оставить разрешённым, если важны превью ссылок в Facebook/Instagram.
7. Рекомендации по оптимизации
- Если цель — цитирования и видимость в Meta AI — не блокируйте
meta-webindexerслучайным широкимDisallow: /дляUser-agent: *; - Разрешение meta-webindexer не означает разрешение meta-externalagent — можно быть видимым в поиске Meta AI, не отдавая контент на обучение;
- Не путайте с facebookexternalhit — блокировка превью-бота ломает карточки ссылок в соцсетях, но почти не влияет на поиск Meta AI;
- Контент лучше отдавать server-side — полноценный JS-рендеринг для meta-webindexer официально не гарантирован;
- При всплесках нагрузки сначала отделите
meta-webindexerотmeta-externalagentв логах: часто «ddos-подобную» картину даёт именно обучающий/продуктовый агент, а не поисковый индексёр; - На origin используйте UA-блок/rate-limit; в TrafficVeil — точечный запрет бота без отключения полезных Meta-агентов.
8. Сравнение с похожими ботами
| Бот | Оператор | Назначение | Список IP |
|---|---|---|---|
| meta-webindexer | Meta | Поиск Meta AI / цитирования | ❌ Нет отдельного списка (AS32934) |
| meta-externalagent | Meta | Обучение / продуктовая индексация | ❌ Нет отдельного списка (AS32934) |
| facebookexternalhit | Meta | Превью ссылок в соцсетях | ✅ Диапазоны/ASN Meta |
| Claude-SearchBot | Anthropic | Поиск Claude | ❌ Нет |
| OAI-SearchBot | OpenAI | Поиск ChatGPT | ✅ Есть |
| PerplexityBot | Perplexity | Индекс для AI-поиска | ✅ Есть |
9. Сводная таблица стратегии
| Цель сайта | Рекомендация |
|---|---|
| Хочу цитирования и видимость в Meta AI | Allow для meta-webindexer; контент без обязательного JS-рендеринга |
| Не хочу участвовать в поиске Meta AI | Disallow для meta-webindexer (или запрет в TrafficVeil) |
| Хочу поиск Meta AI, но не обучение моделей | Allow для meta-webindexer + Disallow для meta-externalagent |
| Нужны превью в Facebook/Instagram, но не AI-краулинг | Allow facebookexternalhit; Disallow meta-webindexer и meta-externalagent |
| Беспокоит частота визитов | Rate-limit на nginx/TrafficVeil; robots.txt у Meta не документирует Crawl-delay для этого UA |