TrafficVeil
Боты 4 мин2 августа 2026 г.

Meta WebIndexer

meta-webindexer — краулер Meta, отвечающий за качество и релевантность поисковых функций Meta AI. Он индексирует публичный веб-контент, чтобы Meta AI мог возвращать более точные ответы с цитированием источников. Это не превью-бот Facebook и не обучающий краулер: собранные данные используются для поискового слоя Meta AI, а не для превью ссылок в соцсетях.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое meta-webindexer
  2. 2. Как работает meta-webindexer
  3. 3. Нагрузка на сервер
  4. 4. Обнаружение в логах
  5. Поиск по User-Agent
  6. Верификация — почему одной блокировки по UA недостаточно
  7. 5. robots.txt
  8. 6. Управление на уровне сервера
  9. Nginx
  10. Apache (.htaccess)
  11. Через TrafficVeil
  12. 7. Рекомендации по оптимизации
  13. 8. Сравнение с похожими ботами
  14. 9. Сводная таблица стратегии
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Для веб-мастеров это ключевой агент, если цель — появляться в ответах Meta AI с цитированием: Meta официально указывает, что разрешение meta-webindexer в robots.txt помогает сервису цитировать и ссылаться на ваш контент в ответах Meta AI. Это не превью-бот Facebook и не обучающий краулер: его задача — качество поискового слоя Meta AI.

1. Что такое meta-webindexer

Параметр Значение
User-Agent (токен) meta-webindexer
Полная строка UA meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/web-crawlers)
также встречается короткий вариант meta-webindexer/1.1
Оператор Meta (Facebook)
Назначение Индексация публичного веба для повышения качества и релевантности поисковых ответов Meta AI, включая цитирование источников
Официальная документация Meta for Developers — «Meta Web Crawlers»
Список IP-адресов ❌ Отдельного статического списка для meta-webindexer нет; трафик идёт из сети Meta (AS32934), проверка — через ASN / geofeed Meta
Соблюдение robots.txt Да, официально через стандартные Allow/Disallow; изменения могут применяться до 24 часов из‑за кеша crawler’а
Используется для обучения моделей Нет (для обучения и продуктового индекса контента Meta указывает отдельный агент meta-externalagent)
Формирует цитируемые ссылки на источник Да — при индексации Meta AI может цитировать и ссылаться на ваш контент в ответах

2. Как работает meta-webindexer

  • Обходит публичные страницы, чтобы улучшать качество поисковых результатов Meta AI;
  • Анализирует онлайн-контент для повышения релевантности и точности ответов ассистента;
  • Соблюдает стандартные директивы robots.txt (Allow / Disallow); отдельный Crawl-delay в документации Meta для этого агента не описан;
  • Питает поисковый слой Meta AI — то есть влияет на то, сможет ли Meta AI найти и процитировать вашу страницу.

Важно не путать семейство Meta-краулеров:

  • meta-webindexer — индекс для поиска Meta AI;
  • meta-externalagent — сбор/индексация контента, в т.ч. для обучения foundation-моделей;
  • facebookexternalhit / FacebookBot — превью ссылок при шеринге в Facebook, Instagram, Messenger;
  • meta-externalfetcher — точечная загрузка URL по действию пользователя, может обходить robots.txt.

3. Нагрузка на сервер

По данным мониторинга bot-трафика TrafficVeil (ClickHouse, 696 доменов, март–июнь 2026) агент meta-webindexer зафиксирован на уровне сотен тысяч запросов за период (~714 000 суммарно по выборке), с заметными всплесками в отдельные месяцы. Это заметно меньше, чем у соседнего meta-externalagent (десятки миллионов запросов в той же выборке), но на отдельных доменах поведение всё равно может выглядеть как «волна» автоматических обращений: плотные серии запросов из IP Meta, обход многих URL подряд, рост CPU/bandwidth без роста реальных сессий пользователей.

Именно такие паттерны веб-мастера часто описывают как поведение, похожее на L7-нагрузку: сайт отвечает 200, но origin перегружен краулингом. Если одновременно активны несколько агентов Meta, эффект суммируется.

4. Обнаружение в логах

Поиск по User-Agent

# Все запросы от meta-webindexer
grep -i "meta-webindexer" /var/log/nginx/access.log

# Количество запросов за сегодня
grep -i "meta-webindexer" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l

# Уникальные IP-адреса
grep -i "meta-webindexer" /var/log/nginx/access.log | awk '{print $1}' | sort -u

# Частота визитов по дням
grep -i "meta-webindexer" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отличить от других Meta-агентов
grep -iE "meta-webindexer|meta-externalagent|facebookexternalhit|meta-externalfetcher" /var/log/nginx/access.log | \
  sed -n 's/.*\"\([^\"]*\)\".*/\1/p' | sort | uniq -c | sort -rn

Верификация — почему одной блокировки по UA недостаточно

User-Agent легко подделать. Для Meta практическая проверка — принадлежность IP к AS32934 и/или geofeed Meta, а не только строка UA. Отдельного официального JSON со списком IP именно для meta-webindexer нет.

# Проверка ASN источника
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"

# Вспомогательная проверка reverse DNS
dig +short -x "$IP"

5. robots.txt

# Разрешить индексацию для поиска Meta AI,
# запретить использование контента обучающим агентом Meta
User-agent: meta-webindexer
Allow: /

User-agent: meta-externalagent
Disallow: /

# Полная блокировка поисковой индексации Meta AI
User-agent: meta-webindexer
Disallow: /

# Точечное ограничение — закрыть служебные разделы
User-agent: meta-webindexer
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /

# Учтите: meta-externalfetcher может обходить robots.txt
# при пользовательских запросах; facebookexternalhit тоже
# может игнорировать robots.txt для security/integrity checks

Meta предупреждает: изменения robots.txt могут применяться до 24 часов из‑за кеширования на стороне краулеров. Вопросы по краулингу — webmasters@meta.com.

6. Управление на уровне сервера

Nginx

if ($http_user_agent ~* "meta-webindexer") {
    return 403;
}

# Мягкий вариант — ограничение частоты запросов
limit_req_zone $binary_remote_addr zone=metawebindexer:10m rate=15r/m;

location / {
    if ($http_user_agent ~* "meta-webindexer") {
        limit_req zone=metawebindexer burst=30 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} meta-webindexer [NC]
RewriteRule ^ - [F,L]

Через TrafficVeil

  • В панели домена включите Bot Detection и найдите meta-webindexer / Meta WebIndexer в списке известных ботов;
  • Поставьте категорию «запретить» или ограничьте rate limit, если нужна мягкая политика;
  • Для массовых операций используйте /system/bots (разрешить/запретить, включить/выключить) — правило применится на уровне защитного контура без правки origin;
  • Проверьте логи после изменения: бот должен уходить в блок/лимит, при этом facebookexternalhit можно оставить разрешённым, если важны превью ссылок в Facebook/Instagram.

7. Рекомендации по оптимизации

  • Если цель — цитирования и видимость в Meta AI — не блокируйте meta-webindexer случайным широким Disallow: / для User-agent: *;
  • Разрешение meta-webindexer не означает разрешение meta-externalagent — можно быть видимым в поиске Meta AI, не отдавая контент на обучение;
  • Не путайте с facebookexternalhit — блокировка превью-бота ломает карточки ссылок в соцсетях, но почти не влияет на поиск Meta AI;
  • Контент лучше отдавать server-side — полноценный JS-рендеринг для meta-webindexer официально не гарантирован;
  • При всплесках нагрузки сначала отделите meta-webindexer от meta-externalagent в логах: часто «ddos-подобную» картину даёт именно обучающий/продуктовый агент, а не поисковый индексёр;
  • На origin используйте UA-блок/rate-limit; в TrafficVeil — точечный запрет бота без отключения полезных Meta-агентов.

8. Сравнение с похожими ботами

Бот Оператор Назначение Список IP
meta-webindexer Meta Поиск Meta AI / цитирования ❌ Нет отдельного списка (AS32934)
meta-externalagent Meta Обучение / продуктовая индексация ❌ Нет отдельного списка (AS32934)
facebookexternalhit Meta Превью ссылок в соцсетях ✅ Диапазоны/ASN Meta
Claude-SearchBot Anthropic Поиск Claude ❌ Нет
OAI-SearchBot OpenAI Поиск ChatGPT ✅ Есть
PerplexityBot Perplexity Индекс для AI-поиска ✅ Есть

9. Сводная таблица стратегии

Цель сайта Рекомендация
Хочу цитирования и видимость в Meta AI Allow для meta-webindexer; контент без обязательного JS-рендеринга
Не хочу участвовать в поиске Meta AI Disallow для meta-webindexer (или запрет в TrafficVeil)
Хочу поиск Meta AI, но не обучение моделей Allow для meta-webindexer + Disallow для meta-externalagent
Нужны превью в Facebook/Instagram, но не AI-краулинг Allow facebookexternalhit; Disallow meta-webindexer и meta-externalagent
Беспокоит частота визитов Rate-limit на nginx/TrafficVeil; robots.txt у Meta не документирует Crawl-delay для этого UA

 

Частые вопросы

В чём разница между meta-webindexer и meta-externalagent?

meta-webindexer индексирует контент для поисковых функций Meta AI и цитирований. meta-externalagent используется для обучения foundation-моделей и продуктовой индексации контента. Настройки для них независимы.

Используются ли данные meta-webindexer для обучения моделей?

По официальной документации Meta этот краулер предназначен для качества поиска Meta AI и цитирования источников. Для сценариев обучения/продуктовой индексации указан отдельный агент meta-externalagent.

Как проверить, что запрос действительно от Meta?

Не полагайтесь только на User-Agent. Проверяйте принадлежность IP к сети Meta (AS32934) и/или geofeed Meta; отдельного статического IP-списка именно для meta-webindexer нет.

Сломаются ли превью ссылок в Facebook, если заблокировать meta-webindexer?

Нет. Превью ссылок делает facebookexternalhit / FacebookBot. Блокировка meta-webindexer влияет на индексацию для Meta AI, а не на карточки при шеринге.

Как быстро применяется robots.txt для Meta?

Meta указывает, что изменения robots.txt могут применяться до 24 часов из‑за кеширования на стороне краулеров.

TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Microsoft Preview — бот Microsoft

Компонент Microsoft для rich-вставок ссылок — получает метаданные страницы для embed в сообщении. Типичный сценарий: пользователь отправил ссылку в мессенджер или редактор постов. Руководство по MicrosoftPreview (User-Agent microsoftpreview, категория «Превью ссылок в соцсетях»): как распознать в access.log, оценить риски и ограничить доступ.

6 мин

Internet Archive Bot - проект для периодического архивирования сайтов

Проект архивный проект для периодического архивирования сайтов — фиксирует HTML и ресурсы на дату обхода. Используется библиотеками, музеями интернета и compliance-архивами.

4 мин

Claude Search Bot

Claude-SearchBot — краулер Anthropic, отвечающий за качество и релевантность поисковых функций Claude. Он индексирует публичный веб-контент, чтобы Claude мог возвращать актуальные, точные ответы с цитированием источников, когда пользователь задаёт вопрос, требующий свежих данных из интернета. Это не обучающий краулер: собранные данные используются исключительно для поискового слоя Claude, а не для тренировки моделей.

3 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.